StrixHalo Halogen-flash-server 사용기

61

그냥 StrixHalo의 Qwen3.8 Flash Next만을 위해 몰빵한 구현 입니다.

아직 몇몇 개발자에게만 공유하고 close source상태라 뭘 어떻게 하는지는 모르겠는데, 돌았습니다.

256K Full context 채우는데 거의 계속 1000t/s를 유지하고 그 상태에서 TG도 30이상 나옵니다 ;;;

처음에는 비전은 뺐으나 지금은 비전도 되고, 개발자 본인이 만든 모델파일 이외에 Qwen 3.8 FN gguf도 지원을 시작했습니다.

물론 본인 모델이 가장 빠릅니다. (퍼플렉시티는 살짝 떨어진다고)

KV캐쉬가 256K에 메모리 한 20GB씩 먹는 구조인거 같긴합니다.

지금 별도 컨테이너 형태라 다른 llamacpp 랑 같이 쓰기가 좀 애매해서 일단 lemonade에 외부 서비스로 붙이고, 10분 idle이면 컨테이너 종료하게는 해놨는데, 성능 진짜 괴물 같습니다.

초반엔 오픈소스가 아니라 말들이 좀 있었는데, 성능으로 보여주니까 다들 아닥 상태입니다 ㅎㅎ

AIMAX 395+ 128GB 쓰시는 분들은 무조건

https://github.com/peonist-ai/halogen-flash-server

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.53 ▲ 0.01

2026.10.09 KEB 하나은행 고시회차 1738회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!