그냥 StrixHalo의 Qwen3.8 Flash Next만을 위해 몰빵한 구현 입니다.
아직 몇몇 개발자에게만 공유하고 close source상태라 뭘 어떻게 하는지는 모르겠는데, 돌았습니다.
256K Full context 채우는데 거의 계속 1000t/s를 유지하고 그 상태에서 TG도 30이상 나옵니다 ;;;
처음에는 비전은 뺐으나 지금은 비전도 되고, 개발자 본인이 만든 모델파일 이외에 Qwen 3.8 FN gguf도 지원을 시작했습니다.
물론 본인 모델이 가장 빠릅니다. (퍼플렉시티는 살짝 떨어진다고)
KV캐쉬가 256K에 메모리 한 20GB씩 먹는 구조인거 같긴합니다.
지금 별도 컨테이너 형태라 다른 llamacpp 랑 같이 쓰기가 좀 애매해서 일단 lemonade에 외부 서비스로 붙이고, 10분 idle이면 컨테이너 종료하게는 해놨는데, 성능 진짜 괴물 같습니다.
초반엔 오픈소스가 아니라 말들이 좀 있었는데, 성능으로 보여주니까 다들 아닥 상태입니다 ㅎㅎ
AIMAX 395+ 128GB 쓰시는 분들은 무조건
https://github.com/peonist-ai/halogen-flash-server