AMD AI Max (strixhalo) 전용 추론 엔진 입니다.

49
This post has not been translated to English yet. Showing the original text.

역시 AMD는 아몰랑 하고 놀고있고, 목마른 유저들이 우물을 파는 현실입니다

https://github.com/gufo-org/gufo

지난번에 halogen-flash-server가 llamacpp를 쓰지않고, 수정해서 전용 엔진을 만들었는데

gufo는 거기에 더해서 어차피 사람들 실제로 쓰는모델은 Qwen이지라는 생각을 하셨는지

Qwen3.8 27B, Qwen 3.8 Flash Next, Deepseek v4 Flash 외에 일부 TTS, 이미지, 영상모델들만 지원하게 Sttixhalo에 최적화 시켜서 만드셨더군요

딱 저것만 되고, vllm처럼 동시 사용올라가면 총 토큰수도 증가하도록도 만들고 싱글 성능도 상당히 끌어올렸습니다.

27B는 싱글 기준으로 프리필은 2배 정도 개선된거 같습니다(페이지에 BM 결과는 초기꺼 같고, 제가 측정해보니 더 잘나옵니다)

DGX로 갈아탈까 하다가 이것때문에 잠시 유보입니다

AI Max 쓰시는 분들 사용해보시길 추천드립니다

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▼ -0.01

2026.10.09 KEB 하나은행 고시회차 2302회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!