Qwen3.8-Flash-Next Q4 를 64GB 맥에서 실행하기

97

oMLX최신버전에서 n-gram을 ssd 오프로딩하는 기능이 추가되었지만 Q2 모델도 정상동작이 안되었습니다.

방법을 찾아보다가 llama.cpp의 커스텀 레포지토리로 실행 성공했습니다.

이 레포 그대로 실행은 안되서 claude에게 조금 수정을 부탁했습니다.

https://github.com/mihailescu2m/llama.cpp


model : unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS (93.7GB)

MTP활성화해서 평균 디코딩 속도 13t/s(최저9, 최고19) 정도 나오네요.

태양계 시뮬레이션 단독 HTML 만들어줘해서 나온 파일을 첨부했습니다.

버그가 좀 있긴하지만 퀄리티가 남다르긴 하군요.

제 환경에서 Qwen3.8-27B MTP 가 18t/s, Dflash2가 25t/s정도 나옵니다.

결과물 비교해서 괜찮으면 갈아타볼까합니다.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.63 -0.01

2026.09.14 KEB 하나은행 고시회차 230회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!