oMLX최신버전에서 n-gram을 ssd 오프로딩하는 기능이 추가되었지만 Q2 모델도 정상동작이 안되었습니다.
방법을 찾아보다가 llama.cpp의 커스텀 레포지토리로 실행 성공했습니다.
이 레포 그대로 실행은 안되서 claude에게 조금 수정을 부탁했습니다.
https://github.com/mihailescu2m/llama.cpp
model : unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS (93.7GB)
MTP활성화해서 평균 디코딩 속도 13t/s(최저9, 최고19) 정도 나오네요.
태양계 시뮬레이션 단독 HTML 만들어줘해서 나온 파일을 첨부했습니다.
버그가 좀 있긴하지만 퀄리티가 남다르긴 하군요.
제 환경에서 Qwen3.8-27B MTP 가 18t/s, Dflash2가 25t/s정도 나옵니다.
결과물 비교해서 괜찮으면 갈아타볼까합니다.