Pada versi terbaru oMLX, fungsi untuk meng-offload n-gram ke ssd telah ditambahkan, tetapi model Q2 juga tidak berfungsi dengan baik.
Setelah mencari cara, saya berhasil menjalankannya melalui repositori kustom llama.cpp.
Saya meminta sedikit modifikasi dari claude karena repo itu tidak dapat dijalankan langsung.
https://github.com/mihailescu2m/llama.cpp
model : unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS (93.7GB)
Dengan mengaktifkan MTP, kecepatan dekoding rata-rata sekitar 13t/s (terendah 9, tertinggi 19).
Saya melampirkan file yang dihasilkan dari simulasi sistem tata surya yang dibuat dalam HTML terpisah.
Meskipun ada beberapa bug, kualitasnya memang luar biasa.
Dalam lingkungan saya, Qwen3.8-27B MTP menghasilkan sekitar 18t/s, sedangkan Dflash2 sekitar 25t/s.
Saya akan mempertimbangkan untuk beralih jika hasilnya memuaskan.