Jalankan Qwen3.8-Flash-Next Q4 pada Mac dengan RAM 64GB.

98

Pada versi terbaru oMLX, fungsi untuk meng-offload n-gram ke ssd telah ditambahkan, tetapi model Q2 juga tidak berfungsi dengan baik.

Setelah mencari cara, saya berhasil menjalankannya melalui repositori kustom llama.cpp.

Saya meminta sedikit modifikasi dari claude karena repo itu tidak dapat dijalankan langsung.

https://github.com/mihailescu2m/llama.cpp


model : unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS (93.7GB)

Dengan mengaktifkan MTP, kecepatan dekoding rata-rata sekitar 13t/s (terendah 9, tertinggi 19).

Saya melampirkan file yang dihasilkan dari simulasi sistem tata surya yang dibuat dalam HTML terpisah.

Meskipun ada beberapa bug, kualitasnya memang luar biasa.

Dalam lingkungan saya, Qwen3.8-27B MTP menghasilkan sekitar 18t/s, sedangkan Dflash2 sekitar 25t/s.

Saya akan mempertimbangkan untuk beralih jika hasilnya memuaskan.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.63 -0.01

2026.09.14 KEB 하나은행 고시회차 230회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!