Mesin yang digunakan : llama.cpp cabang pr27742
Model yang digunakan : Qwen3.8-Flash-Next-UD-IQ4_XS
Sistem yang digunakan : Strix Halo (Beelink GTR9 PRO 128GB)
Sistem operasi yang digunakan : Arch Linux, Vulkan VRAM 96GB dialokasikan
Referensi : Lihat tautan
Setelah beberapa kali mencoba dengan pengaturan yang berbeda,
Sepertinya panjang konteks 128k adalah yang paling optimal.
Ketika di set sekitar 64k, kecepatan respons yang mendekati layanan komersial benar-benar muncul.
Jika di set sekitar 256k, menjalankan server dan menggunakannya akan membuat sistem bekerja keras dengan menguras sumber daya CPU dan memori sistem. Tentu saja, kecepatan juga akan melambat seiring dengan peningkatan panjang konteks.
Namun, bahkan dalam kasus ini, sepertinya cukup sabar untuk membuatnya berjalan dengan baik.
Hasil benchmark menunjukkan bahwa Qwen3.8 Flash Next memang melampaui Deepseek 4 flash, tetapi kecepatannya masih jauh lebih baik, jadi kemajuannya sungguh luar biasa.
Sangat menyenangkan bahwa kita sekarang dapat memperoleh hasil dengan kualitas yang setara dengan model publik dengan menggunakan model lokal yang memiliki kecepatan yang layak.
Saya sebenarnya lebih suka model open-source daripada model China, dan saya sangat berharap model seperti ini akan muncul di platform seperti OpenAssistant. OpenAssistant fokus pada pengembangan model tingkat lanjut, dan perusahaan yang terlibat tampaknya tidak terlalu bersemangat untuk berkontribusi pada open-weight karena alasan komersial. Sayang sekali.
▶ Sumber asli: https://www.reddit.com/r/StrixHalo/comments/1vz5yb3/qwen38flashnext_125ba6b_running_on_strix_halo/?solution=957fe3a6a547c072957fe3a6a547c072&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec7dbcc5482b6045fe1f50de322cb8d1eb&jsc_orig_r=