Sebelumnya saya telah memposting artikel tentang informasi Qwen 3.8 Splash.
https://damoang.net/ai/7949
Ada beberapa komentar yang mengatakan bahwa kualitasnya kurang memuaskan karena kuantitas 4 bit, jadi saya bertanya lebih lanjut kepada Gemini dan mendapatkan informasi baru ini.
※ Ini adalah tips untuk mereka yang merasa kecewa dengan performa (tebing inferensi) Qwen 3.8 Splash dengan kuantitas 4 bit.
Mesin Splash asli yang pertama kali dirilis berbasis 4 bit, jadi banyak umpan balik yang mengatakan bahwa kecerdasannya kurang dalam hal pengkodean kompleks atau inferensi matematika. Pengguna open source di Reddit (r/LocalLLaMA) dan tempat lain telah berhasil memodifikasi kode mesin untuk menjalankan versi asli 8-bit (Native 8-bit, juga dikenal sebagai Splash-HQ) tanpa kompresi.
Saya sangat merekomendasikan ini bagi pengguna Mac yang memiliki kapasitas RAM yang cukup.
1. Kemampuan Inferensi (Kecerdasan) Dikembalikan Sepenuhnya
Kerugian data yang khas dari kuantitas 4 bit, yang menyebabkan kesalahan dalam debug kode tingkat lanjut atau operasi logis, telah sepenuhnya dihilangkan. Qwen 3.8 memberikan performa penuh seperti aslinya.
2. Peningkatan Kecepatan yang Ironis
Alih-alih model kuantitas terkompresi, bobot asli 8 bit justru meningkatkan akurasi dekodisasi spekulatif.
Akibatnya, meskipun kecerdasannya jauh lebih tinggi, kecepatan aktualnya adalah sekitar 37 hingga 55 token per detik, yang jauh lebih cepat dan nyaman daripada Ollama sebelumnya.
3. Direkomendasikan untuk Mereka yang:
"Kecepatannya bagus, tapi terkadang saya tidak suka jika dia berbicara omong kosong atau kode yang rusak."
Memiliki memori terintegrasi 48GB ~ 64GB atau lebih sehingga dapat dengan mudah memuat model berukuran sekitar 27GB.
Bagi mereka yang perlu menganalisis kode sumber panjang yang melebihi puluhan ribu baris, atau membuat skrip pengembangan game/otomatisasi pekerjaan yang akurat tanpa kesalahan, silakan terapkan patch Native 8-bit dan file bobot yang tersedia di Reddit. Keseimbangannya sangat sempurna.