Hmm.. Hari libur tapi saya masih bersama Codex dan Claude sejak pagi.
Biasanya saya tidak punya waktu untuk melakukan pekerjaan yang belum selesai, jadi saya menjalankannya sekarang.
Sepertinya saya mengalami ADHD. Saat ini saya menjalankan 4 tugas, tetapi pernah mencapai 9 tugas sekaligus.
Sekarang 4 saja sudah terasa berat. Token juga terasa berat..
Semoga LLM lokal yang bagus segera tersedia.
Saya menggunakan Mac mini m4 32g dan menjalankan gemma4-26b-a4b di atasnya. Kecepatannya lumayan bagus dan semuanya baik, tetapi terasa memakan banyak RAM, jadi saya mulai menguji berbagai hal lain. Beberapa hari yang lalu, saya mendengar bahwa xiaomidptj telah menyuling qwen3.5-9b dengan mimoV2.6, jadi saya mengunduhnya dan mencobanya. Saya akan membagikan hasil tes untuk menghemat token Anda.
Saya membandingkan kedua model satu per satu. MiMo memang menghemat memori secara signifikan, tetapi dengan pengaturan saat ini, masih terlalu dini untuk mengganti Gemma sebagai model dasar. Setelah pengujian, saya menonaktifkan semua server MiMo dan memulihkan layanan Gemma yang ada.
Item yang Diukur | Gemma 4 QAT Saat Ini | MiMo Umum 4bit | MiMo oQ/MTP |
|---|
Memori Proses | Sekitar 15,8 GiB | Sekitar 6,8 GiB | Sekitar 5,7 GiB |
Ringkasan Bahasa Korea Selesai | 9,9 detik | 24,3 detik | 12,3 detik |
Kecepatan Pembuatan | 30,8 tok/s | 19,2 tok/s | 23,7 tok/s |
Tugas Agen Sintetik | 3/3 Lulus | 3/3 Lulus | Kegagalan Pengiriman Faktor Alat |
MiMo umum 4bit melakukan pencarian dokumenโperhitunganโjawaban dengan akurat. Di sisi lain, Gemma juga lulus semua tugas dalam tes kecil ini, jadi kami tidak menemukan bukti bahwa kemampuan agen MiMo lebih tinggi daripada Gemma. Tes kode yang disajikan oleh MiMo memiliki kesalahan eksekusi, dan jawaban untuk input yang panjang juga lebih lama: Gemma 14,1 detik, MiMo umum 22,3 detik.
Versi oQ/MTP menunjukkan memori yang lebih sedikit dan pembuatan yang lebih cepat, tetapi masalah kompatibilitas muncul kembali di mana oMLX 0.6.4 mengirimkan faktor panggilan alat sebagai {}. Konfigurasi ini belum dapat digunakan sebagai backend agen. Peningkatan evaluasi agen yang dipublikasikan oleh Xiaomi adalah angka dibandingkan dengan Qwen3.5-9B dan bukan perbandingan langsung dengan Gemma. Versi yang diuji umum 4bit dan oQ/MTP juga merupakan varian yang berbeda.
Dalam jangka panjang, menggunakan MiMo adalah pertimbangan yang valid dari segi memori. Anda dapat menghemat sekitar 9 GiB. Namun, sebelum beralih ke model dasar, sebaiknya selesaikan masalah faktor alat dan periksa kualitas dan keterlambatan dalam tugas membaca dan meringkas yang sebenarnya.