Model qwen3.5-122b yang saya gunakan sebelumnya ternyata tidak sebaik yang saya bayangkan dan menggunakan banyak RAM, sehingga memori tersisa tidak cukup, jadi saya mencari alternatif lain
Ada versi yang dimodifikasi oleh Nvidia di Hugging Face
qwen3.6-27b dense, qwen3.6-35b-a3b seperti ini
Pada awalnya saya mendengar model dense itu bagus, jadi saya mengunduhnya dan mencobanya... tapi sangat lambat
Jadi saya berpikir apakah harus kembali ke 122b, tapi karena saya mendengar 35b memiliki performa serupa, saya mengunduhnya terlebih dahulu, dan ternyata ada opsi untuk Spark
Jadi saya menerapkan semuanya, mengunggahnya ke vllm, dan mengukur kecepatan generasi token
| Item | 27B (Sebelumnya) | 35B-A3B (Sekarang) |
| ---- | -------- | ------------ |
| Konteks | 131K | 262K |
| VRAM | 98GB | 22GB |
| RAM | 109GB | 79GB (termasuk cache) |
| Kecepatan | 9 tok/s | 105 tok/s |
Kurang lebih hasilnya seperti ini. 105 token adalah tanpa menerapkan OpenCode, jadi ketika OpenCode diterapkan, generasi token akan lebih rendah, tetapi masih menghasilkan lebih dari 80
Pada tingkat ini, tidak ada masalah untuk penggunaan praktis
Katanya dengan 2 Spark bisa menjalankan DeepSeek 4 Flash.... katanya juga bisa MinMax 3.... iri saya