
Saya sudah mencobanya di dgx spark
Karena HuggingFace menggunakan vllm, saya mencoba mengaturnya dan menggunakannya, hasilnya sekitar 19~20 token.
Terjadi banyak kesalahan juga.
Hari ini saya mengunjungi halaman web llama, dan ternyata sudah dirilis kemarin. Saya mengunduhnya dan mencobanya.
Memuatnya ke RAM spark memakan waktu agak lama, dan pada awalnya menghasilkan 9 token, jadi saya berpikir ini tidak bisa digunakan. Namun, setelah beberapa kali mencoba, kecepatan generasi token semakin meningkat.
Melihat hasilnya sekitar 20~22 token, jika nanti ada vllm atau alat optimasi lain yang dirilis, saya yakin akan menghasilkan lebih dari 30 token.
Dengan 20 token, ini kecepatan generasi yang tepat untuk mengerjakan tugas sebelum tidur dan menerima hasilnya keesokan harinya.
qwen3.6-27b juga menghasilkan sekitar 22 token ketika menggunakan versi yang dioptimalkan. Semoga perkembangan llama terus berlanjut!????