
Saya menggunakan nvfp4 + vllm, versi mtp3.

Saya menginstal mtp 2.
Sepertinya generasi token sedikit lebih baik, tetapi tidak ada perbedaan yang signifikan.
Masih mtp2 lebih stabil daripada 3, kan?
Resep optimasi belum dibuat.
qwen 122b-a10b menghasilkan 60 token setelah dioptimalkan. Saya percaya jika optimasinya bagus, generasi token akan lebih baik.