DeepSpeech V4 0731 telah diputar ulang ke Q2KL Unslos
IQ3XXS naik, tetapi terlalu ketat dan kecepatannya kurang,
Ngomong-ngomong, jika dijalankan dengan ROCm, prefill akan terus dipertahankan di atas 100 detik awal, dan token dipertahankan sekitar 12-13 per detik
Jika dijalankan dengan ds4, prefill akan berada di kisaran 150-130 dan token akan berada di kisaran 15-16
Karena terlalu repot bolak-balik ke ds4, saya telah memutar ulang ke llama
Gambar tersebut adalah hasil eksekusi prompt yang tersedia di tautan
Sepertinya ada masalah kompatibilitas dengan vulkan, jadi mungkin perlu beberapa modifikasi. Jika menggunakan versi strix halo kv cache yang telah dimodifikasi, secara keseluruhan akan meningkat sekitar 30%, tetapi llama belum melakukan merge ㅜㅡㅠ

▶ Sumber asli: https://sunsetcompare.web.app/