https://github.com/Nathanw1014/strix-halo-llamacpp
Ini adalah versi yang dimodifikasi oleh pengembang untuk memperbaiki beberapa operasi yang tidak efisien antara Strix Halo dan llamacpp.
Sepertinya sudah diajukan permintaan gabungan ke llamacpp, tetapi sepertinya bukti belum memadai sehingga belum diterima.
Saya mengalami peningkatan yang signifikan.
Berdasarkan Qwen 3.6 27B Q6K, dengan 180K Prefill, kecepatannya mencapai 130t/s dan menghasilkan sekitar 10tps dalam kondisi normal.