Saya melihat video di YouTube berjudul "Best Ways to Run Qwen3.8-27B on Dual RTX 5060 Ti Cards" dan ada kalimat seperti "measured 78.31 tokens/second for prose and 124.89 tokens/second". Jadi saya mencobanya.
https://github.com/skrodahl/qwen38-27B-dual-rtx5060
Saya memberikan prompt kira-kira seperti ini.
Tolong rancang proyek "Sistem Klasifikasi Gerakan dan Pemberitahuan Anomali On-Device" yang menggabungkan papan ESP32-P4, sensor IMU (akselerasi/gyro) berbasis I2C/SPI, dan fungsi Wi-Fi.
Isi yang disertakan:
Panduan desain multi-tasking berbasis FreeRTOS untuk mengumpulkan data sensor dengan frekuensi 50Hz dan menyimpannya dalam antrian (Queue) atau buffer.
Kerangka kode dasar untuk pra-pemrosesan data deret waktu (CNN/LSTM) dan eksekusi TFLite Micro untuk inferensi.
Kode integrasi jaringan untuk mengirim data JSON melalui HTTP POST atau MQTT ke Wi-Fi saat mendeteksi anomali seperti "Jatuh (Fall)".
Tips pencegahan kebocoran memori dan debugging dalam lingkungan multi-tasking.
Waktu yang dibutuhkan sekitar 418 detik.
Setelah mengamati melalui dashboard yang dibuat oleh Gemini...

Angka yang sebelumnya tidak bisa dicapai saat menggunakan llama.cpp di lingkungan yang sama...
Ternyata kombinasi ini cukup bagus.
Catatan: Daya GPU dibatasi pada 153W, memori di-overclock +3000.