https://x.com/bleysg/status/2083448647908569321
Saya sudah mencoba perintah "berikan ini ke agen"
Secara teoritis maksimal 59 token, tetapi agen mengatakan bahwa angka tersebut adalah maksimum yang muncul ketika ada beberapa permintaan yang masuk.
Saya telah mencoba menginstal dan menghubungkannya ke kode sumber terbuka.

Ini adalah kecepatan pembuatan token TPS saat pertama kali dikonfigurasi dan terhubung.
Belakangan ini, saya rasa Thinking High memiliki nilai terbaik untuk LLM, jadi saya menggantinya dengan High dan mengukurnya.

Pembuatan token sedikit lebih banyak.
Karena itu, saya berpikir bahwa NonThinking mungkin akan menghasilkan lebih banyak token dan mengujinya.

Agen mengatakan bahwa ini adalah maksimum karena botol leher di Spark, tetapi saya rasa Thinking High adalah yang terbaik.
Terlalu lambat untuk percakapan, tetapi mungkin cocok untuk digunakan dan ditinggalkan. Saya tidak tahu kualitasnya, tetapi dikatakan bahwa bobot 0731 sangat bagus, jadi bahkan dengan kuantifikasi 2 bit, kemungkinan akan lebih baik daripada DeepSpeed4 Flashback yang lama.
Saya butuh Spark lagi ㅠㅠ