60tps dari Reddit
https://www.reddit.com/r/LocalLLM/comments/1vvtquz/dgx_spark_qwen_38_27b_nvfp4_at_60toks_generation/
Versi yang saya gunakan adalah ini
https://forums.developer.nvidia.com/t/qwen3-8-27b-nvfp4-on-single-dual-dgx-spark-sglang-dflash2-fully-openai-compatible/380732
Beban Kerja (Aliran Tunggal) | 1x Spark | 2x Spark (TP=2) |
|---|
Generasi Kode | 52~61 token/detik | 87 token/detik |
Prosa/Esai | 26 token/detik | 41 token/detik |
Percakapan Pemikiran | 34~49 token/detik | 49 token/detik |
Pemikiran tentang Kode, ("tidak ada") | 52 token/detik | sekitar 80 token/detik |
TTFT, Prompt Pendek | sekitar 0.16 detik | Serupa |
TTFT, Pengulangan Awalan 16K | 0.44 detik | 0.74 detik |
Jendela Konteks | 262,144 | 262,144 |
Saya menggunakan pengaturan yang agak konservatif (untuk quant, untuk embedding, menggunakan model 8B bersama, dll) dan pengukuran aktual saya mendapatkan 36~46 tps
Flash 2+ Slang benar-benar .. sangat cepat. Perkembangan teknologi memang luar biasa.
Tip hari ini : Qwen38 memiliki bug compact
Dalam DeepSeek Harness, ketika mengompresi sesi 150K token dengan Qwen3.8 27B, dilaporkan masalah yang hampir sama di mana auto compact tidak selesai.
Penyebab: Kompresor mewarisi pengaturan reasoning dari percakapan asli dan menghabiskan anggaran output selama proses.
Solusi: Hanya permintaan ringkasan dengan reasoningEffort: off
Menghapus reasoning lama, menghapus gambar, meringkas hasil alat yang besar.
Dengan cara ini, sesi kompresi 128K·150K·256K dilaporkan telah distabilkan.
Kasus kompresi DeepSeek Harness Qwen3.8
Dalam Qwen Code, juga dilaporkan masalah di mana permintaan bantuan seperti judul, ringkasan, dan recap mewarisi pengaturan model utama dan menyebabkan pemikiran yang tidak perlu. Solusi yang diajukan adalah "setiap permintaan bantuan harus memiliki model sendiri, pengaturan listening, dan pengaturan extra body".
Masalah pewarisan pengaturan permintaan sampingan Qwen Code
Dalam isu Qwen Code lainnya, ditemukan bahwa struktur permintaan OpenAI umum tidak menyertakan enable_thinking khusus untuk Qwen, sehingga pengaturan OFF tidak dikirim ke server. Dengan kata lain, hanya menampilkan OFF di UI tidak cukup dan adapter penyedia harus secara eksplisit memasukkannya ke dalam badan permintaan.
Kerusakan pengiriman enable_thinking Qwen Code
Hal berikut telah ditambahkan ke Vector Build untuk menyelesaikan masalah tersebut:
{
"chat_template_kwargs": {
"enable_thinking": false,
"preserve_thinking": false
}
}