Kemarin DeepSeek V4 Flash 0731 dirilis tepat waktu dan bobotnya sudah naik ke HuggingFace, dan mulai hari ini akan tersedia di penyedia satu per satu.
Saya awalnya menggunakan Preview yang disetel secara lokal, tetapi hari ini saya mengunduh versi resmi dari HuggingFace dan mencobanya. Karena saya menyetel Preview dengan agak aneh, performanya tidak bagus, karena saya menggunakannya sendiri, jadi saya hanya menggunakannya dengan sembarangan. Kali ini untuk merayakan peluncuran resmi, saya membongkar semuanya dan mencari resep vllm yang berfungsi dengan baik... lalu saya berkata pada Codex: "Setel berdasarkan itu!" dan saya hanya duduk santai.
[1/2] Menjalankan Benchmark Throughput & Concurrency Full Serving...
=========================================================
BENCHMARK PELAYANAN LENGKAP: DeepSeek-V4-Flash-0731
URL Target: #########################
ID Model : deepseek-v4-flash-0731
=========================================================
Memanaskan mesin inferensi...
--- [DeepSeek-V4-Flash-0731] KECEPATAN DECODE BERDASARKAN ISI ---
Jenis Prompt Token Detik Kecepatan Decode
-----------------------------------------------
count300 600 7.20 83.4 tok/s
mult12 900 11.52 78.1 tok/s
json60 5 0.44 11.4 tok/s
bst 600 9.27 64.7 tok/s
story 253 7.92 31.9 tok/s
-----------------------------------------------
DECODE PUNCAK : 83.4 tok/s (count300)
DECODE RATA-RATA : 53.9 tok/s
--- [DeepSeek-V4-Flash-0731] PEMERIKSAAN KONKURENSI (c1..c12) ---
Stream OK Aggregate tok/s Per-Stream tok/s Detik Dinding
--------------------------------------------------------------
1 1 70.9 70.9 5.64
2 2 115.4 57.7 6.93
4 4 158.6 41.4 10.09
6 6 211.3 36.0 11.36
8 8 169.4 31.4 18.88
10 10 184.6 28.1 21.67
12 12 201.5 26.7 23.82
--- [DeepSeek-V4-Flash-0731] KECEPATAN PREFIL & TTFT DI DALAM ---
Kedalaman Target Token Prompt Detik TTFT Kecepatan Prefil
----------------------------------------------------------
8000 5892 3.71 1588 tok/s
32000 23540 10.69 2201 tok/s
100000 73540 30.31 2426 tok/s
==================== RINGKASAN ====================
Puncak Decode : 83.4 tok/s | Rata-rata: 53.9 tok/s
Konkurensi : c1=71t/s | c2=115t/s | c4=159t/s | c6=211t/s | c8=169t/s | c10=185t/s | c12=201t/s
Prefil : 8K=1588t/s | 32K=2201t/s | 100K=2426t/s
=================================================
[2/2] Menjalankan Benchmark Loop ReAct Subagent Paralel 4...
=========================================================
BENCHMARK LOOP AGENT MULTI-TURN SEBENARNYA
LLM Target : ##########################
ID Model : deepseek-v4-flash-0731
Konkurensi: 4 Sub-agent menjalankan loop ReAct paralel
=========================================================
===========================================================================
ID Agent | Peran | Putaran | Token Gen | Waktu (s) | Kecepatan
---------------------------------------------------------------------------
Subagent-1-Frontend | Pengembang Frontend | 6 | 2867 | 86.46 | 33.2 tok/s [INC]
Subagent-2-Backend | Pengembang Backend | 6 | 3821 | 143.69 | 26.6 tok/s [INC]
Subagent-3-Database | Spesialis DB | 6 | 3993 | 110.44 | 36.2 tok/s [INC]
Subagent-4-Tester | Insinyur QA | 6 | 4800 | 129.34 | 37.1 tok/s [INC]
---------------------------------------------------------------------------
Total Waktu Jam Dinding : 143.69 detik
Total Kode yang Dibuat : 15,481 token
Kecepatan Kluster Agregat: 107.7 tok/s
=========================================================
✅ Pengukuran benchmark telah selesai!
Prefilnya hampir sama, tetapi kecepatan decode tampaknya meningkat secara signifikan.
Dengan harga setengah dari 5.6 luna, sepertinya saya akan meminta hal ini untuk dilakukan pada luna. ㅋㅋ