
Tentu saja ada yang bisa menggunakannya lebih baik dari saya, tetapi
setidaknya saya telah menetap dengan model DeepSeek V4 flash 0731.
Melalui vllm dan Dspark, kecepatan rata-rata sekitar 75~80 tok/s.
Karena banyak masalah yang membutuhkan analisis mendalam daripada hanya tanya jawab, saya menetapkan thinking ke max.
Selain itu, saya telah mengintegrasikan bot Telegram sehingga tampaknya cukup untuk layanan pribadi.
Di sini, tombol yang terlihat di tengah memungkinkan pertukaran antara mode LLM (vllm, open-webui) dan mode video (comfyui minimax-h3).
Sebenarnya, saya membuatnya agar dapat memonitor status dan beralih antar layanan melalui tombol halaman web karena malas untuk melakukan akses jarak jauh.
Halaman layanan pada tangkapan layar ini.. (tetapi saya hanya mengikuti instruksi llm).
Untuk mode minimax h3, dua dgx spark tidak diperlukan, jadi saya sedang mempertimbangkan untuk menggunakan model qwen 3.8 27b saat berada dalam mode video. (Saya sedang berpikir untuk melakukan fine-tuning pada model qwen 3.8 27b..)
Tentu saja dgx spark memiliki nilai yang sangat baik, tetapi melihat model berat terbuka yang baru-baru ini dirilis,
saya rasa ada sedikit keraguan.
Namun, saya rasa model DeepSeek V4 flash 0731 ini adalah model pembunuh yang tepat untuk dua dgx spark.
Keuntungan terbesarnya adalah dapat mencoba memproses data yang tidak dapat diunggah ke layanan komersial secara lokal (meskipun deepseek masih kesulitan menyelesaikannya sendiri). Saya percaya bahwa model open-weight yang lebih baik akan terus muncul seiring berjalannya waktu, jadi saya akan meninggalkan panduan penggunaan sederhana ini.