Cobalah gunakan Qwen3.6-27B-NVFP4 dan Qwen3.6-35B-A3B-NVFP4 dengan dgx spark.

240

Model qwen3.5-122b yang saya gunakan sebelumnya ternyata tidak sebaik yang saya bayangkan dan menggunakan banyak RAM, sehingga memori tersisa tidak cukup, jadi saya mencari alternatif lain

Ada versi yang dimodifikasi oleh Nvidia di Hugging Face

qwen3.6-27b dense, qwen3.6-35b-a3b seperti ini

Pada awalnya saya mendengar model dense itu bagus, jadi saya mengunduhnya dan mencobanya... tapi sangat lambat

Jadi saya berpikir apakah harus kembali ke 122b, tapi karena saya mendengar 35b memiliki performa serupa, saya mengunduhnya terlebih dahulu, dan ternyata ada opsi untuk Spark

Jadi saya menerapkan semuanya, mengunggahnya ke vllm, dan mengukur kecepatan generasi token

| Item   | 27B (Sebelumnya) | 35B-A3B (Sekarang) |
| ---- | -------- | ------------ |
| Konteks | 131K     | 262K         |
| VRAM | 98GB     | 22GB         |
| RAM  | 109GB    | 79GB (termasuk cache) |
| Kecepatan   | 9 tok/s  | 105 tok/s    |

Kurang lebih hasilnya seperti ini. 105 token adalah tanpa menerapkan OpenCode, jadi ketika OpenCode diterapkan, generasi token akan lebih rendah, tetapi masih menghasilkan lebih dari 80

Pada tingkat ini, tidak ada masalah untuk penggunaan praktis

Katanya dengan 2 Spark bisa menjalankan DeepSeek 4 Flash.... katanya juga bisa MinMax 3.... iri saya

Tangkapan layar 2026-07-09 orang sore 11.58.35.png Tangkapan layar 2026-07-10 pagi 12.51.31.png
로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▼ -0.01

2026.10.09 KEB 하나은행 고시회차 2840회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!