Tinjauan singkat QWEN3.8 27B

169

Saat ini saya akan menjelaskan secara singkat tentang sistem dan kondisi loading saya.

  • T7910 bekas + dual Nvidia GV100 (VRAM 32GB per kartu) - NVLink sedang terbang di eBay, tetapi saya menemukan hasil yang menunjukkan penurunan kecepatan yang fatal saat menggunakan kombinasi NVLink + MTP.

  • Model Q8, KV cache FP16

  • Parameter diatur sesuai dengan konfigurasi yang direkomendasikan (kecuali konteks)

  • 2 slot, 200K konteks per slot (konfigurasi ini menyebabkan GV100 menggunakan 31.5GB)

Saya menggunakan HP Strix Halo Mini Workstation sebagai server dan sebelumnya menggunakan Asus GX10 sebelum menjualnya.

Perlu saya tegaskan bahwa ini bukan benchmark dalam lingkungan yang terkontrol, melainkan hasil sederhana dari pengujian yang saya lakukan setelah memuat model kemarin.

  • Kecepatan bervariasi tergantung pada akurasi MTP, berkisar antara 30 tps hingga 50 tps (MTP diatur ke 4)

  • Token inferensi masih sangat banyak. Namun, saya menganggap ini sebagai pendorong utama untuk mencapai hasil ini dengan model 27B parameter, jadi saya tidak mematikan atau membatasi inferensi secara terpisah.

  • Biasanya saya tidak menggunakan OpenCLO dan hanya memanggilnya sekali saja, tetapi kali ini saya ingin melihat seberapa jauh lingkungan sekitarnya dikenali dan bagaimana responsnya saat konteks diperpanjang. Jadi saya mencoba menggunakannya di OpenCLO.

  • Secara subjektif, kemampuan tool calling terasa meningkat pesat. Saya mengamati QWEN3.8 berhasil menemukan dan menggunakan alat yang sering gagal atau tidak ditemukan oleh QWEN3.6.

  • Ketika saya bertanya kepada QWEN3.6 tentang model apa yang dimilikinya, ia hanya akan menyebutkan nilai yang disuntikkan ke sesi dan memberikan jawaban yang sama ketika ditanya kembali. Sementara itu, QWEN3.8 dapat mengirim Curl untuk memverifikasi nama modelnya, ukuran konteks, dan kuantitas. Ketika saya menanyakan kembali kebenarannya, ia bahkan mencari nama file model asli untuk mengonfirmasi identitasnya.

  • Meskipun sudah berlangsung lama, QWEN3.8 masih menunjukkan perilaku mencampur bahasa Inggris dan Korea atau bahkan Mandarin dalam tanggapannya. Fenomena ini juga terkadang terjadi pada GPT 5.6 Luna, jadi saya tidak terlalu khawatir.

  • Saya menginstruksikan QWEN3.8 untuk menginstal server kode di Raspberry Pi 5 yang ada di dalam jaringan tailscale dan menginstal CODEX Extension serta meminta login. CODEX Extension berhasil diinstal, tetapi login CODEX masih bermasalah. GPT 5.5 juga gagal (saya bahkan tidak yakin apakah login oauth memungkinkan). Saya akan terus mengamati perkembangannya dengan penuh minat.

  • Namun, QWEN3.8 masih terjebak dalam loop tak terbatas ketika menghadapi masalah yang sulit diatasi.

  • Saya percaya bahwa jika hanya menampilkan alat yang diperlukan dan memberikan tugas, QWEN3.8 akan menghasilkan hasil yang cukup baik sebagai model lokal (menampilkan terlalu banyak alat akan memperpanjang waktu inferensi).

Meskipun mungkin berbeda di setiap bidang pengembangan, saya berpikir kombinasi Frontier + QWEN3.8 akan berjalan dengan lancar.

Saat menggunakan GX10 sebelumnya, saya berlangganan GPT Plus dan mencoba berbagai hal dengan GPT 5.5 + QWEN3 Coder Next melalui Roo Code. Sekarang dengan hadirnya QWEN3.8, saya ingin tahu bagaimana performanya dibandingkan dengan yang lain. Saya akan menunggu umpan balik dari pengguna lain.

QWEN3.8 telah dijalankan kembali untuk tugas-tugas seperti pengelolaan LLM Wiki dan pengumpulan/klasifikasi email.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▼ -0.01

2026.10.09 KEB 하나은행 고시회차 2759회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!