Hasil menjalankan qwen3:27b q3 pada omen 16L / intel 265f / 32g / 5060ti

302

Seperti yang diperkirakan, menampilkan 20t/s melampaui 10t/s 5050 dan dengan mudah menangani model yang lebih besar untuk menghasilkan hasil

  • Yang kami hentikan setelah berjalan satu jam di m1 max 32g (7b, 14b berjalan tetapi memberikan jawaban yang salah, 27b dihentikan saat berjalan)

  • Pada 5050, model kecil (14b q2) memakan waktu lebih dari 10 menit

  • 5060ti 16g memberikan jawaban dalam 2 menit saja dan dengan mudah menangani pertanyaan setelahnya

Dengan tingkat ini, tampaknya sangat cocok untuk pengembangan hobi pribadi.

Saya membatasi ke 150w untuk manajemen termal, dan kartu grafis ini dapat menggunakan hingga 175w.

Memang benar, saya tidak bisa membayangkan LLM lokal tanpa CUDA...

🪐 Ringkasan Model Mesin Ekonomi Planet dan Laporan Kerja


1️⃣ Ikhtisar Model: PlanetEconomicsEngine

PlanetEconomicsEngine adalah mesin makroekonomi inti dari permainan simulasi berbasis Flutter "OverStars". Ini menghitung bagaimana sumber daya planet (populasi, emas, mineral, kekuatan teknologi) berubah seiring waktu.

Fitur Utama

  • Dinamika Ekonomi Nonlinear: Pemodelan gesekan pajak pendapatan/tarif dengan menerapkan kurva Laffer

  • Penalti Penipisan Mineral: Jika mineral berkurang, penalti 5 kali lipat dikenakan pada kas negara (memicu kebangkrutan berantai)

  • Pertumbuhan Berbasis Anggaran: Anggaran setiap departemen (sosial, lingkungan, pendidikan, militer, ekonomi) mempengaruhi perubahan sumber daya

3️⃣ Ringkasan Pekerjaan Hari Ini

✅ Pekerjaan yang Selesai

  1. Analisis Model: Analisis rinci dari logika perhitungan fungsi PlanetEconomicsEngine.calculateNextState()

  2. Simulasi 10 Tahun: Memproyeksikan perubahan sumber daya hingga 10 tahun dengan nilai awal dasar (populasi 1.000, emas 5.000, mineral 1.000)

  3. Dokumentasi Dasar Perhitungan: Menentukan formula dan angka untuk setiap tahun

  4. Desain Skenario Kebangkrutan menurut Tingkat Kesulitan: Menghitung nilai sumber daya awal yang akan mengakibatkan kebangkrutan dalam 1/2/3 tahun sesuai tingkat kesulitan atas/tengah/bawah

📊 Hasil Utama

Item

Nilai Dasar (Simulasi 10 Tahun)

Laju Pertumbuhan Populasi

Meningkat ~3,7% setiap tahun

Laju Penurunan Emas

~876 per tahun (pengeluaran anggaran > penerimaan pajak)

Laju Penurunan Mineral

~150 per tahun (konsumsi > produksi)

Tingkat Kesulitan

Emas Awal

Mineral Awal

Titik Kebangkrutan yang Diharapkan

Bawah (Mudah)

2.500

400

~Tahun ke-3

Tengah (Normal)

1.500

250

~Tahun ke-2

Atas (Sulit)

800

120

~Tahun ke-1

4️⃣ Wawasan Inti

  • Efek Kurva Laffer: Jika menaikkan tarif pajak secara sembarangan, penerimaan pajak justru berkurang (penurunan motivasi kerja)

  • Reaksi Berantai Penipisan Mineral: Ketika mineral berkurang, penalti 5 kali lipat dikenakan pada kas negara yang mempercepat kebangkrutan

  • Pentingnya Anggaran Seimbang: Ketika biaya militer/administrasi melebihi penerimaan pajak, terjadi pengurangan emas berkelanjutan

⚠️ Wawasan Analisis Log

Berdasarkan log yang diberikan dan spesifikasi sistem (diperkirakan HP Omen 16L, RTX 5060 Ti), berikut adalah ringkasan hasil kerja saat menjalankan model bahasa besar (Qwen 3 27B Q3, 32k Context) di lingkungan tersebut.

1. Indikator Kinerja Inti (Kecepatan & Throughput)

Meskipun menjalankan model yang berat dengan tingkat perangkat keras (5060 Ti) berupa 27B (27 miliar parameter), inferensi itu sendiri menunjukkan kecepatan yang relatif stabil.

  • Kecepatan Pembuatan Teks (Decoding): Sekitar 21 ~ 23 token per detik (tg = 21 ~ 23 t/s)

    • Lebih cepat daripada kecepatan orang membaca teks, sehingga cukup cocok untuk percakapan real-time atau penggunaan kerja.

  • Kecepatan Pemrosesan Prompt (Pre-fill): Sekitar 600 ~ 900 token per detik

    • Ketika konteks tidak terlalu panjang (saat cache hit), membaca konteks percakapan yang dimasukkan dengan sangat cepat.

2. Hambatan Utama: Kedaluwarsa Cache (Cache Invalidation)

Ini adalah faktor pengurang paling menonjol dalam log. Ketika percakapan berlangsung lama (task 147, task 5458, dll.), fenomena berikut terjadi bersama dengan peringatan: merusak seluruh ingatan percakapan sebelumnya (KV Cache) dengan menghapusnya.

forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory...)

💡 Mengapa ini terjadi?

Karena teknik memori khusus yang digunakan model Qwen 3 seperti Sliding Window Attention (SWA), ketika isi percakapan berubah, mesin llama.cpp memutuskan bahwa checkpoint konteks yang tersimpan sebelumnya tidak kompatibel secara matematis dan menghancurkan cache.

⚠️ Kerusakan yang Diakibatkan (Lag Spike)

Ketika cache rusak, ketika percakapan berlangsung lama, prompt harus dihitung ulang dari awal. Karena alasan ini, sebelum jawaban muncul, sistem macet selama sekitar 28 detik hingga 40 detik sampai token pertama muncul (Lag yang ekstrem).

3. Tekanan Memori dan Sumber Daya

  • Kapasitas KV Cache: Hanya untuk mengingat konten percakapan (prompt), mengkonsumsi sekitar 4GB (3992.385 MiB) VRAM/RAM tambahan.

  • Batas konteks 32k (n_ctx_slot = 32768) digunakan sepenuhnya, terus membuat checkpoint berukuran 150MB seiring kemajuan percakapan, menimbulkan tekanan memori.

🛠️ Ringkasan dan Rekomendasi Optimasi

Kesimpulan: "Di lingkungan RTX 5060 Ti, model Qwen 3 27B beroperasi dengan luar biasa pada tingkat sekitar 22 token per detik, tetapi ketika percakapan berlangsung lama, cache rusak menyebabkan sistem hang selama lebih dari 30 detik sesekali."

Untuk meningkatkan hal ini, rekomendasi tindakan berikut.

  1. Update Mesin: Bug cache yang disebutkan dalam log adalah masalah arsitektur ringan yang saat ini sedang diperbaiki oleh komunitas open-source llama.cpp. Perbarui Ollama atau backend yang digunakan ke versi terbaru.

  2. Kurangi Ukuran Konteks: Jika konteks 32k tidak penting, turunkan ke 16k (16384) atau 8k (8192). Frekuensi cache rusak dan tekanan VRAM akan berkurang secara dramatis, membuat semuanya jauh lebih menyenangkan.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▼ -0.01

2026.10.09 KEB 하나은행 고시회차 3530회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!