Seperti yang diperkirakan, menampilkan 20t/s melampaui 10t/s 5050 dan dengan mudah menangani model yang lebih besar untuk menghasilkan hasil
Yang kami hentikan setelah berjalan satu jam di m1 max 32g (7b, 14b berjalan tetapi memberikan jawaban yang salah, 27b dihentikan saat berjalan)
Pada 5050, model kecil (14b q2) memakan waktu lebih dari 10 menit
5060ti 16g memberikan jawaban dalam 2 menit saja dan dengan mudah menangani pertanyaan setelahnya
Dengan tingkat ini, tampaknya sangat cocok untuk pengembangan hobi pribadi.
Saya membatasi ke 150w untuk manajemen termal, dan kartu grafis ini dapat menggunakan hingga 175w.
Memang benar, saya tidak bisa membayangkan LLM lokal tanpa CUDA...
🪐 Ringkasan Model Mesin Ekonomi Planet dan Laporan Kerja
1️⃣ Ikhtisar Model: PlanetEconomicsEngine
PlanetEconomicsEngine adalah mesin makroekonomi inti dari permainan simulasi berbasis Flutter "OverStars". Ini menghitung bagaimana sumber daya planet (populasi, emas, mineral, kekuatan teknologi) berubah seiring waktu.
Fitur Utama
Dinamika Ekonomi Nonlinear: Pemodelan gesekan pajak pendapatan/tarif dengan menerapkan kurva Laffer
Penalti Penipisan Mineral: Jika mineral berkurang, penalti 5 kali lipat dikenakan pada kas negara (memicu kebangkrutan berantai)
Pertumbuhan Berbasis Anggaran: Anggaran setiap departemen (sosial, lingkungan, pendidikan, militer, ekonomi) mempengaruhi perubahan sumber daya
3️⃣ Ringkasan Pekerjaan Hari Ini
✅ Pekerjaan yang Selesai
Analisis Model: Analisis rinci dari logika perhitungan fungsi PlanetEconomicsEngine.calculateNextState()
Simulasi 10 Tahun: Memproyeksikan perubahan sumber daya hingga 10 tahun dengan nilai awal dasar (populasi 1.000, emas 5.000, mineral 1.000)
Dokumentasi Dasar Perhitungan: Menentukan formula dan angka untuk setiap tahun
Desain Skenario Kebangkrutan menurut Tingkat Kesulitan: Menghitung nilai sumber daya awal yang akan mengakibatkan kebangkrutan dalam 1/2/3 tahun sesuai tingkat kesulitan atas/tengah/bawah
📊 Hasil Utama
Item | Nilai Dasar (Simulasi 10 Tahun) |
|---|
Laju Pertumbuhan Populasi | Meningkat ~3,7% setiap tahun |
Laju Penurunan Emas | ~876 per tahun (pengeluaran anggaran > penerimaan pajak) |
Laju Penurunan Mineral | ~150 per tahun (konsumsi > produksi) |
Tingkat Kesulitan | Emas Awal | Mineral Awal | Titik Kebangkrutan yang Diharapkan |
|---|
Bawah (Mudah) | 2.500 | 400 | ~Tahun ke-3 |
Tengah (Normal) | 1.500 | 250 | ~Tahun ke-2 |
Atas (Sulit) | 800 | 120 | ~Tahun ke-1 |
4️⃣ Wawasan Inti
Efek Kurva Laffer: Jika menaikkan tarif pajak secara sembarangan, penerimaan pajak justru berkurang (penurunan motivasi kerja)
Reaksi Berantai Penipisan Mineral: Ketika mineral berkurang, penalti 5 kali lipat dikenakan pada kas negara yang mempercepat kebangkrutan
Pentingnya Anggaran Seimbang: Ketika biaya militer/administrasi melebihi penerimaan pajak, terjadi pengurangan emas berkelanjutan
⚠️ Wawasan Analisis Log
Berdasarkan log yang diberikan dan spesifikasi sistem (diperkirakan HP Omen 16L, RTX 5060 Ti), berikut adalah ringkasan hasil kerja saat menjalankan model bahasa besar (Qwen 3 27B Q3, 32k Context) di lingkungan tersebut.
1. Indikator Kinerja Inti (Kecepatan & Throughput)
Meskipun menjalankan model yang berat dengan tingkat perangkat keras (5060 Ti) berupa 27B (27 miliar parameter), inferensi itu sendiri menunjukkan kecepatan yang relatif stabil.
2. Hambatan Utama: Kedaluwarsa Cache (Cache Invalidation)
Ini adalah faktor pengurang paling menonjol dalam log. Ketika percakapan berlangsung lama (task 147, task 5458, dll.), fenomena berikut terjadi bersama dengan peringatan: merusak seluruh ingatan percakapan sebelumnya (KV Cache) dengan menghapusnya.
forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory...)
💡 Mengapa ini terjadi?
Karena teknik memori khusus yang digunakan model Qwen 3 seperti Sliding Window Attention (SWA), ketika isi percakapan berubah, mesin llama.cpp memutuskan bahwa checkpoint konteks yang tersimpan sebelumnya tidak kompatibel secara matematis dan menghancurkan cache.
⚠️ Kerusakan yang Diakibatkan (Lag Spike)
Ketika cache rusak, ketika percakapan berlangsung lama, prompt harus dihitung ulang dari awal. Karena alasan ini, sebelum jawaban muncul, sistem macet selama sekitar 28 detik hingga 40 detik sampai token pertama muncul (Lag yang ekstrem).
3. Tekanan Memori dan Sumber Daya
Kapasitas KV Cache: Hanya untuk mengingat konten percakapan (prompt), mengkonsumsi sekitar 4GB (3992.385 MiB) VRAM/RAM tambahan.
Batas konteks 32k (n_ctx_slot = 32768) digunakan sepenuhnya, terus membuat checkpoint berukuran 150MB seiring kemajuan percakapan, menimbulkan tekanan memori.
🛠️ Ringkasan dan Rekomendasi Optimasi
Kesimpulan: "Di lingkungan RTX 5060 Ti, model Qwen 3 27B beroperasi dengan luar biasa pada tingkat sekitar 22 token per detik, tetapi ketika percakapan berlangsung lama, cache rusak menyebabkan sistem hang selama lebih dari 30 detik sesekali."
Untuk meningkatkan hal ini, rekomendasi tindakan berikut.
Update Mesin: Bug cache yang disebutkan dalam log adalah masalah arsitektur ringan yang saat ini sedang diperbaiki oleh komunitas open-source llama.cpp. Perbarui Ollama atau backend yang digunakan ke versi terbaru.
Kurangi Ukuran Konteks: Jika konteks 32k tidak penting, turunkan ke 16k (16384) atau 8k (8192). Frekuensi cache rusak dan tekanan VRAM akan berkurang secara dramatis, membuat semuanya jauh lebih menyenangkan.