Sebenarnya saya hanya menggunakan LLM instalasi untuk bersenang-senang, tetapi saya sedang mencari model ringan yang dapat dijalankan di laptop saya. Kemudian muncul Ornith.
Ringkasan satu baris : Tidak bisa membuat kode, tetapi bagus dalam mengikuti instruksi
Ringkasan dua baris : Jangan biarkan orang lain melatihnya untuk Anda, karena Anda tidak akan bisa melakukannya sendiri.
Berikut adalah benchmark Codex Python yang saya buat dan gunakan (standar untuk dijalankan di laptop)
Syaratnya adalah model Ollama mentah, num_ctx=4096, suhu 0, kompatibel dengan Python 3.9
Skor Total
Model | Task Pass | Case Score | Accuracy | Avg tok/s |
|---|
Qwen3-Coder 30B-A3B | 5/6 | 35/37 | 94.59% | 42.27 |
Ornith 35B Q4 4K | 4/6 | 35/37 | 94.59% | 11.06 |
Devstral 24B Dense | 3/6 | 31/37 | 83.78% | 15.30 |
Ornith 9B Q8 | 4/6 | 29/37 | 78.38% | 23.00 |
Skor Per Item
Model | Penulisan Kode | Perbaikan Kesalahan/Bug Fix | Implementasi Struktur Data | Deteksi Kesalahan/Tinjauan |
|---|
Qwen3-Coder 30B | 18/18 | 12/12 | 2/2 | 3/5 |
Ornith 35B | 17/18 | 11/12 | 2/2 | 5/5 |
Devstral 24B | 14/18 | 12/12 | 2/2 | 3/5 |
Ornith 9B Q8 | 12/18 | 12/12 | 0/2 | 5/5 |
Deteksi Kesalahan
Model | Exact | Candidate Acc | Precision | Recall | F1 |
|---|
Ornith 9B | 3/5 | 90.32% | 88.89% | 94.12% | 91.43% |
Qwen3-Coder 30B | 3/5 | 87.10% | 84.21% | 94.12% | 88.89% |
Pemahaman Struktur Kode
Model | Exact | Candidate Acc | Precision | Recall | F1 |
|---|
Ornith 9B | 3/4 | 95.83% | 92.86% | 100.00% | 96.30% |
Qwen3-Coder 30B | 3/4 | 95.83% | 100.00% | 92.31% | 96.00% |
Interpretasi adalah sebagai berikut:
9B bagus untuk review/deteksi. Terutama cenderung menangkap lebih banyak daripada melewatkan (recall).
Qwen 30B lebih konservatif. False positive lebih sedikit dalam pemahaman struktur, tetapi melewatkan satu bug yang dapat dijangkau.
Kedua model memiliki kelemahan dalam kontrol false positive. 9B menambahkan 2 bug palsu, Qwen menambahkan 3.
Format lebih berisiko pada 9B. Kontennya benar, tetapi tidak mengikuti format JSON array dan menghasilkan {"A","B"}. Dibutuhkan koreksi parser jika digunakan sebagai reviewer.
Struktur yang direkomendasikan sudah menjadi jelas:
Penulisan/modifikasi kode: Qwen3-Coder 30B
Deteksi kesalahan/review struktur tahap 1: Ornith 9B
Keputusan penerapan akhir: Qwen hasil dan hasil review 9B saling memverifikasi.
Output seperti block_patch.json yang ketat tidak boleh hanya diserahkan ke 9B.