Saya menggunakan llm untuk membaca, menemukan, dan mengklasifikasikan teks.
Saya telah bekerja keras dengan qwen3.8, tetapi masih kesulitan memahami angka dan konteks dalam teks. Saya mencoba mengatur ulang Astra dengan membakar semua token, tetapi saya terus gagal. Hasilnya tampak membaik, tetapi kemudian kembali ke titik awal, membuat saya putus asa.
Ternyata Astra mengontrol model qwen langsung melalui Python untuk mendapatkan jawaban. Dengan kata lain, karena saya mencoba memproses tugas dengan panggilan sekali pakai, setiap kali saya memanggilnya, saya mendapatkan jawaban yang berbeda... Astaga... Selama beberapa minggu terakhir, saya terus melakukan ini tanpa menyadarinya.
Jadi, saya membungkusnya dengan harness sederhana bernama pi dan memerintahkannya untuk melakukannya.....
Bukankah semua perjuangan selama dua minggu terakhir menjadi tidak berarti ketika semuanya langsung berfungsi sempurna!!! Saya sangat kecewa karena telah membuang begitu banyak token, tetapi saya senang melihat hasilnya sehingga saya tidak mengatakan apa pun pada Astra.
Kemudian, saya penasaran. Jika pi yang paling lemah bisa melakukan ini dengan baik, seberapa bagus jika saya menggunakan yang lain? Karena semuanya berjalan lancar sekarang, saya tidak berani mengubahnya menurut hukum pengembang.
Saya ingin tahu apa yang biasanya digunakan oleh para anggota komunitas AI untuk mengkode llm lokal atau harness agen.
Saya yakin performa AI ditentukan setengahnya oleh model dan setengahnya lagi oleh harness, jadi saya ingin tahu harness mana yang harus saya uji.