Perbandingan Benchmark Vector build 1.2 yang Diperbarui dengan Grok 4.6 vs Grok build 0.3 (Terminal + Aplikasi)

58.26.***.***
36

Grok Build 0.3 vs VectorBuild 1.2 (Grok 4.6)

Ringkasan

Beberapa hari lalu ketika Grok 4.6 diluncurkan, Grok Build juga diperbarui. Peningkatan performa terkait pengkodean agen sangat mencolok. Menggunakan Grok Build yang khusus untuk Task dan agen, saya tidak bisa begitu saja melewatkannya. Selama akhir pekan, saya menyelesaikan pembaruan Vector Build untuk Grok 4.6 secara jarak jauh dan menjalankan benchmark. Baik Grok Build maupun Grok 4.6, keduanya pasti lebih baik dari 4.5

Sekali lagi, SpaceXAi yang melepaskan aplikasi berkualitas tinggi seperti ini sebagai kode terbuka benar-benar orang besar hati.

Perubahan waktu, biaya, token, jumlah panggilan, dan kualitas Vector Build dibandingkan Grok Build

  • time: -10.15% (VectorBuild sekitar 10% lebih cepat di semua 7 tugas)

  • cost: -21.99% (menghemat sekitar 22% biaya)

  • tokens: -25.12% (menghemat sekitar 25% penggunaan token)

  • calls: -10.67% (penurunan sekitar 11% dalam jumlah panggilan model)

  • quality: +0.43 poin (peningkatan kecil dalam kualitas rata-rata)

  1. VectorBuild berhasil mengurangi waktu, biaya, token, dan panggilan sambil mempertahankan dan sedikit meningkatkan kualitas

  2. Pengurangan efisiensi terbesar adalah token dan biaya, sementara panggilan dan waktu relatif lebih kecil, sehingga dalam operasi sebenarnya 'pengurangan transmisi ulang konteks' adalah efek terbesar (kekuatan vektorisasi)

  3. Dalam pekerjaan implementasi dan debugging di mana penyelesaian jelas berdasarkan pengujian dan runtime, saat menggunakan VectorBuild On, waktu, biaya, dan token secara rata-rata berkurang dengan cara yang mencolok. Dengan kata lain, kuat dalam masalah yang memiliki jawaban yang benar

  4. Sebaliknya, dalam pekerjaan nonspesifik tanpa tujuan seperti pembuatan UI aplikasi, dapat jatuh ke pola over-verification.

Satu hal yang saya pelajari adalah bahwa saat membuat aplikasi, jika tujuan tidak jelas, efisiensi dapat malah menurun. Jika tidak memecah tugas melalui mode plan dan mode workflow, tampaknya algoritma vektor tidak dapat menunjukkan kekuatannya.

Lampiran : Loop Grok Build (Kira-kira)

  • Permintaan - Penilaian mandiri agen - File/Alat/Sub-agen - Modifikasi sumber/Pengujian - Model menentukan apakah loop

Lampiran 2 : Loop Vector Build

  • Permintaan - Injeksi vektor memori pra-kondisi - Penetapan kondisi penyelesaian - Penilaian agen - Modifikasi sumber/Pengujian - TodoGate yang belum selesai - Model menentukan loop - Vektorisasi memori/counterexample tambahan setelah penyelesaian

Harness yang saya gunakan terutama adalah sebagai berikut

Grok Build / Vector Build (Peringkat 1, performa kecepatan yang luar biasa)

Claude Code (Peringkat 2, Stabilitas)

Codex (Peringkat 3, Lambat tetapi kemampuan pemecahan masalah tetap bagus)

OpenCode (Peringkat 4, Mode Plan sangat bagus)

▶ Sumber asli: https://github.com/JUNJOONHWAN/vectorbuild-releases/releases/tag/v1.2.0-vectorbuild.15

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.93 =0.00

2026.08.19 KEB 하나은행 고시회차 955회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!