Kenapa Skor Benchmark Model AI Sering Menyesatkan
Terbit 8 Oktober 2026
Angka yang jadi sorotan satu vendor sering diukur di test yang tidak pernah dipakai pengguna. Empat alasan, dan cara membacanya.

Pada 30 September 2026, Google-meaningwrapped Gemini 4 Argon dengan klaim yang terdengar kuat: 77,9 persen pada DeepSWE v1.1, di depan GPT-6 Astra, Claude Fable 5.1, dan Opus 5.5. Serat posisi pertama di knowledge work menurut Vals AI. Lalu analis dari Jefferies menambahkan satu kalimat: kemenangan benchmark masih butuh validasi di dunia nyata.
Catatan status: belum terverifikasi. Angka 77,9 persen di DeepSWE dan posisi pertama menurut Vals AI berasal dari pengukuran pihak ketiga, tetapi hasilnya tetap belum dipublikasikan sebagai laporan lengkap yang bisa diperiksa ulang. Perbandingan dengan model lain bisa berbeda bila konfigurasi, biaya, atau jenis task yang diizinkan tidak sama. Klaim dari Jefferies adalah analisis, bukan hasil pengujian.
Empat kalimat dalam satu paragraf itu contoh yang cukup baik untuk menjelaskan kenapa daftar peringkat tidak bisa dipakai apa adanya. Klaimnya nyata, metodenya dijelaskan, dan tetap saja tidak menjawab pertanyaan yang paling penting: apakah model ini lebih bagus untuk pekerjaan yang akan orang lakukan.
Empat alasan angka itu menyesatkan
Pertama, testnya dipilih, bukan terjadi. Benchmark bukan sesuatu yang muncul secara alami. Sekelompok orang memilih tugas apa yang diukur, dan pilihan itu menentukan hasilnya. Kalau tim produk memilih benchmark yang jadi kuat di produknya, itu pilihan yang sah secara teknis dan tentunya menguntungkan dirinya sendiri.
Kedua, pengujiannya sering milik sendiri. Angka di atas berasal dari pengujian internal. Dalam pengujian internal, kasus uji diketahui lebih dulu dan bisa disesuaikan. Itu tidak berarti angkanya palsu. Itu berarti angkanya mengukur kondisi yang lebih mudah daripada yang ditemui pengguna.
Ketiga, kontaminasi data latih. Kalau pertanyaan benchmark sudah ada di data latih sebuah model, skor pada benchmark itu bukan lagi ukuran kemampuan. Benchmark lama justru yang paling mudah dihafal model.
Keempat, yang diukur adalah tambahan kecil. Kalau kemampuan dasar sudah naik, selisih beberapa poin di benchmark bisa muncul karena perubahan kecil pada cara model menjawab, bukan karena kemampuan.
Yang sebenarnya bergerak: jaraknya, bukan peringkatnya
Peringkat model berubah setiap bulan. Yang lebih menarik adalah jarak antara model, dan jarak itu menyusut dengan pola yang jelas.
Jarak 15 persen pada awal 2026 menjadi sekitar 9 persen pada Mei, lalu sekitar 3 persen pada September. Itu bukan satu lompatan besar, tapi tiga Btwin yang berurutan. Kalau polanya diteruskan, beberapa tahun lagi jarak antara model terbaik dunia dan model open-weight kelas satu bisa mengecil sampai tidak berarti.
Yang membuat jaraknya menyusut bukan satu penemuan, tapi tiga hal yang berjalan bersamaan. Data yang lebih bersih dan lebih banyak. Arsitektur yang lebih hemat. Dan komputasi yang diarahkan ke reinforcement learning, bukan dipercyclo seluruhnya ke pretraining.
Sejarah singkat: kenapa benchmark muncul
Sebelum 2020, cara menilai model adalah memeriksa contoh keluarannya sendiri, lalu memutuskan. Metode itu gagal karena dua alasan. Pertama, tidak ada angka yang bisa dibandingkan antar-paper, jadi dua grup riset tidak pernah bisa mengukur hal yang sama. Kedua, dan lebih halus, contoh yang dipilih penulis paper hampir selalu contoh terbaik.
Lalu benchmark publik datang. GLUE pada 2018, lalu SuperGLUE pada 2019, lalu SQuAD dan task pemrosesan dokumen. Semuanya memberi satu angka yang bisa dibandingkan, dan itu mengubah industri dalam dua tahun.
Tapi hasilnya punya efek samping yang waktu itu belum kelihatan: model yang dilatih khusus pada test yang sama langsung mendapat skor tinggi tanpa kemampuan bertambah di tempat lain. Gejalanya sekarang dikenal sebagai benchmark contamination, dan hampir semua benchmark lama sudah kena.
Itu sebabnya evaluasi bergerak ke arah yang lebih sulit. LiveBench diperbarui berkala supaya pertanyaannya baru. METR mengukur hal yang berbeda: bukan seberapa baik jawaban model, tapi berapa lama satu tugas bisa diselesaikan model bila waktu komputasi ikut dihitung dengan cermat.
Apa yang terjadi kalau benchmark dipakai untuk melatih
Kasus yang paling jelas terjadi ketika test di-train ulang. Model yang melihat contoh benchmark saat latihan akan mendapat skor tinggi di benchmark itu dan tetap di tempat yang sama saat menghadapi masalah baru.
Yang lebih sulit dideteksi adalah kontaminasi tidak langsung: data yang mirip tapi bukan sama. Buku pelajaran yang memuat soal latihan dengan bentuk serupa, dokumentasi API yang menyalin contoh dari test suite, atau forum tempat orang mendiskusikan test tersebut. Semuanya memberi model kemampuan melihat bentuk soalnya, tanpa pernah melihat jawabannya.
Ini sebabnya benchmark baru yang sengaja dibuat sesudah sebuah model dilepas punya nilai yang berbeda dari benchmark lama. Keduanya mengukur hal yang sama secara teori, tapi satu sudah tercemar dan satu belum.
Cara membaca angka yang bukan milikmu
Empat hal yang bisa diperiksa sebelum mengambil kesimpulan dari satu tabel peringkat.
- Siapa yang mengujinya. Pengujian pihak ketiga lebih layak dipercaya daripada pengujian vendor. METR, organisasi yang menelaah insiden agent OpenAI, disebut sebagai target investigasi FTC pada 30 September 2026; organisasinya dikenal karena menguji klaim, bukan karena menjual model.
- Apakah skornya milik sendiri. Vendor yang menguji modelnya sendiri tidak otomatis berbohong, tapi berkepentingan. Perhitungan yang benar-benar netral perlu diulang oleh pihak lain.
- Apakah testnya sudah masuk data latih. Untuk model yang dilatih di web terbuka, hampir semua benchmark lama sudah termasuk. Yang relatif bersih adalah yang dibuat atau diperbarui setelah waktu latihan model itu.
- Seberapa dekat jaraknya. Selisih di bawah dua persen pada test apa pun sebaiknya dibaca sebagai seri, bukan kemenangan.
Tabel: empat tanda angka yang perlu dikliker ulang
| Tanda di angka | Kemungkinan yang tersembunyi | Yang harus dicari |
|---|---|---|
| Skor naik 2 poin | Noise decoding, bukan kemampuan baru | Interval YO, jumlah run |
| Persentase klaim vendor | Test pilihan, bukan test default | Apakah ada tabel lengkap |
| "NYATA" dan Labs | Pengujian pihak ketiga | Nama lembaga dan tanggal |
| Angka tanpa test | Contoh yang dipilih manual | Apakah metodenya dipublikasikan |
Angka yang perlu dibaca statusnya
Beberapa angka yang beredar deserve label berbeda.
Angka 99 langkah menjadi 8 langkah pada distilasi Rho-1 berasal dari pengujian Reka sendiri. Angka 6,70 detik untuk video 14,3 detik pada Video DeltaNet berasal dari penulisnya sendiri. Keduanya secara teknis mungkin dan sangat menarik, dan keduanya belum diverifikasi pihak ketiga.
Angka "sering dipilih 14 kernel" pada Reka Stream adalah klaim vendor dengan komponen yang jelas bisa bocor: modelnya sendiri yang memilih kernel-nya, dan tidak ada kontrol eksternal atas apa yang dipilih. Angka seperti itu layak dibaca sebagai laporan internal, bukan sebagai bukti.
Yang paling sering disalahpahami adalah angka yang tidak punya pembanding. "Pixel-perfect" pada satu model tidak berarti apa-apa kalau gambar pembandingnya diambil dari sumber berbeda, atau kalau panjang prompt-nya berbeda.
Analisis: kenapa leaderboard tidak akan hilang
Leaderboard akan tetap ada, dan bukan karena soal prestise. Alasannya struktural. Angka peringkat adalah cara termurah untuk menyampaikan sesuatu yang memang sulit disampaikan dalam bentuk kalimat.
Dua model yang berbeda bisa punya arsitektur, data, dan decoding yang sangat berbeda, sementara skornya hanya berbeda dua angka. Di dalam peringkat itu informasi itu hilang. Tapi tanpa peringkat, perbandingan jadi sulit, dan pasar akan mencari cara lain untuk membandingkan.
Yang berubah justru cara leaderboard itu dibuat. Leaderboard yang menyertakan interval kepercayaan, jumlah data, dan tanggal akan lebih berguna daripada yang hanya mencetak pemenang dengan huruf tebal.
Analisis: di balik angka, ada empat hal yang salah baca
Tabel yang lebih berguna bukan leaderboard-nya, tapi empat pertanyaan yang sering dilewatkan. Berikut tambahan yang tidak ada di sumber aslinya.
| Pertanyaan | Jawaban aman | Kenapa penting |
|---|---|---|
| Siapa yang menguji | Parties ketiga | Vendor punya kepentingan |
| Test-nya dibuat kapan | Setelah waktu latihan | Lebih bersih dari kontaminasi |
| Seberapa dekat jaraknya | Bawah 2 persen = seri | Noise decoding |
| Ada tabel lengkap | Ya atau tidak | Angka terpilih bisa dilebih-lebihkan |
Pertanyaan keempat paling sering revealing. Hampir semua halaman vendor menampilkan lima hasil terbaik lalu menyimpan sisanya. Satu tabel lengkap yang menunjukkan sebaran sebenarnya lebih informatif daripada sepuluh pilihan yang sama.
Ada hitungan sederhana yang bisa dilakukan sendiri tanpa alat apa pun. Ambil angka yang diklaim vendor, bagi dengan angka pembanding yang diuji pihak ketiga, lalu lihat apakah selisihnya masuk akal dengan satu poin atau lebih. Klaim yang melompat jauh biasanya muncul bukan karena modelnya lebih pintar, tapi karena testnya lebih sempit. Pada 30 September 2026, ketika FTC membuka investigasi atas klaim sejenis, dokumen investigasi itu yang jadi rujukan, bukan tabel marketing.
Cara lain adalah mengulang task-nya sendiri. Ambil lima permintaan yang benar-benar muncul di pekerjaan Anda, jalankan di dua model, dan catat berapa yang gagal tanpa campur tangan manusia. Hasilnya tidak sekompleks leaderboard, tapi itu angka yang akan Anda andalkan saat ada keputusan.
Pertanyaan ketiga punya konsekuensi praktis. Kalau dua model berbeda 1,8 persen pada test apa pun, memilih salah satu berdasarkan angka itu sama seperti memilih tanggal ramalan. Yang menentukan seharusnya biaya, latensi, dan tingkat kegagalan di lingkungan sendiri, bukan posisi di tabel milik orang lain.
Yang perlu dipantau
Tiga hal. Pertama, apakah test yang terlindungi dari kontaminasi makin banyak. Test yang dibuat komunitas dengan sengaja sesudah suatu model dilepas punya nilai yang berbeda dari test lama yang sudah dihafal model.
Kedua, apakah vendor mulai mengaudit diri sendiri dancerto publishes. Kalau laporan terbaik mulai mencakup kasus kegagalan, angka itu jadi lebih berguna justru karena kelihatan tidak bagus.
Ketiga, apakah jarak antara model open-weight dan frontier benar-benar hilang. Kalau iya, pertanyaan "harus pakai yang closed" jadi tidak berlaku lagi, dan itu perubahan yang lebih besar daripada peringkat mana pun yang keluar bulan ini.
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
- Ciri Tulisan AICari pola generik di tulisan Anda sendiri. Bukan detektor AI.
- Penulis Ulang Teks AITulis ulang teks menjadi bahasa yang lebih natural dan mudah dibaca dengan mempertahankan makna.
- Ringkasan Teks AIBuat ringkasan abstraktif secara lokal di browser dengan AI.
- Kalkulator PersentaseHitung persentase dan perubahan persentase.
Bagikan artikel ini
Bagikan ke
Artikel terkait

9 Oktober 2026
Kenapa Bahasa Non-Inggris Lebih Mahal: Rahasia di Balik Tokenizer
Satu tokenizer bisa membuat kata yang sama menjadi 5 token atau 15 token. Bedanya menentukan biaya API dan panjang konteks yang kamu punya.

8 Oktober 2026
Satu Model atau Banyak Model: Apa Bedanya Arsitektur Multimodal
Model unified memproses teks, gambar, dan audio dalam satu jaringan. Model pipeline menyambung beberapa model terpisah. Bedanya bukan cuma teknis.

8 Oktober 2026
Kenapa Gambar AI Pakai Diffusion, Tapi Teks Pakai Autoregressive
Dua cara membuat gambar dari noise punya akhir yang sama tapi proses yang berlawanan. Penjelasan kenapa pilihan ini berubah sejak 2015.



