Kenapa AI Salah Baca Dokumen Panjang, dan Apa yang Memperbaikinya
Terbit 1 Oktober 2026
Para peneliti menemukan pola yang berulang: model AI jauh lebih akurat kalau informasi penting diletakkan di awal atau akhir dokumen, dan gagal di tengah.

Setiap kali model AI salah menjawab pertanyaan tentang dokumen panjang, ada penjelasan yang paling sering diberikan: konteksnya tidak cukup besar. Jawabannya menenangkan, karena menyiratkan ada solusi teknis yang akan datang. Faktanya, setelah jendela konteks diperbesar berkali-kali lipat, kesalahannya tidak hilang. Ia hanya pindah tempat.
Pada 2023, tim dari Stanford dan Samaya AI menguji model bahasa pada dua tugas yang menuntut pencarian informasi di dalam dokumen panjang. Hasilnya menunjukkan pola yang konsisten di semua model yang diuji, termasuk yang dirancang khusus untuk konteks panjang: akurasi tertinggi ketika informasi yang benar diletakkan di awal atau di akhir input, dan turun tajam ketika informasi itu berada di tengah. Bukan sekadar naik atau turun beberapa poin.
Mereka menamai penemuan itu "lost in the middle". Nama yang tepat, karena yang hilang bukan datanya, tapi perhatian model terhadap data itu. Informasi ada di dalam konteks, model bisa secara teknis mengaksesnya, tapi hasilnya seperti tidak ada sama sekali.
Bentuk kurvanya: U, bukan garis turun
Temuan yang paling berguna dari makalah itu bukan kutipan tunggal, melainkan sebuah kurva. Kalau Anda memindahkan dokumen yang benar dari awal ke tengah lalu ke akhir, dan mengukur akurasi tiap posisi, Anda tidak akan melihat penurunan bertahap. Anda akan melihat bentuk huruf U.
Angka-angka di atas adalah representasi bentuk kurvanya, bukan hasil pengukuran tunggal dari satu paper. Yang penting itu polanya: tinggi di dua ujung, rendah di tengah, dan simetris.
Dua ujung itu punya nama: primacy bias untuk yang awal, dan recency bias untuk yang akhir. Keduanya bukan kebetulan. Jaringan yang dilatih dengan prediksi token berikutnya secara alami diberi imbalan yang lebih besar bila-gradients lebih jelas untuk token yang dekat. Awal konteks punya pola yang sudah "dipahami" model sebelum pertanyaan muncul; akhir konteks punyatoken yang paling baru dan paling dekat dengan pertanyaan. Posisi tengah tidak punya salah satu keuntungan itu.
Bandingkan dengan yang terjadi di tengah. Pada salah satu skenario di paper tersebut, ketika informasi relevan diletakkan di tengah input, GPT-3.5-Turbo mencatat hasil lebih rendah daripada ketika model menjawab tanpa dokumen sama sekali. Itu bukan jawaban yang salah sedikit. Itu jawaban yang lebih buruk daripada tidak membaca dokumen.
Kenapa ini penting secara praktis dan tambahan
Tiga implikasi langsung untuk orang yang memakai AI pada dokumen kerja. Semuanya bisa diringkas dalam satu tabel, dan perbedaannya bukan soal benar atau salah tapi soal gejala yang Anda lihat:
| Gejala yang Anda lihat | Penyebab sebenarnya | Yang harus diubah |
|---|---|---|
| Model bilang informasinya tidak ada di dokumen | Jendela konteks terpotong | Perbesar jendela, atau potong dokumen jadi bagian-bagian |
| Model benar saat kunci ada di awal atau akhir, salah atau mengarang saat di tengah | Bias posisi (lost in the middle) | Susun ulang, letakkan yang menentukan di ujung |
| Jawaban berubah-ubah tanpa alasan jelas saat dokumen panjang | Dua masalah di atas bercampur | Pecah dokumen, lalu susun ulang setiap pecahan |
Ketiga, dan ini yang paling sering terlewat: menghapus bagian tengah secara eksplisit sering lebih berguna daripada menambah jendela. Kalau Anda sudah tahu satu fakta ada di halaman 200 dari dokumen 400 halaman, memotong dokumen menjadi dua bagian 200 halaman dan memberi model keduanya berarti fakta itu berada di ujung salah satu bagian, bukan di tengah. Menghapus konteks yang Anda tahu tidak dibutuhkan bukan pemborosan, itu pilihan yang murah dan langsung menaikkan kualitas jawaban.
Implikasi yang pertama adalah ini langsung untuk orang yang memakai AI pada dokumen kerja.
Pertama, urutan dokumen memengaruhi jawaban. Kalau Anda mengunggah kontrak, laporan, atau dokumen teknis, isi yang paling menentukan dan paling sering ditanyakan sebaiknya diletakkan dekat awal atau dekat akhir — bukan di tengah-tengah dengan lampiran di belakang. Ini bukan teori; ini cara kerja yang terukur.
Kedua, "jendela konteks lebih besar" bukan solusi otomatis. Paper LongRoPE2 tahun 2025 mencoba memperpanjang jendela LLaMA3-8B ke 128.000 token sambil mempertahankan lebih dari 98,5% performa konteks pendeknya, menggunakan hanya 10 miliar token pelatihan. Angka itu menarik. Tapi makalah Lost in the Middle tidak mengklaim bahwa jendela yang lebih besar otomatis memperbaiki bias berbentuk U. Dua masalah itu berbeda, dan menyelesaikan satu tidak otomatis menyelesaikan yang lain.
Penyebabnya ada di dalam attention itu sendiri
Paper "Found in the Middle" yang terbit di Findings of ACL tahun 2024 menelusuri penyebab dasarnya: bias posisi itu melekat pada model itu sendiri. Token di awal dan akhir input menerima perhatian lebih tinggi secara bawaan, bukan karena isinya relevan.
Analoginya seperti membaca sebuah meja panjang dengan lampu yang hanya menyala di dua ujungnya. Anda bisa melihat seluruh meja, tapi apa pun yang diletakkan di bagian tengah bayangan akan lebih sulit dibaca. Memanjangkan meja tidak memperbaiki masalah pencahayaan.
Paper itu mengusulkan solusi yang cukup elegan: kalibrasi bias posisi sehingga model bisa memperhatikan sesuai relevansi, bukan sesuai posisi. Metodenya membuat distribusi perhatian lebih datar. Diuji pada retrieval dan pada tugas retrieval-augmented generation, hasilnya mengalahkan metode yang sudah ada sampai 10 poin persentase.
Yang perlu dicatat: pola berbentuk U yang sama juga muncul di model kecil sekelas GPT-2, bukan hanya model besar dan mahal. Ini sifat dari arsitektur attention itu sendiri, bukan artefak dari skala data. Artinya, ini bukan masalah sementara yang akan hilang dengan model yang lebih besar.
Kuadratik, dan bagaimana FlashAttention mengatasinya
Ada masalah lain yang sering tertukar dengan di atas. Perhitungan attention menguji setiap pasangan kata di dokumen, sehingga biayanya naik kuadratik terhadap panjang dokumen. Pada 1.000 kata, itu sekitar satu juta perhitungan. Pada 100.000 kata, sepuluh miliar. Pada jendela satu juta token, itu satu kuadrilium.
Masalah itudicoba diselesaikan dengan pendekatan yang mengorbankan kualitas: linear attention, sparse attention, Performer. Masalahnya, sebagian besar pendekatan itu mengurangi beban komputasi di atas kertas tapi tidak memberikan percepatan waktu nyata, karena biayanya bergeser ke tempat lain.
FlashAttention, dari Stanford pada 2022, mendekati masalah ini dari arah yang berbeda. Bukannya mengubah attention jadi lebih sederhana, ia menyadari bahwa bottleneck sebenarnya bukan jumlah perhitungan, tapi banyaknya perpindahan data antara dua tingkat memori di GPU: memori utama yang besar dan lambat, dan cache yang kecil di cip. Algoritma ini memakai tiling sehingga attention dihitung di dalam cache dan matriks attention yang besar tidak pernah ditulis ke memori lambat.
Hasilnya, dari tabel di paper:
| Metrik | Attention biasa | FlashAttention |
|---|---|---|
| Pembacaan/tulisan HBM (GB) | 35,3 | 4,4 |
| Waktu runtime (ms) | 35,1 | 11,7 |
| Kompleksitas memori terhadap panjang | kuadratik | linear |
Yang perlu dicatat adalah kata "exact" di judul paper. FlashAttention tidak mengorbankan apa pun dari ketepatan attention. Ia menghasilkan angka yang sama persis dengan cara attention biasa dihitung, hanya dengan lebih sedikit perpindahan memori. Ketika FlashAttention-2 keluar tahun 2023, runtime-nya turun lagi sekitar 2 kali dan mencapai 73% dari throughput teoretis maksimum di A100.
Dua masalah, dua obat, satu aturan praktis
Kembali ke soal praktis. Kalau dokumen Anda panjang dan model sering salah, ada dua penyebab yang berbeda dengan dua obat yang berbeda.
Kalau informasinya masih terpotong. Gejalanya: model bilang "informasi itu tidak ada di dokumen". Penyebabnya jendela konteks. Obatnya perbesar jendela, atau potong dokumen jadi beberapa bagian yang lebih kecil.
Kalau informasinya ada tapi diabaikan. Gejalanya: model menjawab dengan benar saat informasinya di awal atau akhir, dan salah atau mengarang saat di tengah. Penyebabnya bias posisi. ObatnyaSusun ulang: letakkan bagian yang paling menentukan di ujung, dan jangan mengandalkan model untuk menemukan sesuatu di tengah dokumen yang panjang.
Membedakan keduanya penting, karena obat yang salah justru memperburuk. Memperbesar jendela 32.000 token tidak akan memperbaiki dokumen 5.000 token yang ketentuan utamanya berada di paragraf kedelapan. Yang akan memperbaiki hal itu adalah menyusun ulang dokumen, atau memotongnya menjadi beberapa bagian.
Ketiga, ada hal yang jarang disebut di tutorial mana pun: memotong dokumen sendiri sering lebih baik daripada memperbesar jendela. Kalau sebuah dokumen 400 halaman dipecah menjadi lima bagian 80 halaman, dan Anda mempertahankan urutan yang benar di prompt, setiap bagian masuk ke model secara utuh, dan informasi penting Anda berada di bagian awal atau akhir dari setiap potongan, bukan di tengah dokumen asli. Jendela yang besar membuat semua isi muat, tapi isi itu tetap terbagi menjadi beberapa segmen di dalam jendela. Menghapus bagian tengah secara eksplisit memberi Anda keuntungan yang tidak bisa didapat dari jendela lebih besar, dan tanpa biaya komputasi tambahan.
Ada satu hal yang perlu ditambahkan di sini, dan ini jarang disebut secara eksplisit: model bahasa yang dilatih untuk mengikuti instruksi biasanya diberi instruksi di awal atau akhir. Format paling umum dari ribuan dokumen yang dilatih untuk itu menempatkan pertanyaan atau perintah di atas, lalu jawabannya di bawah. Bias primacy dan recency yang dijelaskan di atas memperkuat persis pola itu, dan ditemukan bahwa model menunjukkan bias yang lebih kuat pada dokumen yang tersusun seperti itu. Efeknya bukan cuma pada model bahasa besar. Pola yang sama ditemukan pada model kecil dan pada tugas yang sama sekali bukan tentang bahasa.
Praktisnya, ini berarti struktur dokumen adalah bagian dari prompt Anda. Kalau Anda memuat dua puluh halaman laporan dan bertanya tentang satu angka di halaman tujuh belas, Anda tidak sedang menguji kemampuan model. Anda sedang menguji seberapa baik Anda menaruh pertanyaan itu di tempat yang ringan terbaca.
Aturan praktis yang muncul dari seluruh kajian di atas adalah satu kalimat: di dalam jendela konteks, posisi adalah informasi. Kalau Anda memasukkan dokumen ke dalam model, Anda tidak hanya memberi tahu model apa isinya, tapi juga urutan Anda menyusunnya.
Sembilan tahun sejak paper Transformer yang membuat attention jadi standar, masalah yang muncul dari standardisasi ini ternyata bukan pada ide intinya, tapi pada apa yang tidak ditangani arsitektur itu. Bias posisi dan biaya kuadratik keduanya muncul langsung dari keputusan merancang attention yang bisa dihitung parallel. Keduanya juga keduanya diselesaikan dengan memodifikasi arsitektur itu sendiri, bukan dengan menggantinya. Dan setiap solusi itu mengubah cara orang sebaiknya menyusun input-nya, cara yang belum masuk ke panduan siapa pun.
Setiap kali jendela konteks diperbesar lagi, pertanyaan yang sama akan muncul: apakah konteks yang lebih besar itu membuat model lebih baik di tengah dokumen, atau hanya menyembunyikan masalah itu lebih lama?
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
Bagikan artikel ini
Bagikan ke
Artikel terkait

1 Oktober 2026
Arsitektur Transformer 2017 yang Mengubah Cara Mesin Belajar
Delapan GPU P100 dan 3,5 hari cukup untuk memecahkan rekor BLEU. Kenapa makalah yang menghapus RNN jadi fondasi hampir semua model AI?

1 Oktober 2026
AI Slop: Kata yang Memberi Nama Badai Konten Murahan
Pada 2025, satu kata empat huruf terpilih jadi kata tahun ini. Bukan karena tren, tapi karena konten murah yang membanjiri internet.

30 September 2026
Kapan AI Pertama Muncul? Bukan 1956, Tapi 13 Tahun Lebih Awal
Istilahnya lahir di Dartmouth 1956, tapi idenya sudah ditulis pada 1943. Sejarah AI menunjukkan pola yang berulang sampai sekarang.



