Arsitektur Transformer 2017 yang Mengubah Cara Mesin Belajar
Terbit 1 Oktober 2026
Delapan GPU P100 dan 3,5 hari cukup untuk memecahkan rekor BLEU. Kenapa makalah yang menghapus RNN jadi fondasi hampir semua model AI?

Pada Juni 2017, delapan penulis dari Google Brain dan University of Toronto memuat makalah delapan halaman ke arXiv. Judulnya lugas: "Attention Is All You Need". Tidak ada nama perusahaan yang diumumkan, tidak ada program prarilis, tidak ada keynote. Hasilnya: arsitektur yang menghapus komponen yang dianggap wajib di bidang machine learning saat itu, dan yang kini menjadi fondasi hampir setiap model AI besar yang Anda pakai.
Makalah itu mencapai sesuatu yang belum pernah dicapai bidang ini dalam satu langkah: kualitas terjemahan yang lebih baik, dengan komputasi yang jauh lebih sedikit. Model besar mereka dilatih 3,5 hari di delapan GPU P100 dan mencapai skor BLEU 41,8 pada benchmark WMT 2014 Inggris-Perancis. Model-model terbaik sebelumnya butuh berlipat kali lebih banyak komputasi, dan beberapa di antaranya mencapai skor itu hanya dengan menggabungkan sepuluh model sekaligus.
Yang membuat makalah ini penting bukan angkanya, melainkan arsitekturnya. Sebelum 2017, cara utama memproses kalimat bernuansa adalah recurrent neural network atau RNN: model membaca kata satu per satu dari kiri ke kanan, menyimpan semua yang ia tahu tentang kata-kata sebelumnya di dalam satu state yang terus diperbarui. Cara itu punya satu masalah fatal yang tidak bisa diperbaiki dengan menunggu lebih lama. Untuk menghitung kata ke-1.000, RNN harus lebih dulu menyelesaikan kata ke-999. Berapa pun GPU yang Anda punya, urutan itu tidak bisa diparalelkan.
Arsitektur satu-lapis yang menghapus urutan
Transformer memecahkan ini dengan cara yang terdengar sederhana: biarkan setiap kata langsung melihat setiap kata lain dalam dokumen, sekaligus, di lapisan yang sama.
Ini yang disebut self-attention. Mekanismenya: setiap kata diubah menjadi sebuah vektor yang merepresentasikan isinya. Lalu setiap pasang kata menghitung seberapa dekat hubungannya, dan bobot perhatian dialokasikan ke setiap kata berdasarkan kedekatan itu. Kata "kucing" akan mengarahkan perhatian lebih besar ke kata "mengikis" di sebelahnya, dan lebih kecil ke kata "di" yang jauh di paragraf berikutnya. Layer yang sama, semua kata sekaligus.
Poin kuncinya ada di kata sekaligus. Karena tidak ada ketergantungan antar waktu, seluruh perhitungan bisa dijalankan secara paralel di ribuan inti GPU sekaligus. RNN harus berjalan berurutan 1.000 langkah; Transformer menyelesaikan seluruh 1.000 kata itu dalam satu langkah. Pada hardware yang dirancang untuk paralelisme, itulah perbedaan antara mustahil dan sepele.
Google bukan pihak pertama yang memakai mekanisme perhatian. Attention sudah dipakai sejak 2014 untuk menghubungkan encoder dan decoder, hanya saja digabungkan dengan RNN. Kontribusi makalah 2017 adalah melepaskan RNN itu sepenuhnya, lalu menambahkan sublayer attention multi-kepala yang memproses beberapa hubungan sekaligus dalam satu langkah.
Setiap angka di baris pertama adalah model yang berbeda, dan urutannya dari yang tertinggal: model Transformer kecil 28,4, Transformer besar 41,0, dan angka 41,8 di abstrak makalah untuk versi dengan dropout yang disesuaikan. Semua diukur di benchmark yang sama.
Angka yang membuat reviewer reconsider
Bagian yang paling sering dikutip dari makalah ini bukan arsitekturnya, tapi tabel biayanya. Para penulis menghitung operation float yang terpakai untuk melatih tiap model, lalu membandingkannya langsung.
| Model | BLEU Inggris-Jerman | Biaya latihan (FLOPs) |
|---|---|---|
| ByteNet | 23,75 | tidak dipublikasikan di tabel utama |
| GNMT + RL | 24,6 | 2,3 x 10^19 |
| ConvS2S | 25,16 | 9,6 x 10^18 |
| Transformer (base) | 27,3 | tidak dipublikasikan di tabel utama |
| Transformer (big) | 28,4 | 3,3 x 10^19 |
Perhatikan kolom BLEU dan kolom biaya: model yang menang di skor BELUM tentu yang paling murah. ConvS2S paling hemat, tapi skornya paling rendah di antara yang modern. Yang ergibt dari Transformer adalah titik di kanan atas tabel: skor tertinggi dan biaya yang lebih rendah dari model terbaik pendahulunya.
Frasa di abstraknya merangkum ini. Mereka menulis model mereka mencapai rekor baru dengan biaya latihan "a small fraction of the training costs of the best models from the literature". Itu bukan klaim teknis, itu klaim ekonomi. Kalau satu epoch lebih murah, peneliti bisa melakukan lebih banyak eksperimen, dan eksperimen yang lebih banyak itulah yang menggeser bidang ini.
Untuk model besar, angkanya jelas: 300.000 langkah, masing-masing sekitar 1 detik, di satu mesin dengan delapan P100. Untuk model kecil, 100.000 langkah dan 12 jam. Angka 12 jam inilah yang membuat makalah ini bisa direproduksi oleh laboratorium kecil, dan itu mungkin efek jangka panjang yang paling penting dari seluruh paper.
Dari penerjemah ke model bahasa
Transformer berubah peran dari arsitektur penerjemah menjadi arsitektur umum. Model bahasa besar sekarang praktis tidak memakai RNN atau convolutional lagi. GPT, BERT, dan seluruh keluarga turunannya berdiri di atas blok yang sama: multi-head attention, residual connection, layer normalization, dan feed-forward network per posisi.
Transformer berubah peran dari arsitektur penerjemah menjadi arsitektur umum. Model bahasa besar sekarang praktis tidak memakai RNN atau convolutional lagi. GPT, BERT, dan semua keluarga model turunan mereka berdiri di atas blok yang sama: multi-head attention, residual connections, layer normalization, dan feed-forward network per posisi.
Dua perubahan struktural yang membuat transformasi ini mungkin. Pertama, positional encoding: karena attention tidak tahu urutan dengan sendirinya, posisi kata harus disuntikkan sebagai vektor tambahan. Tanpa itu, model akan melihat "kucing mengikis tikus" dan "tikus mengikis kucing" sebagai hal yang identik. Kedua, residual connection dan layer normalization membuat jaringan bisa dibuat jauh lebih dalam tanpa hilang stabilitas, sesuatu yang mustahil dilakukan berulang kali pada RNN.
Perhatikan arah perubahan biaya. Untuk klasifikasi kalimat pendek, sequential processing sudah cukup. Untuk dokumen panjang, proses RNN akan mandek. Transformer tidak hanya cocok untuk yang panjang; ia menghapus alasan struktural kenapa RNN masih dipakai. Ketika penggantian itu terjadi, satu-satunya kelebihan RNN yang tersisa adalah memproses input panjang secara streaming, dan itu sekarang lebih lambat tanpa lagi jadi alasan.
Sejak 2017, jendela konteks menjadi sumbu persaingan, dan setiap penambahannya merupakan modifikasi atas keputusan yang sama. Model dengan jendela 4.096 token pada 2019, jendela 100.000 token pada 2023, dan jendela satu juta token pada 2024. Setiap dorongan jendela itu berakar pada keputusan arsitektural yang diambil delapan penulis pada 2017.
Yang benar-benar hilang dari RNN
Ada satu hal yang Transformer tidak tawarkan, dan itu perlu disebut supaya tidak ada yang menganggap paper ini sesuatu yang bukan kenyataan.
Transformer dalam bentuk aslinya tidak punya memori di luar jendela inputnya. Setiap dokumen diproses dari nol. Untuk RNN, informasi dari kata pertama masih tersedia di state internal saat kata terakhir diproses, selama konteksnya masih muat. Pada Transformer, ketika jendela penuh, isi di luar jendela itu hilang.
Inilah sebabnya model dengan jendela 100.000 token masih punya masalah nyata pada dokumen 500.000 token, dan kenapa_I eagerly recall ada perusahaan yang harus memilih: context yang lebih besar atau context yang lebih baik utilized. Keduanya boros, dan_I punya spreadsheet yang berbeda.
Perbedaan penting lain: Transformer menghitung perhatian pada setiap pasangan kata, jadi biayanya kuadratik terhadap panjang dokumen. Pada 1.000 kata, itu sekitar satu juta perhitungan pasangan. Pada 100.000 kata, itu sepuluh miliar. Angka itu tidak hilang; ia hanya dipindahkan ke tempat lain, ke masalah yang diselesaikan FlashAttention pada 2022.
Mengapa 3,5 hari itu mengubah dunia
Balik ke angka training. Delapan GPU P100, 3,5 hari, satu makalah. Tidak ada klaster. Tidak ada program infrastruktur, tidak ada laboratorium tersembunyi, tidak ada anggaran khusus.
Sebelum 2017, biaya infrastruktur sering menentukan siapa yang bisa menyelesaikan masalah mana. Laboratorium dengan akses ke ribuan GPU bisa menjalankan eksperimen yang mustahil diletakkan di luar jangkauan orang yang mengerjakannya sendiri. Transformer mengubah persamaan itu: ia membuat permintaan perangkat keras per percobaan turun drastis, dan itu membuat bidang ini bisa dimasuki orang yang bekerja sendirian.
Angka lain yang sering dilupakan: dropout yang dipakai model besar hanya 0,1 untuk tugas Inggris-Perancis, bukan 0,3 seperti pada model kecil. Ini detail kecil di atas kertas, tapi menunjukkan sesuatu yang lebih besar โ para penulis tidak sekadar mengikuti resep dropout yang ada. Mereka mengubahnya karena meskipun trainer lebih besar dengan lebih banyak data, overfitting terjadi lebih lambat. Pengetahuan itu butuh beberapa tahun untuk diserap sepenuhnya.
Sembilan tahun kemudian, tidak ada satu pun arsitektur AI mainstream yang keluar dari keluarga ini. Firmware Qualcomm, model generatif gambar, protein structure prediction, mobil otonom, dan chatbot yang Anda pakai โ semuanya memakai attention. Yang tersisa dari RNN bukan arsitekturnya, tapi gagasanannya: memproses urutan dengan RK yang bisa dipDQ.
Pertanyaannya sekarang bukan "apakah Transformer akan bertahan", tapi seberapa lama bisa diperbaiki tanpa perlu ganti paradigma. Dari 2017 sampai sekarang, setiap keterbatasan yang ditemukan โ attention kuadratik, bias posisi, komputasi yang boros โ diselesaikan dengan memodifikasi paradigmanya, bukan menggantinya. Apakah itu akan terus bekerja, atau apakah kita sedang menumpuk masalah yang akhirnya menuntut arsitektur baru.
Analisis tambahan: apa yang membuat paper ini bertahan hampir sembilan tahun
Ada satu pertanyaan yang jarang ditanyakan orang: kenapa arsitektur yang sudah hampir sembilan tahun tidak digantikan. Jawabannya bukan karena tidak ada yang mencoba. Ada yang mencoba berkali-kali, dan sebagian besar gagal dengan pola yang sama.
Hapus satu lapisan dari arsitektur Transformer, dan yang tersisa ternyata sudah cukup untuk mengubah kesimpulan reviewer di paper itu. Berikut perbandingan yang mereka buat sendiri:
| Pendekatan | Prinsipnya | Hasil di paper itu |
|---|---|---|
| ByteNet | Konvolusi untuk urutan, tanpa rekurensi | BLEU 23,75, biaya tidak dipublikasikan |
| ConvS2S | Konvolusi saja, tanpa attention sama sekali | BLEU 25,16, biaya 9,6 x 10^18 FLOPs |
| GNMT + RL | RNN dengan attention sebagai pelengkap | BLEU 24,6, biaya 2,3 x 10^19 FLOPs |
| Transformer base | Attention saja, tanpa rekurensi dan tanpa konvolusi | BLEU 27,3, biaya tak sebanding |
| Transformer big | Attention multi-kepala, dropout yang disesuaikan | BLEU 28,4, biaya 3,3 x 10^19 FLOPs |
Baris terakhir adalah inti argumennya. Model terbaik bukan yang paling murah dan bukan yang paling sederhana; model terbaik adalah yang menghapus komponen yang tidak perlu. ConvS2S lebih sederhana dari RNN, dan GNMT + RL menambah reinforcement learning dengan biaya dua kali lebih besar dari ConvS2S untuk skor yang justru lebih rendah. Setiap pendekatan sebelum 2017 menambahkan mesin, sementara Transformer berhasil dengan lebih sedikit mesin yang mengerjakan lebih banyak.
Percobaan yang gagal mengurangi kompleksitas, bukan menambahkannya. Linear attention dan Performer mengganti softmax attention dengan bentuk yang bisa dihitung linear. Secara teori itu terdengar masuk akal. Kenyataannya, jumlah FLOP turun drastis tapi waktu berjalan hampir tidak bergerak, karena FLOP bukan ukuran biaya sebenarnya. Yang mahal bukan perkalian matriks, tapi memindahkan data dari memori ke inti komputasi. Mengurangi perkalian tidak menyentuh itu.
Percobaan yang berhasil menambah struktur, bukan mengurangi. FlashAttention adalah contoh paling jelas. Prinsipnya tidak menyederhanakan attention sama sekali: matriks attention tetap berukuran N kali N dan tetap dihitung eksak. Yang diubah hanya urutan akses memorinya. Hasilnya 2 sampai 4 kali lebih cepat tanpa satu pun pengorbanan kualitas. Pola ini berulang: optimasi yang bisa dilakukan menang, dan pengurangan yang mengorbankan ketepatan tidak menang.
Ada satu hal lagi yang jarang disebut, dan itu soal biayanya. Model besar berada di bawah tekanan biaya yang tidak bisa dihindari, karena biaya training meningkat hampir linear dengan ukuran model sementara kemampuan tidak meningkat linear. Tekanan itulah yang sebenarnya mendiktei setiap keputusan arsitektural, dan alasan kenapa angka 3,5 hari itu sama pentingnya dengan skor BLEU-nya.
Yang membuat ini memunculkan pertanyaan yang tidak bisa diajukan penulisnya sendiri pada 2017: apakah self-attention masih pilihan yang tepat untuk konteks berukuran jutaan token, atau apakah arsitektur ini akhirnya akan terlihat sama primitifnya seperti RNN terlihat bagi kita sekarang?
Dua kemungkinan jawabannya. Yang pertama, arsitektur ini dipoles tanpa henti selama dua dekade dan tidak akan pernah ada penerusnya. Yang kedua, penerus datang dari arah yang tidak terduga: bukan dari model yang lebih besar, tapi dari model yang lebih kecil dan lebih khusus. Pola seperti itu sudah terjadi sekali, pada 2017, dan itulah sebabnya makalah delapan halaman ini masih menentukan istilah bidang ini.
Tidak satu pun dari dua jawaban itu bisa diketahui sekarang. Yang bisa diketahui adalah ini: makalah yang Anda baca, delapan halaman dengan delapan GPU, mengubah arah bidang ini, dan arah itu masih terasa di setiap model yang ada hari ini.
Bagikan artikel ini
Bagikan ke
Artikel terkait

1 Oktober 2026
Kenapa AI Salah Baca Dokumen Panjang, dan Apa yang Memperbaikinya
Para peneliti menemukan pola yang berulang: model AI jauh lebih akurat kalau informasi penting diletakkan di awal atau akhir dokumen, dan gagal di tengah.

1 Oktober 2026
AI Slop: Kata yang Memberi Nama Badai Konten Murahan
Pada 2025, satu kata empat huruf terpilih jadi kata tahun ini. Bukan karena tren, tapi karena konten murah yang membanjiri internet.

30 September 2026
Kapan AI Pertama Muncul? Bukan 1956, Tapi 13 Tahun Lebih Awal
Istilahnya lahir di Dartmouth 1956, tapi idenya sudah ditulis pada 1943. Sejarah AI menunjukkan pola yang berulang sampai sekarang.



