501 Miliar Parameter Menang Lawan 2 Triliun, Tapi Bukan Itu
Terbit 7 Oktober 2026
Reflection AI rilis Beam dengan 501 miliar parameter dan mengalahkan model 2 triliun di tugas tertentu. Yang menentukan bukan angkanya.

Pada 5 Oktober 2026, Reflection AI memperkenalkan Beam, model bahasa open source dengan 501 miliar parameter. Angka itu lebih kecil daripada yang biasanya orang kira. Perusahaan mengklaim Beam menjalankan beberapa tugas lebih baik daripada GLM-5.2, yang punya sekitar 250 miliar parameter lebih banyak, dan mendekati Qwen 3.8-Max yang melampaui 2 triliun parameter. Jadi model yang lebih kecil menang di beberapa bidang, sementara model terbesar masih jauh di depan.
Pertanyaan yang sebenarnya dijawab Rheumatology ini bukan model tersebut. Yang deserving dijawab adalah: kenapa jumlah parameter berhenti jadi ukuran kemampuan, dan apa yang menggantikannya.
Chinchilla: ketika jumlah parameter bukan lagi jawaban
Dominasi ukuran parameter berawal dari satu kertas tahun 2022. Chinchilla, riset dari Google DeepMind, menunjukkan bahwa model bahasa yang dilatih pada 70 miliar parameter ternyata lebih kuat daripada model 280 miliar parameter yang dilatih dengan empat kali lipat data. Pesannya sederhana dan mengubah arah industri: model-model besar sebelumnya dilatih dengan cara yang terlalu rakus.
Sebelum Chinchilla, asumsi yang berlaku adalah bahwa skala adalah segalanya. Labillage skalakan model sebesar mungkin karena itu satu-satunya sumber daya yang paling mereka yakini. Sesudahnya aturan berubah menjadi efisiensi: ukuran dataset harus ikut tumbuh bersama model. Parameter berhenti jadi angka yang berdiri sendiri.
Angka itu masih ada di kepala orang, dan justru di situlah masalahnya. Judul berita masih berbunyi "model X punya berapa parameter", padahal urutan itu sudah lama tidak informatif.
Dua tahun sebelum Chinchilla, arahnya berlawanan. GPT-3 yang rilis pada 2020 memakai 175 miliar parameter, sedangkan GPT-2 dua tahun sebelumnya cuma 1,5 miliar. Selisihnya sekitar seratus kali, dan selisih kemampuan pada benchmark yang tersedia saat itu ikut sekurang-kurangnya sebesar itu. Ketika kurva performanya masih jelas naik seiring ukuran, industri punya alasan rasional untuk mengejar ukuran, karena ukuran itu berkorelasi kuat dengan hasil.
Yang Chinchilla perbaiki adalah asumsi bahwa data selalu cukup. Confidential, model 280 miliar itu punya kemampuan komputasi yang besar tapi data latihnya cuma 300 miliar token. Chinchilla menunjukkan bahwa dengan data 1,4 triliun token, model 70 miliar bisa melampauiinya. Jadi bottleneck-nya bergeser: bukan ukuran model, tapi ukuran data. Setiap lab yang sesudah itu harus ROGUE lebih banyak sumber data, dan itu mengubah hubungan biaya secara fundamental.
Yang benar-benar mahal: komputasi, bukan parameter
Parameter adalah hasil akhir, bukan bahan baku. Yang mahal adalah waktu GPU untuk mendorong setiap token melewati jaringan model, berulang kali, di setiap permintaan pengguna.
Reflection AI melatih Beam Base di klaster 6.144 kartu grafis, dengan 23,8 triliun token dari web publik dan sumber komersial. Filter khusus per bahasa pemrograman dipakai untuk membuang file berkualitas rendah. Beam Base selesai dibangun dalam waktu kurang dari empat minggu.
Tahap berikutnya adalah midtraining, untuk memperpanjang context window dan memperkuat penalaran. Tahap paling berat adalah reinforcement learning. Pada tahap ini Reflection AI menyalakan 10.000 kartu GB300 dan menjalankan 1,3 miliar sandbox reinforcement learning: lingkungan virtual tempat model mempelajari keterampilan baru.
Angka itu menjelaskan kenapa "hanya 501 miliar parameter" bukan kabar kecil. Untuk menghasilkan model itu, perusahaan menyewa perangkat keras NVIDIA lewat kontrak 6,3 miliar dolar dengan SpaceX Corp, setelah menghimpun modal di valuasi 25 miliar dolar. Laboratorium kecil sekarang butuh modal besar.
Bagaimana kemampuan sebenarnya diukur
Benchmark berhenti jadi ukuran mutlak sejak lama, tetapi pendekatan Reflection AI punya ciri tersendiri: membandingkan modelnya dengan model yang lebih besar pada tugas tertentu, sambil menghitung berapa banyak perangkat keras yang dibutuhkan masing-masing.
Klaim perusahaan: Beam menyelesaikan sebagian tugas itu lebih baik dengan antara seperempat sampai sepertiga perangkat keras yang dipakai pesaingnya.
| Model | Parameter | Sumber |
|---|---|---|
| Beam | 501 miliar | Reflection AI |
| GLM-5.2 | sekitar 751 miliar (estimasi pesaing) | Zhipu AI |
| Qwen 3.8-Max | lebih dari 2 triliun | Alibaba |
| Claude Fable 5.1 | tidak dipublikasikan | Anthropic |
Angka GLM-5.2 dihitung dari selisih yang disebut Reflection AI dalam pengumumannya, jadi itu angka estimasi yang disampaikan pesaing, bukan angka yang diverifikasi secara independen. Claude tidak menyebut jumlah parameter sama sekali, dan itu bukan hal yang langka: lab besar increasingly tidak meng|matching nomor itu lagi ke publik.
Dari dense ke mixture of experts
Model dense memproses setiap token melalui seluruh parameter. Pendekatan yang lebih hemat, mixture of experts, hanya mengaktifkan sebagian parameter untuk tiap token, sehingga sebagian bobot menjadi ahli pada jenis tugas tertentu.
GLM-5.2 dan Qwen 3.8-Max memakai pendekatan itu. Beam dilaporkan memakai bentuk yang lebih agresif, dan itulah yang memungkinkan model sebesar ini mendekati model dua kali lebih besar.
Mekanismenya tidak jelas bagi pembaca awam. Pada model dense, setiap parameter berkontribusi ke setiap jawaban. Pada mixture of experts, sebuah router memilih kelompok kecil parameter untuk setiap token. Konsekuensinya, model dengan parameter lebih sedikit bisa punya kapasitas total lebih besar tanpa membayar biaya komputasi penuh setiap kali.
Apa yang belum dibuktikan Beam
Beam adalah model open source pertama dari startup Amerika Serikat yang menunjukkan performa setara atau lebih baik di ekosistem yang sampai saat ini didominasi perusahaan Tiongkok. Secara simbolik itu penting.
Tapi batasnya jelas. Reflection AI memakai 1,3 miliar sandbox untuk reinforcement learning, dan sebagian besar laboratorium kecil tidak punya akses ke GPU sebanyak itu. Kemampuan teknis model ini terikat langsung pada skala permodalan yang tidak bisa ditiru dengan menyalin resepnya.
Catatan lain pada klaim open source: bobot Beam belum dirilis. Perusahaan menjalankan program akses awal lebih dulu, danolik menjadwalkan rilis bobot, dokumentasi, serta alat fine tuning pada akhir Oktober.
Yang perlu dipantau
Tren terbaru menunjuk arah yang jelas. DeepSeek V4.1 Flash, yang rilis 10 September 2026, Nilainya 81,1 pada LiveBench, sementara skor Anthropic 83,4. Jarak sekitar 3 persen itu pernah sekitar 15 persen pada awal 2026 dan 9 persen pada Mei.
Yang bergerak adalah jaraknya, bukan peringkatnya. Peringkat model berubah setiap bulan; yang tidak berubah adalah alasan mengapa peringkat itu berubah: data yang lebih baik, arsitektur yang lebih hemat, dan komputasi yang lebih terarah. Putaran terbaru memakai perkakas yang paling murah, model kecil makin mendekati yang besar, dan sisa jarak yang tersisa makin sulit ditebak.
Perbandingan 501 miliar versus 2 triliun adalah bagian yang paling menarik untuk ditulis, tapi bukan bagian yang paling penting. Bagian pentingnya adalah bukti bahwa angka itu sudah berhenti jadi ukuran.
Analisis: kenapa angka parameter berhenti jadi ukuran
Tiga hal membuat parameter berhenti informatif. Pertama, ukuran model tumbuh lebih cepat daripada jumlah data yang tersedia untuk melatihnya, sehingga sebagian besar kapasitas itu menganggur. Kedua, arsitektur mixture of experts membuat sebagian besar parameter hanya aktif sesekali, jadi parameter total bukan lagi ukuran kerja nyata. Ketiga, reinforcement learning menggeser sebagian besar peningkatan kemampuan ke tahap setelah pretraining, di mana ukuran model hampir tidak menjelaskan apa yang terjadi.
Efeknya pada industri bisa diringkas jadi satu kalimat: yang diukur sekarang adalah berapa banyak komputasi yang dibutuhkan untuk mendapat jumlah kemampuan tertentu, bukan berapa banyak parameter yang tersimpan di dalam model.
| Ukuran | Yang dijawabnya | Seberapa berguna |
|---|---|---|
| Jumlah parameter | Berapa besar wadahnya | lemah |
| Rasio parameter per GPU | Berapa mahal melatihnya | sedang |
| Jumlah token dataset | Apa yang sebenarnya dipelajari | kuat |
| Iterasi reinforcement learning | Apakah model bisa mengerjakan tugas | kuat |
Apa artinya buat pembaca di Indonesia
Model yang lebih murah per tokennya berarti satu hal konkret: biaya menjalankan model sendiri di server kecil makin masuk akal. Kalau sebuah model bisa dilayani tanpa bergantung pada API luar, data yang diproses tidak perlu keluar dari perangkat atau dari negara.
Untuk pengembang kecil dan universitas yang selama ini memakai kredit API, itu mengubah hitungan dari biaya langganan menjadi biaya satu kali. Model open source seperti Beam membuat bobotnya bisa diunduh, diukur ulang, dan diaudit. Tidak ada yang bisa diubah tanpa terlihat. Kebalikan dari model tertutup yang hanya bisa diterima apa adanya karena dokumentasinya minim.
Tapi klaim hemat perangkat keras punya harga yang sering luput: kualitasnya bergantung pada data yang dipakai. Model open source yang dilatih pada data web terbuka mewarisi bias web terbuka itu, termasuk untuk bahasa yang kurang terwakili. Klaim hemat komputasi tidak otomatis berarti klaim netralitas.
Tiga hal yang perlu diperhatikan sebelum memilih model yang dilayani sendiri:
- Biaya perangkat keras. Model 501 miliar parameter dengan mixture of experts mungkin muat di satu workstation, sedangkan model dense 2 triliun jelas tidak.
- Kebutuhan RAM dan VRAM. Angka parameter menentukan memori minimal, dan mixture of experts bisa meredam lonjakan itu karena tidak semua parameter aktif bersamaan.
- Kepatuhan pada lisensi. Model open source datang dengan syarat penggunaan yang berbeda-beda, dan sebagian data latih yang sama sekali tidak boleh dipakai untuk tujuan tertentu.
Ukuran yang masih layak dipantau
Kalau jumlah parameter tidak lagi jadi ukuran, tiga angka lain masih layak dipantau. Pertama, rasio parameter terhadap jumlah GPU yang dipakai, karena itu yang menentukan biaya pelatihan. Kedua, ukuran dataset training dalam token, karena itu yang menentukan apa yang sebenarnya dipelajari model. Ketiga, jumlah iterasi reinforcement learning, karena itulah tahap yang mengubah model statis jadi model yang bisa mengerjakan tugas berulang.
Beam melaporkan keempat-empat-nya: 501 miliar parameter, 23,8 triliun token, 10.000 GPU pada tahap RL, dan 1,3 miliar sandbox. Angka-angka itu membuat perbandingannya bisa diperiksa, bukan sekadar klaim perusahaan lain. Inilah yang akan menarik bila model berikutnya meluncur dengan angka yang lebih murah lagi.
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
- Ciri Tulisan AICari pola generik di tulisan Anda sendiri. Bukan detektor AI.
- Penulis Ulang Teks AITulis ulang teks menjadi bahasa yang lebih natural dan mudah dibaca dengan mempertahankan makna.
- Ringkasan Teks AIBuat ringkasan abstraktif secara lokal di browser dengan AI.
- Air & Listrik Data Center AIPerkirakan air dan listrik yang benar-benar dibutuhkan data center.
Bagikan artikel ini
Bagikan ke
Artikel terkait

7 Oktober 2026
AI Agent yang Bisa Buka Website Sendiri, dan Kontrol yang Gagal
899 permintaan AI ke situs pemerintah Kanada dan pembatalan rilis GPT-6.1 Astra. Akar masalahnya bukan modelnya, tapi kontrol di sekitarnya.

7 Oktober 2026
Kenapa Negara Mulai Bayar Model Sendiri, dan Kenapa Sulit
Korea Selatan siapkan 3,5 miliar dolar untuk model AI nasional. Empat hal yang harus benar sebelum program seperti itu berhasil.

7 Oktober 2026
Harga Token AI Turun, Tapi Tagihanmu Naik: Kenapa
Gemini 4 Argon dijual 2 dolar per juta token input, setengah dari Claude Opus 5.5. Kenapa harga per token turun sementara total tagihan naik.



