Kimi K2.6: Satu Triliun Parameter, Tapi Aktif Cuma 32B
Terbit 10 Oktober 2026
Kimi K2.6 membawa 1 triliun parameter tapi hanya mengaktifkan 32 miliar per token. Itulah rahasia MoE yang membuatnya murah seperti model kecil, sambil tetap masuk benchmark teratas.

Rahasia di Balik 384 Ahli
Kimi K2.6 punya 384 expert sub-network. Setiap token yang masuk melewati router, semacam pelatih sepakbola yang melihat lawan lalu memencet tombol substitusi. Hanya 8 expert yang dipilih — ditambah 1 shared expert yang selalu hadir — untuk tiap token. Sisanya tidak ikut komputasi.
Hasilnya? Komputasi per token bisa ditekan drastis, sekitar seperlima-belas model padat dengan total parameter sama. Itu seperti punya perpustakaan nasional di garasi, tapi saat ditanya, kamu cuma mengambil buku yang relevan dari 384 lorong. Nggak ada yang maksa bawa semua buku untuk jawab satu pertanyaan.
Angka Benchmark yang Melawan Ekspektasi
Model open-weight biasanya jadi bahan candaan. Dulu kita menganggap cuma bisa dipakai buat tugas ringan. K2.6 menampar anggapan itu. Dalam benchmark HLE with tools, ia mencetak 54.0, melewati kakaknya K2.5 yang di 50.2, dan sedikit di atas perkiraan GPT-5.4 maupun Claude Opus 4.6. Di SWE-Bench Pro ia 58.6, di SWE-Bench Multilingual 76.7 — bicara soal coding multi-bahasa — dan BrowseComp kembali ke 83.2, lompatan dari 60.2. Untuk konteks: BrowseComp adalah tes arah website — berapa lama model bisa menjelajahi web? K2.5 cuma bisa cukup lama, K2.6 bisa jalan berjam-jam.
Yang menarik, benchmark GPT-5.4 dan Claude Opus 4.6 di tabel AI Daily bersifat proyeksi mengingat dataset publik mereka belum rilis persis. Angka K2.6 adalah sumber primer mereka. Gunakan tabel sebagai peta, bukan kado bakar sate.
$0,60 per Juta Token: Harga Seperti Warteg
Angka paling menggoda bukan 1 triliun, tapi $0,60 per juta token input. Itu kira-kira seperenam harga alternatif closed sebanding. Buat pemilik startup yang mengukur biaya token sebagai biaya makan, K2.6 terasa seperti warteg favorit: penuh gizi, murah, nggak bikin kantongbolong.
Kenapa bisa murah? Karena aktifnya cuma 32 miliar. Saat satu token lewat, hanya sesruh daya komputasi 1 triliun yang benar-benar disentuh. Saya kira seperti memesan pizza kecil dari dapur besar: kamu ngga usaha membuat adonan semua ukuran.
Mampu Menangani 300 Agen Sekaligus
Yang benar-benar membedakan K2.6 dari model open-weight generasi sebelumnya adalah skalanya di level agen. Ia bisa menjalankan 300 sub-agent paralel di satu proyek, masing-masing punya context sendiri, total 4.000 panggilan alat, dalam waktu lebih dari 12 jam. Itu bukan tabrakan prompt tunggal. Itu arsitektur orkestrasi.
Cara paling jelas membayangkan: di sini agen tidak "berdiri sendiri". Setiap sub-agent itu seperti juru masak di dapur restoran sibuk. Masing-masing punya kompor sendiri, alat sendiri, bahan sendiri. Sang koki utama (router/orchestrator) mengoordinasikan. Satu gagal? Dia kirim instruksi ulang, bukan panik lalu angkat tangan.
Expert Collapse: Musuh Utama MoE
Masalah klasik MoE adalah expert collapse: semua token lewat satu dua expert yang sama, seperti pemain sepakbola yang harus merangkap tiga posisi. Tim jadi pincang. Kimi menambahkan dua regulariser — routing loss dan load balancing loss — supaya 384 expert merata membawa beban. Analoginya: router yang sehat itu seperti wasit yang adil, membagikan bola merata ke semua lini.Kalau semua bola dikirim ke striker, pertandingan jadi boseg.
Lisensi MIT: Buka Pintu untuk Komersial
K2.6 dilisensikan Modified MIT. Artinya kamu boleh pakai secara komersial, modifikasi berkali-kali, dan tidak harus kirim royalti ke Moonshot per-token. DeepSeek dan Qwen akan merasakan efeknya: tekanan kompetitif mendorong rilis MoE open-weight lebih agresif. Itu lah flywheel: satu pemain berhasil menyaingi closed-source dengan harga seperenam, pemain closed harus menurunkan harga atau rilis lebih inovatif. Pemenggalan akhirnya, pengguna menang.
Apa Artinya Buat Kamu?
Sepuluh tahun lalu, membangun AI sendiri adalah main membuat roket di dapur. Sekarang, K2.6 memberikan bahan roket — tapi bahan itu berupa model 1 triliun parameter yang cukup dibangun di atas beberapa chip GPU — dan harga seperlima belas dari bekasnya. Untuk developer yang sudah lama ingin self-host tapi dibataskan harga, K2.6 melepas ikatan itu.
Tapi tetap diingat: "trillion parameters" sekarang harus selalu diikuti pertanyaan, "...tapi yang aktif berapa?". Kalau kamu tidak bisa menyebut angka aktif, mungkin kamu sedang melihat brosur, bukan spesifikasi.
| Metrik | Sebelum | Setelah |
|---|---|---|
| Endpoint aktif | 1 dokumen | Ratusan sub-agen |
| Biaya per token | Tinggi | $0,60 / 1 juta |
| Waktu fokus read | Satu sesi | 4.000 panggilan |
Angka di tabel itu sengaja kami kumpulkan supaya tidak ada debat berputar-putar. Kalau Anda bilang model lebih murah tanpa menunjukkan biaya per juta token, audiens Anda hanya mendengar slogan. Untuk perluasan analisis, bandingkan saja: dengan titik-acuan di atas, satu pekerjaan kecil yang biasa dijalankan sehari-hari bisa dipersingkat waktunya berkali-kali lipat. Di sisi lain, efisiensi aktif itu jauh lebih masuk akal ketimbang membayar untuk diam saja. Itulah mengapa rilis terbaru berpindah dari adu bobot model ke cara mengatur banyak pelaut sekaligus -- setiap sub-agen diberi konteksnya sendiri, lalu hasilnya dicek lagi sebelum pulang. Anda akan melihat hasil yang tidak naik-turun, dan pada akhirnya itulah parameter yang paling hidup di prod. Relevansi di lapangan: ketika tarif per token turun berkali-kali, proyek yang tadinya ditunda satu kuartal panjang bisa dijalankan hanya dengan penggeserannya; ketika parsialisasi tugas bisa di-orkestrasi, Anda tidak lagi menunggu satu jendela konteks besar, tetapi memakai banyak jendela kecil yang bekerja paralel. Kombinasi dua poin itulah tambahan yang membuat rilis ini layak dicatat, bukan sekadar soal nama rilisnya.
Catatan Soal Otoritas
Saya perlu jujur: baris GPT-5.4 dan Claude Opus 4.6 di sini adalah perkiraan, bukan klaim resmi. Angka primer datang dari Kimi K2.6 — HLE 54.0, SWE-Bench Pro 58.6, BrowseComp 83.2, Toolathlon 50.0, dan harga $0,60 per juta token. Kalau mau angka persis untuk kompetitor, saya bisa cari paper resmi mereka. Untuk sekarang, gunakan itu sebagai pijakan diskusi, bukan vonis.
Ekspektasi yang Wajar
Satu hal yang penting dicatat: rilis seperti Kimi K2.6 tidak mengubah fakta bahwa Anda tetap butuh infrastruktur. Model open-weight bisa diunduh, tetapi menjalankan 1 triliun parameter aktif meski hanya 32 miliar yang dipakai per token tetap membutuhkan memory terdistribusi, jaringan antar-node yang cepat, dan tim ops yang paham queue. Kalau infrastruktur Anda seperti jalur tol padat di jam pulang, latency bisa melompat meski komputasinya ringan. Pengaruh nyata K2.6 muncul saat Anda sudah punya mesin GPU layak dan ingin menjalankan agen otomatis semalaman -- bukan menyulap garasi jadi pabrik mandiri dalam semalam.
Minggu lalu, seorang teman langsung menghitung biaya server yang sudah ia bayar untuk inference bulan lalu. Angka itu buatnya seperti tiba-tiba nemu warung kopi enak yang harga kopinya sama dengan teh celup di minimarket. Perhitungannya bukan baru, tapi angkanya bikin kebiasaan berubah.
Contoh praktis: jika situs berita seperti ini ingin menyimpan ringkasan 10.000 artikel di Sanity dan mencari yang paling relevan tiap pembaca, tidak praktis memanggil model depan saat setiap klik. Tapi dengan mengarahkan 85% query ke model open-weight murah seperti K2.6 dan menyimpan hasil teratas di cache, biayanya mungkin terjun dari puluhan dolar per bulan menjadi sekitar satu dolar sehari. Selisih kecil itu yang sering membedakan produk layak skala dari yang cuma gagal di panel demo.
Kalau pun kamu tidak sedang berencana menjalankan 1 triliun parameter semalam, ada satu pelajaran yang tetap berlaku: jangan pernah membandingkan model hanya dari total parameter. Tanya tiga hal dulu -- berapa yang aktif? berapa biayanya? dan apakah ia bisa dibaca di laptop yang kamu punya sekarang? Untuk kebanyakan tim, K2.6 bukan bahan canda atau selimut pilu, melainkan pilihan yang masuk akal untuk tahun depan.
Kalau dari tabel di atas, satu benchmark mana yang kalau tiba-tiba jadi murah dan bisa kamu jalankan di kantor sendiri bakal bikin kerja jadi berubah?
Efek Samping yang Perlu Diwaspadai
Tidak ada bunga-bunga cantik yang sempurna, juga K2.6. Router yang pintar itu beban tambahan: setiap token harus "dipilih" ahli mana yang akan memprosesnya, lalu output delapan expert dikompresi kembali. Di infrastruktur terdistribusi, proses memilih itu berupa komunikasi antar-GPU. Kalau infrastrukturnya buruk, latency bisa naik walaupun komputasinya ringan. Itulah sebabnya perusahaan yang ingin self-host butuh jaringan antar-node yang layak -- bukan cuma GPU yang tiba-tiba banyak.
Satu hal lagi: "aktif cuma 32 miliar" tidak berarti model ini pintar hanya 32 miliar. Seperti kulkas besar, semua butuh listrik kalau pintunya dibuka terus. Tapi setiap kali hanya 32 miliar yang aktif, berarti tokennya tidak menjemput biaya penuh dari rak 1 triliun. Itu ya.
| Hal | Angka | Sumber |
|---|---|---|
| HLE with tools | 54.0 | Moonshot |
| BrowseComp | 83.2 | Moonshot |
| Harga input | $0.60/1M token | Moonshot |
Konteks tabel ini penting: omset per input sudah turun ke tingkat klasik, tidak lagi berada di tier premium closed. Itu mengubah kalkulasi ekonomi -- proyeksi inference murah bukan lagi mimpi, tapi baseline baru.
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
Bagikan artikel ini
Bagikan ke
Artikel terkait

10 Oktober 2026
Opus 4.8: Frontier AI Bukan Parameter, Tapi Orchestrasi
Claude Opus 4.8 muncul tanpa angka parameter baru. Dayanya pindah ke ratusan agen yang jalan bareng. Itu sinyal: frontier AI sekarang dihukum di cara kerjanya, bukan ukurannya.

9 Oktober 2026
Kenapa Bahasa Non-Inggris Lebih Mahal: Rahasia di Balik Tokenizer
Satu tokenizer bisa membuat kata yang sama menjadi 5 token atau 15 token. Bedanya menentukan biaya API dan panjang konteks yang kamu punya.

8 Oktober 2026
Satu Model atau Banyak Model: Apa Bedanya Arsitektur Multimodal
Model unified memproses teks, gambar, dan audio dalam satu jaringan. Model pipeline menyambung beberapa model terpisah. Bedanya bukan cuma teknis.






