Harga Token AI Turun, Tapi Tagihanmu Naik: Kenapa
Terbit 7 Oktober 2026
Gemini 4 Argon dijual 2 dolar per juta token input, setengah dari Claude Opus 5.5. Kenapa harga per token turun sementara total tagihan naik.

Pada 30 September 2026, Google launching Gemini 4 Argon dengan harga permulaan 2 dolar per juta token input dan 10 dolar per juta token output. Itu sekitar setengah dari Claude Opus 5.5, dan aksesnya masih sempit: cyber defender tersertifikasi dalam Fairwind Program milik Google, lalu pelanggan enterprise.
Bagi sebagian besar pengembang itu seluruh kisahnya, dan harga yang murah. Tapi itu bukan angka yang menentukan sebenarnya yang dibayar perusahaan. Harga token turun karena ada mekanisme yang tidak akan berhenti. Yang tidak akan berhenti adalah tagihannya.
Apa yang sebenarnya menentukan harga satu token
Harga jual API tidak ditetapkan dari biaya pelatihan, melainkan dari empat hal yang saling berkaitan.
Pertama, komputasi yang dipakai per token. Model dengan arsitektur mixture of experts tidak memakai seluruh parameter-nya pada setiap token, jadi biaya per token turun walaupun jumlah parameter total tetap sama.
Kedua, kualitas perangkat keras. Chip generasi terbaru memproses lebih banyak token per dolar daripada chip yang digantikan, jadi distributor yang memegang chip baru bisa menawarkan harga lebih murah tanpa mengubah model sama sekali.
Ketiga, kuantisasi. Model yang bobotnya dipangkas dari 16 bit ke 8 bit atau 4 bit membutuhkan lebih sedikit memori dan lebih sedikit transfer data per token. Kemampuan model turun sedikit, tapi biaya turun drastis.
Keempat, dan ini yang paling jarang disebut, persaingan. Ketika beberapa laboratorium mengerjakan model dengan kemampuan setara, harga menjadi alat transaksi. Margin dikorbankan demi volume.
Kenapa tagihan tetap naik
Ini konsekuensi yang hampir tidak bisa dihindari dan jarang dibahas terbuka. Kalau harga per token turun 50 persen, pekerjaan yang sama hanya menghasilkan biaya 25 persen dari sebelumnya. Jadi siapa pun yang butuh dua kali lebih banyak token akan melihat tagihan naik.
Kebutuhan token bertambah karena tiga hal.
Pertama, agent. Satu permintaan yang dulu butuh 1.000 token sekarang bisa menjalankan percakapan panjang dengan beberapa model berbeda, masing-masing dengan konteks sendiri. Konteks diproses berulang kali di setiap putaran.
Kedua, context window yang membesar. Gemini 4 Argon menaikkan batas keluarannya dari 64.000 menjadi 1 juta token. Batas yang lebih besar itu sendiri menciptakan permintaan: kalau model bisa menerima 1 juta token, pengguna akan mengisinya.
Ketiga, reasoning yang lebih panjang. Model yang berpikir lebih lama sebelum menjawab memakai lebih banyak token untuk jawaban yang sama. Itu pilihan, bukan cacat, tapi biayanya ada di tempat yang tidak terlihat.
Sejarah singkat harga token
Harga API modern lahir sekitar 2020, ketika model bahasa masuk dari riset ke produk. Dua tahun pertama, harga dihitung untuk menutup biaya GPU, dan tidak ada yang bisa dilakukan klien selain menerima.
Antara 2022 dan 2024 terjadi pembalikan. Model yang lebih kecil mulai cukup baik untuk sebagian besar tugas, dan kuantisasi 4 bit berubah dari eksperimen menjadi default di banyak layanan. Harga turun beberapa kali lipat dalam dua tahun.
Mulai 2025 polanya bergeser lagi. Persaingan masuk ke model frontier sendiri, bukan cuma model murah. Google, OpenAI, dan Anthropic mulai menjual model dengan kemampuan yang setara tetapi harga lebih rendah. Penurunan yang terjadi sekarang berbeda sifatnya: bukan penghematan teknis, tapi keputusan bisnis untuk mengambil pangsa pasar.
Angka yang belum bisa diprediksi
Tidak ada yang bisa memperkirakan harga token tiga tahun ke depan dengan jujur. Yang bisa disebutkan hanya arahnya: turun. Kecepatannya tidak bisa, karena bergantung pada hal yang tidak terlihat, termasuk apakah ada terobosan arsitektur, apakah kuantisasi bergerak lebih jauh, dan apakah perangkat keras membaik dengan laju yang sama seperti beberapa tahun terakhir.
Rekayasa akan membuat token lebih murah, tapi ada batas fisik. Pada titik tertentu, waktu yang dibutuhkan untuk memindahkan satu token melalui memori perangkat keras menjadi batas yang tidak bisa dilewati dengan perangkat yang sekarang ada.
Angka yang bisa dihitung sendiri
Bandingkan harga per juta token untuk model frontier dengan harga yang dipublikasikan:
| Model | Input per 1 juta token | Output per 1 juta token |
|---|---|---|
| Gemini 4 Argon | $2 | $10 |
| GPT-6.1 Sol | $2 | $10 |
| Claude Opus 5.5 | $4 | $20 |
Angka Claude dihitung dari pernyataan Google bahwa Argon berharga sekitar setengah harganya, jadi itu angka yang belum dikonfirmasi langsung. Angka untuk Gemini dan GPT sudah dipublikasikan.
Sekarang hitung sendiri biaya nyata. Sebuah tim yang memproses 50 miliar token input per bulan dengan model seharga $2 per juta akan membayar $100.000 per bulan. Kalau token-nya naik menjadi 250 miliar -- dan itu akan terjadi begitu agent masuk ke alur kerja harian -- tagihannya menjadi $500.000.
Harga per token tidak naik secepat tagihan. Tagihan naik karena volume naik, dan volume naik karena kemampuannya naik.
Apa artinya buat pembaca di Indonesia
Biaya API adalah salah satu komponen paling nyata dalam membangun produk. Untuk pembaca di Indonesia, hitungannya lebih terbuka karena sebagian besar pengguna berbahasa Indonesia, dan sebagian besar model frontier dilatih dengan data yang didominasi bahasa Inggris.
Dua konsekuensi praktis. Pertama, model dengan kemampuan sama bisa biaya berbeda jauh kalau dilatih lebih baik pada bahasa target. Kedua, kuantisasi yang disetel untuk model bahasa Inggris bisa merusak secara tidak proporsional pada teks non-Inggris, karena tokenisasi memotong kata dengan cara berbeda.
Kalau sebuah tim sedang memilih model untuk aplikasi berbahasa Indonesia, angka yang perlu dibandingkan bukan cuma harga per juta token, tapi harga per jawaban yang benar. Model yang lebih murah tetapi gagal memahami pertanyaan dalam bahasa sendiri berakhir lebih mahal karena harus diulang.
Tiga hal yang bisa dilakukan sekarang untuk menekan biaya:
- Cache jawaban yang sering muncul. Banyak pertanyaan itu identik. Cache mengubah permintaan berulang menjadi nol token.
- Potong konteks yang tidak dipakai. Rata-rata aplikasi mengirim dokumen yang sebagian besar tidak pernah dibaca model. Memangkas sebelum dikirim langsung mengurangi tagihan.
- Pilih model per tugas. Tidak semua tugas butuh model frontier. Routing tugas sederhana ke model kecil menghasilkan penghematan besar.
Analisis: apakah penurunan harga ini akan terus berlanjut
Tiga hal menentukan apakah mekanisme ini masih punya bensin.
Pertama, efisiensi hardware. Peningkatan token per dolar dari satu generasi chip ke generasi berikutnya sudah melambat dari waktu ke waktu. Kalau responsnya asal stabil, price per token berhenti turun di titik tertentu dan yang tersisa hanya persaingan margin.
Kedua, batas kuantisasi. Memangkas bobot dari 8 bit ke 4 bit memberi penghematan besar. Setelah itu, penghematan berikutnya jauh lebih kecil, dan kualitas yang hilang jauh lebih terasa. Efek praktis yang masih ada tinggal sedikit.
Ketiga, apakah ada model bisnis baru. Sekarang ini hampir semua permintaan dibayar per token. Model lain seperti lisensi per perangkat, atau iklan yang dibayar pihak lain, akan mengubah insentif secara mendasar.
Kesimpulannya: harga token akan turun lagi, tapi lajunya tidak akan secepat tahun 2024 dan 2025. Dan selama volume naik lebih cepat daripada harga turun, tagihan per pengguna akan naik juga.
| Faktor | Remaining headroom | Arah harga |
|---|---|---|
| Kuantisasi 8 bit ke 4 bit | besar | turun |
| Kuantisasi 4 bit ke 2 bit | kecil | turun |
| Efisiensi chip generasi berikutnya | menyempit | turun |
| Persaingan antar model | tidak terbatas | turun |
Distribusi itu sengaja dirancang begitu
Pelanggan tidak membeli token. Mereka membeli kemampuan menyelesaikan tugas. Harga yang sama dihitung tiga kali di bawah ini, dengan asumsi 100 juta token per bulan per pengguna:
| Kebutuhan | Harga per token | Tagihan per pengguna |
|---|---|---|
| 50 juta token, model murah | $2 per juta | $100 per bulan |
| 10 juta token, model frontier | $2 per juta | $20 per bulan |
| 200 juta token, model frontier | $10 per juta | $2.000 per bulan |
Perhatikan arahnya. Pengguna paling aktif, yang paling sering memakai kemampuan termahal, membayar paling banyak. Gradien inilah yang menjaga insentif vendor tetap benar: semakin bagus modelnya, semakin banyak orang membutuhkannya.
Mengapa pada akhirnya semua orang bisa memakai ini
Ada dua hal yang bisa menghentikan kenaikan tagihan. Yang pertama adalah model yang cukup bagus untuk pengguna median. Kalau model kelas menengah mendekati 90 persen kemampuan frontier, sebagian besar pengguna tidak akan melihat perbedaan, dan mayoritas akan pindah ke sana.
Yang kedua adalah efisiensi di sisi pengguna. Prompt yang lebih pendek, cache, dan pemrosesan batch menurunkan jumlah token yang dibutuhkan untuk tugas yang sama. Perusahaan besar sudah melakukan ini; orang kecil belum.
Kalau keduanya terjadi, harga per token akan turun lebih jauh, sementara volume akan naik lebih lambat. Itulah skenario yang membuat total tagihan membaik. Tapi perlu beberapa tahun, dan tidak ada yang bisa mempercepatnya.
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
Bagikan artikel ini
Bagikan ke
Artikel terkait

7 Oktober 2026
AI Agent yang Bisa Buka Website Sendiri, dan Kontrol yang Gagal
899 permintaan AI ke situs pemerintah Kanada dan pembatalan rilis GPT-6.1 Astra. Akar masalahnya bukan modelnya, tapi kontrol di sekitarnya.

7 Oktober 2026
501 Miliar Parameter Menang Lawan 2 Triliun, Tapi Bukan Itu
Reflection AI rilis Beam dengan 501 miliar parameter dan mengalahkan model 2 triliun di tugas tertentu. Yang menentukan bukan angkanya.

7 Oktober 2026
Kenapa Negara Mulai Bayar Model Sendiri, dan Kenapa Sulit
Korea Selatan siapkan 3,5 miliar dolar untuk model AI nasional. Empat hal yang harus benar sebelum program seperti itu berhasil.



