Kenapa Gambar AI Pakai Diffusion, Tapi Teks Pakai Autoregressive
Terbit 8 Oktober 2026
Dua cara membuat gambar dari noise punya akhir yang sama tapi proses yang berlawanan. Penjelasan kenapa pilihan ini berubah sejak 2015.

Model bahasa membuat teks dengan cara yang jelas: token demi token, dari kiri ke kanan, dan setiap token dibangun di atas semua token sebelumnya. Model gambar tidak bisa begitu. Gambar tidak punya urutan natural -- tidak ada "kiri ke kanan" di dalam foto kucing yang sedang duduk.
Karena itu jalur yang berlawanan diambil: model gambar mulai dari kebisingan penuh dan berulang kali menghapus derau itu, sedikit demi sedikit, sampai tersisa gambar. Namathereumnya adalah diffusion, dari istilah fisika yang dilakukan pada 2015.
Dua arah yang berlawanan
Perbedaannya bisa dijelaskan dalam satu tabel, dan tabel itu menjelaskan hampir semua konsekuensi teknis yangbsdividing keduanya.
| Model bahasa | Model gambar | |
|---|---|---|
| Mulai dari | teks kosong | noise penuh |
| Arah | menambahkan token | menghapus noise |
| Sifat | irreversible per token | bisa dibalik tiap langkah |
| Istilah teknis | autoregressive | diffusion |
Baris ketiga adalah kuncinya. Menulis token bersifat irreversible: begitu "sek" ditulis, "s" tidak mungkin menggantikannya. Sebaliknya, menambahkan lapisan noise ke gambar bisa dibalik -- dan pembalikan itulah yang membuat seluruh algoritma mungkin ada.
Kenapa pembalikan itu penting
Algoritma denoising diffusion probabilistic model, yang mapan pada 2020, bekerja seperti ini. Ambil gambar latih asli. Tambahkan noise secara bertahap sampai gambar itu tidak bisa dibedakan dari noise murni. Sekarang modelnya punya dua proses: satu proses membuat gambar jadi noise, satu proses belajar untuk membalikannya.
Lalu saat membuat gambar baru: mulai dari noise murni, jalankan proses pembalik beberapa kali, dan di setiap langkah prediksi noise yang ada lalu kurangi. Setelah tiga puluh sampai seratus langkah, yang tersisa adalah gambar.
Asimetri itulah yang membuatnya bekerja. Training butuh proses maju yang menghancurkan gambar, karena tidak ada proses mundur. Inference menjalankan kebalikannya, karena pada titik itu proses mundur itu sudah dipelajari.
Angka yang menjelaskan kenapa ini berubah cepat
Tiga angka dari 2026 menunjukkan arahnya, dan ketiganya berasal dari pengujian perusahaan masing-masing sehingga statusnya perlu diperhatikan.
Catatan status: belum terverifikasi. Ketiga angka di bagian ini adalah klaim perusahaan atas pengujiannya sendiri. Belum ada pihak ketiga yang mengulang pengukuran ini, dan angka bisa berbeda pada konfigurasi, resolusi, atau perangkat yang berbeda.
- Lima belas kali empat speedup. Video DeltaNet menyelesaikan denoising untuk video 14,3 detik pada 768p dalam 6,70 detik memakai delapan GPU B200, dibandingkan baseline 50 langkah yang butuh 91 detik pada jumlah GPU yang sama. Percepatannya 14,5 kali.
- Sembilan puluh sembilan menjadi delapan langkah. Varian distilasi Rho-1 memangkas langkah denoising dengan rasio lebih dari sepuluh banding satu.
- Pemangkasan komunikasi 75 persen. Sparse Sequence Parallelism memangkas volume komunikasi antar rank sebesar 75 persen dan menurunkan langkah komunikasi per blok dari empat menjadi satu.
Tiga angka itu berasal dari tiga masalah berbeda: attention yang terlalu mahal, jumlah langkah yang terlalu banyak, dan komunikasi antar perangkat yang menumpuk. Tidak satu pun diselesaikan dengan membuat model lebih besar.
Itu polanya yang menarik. Sejak 2022, perbaikan datang dari arsitektur dan dari pipeline penyajian, bukan dari parameter count. Persis kebalikan dari dua tahun pertama ledakan model bahasa.
Sejarah singkat: kenapa jalur dibalik
Tahun 2015, penelitian diffusion dengan denoising terfokus pada simulasi fisika: memodelkan bagaimana partikel bergerak, lalu belajar membalikannya. Para peneliti awalnya datang dari bidang fisika, bukan dari komputer.
Baru pada 2020, pendekatan itu dipindahkan ke gambar, dan hasilnya mengejutkan. GAN pada saat itu masih kesulitan menghasilkan gambar yang benar-benar tajam, sementara diffusion menghasilkan gambar yang langsung bisa dipakai, berada di atas. GAN membuat gambar dalam satu lintasan terbalik; diffusion membuat gambar dengan berulang kali memperbaiki.
Dua tahun kemudian, Stable Diffusion membuat pendekatan ini mudah diakses. Dan dari situ jalan yang sama untuk video: yang perlu diubah bukan idenya, tapi jumlah frame yang harus konsisten.
Dan yang membuat video menjadi sulit
Video bukan satu gambar, tapi ratusan gambar yang harus konsisten satu sama lain. Noise yang dihapus di frame pertama harus menghasilkan gerakan yang tetap koheren sampai frame terakhir.
Inilah alasan video generatif jauh lebih lambat daripada gambar. Di JoyAI-Video-Edit, pipeline-nya mencapai 30 frame per detik pada resolusi 720x1280, dan itu dicapai lewat empat perubahan spesifik: desain autoregressive, optimasi horizon panjang, inferensi dengan keadaan KV terbatas, dan penjadwalan yang mengutamakan decode.
Tiga mekanisme di situ bekerja bersama. Yang pertama membuat frame demi frame secara berurutan alih-alih sekaligus. Yang kedua mencegah error menumpuk; video yang dibangkitkan tanpa ini akan berubah warna setelah beberapa detik. Yang ketiga membatasi berapa banyak state yang harus diingat model.
Dari denoising ke flow matching
Algoritma 2020 punya masalah praktis: butuh terlalu banyak langkah. Setiap langkah adalah penghitungan penuh atas seluruh jaringan, dan tiga puluh langkah sudah terasa lama.
Flow matching menggantinya. Alih-alih menghapus noise sedikit demi sedikit, model langsung memprediksi kecepatan perubahan antara noise dan gambar. Satu langkah berarti satu pembaruan besar, bukan banyak pembaruan kecil.
Efeknya terlihat langsung pada angka. Reka melaporkan varian hasil distilasi Rho-1 memangkas denoising dari 99 langkah menjadi 8, dan klaimnya hasil klip 5,3 detik dalam waktu sekitar satu detik. Angka itu berasal dari pengujian perusahaan sendiri, jadi harus dibaca sebagai klaim, bukan sebagai hasil yang sudah diverifikasi pihak ketiga.
Delapan langkah versus sembilan puluh sembilan adalah selisih satu orde besaran. Dan inilah yang membuat video generatif bergerak dari demo laboratory menjadi produk.
Arsitektur video terbaru: dua jalur, satu context
Satu regulator framework todavía lebih menarik. Vega memisahkan dua tugas yang biasanya bercampur.
Autoregressive transformer, yang berbasis Qwen2.5-3B, memperlakukan semua input sebagai token diskret, termasuk gambar lewat vision tokenizer yang memetakan frame ke kosakata 65.536 token. Transformer itu tidak menghasilkan gambar; ia menghasilkan token semantik yang menjelaskan isi dan gerakan.
Lalu diffusion decoder yang berbasis Wan2.1-1.3B yang benar-benar merender piksel. Pemisahan itu ada untuk alasan: satu jalur membaca dan menulis dalam representasi yang sama dan menjaga hasil tetap koheren, sedangkan jalur lain merender di ruang tempat detail tinggal.
Hasilnya 82,58 pada VBench, dengan skor semantik 82,35 -- angka yang dilaporkan penulisnya sendiri, jadi perlakukan sebagai klaim yang belum diverifikasi independen.
Apa artinya buat pembaca di Indonesia
Bagi yang biasanya memakai gambar AI dari server, ada satu hal yang layak disadari: biaya dan hak cipta bukan satu masalah.
Perubahan dari 99 langkah ke 8 langkah menurunkan biaya komputasi secara langsung, karena biaya video generatif hampir sepenuhnya didominasi jumlah lintasan denoising. Model yang tadinya butuh beberapa GPU sekarang bisa ditangani oleh satu workstation. Itu yang membuat tool kecil dan aplikasi lokal untuk video jadi mungkin.
Sudut yang lebih penting untuk pembaca di Indonesia adalah bahasa prompt. Diffusion membaca prompt lewat encoder teks, dan encoder itu dilatih pada data yang didominasi beberapa bahasa. Prompt dalam bahasa Indonesia sering menghasilkan komposisi yang benar secara literal tapi salah secara halus -- misalnya jumlah orang, arah gerakan, atau hubungan antar objek tidak mengikuti kalimat.
Tiga hal yang bisa dicoba sekarang:
- Tulis prompt dalam dua tahap. Dahulukan deskripsi singkat dalam bahasa Inggris untuk tata letak, lalu tambahkan detail dalam bahasa Anda sendiri.
- Kontrol komposisi secara eksplisit. Sebutkan jumlah objek, posisi, dan arah gerakan. Diffusion tidak menyimpulkan seperti model bahasa.
- Gunakan model yang punya kontrol seed. Seed yang sama menghasilkan hasil yang sama, jadi iterasi bisa diulang dan bukan sekadar percobaan acak.
Hal yang paling sering dikeluhkan pengguna di Indonesia adalah jumlah orang dan ketelitian pada tangan. Keduanya adalah dua masalah yang dikenal dan belum selesai di semua model video saat ini.
Analisis: mana yang akan menang
Tidak ada yang menang telak, dan alasannya karena keduanya ahli dalam hal yang berbeda.
- Diffusion unggul di penghalusan yang halus. Mengoreksi distribusi piksel satu per satu adalah apa yang membuatnya menghasilkan detail yang masuk akal.
- Autoregressive unggul dalam konsistensi. Karena setiap token melihat semua token sebelumnya, tidak ada "frame yang lupa" -- dan itu justru masalah utama video.
- Video butuh keduanya, dan itu sebabnya arsitektur terbaru pindah ke dua jalur: satu untuk memahami dan menahan sesuatu yang koheren, satu untuk merender dengan halus.
Yang berubah sejak 2015 bukan bahwa model-model ini benar-benar baru. Yang berubah adalah bahwa denoising yang sebelumnya butuh 99 langkah sekarang bisa 8, dan angka itulah yang membuatnya praktis.
Yang perlu dipantau
Tiga hal. Pertama, apakah langkah distilasi bisa turun lagi tanpa kehilangan detail halus. Kalau bisa ke empat langkah, biaya turun lagi separuh.
Kedua, apakah batas resolusi native masih jadi masalah. Rho-1 misalnya masih dipatok 672x384, sementara model video lain sudah 720p pada 24 frame per detik. Batasnya adalah VRAM, bukan algoritma.
Ketiga, apakah kemampuan ini masuk ke perangkat konsumen. Untuk sekarang model video memakai puluhan GPU. Yang membuatnya terjangkau oleh orang awam bukan algoritmanya, tapi perangkat keras yang cukup murah.
Tool terkait
Alat gratis di browser yang berguna untuk topik ini.
Bagikan artikel ini
Bagikan ke
Artikel terkait

9 Oktober 2026
Kenapa Bahasa Non-Inggris Lebih Mahal: Rahasia di Balik Tokenizer
Satu tokenizer bisa membuat kata yang sama menjadi 5 token atau 15 token. Bedanya menentukan biaya API dan panjang konteks yang kamu punya.

8 Oktober 2026
Satu Model atau Banyak Model: Apa Bedanya Arsitektur Multimodal
Model unified memproses teks, gambar, dan audio dalam satu jaringan. Model pipeline menyambung beberapa model terpisah. Bedanya bukan cuma teknis.

8 Oktober 2026
Kenapa Skor Benchmark Model AI Sering Menyesatkan
Angka yang jadi sorotan satu vendor sering diukur di test yang tidak pernah dipakai pengguna. Empat alasan, dan cara membacanya.



