Perhatian Silang
Perhatian silang adalah mekanisme yang memungkinkan satu urutan melihat urutan lainnya: dekoder yang menghasilkan teks dapat memperhatikan representasi masukan dari pembuat enkode.
Ikhtisar
It is how models connect what they are producing to what they read, powering translation, captioning, and modern multimodal systems.
Menyelam Lebih Dalam
Perhatian diri memungkinkan token dalam satu urutan berhubungan satu sama lain; perhatian silang memungkinkan suatu urutan mengambil informasi dari informasi yang berbeda. Dalam dekoder Transformer, setiap langkah pembangkitan membentuk kueri dari keluaran yang dihasilkan sebagian, sedangkan kunci dan nilai berasal dari keluaran pembuat enkode. Model ini menghitung seberapa relevan setiap elemen masukan dengan posisi keluaran saat ini dan menarik campuran informasi masukan yang berbobot. Inilah yang memungkinkan decoder terjemahan fokus pada kata sumber yang tepat saat menulis setiap kata target. Di luar teks, perhatian silang adalah perekat dalam model multimodal: dekoder teks dapat menangani fitur patch gambar, atau model audio dapat menyelaraskan suara dengan kata-kata yang ditranskripsikan. Kapanpun dua aliran informasi yang berbeda perlu digabungkan, perhatian silang biasanya terjadi pada jaringan ikat.
Wawasan Teknis
Secara mekanis, perhatian silang menggunakan kembali rumus perkalian titik berskala yang sama dengan perhatian mandiri, dengan satu perubahan: kueri berasal dari satu urutan (decoder) dan kunci/nilai berasal dari urutan lain (encoder). Ini menghitung bobot perhatian sebagai softmax atas kesamaan kunci kueri, lalu mengembalikan jumlah nilai yang tertimbang. Karena kueri dan kunci berasal dari sumber yang berbeda, kedua rangkaian tersebut dapat berbeda dalam panjang, modalitas, atau bahasa secara keseluruhan.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Perhatian Silang
Perhatian silang semakin menjadi antarmuka standar untuk menyatukan modalitas. Model bahasa visi menggunakannya sehingga teks dapat ditempatkan pada wilayah gambar; generator gambar difusi menggunakannya untuk mengkondisikan piksel pada perintah teks. Penelitian mendorong perhatian silang yang lebih efisien (varian linier dan jarang) untuk menangani dokumen panjang, gambar resolusi tinggi, dan video. Ketika sistem AI mengintegrasikan lebih banyak indra, lapisan perhatian silang diharapkan bertindak sebagai konektor universal yang menyelaraskan teks, suara, penglihatan, dan data terstruktur.
Implementasi Dunia Nyata
Dalam terjemahan mesin saraf, dekoder memperhatikan kata-kata sumber untuk memilih terjemahan yang tepat untuk setiap kata keluaran.
Difusi Stabil menggunakan perhatian silang untuk mengkondisikan setiap wilayah gambar yang dihasilkan pada prompt teks.
Model bahasa visi seperti Flamingo memungkinkan token teks memperhatikan fitur gambar untuk menjawab pertanyaan visual.
Dekoder ucapan-ke-teks memperhatikan bingkai audio yang dikodekan untuk menyelaraskan suara dengan kata-kata yang ditranskripsi.
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Cross-Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pengeditan Perhatian Silang Prompt-to-Prompt
Pertanyaan yang sering diajukan
What is Cross-Attention?
Perhatian silang adalah mekanisme yang memungkinkan satu urutan melihat urutan lainnya: dekoder yang menghasilkan teks dapat memperhatikan representasi masukan dari pembuat enkode. Ini adalah cara model menghubungkan apa yang mereka hasilkan dengan apa yang mereka baca, mendukung penerjemahan, pembuatan teks, dan sistem multimoda modern.
Apa perbedaan utama antara perhatian diri dan perhatian silang?
Perhatian silang menarik kueri dari satu urutan (misalnya, decoder) dan kunci serta nilai dari urutan yang berbeda (misalnya, encoder), sehingga keduanya dapat berinteraksi.
Dalam Transformer encoder-decoder, dari mana asal pertanyaan untuk perhatian silang?
Decoder membentuk kueri dari keluaran yang dihasilkan sebagian, kemudian menggunakan keluaran encoder sebagai kunci dan nilai untuk menarik informasi masukan yang relevan.
Mengapa dua rangkaian dalam perhatian silang dapat memiliki panjang atau modalitas yang berbeda?
Karena kueri berasal dari satu sumber dan kunci/nilai dari sumber lain, urutannya bersifat independen dan mungkin berbeda dalam panjang, bahasa, atau modalitas.
Bagaimana Difusi Stabil menggunakan perhatian silang?
Perhatian silang memungkinkan setiap bagian gambar yang dihasilkan memperhatikan perintah teks, mendasarkan visual pada kata-kata.
Operasi matematika apa yang membagi perhatian silang dengan perhatian diri?
Keduanya menggunakan perhatian produk titik berskala yang sama: skor kesamaan antara kueri dan kunci, softmax, lalu jumlah nilai yang diberi bobot.