Apa yang terjadi
Lec melaporkan bahwa Qualcomm meluncurkan unit pemrosesan saraf Hexagon generasi berikutnya pada 10 September untuk beban kerja AI agenik yang berkelanjutan pada perangkat seluler. Desain yang dilaporkan menambahkan Element Accelerator untuk beban kerja transformator, meningkatkan memori bersama sebesar 50%, dan mendukung model campuran ahli dengan hingga 30 miliar parameter, dengan sekitar 3 miliar aktif untuk setiap token yang dihasilkan. Menurut The Lec, NPU mendukung format data FP16, INT2, INT4, INT8 dan FP8. Qualcomm mengklaim kinerja pra-pengisian INT4 dapat mencapai 50% lebih cepat dan respons dapat dimulai dalam 1,5 detik, meskipun The Lec tidak melaporkan pengujian independen terhadap angka-angka tersebut. NPU ini dimaksudkan untuk bekerja dengan CPU Oryon Snapdragon dan GPU Adreno untuk alur kerja multilangkah dan pemrosesan AI terkait grafis. Laporan tersebut mengatakan Qualcomm akan memberikan rincian lebih lanjut pada Snapdragon Summit di Amerika Serikat pada 22-24 September. Sumber tersebut tidak mengidentifikasi smartphone tertentu, tanggal peluncuran, ketersediaan ritel, harga, atau hasil benchmark pihak ketiga yang dikonfirmasi.
Lec melaporkan bahwa Qualcomm meluncurkan NPU Hexagon generasi berikutnya pada tanggal 10 September, memposisikannya sebagai perangkat keras seluler untuk sistem AI yang menafsirkan konteks, alasan di seluruh aplikasi, dan melakukan tugas untuk pengguna. Perangkat keras yang dilaporkan menambahkan Akselerator Elemen bersama dengan ekstensi skalar, vektor, dan matriks yang ada, dengan tujuan meningkatkan komputasi model transformator sekaligus mengelola penggunaan daya.
Laporan tersebut mengatakan kapasitas memori bersama 50% lebih tinggi dibandingkan desain sebelumnya. Alasan Qualcomm adalah menjaga status model, aktivasi, dan data tensor perantara lebih dekat ke prosesor dapat mengurangi transfer ke DRAM eksternal, sehingga berpotensi meningkatkan retensi konteks dan peralihan tugas. Laporan ini tidak memberikan perbandingan independen dengan penerapan Hexagon sebelumnya.
The new Hexagon reportedly supports mixture-of-experts models with up to 30 billion parameters, while activating about 3 billion routed parameters per token. Lec juga melaporkan manajemen flash-ke-memori NAND dan cache yang dimaksudkan untuk memuat hanya komponen ahli yang relevan ke dalam DRAM dan menyimpan komponen yang sering digunakan dalam cache.
NPU dilaporkan mendukung format presisi FP16, INT2, INT4, INT8 dan FP8. Lec mengaitkan klaim pengisian awal INT4 hingga 50% lebih cepat dan respons dimulai dalam 1,5 detik ke Qualcomm. Tidak ada pengujian independen, ketersediaan perangkat, harga, atau produk konsumen tertentu yang disediakan.
Mengapa itu penting
If Qualcomm’s reported design reaches consumer devices as described, it could make larger and more context-aware AI systems more practical to run locally on phones. Menyimpan lebih banyak data model di dekat prosesor dapat mengurangi lalu lintas dan latensi memori, sementara arsitektur campuran ahli dapat memberikan akses ke kemampuan khusus tanpa mengaktifkan setiap parameter untuk setiap tugas. Hal ini penting bagi privasi, daya tanggap, dan penggunaan offline, namun manfaat praktisnya masih belum terverifikasi hingga perangkat, model, dan pengujian independen tersedia.
Pengumuman ini menargetkan kendala utama dalam AI seluler: menjalankan model berkemampuan dalam batas ketat pada bandwidth memori, penggunaan baterai, dan latensi. Kumpulan memori bersama yang lebih besar dan aktivasi selektif komponen campuran ahli dapat mengurangi jumlah data yang dipindahkan selama inferensi lokal, jika arsitektur Qualcomm berfungsi seperti yang dijelaskan.
Pemrosesan lokal dapat memberikan manfaat praktis karena beberapa interaksi dapat ditangani melalui telepon tanpa mengirimkan setiap masukan ke layanan jarak jauh. Namun, sumbernya tidak memberikan jaminan privasi, fungsionalitas offline, peningkatan baterai, atau kinerja di seluruh aplikasi nyata. Hasil tersebut bergantung pada perangkat lunak, kompresi model, batas termal, dan implementasi handset.
Integrasi yang dilaporkan dengan CPU dan GPU menunjukkan bahwa Qualcomm memperlakukan AI agen sebagai beban kerja platform, bukan sebagai fitur akselerator yang terisolasi. Signifikansinya akan bergantung pada apakah pengembang dapat mengakses perangkat keras secara efisien dan apakah pembuat ponsel mengirimkan model dan aplikasi yang menggunakannya.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang harus ditonton selanjutnya
Bukti penting berikutnya adalah pengungkapan Snapdragon Summit oleh Qualcomm dan perangkat yang nantinya akan menggunakan NPU. Perhatikan platform chip yang disebutkan, model yang didukung, alat pengembang, pengukuran sebenarnya pada perangkat, konsumsi daya yang berkelanjutan, dan apakah waktu respons yang diklaim berlaku untuk menyelesaikan alur kerja agen, bukan demonstrasi terbatas. Ketersediaan, harga dan distribusi regional tidak didokumentasikan dalam laporan.
Qualcomm mengatakan rincian lebih lanjut akan diungkapkan pada Snapdragon Summit pada 22-24 September. Pengungkapan tersebut dapat memperjelas platform Snapdragon spesifik, jadwal penerapan, lingkungan operasi yang didukung, dan akses pengembang.
Pengujian independen harus memverifikasi peningkatan kinerja INT4 yang dilaporkan, klaim mulai respons 1,5 detik, konsumsi daya, dan kinerja berkelanjutan dalam beban kerja agen multilangkah. Sumber tidak memberikan pengujian seperti itu.
Belum diketahui smartphone mana yang akan menggunakan NPU, kapan akan menjangkau pelanggan, berapa biayanya, atau apakah semua kemampuan yang dilaporkan akan diaktifkan saat peluncuran.