Apa yang terjadi
Register melaporkan pergerakan yang semakin luas menuju perangkat keras AI khusus dan alternatif. Akunnya mencakup sistem rak CS-4 modular Cerebras, peran Marvell yang semakin besar dalam desain akselerator khusus, penggunaan TPU khusus yang terus dilakukan oleh Google, dan pengembangan akselerator pembelajaran mesin untuk kendaraan otonom oleh Waymo. Laporan tersebut juga menjelaskan Microsoft memulihkan beberapa fitur kustomisasi Windows dan pemantauan AI, tetapi itu adalah thread sekunder yang terpisah.
Laporan The Register pada tanggal 24 Agustus berpusat pada apa yang digambarkan oleh editornya sebagai langkah melampaui peran dominan Nvidia di pusat data AI. Vendor semakin banyak membagi beban kerja di antara berbagai jenis silikon daripada mengandalkan satu jenis akselerator. Hal ini menghadirkan inferensi, atau menghasilkan keluaran dari model yang dilatih, sebagai titik tekanan utama: penyedia menginginkan tingkat token yang tinggi untuk asisten pengkodean dan layanan interaktif lainnya sambil mengendalikan biaya daya dan perangkat keras untuk melayani permintaan. Artikel The Register adalah transkrip dan analisis podcast, sehingga harus dibaca sebagai laporan dari outlet tersebut dan bukan sebagai dokumentasi yang diverifikasi secara independen dari setiap klaim teknis.
Register melaporkan bahwa Cerebras beralih dari sistem monolitik yang besar menuju desain skala rak CS-4. Sistem Cerebras sebelumnya menempatkan chip berskala wafer yang besar dan haus daya dalam sasis berpendingin cairan mandiri. Pendekatan baru ini menempatkan tiga chip dalam susunan rak modular, memungkinkan komponen komputasi diganti tanpa mengganti peralatan penyalur daya terkait. Register mengatakan desainnya menggandakan kecepatan clock, bandwidth memori, dan kecepatan input-output, sekaligus menempatkan silikon tiga kali lebih banyak di rak. Cerebras juga dikatakan memiliki kemitraan dengan AWS dan AMD, dan pembuatan token yang cepat telah menarik minat untuk asisten pengkodean dan layanan inferensi lainnya.
Laporan tersebut menjelaskan ekosistem silikon khusus yang lebih luas di sekitar hyperscaler: Google telah menggunakan Tensor Processing Unit miliknya sendiri sejak sekitar tahun 2015 dan mengandalkan Broadcom untuk sebagian desain akselerator khusus, sementara Marvell menjadi pesaing dalam pekerjaan XPU khusus dan konektivitas setelah membangun portofolio kekayaan intelektual melalui akuisisi. Artikel ini menggambarkan hal ini sebagai cara bagi perusahaan cloud untuk membandingkan pemasok atau mengurangi ketergantungan pada satu mitra desain, namun tidak mendokumentasikan kontrak Google-Marvell baru yang spesifik; pernyataan tentang strategi pelanggan masa depan dan tekanan harga hanyalah komentar, bukan perkembangan yang sudah pasti. Waymo mengungkapkan akselerator pembelajaran mesin khusus yang ditujukan untuk kendaraan karena volume sensor dan latensi rendah penting ketika hambatan muncul. Register mengatakan Waymo sangat bergantung pada susunan gerbang yang dapat diprogram di lapangan dan mungkin mencari kepadatan komputasi yang lebih besar dan pengembangan yang lebih mudah dari sirkuit terpadu khusus aplikasi, namun tidak memberikan spesifikasi, hasil pengujian, jadwal produksi atau catatan keselamatan. Secara terpisah, Microsoft sedang menguji bilah tugas Windows 11 yang dapat dipindahkan, menu konteks yang lebih dapat disesuaikan, dan visibilitas Pengelola Tugas ke dalam beban kerja unit pemrosesan saraf.
Detail sumber: theregister.com ↗
Mengapa itu penting
Pergeseran ini dapat membuat infrastruktur AI tidak terlalu bergantung pada satu kelas GPU Nvidia dan lebih menekankan pada perangkat keras yang dirancang untuk beban kerja inferensi tertentu. Waktu respons yang lebih cepat, biaya pengoperasian yang lebih rendah, efisiensi daya yang lebih baik, dan integrasi yang lebih erat dengan sensor adalah tujuan praktis yang dijelaskan oleh The Register. Laporan tersebut tidak menetapkan bahwa alternatif apa pun telah melampaui Nvidia dalam penerapan di dunia nyata.
Signifikansi praktisnya adalah kinerja AI tidak hanya ditentukan oleh model. Pelaporan Register menunjukkan vendor mengoptimalkan perangkat keras berdasarkan inferensi untuk batasan tertentu: kecepatan pembuatan token untuk alat interaktif, daya dan pendinginan untuk rak pusat data, dan latensi untuk kontrol kendaraan. Jika desain tersebut berhasil dalam skala besar, perusahaan dapat memilih akselerator yang berbeda untuk pelatihan, inferensi volume tinggi, permintaan latensi rendah premium, dan beban kerja edge. Hal ini akan membuat pasar infrastruktur AI menjadi lebih terspesialisasi dan memberikan pelanggan lebih banyak alternatif dibandingkan sistem GPU tujuan umum.
Laporan desain ulang rak Cerebras menyoroti masalah operasional yang mungkin terlewatkan dalam klaim kinerja utama. Register mengatakan sistem sebelumnya mengkonsumsi sekitar 15 kilowatt untuk chip dan menggabungkan komputasi dengan peralatan penyalur daya dalam sasis besar. Rak modular dapat membuat perbaikan dan peningkatan tidak terlalu mengganggu, bahkan jika silikon tetap sangat membutuhkan daya. Bagi operator pusat data, kemudahan servis, pemasangan kabel, pendinginan, dan kemampuan untuk mengganti satu komponen yang rusak mungkin sama pentingnya dengan throughput puncak. Sumber tersebut tidak memverifikasi secara independen angka kekuatan atau kinerja yang dilaporkan, sehingga manfaat tersebut tetap merupakan klaim yang memerlukan tinjauan teknis.
Basis pemasok yang lebih luas dapat mempengaruhi daya tawar dan keputusan investasi. Register menunjukkan bahwa perusahaan cloud sering kali menggunakan perusahaan kekayaan intelektual luar untuk bagian chip khusus yang tidak terlalu berbeda, sambil memusatkan rekayasa internal pada fitur yang relevan dengan layanan mereka. Persaingan antara Broadcom dan Marvell dapat memberi hyperscaler jalur desain lain, namun silikon khusus juga menciptakan kewajiban perangkat lunak dan dukungan. Sebuah chip yang efisien untuk satu beban kerja mungkin sulit untuk diprogram, sulit diperoleh, atau tidak cocok untuk beban kerja lainnya. Laporan tersebut tidak menawarkan perbandingan biaya dengan sistem Nvidia dan tidak ada bukti bahwa pelanggan beralih dalam skala luas. Contoh Waymo menghubungkan perangkat keras AI khusus dengan penerapan yang sensitif terhadap keselamatan, bukan hanya ekonomi pusat data: latensi rendah penting ketika kendaraan merespons masukan sensor, dan intervensi manusia jarak jauh bukanlah pengganti yang ideal untuk pemrosesan langsung di dalam kendaraan. Hal ini tidak menunjukkan peningkatan keamanan; tidak ada evaluasi independen, perbandingan tingkat kegagalan, atau penilaian peraturan. Kesimpulan yang lebih sempit adalah bahwa kendaraan otonom memberikan alasan untuk merancang silikon berdasarkan pemrosesan sensor dan waktu respons, sementara dampak publik bergantung pada validasi dalam kondisi pengoperasian nyata.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pengujian utamanya adalah dokumentasi teknis publik, tolok ukur independen, dan bukti penggunaan pelanggan dalam skala besar. Perhatikan apakah desain rak baru Cerebras, akselerator khusus yang didukung Marvell, dan silikon kendaraan Waymo mencapai produksi, dan apakah manfaatnya lebih besar daripada biaya perangkat lunak, rantai pasokan, dan pemeliharaan. Perubahan Windows Microsoft juga harus dinilai berdasarkan ketersediaan publik dan apakah perubahan tersebut meningkatkan kontrol pengguna daripada sekadar menambahkan lebih banyak pemantauan sistem.
Pertama, cari materi teknis utama dari Cerebras, Waymo, Google, Marvell atau pelanggannya. Bukti yang berguna mencakup dokumen arsitektur, pengukuran daya, dukungan perangkat lunak, status produksi, dan pengujian beban kerja yang jelas. Laporan Register memberikan peta yang layak diberitakan mengenai perusahaan-perusahaan yang terlibat, namun tidak menetapkan ketersediaan, harga, volume pelanggan, atau kinerja independen. Detail yang hilang tersebut menentukan apakah perkembangan tersebut merupakan pergerakan industri atau sebagian besar merupakan rencana teknis.
Kedua, bandingkan suka dengan suka. Angka token per detik dapat bervariasi tergantung ukuran model, batching, presisi, panjang konteks, dan jumlah pengguna secara bersamaan. Akselerator khusus mungkin cocok untuk satu pola inferensi sempit dan kurang berguna untuk beban kerja umum. Perhatikan pengujian independen yang mengukur throughput, latensi respons, energi per token yang dihasilkan, pemanfaatan, keandalan, dan total biaya kepemilikan terhadap sistem GPU kontemporer. Tanpa konteks tersebut, klaim AI yang lebih cepat atau lebih murah akan sulit untuk dievaluasi. Ketiga, ikuti hubungan komersial: The Register melaporkan kemitraan Cerebra dengan AWS dan AMD dan menggambarkan Marvell memasuki bidang yang sebelumnya didominasi oleh Broadcom dan tim hyperscaler internal. Bukti penting berikutnya adalah apakah hubungan tersebut menghasilkan layanan yang dapat diakses secara umum, penerapan bernama, atau pesanan berulang. Perkiraan laporan bahwa layanan AWS atau AMD dapat menggunakan perangkat keras Cerebras hanyalah komentar berwawasan ke depan, bukan peluncuran yang dikonfirmasi, dan tidak boleh dianggap sebagai peluncuran.
Terakhir, pantau penerapan kendaraan Waymo dan perubahan perangkat lunak Microsoft secara terpisah. Bagi Waymo, pertanyaan yang penting adalah apakah akselerator dipasang di kendaraan produksi, bagaimana akselerator menangani beban kerja sensor, sistem fallback apa yang ada, dan validasi keselamatan apa yang telah diselesaikan. Untuk Windows, The Register mengatakan pergerakan bilah tugas ada di saluran Pratinjau Rilis dan peningkatan visibilitas proses NPU sedang dikembangkan, namun waktu publik dan perilaku akhir dapat berubah. Thread tidak boleh disajikan secara lengkap sampai perusahaan mempublikasikan ketersediaan yang stabil dan pengguna independen dapat menilai hasilnya.