Kembali ke Berita
industriAI Understanding taklimat

Daftar melaporkan vendor AI mempelbagaikan melebihi GPU Nvidia untuk inferens

Daftar melaporkan bahawa Cerebras, Google, Marvell dan Waymo sedang mengejar silikon khusus untuk meningkatkan kelajuan inferens AI, penggunaan kuasa atau kependaman, walaupun pendedahan asas dan penggunaan komersial tidak disahkan secara bebas di sini.

6 min readRead the original reporting
Source-provided image accompanying The Register reports AI vendors are diversifying beyond Nvidia GPUs for inference
Pelaporan berkaitSumber direkodkan
Penerbit
theregister.com
Pautan sumber
theregister.comhttps://www.theregister.com/ai-and-ml/2026/08/24/ai-vendors-are-turning-to-custom-hardware-as-microsoft-winds-back-the-clock-on-windows/5291293
Jenis sumber
Pelaporan oleh saluran berita — bukan dokumen pihak pertama.

Perkara yang tidak dapat kami sahkan secara bebas: Tuntutan ini dikaitkan dengan kedai yang dinamakan. Kami tidak mengesahkannya terhadap dokumen pihak pertama. (theregister.com)

KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Ketepatan
Perkadaran positif yang diramalkan yang sebenarnya betul.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Daftar melaporkan langkah yang semakin meluas ke arah perkakasan AI tersuai dan alternatif. Akaunnya meliputi sistem rak modular CS-4 Cerebras, peranan Marvell yang semakin meningkat dalam reka bentuk pemecut tersuai, penggunaan berterusan Google bagi TPU khusus, dan pembangunan pemecut pembelajaran mesin oleh Waymo untuk kenderaan autonomi. Laporan itu juga menerangkan Microsoft memulihkan beberapa penyesuaian Windows dan ciri pemantauan AI, tetapi itu adalah urutan kedua yang berasingan.

Laporan 24 Ogos Register menumpukan pada perkara yang disifatkan oleh editornya sebagai satu langkah melangkaui peranan dominan Nvidia dalam pusat data AI. Vendor semakin membahagikan beban kerja antara pelbagai jenis silikon dan bukannya bergantung pada satu jenis pemecut. Ia membentangkan inferens, atau menjana output daripada model terlatih, sebagai titik tekanan utama: penyedia mahukan kadar token yang tinggi untuk pembantu pengekodan dan perkhidmatan interaktif lain sambil mengawal kos kuasa dan perkakasan bagi permintaan penyajian. Artikel Daftar ialah transkrip dan analisis podcast, jadi ia harus dibaca sebagai pelaporan daripada saluran itu dan bukannya dokumentasi yang disahkan secara bebas bagi setiap tuntutan teknikal.

Daftar melaporkan bahawa Cerebras sedang bergerak dari sistem monolitik yang besar ke arah reka bentuk skala rak CS-4nya. Sistem Cerebras sebelum ini meletakkan cip berskala wafer yang haus kuasa dalam casis penyejuk cecair serba lengkap. Pendekatan baharu ini meletakkan tiga cip dalam susunan rak modular, membolehkan komponen pengiraan diganti tanpa menggantikan peralatan penghantaran kuasa yang berkaitan. The Register mengatakan reka bentuk itu menggandakan kelajuan jam, lebar jalur memori dan kelajuan input-output, sambil meletakkan silikon tiga kali ganda dalam rak. Ia juga mengatakan Cerebras mempunyai perkongsian dengan AWS dan AMD, dan penjanaan token yang pantas itu telah menarik minat untuk pembantu pengekodan dan perkhidmatan inferens lain.

Laporan itu menerangkan ekosistem silikon tersuai yang lebih luas di sekitar hyperscaler: Google telah menggunakan Unit Pemprosesan Tensornya sendiri sejak sekitar 2015 dan bergantung pada Broadcom untuk sebahagian daripada reka bentuk pemecut tersuai, manakala Marvell menjadi pesaing dalam XPU tersuai dan kerja ketersambungan selepas membina portfolio harta intelek melalui pemerolehan. Artikel membingkaikan ini sebagai cara untuk syarikat awan membandingkan pembekal atau mengurangkan pergantungan pada rakan reka bentuk tunggal, tetapi tidak mendokumenkan kontrak Google-Marvell baharu yang khusus; dakwaan tentang strategi pelanggan masa depan dan tekanan harga adalah ulasan, bukan perkembangan yang mantap. Waymo mendedahkan pemecut pembelajaran mesin tersuai yang ditujukan untuk kenderaan kerana volum sensor dan kependaman rendah penting apabila halangan muncul. Daftar mengatakan Waymo telah banyak bergantung pada tatasusunan get boleh diprogramkan medan dan mungkin mencari kepadatan pengiraan yang lebih besar dan pembangunan litar bersepadu khusus aplikasi yang lebih mudah, tetapi tidak memberikan spesifikasi, keputusan ujian, jadual pengeluaran atau rekod keselamatan. Secara berasingan, Microsoft sedang menguji bar tugas Windows 11 alih, menu konteks yang lebih disesuaikan dan keterlihatan Pengurus Tugas ke dalam beban kerja unit pemprosesan saraf.

Butiran sumber: theregister.com ↗

Mengapa ia penting

Peralihan ini boleh menjadikan infrastruktur AI kurang bergantung pada satu kelas GPU Nvidia dan memberi lebih penekanan pada perkakasan yang direka untuk beban kerja inferens tertentu. Masa tindak balas yang lebih pantas, kos operasi yang lebih rendah, kecekapan kuasa yang lebih baik dan integrasi yang lebih ketat dengan penderia adalah matlamat praktikal yang diterangkan oleh The Register. Laporan itu tidak menetapkan bahawa mana-mana alternatif secara meluas telah mengatasi Nvidia dalam penggunaan dunia sebenar.

Kepentingan praktikal ialah prestasi AI bukan hanya ditentukan oleh model. Pelaporan Daftar menunjukkan vendor mengoptimumkan perkakasan di bawah inferens untuk kekangan tertentu: kelajuan penjanaan token untuk alat interaktif, kuasa dan penyejukan untuk rak pusat data dan kependaman untuk kawalan kenderaan. Jika reka bentuk tersebut berfungsi pada skala, syarikat boleh memilih pemecut yang berbeza untuk latihan, inferens volum tinggi, permintaan kependaman rendah premium dan beban kerja kelebihan. Itu akan menjadikan pasaran infrastruktur AI lebih khusus dan boleh memberi pelanggan lebih banyak alternatif kepada sistem GPU tujuan umum.

Reka bentuk semula rak Cerebras yang dilaporkan menyerlahkan isu operasi yang boleh terlepas dalam tuntutan prestasi tajuk. Daftar mengatakan bahawa sistem terdahulu menggunakan kira-kira 15 kilowatt untuk cip dan pengiraan digabungkan dengan peralatan penghantaran kuasa dalam casis yang besar. Rak modular boleh membuat pembaikan dan naik taraf kurang mengganggu, walaupun silikon kekal sangat haus kuasa. Untuk pengendali pusat data, kebolehservisan, pengkabelan, penyejukan dan keupayaan untuk menggantikan satu komponen yang gagal mungkin sama pentingnya dengan daya pemprosesan puncak. Sumber itu tidak mengesahkan secara bebas angka kuasa atau prestasi yang dilaporkan, jadi faedah tersebut kekal sebagai tuntutan yang memerlukan semakan teknikal.

Pangkalan pembekal yang lebih luas boleh menjejaskan kuasa tawar-menawar dan keputusan pelaburan. Daftar mencadangkan bahawa syarikat awan sering menggunakan firma harta intelek luar untuk bahagian cip tersuai yang kurang tersendiri sambil menumpukan kejuruteraan dalaman pada ciri yang berkaitan dengan perkhidmatan mereka. Persaingan antara Broadcom dan Marvell boleh memberikan laluan reka bentuk lain kepada hyperscaler, tetapi silikon tersuai juga mencipta perisian dan kewajipan sokongan. Cip yang cekap untuk satu beban kerja mungkin sukar untuk diprogramkan, sukar diperoleh atau kurang sesuai dengan yang lain. Laporan itu tidak menawarkan perbandingan kos dengan sistem Nvidia dan tiada bukti bahawa pelanggan beralih pada skala yang luas. Contoh Waymo menghubungkan perkakasan AI tersuai kepada penggunaan sensitif keselamatan dan bukannya ekonomi pusat data sahaja: kependaman rendah penting apabila kenderaan bertindak balas kepada input penderia dan campur tangan manusia jauh bukanlah pengganti yang ideal untuk pemprosesan onboard segera. Itu tidak menunjukkan keselamatan yang lebih baik; tiada penilaian bebas, perbandingan kadar kegagalan atau penilaian kawal selia. Kesimpulan yang lebih sempit ialah kenderaan autonomi memberikan alasan untuk mereka bentuk silikon di sekitar pemprosesan sensor dan masa tindak balas, manakala kesan awam bergantung pada pengesahan dalam keadaan operasi sebenar.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Ujian utama ialah dokumentasi teknikal awam, penanda aras bebas dan bukti penggunaan pelanggan berskala. Tonton sama ada reka bentuk rak baharu Cerebras, pemecut tersuai yang disokong Marvell dan pengeluaran silikon kenderaan Waymo, dan sama ada faedahnya melebihi kos perisian, rantaian bekalan dan penyelenggaraan. Perubahan Windows Microsoft juga harus dinilai oleh ketersediaan awam dan sama ada ia meningkatkan kawalan pengguna dan bukannya menambah lebih banyak pemantauan sistem.

Mula-mula, cari bahan teknikal utama daripada Cerebras, Waymo, Google, Marvell atau pelanggan mereka. Bukti berguna termasuk dokumen seni bina, pengukuran kuasa, sokongan perisian, status pengeluaran dan ujian beban kerja yang jelas. Laporan Daftar membekalkan peta bernilai berita bagi syarikat yang terlibat, tetapi tidak menetapkan ketersediaan, harga, volum pelanggan atau prestasi bebas. Butiran yang hilang itu menentukan sama ada perkembangan itu adalah pergerakan industri atau terutamanya rancangan kejuruteraan.

Kedua, bandingkan suka dengan suka. Angka token setiap saat boleh berbeza-beza mengikut saiz model, batching, ketepatan, panjang konteks dan bilangan pengguna serentak. Pemecut tersuai mungkin sangat baik untuk satu corak inferens sempit dan kurang berguna untuk beban kerja umum. Perhatikan ujian bebas yang mengukur daya tampung, kependaman tindak balas, tenaga setiap token yang dijana, penggunaan, kebolehpercayaan dan jumlah kos pemilikan terhadap sistem GPU kontemporari. Tanpa konteks itu, tuntutan AI yang lebih pantas atau lebih murah kekal sukar untuk dinilai. Ketiga, ikuti perhubungan komersial: The Register melaporkan perkongsian Cerebras dengan AWS dan AMD dan menggambarkan Marvell memasuki bidang yang sebelum ini didominasi oleh Broadcom dan pasukan hyperscaler dalaman. Bukti penting seterusnya ialah sama ada perhubungan tersebut menghasilkan perkhidmatan yang boleh diakses secara umum, penempatan dinamakan atau pesanan berulang. Jangkaan laporan bahawa perkhidmatan AWS atau AMD mungkin menggunakan perkakasan Cerebras adalah ulasan berpandangan ke hadapan, bukan pelancaran yang disahkan dan tidak boleh dianggap sebagai satu.

Akhir sekali, pantau pelaksanaan kenderaan Waymo dan perubahan perisian Microsoft secara berasingan. Bagi Waymo, soalan yang bermakna ialah sama ada pemecut dipasang dalam kenderaan pengeluaran, cara ia mengendalikan beban kerja penderia, sistem sandaran yang wujud dan pengesahan keselamatan yang telah diselesaikan. Untuk Windows, The Register mengatakan pergerakan bar tugas berada dalam saluran Pratonton Keluaran dan keterlihatan proses NPU yang dipertingkat sedang dibangunkan, tetapi masa awam dan tingkah laku akhir boleh berubah. Kedua-dua urutan tidak harus dibentangkan sebagai lengkap sehingga syarikat menerbitkan ketersediaan yang stabil dan pengguna bebas boleh menilai hasilnya.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerMasa Depan AIChatGPT & LLMUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak pembiayaan AI
Adakah ini berguna?