Kembali ke Berita
industriAI Understanding taklimat

Groq berkata ia akan menggunakan Nvidia Groq 3 LPX dan Vera Rubin NVL72 untuk inferens AI

Groq berkata ia sedang bekerjasama dengan Dell Technologies untuk menggunakan sistem Nvidia Groq 3 LPX dan Vera Rubin NVL72 dalam awan inferensnya, menjanjikan respons yang lebih pantas untuk beban kerja AI konteks besar dan agenik. Syarikat itu tidak memberikan tarikh penggunaan, senarai pelanggan atau pengesahan bebas tuntutan prestasi.

6 min readRead the primary source
Source-provided image accompanying Groq says it will deploy Nvidia Groq 3 LPX and Vera Rubin NVL72 for AI inference
Dokumen sumber utamaSumber direkodkan
Penerbit
groq.com
Pautan sumber
groq.comhttps://groq.com/blog/groq-among-the-first-to-bring-nvidia-groq-3-lpx-and-vera-rubin-nvl72-to-market
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Ejen AI
Sistem perisian yang boleh memerhati, menaakul dan mengambil tindakan untuk mencapai matlamat, selalunya menggunakan alatan dan ingatan.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Groq mengumumkan pada 24 Ogos bahawa ia akan menjadi antara pengguna pertama Nvidia Groq 3 LPX dan merancang untuk menggunakan perkakasan bersama Nvidia Vera Rubin NVL72 dalam awan inferens AI yang dibina khas. Groq berkata Dell Technologies akan membantu menggunakan sistem dan kapasiti itu akhirnya akan disediakan kepada pembangun, perusahaan dan syarikat AI menggunakan GroqCloud.

Groq berkata ia akan menjadi antara pengguna pertama Nvidia Groq 3 LPX, yang disifatkannya sebagai pemecut inferens bertujuan untuk meningkatkan kelajuan penjanaan token pada sistem Nvidia Vera Rubin NVL72. Groq berkata ia sedang bekerjasama dengan Dell Technologies untuk menggunakan infrastruktur dalam awan inferens AI yang dibina khas. Pengumuman itu menerangkan pengembangan yang dirancang, bukan pelancaran yang lengkap: apabila kapasiti datang dalam talian, syarikat itu berkata ia akan menyediakan laluan awal untuk perusahaan dan syarikat AI untuk menggunakan perkakasan pada beban kerja pengeluaran.

Syarikat-syarikat itu merangka langkah di sekitar respons model yang berulang dan pantas untuk aplikasi konteks besar dan AI agenik, yang mana perisian boleh menjana berbilang panggilan model semasa menjalankan tugas. Groq memetik angka prestasi terbitan Nvidia, termasuk 3,400 token keluaran sesaat yang menjalankan Gemma 4 31B dengan konteks 100,000 token dalam penanda aras Analisis Buatan. Groq juga mengulangi tuntutan interaktiviti empat kali lebih tinggi daripada platform alternatif terdekat dan berkata beberapa tugas pengekodan boleh diselesaikan dalam beberapa minit berbanding jam.

Angka-angka tersebut adalah tuntutan yang dibentangkan oleh Groq dan sebahagiannya dikaitkan dengan hasil terbitan Nvidia; sumber tidak memberikan persediaan ujian, perkakasan perbandingan, pengedaran kependaman, andaian harga atau replikasi bebas. Ia juga tidak menyatakan sama ada penanda aras yang disebut mencerminkan konfigurasi yang digunakan oleh Groq atau hasil platform Vera Rubin yang lebih luas. Prestasi inferens dunia sebenar bergantung pada seni bina model, panjang input dan output, batching, rangkaian, pengoptimuman perisian dan kekangan peringkat perkhidmatan.

Groq berkata lebih enam juta pembangun, perusahaan Fortune 500 dan beribu-ribu syarikat asli AI telah membina GroqCloud, menjana trilion token setiap minggu merentasi pusat data di Amerika Utara, Eropah, Timur Tengah dan Asia Pasifik. Sumber itu tidak mendokumenkan angka tersebut atau mengenal pasti pelanggan secara bebas. Ia juga mengatakan Groq menjadi Rakan Awan Nvidia pada bulan Ogos, membolehkannya mereka bentuk, menggunakan dan mengendalikan pengkomputeran dipercepatkan berdasarkan seni bina rujukan dan piawaian operasi Nvidia. Peranan Dell digambarkan sebagai menyediakan infrastruktur bersepadu dan keupayaan rantaian bekalan global, tetapi pengumuman itu tidak memberikan kuantiti sistem, lokasi kemudahan atau jadual penghantaran.

Butiran sumber: groq.com ↗

Mengapa ia penting

Pengumuman itu menunjukkan usaha yang semakin meningkat untuk membina infrastruktur khusus untuk inferens: peringkat apabila model AI terlatih menjana respons untuk pengguna dan aplikasi. Inferens yang lebih pantas boleh menjadikan sistem konteks panjang dan ejen AI lebih responsif, tetapi bukti awam di sini terhad kepada tuntutan syarikat dan vendor. Pengumuman itu tidak menentukan bila sistem akan tersedia, berapa kosnya atau cara ia akan berprestasi merentas beban kerja di luar penanda aras yang disebut.

Infrastruktur inferens semakin menentukan seberapa cepat orang dan perisian boleh menggunakan model AI selepas model tersebut dilatih. Untuk chatbot konvensional, kependaman respons yang lebih rendah boleh menjadikan interaksi terasa lebih serta-merta. Untuk ejen AI yang merancang, mendapatkan maklumat, menulis kod atau memanggil perkhidmatan lain, penjanaan yang lebih pantas boleh mengurangkan masa yang dihabiskan untuk menunggu merentasi banyak langkah berurutan. Oleh itu, pengumuman Groq adalah mengenai lapisan penghantaran praktikal AI, bukan model baharu atau keupayaan baharu yang ditunjukkan oleh model itu sendiri.

Penggunaan yang dicadangkan juga menggambarkan bagaimana infrastruktur AI menjadi lebih khusus. Groq meletakkan unit pemprosesan bahasa dan operasi awannya di sekitar penjanaan token, manakala Nvidia dan Dell dipersembahkan sebagai rakan kongsi yang membekalkan platform pemecut dan sistem bersepadu. Jika susunan berfungsi seperti yang diterangkan, pelanggan boleh mendapat akses kepada kapasiti inferens khusus tanpa membina dan mengendalikan perkakasan itu sendiri. Itu mungkin penting kepada syarikat yang mencari masa tindak balas yang boleh diramal untuk perkhidmatan pelanggan, pembangunan perisian atau aplikasi berasaskan ejen lain.

Kepentingan kepentingan awam adalah lebih terhad daripada yang dicadangkan oleh tuntutan prestasi tajuk. Sumber itu tidak menetapkan bahawa penjanaan token yang lebih pantas akan menghasilkan jawapan yang lebih baik, ejen yang lebih selamat atau kos keseluruhan yang lebih rendah. Kelajuan output hanyalah satu bahagian daripada perkhidmatan AI. Pengguna juga memerlukan ketepatan yang mencukupi, pengendalian konteks, masa beroperasi, keselamatan, kawalan tadbir urus data dan harga yang boleh diramal. Sistem yang lebih pantas malah boleh meningkatkan permintaan infrastruktur jika ia menjimatkan untuk menjalankan lebih banyak panggilan model atau interaksi yang lebih lama.

Pengumuman itu juga berkaitan dengan persaingan dalam pengkomputeran AI. Arkib dalaman termasuk laporan terbaru lain tentang sistem Nvidia, termasuk laporan berasingan bahawa firma pusat data AI India memesan sistem Vera Rubin. Itu adalah peristiwa yang berbeza, bukan bukti bahawa penempatan Groq telah bermula. Secara keseluruhan, perkembangan sedemikian menunjukkan minat pasaran dalam infrastruktur AI baharu, tetapi sumber ini sahaja tidak dapat mewujudkan bahagian pasaran, ketersediaan bekalan atau sama ada Groq akan menerima kelebihan material berbanding penyedia awan lain.

Bagi pelanggan, persoalan praktikal bukan semata-mata sama ada perkakasan boleh menghasilkan nombor penanda aras yang tinggi. Ia adalah sama ada pembangun boleh mengaksesnya melalui API yang stabil, pada harga yang menyokong beban kerja mereka, di kawasan tempat mereka beroperasi, dengan komitmen perkhidmatan yang boleh mereka harapkan. Tiada satu pun daripada syarat tersebut dinyatakan dalam pengumuman itu. Sumber itu juga tidak mendedahkan penggunaan tenaga, keperluan penyejukan, sekatan model atau syarat keselamatan dan privasi yang akan mengawal penggunaan perusahaan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Ujian utama ialah sama ada Groq menukar perkongsian perkakasan yang diumumkan kepada kapasiti pengeluaran yang boleh diakses secara meluas. Perhatikan jadual penggunaan, harga, kawasan perkhidmatan, akses pelanggan, penanda aras bebas dan bukti daripada beban kerja sebenar. Ia juga masih tidak jelas bagaimana sistem baharu itu akan dibandingkan dengan pemecut bersaing pada jumlah kos, penggunaan tenaga, kebolehpercayaan dan julat model yang boleh mereka sokong.

Mula-mula, lihat bukti bahawa pengumuman itu telah beralih daripada bahasa perkongsian kepada kapasiti pengendalian. Groq belum membekalkan tarikh untuk ketersediaan awal, bilangan sistem yang dijangkakan untuk digunakan, lokasi pusat data yang berkaitan atau bahagian trafik GroqCloud yang akan menggunakan perkakasan baharu. Pengumuman kapasiti kemudian, dokumentasi perkhidmatan atau pelancaran pelanggan akan menjelaskan status projek.

Kedua, perhatikan ujian bebas terhadap tuntutan prestasi. Perbandingan berguna akan melaporkan kependaman hujung-ke-hujung, masa kepada token pertama, kelajuan output yang mampan, daya pemprosesan di bawah permintaan serentak, prestasi pada panjang konteks yang berbeza dan hasil merentas beberapa model. Mereka juga harus menyatakan platform yang bersaing, susunan perisian dan andaian harga. Angka 3,400 token sumber dan tuntutan interaktiviti empat kali tidak dapat menjawab soalan tersebut sendiri.

Ketiga, pelanggan dan penganalisis harus memeriksa ekonomi. Pengumuman itu mengatakan bahawa platform itu direka untuk AI agenik berskala dan kos rendah, memetik seorang eksekutif Nvidia, tetapi ia tidak memberikan harga setiap token, terma kontrak, andaian penggunaan atau jumlah kos pemilikan. Pendedahan masa hadapan mungkin menunjukkan sama ada perkakasan inferens khusus mengurangkan kos dalam beban kerja biasa atau sama ada faedahnya tertumpu pada model dan corak trafik tertentu.

Keempat, perhatikan had operasi dan teknikal penggunaan. Groq berkata ia akan menggunakan seni bina rujukan Nvidia dan infrastruktur bersepadu Dell, tetapi sumber itu tidak menerangkan keserasian perisian, keperluan penghijrahan, sokongan model, redundansi, pemastautinan data atau pengaturan tindak balas insiden. Butiran tersebut akan menentukan sama ada perusahaan boleh menggunakan kapasiti untuk aplikasi sensitif atau kritikal perniagaan.

Akhir sekali, lihat sama ada kapasiti baharu mengubah cara pembangun membina ejen AI. Jika kependaman yang lebih rendah tersedia secara konsisten, pembangun boleh menggunakan konteks yang lebih panjang, lebih banyak panggilan alat atau lebih banyak langkah penaakulan berulang. Itu boleh meningkatkan responsif dalam sesetengah aplikasi sambil meningkatkan penggunaan token dan permintaan infrastruktur. Pengumuman itu tidak menawarkan bukti lagi tentang kesan hiliran tersebut, jadi ia masih mempunyai kemungkinan untuk menguji dan bukannya hasil yang ditetapkan.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AITransformerMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak pembiayaan AI
Adakah ini berguna?