Kembali ke Berita
IndustriAI Understanding pengarahan

Groq mengatakan akan menerapkan Nvidia Groq 3 LPX dan Vera Rubin NVL72 untuk inferensi AI

Groq mengatakan pihaknya bekerja sama dengan Dell Technologies untuk menerapkan sistem Nvidia Groq 3 LPX dan Vera Rubin NVL72 di cloud inferensinya, sehingga menjanjikan respons yang lebih cepat untuk beban kerja AI agen dan konteks besar. Perusahaan belum memberikan tanggal penerapan, daftar pelanggan, atau validasi independen atas klaim kinerja.

6 min readRead the primary source
Source-provided image accompanying Groq says it will deploy Nvidia Groq 3 LPX and Vera Rubin NVL72 for AI inference
Dokumen sumber utamaSumber direkam
Penerbit
groq.com
Tautan sumber
groq.comhttps://groq.com/blog/groq-among-the-first-to-bring-nvidia-groq-3-lpx-and-vera-rubin-nvl72-to-market
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Kesimpulan
Fase runtime saat model terlatih menghasilkan prediksi atau keluaran.
Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Agen AI
Sebuah sistem perangkat lunak yang dapat mengamati, menalar, dan mengambil tindakan untuk mencapai suatu tujuan, sering kali menggunakan alat dan memori.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

Groq mengumumkan pada tanggal 24 Agustus bahwa mereka akan menjadi salah satu pengguna pertama Nvidia Groq 3 LPX dan berencana untuk menerapkan perangkat keras tersebut bersama Nvidia Vera Rubin NVL72 di cloud inferensi AI yang dibuat khusus. Groq mengatakan Dell Technologies akan membantu penerapan sistem tersebut dan kapasitas tersebut pada akhirnya akan tersedia bagi pengembang, perusahaan, dan perusahaan AI yang menggunakan GroqCloud.

Groq mengatakan mereka akan menjadi salah satu pengguna pertama Nvidia Groq 3 LPX, yang digambarkan sebagai akselerator inferensi yang dimaksudkan untuk meningkatkan kecepatan pembuatan token pada sistem Nvidia Vera Rubin NVL72. Groq mengatakan pihaknya bekerja sama dengan Dell Technologies untuk menerapkan infrastruktur di cloud inferensi AI yang dibuat khusus. Pengumuman tersebut menggambarkan perluasan yang direncanakan, bukan peluncuran yang telah selesai: ketika kapasitas mulai tersedia, perusahaan mengatakan akan memberikan jalur awal bagi perusahaan dan perusahaan AI untuk menggunakan perangkat keras pada beban kerja produksi.

Perusahaan-perusahaan tersebut merancang pergerakan berdasarkan respons model yang berulang dan cepat untuk aplikasi konteks besar dan AI agen, di mana perangkat lunak dapat menghasilkan beberapa panggilan model saat menjalankan suatu tugas. Groq mengutip angka kinerja yang diterbitkan Nvidia, termasuk 3,400 token keluaran per detik yang menjalankan Gemma 4 31B dengan konteks 100,000 token dalam tolok ukur Analisis Buatan. Groq juga mengulangi klaim interaktivitas empat kali lebih tinggi dibandingkan platform alternatif terdekat dan mengatakan beberapa tugas pengkodean dapat diselesaikan dalam hitungan menit, bukan jam.

Angka-angka tersebut adalah klaim yang diajukan oleh Groq dan sebagian dikaitkan dengan hasil publikasi Nvidia; sumbernya tidak memberikan pengaturan pengujian, perangkat keras perbandingan, distribusi latensi, asumsi harga, atau replikasi independen. Juga tidak disebutkan apakah tolok ukur yang dikutip mencerminkan konfigurasi yang diterapkan Groq atau hasil platform Vera Rubin yang lebih luas. Performa inferensi dunia nyata bergantung pada arsitektur model, panjang input dan output, batching, jaringan, pengoptimalan perangkat lunak, dan batasan tingkat layanan.

Groq mengatakan lebih dari enam juta pengembang, perusahaan Fortune 500, dan ribuan perusahaan asli AI telah membangun GroqCloud, menghasilkan triliunan token setiap minggunya di seluruh pusat data di Amerika Utara, Eropa, Timur Tengah, dan Asia-Pasifik. Sumber tersebut tidak secara independen mendokumentasikan angka-angka tersebut atau mengidentifikasi pelanggan. Groq juga dikatakan menjadi Mitra Cloud Nvidia pada bulan Agustus, yang memungkinkannya merancang, menerapkan, dan mengoperasikan komputasi yang dipercepat berdasarkan arsitektur referensi dan standar operasional Nvidia. Peran Dell digambarkan sebagai penyediaan infrastruktur terintegrasi dan kemampuan rantai pasokan global, namun pengumuman tersebut tidak memberikan jumlah sistem, lokasi fasilitas, atau jadwal pengiriman.

Detail sumber: groq.com ↗

Mengapa itu penting

Pengumuman ini menunjukkan peningkatan upaya untuk membangun infrastruktur khusus untuk inferensi: tahap ketika model AI yang terlatih menghasilkan respons bagi pengguna dan aplikasi. Inferensi yang lebih cepat dapat membuat sistem konteks panjang dan agen AI menjadi lebih responsif, namun bukti publik di sini terbatas pada klaim perusahaan dan vendor. Pengumuman tersebut tidak menentukan kapan sistem akan tersedia, berapa biayanya, atau bagaimana kinerjanya pada beban kerja di luar tolok ukur yang disebutkan.

Infrastruktur inferensi semakin menentukan seberapa cepat orang dan perangkat lunak dapat menggunakan model AI setelah model tersebut dilatih. Untuk chatbot konvensional, latensi respons yang lebih rendah dapat membuat interaksi terasa lebih cepat. Untuk agen AI yang merencanakan, mengambil informasi, menulis kode, atau memanggil layanan lain, pembuatan yang lebih cepat dapat mengurangi waktu yang dihabiskan untuk menunggu di banyak langkah berurutan. Oleh karena itu, pengumuman Groq adalah tentang lapisan penyampaian AI yang praktis, bukan model baru atau kemampuan baru yang ditunjukkan oleh model itu sendiri.

Penerapan yang diusulkan juga menggambarkan bagaimana infrastruktur AI menjadi lebih terspesialisasi. Groq memposisikan unit pemrosesan bahasa dan operasi cloud di sekitar pembuatan token, sementara Nvidia dan Dell dihadirkan sebagai mitra yang memasok platform akselerator dan sistem terintegrasi. Jika pengaturannya berfungsi seperti yang dijelaskan, pelanggan dapat memperoleh akses ke kapasitas inferensi khusus tanpa membangun dan mengoperasikan perangkat keras itu sendiri. Hal ini penting bagi perusahaan yang mencari waktu respons yang dapat diprediksi untuk layanan pelanggan, pengembangan perangkat lunak, atau aplikasi berbasis agen lainnya.

Signifikansi kepentingan publik lebih terbatas dibandingkan klaim kinerja utama. Sumber tersebut tidak menetapkan bahwa pembuatan token yang lebih cepat akan menghasilkan jawaban yang lebih baik, agen yang lebih aman, atau biaya keseluruhan yang lebih rendah. Kecepatan keluaran hanyalah salah satu bagian dari layanan AI. Pengguna juga memerlukan akurasi yang memadai, penanganan konteks, waktu aktif, keamanan, kontrol tata kelola data, dan harga yang dapat diprediksi. Sistem yang lebih cepat bahkan dapat meningkatkan permintaan infrastruktur jika sistem tersebut membuatnya lebih ekonomis untuk menjalankan lebih banyak model panggilan atau interaksi yang lebih lama.

Pengumuman ini juga relevan dengan persaingan dalam komputasi AI. Arsip internal mencakup laporan terbaru lainnya tentang sistem Nvidia, termasuk laporan terpisah bahwa perusahaan pusat data AI India memesan sistem Vera Rubin. Itu adalah peristiwa yang berbeda, bukan bukti bahwa pengerahan Groq telah dimulai. Secara keseluruhan, perkembangan tersebut menunjukkan minat pasar terhadap infrastruktur AI baru, namun sumber ini saja tidak dapat menentukan pangsa pasar, ketersediaan pasokan, atau apakah Groq akan menerima keuntungan material dibandingkan penyedia cloud lainnya.

Bagi pelanggan, pertanyaan praktisnya bukan sekadar apakah perangkat keras tersebut dapat menghasilkan angka yang tinggi. Pertanyaannya adalah apakah pengembang dapat mengaksesnya melalui API yang stabil, dengan harga yang mendukung beban kerja mereka, di wilayah tempat mereka beroperasi, dengan komitmen layanan yang dapat mereka andalkan. Tak satu pun dari kondisi tersebut ditentukan dalam pengumuman. Sumber tersebut juga tidak mengungkapkan penggunaan energi, persyaratan pendinginan, pembatasan model, atau ketentuan keamanan dan privasi yang akan mengatur penerapan di perusahaan.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Uji coba utamanya adalah apakah Groq mengubah kemitraan perangkat keras yang diumumkan menjadi kapasitas produksi yang dapat diakses secara luas. Perhatikan jadwal penerapan, harga, wilayah layanan, akses pelanggan, tolok ukur independen, dan bukti dari beban kerja nyata. Masih belum jelas bagaimana sistem baru ini akan dibandingkan dengan akselerator pesaing dalam hal total biaya, penggunaan energi, keandalan, dan jangkauan model yang dapat didukungnya.

Pertama, perhatikan bukti bahwa pengumuman tersebut telah beralih dari bahasa kemitraan ke kapasitas operasional. Groq belum memberikan tanggal ketersediaan awal, jumlah sistem yang diperkirakan akan diterapkan, lokasi pusat data yang relevan, atau porsi lalu lintas GroqCloud yang akan menggunakan perangkat keras baru tersebut. Pengumuman kapasitas, dokumentasi layanan, atau peluncuran pelanggan di kemudian hari akan memperjelas status proyek.

Kedua, perhatikan pengujian independen terhadap klaim kinerja. Perbandingan yang berguna akan melaporkan latensi end-to-end, waktu untuk token pertama, kecepatan output berkelanjutan, throughput berdasarkan permintaan bersamaan, kinerja pada jangka waktu konteks yang berbeda, dan hasil di beberapa model. Mereka juga harus menyatakan platform pesaing, tumpukan perangkat lunak, dan asumsi harga. Angka 3.400 token dari sumber dan klaim interaktivitas empat kali lipat tidak dapat menjawab pertanyaan-pertanyaan itu sendiri.

Ketiga, pelanggan dan analis harus mengkaji ekonomi. Pengumuman tersebut mengatakan bahwa platform tersebut dirancang untuk AI agen yang terukur dan berbiaya rendah, mengutip seorang eksekutif Nvidia, tetapi tidak memberikan harga per token, persyaratan kontrak, asumsi pemanfaatan, atau total biaya kepemilikan. Pengungkapan di masa depan mungkin menunjukkan apakah perangkat keras inferensi khusus menurunkan biaya pada beban kerja umum atau apakah manfaatnya terkonsentrasi pada model dan pola lalu lintas tertentu.

Keempat, perhatikan batasan operasional dan teknis penerapannya. Groq mengatakan akan menggunakan arsitektur referensi Nvidia dan infrastruktur terintegrasi Dell, namun sumbernya tidak menjelaskan kompatibilitas perangkat lunak, persyaratan migrasi, dukungan model, redundansi, residensi data, atau pengaturan respons insiden. Detail tersebut akan menentukan apakah perusahaan dapat menggunakan kapasitas tersebut untuk aplikasi sensitif atau penting bagi bisnis.

Terakhir, perhatikan apakah kapasitas baru ini mengubah cara pengembang membangun agen AI. Jika latensi yang lebih rendah tersedia secara konsisten, pengembang dapat menggunakan konteks yang lebih panjang, lebih banyak panggilan alat, atau langkah penalaran yang lebih berulang. Hal ini dapat meningkatkan daya tanggap pada beberapa aplikasi sekaligus meningkatkan konsumsi token dan permintaan infrastruktur. Pengumuman tersebut belum memberikan bukti mengenai dampak hilir tersebut, sehingga masih ada kemungkinan untuk diuji dibandingkan hasil yang sudah pasti.

Panduan & kuis terkait

Model AI DijelaskanAgen AItransformatorMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak pendanaan AI
Apakah ini berguna?