Haberlere Geri Dön
EndüstriAI Understanding brifing

Groq, yapay zeka çıkarımı için Nvidia Groq 3 LPX ve Vera Rubin NVL72'yi kullanacağını söyledi

Groq, çıkarım bulutunda Nvidia Groq 3 LPX ve Vera Rubin NVL72 sistemlerini dağıtmak için Dell Technologies ile birlikte çalıştığını ve geniş bağlamlı ve aracılı yapay zeka iş yükleri için daha hızlı yanıtlar vaat ettiğini söylüyor. Şirket, performans iddialarına ilişkin bir dağıtım tarihi, müşteri listesi veya bağımsız doğrulama sunmadı.

6 min readRead the primary source
Source-provided image accompanying Groq says it will deploy Nvidia Groq 3 LPX and Vera Rubin NVL72 for AI inference
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
groq.com
Kaynak bağlantısı
groq.comhttps://groq.com/blog/groq-among-the-first-to-bring-nvidia-groq-3-lpx-and-vera-rubin-nvl72-to-market
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Çıkarım
Eğitilmiş bir modelin tahminler veya çıktılar ürettiği çalışma zamanı aşaması.
Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Yapay Zeka Temsilcisi
Bir hedefe ulaşmak için genellikle araçları ve hafızayı kullanarak gözlemleyebilen, mantık yürütebilen ve harekete geçebilen bir yazılım sistemi.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Groq, 24 Ağustos'ta Nvidia Groq 3 LPX'i ilk benimseyenlerden biri olacağını ve donanımı, amaca yönelik olarak oluşturulmuş yapay zeka çıkarım bulutunda Nvidia Vera Rubin NVL72 ile birlikte dağıtmayı planladığını duyurdu. Groq, Dell Technologies'in sistemlerin dağıtımına yardımcı olacağını ve kapasitenin sonunda GroqCloud kullanan geliştiricilerin, kuruluşların ve yapay zeka şirketlerinin kullanımına sunulacağını söyledi.

Groq, Nvidia Vera Rubin NVL72 sistemlerinde token oluşturma hızını artırmayı amaçlayan bir çıkarım hızlandırıcı olarak tanımladığı Nvidia Groq 3 LPX'i ilk benimseyenlerden biri olacağını söyledi. Groq, altyapıyı amaca yönelik olarak oluşturulmuş yapay zeka çıkarım bulutuna dağıtmak için Dell Technologies ile birlikte çalıştığını söyledi. Duyuru, tamamlanmış bir lansmanı değil, planlı bir genişlemeyi anlatıyor: Kapasite çevrimiçi olduğunda şirket, bunun işletmelerin ve yapay zeka şirketlerinin donanımı üretim iş yüklerinde kullanmaları için erken bir yol sağlayacağını söyledi.

Şirketler, bu hareketi, yazılımın bir görevi yerine getirirken birden fazla model çağrısı oluşturabildiği geniş bağlamlı uygulamalar ve aracılı yapay zeka için tekrarlanan, hızlı model yanıtları etrafında çerçeveledi. Groq, Yapay Analiz kıyaslamasında 100.000 jeton bağlamıyla Gemma 4 31B'yi çalıştıran saniyede 3.400 çıkış jetonu da dahil olmak üzere Nvidia tarafından yayınlanan performans rakamlarını gösterdi. Groq ayrıca en yakın alternatif platforma göre dört kat daha yüksek etkileşim iddiasını yineledi ve bazı kodlama görevlerinin saatler yerine dakikalar içinde tamamlanabileceğini söyledi.

Bu rakamlar Groq tarafından sunulan ve kısmen Nvidia'nin yayınlanan sonuçlarına atfedilen iddialardır; kaynak hiçbir test kurulumu, karşılaştırma donanımı, gecikme dağıtımı, fiyatlandırma varsayımları veya bağımsız çoğaltma sağlamaz. Ayrıca belirtilen kıyaslamanın Groq'un konuşlandırılan konfigürasyonunu mu yoksa daha geniş bir Vera Rubin platformu sonucunu mu yansıttığını da belirtmiyor. Gerçek dünyadaki çıkarım performansı, model mimarisine, giriş ve çıkış uzunluğuna, toplu işleme, ağ oluşturma, yazılım optimizasyonu ve hizmet düzeyi kısıtlamalarına bağlıdır.

Groq, altı milyondan fazla geliştiricinin, Fortune 500 kuruluşunun ve binlerce yapay zeka yerli şirketinin GroqCloud'u temel alarak Kuzey Amerika, Avrupa, Orta Doğu ve Asya-Pasifik'teki veri merkezlerinde her hafta trilyonlarca token ürettiğini söyledi. Kaynak bu rakamları bağımsız olarak belgelemiyor veya müşterilerin kimliğini belirtmiyor. Ayrıca Groq'un Ağustos ayında Nvidia Bulut Ortağı haline geldiğini ve bunun, Nvidia'nin referans mimarisine ve operasyonel standartlarına dayalı olarak hızlandırılmış bilgi işlem tasarlamasına, dağıtmasına ve çalıştırmasına izin verdiğini söylüyor. Dell'in rolü entegre altyapı ve küresel tedarik zinciri yetenekleri sağlamak olarak tanımlanıyor ancak duyuruda sistem miktarları, tesis konumları veya teslimat zaman çizelgesi belirtilmiyor.

Kaynak ayrıntıları: groq.com ↗

Neden önemli?

Duyuru, özellikle çıkarım için altyapı oluşturmaya yönelik artan çabaya işaret ediyor: eğitimli yapay zeka modellerinin kullanıcılar ve uygulamalar için yanıtlar ürettiği aşama. Daha hızlı çıkarım, uzun bağlamlı sistemleri ve yapay zeka aracılarını daha duyarlı hale getirebilir ancak buradaki kamuya açık kanıtlar şirket ve satıcı iddialarıyla sınırlıdır. Duyuruda, sistemlerin ne zaman kullanıma sunulacağı, maliyetinin ne olacağı veya belirtilen kriterlerin ötesinde iş yüklerinde nasıl performans gösterecekleri belirtilmedi.

Çıkarım altyapısı, insanların ve yazılımın, bu modeller eğitildikten sonra yapay zeka modellerini ne kadar hızlı kullanabileceğini giderek daha fazla belirliyor. Geleneksel bir sohbet robotu için daha düşük yanıt gecikmesi, etkileşimin daha hızlı olmasını sağlayabilir. Bilgiyi planlayan, alan, kod yazan veya diğer hizmetleri çağıran bir yapay zeka aracısı için daha hızlı üretim, birçok ardışık adımda beklemek için harcanan süreyi azaltabilir. Groq'un duyurusu bu nedenle yeni bir model veya modelin kendisi tarafından gösterilen yeni bir yetenek değil, yapay zekanın pratik dağıtım katmanıyla ilgilidir.

Önerilen dağıtım aynı zamanda yapay zeka altyapısının nasıl daha uzmanlaşmış hale geldiğini de gösteriyor. Groq, dil işleme birimlerini ve bulut operasyonlarını token üretimi etrafında konumlandırırken Nvidia ve Dell, hızlandırıcı platformunu ve entegre sistemleri sağlayan ortaklar olarak sunuluyor. Düzenleme açıklandığı gibi çalışırsa müşteriler, donanımı kendileri oluşturup çalıştırmadan özel çıkarım kapasitesine erişim kazanabilirler. Bu, müşteri hizmetleri, yazılım geliştirme veya diğer aracı tabanlı uygulamalar için öngörülebilir yanıt süreleri arayan şirketler için önemli olabilir.

Kamu yararının önemi, manşetteki performans iddialarının önerdiğinden daha sınırlıdır. Kaynak, daha hızlı token üretiminin daha iyi yanıtlar, daha güvenli aracılar veya daha düşük genel maliyetler üreteceğini kanıtlamıyor. Çıkış hızı yapay zeka hizmetinin yalnızca bir parçasıdır. Kullanıcılar ayrıca yeterli doğruluk, bağlam yönetimi, çalışma süresi, güvenlik, veri yönetimi kontrolleri ve öngörülebilir fiyatlandırmaya da ihtiyaç duyar. Daha hızlı sistemler, daha fazla model çağrısını veya daha uzun etkileşimleri çalıştırmayı ekonomik hale getirirse altyapı talebini bile artırabilir.

Duyuru aynı zamanda yapay zeka bilişimindeki rekabetle de ilgilidir. Dahili arşiv, Hintli bir yapay zeka veri merkezi firmasının Vera Rubin sistemleri sipariş ettiğine dair ayrı bir rapor da dahil olmak üzere Nvidia sistemleri hakkında diğer yeni raporları içeriyor. Bu ayrı bir olaydır, Groq'un konuşlandırılmasının başladığının kanıtı değildir. Birlikte ele alındığında, bu tür gelişmeler pazarın yeni yapay zeka altyapısına olan ilgisini gösteriyor ancak bu kaynak tek başına pazar payını, tedarik kullanılabilirliğini veya Groq'un diğer bulut sağlayıcılarına göre maddi bir avantaj elde edip etmeyeceğini belirleyemez.

Müşteriler için pratik soru, donanımın yüksek bir kıyaslama numarası üretip üretemeyeceği değildir. Geliştiricilerin, faaliyet gösterdikleri bölgelerde iş yüklerini destekleyen bir fiyatla, güvenebilecekleri hizmet taahhütleriyle kararlı API'ler aracılığıyla buna erişip erişemeyecekleri önemlidir. Duyuruda bu koşulların hiçbiri belirtilmemiştir. Kaynak ayrıca enerji kullanımını, soğutma gereksinimlerini, model kısıtlamalarını veya kurumsal dağıtımları yönlendirecek güvenlik ve gizlilik koşullarını da açıklamıyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Önemli test, Groq'un duyurulan donanım ortaklığını geniş çapta erişilebilir üretim kapasitesine dönüştürüp dönüştürmeyeceği olacak. Dağıtım programını, fiyatlandırmayı, hizmet bölgelerini, müşteri erişimini, bağımsız karşılaştırmaları ve gerçek iş yüklerinden elde edilen kanıtları izleyin. Ayrıca yeni sistemlerin toplam maliyet, enerji kullanımı, güvenilirlik ve destekleyebilecekleri model yelpazesi açısından rakip hızlandırıcılarla nasıl karşılaştırılacağı da belirsizliğini koruyor.

İlk olarak, duyurunun ortaklık dilinden işletme kapasitesine geçtiğine dair kanıtları izleyin. Groq, ilk kullanılabilirlik tarihi, dağıtmayı beklediği sistem sayısı, ilgili veri merkezlerinin konumları veya yeni donanımı kullanacak GroqCloud trafiğinin kısmı hakkında bir tarih vermedi. Daha sonraki bir kapasite duyurusu, hizmet dokümantasyonu veya müşteriye sunulması projenin durumunu açıklığa kavuşturacaktır.

İkinci olarak, performans iddialarının bağımsız testlerini izleyin. Yararlı karşılaştırmalar, uçtan uca gecikmeyi, ilk jetona kadar geçen süreyi, sürdürülebilir çıktı hızını, eşzamanlı talep altında verimi, farklı bağlam uzunluklarındaki performansı ve çeşitli modellerdeki sonuçları raporlayacaktır. Ayrıca rakip platformu, yazılım yığınını ve fiyatlandırma varsayımlarını da belirtmelidirler. Kaynağın 3.400 jetonluk rakamı ve dört kat etkileşim iddiası bu sorulara tek başına cevap veremez.

Üçüncüsü, müşteriler ve analistler ekonomiyi incelemelidir. Duyuru, Nvidia yöneticisinden alıntı yaparak platformun ölçeklenebilir, düşük maliyetli aracı yapay zeka için tasarlandığını söylüyor ancak token başına fiyat, sözleşme koşulları, kullanım varsayımları veya toplam sahip olma maliyeti sunmuyor. Gelecekteki açıklamalar, özel çıkarım donanımının ortak iş yüklerinde maliyetleri düşürüp düşürmediğini veya faydalarının belirli modellerde ve trafik modellerinde yoğunlaşıp yoğunlaşmadığını gösterebilir.

Dördüncüsü, dağıtımın operasyonel ve teknik sınırlarını izleyin. Groq, Nvidia'nin referans mimarisini ve Dell'in entegre altyapısını kullanacağını söylüyor ancak kaynak, yazılım uyumluluğunu, geçiş gereksinimlerini, model desteğini, yedekliliği, veri yerleşimini veya olay-müdahale düzenlemelerini açıklamıyor. Bu ayrıntılar, kuruluşların kapasiteyi hassas veya iş açısından kritik uygulamalar için kullanıp kullanamayacağını belirleyecek.

Son olarak, yeni kapasitenin geliştiricilerin yapay zeka aracıları oluşturma biçimini değiştirip değiştirmediğini izleyin. Daha düşük gecikme süresi tutarlı bir şekilde mevcutsa, geliştiriciler daha uzun bağlamlar, daha fazla araç çağrısı veya daha fazla yinelemeli akıl yürütme adımları kullanabilir. Bu, token tüketimini ve altyapı talebini artırırken bazı uygulamalardaki yanıt verme hızını da artırabilir. Duyuru, bu aşağı yönlü etkiler hakkında henüz bir kanıt sunmuyor, dolayısıyla bunlar, belirlenmiş sonuçlar yerine test etme olasılıkları olmaya devam ediyor.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka AracılarıTransformatörlerYapay Zekanın GeleceğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınYapay zeka fon takibini takip edin
Bunu yararlı buldunuz mu?