Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το NVIDIA Vera Rubin NVL72 δημοσιεύει κορυφαία αποτελέσματα MLPerf Inference v6.1

Το NVIDIA κυκλοφόρησε αποτελέσματα προεπισκόπησης που δείχνουν ότι το Vera Rubin NVL72 επιτυγχάνει έως και 3,7 φορές υψηλότερη απόδοση από το GB300 NVL72 στο Qwen3-VL και 2,5x στο DeepSeek-R1 στη σουίτα MLPerf Inference v6.1.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
blogs.nvidia.com
Σύνδεσμος πηγής
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Συμπέρασμα
Η φάση χρόνου εκτέλεσης όπου ένα εκπαιδευμένο μοντέλο δημιουργεί προβλέψεις ή εξόδους.
Μεγάλο μοντέλο γλώσσας (LLM)
Ένα μοντέλο γλώσσας εκπαιδευμένο σε τεράστια σώματα κειμένου για τη δημιουργία και ανάλυση κειμένου.
Μνήμη (μνήμη πράκτορα)
Το αποθηκευμένο πλαίσιο που χρησιμοποιεί ένας πράκτορας τεχνητής νοημοσύνης σε βήματα ή περιόδους σύνδεσης για να βελτιώσει τη συνέχεια.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Το NVIDIA υπέβαλε δεδομένα προεπισκόπησης απόδοσης για την πλατφόρμα Vera Rubin NVL72 στη σουίτα σημείων αναφοράς MLPerf v6.1, επιδεικνύοντας σημαντικές βελτιώσεις απόδοσης σε σχέση με την προηγούμενη γενιά GB300 NVL72. Τα αποτελέσματα υποδεικνύουν έως και 3,7 φορές υψηλότερη απόδοση στο σημείο αναφοράς Qwen3-VL και 2,5 φορές υψηλότερη απόδοση στο DeepSeek-R1, με γνώμονα τη συν-σχεδίαση υλικού-λογισμικού, την ακρίβεια NVFP4 και τις τεχνικές αναλύσεων σερβιρίσματος.

Το NVIDIA δημοσίευσε τα αποτελέσματα προεπισκόπησης για την πλατφόρμα Vera Rubin NVL72 στη σουίτα MLPerf v6.1, εστιάζοντας στα σημεία αναφοράς DeepSeek-R1 και Qwen3-VL. Η εταιρεία ανέφερε ότι το Vera Rubin NVL72 παρέχει έως και 3,7 φορές υψηλότερη απόδοση από το GB300 NVL72 στο Qwen3-VL σε σενάρια εκτός σύνδεσης, διακομιστή και διαδραστικά κατά τη χρήση του vLLM με το πλαίσιο συμπερασμάτων ανοιχτού κώδικα NVIDIA Dynamo. Για το σημείο αναφοράς DeepSeek-R1, χρησιμοποιώντας τη βιβλιοθήκη NVIDIA TensorRT-LLM, η απόδοση ήταν έως και 2,5 φορές υψηλότερη από την GB300 NVL72.

Τα κέρδη απόδοσης αποδίδονται στη σχεδίαση πλήρους στοίβας, συμπεριλαμβανομένων των ενισχυμένων πυρήνων Tensor, του Transformer Engine και της ακρίβειας NVFP4, η οποία μειώνει το αποτύπωμα μνήμης για τα βάρη του μοντέλου, την προσοχή και την κρυφή μνήμη KV. Οι υποβολές χρησιμοποίησαν σε μεγάλο βαθμό χωριστή εξυπηρέτηση, διαχωρίζοντας τα στάδια προπλήρωσης και αποκωδικοποίησης, μαζί με μεγάλης κλίμακας παραλληλισμό ειδικών για επίπεδα μείγματος ειδικών. Ο τομέας κλιμάκωσης NVL72, που τροφοδοτείται από NVLink έκτης γενιάς και διακόπτη NVLink, παρείχε τη βάση διασύνδεσης που ήταν απαραίτητη για αυτές τις τεχνικές σε κλίμακα rack.

Το NVIDIA τόνισε επίσης την αποδοτικότητα κλιμάκωσης, σημειώνοντας ότι η υποβολή DeepSeek-R1 κλιμακώθηκε από ένα μόνο rack GB300 NVL72 σε τέσσερα rack (288 GPU) με απόδοση κλιμάκωσης 99% στο σενάριο εκτός σύνδεσης. Σε πρακτικούς φόρτους εργασίας, ειδικά στο σημείο αναφοράς SemiAnalysis AgentX, η Vera Rubin NVL72 απέδωσε 30 φορές καλύτερη απόδοση από το GB300 NVL72 στη δοκιμή προεπισκόπησης. Ο συνεργάτης Nebius υπέβαλε επίσης αποτελέσματα προεπισκόπησης Vera Rubin NVL72, που δείχνουν παρόμοια χαρακτηριστικά απόδοσης.

Η έκδοση περιλαμβάνει αποτελέσματα από το ευρύτερο οικοσύστημα NVIDIA, με 19 συνεργάτες να υποβάλλουν δεδομένα, συμπεριλαμβανομένων των ASUS, Azure, Cisco, CoreWeave και Oracle Cloud Infrastructure. Ο NVIDIA υπέβαλε επίσης αποτελέσματα Jetson AGX Thor χρησιμοποιώντας το TensorRT Edge-LLM στο νέο σημείο αναφοράς Edge-Agentic με το Qwen3.6-27B. Τα αποτελέσματα μετά την υποβολή για το GPT-OSS-120B και το DLRMv3 έδειξαν περαιτέρω κέρδη, αλλά δεν έχουν ακόμη επαληθευτεί από το MLCommons.

Στοιχεία πηγής: blogs.nvidia.com ↗

Γιατί έχει σημασία

Αυτά τα αποτελέσματα παρέχουν συγκεκριμένες αποδείξεις της τροχιάς απόδοσης για την υποδομή συμπερασμάτων τεχνητής νοημοσύνης επόμενης γενιάς, επηρεάζοντας άμεσα την οικονομία κόστους ανά διακριτικό για οργανισμούς που αναπτύσσουν μεγάλα γλωσσικά μοντέλα. Επιδεικνύοντας σχεδόν γραμμική αποτελεσματικότητα κλιμάκωσης σε πολλαπλά rack και σημαντικά κέρδη σε φόρτους εργασίας αντιπροσώπων, τα δεδομένα βοηθούν τις επιχειρήσεις να προβλέψουν τις απαιτήσεις υποδομής και να επικυρώσουν την οικονομική βιωσιμότητα της κλιμάκωσης των αναπτύξεων τεχνητής νοημοσύνης. Αυτό έχει σημασία επειδή το κόστος συμπερασμάτων είναι ο κύριος μοχλός της κερδοφορίας και της προσβασιμότητας των προϊόντων τεχνητής νοημοσύνης.

Η πρωταρχική σημασία αυτών των αποτελεσμάτων έγκειται στην ποσοτικοποίηση των οικονομικών συμπερασμάτων. Αποδεικνύοντας ότι κάθε ράφι Vera Rubin NVL72 μπορεί να δημιουργήσει σημαντικά περισσότερα διακριτικά και να εξυπηρετήσει περισσότερους χρήστες από ένα rack GB300 NVL72, το NVIDIA παρέχει μια σαφή μέτρηση για τη μείωση κόστους ανά κουπόνι. Αυτό είναι κρίσιμο για οργανισμούς όπου το κόστος συμπερασμάτων αποτελεί σημαντικό μέρος των λειτουργικών δαπανών, καθώς μεταφράζεται άμεσα σε υψηλότερες δυνατότητες εσόδων ή χαμηλότερο κόστος υπηρεσιών για τον ίδιο φόρτο εργασίας.

Η έμφαση στην αποδοτικότητα κλιμάκωσης αντιμετωπίζει ένα κοινό σημείο πόνου στην υποδομή AI: τη μη γραμμική σχέση μεταξύ της προσθήκης υλικού και των κερδών απόδοσης. Η επίτευξη απόδοσης κλιμάκωσης 99% σε 288 GPU υποδηλώνει ότι η αρχιτεκτονική και οι διασυνδέσεις μετριάζουν αποτελεσματικά τα σημεία συμφόρησης στην επικοινωνία, επιτρέποντας στους οργανισμούς να προβλέπουν τα κέρδη απόδοσης με μεγαλύτερη ακρίβεια κατά την επέκταση των εργοστασίων τεχνητής νοημοσύνης τους.

Η συμπερίληψη σημείων αναφοράς φόρτου εργασίας αντιπροσώπων, όπως το SemiAnalysis AgentX, σηματοδοτεί μια αλλαγή στον τρόπο μέτρησης της απόδοσης της τεχνητής νοημοσύνης. Καθώς τα συστήματα τεχνητής νοημοσύνης περνούν από τις αποκρίσεις μιας στροφής στη συλλογιστική και τη δράση πολλών βημάτων, οι παραδοσιακές μετρήσεις απόδοσης ενδέχεται να μην καταγράφουν πλήρως τη χρησιμότητα. Η 30πλάσια βελτίωση της απόδοσης σε αυτόν τον συγκεκριμένο τομέα δείχνει ότι το υλικό επόμενης γενιάς είναι ειδικά βελτιστοποιημένο για τον λανθάνοντα χρόνο και τις απαιτήσεις υπολογισμού του agentic AI, ο οποίος είναι ένας αναπτυσσόμενος τομέας στις εταιρικές εφαρμογές.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Παρακολουθήστε την τελική επαλήθευση αυτών των αποτελεσμάτων από την MLCommons και την επακόλουθη κυκλοφορία της πλατφόρμας Vera Rubin στην αγορά. Επιπρόσθετα, παρακολουθήστε την υιοθέτηση του νέου σημείου αναφοράς MLPerf Endpoints για agentic , το οποίο θα τυποποιεί τις μετρήσεις απόδοσης για πράκτορες τεχνητής νοημοσύνης πολλαπλών βημάτων και παρατηρήστε πώς ανταποκρίνονται οι ανταγωνιστές σε αυτά τα συγκεκριμένα σημεία αναφοράς απόδοσης και κλιμάκωσης.

Η τελική επαλήθευση αυτών των αποτελεσμάτων προεπισκόπησης από το MLCommons είναι το άμεσο επόμενο βήμα. Μέχρι να επαληθευτεί, αυτοί οι αριθμοί είναι προκαταρκτικοί και υπόκεινται σε αλλαγές. Η επίσημη κυκλοφορία θα παρέχει την οριστική βασική γραμμή απόδοσης για την πλατφόρμα Vera Rubin.

Η διαθεσιμότητα στην αγορά και η τιμολόγηση της πλατφόρμας Vera Rubin NVL72 θα καθορίσουν τον πρακτικό αντίκτυπό της. Ενώ τα κέρδη απόδοσης τεκμηριώνονται, το κόστος του υλικού και η μεταβατική περίοδος από 300 GB θα επηρεάσουν τα ποσοστά υιοθέτησης. Οι οργανισμοί θα πρέπει να σταθμίσουν τα οφέλη απόδοσης έναντι των κεφαλαιουχικών δαπανών που απαιτούνται για την αναβάθμιση.

Η ανάπτυξη και η υιοθέτηση του σημείου αναφοράς MLPerf Endpoints για την εξαγωγή συμπερασμάτων θα είναι ζωτικής σημασίας. Καθώς αυτό το σημείο αναφοράς καθίσταται τυποποιημένο, θα παρέχει μια πιο ολοκληρωμένη εικόνα των δυνατοτήτων του συστήματος AI πέρα ​​από την ακατέργαστη απόδοση διακριτικών, δυνητικά αναδιαμορφώνοντας τον τρόπο με τον οποίο οι πωλητές εμπορεύονται και συγκρίνουν τις πλατφόρμες τους.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΕκπαίδευση AIΤο μέλλον του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;