Terug naar Nieuws
ProductAI Understanding-briefing

OpenAI meldt dat de aangepaste Jalapeño-chip de AI-inferentiesnelheid en -efficiëntie verbetert

OpenAI zegt dat de eerste op maat gemaakte inferentiechip hogere prestaties per watt en een lagere latentie leverde dan vergelijkingssystemen in drie grote taalmodellen, terwijl hij in productiekwalificatie bleef voorafgaand aan een geplande implementatie aan het einde van het jaar.

6 min readRead the primary source
Source-provided image accompanying OpenAI reports custom Jalapeño chip improves AI inference speed and efficiency
Primair brondocumentBron opgenomen
Uitgever
openai.com
Bronlink
openai.comhttps://openai.com/index/jalapeno-first-results/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Gevolgtrekking
De runtimefase waarin een getraind model voorspellingen of uitvoer genereert.
Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

OpenAI publiceerde de eerste testresultaten voor Jalapeño, de eerste aangepaste inferentiechip. Het bedrijf zegt dat het systeem 1,5 tot 1,9 keer meer AI-werk per watt leverde bij piekdoorvoer en 1,7 tot 3,6 keer lagere end-to-end latentie dan vergelijkbare systemen via GPT-OSS 120B, DeepSeek R1 670B en Kimi K2.5 1T.

OpenAI zegt dat Jalapeño de eerste op maat gemaakte inferentie-chip is en dat de resultaten zijn gebaseerd op het testen van de chip samen met het eromheen gebouwde systeem. Het bedrijf evalueerde het systeem op InferenceX, een openbare van SemiAnalysis die het volledige proces van het indienen van een AI-verzoek meet. OpenAI zegt dat het Jalapeño heeft vergeleken met in de handel verkrijgbare AI-systemen op werkpunten variërend van dienstverlening met hoge doorvoer tot zeer interactief gebruik met lage latentie.

Over GPT-OSS 120B, DeepSeek R1 en Kimi K2.5 rapporteert OpenAI 1,5 tot 1,9 keer meer AI-werk per watt bij maximale doorvoer en 1,7 tot 3,6 keer lagere end-to-end latentie dan vergelijkbare systemen. Voor zeer interactieve workloads rapporteert het 2,1 tot 4,1 keer hogere prestaties. In de bijlage vergelijkt het bedrijf Jalapeño met een GB200 voor GPT-OSS 120B en met een GB300 voor DeepSeek R1 en Kimi K2.5. OpenAI zegt dat Jalapeño de Pareto-grens heeft bereikt op de geteste werkpunten, wat betekent dat het binnen die vergelijkingen een betere combinatie van doorvoer, latentie en energie-efficiëntie heeft gevonden.

Het bedrijf meldt dat Jalapeño een pakketvermogen van 700 watt heeft, terwijl het gemeten duurzame vermogen bij de geteste werkbelastingen op of onder de 550 watt bleef. De gepubliceerde vergelijkingen maken gebruik van een pakketvermogen, waaronder 1.200 watt voor de GB200 en 1.400 watt voor de GB300. Voor GPT-OSS 120B rapporteert OpenAI ongeveer 1,9 keer hogere piektokens per seconde per kilowatt en 1,7 keer lagere end-to-end latentie dan het vergelijkingssysteem. Voor de DeepSeek R1 rapporteert deze ongeveer 1,7 keer hogere piekprestaties per watt en 3,6 keer lagere latentie. Voor Kimi K2.5 rapporteert het ongeveer 1,5 keer hogere piekprestaties per watt en 3,4 keer lagere latentie.

OpenAI schrijft de resultaten toe aan een full-stack ontwerp dat de chip, het geheugen, het netwerk, de software en het rack-schaalsysteem combineert rond taalmodelworkloads. Het bedrijf zegt dat de architectuur de modelstatus, inclusief de KV-cache die tijdens het genereren wordt gebruikt, waar mogelijk lokaal houdt en de communicatievertragingen tussen cores en chips vermindert. Het beschrijft prefill als meer rekenintensief en decoderen als meer beperkt door geheugenbandbreedte, en zegt dat Jalapeño is ontworpen om beide fasen aan te kunnen. OpenAI zegt ook dat AI heeft geholpen de chip in negen maanden van het oorspronkelijke ontwerp naar de tape-out te verplaatsen en de rekenkundige circuits heeft helpen optimaliseren, maar de bron geeft geen onafhankelijk verslag van die tijdlijn of een volledig overzicht van welk ontwerpwerk is geautomatiseerd.

Brongegevens: openai.com ↗

Waarom het ertoe doet

De resultaten suggereren dat de prestaties van gevolgtrekkingen in toenemende mate afhankelijk kunnen zijn van het ontwerpen van modellen, chips, geheugen, netwerken en software als één systeem. Als de winsten op productieschaal standhouden, kunnen ze het vermogen en de hardware die nodig zijn om AI-reacties te bedienen verminderen en de workloads van interactieve agenten responsiever maken.

De centrale betekenis is een mogelijke verschuiving in de manier waarop de AI-infrastructuur wordt geoptimaliseerd. Het verhaal van OpenAI stelt dat een accelerator voor algemeen gebruik prestatieverlies kan lijden wanneer berekeningen, geheugentoegang en communicatie als afzonderlijke problemen worden behandeld. Jalapeño combineert in plaats daarvan deze elementen rond de timing en databewegingspatronen van taalmodelinferentie. Die aanpak is van belang omdat het serveren van een antwoord zowel het verwerken van de prompt als het opeenvolgend genereren van tokens inhoudt, terwijl agentische systemen deze stappen vele malen in één taak kunnen herhalen.

De gerapporteerde latentiewinst zou praktische gevolgen kunnen hebben voor interactieve AI-producten als deze de productie-implementatie overleven. OpenAI zegt dat snellere inferentie responsievere agents kan ondersteunen en het mogelijk kan maken om ultrasnelle workloads uit te voeren met efficiëntieverbeteringen die eerder geassocieerd werden met snellere of zwaarder gebatcheerde modi. De bron demonstreert deze effecten echter niet in een live klantproduct. Het presenteert benchmarkresultaten en geplande infrastructuurimplementatie, zodat de publieke impact prospectief blijft.

Energie-efficiëntie heeft ook operationele betekenis. OpenAI zegt dat het produceren van nuttiger werk met dezelfde kracht en hardware kan helpen om tegen lagere kosten aan de vraag te voldoen en de operationele hefboomwerking te verbeteren. Die bewering is plausibel als bedrijfsdoelstelling, maar de bron geeft geen informatie over de kosten per zoekopdracht, de totale systeemkosten, de koelingsvereisten, de kapitaaluitgaven, de aannames over het gebruik of het bewijs dat de gerapporteerde benchmarkratio's zich direct vertalen in lagere prijzen voor gebruikers.

Het door OpenAI beschreven ontwikkelingsproces is op zichzelf opmerkelijk. Het bedrijf zegt dat zijn modellen hebben geholpen bij het ontwerpen en op de markt brengen van Jalapeño, terwijl nieuwere modellen worden gebruikt om het te optimaliseren en te programmeren. Met behulp van Codex met GPT-Astra heeft het team naar verluidt binnen twee maanden drie open-weight-modellen die geen deel uitmaakten van het oorspronkelijke productieplan tot hoge prestaties gebracht. OpenAI zegt ook dat door AI gegenereerde implementaties 1,5 tot 1,8 keer sneller waren dan door mensen geschreven implementaties voor geselecteerde GPT-OSS-aandachts- en mix-van-experts-blokken. Deze cijfers gelden alleen voor geselecteerde blokken, niet voor complete modellen, en bewijzen niet dat AI zelfstandig een volledige productiechip kan ontwerpen of optimaliseren.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

OpenAI is van plan Jalapeño tegen eind 2026 in zijn computerinfrastructuur te gaan implementeren, maar zegt dat productiekwalificatie, softwarerijping, schaaloperaties en bredere modelvalidatie nog aan de gang zijn. De bron geeft geen onafhankelijke verificatie, bedrijfskosten, productievolume of hoe de chip zal presteren bij werklasten die verder gaan dan de geteste.

De eerste test is of Jalapeño de geplande implementatiemijlpaal bereikt. OpenAI zegt dat het van plan is de chip eind 2026 in zijn computerinfrastructuur te gaan inzetten, terwijl de productiekwalificatie en het softwarewerk doorgaan. Uitrol zou aantonen dat het systeem verder is gegaan dan benchmarkdemonstraties, maar de bron specificeert niet de initiële schaal, locaties, werklasten en ook niet of gebruikers een verandering op productniveau zullen opmerken.

Er is meer bewijs nodig over reproduceerbaarheid en vergelijkingsmethodologie. OpenAI heeft gebruik gemaakt van een openbare , maar de bron levert niet de volledige benchmarkgegevens, het aantal geteste chips of systemen, softwareversies, gebruiksniveaus, koeling en faciliteitsvermogen, of onafhankelijke validatie van de vergelijkingsresultaten. Omdat de nominale verhoudingen zijn genormaliseerd op basis van gepubliceerde chipvermogens, terwijl het aanhoudende vermogen van Jalapeño ook afzonderlijk wordt gerapporteerd, moeten lezers de efficiëntie op pakketniveau onderscheiden van de totale efficiëntie van het datacenter.

Modeldekking zal belangrijk zijn. OpenAI rapporteert resultaten voor GPT-OSS 120B, DeepSeek R1 670B en Kimi K2.5 1T, en zegt dat interne tests een groter voordeel lieten zien op geavanceerde OpenAI-modellen. De bron identificeert deze interne modellen niet en publiceert hun resultaten niet. Het zegt ook dat elke extra modelfamilie nieuwe kernels en modelspecifieke optimalisatie vereist, wat betekent dat de flexibiliteit van de chip mogelijk afhangt van doorlopend softwarewerk in plaats van alleen van hardware.

OpenAI zegt dat Gen 2 zich diep in ontwikkeling bevindt en Gen 3 vorm aan het krijgen is, terwijl hij ook benadrukt dat het accelerators van NVIDIA en andere partners zal blijven inzetten voor training en gevolgtrekking. Het betekenisvolle onbekende is daarom niet simpelweg of Jalapeño sneller is in de gerapporteerde tests, maar hoe het past in een gemengde infrastructuurstrategie, hoeveel capaciteit het zal vertegenwoordigen en of toekomstige generaties het evenwicht bewaren tussen doorvoer, latentie, efficiëntie en ondersteuning voor veranderende modelarchitecturen.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingAI-agentenToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?