Terug naar Nieuws
InnovatieAI Understanding-briefing

Martin Cid meldt een betwiste AGI-claim voor de Astra van OpenAI

Martin Cid Magazine meldt dat OpenAI Astra als AGI heeft ingelijst, terwijl de referentie-evaluatie van de benchmark deze 62,7% scoorde, ver onder het door OpenAI gerapporteerde resultaat van 99,9%. Het account is niet onafhankelijk bevestigd door de opgegeven bron.

4 min readRead the linked source
Source-provided image accompanying Martin Cid reports a disputed AGI claim for OpenAI’s Astra
BronreferentieBron opgenomen
Uitgever
martincid.com
Bronlink
martincid.comhttps://www.martincid.com/technology-sv/jensen-huang-agi-claim-benchmark-gap/
Brontype
Gekoppelde bron: de status van de primaire bron is niet vastgesteld.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

AGI (kunstmatige algemene intelligentie)
Een hypothetisch AI-systeem dat de meeste intellectuele taken op menselijk niveau in vele domeinen kan uitvoeren.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Test jezelfWat is AI? Quiz

Wat is er gebeurd

Martin Cid Magazine meldt dat OpenAI en Nvidia CEO Jensen Huang het Astra-model van OpenAI publiekelijk hebben ingelijst als bewijs dat kunstmatige algemene intelligentie is gearriveerd. De outlet zegt dat OpenAI een score van 99,9% rapporteerde op ARC-AGI-3, terwijl het referentieharnas van de benchmarkorganisatie 62,7% opleverde voor hetzelfde model. De bron geeft geen onafhankelijke bevestiging van het resultaat of de beschikbaarheid van Astra.

Martin Cid Magazine meldt dat Jensen Huang op 6 september heeft gepost dat “AGI is gearriveerd” na een overstap van ChatGPT naar o1 naar Astra. De outlet zegt dat OpenAI-president Greg Brockman drie dagen eerder soortgelijke taal uit het “AGI-tijdperk” had gebruikt. Deze verklaringen worden toegeschreven aan het account van het genoemde verkooppunt; het geleverde materiaal verifieert de berichten niet onafhankelijk en biedt geen links naar primaire verklaringen.

De centraal gerapporteerde discrepantie betreft ARC-AGI-3. Volgens Martin Cid Magazine zei OpenAI dat Astra 99,9% scoorde op de , naast een gerapporteerde score van 98% op FrontierMath Tier 4. De outlet zegt dat het standaard evaluatieharnas van de ARC-AGI-3-organisatie in plaats daarvan een score van 62,7% opleverde. Martin Cid schrijft het verschil toe aan afzonderlijke evaluatieprotocollen en zegt dat de makers van de benchmarks hun referentieconditie als de geldige basis voor vergelijkingen beschouwen. De aangeleverde bron bevestigt niet onafhankelijk de scores, testomstandigheden of methodologie.

Het artikel stelt dat 62,7% nog steeds een sterk resultaat zou zijn, maar zegt dat de overgang van een hoge benchmarkscore naar een “AGI is gearriveerd”-verklaring een overeengekomen definitie van AGI vereist. Het rapporteert dat Astra op het moment van publicatie nog niet zichtbaar was in de ranglijst van Artificial Analysis’s Intelligence Index of Arena.ai, terwijl wordt opgemerkt dat afwezigheid in deze systemen geen bewijs is van slechte prestaties. Dit zijn de gerapporteerde observaties en interpretaties van het verkooppunt, en geen onafhankelijk vastgestelde bevindingen in het aangeleverde materiaal.

Brongegevens: martincid.com ↗

Waarom het ertoe doet

De gerapporteerde kloof illustreert waarom benchmarkresultaten niet los kunnen worden gezien van evaluatieprotocollen, en waarom de definitie van AGI door een bedrijf mogelijk niet buiten het bedrijf wordt geaccepteerd. Een wijd verspreide AGI-verklaring, gebaseerd op een interne evaluatie, zou investeringen, infrastructuuruitgaven, beleidsdebatten en publieke verwachtingen kunnen beïnvloeden, zelfs als de externe validatie onvolledig is. De bron plaatst de verklaring van Huang ook in de commerciële context waarin Nvidia chips levert die worden gebruikt om Astra te trainen, zonder enig bewijs van wangedrag.

Een benchmarkscore heeft alleen betekenis in relatie tot de testversie, het harnas, de toegangsvoorwaarden en de scoreregels die zijn gebruikt om de te produceren. Het gerapporteerde verschil van 37,2 procentpunt tussen het resultaat van OpenAI en het referentieresultaat van de benchmarkorganisatie is daarom van belang, ongeacht of een van beide cijfers uiteindelijk wordt herzien. Lezers mogen het hogere cijfer niet beschouwen als een veldbrede meting zonder vergelijkbare externe tests.

Het rapport legt ook een definitieprobleem bloot. AGI wordt niet bepaald door één universeel aanvaarde drempel, dus een bedrijf kan een interne mijlpaal bereiken zonder vast te stellen dat de bredere onderzoeksgemeenschap dezelfde mijlpaal zou erkennen. Martin Cid presenteert de verklaringen als potentieel gevolgvolle marktboodschappen, vooral omdat daarin wordt gemeld dat Astra is getraind op Nvidia-hardware en dat Huang OpenAI publiekelijk heeft gefeliciteerd. De bron biedt geen bewijs dat de verklaringen opzettelijk misleidend waren.

Als het verslag klopt, is de praktische implicatie dat klanten, investeerders en beleidsmakers beweringen over productcapaciteiten moeten onderscheiden van onafhankelijk reproduceerbaar bewijsmateriaal. De verstrekte bron geeft geen bewijs van de werkelijke betrouwbaarheid, algemene beschikbaarheid, prijsstelling, veiligheidsprestaties of bruikbaarheid van Astra voor het brede scala aan taken dat door AGI wordt geïmpliceerd.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Wat je nu moet bekijken

Kijk uit naar de makers van de ARC-AGI-3 die een reproduceerbaar referentieharnasresultaat publiceren of bevestigen, naar OpenAI die zijn evaluatiemethodologie onthult, en naar onafhankelijke beoordelingen van Astra. Uit de aangeleverde bron blijkt niet of de Astra algemeen verkrijgbaar is, beperkt is tot geselecteerde klanten of tegen een bepaalde prijs wordt aangeboden. Er wordt ook geen veldbrede definitie van AGI vastgelegd.

Het belangrijkste volgende bewijs zou een openbare ARC-AGI-3-evaluatie zijn onder het referentieharnas van de makers van de , met voldoende methodologische details voor onafhankelijke reproductie. Een reactie van OpenAI waarin wordt uitgelegd waarom het interne harnas een wezenlijk ander resultaat opleverde, zou ook duidelijk maken of de kloof een weerspiegeling is van prompts, toegang tot tools, taakselectie, scores of een ander protocolverschil.

Onafhankelijke classificatie- en testsystemen zouden aanvullend bewijs kunnen leveren over de capaciteiten van de Astra, maar hun afwezigheid op de publicatiedatum van het artikel mag niet als een negatief resultaat worden beschouwd. De bron zegt niet wanneer die systemen Astra kunnen evalueren en of ze toegang hebben tot het model.

De bron identificeert geen bevestigde toegangsroute of prijs. Er wordt ook niet vastgesteld of OpenAI zijn productstatus, documentatie of beleid formeel heeft gewijzigd op basis van de AGI-taal. Deze praktische details blijven onbekend en moeten worden geverifieerd voordat de Astra als algemeen verkrijgbaar of als AGI bij consensus wordt beschreven.

Gerelateerde gidsen en quizzen

Wat is AI?AI-modellen uitgelegdTransformatorenTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?