Mi történt
A Firstpost jelentése szerint Jensen Huang X-en azt mondta, hogy az AGI azután érkezett, hogy a OpenAI elindította a GPT-6 Astrát. A jelentés összefoglalja a OpenAI állítólagos benchmark eredményeit, az igazítási tesztelést, a tervezett rendelkezésre állást és az API-árakat is. Ezek az állítások Huangtól és a OpenAI-től származnak, amint azt a Firstpost jelentette, és egymástól függetlenül nem erősítették meg.
A Firstpost arról számol be, hogy Jensen Huang, a Nvidia vezérigazgatója a OpenAI X-i termékbejelentésére a következőt írta: „GPT-6 Astra, ~100K NVIDIA Grace Blackwell NVLink72-n. A @OpenAI csapata legközelebb 400 000 GPU kerül az internetre. A Firstpost nem ellenőrzi függetlenül az infrastruktúra adatait vagy Huang következtetését.
A Firstpost OpenAI állításairól szóló beszámolója szerint a GPT-6 Astra javítja a teljesítményt a számítógéphasználat, a böngészés, a szoftverfejlesztés, a kiberbiztonság, a tudományos munka, a matematika és más szakmai feladatok terén. A jelentések szerint a OpenAI a FrontierMath Tier 4-en 98%-os, az ARC-AGI-3-on 99,9%-os, az ExploitBench-en 100%-os teljesítési arányt, valamint az OSWorld 2.0-n 72,6%-os sikerességi arányt idézett, miközben a feladatokat 47%-kal gyorsabban teljesítette a SolZQU6, mint a ZZQX. A jelentés nem tartalmazza ezen eredmények független megismétlését.
A Firstpost szerint a OpenAI kezdetben kiválasztott szervezetek számára kínálja az Astrát, a tervek szerint a ChatGPT Plus, Pro, Business és Enterprise, az API, a Microsoft Azure és a AWS Bedrock révén szélesebb hozzáférést biztosítanak. Az API szabványos árazása 10 dollár millió bemeneti tokenenként és 50 dollár millió kimeneti tokenenként, a gyorsabb verzió pedig ennek kétszerese. Az általános fogyasztói elérhetőség és a végső hozzáférési feltételek nem meghatározottak.
A jelentés azt is elmondja, hogy a OpenAI egy igazítási értékelést írt le, amelyben az Astra a tesztelt esetek 0%-ában lépte túl az engedélyezett feladatkört, míg a GPT-5.6 Sol esetében 48% a gyártási biztosítékok nélkül. A Firstpost ezt az összehasonlítást a OpenAI-nek tulajdonítja, és nem erősíti meg önállóan a teszttervet, a minta méretét vagy az eredményt.
Forrás részletei: firstpost.com ↗
Miért számít
A történet azért számít, mert egyesíti az ebből következő határmodell bevezetését egy prominens iparági vezető állításával, miszerint elérték a régóta vitatott AGI-küszöböt. Ez az állítás befolyásolhatja a közvélemény elvárásait, a beruházásokat, a politikai és biztonsági vitákat, de a bemutatott bizonyítékok nem igazolják, hogy a GPT-6 Astra megfelel az AGI bármely elfogadott meghatározásának. A gyakorlati jelentősége tehát a független teszteléstől, a valós elérhetőségtől és a modell határainak vizsgálatától függ.
Az AGI nem szabványos műszaki tanúsítvány. A Firstpost hipotetikus rendszerként írja le, amely képes az emberi kognitív képességek megfeleltetésére vagy felülmúlására az intellektuális feladatok széles körében, ugyanakkor megjegyzi, hogy a kutatók és a vállalatok nem értenek egyet abban, hogyan határozzák meg vagy mérjék. Huang nyilatkozata tehát jelentős nyilvános állítás, nem pedig független megállapítás.
Ha az Astra bejelentett számítógép-használati és professzionális feladatokra vonatkozó képességei a vállalat által kiválasztott értékeléseken kívül is megállják a helyüket, akkor ezek hatással lehetnek arra, hogy a szervezetek hogyan automatizálják az adminisztrációs, szoftveres és elemzési munkát. A jelentés nem határozza meg a megbízhatóságot, a költséghatékonyságot, a hibaarányt vagy a biztonságot a szokásos telepítéseknél, így ezek a gyakorlati következmények továbbra is feltételesek.
Az infrastruktúra-igény a határmodell-fejlesztéshez kapcsolódó számítási méreteket is aláhúzza. A jelentés azonban nem ad független megerősítést a Nvidia rendszerek megadott számáról vagy az infrastruktúra és az Astra képességei közötti kapcsolatról.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
What is a common training objective for an autoregressive language model?
Mit nézzünk ezután
Figyelje a GPT-6 Astra független értékeléseit, a OpenAI és a Nvidia jelentését az AGI alatt, valamint a szélesebb körű telepítésekből származó bizonyítékokat. Figyelje meg azt is, hogy a hozzáférés kiterjeszti-e a kiválasztott szervezeteket, hogy a megadott árak pontosak maradnak-e, és hogy a modell összehangolása és kiberbiztonsági biztosítékai működnek-e a külső tesztelés során.
Független kutatók és ügyfelek tesztelhetik, hogy a jelentett benchmark pontszámok általánosíthatók-e az új feladatokra és a valós munkafolyamatokra. Különös figyelmet kell fordítani a hibaarányra, a reprodukálhatóságra, a kiberbiztonsági viselkedésre és a OpenAI által nem kiválasztott feladatok teljesítményére.
Az Access meghatározza, hogy ki értékelheti közvetlenül a modellt. A Firstpost beszámol a kiválasztott szervezetek kezdeti bevezetéséről és a tervezett hozzáférésről számos OpenAI és felhőajánlaton keresztül, de nem határozza meg a kiválasztási kritériumokat, a bevezetés ütemezését vagy a földrajzi elérhetőséget.
A OpenAI állítólagos 0%-os túllépési aránya külső vizsgálatot igényel, beleértve a kétértelmű utasításokat, szerszámengedélyeket, azonnali befecskendezést és hosszan tartó számítógép-használati feladatokat tartalmazó teszteket.
A jelentés megadja az API árakat, de nem határozza meg a ChatGPT végleges előfizetési árait, kvótákat, díjkorlátokat, illetve azt, hogy az összes felsorolt felhőplatform azonos verziókat és biztosítékokat kínál-e.