Apa yang berlaku
Firstpost melaporkan bahawa Jensen Huang berkata pada X bahawa AGI telah tiba selepas OpenAI melancarkan GPT-6 Astra. Laporan itu juga meringkaskan keputusan penanda aras yang didakwa OpenAI, ujian penjajaran, ketersediaan yang dirancang dan harga API. Tuntutan ini datang daripada Huang dan OpenAI seperti yang dilaporkan oleh Firstpost dan belum disahkan secara bebas.
Firstpost melaporkan bahawa Ketua Pegawai Eksekutif Nvidia Jensen Huang bertindak balas terhadap pengumuman produk OpenAI pada X dengan menulis: "GPT-6 Astra, dilatih pada ~100K NVIDIA Grace Blackwell NVLink72. Dari ChatGPT ke o1 kepada Astra Astra telah tiba @ZAIQ1X dalam 4 tahun. pasukan 400K GPU akan datang dalam talian seterusnya.” Firstpost tidak mengesahkan angka infrastruktur atau kesimpulan Huang secara bebas.
Menurut akaun Firstpost tentang tuntutan OpenAI, GPT-6 Astra meningkatkan prestasi dalam penggunaan komputer, penyemakan imbas, kejuruteraan perisian, keselamatan siber, kerja saintifik, matematik dan tugas profesional lain. OpenAI dilaporkan memetik markah sebanyak 98% pada FrontierMath Tier 4, 99.9% pada ARC-AGI-3 dan kadar penyiapan 100% pada ExploitBench, serta kadar kejayaan 72.6% pada OSWorld 2.0 sambil menyelesaikan tugasan 47% lebih cepat daripada ZXZ.6U1Q. Laporan itu tidak menyediakan replikasi bebas keputusan ini.
Firstpost mengatakan OpenAI pada mulanya menawarkan Astra untuk memilih organisasi, dengan akses yang lebih luas dirancang melalui ChatGPT Plus, Pro, Business and Enterprise, API, Microsoft Azure dan AWS Bedrock. Ia melaporkan penetapan harga API standard sebanyak $10 setiap juta token input dan $50 setiap juta token keluaran, dengan versi yang lebih pantas berharga dua kali ganda kadar tersebut. Ketersediaan pengguna am dan syarat akses akhir kekal tidak ditentukan.
Laporan itu juga mengatakan OpenAI menerangkan penilaian penjajaran di mana Astra melebihi skop tugas yang dibenarkan dalam 0% kes yang diuji, berbanding dengan 48% untuk GPT-5.6 Sol tanpa perlindungan pengeluaran. Firstpost mengaitkan perbandingan ini kepada OpenAI dan tidak mengesahkan reka bentuk ujian, saiz sampel atau keputusan secara bebas.
Butiran sumber: firstpost.com ↗
Mengapa ia penting
Cerita ini penting kerana ia menggabungkan pelancaran model sempadan berbangkit dengan dakwaan pemimpin industri terkemuka bahawa ambang AGI yang telah lama diperdebatkan telah dicapai. Tuntutan itu boleh mempengaruhi jangkaan awam, pelaburan, dasar dan perbahasan keselamatan, tetapi bukti yang dikemukakan tidak membuktikan bahawa GPT-6 Astra memenuhi sebarang definisi AGI yang dipersetujui. Oleh itu, kepentingan praktikal bergantung pada ujian bebas, ketersediaan dunia sebenar dan penelitian had model.
AGI bukan pensijilan teknikal piawai. Firstpost menerangkannya sebagai sistem hipotetikal yang mampu memadankan atau melebihi kebolehan kognitif manusia merentas pelbagai tugas intelektual, sambil menyatakan bahawa penyelidik dan syarikat tidak bersetuju tentang cara mentakrifkan atau mengukurnya. Oleh itu, kenyataan Huang adalah tuntutan awam yang penting, bukan penemuan yang ditubuhkan secara bebas.
Jika penggunaan komputer dan keupayaan tugas profesional yang dilaporkan oleh Astra bertahan di luar penilaian yang dipilih oleh syarikat, ia boleh menjejaskan cara organisasi mengautomasikan kerja pentadbiran, perisian dan analisis. Laporan itu tidak menetapkan kebolehpercayaan, keberkesanan kos, kadar ralat atau keselamatan dalam penggunaan biasa, jadi implikasi praktikal tersebut kekal bersyarat.
Tuntutan infrastruktur juga menggariskan skala pengiraan yang dikaitkan dengan pembangunan model sempadan. Walau bagaimanapun, laporan itu tidak memberikan pengesahan bebas tentang bilangan sistem Nvidia yang dinyatakan atau hubungan antara infrastruktur tersebut dan keupayaan Astra.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Tonton penilaian bebas GPT-6 Astra, penjelasan tentang maksud OpenAI dan Nvidia dengan AGI, dan bukti daripada penggunaan yang lebih luas. Tonton juga sama ada akses berkembang melangkaui organisasi terpilih, sama ada harga yang dinyatakan kekal tepat dan sama ada penjajaran model dan perlindungan keselamatan siber berfungsi di bawah ujian luaran.
Penyelidik dan pelanggan bebas boleh menguji sama ada markah penanda aras yang dilaporkan digeneralisasikan kepada tugas baharu dan aliran kerja dunia sebenar. Perhatian khusus harus diberikan kepada kadar kegagalan, kebolehulangan, tingkah laku keselamatan siber dan prestasi pada tugas yang tidak dipilih oleh OpenAI.
Akses akan menentukan siapa yang boleh menilai model secara langsung. Firstpost melaporkan pelancaran awal untuk memilih organisasi dan akses yang dirancang melalui beberapa tawaran OpenAI dan awan, tetapi ia tidak menyatakan kriteria pemilihan, jadual pelancaran atau ketersediaan geografi.
Kadar 0% yang didakwa melebihi skop dibenarkan oleh OpenAI memerlukan pemeriksaan luaran, termasuk ujian yang melibatkan arahan samar-samar, kebenaran alat, suntikan segera dan tugasan penggunaan komputer yang berjalan lama.
Laporan itu memberikan harga API tetapi tidak menetapkan harga langganan ChatGPT muktamad, kuota, had kadar atau sama ada semua platform awan yang disenaraikan akan menawarkan versi dan perlindungan yang sama.