무슨 일이 일어났나요?
Firstpost에 따르면 Jensen Huang은 X에서 OpenAI가 GPT-6 Astra를 출시한 후 AGI가 도착했다고 말했습니다. 이 보고서에는 또한 OpenAI가 주장한 벤치마크 결과, 정렬 테스트, 계획된 가용성 및 API 가격이 요약되어 있습니다. 이러한 주장은 Firstpost에서 보고한 Huang 및 OpenAI에서 나온 것이며 독립적으로 확인되지 않았습니다.
Firstpost에 따르면 Nvidia CEO Jensen Huang은 X에 대한 OpenAI의 제품 발표에 대해 "GPT-6 Astra, ~100K NVIDIA Grace Blackwell NVLink72에서 교육을 받았습니다. 4년 만에 ChatGPT에서 o1, Astra까지. AGI가 도착했습니다. @OpenAI 팀을 축하합니다. 400K GPU 다음에는 온라인으로 뵙겠습니다.” Firstpost는 인프라 수치나 Huang의 결론을 독립적으로 검증하지 않습니다.
OpenAI의 주장에 대한 Firstpost의 설명에 따르면 GPT-6 Astra는 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 사이버 보안, 과학 작업, 수학 및 기타 전문 작업의 성능을 향상시킵니다. OpenAI는 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100% 완료율, OSWorld 2.0에서 72.6%의 성공률을 기록했으며 GPT-5.6 Sol보다 작업을 47% 빠르게 완료한 것으로 알려졌습니다. 보고서는 이러한 결과에 대한 독립적인 복제를 제공하지 않습니다.
Firstpost에 따르면 OpenAI는 처음에 일부 조직에 Astra를 제공하고 있으며 ChatGPT Plus, Pro, Business 및 Enterprise, API, Microsoft Azure 및 AWS Bedrock을 통해 더 광범위한 액세스가 계획되어 있습니다. 백만 입력 토큰당 10달러, 출력 토큰 백만 개당 50달러의 표준 API 가격을 보고하며 더 빠른 버전의 가격은 두 배입니다. 일반 소비자 가용성 및 최종 액세스 조건은 아직 지정되지 않았습니다.
보고서는 또한 OpenAI가 생산 안전 장치가 없는 GPT-5.6 Sol의 경우 48%에 비해 테스트 사례의 0%에서 Astra가 승인된 작업 범위를 초과한 정렬 평가를 설명했다고 밝혔습니다. Firstpost는 이 비교를 OpenAI에 기인하며 테스트 설계, 표본 크기 또는 결과를 독립적으로 확인하지 않습니다.
왜 중요한가요?
이 이야기는 결과적인 개척 모델 출시와 오랫동안 논의되어 온 AGI 임계값에 도달했다는 저명한 업계 리더의 주장을 결합했기 때문에 중요합니다. 이러한 주장은 대중의 기대, 투자, 정책 및 안전 논쟁에 영향을 미칠 수 있지만 제시된 증거는 GPT-6 Astra가 합의된 AGI 정의를 충족한다는 것을 입증하지 못합니다. 따라서 실질적인 중요성은 독립적인 테스트, 실제 가용성 및 모델 한계에 대한 정밀 조사에 따라 달라집니다.
AGI는 표준화된 기술인증이 아닙니다. Firstpost는 이를 광범위한 지적 작업에 걸쳐 인간의 인지 능력과 일치하거나 초과할 수 있는 가상 시스템이라고 설명하며, 연구자와 기업은 이를 정의하거나 측정하는 방법에 대해 의견이 일치하지 않는다는 점을 지적합니다. 따라서 황의 진술은 독립적으로 확립된 결과가 아니라 중요한 공개 주장입니다.
Astra의 보고된 컴퓨터 사용 및 전문 작업 기능이 회사가 선택한 외부 평가를 유지하는 경우 조직이 관리, 소프트웨어 및 분석 작업을 자동화하는 방법에 영향을 미칠 수 있습니다. 이 보고서는 일반 배포의 안정성, 비용 효율성, 오류율 또는 안전성을 설정하지 않으므로 이러한 실질적인 의미는 조건부로 유지됩니다.
인프라 주장은 또한 프론티어 모델 개발과 관련된 컴퓨팅 규모를 강조합니다. 그러나 이 보고서는 명시된 Nvidia 시스템 수 또는 해당 인프라와 Astra의 기능 간의 관계에 대한 독립적인 확인을 제공하지 않습니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
What is a common training objective for an autoregressive language model?
다음에 무엇을 볼 것인가
GPT-6 Astra에 대한 독립적인 평가, AGI의 OpenAI 및 Nvidia의 의미에 대한 설명, 광범위한 배포에서 얻은 증거를 살펴보세요. 또한 액세스가 선택된 조직 이상으로 확장되는지, 명시된 가격이 정확한지, 외부 테스트에서 모델 정렬 및 사이버 보안 보호 장치가 작동하는지 여부를 살펴보세요.
독립적인 연구원과 고객은 보고된 벤치마크 점수가 새로운 작업과 실제 워크플로우에 일반화되는지 여부를 테스트할 수 있습니다. OpenAI에서 선택하지 않은 작업에 대한 실패율, 재현성, 사이버 보안 동작 및 성능에 특별한 주의를 기울여야 합니다.
액세스에 따라 모델을 직접 평가할 수 있는 사람이 결정됩니다. Firstpost는 일부 조직에 대한 초기 출시와 여러 OpenAI 및 클라우드 서비스를 통한 계획된 액세스를 보고하지만 선택 기준, 출시 시간표 또는 지리적 가용성은 지정하지 않습니다.
OpenAI는 승인된 범위를 초과하는 비율이 0%라고 주장하므로 모호한 지침, 도구 권한, 신속한 주입 및 장기 실행 컴퓨터 사용 작업과 관련된 테스트를 포함한 외부 검사가 필요합니다.
보고서는 API 가격을 제공하지만 최종 ChatGPT 구독 가격, 할당량, 속도 제한 또는 나열된 모든 클라우드 플랫폼이 동일한 버전 및 보호 기능을 제공하는지 여부를 설정하지 않습니다.