뉴스로 돌아가기
제품AI Understanding 브리핑

SpaceXAI, 장기 실행 코딩 에이전트용 Grok 4.6 출시

SpaceXAI에 따르면 Grok 4.6은 현재 500,000개의 토큰 컨텍스트 창, 확장된 추론 제어, 지속적인 코딩, 연구 및 대화형 프로젝트 작업을 목표로 하는 교육을 통해 사용할 수 있습니다.

6 min readRead the primary source
기본 소스 문서녹음된 소스
출판사
SpaceXAI's August 12 Grok 4.6 announcement and API documentation
소스 링크
docs.x.aihttps://docs.x.ai/developers/grok-4-6
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

API(애플리케이션 프로그래밍 인터페이스)
한 소프트웨어 시스템이 다른 시스템에 요청을 보내고 응답을 받는 구조화된 방식입니다.
XAI(설명 가능한 AI)
AI 예측을 더욱 투명하고 이해하기 쉽게 만드는 기술과 사례입니다.
데이터 출처
데이터 세트 또는 모델 아티팩트의 문서화된 출처, 소유권 및 기록입니다.
자신을 테스트해 보세요AI 에이전트 퀴즈

무슨 일이 일어났나요?

SpaceXAI는 8월 12일 코딩, 에이전트 작업 및 지식 작업을 목표로 하는 프론티어 모델로 Grok 4.6을 출시했습니다. 이 회사는 이 모델이 익숙하지 않은 주제 연구, 정보 분석, 코드베이스 변경, 아이디어를 작동 중인 애플리케이션이나 기타 세련된 결과물로 전환하는 등 장기간의 다단계 작업에서 효율성을 유지하도록 설계되었다고 말합니다. 이 릴리스는 xAI API, Grok Build, Cursor 및 OpenRouter, Vercel, Cloudflare를 포함한 모델 게이트웨이를 통해 제공됩니다. 지금까지 발표된 대부분의 성능 증거는 SpaceXAI 자체에서 나온 것이지만 로드맵 발표라기보다는 출시된 제품입니다.

공식 API 문서는 모델을 'grok-4.6'으로 식별하고 500,000개의 토큰 컨텍스트 창을 제공합니다. 명시된 텍스트 출력 제한 없이 텍스트 및 이미지 입력을 허용하고 텍스트 출력을 생성합니다. 개발자는 낮음, 중간, 높음 또는 높음 추론 노력을 선택할 수 있습니다. SpaceXAI는 입력 토큰 백만 개당 2달러, 캐시된 입력 토큰 백만 개당 0.50달러, 출력 토큰 백만 개당 6달러로 프롬프트 토큰 200,000개 미만의 기본 가격을 제시합니다. 해당 임계값을 초과하는 메시지는 각각 $4, $1, $12의 비용이 듭니다. 빠른 변형은 기본 요율의 두 배입니다. 이는 출시 가격 및 제품 사양이며 대기 시간, 가용성 또는 총 워크로드 비용을 보장하지 않습니다.

SpaceXAI는 Grok 4.6이 Grok 4.5보다 더 긴 보충 훈련을 받았다고 말합니다. 이 회사는 추론 및 고급 기술 개념, 고품질 엔지니어링 데이터, 최적화 프로그램 및 교육 레시피에 대한 변경 사항을 위해 엄선된 모델 생성 자료를 설명합니다. 그런 다음 Grok 4.5를 사용하여 문제 추적을 필터링하는 모델 기반 검사를 통해 추론 설정, 에이전트 하네스, STEM, 소프트웨어 엔지니어링 및 지식 작업 전반에 걸쳐 감독된 미세 조정 궤적을 재생성했습니다. 강화 학습 환경에는 일반 코딩, 지식 작업, 커널 최적화, 웹 개발 및 컴퓨터 지원 설계가 포함된 것으로 알려졌습니다. 이 발표에서는 매개변수 수, 학습 계산, 완전한 데이터 출처 또는 외부 그룹이 학습 프로세스를 재현할 수 있는 충분한 구현 세부 정보를 공개하지 않습니다.

이번 출시에서는 하나의 독립적인 코딩 답변보다는 지속적인 작업과 제품 생성을 강조합니다. SpaceXAI는 내부 프로젝트가 Grok 4.5보다 시각적 및 대화형 응용 프로그램에 대한 더 강력한 첫 번째 통과를 보여주었고 그 뒤를 이어 반복적 개선과 더 긴 궤적에 대한 더 많은 자체 테스트를 보여주었다고 말합니다. 이는 의도된 동작에 대한 유용한 설명이지만 공개 예제는 선택된 데모입니다. 모델이 자체 오류를 감지하는 빈도, 확인에서 미묘한 회귀를 포착하는지 여부, 에이전트에 제한된 도구, 불완전한 컨텍스트, 대규모 레거시 저장소 또는 몇 시간 동안 실행되는 작업이 있을 때 성능이 어떻게 변경되는지는 설정하지 않습니다.

이 회사는 인공 분석 지능 지수 점수를 61점으로 보고했는데, 이는 GPT-5.6 Sol에 나열된 점수와 일치하고 Fable 5 Max보다 1점 뒤진 것입니다. 해당 테이블은 또한 CursorBench 3.2에서 69.9%, DeepSWE 1.1에서 65.9%, FrontierCode 1.1 Extended에서 61.3%, APEX-Agents에서 57.5%, Terminal-Bench 3.0에서 26%를 보고합니다. 결과는 범용 리드가 아니라 혼합되어 있습니다. 표는 여러 코딩 및 터미널 테스트에서 다른 모델을 앞서게 합니다. SpaceXAI는 제3자 수치가 자체 보고되거나 공개적으로 이용 가능한 최상의 결과를 사용하므로 하네스, 추론 예산 및 테스트 설정의 차이가 여전히 중요한 한계로 남아 있다고 말합니다.

소스 세부정보: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗

왜 중요한가요?

Grok 4.6은 단순히 프롬프트에 응답하는 것이 아니라 프로젝트를 수행할 수 있는 에이전트를 중심으로 점점 더 조직화되는 모델 경쟁에 합류합니다. 대규모 컨텍스트 창, 조정 가능한 추론, 도구 사용 및 긴 궤적에 대한 교육을 통해 개발자나 소규모 팀이 제한된 연구, 코딩, 테스트 및 수정 작업을 더 쉽게 위임할 수 있습니다. 실용적인 가치는 모델이 요구 사항을 유지하고, 도구를 안전하게 사용하고, 사람이 검사하고 수정할 수 있는 작업을 생성할 수 있는지 여부보다 순위표 위치에 덜 좌우됩니다.

소프트웨어 팀의 경우 연속성은 제품의 핵심 주장입니다. 장기 실행 에이전트는 아키텍처 제약 조건을 기억하고, 세션 초기에 적용된 변경 사항을 이해하고, 올바른 작업을 실행 취소하지 않고, 수정 사항이 시스템의 다른 부분을 손상시키지 않는지 확인해야 합니다. 500,000개의 토큰 창은 더 많은 저장소 컨텍스트 및 도구 기록을 위한 모델 공간을 제공하지만 컨텍스트 용량은 신뢰할 수 있는 회상 또는 추론과 동일하지 않습니다. 큰 프롬프트에는 관련이 없거나 충돌하는 자료가 포함될 수 있고 xAI의 200,000개 토큰 가격 임계값을 초과하는 비용이 들며 여전히 정답을 결정하는 하나의 파일이나 요구 사항을 포함하지 못할 수 있습니다.

교육 설명은 또한 개척 연구소가 이전 모델을 사용하여 이후 모델의 궤적을 제조하고 필터링하는 방법을 보여줍니다. 여러 추론 노력과 에이전트 활용을 통해 지도 예제를 재생성하면 모델과 모델이 작동할 환경 간의 일관성이 향상될 수 있습니다. 또한 오류 상속 및 평가 독립성에 대한 답이 없는 질문도 제기됩니다. 하나의 모델이 훈련 추적을 생성하고 모델 기반 검사가 어떤 추적이 유지되는지 결정하는 경우 개발자에게는 결과 시스템이 동일한 자동화된 판단을 만족시키는 동시에 판단이 놓친 맹점을 유지하는 데 더 이상 개선되지 않는다는 증거가 필요합니다.

API, Cursor, Grok Build 및 게이트웨이 전반에 걸친 가용성은 기존 워크플로우에서 릴리스 테스트 시 발생하는 마찰을 줄여줍니다. 일주일 동안 Cursor 및 Grok Build에 포함된 사용량의 두 배를 소개하는 제안으로 실제 시험 기간이 가속화될 수 있습니다. 팀은 토큰 가격만 비교하기보다는 총 작업 비용, 완료 시간, 수정 노력 및 오류 복구를 비교해야 합니다. 빠른 변형은 대화형 작업에 도움이 될 수 있지만 토큰당 가격을 두 배로 늘리면 작업 수준 테스트에서만 해결할 수 있는 절충점이 발생합니다. 첫 번째 시도에서 올바르게 완료되는 느린 모델은 반복적인 수리가 필요한 빠른 모델보다 저렴할 수 있습니다.

공익 경계는 코딩 성능만큼 중요합니다. 파일, 브라우저, 터미널 또는 비즈니스 시스템 전반에서 작동하는 에이전트는 기존 챗봇 답변보다 더 멀리 잘못된 가정을 전파할 수 있습니다. SpaceXAI는 Grok 4.6이 가장 광범위한 배포 전 테스트 제품군과 확장된 배포 후 및 타사 테스트를 받았다고 밝혔지만 이번 발표에서는 높은 수준의 안전 설명만 제공되었습니다. 자세한 시스템 카드, 세분화된 거부 및 오용 결과, 사고 임계값 또는 회사에서 안전 장치가 조정되었다고 말하는 모든 도메인에 대한 증거를 게시하지 않습니다. 사용자는 안전 언어를 완전한 문서화 및 독립적인 테스트가 진행 중인 공급업체의 주장으로 취급해야 합니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
대화형 개념 확인+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

다음에 무엇을 볼 것인가

결정적인 증거는 출시 후 재현 가능한 테스트와 일반 프로젝트에서 나올 것입니다. Grok 4.6이 드리프트 없이 긴 작업을 완료할 수 있는지, 자체 테스트에서 실제 결함을 포착하는지, 대규모 컨텍스트 및 재시도에 따라 비용이 어떻게 변하는지, SpaceXAI가 외부인이 주장을 검사할 수 있도록 충분한 안전 및 평가 세부 정보를 게시하는지 여부를 살펴보세요. 조기 가용성은 의미가 있습니다. 신뢰할 수 있는 자율성은 여전히 ​​경험적인 문제로 남아 있습니다.

먼저, 일치된 조건에서 모델을 비교합니다. 독립 평가자는 Grok 4.6을 Grok 4.5 및 경쟁 시스템과 비교할 때 에이전트 하네스, 도구, 저장소 스냅샷, 시간 제한, 토큰 예산 및 추론 노력을 일정하게 유지해야 합니다. 유용한 보고서에는 완료된 작업, 부분 성공, 회귀, 잘못된 도구 호출, 사람의 개입, 벽시계 시간 및 총 비용이 포함되어야 합니다. 단일 벤치마크 비율로는 오류가 쉽게 복구되는지 여부 또는 에이전트가 테스트 통과 결과를 얻는 동안 관련 없는 파일을 자동으로 변경하는지 여부를 보여줄 수 없습니다.

둘째, 긴 컨텍스트 주장을 시스템 질문으로 테스트합니다. 개발자는 저장소 크기와 컨텍스트 품질을 변경한 다음 모델이 올바른 제약 조건을 검색하는지, 압축을 통해 계획을 유지하는지, 궤적 초기에 도입된 모순을 인지하는지 측정해야 합니다. 문서에서는 요청 경로가 일관되게 유지되고 캐시 적중이 안정적으로 유지되도록 프롬프트 캐시 키를 권장하고 컨텍스트 압축을 향한 긴 루프를 가리킵니다. 이러한 기능은 경제성과 연속성을 향상시킬 수 있지만 팀은 어떤 압축이 제거되는지, 그리고 기본 프로젝트 변경 후 캐시된 대화가 쓸모없는 가정을 유지하는지 여부를 모니터링해야 합니다.

셋째, 더 완전한 안전 공개를 찾으십시오. SpaceXAI는 자사의 보호 조치가 광범위한 배포 전, 배포 후 및 제3자 테스트를 통해 합법적인 취약성 패치, 엔지니어링 설계 및 AI 연구를 포괄한다고 밝혔습니다. 다음 유용한 간행물에서는 모델 및 제품 계층 모두에서 위협 모델, 평가 세트, 통과 임계값, 고위험 기능, 알려진 실패 모드 및 완화를 식별할 것입니다. Grok Build, Cursor, API 게이트웨이 또는 고객 자체 샌드박스가 시행하는 것에서 기본 모델이 학습한 것을 구별해야 합니다. 이러한 분리가 없으면 사용자는 어떤 안전 속성이 모델과 함께 이동하는지, 어떤 안전 속성이 주변 애플리케이션에 따라 달라지는지 알 수 없습니다.

마지막으로 출시 주 인센티브 이후의 채택을 살펴보세요. Cursor 및 Grok Build 사용자는 Grok 4.6을 즉시 테스트할 수 있으며 API 고객은 일반 추론 또는 더 빠른 추론을 선택할 수 있습니다. 지속적인 사용, 공개 사후 분석 및 작업 수준 비교를 통해 모델의 강력한 대화형 첫 번째 단계가 유지 관리 가능한 소프트웨어 및 유용한 연구 결과물로 변환되는지 여부가 표시됩니다. SpaceXAI는 구체적인 사양을 갖춘 새로운 재료 옵션을 출시했습니다. 여전히 알려지지 않은 것은 권한, 불완전한 요구 사항, 파일 변경 및 사람의 검토가 원시 벤치마크 기능만큼 중요한 지저분한 프로덕션 환경에서 자율 작업을 얼마나 안정적으로 유지하는지입니다.

관련 가이드 및 퀴즈

AI 에이전트AI 모델 설명AI 코딩AI 안전알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?