Tilbake til Nyheter
ProduktAI Understanding orientering

SpaceXAI lanserer Grok 4.6 for langvarige kodingsagenter

SpaceXAI sier at Grok 4.6 er tilgjengelig nå med et kontekstvindu på 500 000 tokener, utvidede resonneringskontroller og opplæring rettet mot vedvarende koding, forskning og interaktivt prosjektarbeid.

6 min readRead the primary source
PrimærkildedokumentKilde registrert
Utgiver
SpaceXAI's August 12 Grok 4.6 announcement and API documentation
Kilde lenke
docs.x.aihttps://docs.x.ai/developers/grok-4-6
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
XAI (Explainable AI)
Teknikker og praksis for å gjøre AI-spådommer mer transparente og forståelige.
Dataopprinnelse
Den dokumenterte opprinnelsen, eierskapet og historien til et datasett eller modellartefakt.
Test deg selvAI Agents Quiz

Hva skjedde

SpaceXAI ga ut Grok 4.6 12. august som en grensemodell rettet mot koding, agentoppgaver og kunnskapsarbeid. Selskapet sier at modellen er designet for å forbli effektiv på tvers av lengre, flertrinns jobber: undersøke et ukjent emne, analysere informasjon, endre en kodebase og gjøre en idé om til en fungerende applikasjon eller annen polert artefakt. Utgivelsen er tilgjengelig gjennom xAI API, Grok Build, Cursor og modellgatewayer inkludert OpenRouter, Vercel og Cloudflare. Det er et sendt produkt snarere enn en kunngjøring om veikart, selv om de fleste ytelsesbevis som er publisert så langt kommer fra SpaceXAI selv.

Den offisielle API-dokumentasjonen identifiserer modellen som `grok-4.6` og gir den et 500 000-token kontekstvindu. Den aksepterer tekst- og bildeinndata og produserer tekstutdata, uten noen oppgitt grense for tekstutdata. Utviklere kan velge lav, middels, høy eller x høy resonnementinnsats. SpaceXAI lister opp grunnpriser under 200 000 prompt-tokens til $2 per million input-tokens, $0,50 per million bufrede input tokens og $6 per million output tokens; meldinger over denne terskelen koster henholdsvis $4, $1 og $12. En rask variant koster det dobbelte av basisprisene. Dette er lanseringspriser og produktspesifikasjoner, ikke en garanti for ventetid, tilgjengelighet eller total arbeidsbelastningskostnad.

SpaceXAI sier at Grok 4.6 fikk en lengre tilleggstrening enn Grok 4.5. Selskapet beskriver kuratert modellgenerert materiale for resonnement og avanserte tekniske konsepter, ingeniørdata av høyere kvalitet og endringer i optimaliserings- og treningsoppskriften. Den brukte deretter Grok 4.5 til å regenerere overvåkede finjusteringsbaner på tvers av resonneringsinnstillinger, agentseler, STEM, programvareutvikling og kunnskapsarbeid, med modellbaserte kontroller som filtrerer problematiske spor. Forsterkningslæringsmiljøer dekket angivelig generell koding, kunnskapsarbeid, kjerneoptimalisering, webutvikling og datastøttet design. Kunngjøringen avslører ikke parameterantall, treningsberegning, fullstendig dataopprinnelse eller nok implementeringsdetaljer til at en ekstern gruppe kan reprodusere opplæringsprosessen.

Lanseringen legger vekt på vedvarende arbeid og produktskaping i stedet for ett isolert kodesvar. SpaceXAI sier at interne prosjekter viste sterkere førstegangspass på visuelle og interaktive applikasjoner enn Grok 4.5, etterfulgt av iterativ foredling og mer selvtesting på lengre baner. Det er en nyttig beskrivelse av den tiltenkte oppførselen, men de offentlige eksemplene er utvalgte demonstrasjoner. De fastslår ikke hvor ofte modellen oppdager sine egne feil, om verifisering fanger opp subtile regresjoner, eller hvordan ytelsen endres når en agent har begrensede verktøy, ufullstendig kontekst, et stort eldre depot eller en oppgave som kjører i timevis.

Selskapet rapporterer en Artificial Analysis Intelligence Index-score på 61, som samsvarer med poengsummen den viser for GPT-5.6 Sol og ett poeng bak Fable 5 Max. Tabellen rapporterer også 69,9 % på CursorBench 3.2, 65,9 % på DeepSWE 1.1, 61,3 % på FrontierCode 1.1 Extended, 57,5 ​​% på APEX-Agents og 26 % på Terminal-Bench 3.0. Resultatene er blandede i stedet for en universell ledelse: Tabellen plasserer andre modeller foran på flere kodings- og terminaltester. SpaceXAI sier at tredjepartsfigurer bruker de beste selvrapporterte eller offentlig tilgjengelige resultatene, så forskjeller i seler, resonnementbudsjetter og testinnstillinger forblir viktige begrensninger.

Kildedetaljer: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗

Hvorfor det betyr noe

Grok 4.6 blir med i et modellløp som i økende grad er organisert rundt agenter som kan bære et prosjekt i stedet for bare å svare på en melding. Et stort kontekstvindu, justerbar resonnement, bruk av verktøy og opplæring på lange baner kan gjøre det lettere for en utvikler eller et lite team å delegere et avgrenset stykke forskning, koding, testing og revisjon. Den praktiske verdien vil avhenge mindre av én ledertavleplassering enn om modellen kan opprettholde krav, bruke verktøy på en sikker måte og produsere arbeid som en person kan inspisere og korrigere.

For programvareteam er kontinuitet det sentrale produktkravet. Langvarige agenter må huske arkitektoniske begrensninger, forstå endringer som er gjort tidligere i en økt, unngå å angre riktig arbeid og verifisere at en reparasjon ikke ødelegger en annen del av systemet. Et vindu på 500 000 tokener gir modellen rom for mer depotkontekst og verktøyhistorikk, men kontekstkapasitet er ikke det samme som pålitelig tilbakekalling eller resonnement. Store forespørsler kan inkludere irrelevant eller motstridende materiale, koste mer over xAIs 200 000-tokens prisgrense, og fortsatt ikke inneholde den ene filen eller kravet som bestemmer det riktige svaret.

Opplæringsbeskrivelsen viser også hvordan grenselaboratorier bruker tidligere modeller for å produsere og filtrere baner for senere. Regenerering av overvåkede eksempler på tvers av flere resonnementtiltak og agentseler kan forbedre konsistensen mellom modellen og miljøene den skal operere i. Det reiser også ubesvarte spørsmål om feilarv og evalueringsuavhengighet. Hvis en modell lager treningsspor og modellbaserte kontroller avgjør hvilke spor som overlever, trenger utviklere bevis på at det resulterende systemet ikke bare blir bedre til å tilfredsstille de samme automatiserte dommerne samtidig som de beholder blindsoner som dommerne savner.

Tilgjengelighet på tvers av API, Cursor, Grok Build og gateways reduserer friksjonen ved å teste utgivelsen i eksisterende arbeidsflyter. Introduksjonstilbudet med to ganger inkludert bruk i Cursor og Grok Build i én uke kan akselerere prøveversjoner i den virkelige verden. Teamene bør fortsatt sammenligne totale oppgavekostnader, gjennomføringstid, korrigeringsinnsats og feilgjenoppretting i stedet for symbolske priser alene. Den raske varianten kan hjelpe interaktivt arbeid, men dobling av prisen per token skaper en avveining som bare testing på oppgavenivå kan løse. En langsommere modell som fullfører riktig på første forsøk kan være billigere enn en rask modell som krever gjentatt reparasjon.

Grensen for allmenne interesser er like viktig som å kode ytelse. En agent som opererer på tvers av filer, nettlesere, terminaler eller forretningssystemer kan spre en feilaktig antagelse lenger enn et vanlig chatbot-svar. SpaceXAI sier at Grok 4.6 mottok sin bredeste testpakke før distribusjon og utvidet testing etter distribusjon og tredjepartstesting, men kunngjøringen gir bare en sikkerhetsbeskrivelse på høyt nivå. Den publiserer ikke et detaljert systemkort, disaggregerte resultater for avslag og misbruk, hendelsesterskler eller bevis for hvert domene der selskapet sier at sikkerhetstiltak ble kalibrert. Brukere bør behandle sikkerhetsspråket som et leverandørkrav i påvente av mer fullstendig dokumentasjon og uavhengig testing.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Hva du skal se neste

De avgjørende bevisene vil komme fra reproduserbare tester og ordinære prosjekter etter lansering. Se om Grok 4.6 kan fullføre lange oppgaver uten å drive, om selvtestingen fanger opp reelle defekter, hvordan kostnadene endres med store kontekster og gjenforsøk, og om SpaceXAI publiserer nok sikkerhets- og evalueringsdetaljer til at utenforstående kan inspisere påstandene. Tidlig tilgjengelighet er meningsfylt; pålitelig autonomi forblir et empirisk spørsmål.

Sammenlign først modellen under samsvarende forhold. Uavhengige evaluatorer bør holde agentselen, verktøyene, øyeblikksbildet av depotet, tidsbegrensningen, tokenbudsjettet og resonnementinnsatsen konstant når de sammenligner Grok 4.6 med Grok 4.5 og konkurrerende systemer. En nyttig rapport bør inkludere fullførte oppgaver, delvise suksesser, regresjoner, ugyldige verktøykall, menneskelige inngrep, veggklokketid og totalkostnad. En enkelt referanseprosent kan ikke vise om feil er enkle å reparere eller om en agent i det stille endrer urelaterte filer mens han får et bestått testresultat.

For det andre, test langkontekstpåstanden som et systemspørsmål. Utviklere bør variere depotstørrelse og kontekstkvalitet, og deretter måle om modellen henter de riktige begrensningene, opprettholder en plan gjennom komprimering og legger merke til motsetninger introdusert tidligere i banen. Dokumentasjonen anbefaler en hurtigbuffernøkkel slik at forespørsler om rute konsekvent og hurtigbuffertreff forblir pålitelige, og den peker lange sløyfer mot kontekstkomprimering. Disse funksjonene kan forbedre økonomien og kontinuiteten, men teamene må overvåke hva komprimering fjerner og om en bufret samtale bevarer foreldede forutsetninger etter at det underliggende prosjektet endres.

For det tredje, se etter mer sikkerhet. SpaceXAI sier at sikkerhetstiltakene dekker legitim sårbarhetsoppdatering, ingeniørdesign og AI-forskning, med bred pre-distribusjon, post-distribusjon og tredjepartstesting. Den neste nyttige publikasjonen vil identifisere trusselmodeller, evalueringssett, passeringsgrenser, høyrisiko-funksjoner, kjente feilmoduser og reduksjoner på både modell- og produktlag. Den bør skille hva grunnmodellen lærte fra det Grok Build, Cursor, en API-gateway eller en kundes egen sandkasse håndhever. Uten den separasjonen kan ikke brukere fortelle hvilken sikkerhetsegenskap som følger med modellen og hvilken som avhenger av den omkringliggende applikasjonen.

Til slutt, se adopsjon utover lanseringsukens insentiver. Cursor- og Grok Build-brukere kan teste Grok 4.6 umiddelbart, mens API-kunder kan velge vanlig eller raskere slutning. Vedvarende bruk, offentlige obduksjonsundersøkelser og sammenligninger på oppgavenivå vil vise om modellens sterkere interaktive førstepasseringer oversettes til vedlikeholdbar programvare og nyttige forskningsartefakter. SpaceXAI har sendt et nytt materialalternativ med konkrete spesifikasjoner. Det som forblir ukjent er hvor pålitelig det opprettholder autonomt arbeid i rotete produksjonsmiljøer, der tillatelser, ufullstendige krav, endring av filer og menneskelig vurdering betyr like mye som rå benchmark-evne.

Relaterte guider og quizer

AI-agenterAI-modeller forklartAI-kodingAI-sikkerhetTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?