Назад до новин
ПродуктAI Understanding брифінг

SpaceXAI випускає Grok 4.6 для довготривалих агентів кодування

SpaceXAI каже, що Grok 4.6 уже доступний із контекстним вікном із 500 000 токенів, розширеними засобами керування аргументацією та навчанням, спрямованим на безперервне кодування, дослідження та інтерактивну роботу над проектами.

6 min readRead the primary source
Першоджерельний документДжерело записано
Видавець
SpaceXAI's August 12 Grok 4.6 announcement and API documentation
Посилання на джерело
docs.x.aihttps://docs.x.ai/developers/grok-4-6
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

API (інтерфейс прикладного програмування)
Структурований спосіб для однієї програмної системи надсилати запити до іншої системи та отримувати відповіді від неї.
XAI (зрозумілий штучний інтелект)
Техніки та практики, щоб зробити прогнози AI більш прозорими та зрозумілими.
Походження даних
Задокументоване походження, право власності та історія набору даних або артефакту моделі.
Перевір себеВікторина агентів ШІ

Що сталося

SpaceXAI випустив Grok 4.6 12 серпня як передову модель, спрямовану на кодування, агентські завдання та роботу зі знаннями. У компанії стверджують, що модель розроблена, щоб залишатися ефективною в тривалих, багатоетапних роботах: дослідженні незнайомої теми, аналізі інформації, зміні кодової бази та перетворенні ідеї в робочу програму чи інший відшліфований артефакт. Випуск доступний через xAI API, Grok Build, Cursor і модельні шлюзи, включаючи OpenRouter, Vercel і Cloudflare. Це продукт, що поставляється, а не оголошення про дорожню карту, хоча більшість опублікованих на даний момент доказів продуктивності надходить від самого SpaceXAI.

Офіційна документація API ідентифікує модель як `grok-4.6` і надає їй контекстне вікно з 500 000 токенів. Він приймає введення тексту та зображень і створює текстовий вихід без встановленого обмеження на вихід тексту. Розробники можуть вибрати низькі, середні, високі або xвисокі міркування. SpaceXAI перераховує базову ціну нижче 200 000 швидких токенів: 2 долари США за мільйон вхідних токенів, 0,50 доларів США за мільйон кешованих вхідних токенів і 6 доларів США за мільйон вихідних токенів; підказки вище цього порогу коштують 4, 1 і 12 доларів відповідно. Швидкий варіант коштує вдвічі дорожче базової ціни. Це початкові ціни та специфікації продукту, а не гарантія затримки, доступності чи загальної вартості робочого навантаження.

SpaceXAI каже, що Grok 4.6 отримав довший додатковий тренувальний запуск, ніж Grok 4.5. Компанія описує підібраний матеріал, створений моделлю, для міркувань і передових технічних концепцій, інженерних даних вищої якості, а також змін до оптимізатора та рецепту навчання. Потім він використав Grok 4.5 для регенерації траєкторій контрольованого точного налаштування в налаштуваннях аргументації, джгутах агентів, STEM, розробці програмного забезпечення та роботі з знаннями, за допомогою перевірок на основі моделі, які фільтрують проблемні сліди. Повідомляється, що середовища навчання з підкріпленням охоплювали загальне кодування, роботу зі знаннями, оптимізацію ядра, веб-розробку та автоматизоване проектування. В оголошенні не розкривається кількість параметрів, навчальні обчислення, повне походження даних або достатня кількість деталей впровадження, щоб стороння група могла відтворити процес навчання.

Запуск наголошує на постійній роботі та створенні продукту, а не на одній ізольованій відповіді на кодування. SpaceXAI каже, що внутрішні проекти продемонстрували сильніші перші проходження візуальних та інтерактивних програм, ніж Grok 4.5, з подальшим повторним вдосконаленням і більшою кількістю самотестування на довших траєкторіях. Це корисний опис передбачуваної поведінки, але публічні приклади є вибраними демонстраціями. Вони не встановлюють, як часто модель виявляє власні помилки, чи перевірка вловлює тонкі регресії або як змінюється продуктивність, коли агент має обмежені інструменти, неповний контекст, велике застаріле сховище або завдання, яке виконується годинами.

Компанія повідомляє, що індекс штучного аналізу інтелекту становить 61, що відповідає оцінці GPT-5.6 Sol і на один бал відстає від Fable 5 Max. Його таблиця також повідомляє про 69,9% на CursorBench 3.2, 65,9% на DeepSWE 1.1, 61,3% на FrontierCode 1.1 Extended, 57,5% на APEX-Agents і 26% на Terminal-Bench 3.0. Результати є змішаними, а не універсальними: у таблиці інші моделі випереджають кілька тестів кодування та терміналів. SpaceXAI стверджує, що сторонні дані використовують найкращі власноручні або загальнодоступні результати, тому відмінності в джгутах, обґрунтованих бюджетах і налаштуваннях тестування залишаються важливими обмеженнями.

Деталі джерела: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗

Чому це важливо

Grok 4.6 приєднується до модельної гонки, що все більше організовується навколо агентів, які можуть виконувати проект, а не просто відповідати на підказку. Велике контекстне вікно, регульоване міркування, використання інструментів і навчання за довгими траєкторіями можуть полегшити розробнику або невеликій команді делегування обмеженої частини дослідження, кодування, тестування та перегляду. Практична цінність залежатиме не стільки від однієї позиції в таблиці лідерів, скільки від того, чи зможе модель зберегти вимоги, безпечно використовувати інструменти та виконувати роботу, яку людина може перевірити та виправити.

Для команд програмного забезпечення безперервність є центральною вимогою продукту. Довгопрацюючі агенти повинні пам’ятати архітектурні обмеження, розуміти зміни, зроблені раніше під час сеансу, уникати скасування правильної роботи та перевіряти, чи виправлення не порушує іншу частину системи. Вікно в 500 000 токенів дає модельному простору для більшого контексту сховища та історії інструментів, але ємність контексту – це не те саме, що надійне відкликання чи міркування. Великі підказки можуть включати нерелевантний або суперечливий матеріал, коштувати більше, ніж поріг ціни xAI у 200 000 токенів, і все одно не містити єдиного файлу чи вимоги, які визначають правильну відповідь.

Опис навчання також показує, як передові лабораторії використовують попередні моделі для виготовлення та фільтрації траєкторій для наступних. Регенерація підконтрольних прикладів у кількох спробах аргументації та об’єднанні агентів може покращити узгодженість між моделлю та середовищами, в яких вона працюватиме. Це також піднімає питання без відповіді про успадкування помилок і незалежність оцінювання. Якщо одна модель створює тренувальні траси, а перевірки на основі моделі вирішують, які траси виживуть, розробникам потрібні докази того, що отримана система не просто стає кращою, задовольняючи тих самих автоматизованих суддів, зберігаючи сліпі зони, які ці судді пропускають.

Доступність API, Cursor, Grok Build і шлюзів зменшує труднощі під час тестування випуску в існуючих робочих процесах. Вступна пропозиція подвійного використання в Cursor і Grok Build протягом одного тижня може прискорити реальні випробування. Команди все одно повинні порівнювати загальну вартість завдання, час виконання, зусилля з виправлення та відновлення після збою, а не лише ціни на токени. Швидкий варіант може допомогти інтерактивній роботі, але подвоєння ціни за токен створює компроміс, який може вирішити лише тестування на рівні завдання. Повільніша модель, яка правильно завершує роботу з першої спроби, може бути дешевшою, ніж швидка модель, яка потребує повторного ремонту.

Границя суспільних інтересів так само важлива, як і ефективність кодування. Агент, що працює з файлами, браузерами, терміналами чи бізнес-системами, може поширювати помилкове припущення далі, ніж звичайна відповідь чат-бота. SpaceXAI каже, що Grok 4.6 отримав найширший набір тестів перед розгортанням і розширене тестування після розгортання та сторонніми тестуваннями, але в оголошенні міститься лише опис безпеки високого рівня. Він не публікує детальну системну картку, дезагреговані результати відмови та неправильного використання, порогові значення інцидентів або докази для кожного домену, у якому, за словами компанії, були відкалібровані заходи безпеки. Користувачі повинні розглядати формулювання безпеки як заяву постачальника до повної документації та незалежного тестування.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Що дивитися далі

Вирішальний доказ буде отримано від відтворюваних тестів і звичайних проектів після запуску. Подивіться, чи може Grok 4.6 виконувати довгі завдання без дрейфу, чи його самотестування виявляє реальні дефекти, як його вартість змінюється з великими контекстами та повторними спробами, і чи SpaceXAI публікує достатньо деталей безпеки та оцінки, щоб сторонні могли перевірити заяви. Рання доступність має значення; надійна автономія залишається емпіричним питанням.

Спочатку порівняйте модель за відповідних умов. Порівнюючи Grok 4.6 з Grok 4.5 і конкуруючими системами, незалежні оцінювачі повинні підтримувати постійні параметри агента, інструменти, знімок репозиторію, часовий ліміт, бюджет токенів і міркування. Корисний звіт має містити виконані завдання, часткові успіхи, регресії, недійсні виклики інструментів, втручання людини, час роботи настінного годинника та загальну вартість. Один контрольний відсоток не може показати, чи легко виправити збої, чи агент мовчки змінює непов’язані файли, отримуючи результат тесту.

По-друге, перевірте твердження з довгим контекстом як системне запитання. Розробники повинні змінювати розмір сховища та якість контексту, а потім вимірювати, чи модель отримує правильні обмеження, підтримує план шляхом ущільнення та помічає протиріччя, внесені раніше в траєкторію. Документація рекомендує ключ швидкого кешу, щоб запити маршрутизувалися послідовно, а звернення до кешу залишалися надійними, а також вказує довгі цикли на стиснення контексту. Ці функції можуть покращити економічність і безперервність, але командам потрібно відстежувати, що усуває стиснення та чи зберігає кешована бесіда застарілі припущення після того, як базовий проект зміниться.

По-третє, шукайте більш повне розкриття інформації про безпеку. SpaceXAI каже, що його гарантії охоплюють законне виправлення вразливостей, інженерне проектування та дослідження штучного інтелекту, із широким тестуванням перед розгортанням, після розгортання та сторонніми тестуваннями. У наступній корисній публікації будуть визначені моделі загроз, набори оцінок, порогові значення, можливості високого ризику, відомі режими збоїв і засоби пом’якшення як на рівні моделі, так і на рівні продукту. Він повинен відрізняти те, що базова модель навчилася від того, що Grok Build, Cursor, шлюз API або власне пісочне середовище клієнта. Без цього поділу користувачі не можуть визначити, яка властивість безпеки переміщається з моделлю, а яка залежить від навколишнього додатка.

Нарешті, спостерігайте за впровадженням поза стимулами тижня запуску. Користувачі Cursor і Grok Build можуть негайно протестувати Grok 4.6, тоді як клієнти API можуть вибрати звичайний або швидший висновок. Постійне використання, загальнодоступні аналітичні дослідження та порівняння на рівні завдань покажуть, чи ефективніші інтерактивні перші проходи моделі перетворюються на програмне забезпечення, яке можна підтримувати, і корисні дослідницькі артефакти. SpaceXAI надіслав новий матеріал із конкретними характеристиками. Залишається невідомим те, наскільки надійно він підтримує автономну роботу в безладних виробничих середовищах, де дозволи, неповні вимоги, зміна файлів і перевірка персоналом важливі не менше, ніж можливості необробленого тестування.

Пов’язані посібники та вікторини

Агенти ШІПояснення моделей AIШІ кодуванняШІ БезпекаПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?