返回新闻
产品展示AI Understanding 简报

SpaceXAI 发布适用于长时间运行的编码代理的 Grok 4.6

SpaceXAI 表示,Grok 4.6 现已推出,具有 500,000 个令牌的上下文窗口、扩展的推理控制以及旨在持续编码、研究和交互式项目工作的培训。

6 min readRead the primary source
主要来源文件来源记录
出版商
SpaceXAI's August 12 Grok 4.6 announcement and API documentation
来源链接
docs.x.aihttps://docs.x.ai/developers/grok-4-6
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
XAI(可解释的人工智能)
使人工智能预测更加透明和易于理解的技术和实践。
数据来源
数据集或模型工件的记录来源、所有权和历史记录。
测试一下自己AI 代理测验

发生了什么

SpaceXAI 于 8 月 12 日发布了 Grok 4.6,作为针对编码、代理任务和知识工作的前沿模型。该公司表示,该模型旨在在较长、多步骤的工作中保持有效:研究不熟悉的主题、分析信息、更改代码库以及将想法转变为工作应用程序或其他精美的工件。该版本可通过 xAI API、Grok Build、Cursor 和模型网关(包括 OpenRouter、Vercel 和 Cloudflare)获得。尽管迄今为止发布的大多数性能证据都来自 SpaceXAI 本身,但它是一个已发货的产品,而不是一个路线图公告。

官方 API 文档将该模型标识为“grok-4.6”,并为其提供了 500,000 个令牌的上下文窗口。它接受文本和图像输入并生成文本输出,没有规定的文本输出限制。开发人员可以选择低、中、高或极高的推理工作量。 SpaceXAI 将低于 200,000 个提示代币的基本定价列为每百万输入代币 2 美元、每百万缓存输入代币 0.50 美元、每百万输出代币 6 美元;高于该阈值的提示费用分别为 4 美元、1 美元和 12 美元。快速变体的成本是基本费率的两倍。这些是发布价格和产品规格,不能保证延迟、可用性或总工作负载成本。

SpaceXAI 表示,Grok 4.6 比 Grok 4.5 接受了更长的补充训练。该公司描述了用于推理和先进技术概念的精选模型生成材料、更高质量的工程数据以及优化器和培训配方的更改。然后,它使用 Grok 4.5 重新生成跨推理设置、代理工具、STEM、软件工程和知识工作的监督微调轨迹,并通过基于模型的检查过滤有问题的痕迹。据报道,强化学习环境涵盖一般编码、知识工作、内核优化、网络开发和计算机辅助设计。该公告没有透露参数计数、训练计算、完整的数据来源或足够的实现细节供外部小组重现训练过程。

此次发布强调持续的工作和产品创造,而不是一个孤立的编码答案。 SpaceXAI 表示,内部项目在视觉和交互式应用程序方面表现出比 Grok 4.5 更强的首次通过能力,随后进行了迭代改进和对更长轨迹的更多自测试。这是对预期行为的有用描述,但公开示例是选定的演示。他们没有确定模型检测自身错误的频率,验证是否捕获微妙的回归,或者当代理的工具有限、上下文不完整、大型遗留存储库或运行数小时的任务时性能如何变化。

该公司报告的人工智能分析智能指数得分为 61,与 GPT-5.6 Sol 列出的得分相符,比《神鬼寓言 5 Max》落后一分。该表还报告了 CursorBench 3.2 上的 69.9%、DeepSWE 1.1 上的 65.9%、FrontierCode 1.1 Extended 上的 61.3%、APEX-Agents 上的 57.5% 以及 Terminal-Bench 3.0 上的 26%。结果是混合的,而不是普遍领先:该表在一些编码和终端测试中将其他模型置于领先地位。 SpaceXAI 表示,第三方数据使用最佳的自我报告或公开结果,因此工具、推理预算和测试设置的差异仍然是重要的限制。

来源详情: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗

为什么这很重要

Grok 4.6 加入了一场越来越多地围绕代理组织的模型竞赛,这些代理可以承载项目而不仅仅是回答提示。大型上下文窗口、可调整的推理、工具使用和长轨迹培训可以使开发人员或小团队更轻松地委派有限的研究、编码、测试和修订。实用价值与其说取决于排行榜的位置,不如说取决于模型是否能够保留需求、安全地使用工具以及生成人们可以检查和纠正的工作。

对于软件团队来说,连续性是产品的核心主张。长时间运行的代理必须记住架构约束,了解会话早期所做的更改,避免撤消正确的工作,并验证修复不会破坏系统的其他部分。 500,000 个令牌的窗口为模型提供了更多存储库上下文和工具历史记录的空间,但上下文容量与可靠的回忆或推理不同。大型提示可能包含不相关或冲突的材料,成本高于 xAI 的 200,000 代币定价阈值,并且仍然无法包含确定正确答案的一个文件或要求。

培训描述还展示了前沿实验室如何使用早期模型来制造和过滤后来模型的轨迹。跨多个推理工作和代理工具重新生成有监督的示例可以提高模型与其运行环境之间的一致性。它还提出了有关错误继承和评估独立性的悬而未决的问题。如果一个模型创建了训练轨迹,并且基于模型的检查决定了哪些轨迹得以保留,那么开发人员需要证据证明最终的系统不仅仅能够更好地满足相同的自动法官的要求,同时保留法官错过的盲点。

API、Cursor、Grok Build 和网关的可用性降低了在现有工作流程中测试版本的摩擦。 Cursor 和 Grok Build 中包含的使用量为一周的两倍的介绍性优惠可能会加速实际试验。团队仍应比较总任务成本、完成时间、纠正工作和故障恢复,而不是单独比较代币价格。快速变体可能有助于交互式工作,但每个代币价格加倍会产生只有任务级测试才能解决的权衡。第一次尝试就正确完成的较慢模型可能比需要重复修复的快速模型更便宜。

公共利益边界与编码性能同样重要。跨文件、浏览器、终端或业务系统操作的代理可能会将错误的假设传播得比传统聊天机器人答案更远。 SpaceXAI 表示,Grok 4.6 获得了最广泛的部署前测试套件,并扩大了部署后和第三方测试,但该公告仅提供了高级别的安全描述。它没有发布详细的系统卡、分类拒绝和滥用结果、事件阈值或该公司声称已校准安全措施的每个领域的证据。用户应将安全语言视为供应商声明,等待更完整的文档和独立测试。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

接下来看什么

决定性的证据将来自可重复的测试和启动后的普通项目。观察 Grok 4.6 是否能够在不漂移的情况下完成长时间任务,它的自测试是否发现了真正的缺陷,它的成本如何随着大环境和重试而变化,以及 SpaceXAI 是否发布了足够的安全和评估细节以供外部人员检查声明。尽早提供是有意义的;可靠的自主权仍然是一个经验问题。

首先,在匹配条件下比较模型。在将 Grok 4.6 与 Grok 4.5 和竞争系统进行比较时,独立评估者应保持代理工具、工具、存储库快照、时间限制、代币预算和推理工作不变。有用的报告应包括已完成的任务、部分成功、回归、无效工具调用、人为干预、挂钟时间和总成本。单个基准百分比无法显示故障是否易于修复,或者代理是否在获得通过测试结果的同时默默地更改了不相关的文件。

其次,将长上下文主张作为系统问题进行测试。开发人员应该改变存储库大小和上下文质量,然后测量模型是否检索正确的约束,通过压缩维护计划,并注意到轨迹中早期引入的矛盾。该文档建议使用提示缓存键,以便请求一致路由并且缓存命中保持可靠,并且它指向上下文压缩的长循环。这些功能可以提高经济性和连续性,但团队需要监控压缩删除了哪些内容,以及在底层项目更改后缓存的对话是否保留了过时的假设。

第三,寻求更全面的安全披露。 SpaceXAI 表示,其保障措施涵盖合法的漏洞修补、工程设计和人工智能研究,以及广泛的部署前、部署后和第三方测试。下一个有用的出版物将确定威胁模型、评估集、通过阈值、高风险功能、已知故障模式以及模型和产品层的缓解措施。它应该区分基本模型学到的内容与 Grok Build、Cursor、API 网关或客户自己的沙箱强制执行的内容。如果没有这种分离,用户就无法分辨哪些安全属性随模型一起移动,哪些安全属性取决于周围的应用程序。

最后,除了发布周的激励措施外,还要关注采用情况。 Cursor 和 Grok Build 用户可以立即测试 Grok 4.6,而 API 客户可以选择普通或更快的推理。持续使用、公开事后分析和任务级别比较将显示该模型更强的交互性首轮是否转化为可维护的软件和有用的研究工件。 SpaceXAI 推出了具有具体规格的材料新选项。目前尚不清楚的是,它在混乱的生产环境中如何可靠地维持自主工作,在这些环境中,权限、不完整的需求、更改文件和人工审查与原始基准测试能力一样重要。

相关指南和测验

人工智能代理人工智能模型解释人工智能编码人工智能安全测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?