8月13日消息,xAI周三发布Grok 4.6。Artificial Analysis综合指数中,Grok 4.6得到61分,与GPT-5.6 Sol Max持平,排在Claude Opus 5的63分和Claude Fable 5的62分之后。基础API价格沿用上一版:每百万输入token 2美元、输出6美元。作为对照,Claude Opus 5 Max每百万输入token 15美元、输出75美元。

首发渠道包括Cursor、Grok Build和xAI API,同时通过OpenRouter、Vercel、Cloudflare提供。新模型支持50万token上下文,可以接收文字和图片,提供四档推理强度。

长任务是这次更新最直接的看点。在Artificial Analysis的AA-Briefcase测试中,Grok 4.6平均约用53轮完成任务,Claude Opus 5 Max约需103轮,前者消耗的输入token约为后者的四分之一。Artificial Analysis另外估算,Grok 4.6完成一项综合评测任务平均约花0.84美元。
4.6距离上一版发布约五周。马斯克称,Grok 4.7已经完成预训练,正在追加大量SpaceX数据,预计3至4周后准备就绪。

编程测试中,Grok 4.6有赢有输
综合指数只给出一个总分,具体到编程任务,几款模型的排名随测试项目变化。
Grok 4.6在CursorBench v3.2得到69.9%,超过Sol Max的67.2%,但仍低于Fable 5 Max的70.5%。DeepSWE v1.1中,它从上一版的54%升至65.9%,Sol和Fable分别为73%和70%。Terminal-Bench中,它也没有追上Sol和Fable。
几项测试考查的环境不同。CursorBench运行在Cursor构建的环境中,而Cursor参与了Grok 4.6的训练;DeepSWE和Terminal-Bench更偏向代码库、终端操作和持续解决问题。
xAI把训练重点放在长任务上
Grok 4.6的追加训练时间比4.5更长。训练材料包括模型生成的推理与技术内容以及工程数据,优化器和训练配方也做了调整。

在监督微调阶段,上一版Grok 4.5承担了生成训练样本的工作。团队让它按照不同的推理强度、智能体框架和任务领域,重新生成一批训练轨迹,再用模型检查这些材料,剔除存在问题的样本。
完成监督微调后,Grok 4.6又接受了强化学习训练,任务范围包括知识工作、通用编程、内核优化、网页开发和计算机辅助设计。
这些训练主要面向需要连续执行多步操作的长任务。按照xAI的说法,4.6在运行过程中会更频繁地停下来检查已经完成的部分,发现问题后再继续修改。
一夜0.41美元的项目账单
参与产品开发的Cursor工程师Eric Zakariasson提前数周试用了Grok 4.6,把它用于日常编程和知识工作。他说,模型速度变快后,双方的配合方式也随之改变。过去,他往往要先写一份很长的需求,尽量一次交代清楚,再等待模型完成;现在可以先让模型做一小步,查看结果后调整要求,再继续下一步。工作过程更像连续协作,不必在开始时就把所有细节写进提示词。

这种方式仍离不开人工控制。处理3D、视频和视觉效果时,他会先提供参考图,在执行过程中要求模型截图,检查画面是否符合预期,再决定怎样修改。最终效果如何验收,也要由他提前写清标准。
独立开发者OrcDev让Grok 4.6跑了一夜,做出一款类似《我的世界》(Minecraft)的小游戏,账单为0.41美元。他没有公布token构成和运行环境。

账单的另一面是阶梯定价。单次请求超过20万token后,Grok 4.6的输入和输出价格分别升至每百万4美元和12美元;缓存命中价格也从Grok 4.5的0.30美元提高到0.50美元。反复读取文件、调用工具或者失败重来,都可能抬高最终账单。
Cursor和Grok Build首周提供双倍包含用量。首周试用结束后,更长代码库里的重试次数、工具调用和最终账单会陆续出现。等更多开发者公布完整账单,才能看出0.41美元是普遍水平,还是少数项目才能达到的低成本。(易句)
(本文由AI翻译,网易编辑负责校对)