SpaceXAI 发布 Grok 4.7 模型竞争开始转向“长时任务”

更大的基础模型、更长的强化学习训练,以及面向多小时任务的训练集,让 Grok 4.7 把竞争从单轮回答推进到持续完成复杂工作。

SpaceXAI 发布其最新旗舰模型 Grok 4.7,面向编程、Agent 与专业知识工作。标准版沿用 Grok 4.6 的价格和输出速度,现已进入 Cursor、Grok Build 和 xAI API。

xAI 没有把这次升级概括成一次普通的跑分上涨,而是把训练重点移向需要数小时完成的任务:模型能否持续调用工具、检查自己的工作,并在长上下文中保持目标不漂移。理解 Grok 4.7,要从这个变化开始。

Grok 4.7 想解决的,是长任务为何总在中途失控

短任务很容易制造模型能力的错觉:写一个函数、解释一段代码、生成一页文案,往往一两轮就能看到结果。真正拉开差距的是长任务——模型需要连续读取文件、调用工具、处理报错、记住前置约束,并在几十个步骤之后仍然知道自己在解决什么。

Grok 4.7 为此换用了比 Grok 4.6 更大的基础模型,延长强化学习训练,并把任务组合向需要数小时完成的问题倾斜。xAI 将改进概括为两点:更仔细地验证自己的工作,以及更好地管理长上下文。

它还被训练为原生理解 Grok Bot harness。Harness 可以理解为模型外部的运行环境:负责组织对话、调用工具、执行命令并保存任务状态。这里针对的是 Grok Bot 自己的工作方式,目标是让模型在对话和通用知识工作中更熟悉任务如何被组织和推进。

推理配置提供 low、medium、high(默认)和 xhigh 四档 reasoning effort。这意味着团队可以用较低投入处理日常任务,把更多计算留给复杂调试、长链路 Agent 和专业知识工作。

七项基准都超过 4.6,最大跃升出现在终端任务

Grok 4.7、Grok 4.6、GPT-5.6 Sol 与 Fable 5.1 的价格和七项基准对比
xAI 公布的价格与基准对比。各模型列使用了图中标注的 effort 档位。

这张表最清楚地说明了 Grok 4.7 的位置:它不是每一项都拿第一,但相对上一代没有出现“这边提高、那边退步”的交换。

  • 长时间编程:CursorBench 4.0 从 40.4% 提升到 46.3%。
  • 软件工程:DeepSWE v1.1 从 65.2% 提升到 71.0%。
  • 多小时终端工作:Terminal-Bench 4.0 从 20.3% 提升到 38.0%,增加 17.7 个百分点,相对提升约 87%。
  • 电气工程:EEBench 从 53.0% 提升到 64.0%。
  • 法律任务:Harvey Legal Agent 从 15.8% 提升到 19.6%。
  • 临床推理:HealthBench Professional 从 48.5% 提升到 56.7%。
  • 多小时办公任务:AA Briefcase v1.1 从 1,546 提升到 1,657。

其中 Terminal-Bench 的变化最贴近这次发布的训练主线。它衡量的不是一次代码补全,而是模型能否在终端环境里持续推进多步骤工作。38.0% 也意味着这类任务远未被“解决”,但相比 4.6,模型在长链路中维持有效工作的概率明显提高。

横向看,Grok 4.7 的优势集中在价格和部分专业任务。它在 EEBench、Harvey Legal Agent 上领先表中的 Fable 5.1 与 GPT-5.6 Sol;Fable 5.1 则在 CursorBench、Terminal-Bench、AA Briefcase 和 HealthBench 上更高,GPT-5.6 Sol 在 DeepSWE 与 HealthBench 上略高。比较时还要注意列名:Grok 4.7 使用 xHigh,4.6 使用 High,另外两款模型使用 Max;DeepSWE 中 Grok 4.7 标注为 High Effort。

长程能力的第二个落点,是交付完整文档

编程与专业文档看似是两类工作,做久之后遇到的却是同一种失败:前者要让文件、依赖和运行状态始终一致,后者要让材料、数字、论点和版式始终一致。模型只要忘掉前面的一个约束,后面的交付物就会整体走样。

这正是 xAI 把 knowledge work 与 coding 并列的原因。Grok 4.7 不只要写出局部正确的内容,还要把分散材料组织成前后一致的文档和演示。

AA Briefcase 让模型处理律师、护士、金融分析师等专业人士会遇到的多小时办公任务;GDPval 同样考察专业知识工作。官方图表中,Grok 4.7 的 GDPval Elo 为 1,695,高于 Grok 4.6 的 1,605,接近 Fable 5.1 Max 的 1,735。这说明升级方向不只是“更会写代码”,还包括能否阅读更长材料、组织信息并产出完整交付物。

这也解释了为什么 xAI 同时强调自我检查和长上下文管理。对文档、分析和演示任务来说,问题通常不是缺少一句漂亮的话,而是模型能否在大量材料中保持口径一致,把前面的证据正确带到后面的结论。

真正的价格优势,要看每个任务花多少钱

单看 token 单价只能回答“每一步贵不贵”,不能回答“把任务做完要花多少钱”。更强的模型如果少走几轮弯路,可能用更高单价换来更低总成本;便宜模型如果反复重试,也可能在长任务里更贵。

CursorBench 4.0 得分与平均单任务成本关系图
CursorBench 4.0 的得分—平均单任务成本曲线。横轴从左到右成本降低,纵轴为任务得分。

xAI 公布的 CursorBench 4.0 曲线包含同一模型的多个运行点。Fable 5.1 能达到更高的绝对得分,但对应更高的平均任务成本;在相近成本区间,Grok 4.7 的曲线高于 GPT-5.6 Sol 与 Sonnet 5。这正是官方所说的“price-performance frontier”:卖点不是所有分数第一,而是在一定预算下完成更多长程编程任务。

对实际团队而言,最值得记录的指标也应从 token 单价改成单个成功任务的总成本:把模型调用、重试次数、工具执行和人工接管都算进去,才能判断一次升级是否真的省钱。

开放世界游戏,为什么比写一个函数难

开放世界游戏不是一个功能,而是一组必须同时成立的系统:车辆要在道路上移动,行人与交通要共享场景状态,镜头、地图和速度 UI 还要跟随玩家变化。任何一部分各自看起来都不复杂,真正困难的是持续开发时不让它们彼此打架。

SpaceXAI 在发布线程中用城市驾驶演示呈现这种任务。画面里的车辆、行人、道路、建筑、迷你地图和速度 UI,对应的正是多模块持续协作,而不是一次性补全某个函数。

SpaceXAI 发布线程中的 Grok 4.7 开放世界城市演示片段。

这个例子把“多小时任务”具体化了:模型不仅要生成更多代码,还要长期维持目标、状态和多个子任务之间的关系。Grok 4.7 的训练变化,正是为了减少这类任务进行到一半时的遗忘、冲突和反复返工。

安全能力开始和任务能力一起发布

Grok 4.7 使用了一套新的 safeguard stack。xAI 把目标设为同时提高危险请求的拒绝能力,并减少对合法网络安全工作的误拒。

官方公布了两个具体结果:在 LatchBio 生物安全基准上为 62.4%;在 HackerBench v0.3 中,3.3% 的高风险双重用途提示被放行。xAI 还开始向部分网络安全合作伙伴提供邀请制的 Grok 4.7 红队能力,用于防御研究。

这条线的重要性在于,长程 Agent 获得更多工具权限后,安全不再只是聊天界面的内容过滤。模型会执行命令、操作文件并持续推进任务,危险操作的识别能力和合法任务的可用性必须同时进入产品评估。

接入生产环境,最重要的配置都在这里

维度 Grok 4.7
模型 ID grok-4.7
上下文窗口 500,000 tokens
知识截止 2026 年 5 月
输入与输出 文本、图像输入;文本输出;未设文本输出上限
API Responses API、Chat Completions
工具 Function calling、Web Search、X Search、Code Execution
推理档位 low、medium、high(默认)、xhigh
可用渠道 xAI API、Grok Build、Cursor、OpenRouter、Vercel、Cloudflare

标准版与 Grok 4.6 采用相同价格:

  • 低于 200k prompt tokens:输入 $2、缓存输入 $0.50、输出 $6 / 1M tokens。
  • 超过 200k prompt tokens:输入 $4、缓存输入 $1、输出 $12 / 1M tokens。

Grok 4.7 Fast 使用同一个模型和更快的基础设施,输出速度为标准版两倍,token 费率也为两倍。它只在 Cursor 和 Grok Build 提供,不计入 Grok Build 免费额度,也不开放公共 xAI API。

模型能力之外,三个运行配置会直接影响长任务的费用和连续性:

  1. 让缓存真正命中:Responses API 设置 prompt_cache_key,Chat Completions 使用 x-grok-conv-id,可以把同一会话路由到同一服务器,减少缓存失效后重复支付完整输入费用。
  2. 控制不断增长的上下文:工具调用很多、循环很长时,可以配合 context compaction 压缩历史,降低后续轮次的成本和延迟。
  3. 延续多轮推理状态:Responses API 会返回 reasoning.encrypted_content;把 reasoning items 原样传回下一次请求,模型可以在多轮任务中继续使用这部分状态。

需要美国数据驻留的团队还可以使用 https://us.api.x.ai/v1,推理保留在美国境内,token 价格上浮 10%。

团队该怎么判断要不要换

Grok 4.7 最值得测试的,不是一次问答,也不是单个代码补全,而是那些目前经常在中途失控的任务:跨文件改造、连续终端排错、长材料分析、完整文档和演示制作。

可以用同一组真实任务比较现有模型与 Grok 4.7,并记录三项结果:

  1. 端到端成功率:任务是否在既定验收条件下真正完成。
  2. 单个成功任务的总成本:模型费用、重试、工具调用和人工时间合计多少。
  3. 人工接管点:模型在哪一步开始忘记约束、重复报错或需要人类重新规划。

如果成功率上升、总成本下降、人工接管变少,Grok 4.7 的长程训练才真正转化成团队价值。它带来的变化不是“又一个更聪明的聊天模型”,而是把模型竞争推进到一个更严格的问题:谁能以更低的代价,把复杂工作持续做完。

来源
Introducing Grok 4.7SpaceXAI·2026-09-21·查看主材料
本站说明
基准、安全成绩和演示均来自 SpaceXAI/xAI 发布材料;API 规格与分段价格来自官方开发者文档,核对日期为 2026-09-22。