SpaceXAI 发布 Grok 4.7 模型竞争开始转向“长时任务”
更大的基础模型、更长的强化学习训练,以及面向多小时任务的训练集,让 Grok 4.7 把竞争从单轮回答推进到持续完成复杂工作。
SpaceXAI 发布其最新旗舰模型 Grok 4.7,面向编程、Agent 与专业知识工作。标准版沿用 Grok 4.6 的价格和输出速度,现已进入 Cursor、Grok Build 和 xAI API。
xAI 没有把这次升级概括成一次普通的跑分上涨,而是把训练重点移向需要数小时完成的任务:模型能否持续调用工具、检查自己的工作,并在长上下文中保持目标不漂移。理解 Grok 4.7,要从这个变化开始。
Grok 4.7 想解决的,是长任务为何总在中途失控
短任务很容易制造模型能力的错觉:写一个函数、解释一段代码、生成一页文案,往往一两轮就能看到结果。真正拉开差距的是长任务——模型需要连续读取文件、调用工具、处理报错、记住前置约束,并在几十个步骤之后仍然知道自己在解决什么。
Grok 4.7 为此换用了比 Grok 4.6 更大的基础模型,延长强化学习训练,并把任务组合向需要数小时完成的问题倾斜。xAI 将改进概括为两点:更仔细地验证自己的工作,以及更好地管理长上下文。
它还被训练为原生理解 Grok Bot harness。Harness 可以理解为模型外部的运行环境:负责组织对话、调用工具、执行命令并保存任务状态。这里针对的是 Grok Bot 自己的工作方式,目标是让模型在对话和通用知识工作中更熟悉任务如何被组织和推进。
推理配置提供 low、medium、high(默认)和 xhigh 四档 reasoning effort。这意味着团队可以用较低投入处理日常任务,把更多计算留给复杂调试、长链路 Agent 和专业知识工作。
七项基准都超过 4.6,最大跃升出现在终端任务
这张表最清楚地说明了 Grok 4.7 的位置:它不是每一项都拿第一,但相对上一代没有出现“这边提高、那边退步”的交换。
- 长时间编程:CursorBench 4.0 从 40.4% 提升到 46.3%。
- 软件工程:DeepSWE v1.1 从 65.2% 提升到 71.0%。
- 多小时终端工作:Terminal-Bench 4.0 从 20.3% 提升到 38.0%,增加 17.7 个百分点,相对提升约 87%。
- 电气工程:EEBench 从 53.0% 提升到 64.0%。
- 法律任务:Harvey Legal Agent 从 15.8% 提升到 19.6%。
- 临床推理:HealthBench Professional 从 48.5% 提升到 56.7%。
- 多小时办公任务:AA Briefcase v1.1 从 1,546 提升到 1,657。
其中 Terminal-Bench 的变化最贴近这次发布的训练主线。它衡量的不是一次代码补全,而是模型能否在终端环境里持续推进多步骤工作。38.0% 也意味着这类任务远未被“解决”,但相比 4.6,模型在长链路中维持有效工作的概率明显提高。
横向看,Grok 4.7 的优势集中在价格和部分专业任务。它在 EEBench、Harvey Legal Agent 上领先表中的 Fable 5.1 与 GPT-5.6 Sol;Fable 5.1 则在 CursorBench、Terminal-Bench、AA Briefcase 和 HealthBench 上更高,GPT-5.6 Sol 在 DeepSWE 与 HealthBench 上略高。比较时还要注意列名:Grok 4.7 使用 xHigh,4.6 使用 High,另外两款模型使用 Max;DeepSWE 中 Grok 4.7 标注为 High Effort。
长程能力的第二个落点,是交付完整文档
编程与专业文档看似是两类工作,做久之后遇到的却是同一种失败:前者要让文件、依赖和运行状态始终一致,后者要让材料、数字、论点和版式始终一致。模型只要忘掉前面的一个约束,后面的交付物就会整体走样。
这正是 xAI 把 knowledge work 与 coding 并列的原因。Grok 4.7 不只要写出局部正确的内容,还要把分散材料组织成前后一致的文档和演示。
AA Briefcase 让模型处理律师、护士、金融分析师等专业人士会遇到的多小时办公任务;GDPval 同样考察专业知识工作。官方图表中,Grok 4.7 的 GDPval Elo 为 1,695,高于 Grok 4.6 的 1,605,接近 Fable 5.1 Max 的 1,735。这说明升级方向不只是“更会写代码”,还包括能否阅读更长材料、组织信息并产出完整交付物。
这也解释了为什么 xAI 同时强调自我检查和长上下文管理。对文档、分析和演示任务来说,问题通常不是缺少一句漂亮的话,而是模型能否在大量材料中保持口径一致,把前面的证据正确带到后面的结论。
真正的价格优势,要看每个任务花多少钱
单看 token 单价只能回答“每一步贵不贵”,不能回答“把任务做完要花多少钱”。更强的模型如果少走几轮弯路,可能用更高单价换来更低总成本;便宜模型如果反复重试,也可能在长任务里更贵。
xAI 公布的 CursorBench 4.0 曲线包含同一模型的多个运行点。Fable 5.1 能达到更高的绝对得分,但对应更高的平均任务成本;在相近成本区间,Grok 4.7 的曲线高于 GPT-5.6 Sol 与 Sonnet 5。这正是官方所说的“price-performance frontier”:卖点不是所有分数第一,而是在一定预算下完成更多长程编程任务。
对实际团队而言,最值得记录的指标也应从 token 单价改成单个成功任务的总成本:把模型调用、重试次数、工具执行和人工接管都算进去,才能判断一次升级是否真的省钱。
开放世界游戏,为什么比写一个函数难
开放世界游戏不是一个功能,而是一组必须同时成立的系统:车辆要在道路上移动,行人与交通要共享场景状态,镜头、地图和速度 UI 还要跟随玩家变化。任何一部分各自看起来都不复杂,真正困难的是持续开发时不让它们彼此打架。
SpaceXAI 在发布线程中用城市驾驶演示呈现这种任务。画面里的车辆、行人、道路、建筑、迷你地图和速度 UI,对应的正是多模块持续协作,而不是一次性补全某个函数。
这个例子把“多小时任务”具体化了:模型不仅要生成更多代码,还要长期维持目标、状态和多个子任务之间的关系。Grok 4.7 的训练变化,正是为了减少这类任务进行到一半时的遗忘、冲突和反复返工。
安全能力开始和任务能力一起发布
Grok 4.7 使用了一套新的 safeguard stack。xAI 把目标设为同时提高危险请求的拒绝能力,并减少对合法网络安全工作的误拒。
官方公布了两个具体结果:在 LatchBio 生物安全基准上为 62.4%;在 HackerBench v0.3 中,3.3% 的高风险双重用途提示被放行。xAI 还开始向部分网络安全合作伙伴提供邀请制的 Grok 4.7 红队能力,用于防御研究。
这条线的重要性在于,长程 Agent 获得更多工具权限后,安全不再只是聊天界面的内容过滤。模型会执行命令、操作文件并持续推进任务,危险操作的识别能力和合法任务的可用性必须同时进入产品评估。
接入生产环境,最重要的配置都在这里
| 维度 | Grok 4.7 |
|---|---|
| 模型 ID | grok-4.7 |
| 上下文窗口 | 500,000 tokens |
| 知识截止 | 2026 年 5 月 |
| 输入与输出 | 文本、图像输入;文本输出;未设文本输出上限 |
| API | Responses API、Chat Completions |
| 工具 | Function calling、Web Search、X Search、Code Execution |
| 推理档位 | low、medium、high(默认)、xhigh |
| 可用渠道 | xAI API、Grok Build、Cursor、OpenRouter、Vercel、Cloudflare |
标准版与 Grok 4.6 采用相同价格:
- 低于 200k prompt tokens:输入 $2、缓存输入 $0.50、输出 $6 / 1M tokens。
- 超过 200k prompt tokens:输入 $4、缓存输入 $1、输出 $12 / 1M tokens。
Grok 4.7 Fast 使用同一个模型和更快的基础设施,输出速度为标准版两倍,token 费率也为两倍。它只在 Cursor 和 Grok Build 提供,不计入 Grok Build 免费额度,也不开放公共 xAI API。
模型能力之外,三个运行配置会直接影响长任务的费用和连续性:
- 让缓存真正命中:Responses API 设置
prompt_cache_key,Chat Completions 使用x-grok-conv-id,可以把同一会话路由到同一服务器,减少缓存失效后重复支付完整输入费用。 - 控制不断增长的上下文:工具调用很多、循环很长时,可以配合 context compaction 压缩历史,降低后续轮次的成本和延迟。
- 延续多轮推理状态:Responses API 会返回
reasoning.encrypted_content;把 reasoning items 原样传回下一次请求,模型可以在多轮任务中继续使用这部分状态。
需要美国数据驻留的团队还可以使用 https://us.api.x.ai/v1,推理保留在美国境内,token 价格上浮 10%。
团队该怎么判断要不要换
Grok 4.7 最值得测试的,不是一次问答,也不是单个代码补全,而是那些目前经常在中途失控的任务:跨文件改造、连续终端排错、长材料分析、完整文档和演示制作。
可以用同一组真实任务比较现有模型与 Grok 4.7,并记录三项结果:
- 端到端成功率:任务是否在既定验收条件下真正完成。
- 单个成功任务的总成本:模型费用、重试、工具调用和人工时间合计多少。
- 人工接管点:模型在哪一步开始忘记约束、重复报错或需要人类重新规划。
如果成功率上升、总成本下降、人工接管变少,Grok 4.7 的长程训练才真正转化成团队价值。它带来的变化不是“又一个更聪明的聊天模型”,而是把模型竞争推进到一个更严格的问题:谁能以更低的代价,把复杂工作持续做完。
SpaceXAI 发布 Grok 4.7:把长任务做完,而不是再做一次跑分升级
短任务很容易制造大模型能力的繁荣假象:生成几行函数或单篇文案往往一轮即可搞定。但在真实软件工程与专业知识交付中,模型必须在几十步甚至数小时内连续读取工程、执行命令、处理报错并记住前置边界。Grok 4.7 的发布标志着竞争重心的位移——它不再追求边际跑分刷榜,而是全力解决长任务中途失控的系统性痼疾。
核心定位:Grok 4.7 换用了更大的基础模型,延长针对数小时任务的强化学习(RL),并原生适配 Grok Bot harness 运行环境,提供 low、medium、high(默认)和 xhigh 四档推理投入。
长任务为何总在中途失控:Grok 4.7 的解法链
长链路 Agent 要连续读取文件、调用工具、处理报错并记住前置约束;任何一步丢失目标或状态,后续交付就可能偏离。Grok 4.7 的训练重点正是更仔细地验证工作、更好地管理长上下文。
编程与专业文档看似是两类工作,做久之后遇到的却是同一种失败:前者要让文件、依赖和运行状态始终一致,后者要让材料、数字、论点和版式始终一致。xAI 将知识工作与编程并列,其根本逻辑正是复用这套长上下文一致性与自我检查能力。
七项基准全线超越上一代:最大跃升在终端实战
在公布的基准测试中,Grok 4.7 相对上一代没有出现“这边提高、那边退步”的交换。最能印证数小时训练成效的,是多步骤终端环境任务的爆发性增长。
20.3% → 38.0% 多小时终端推进
软件工程实战(前代 65.2%)
逼近顶级商业模型(前代 1,605)
终端实证的意义:Terminal-Bench 衡量的不是一次代码补全,而是模型能否在终端环境里持续推进多步骤工作。38.0% 也意味着这类任务远未被“解决”,但相比 4.6,模型在长链路中维持有效工作的概率明显提高。
真实成本维度重构:算清楚「单个成功任务」花多少钱
很多团队在评估模型时容易陷入“Token 单价陷阱”。单步便宜的模型如果频繁重试或在中途失控,整体调用与人工接管成本将成倍飙升;稳健的模型即便单价相当,也能通过减少弯路拉低综合总成本。
SpaceXAI 在发布线程中用城市驾驶演示呈现多系统协同:车辆、行人、道路、迷你地图和速度 UI 必须持续共享场景状态而不彼此打架。这类任务的攻坚,正是检验多小时模型维持目标与子任务关系的最好试金石。
接入生产环境:决定连续性与开销的 3 项关键配置
模型进入自动化流水线后,工程团队必须通过精细化的运行时策略锁住成本、维持上下文连续:
不要用简单问答来评测,直接选用跨文件改造、连续终端排错等经常在中途失控的真实任务,用同一组任务对比现有模型与 Grok 4.7: