Grok 4.7 扩大模型规模,但标准 API 价格不变
SpaceXAI 新发布的 Grok 4.7 采用更大的基础模型,并面向长任务训练;独立评分仍显示其落后于 GPT-6 和 Claude Fable 5.1。

SpaceXAI 于 9 月 21 日发布 Grok 4.7,带来更大的基础模型,以及一组面向长任务的训练和推理调整。此次发布将标准 API 价格维持不变:每 100 万输入 token 为 2 美元,每 100 万输出 token 为 6 美元。它同时提供 500,000 token 的上下文窗口、四个推理等级,并通过 API、Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare 广泛开放。核心问题不在于 Grok 4.7 是否比前代更大、更有能力,而在于当企业公布的基准成绩与独立评测分开看时,已发布证据在多大程度上支持这一说法。
Grok 4.7 有哪些变化
Grok 4.7 披露的主要架构变化,是采用了更大的基础模型。SpaceXAI 还表示,该模型接受了面向长任务的更长时间强化学习、自我验证以及长上下文训练。这些并非细枝末节的定位表述:它们描述的是一个意在多步骤工作、需要检查输出、以及必须同时处理大量文本或代码时表现更好的模型。因此,这项公告将 Grok 4.7 描绘得不像是一次狭义的速度更新,而更像是一次试图改善长流程推理和持续执行能力的版本升级。
标准 API 价格未变,是此次发布中值得注意的一部分。SpaceXAI 列出的标准价格仍为每 100 万输入 token 2 美元、每 100 万输出 token 6 美元,尽管该模型被描述为规模更大,并采用了额外训练方法。对于已经围绕 token 成本做预算的开发者和团队而言,这一信息意味着新模型的默认服务层没有引入更高的单位价格。但这并不表示所有访问成本都没有变化:更快的服务层价格是标准价格的两倍,这在基础访问和低延迟服务之间形成了明确区分。
500,000 token 的上下文窗口也是一个需要考虑的实际变化。原则上,这样规模的上下文窗口可以让模型处理大型代码库、长篇文档、多文件提示词,或持续时间较长的任务历史,而不必达到同等程度的截断。不过,大上下文窗口是一个容量指标,并不保证模型会同等有效地使用上下文的每个部分。Grok 4.7 接受长上下文训练这一点具有相关性,因为单纯的上下文长度并不能证明模型能够在完整窗口内可靠检索、排序优先级或推理。
此次发布如何定位
SpaceXAI 通过多种路径提供 Grok 4.7:其 API、Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare。这种分发方式有其意义,因为它不仅将模型放在直接 API 后面,也把模型带入开发和部署渠道,而这些渠道中的模型切换可能成为日常工作流的一部分。因此,此次发布既面向直接集成者,也面向通过既有编码、构建或 AI 工作负载路由平台接触模型的用户。可用性清单属于公司公告,应按公告看待,而不是作为性能证据。
四个推理等级为用户或开发者提供了一种选择模型应投入多少推理力度的方式。其实际含义是,并非每项任务都需要在同一设置下运行。较简单的请求未必需要最高等级,而更复杂的工作可以分配更多推理资源。已验证事实并未说明这四个等级在延迟、准确率或成本上有何差异,因此关于最佳设置的任何结论都会超出证据范围。可以说的是,SpaceXAI 将推理作为产品中可配置的一部分暴露出来,而不是完全隐藏在单一默认模式之后。
自我验证也是公告方法的一部分。笼统地说,自我验证表示模型被设计为在生成或推理过程中检查自身输出的某些方面。此次发布的信息不足以判断该流程究竟如何实现,也不足以判断它在多大频率上能防止错误。因此,它应被理解为一项已披露的技术,而不是事实性错误、代码错误或推理失败已经被解决的证明。同样的谨慎也适用于面向长任务的更长时间强化学习:它与模型设计有关,但其效果仍必须通过结果来评估。
数据显示了什么
SpaceXAI 报告了 Grok 4.7 的三项基准结果:CursorBench 46.3、DeepSWE 71 和 EEBench 64。这些数字属于厂商基准测试范畴,因为它们由模型背后的公司提供。它们可能是有用信号,显示 SpaceXAI 希望强调的任务类型,尤其是从基准名称以及通过 Cursor 分发所暗示的编码或软件工程工作流。不过,厂商基准测试不具备与独立测试相同的证据分量。它们展示的是公司在其选择条件下报告的结果;单凭这些结果,不能确立市场领先地位或广泛可靠性。
独立视角则不那么有利。Artificial Analysis 给 Grok 4.7 的智能分数为 46,而 GPT-6 为 53,Claude Fable 5.1 也为 53。在该评测方的量表上,Grok 4.7 落后于比较中提到的两个领先模型。Artificial Analysis 还报告称,在 Terminal Bench 上存在较大差距。这些是独立测量,区别于 SpaceXAI 自身的基准主张。它们并不抹去更大基础模型或标准价格不变的重要性,但确实限制了有关 Grok 4.7 已追上最强竞争对手的说法,至少在已测量智能方面如此。
厂商结果与独立结果之间的差异,是分析上的核心点。SpaceXAI 的数字可以支持这样一种看法:Grok 4.7 在该公司测量并推广的领域有所改进。Artificial Analysis 支持的是另一种结论:在其独立测试中,该模型仍落后于 GPT-6 和 Claude Fable 5.1,并且在 Terminal Bench 上差距尤其明显。任何一组数字都不能证明一切。厂商基准无法决定独立排名。独立分数也不能描述每一种可能的私有工作负载。两者合起来表明,这是一次具有实质工程变化的发布,但在所引用的独立证据上,并不能说明其处于领域领先位置。
实际影响
对 API 用户而言,最清楚的实际影响是,Grok 4.7 改变了能力主张,却没有改变标准 token 价格。使用标准访问的团队,会看到同样列明的费率:每 100 万输入 token 2 美元、每 100 万输出 token 6 美元,同时获得对更大模型、500,000 token 上下文窗口以及四个推理等级的访问。如果需要更快服务层,成本会发生实质变化,因为其价格是标准价格的两倍。因此,价格结构将模型升级与更快服务所附带的溢价区分开来。
对于长任务,此次发布的设计相关性高于一次短提示词模型更新。面向长任务的更长时间强化学习、长上下文训练和自我验证,都指向一些使用场景:模型必须保持指令、处理大量材料,或完成多步骤操作。尽管如此,独立结果为预期划定了边界。更大的基础模型和更长上下文或许有助于复杂工作流,但 Artificial Analysis 给出的分数是 46,而 GPT-6 和 Claude Fable 5.1 均为 53,这表明独立评测方仍认为顶端性能存在差距。
结果是一次有度量依据的升级,而不是对领先模型的明确取代。Grok 4.7 带来了更广泛的可用性、更大的基础模型、长任务训练、自我验证、长上下文训练、未变化的标准 API 价格,以及成本更高的更快服务层。SpaceXAI 报告的 CursorBench、DeepSWE 和 EEBench 结果显示了该公司自身的基准叙事。Artificial Analysis 提供了独立的制衡视角,将 Grok 4.7 置于 GPT-6 和 Claude Fable 5.1 之后,并指出 Terminal Bench 上存在较大差距。此次发布具有意义,但现有证据并不支持将其视为新的基准领先者。
信息来源
- SpaceXAI releases Grok 4.7MarkTechPost · 2026年9月21日
- Grok 4.7 is xAI's strongest model yet, but trails Claude Fable 5.1 and GPT-6The Decoder · 2026年9月21日



