Grok4.7上线,全球第三!马斯克:4.8也训完了

发布时间 2026-09-23 8 天前
来源 新智元
字数 2,768 字
查看原文

AI智能总结

马斯克旗下 SpaceXAI 发布 Grok 4.7,定位史上最强 Grok,专攻编程与知识工作。官方称其 Agent 编程能力位居全球第三,仅次于 Anthropic 和 OpenAI;

输入和输出每百万 Token 价格为 2 美元和 6 美元,与上一代持平。底层基座模型更大,强化学习训练更长,并深度对齐自家 GrokBuild 框架。

新智元报道

就在刚刚,马斯克 SpaceXAI 正式发布全新主力模型 Grok 4.7!

核心卖点主打一个「同样的价格,更强的性能」,同时速度也很快。

马斯克第一时间喊话:「Grok 4.7 把 SpaceXAI 送上了智能体(Agent)编程的第三把交椅,仅次于 Anthropic 和 OpenAI」。

速度快、价格低,Grok 4.7 是个人干活搬砖的首选。

SpaceXAI 官博中,官方给出的定位是:史上最强 Grok,专为编程和知识工作而生。

具体来说,Grok 4.7 在编程和知识工作基准上,成绩几乎盖过了 GPT-5.6 Sol Max,直追 Fable 5.1 Max。

输入每百万 Token 2 美元,输出 6 美元,与 Grok 4.6 一模一样。

但底层模型彻底大换血:基座模型更大,强化学习训练拉长,任务难度加权向「需要数小时才能完成的工作」倾斜。

让 Grok 4.7 和 Grok 4.6 各自去搓一个开放世界城市游戏,差距真的是肉眼可见。

值得一提的是,下一代 2.5T 新模型 Grok 4.8 也训完了。马斯克的拿手好戏,才刚刚开始。


Grok 4.7 登场:编程追进第一梯队

更能量化 Grok 4.7 这轮进步的,还是编程测试。

拆开 AA 的榜单,数据很有意思。

综合智能指数上,Grok 4.7 拿下 46 分,相比 4.6 只寒碜地涨了 2 分。而第一梯队的 Fable 5.1 和 GPT-6 Astra 全是 53 分。

按单模型算,它排在第 16 名;按实验室排,刚好挤到了第四。

而真正让马斯克吹上天的编程榜,其实是两张:

  1. 套上 GrokBuild 框架,Grok 4.7 飙到 56 分,排在 Fable 5.1、GPT-6 Astra 和 Opus 5 之后。马斯克口中的「全球第三」,是偷偷把 Anthropic 的两个模型并成了一家。
  2. 换到统一基准 Terminal-Bench 4.0 后,Grok 4.7 的通过率当场暴跌到 26%–27%。作为对比,GPT-6 Astra 是 60%,Fable 5.1 是 55%。

不过,在评测机构 ValsAI 这里,Grok 4.7 不升反降,直接从第 14 名一路跌到第 24 名,比上一代 4.6 还倒挂了 5 分。

马斯克为什么要拼命给 Build 框架站台?答案就藏在官方公告的附注里——

Grok 4.7 在预训练阶段,深度对齐了 GrokBot 框架的交互模式。

换句话说,它极度依赖自家工具的调用逻辑和任务拆解套路。一旦走出温室,战斗力瞬间打折。


知识能力,也非常能打

这次升级的另一块重点,便是离所有人更近的一个场景——办公。

在长流程知识工作测试 AA-Briefcase 中,Grok 4.7 拿到 1657 Elo,比 Grok 4.6 的 High 档增加 111 分。

在 GDPval-AA 上,它拿到 1695 Elo,比上一代高出 90 分。

这些任务看重的,是 AI 到底能不能帮专业的人把活儿干完、交出像样的东西。

比如,整理材料、制作文档、完成分析与演示文稿,Grok 4.7 明显比上一代大幅提升。

此外,在电气工程测试 EEBench 上,Grok 4.7 拿下 64.0%,在所列四款模型中最高。


全网首测:有惊喜也有翻车

Grok 4.7 一上线,不少人早就摩拳擦掌,上手尝鲜了。

最出圈的一个 demo,来自开发者 Tak。

他压根没给 Grok 4.7 具体要求,就留了一句「你 10 分钟内能做啥就做啥」。

结果 Grok 自己跑去 Blender 里搓了个黄铜浑天仪,上面的行星甚至还能转,引全网 25 万人围观。

Tak 本人点评:「讲真,一点也不差」。

然后是经典节目,鹈鹕骑自行车。

有人直接拉满配置,开了 xhigh 加 fast 模式开跑,烧了整整 18 分钟,3.16 美元。

结果出片还真像那么回事:白鹈鹕在海边骑车,翅膀搭在车把上。

另一个人跑出来的就拉胯多了,生成的棕色鸟直接瘫在自行车上。

产品博主 Paweł Huryn 拿了两个真实代码库、埋了 105 个 bug 测了三轮。

结果是,GPT-6 Astra 能修好 45 个;Grok 4.7 搞定了 28.7 个。戏剧性的是,上一代 Grok 4.6 也是 28.7 个。

还有人直接上了硬碰硬的对照试验:把同一个芯片项目,同时甩给 Grok Build 和 Cursor 里的 Grok 4.7。

整整两小时,测下来最直观的感觉就是四个字:又快又省。

顺带还扒出个新彩蛋:Cursor 居然悄悄把 Grok 4.7 的上下文顶到了 500K,要知道上一代 4.6 可只有 256K。

做编程 Agent 的 Factory 也第一时间接进了自家的 Droid,给的评价比较克制:

工程、调试、数据、基础设施的活都能干,找命令比 4.6 快,medium 档够用,high 档在老代码上有加成。


定价便宜五倍,一算总账却遭背刺

这次 Grok 4.7 官宣的另一大亮点,是价格只有同类的一半。

不得不说,它的单价确实诱人:输入 2 美元、输出 6 美元。

对比 Astra 和 Fable 动辄 10 美元输入、50 美元输出的刺客价格,Grok 单价便宜了 5 到 8 倍。

官方晒出的 Cursor Bench 4.0 性价比曲线上,Grok 4.7 最高档拿下 46.3%,解一道题成本 6.01 美元;Fable 5.1 中档 46.8%,一道题 7.05 美元。看上去像是一场平分秋色的精准狙击。

但只要拿放大镜扫一眼图表底部的细节,这笔账就全变味了。

Fable 5.1 低档跑出 45.1%,单题成本只要 5.44 美元,比 Grok 的最高档还要便宜;而上一代的 GPT-5.6 Sol 高档拿下 35.7%,单题只需 2.85 美元。

玄机依然在于那惊人的「话痨体质」。

8.1 万输出 token,几乎是 GPT-6 Astra 的三倍。单价便宜 5 倍,但废话多了 3 倍,实际账单优势被生生腰斩。

Hacker News 上有开发者算清总账后吐槽:Grok 4.7 的缓存读取单价甚至反超了 Sol。

Cursor 社区更是直接破防:「这根本不是什么划时代的性价比怪物,花掉的 token 几乎是 4.6 的两倍,4.5 时代那种极致廉价感彻底没了。」

不过在纯速度上,它确实快得凶残。

AA 实测每秒狂飙 188 个 token,fast 模式更是原地翻倍。


模型加框架,才是下一个战场

如今再看 Grok 4.7 的战术意图,已经彻底明牌。

它不打算碰 AGI 的绝对王座,而是退守前沿第二梯队,卡住最便宜、最快的高地,专打性价比。

但这场发布暴露出的真正行业趋势——单体模型的时代,正在过去。

Grok 4.7 的高分,有一大半是靠着 Grok Build 的量身定制硬顶上去的;一旦脱离自家的脚手架,分数立马露馅。

Anthropic 用 Claude Code 锁死长程任务,OpenAI 用 Codex 把持生态,xAI 也终于走上了用私有框架捆绑开发者的路子。

未来的第三方评测榜单将彻底失去纯粹性,以后再看到所谓的跑分排名,第一句话必须先问:你到底是用什么框架测的?


参考资料

编辑:摩西 桃子