Grok 4.7

发布时间 2026-09-21 9 天前
来源 Hacker News 热门
字数 1,520 字
查看原文

AI智能总结

Grok 4.7 于 2026 年 9 月 21 日由 SpaceXAI 发布,定位为迄今面向编程与知识工作能力最强的模型,采用更新更大的基础模型和更长时间的强化学习训练。

其输入与输出定价分别为 2 美元和 6 美元每百万 token,并提供速度翻倍的高速版本。

2026 年 9 月 21 日

Grok 4.7 是 SpaceXAI 迄今为止面向编程与知识工作最强悍的模型。速度翻倍,价格却只有同类模型的一半。

免费试用 立即构建

Grok 4.7 是我们迄今在编程与知识工作方面能力最强的模型。它能在难题上长时间推理,更仔细地校验自身输出,并配套了我们迄今为止校准最为完善的安全防护。在定价和速度上,它与 Grok 4.6 保持一致,在同档产品中极具竞争力。

在 CursorBench 4.0(侧重长时间编程任务)上,Grok 4.7 处于性价比的领先水平。

模型改进

相比 Grok 4.6,Grok 4.7 使用了一个更新、规模更大的基础模型。它经过了更长时间、任务更难的强化学习训练,并刻意加重了那些需要耗时数小时才能完成的难题的权重。该模型在自我验证和管理超长上下文方面能力更强。我们还让 Grok 4.7 原生地理解 Grok Bot 的工具调用框架(harness),从而在对话式任务和通用知识工作方面表现更佳。

类别 指标 Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max
定价 输入 token 价格(美元 / 百万 token) $2 $2 $4 $10
定价 输出 token 价格(美元 / 百万 token) $6 $6 $20 $50
软件工程 CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
软件工程 DeepSWE v1.1 71.0%* 65.2% 72.7% 70.0%
电气工程 EEBench 64.0% 53.0% 39.4% 56.4%
多小时办公任务 AA Briefcase v1.1 1,657 1,546 1,487 1,678
多小时终端任务 Terminal-Bench 4.0 38.0% 20.3% 37.3% 57.9%
法律工作 Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
临床推理 HealthBench Professional 56.7% 48.5% 60.5% 62.1%

* 高强度推理模式

Grok 4.7 在文档与演示文稿生成方面也有明显提升。在 GDPval 和 AA Briefcase 这两项基准中,AI 需要完成律师、护士、金融分析师等专业人士的实际工作。Grok 4.7 在这两项基准上都优于 Grok 4.6,整体表现与其它前沿模型持平。

涵盖:专业知识工作、多小时办公任务、电气工程。

安全与网络安全

Grok 4.7 采用了全新构建的安全防护体系。在我们测试过的所有模型中,它对违规请求和越狱攻击的抵御能力最强。在网络安全和生物等双重用途领域,它既能出色完成正常任务,又能稳妥地拒答危险请求,并在 LatchBio 的生物安全基准上以 62.4% 的得分领跑。

Grok 4.7 在强大的网络防御能力与合法请求的低拒绝率之间取得了平衡。它在我们自研的 HackerBench v0.3(用于评估高风险与恶意网络任务的基准)上安全性最高:只放行了 3.3% 的高风险双重用途提示,同时很少误拦合法的安全工作。我们还已开始向部分受邀的网络安全合作伙伴开放 Grok 4.7 红队能力(red-team capabilities)的内测权限,用于防御研究。

定价与可用性

Grok 4.7 自即日起在 Cursor 和 Grok Build 中可用,同时也通过 Grok API、第三方编程框架以及模型路由器和云平台提供。

模型定价为输入 token 2 美元 / 百万 token 起,输出 token 6 美元 / 百万 token 起。我们还提供一个高速版本,输出速度翻倍,定价也相应翻倍。

Console
创建 API 密钥
 docs.x.ai
阅读文档

在 Grok Build 中免费试用

立即前往 x.ai/build 开始使用。

$ curl -fsSL https://x.ai/cli/install.sh | bash