返回 文章 apply CMS 文章

Grok 4.7 发布:面向编程与知识工作的最强模型,速度翻倍、价格减半

Grok 4.7 以翻倍速度和减半价格,成为 SpaceXAI 面向编程与知识工作的最强模型。

Grok 4.7SpaceXAI编程模型知识工作
成长分 / 100 70 综合收获、行动、留存与影响

Grok 4.7 发布:面向编程与知识工作的最强模型,速度翻倍、价格减半
为什么值得读了解 Grok 4.7 在编程与知识工作场景下的核心能力提升。

掌握其性价比优势及在 CursorBench 4.0 等基准测试中的表现。

关键洞察
  1. Grok 4.7 是 SpaceXAI 面向编程与知识工作能力最强的模型,速度提升一倍,价格仅为同类模型的一半。
  2. 在 CursorBench 4.0 上,Grok 4.7 在性价比方面处于前沿水平。
  3. 相比 Grok 4.6,Grok 4.7 采用全新更大基础模型,在更困难、需数小时完成的任务上进行了更长时间强化学习。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2599

SpaceXAI 面向编程与知识工作的最强模型。速度提升一倍,价格仅为同类模型的一半。

Grok 4.7 是我们面向编程与知识工作能力最强的模型。它在困难任务上工作更持久,更仔细地检查自己的工作,并配备了迄今为止我们校准最完善的防护措施。它以与 Grok 4.6 相同的价格和速度提供服务,在同级别中极具竞争力。

在 CursorBench 4.0 上——该基准测试着重考察运行时间较长的编程任务——Grok 4.7 在性价比方面处于前沿水平。

Grok 4.6 相比,Grok 4.7 采用了全新的、规模更大的基础模型。它在一组更困难、且偏向于需要数小时才能完成的问题的任务组合上,进行了更长时间的强化学习训练。该模型更擅长验证自己的工作并管理更长的上下文。我们还训练 Grok 4.7 原生理解 Grok Bot 运行框架,使其更擅长对话任务和通用知识工作。

  • 高强度

Grok 4.7 更擅长创建文档和演示文稿。在 GDPval 和 AA Briefcase 中,AI 被要求处理律师、护士和金融分析师等专业人士所做的工作。Grok 4.7 在这两项基准测试上均较 Grok 4.6 有所提升,并与其他前沿模型表现相当。

专业知识工作

GDPval

Grok 4.7 采用了一套全新的防护体系构建。它在我们测试过的模型中,在拒答和抗越狱方面表现最强。在网络安全和生物学工作等两用领域,它在良性任务的实用性以及危险任务的安全拒答两方面均处于领先,以 62.4% 的成绩位居 LatchBio 生物安全基准测试榜首。

Grok 4.7 在强大的网络防御能力与合法用途的低拒答率之间取得了平衡。它在我们针对高风险和恶意网络任务的基准测试 HackerBench v0.3 上展现出最高的安全性,仅放行 3.3% 的高风险两用提示,同时极少拦截合法的安全工作。我们还开始向部分网络安全合作伙伴提供仅限邀请的 Grok 4.7 红队能力访问权限,用于防御研究。

Grok 4.7 今日已在 CursorGrok Build 中提供。它也可通过 Grok API、第三方编程运行框架,以及模型路由器和云平台使用。

该模型定价为每百万输入 token 2 美元起,每百万输出 token 6 美元起。我们还提供一个快速版本,输出速度提升一倍,价格也提升一倍。