xAI 将 Grok 4.7 定位为编程与知识工作模型,强调它能更长时间处理复杂任务,并更仔细地检查自己的结果。官方称新版使用更大的基础模型,针对耗时较长的难题进行了更长的强化学习训练,同时改进上下文管理。可用渠道包括 Grok API、Grok Build 和 Cursor;API 基础输入/输出价格与 Grok 4.6 相同。查看 xAI 官方公告与评测表。

官方评测应该怎么读
xAI 报告了 CursorBench、DeepSWE、Terminal-Bench、GDPval 和 AA Briefcase 等结果,覆盖代码任务、终端操作和专业办公工作。公告也对比了多个模型、推理档位和任务类别,因此单个数字不能简单概括模型的总体优劣。例如,长程任务表现与标准 API 单次响应的体验不同;“最高档推理”分数也不能直接等同于默认设置。上述成绩由发布方整理,适合用来挑选测试方向,不应视为每个项目的保证。
价格、速度与使用渠道
标准 API 标价为每百万输入 token 2 美元、输出 token 6 美元,与前代基础价格相同。xAI 还提供 Fast mode,公告称速度约为标准模式的两倍、价格也约为两倍。是否值得开启,要看任务等待时间、重试、输出长度和成功率;不能仅凭每 token 的速度或价格推算每个完成任务的成本。
用自己的代码库做对比
- 准备一组带清晰验收标准的真实缺陷、测试补全和多文件功能任务。
- 让 Grok 4.6 与 4.7 使用相同代码库上下文、工具、权限和提示。
- 运行既有自动测试,并由开发者盲审差异,记录一次通过率、错误类型、人工修订和总 token 成本。
- 在长任务中要求模型先列计划和验证办法;仅在隔离分支上执行写入操作。
适合与不适合的场景
当任务需要跨多个文件反复推进、创建文档或长时间调用工具时,长程能力可能比短问答榜单分数更有意义。若请求只是简单问答,切换到更昂贵的 Fast mode 未必划算。对法律、医疗和安全相关材料,还需要专业人员检查;模型评测分数不构成专业意见,也不替代业务审核。