Grok 4.6 评测:编码 Agent 与 DeepSeek V4 Pro 对比参考

整理一则公开笔记对 Grok 4.6 与 DeepSeek V4 Pro 的评测观察,涵盖 Artificial Analysis、Terminal-Bench、GDPval-AA、长程 Agent、价格与选型边界。

来源与使用边界

这则笔记比较了 Grok 4.6 与 DeepSeek V4 Pro 的定位:前者偏向编码、缺陷定位和长程 Agent 工作负载,后者突出较低价格、百万级上下文和可本地部署。它更适合作为建立候选集的线索,而不是替代你自己的上线验证。

文中保留笔记所使用的模型名称与评测口径。特别是同名模型的预览版、正式版、推理模式、工具权限或上游服务商不同,都可能使数字不能直接横向套用。

先看结论

  • Grok 4.6 的重点是长程代码 Agent:笔记将其描述为编码与 bug 查找任务中的优先候选,并认为它在长期运行的 Agent 工作流、交互和视觉类任务上更有优势。
  • DeepSeek V4 Pro 的重点是性价比与部署弹性:笔记强调其低价、深度思考 / 非思考双模式、100 万 token 上下文以及开源、本地部署能力。
  • 不要把“某一项分数更高”直接等同于生产更优:真实任务还取决于仓库规模、工具调用、响应格式、并发、延迟、失败恢复、数据合规和实际成本。

笔记记录的 Grok 4.6 指标

下表仅转录原笔记明确给出的数值和描述,不补充未公开的测试设置,也不把这些结果转换为 GPT88 的能力保证。

指标笔记记录可如何理解
Artificial Analysis Intelligence Index61 分;笔记称与 GPT-5.6 Sol Max 持平可作为综合能力的一个外部信号,但不能说明所有编程、推理或多模态任务均相同。
Terminal-Bench v2.188.4%更接近终端环境下的实际操作与 Agent 执行能力;仍需确认测试版本、工具权限与评测规则。
GDPval-AA v2 Elo1753反映该评测体系中的相对排序,不可直接换算成你的业务成功率或人工返工时间。
笔记给出的定位编码和 bug 查找工作负载的新默认选择这是第三方笔记的选型判断,不是官方 SLA,也不意味着所有代码库都应默认切换。

与 DeepSeek V4 Pro 的侧重点

维度Grok 4.6(笔记观察)DeepSeek V4 Pro(笔记观察)选型提示
主要工作负载长程 Agent、编码、bug 查找,以及更具野心的交互和视觉任务。Sonnet 级旗舰定位,强调覆盖面与经济性。用同一批真实 issue、PR、终端任务和前端需求复测。
上下文与缓存原笔记没有给出具体缓存结构或上下文参数。100 万 token 上下文;混合注意力机制将百万 token 缓存压缩至约 10%。容量上限不等于每次都适合塞满;长上下文要测试召回、延迟和费用。
成本 / 部署原笔记没有给出 Grok 4.6 的实时价格。笔记称约比 Fable 低 57 倍,并提到开源、本地部署。所有价格均以实际接入渠道、输入输出倍率与当日控制台为准。
发展状态笔记提到 Grok 4.7 已开始训练。笔记强调 V4 Pro 相比预览版的 Terminal Bench 提升 15.8%。后续版本变化会迅速改变结论,应记录确切的模型 ID 与测试日期。

如何做模型选型

  1. 固定任务集:至少包含一个代码修复、一个多文件改动、一个终端 / 工具调用任务、一个长文档检索任务和一个失败恢复任务。
  2. 固定运行条件:统一系统提示词、上下文、工具权限、最大回合数、超时和验收规则,避免只比较“最好的一次回答”。
  3. 同时记录四类指标:任务成功率、端到端耗时、人工返工量、实际 token / 余额消耗。
  4. 再做灰度:先在低风险任务中观察连续多日表现,再决定是否用作默认模型或关键链路模型。

局限与复测建议

  • 来源是公开笔记对 AskCat 结果的汇总,本文没有独立复现 Artificial Analysis、Terminal-Bench v2.1 或 GDPval-AA v2。
  • 原笔记没有提供所有模型的精确版本号、完整提示词、工具配置、采样次数和置信区间,因此不能把分数当作严格的因果结论。
  • “约低 57 倍”属于原笔记的相对价格表述,缺少完整计价口径时不应直接用于预算或采购决策。
  • 如果 GPT88 当前账号可使用相关模型,请先通过 GET /v1/models 确认模型可用性,并以控制台展示的模型 ID、分组与实际扣费为准。