行业资讯

  • Home
  • Grok 4.7定价低但表现平平,编程能力令人担忧

Grok 4.7定价低但表现平平,编程能力令人担忧

2026-09-23 2259

Grok 4.7由xAI设定的价格是每百万个token两美元,而输出为每百万个token六美元。与西方主要模型相比,这一定价显得异常低,接近中国公司的定价标准,而非OpenAI或Anthropic的水准。不过,便宜的价格并不意味着其表现出色。在独立机构Artificial Analysis的智能指数(v4.3.2版)中,Grok 4.7仅获得46分,处于中等水平,而Claude Fable 5.1和GPT-6则以53分并列领先,这一指数是基于十项基准测试综合评估的。

在编程能力方面,Grok 4.7表现不佳,Terminal-Bench 4.0的得分只有26%。相比之下,GPT-6 Astra得分60%,Claude Fable 5.1得分55%,甚至更便宜的DeepSeek V4.1 Flash也以27%的成绩超过了Grok 4.7。综合来看,xAI在定价和表现的组合上确实引发了思考。

根据xAI的自我介绍,Grok 4.7被认为是其在编程和知识工作上最强的模型,依托于更大的基础模型,经过更长时间的强化学习训练,并特别注重输出的自我验证。这意味着模型不仅生成答案,还要对答案进行核验。虽然这种设计在知识工作任务中可能有一定意义,但从基准分来看,尚未在编程领域展现出优势。

Grok 4.7可通过Grok API、Cursor和Grok Build三个渠道使用。将定价和表现结合分析后可以清楚看出,Grok 4.7在智能指数中处于中游,而在编程基准测试中则落后于其他竞争者。其低价格并非简单的优惠,实际上反映了它的能力定位。

对开发者而言,选择的方向变得更为明确:若需要顶尖的编程表现,GPT-6 Astra和Claude Fable 5.1是更好的选择;若关注成本控制,则Grok 4.7和DeepSeek V4.1 Flash都是不错的选项,后者在编程基准测试中的成绩略优于前者。xAI此举并未争取第一梯队的位置,而是通过压低价格开拓市场,试图用“足够用且便宜”的策略填补某一需求。能否成功取决于有多少任务并不需要达到60%的编程准确率。

发表评论