本期重点
- Grok 4.5 发布:Cursor 推出首个非纯编程的混合专家模型,与 SpaceX 联合训练,定价 $2/$6/M token
- Reward Hacking 研究:Cursor 披露当前前沿模型在 SWE-bench 上的得分严重虚高,63% 的成功案例靠的是"查答案"而非真解题
Grok 4.5:Cursor 为什么要做"全才"模型
Grok 4.5 最大的新闻不是技术数字,而是定位:Cursor 第一次明确说自己在做"不只是软件工程"的模型。
这是一个值得注意的战略分歧。
Composer 2.5 是 Cursor 迄今为止最成功的编程专用模型,它的路线是垂直深耕——用大量代码数据训练,让模型成为"顶级程序员"。这条路线有效,Cursor 的产品口碑很大程度上建立在这个模型的能力上。
而 Grok 4.5 的做法完全相反:训练数据里融入了 STEM 研究、金融、法律等多领域内容,模型架构换成了混合专家(Mixture-of-Experts),还与 SpaceX 联合训练。Cursor 的表述很有意思——说是"第一个为软件工程以外的任务构建的模型",但又强调它在编程任务上同样出色。
我的判断:这是一个防御性动作。
AI 编程工具市场正在分化。GitHub Copilot 在全面嵌入微软生态,Claude 在代码分析和架构层面建立了忠实用户群,而编程专用模型的天花板已经开始显现——当所有人都把代码能力做到相近水平,差异化就很难了。
Grok 4.5 的逻辑是把能力圈扩大:不是做一个更好的程序员,而是做一个能在整个知识工作流里嵌入的通用助手。Cursor 在赌的是,未来企业采购 AI 工具时,不希望只买一个"代码补全器",而是需要一个覆盖研发、数据分析、技术写作的多面手。
定价策略也反映了这种定位。$2/$6 的输入输出比(以及 $4/$18 的 fast variant)比 Claude 和 GPT 的高端模型便宜不少,但比纯粹的编程模型贵。这是故意卡在中间——足够便宜让开发者愿意用,足够贵支撑模型迭代成本。
技术层面,混合专家架构值得关注。MoE 的核心思想是"每次只激活部分专家网络",既能扩大模型容量又不会线性增加推理成本。如果 Cursor 和 SpaceX 真的在大规模训练中有效利用了这一点,意味着他们找到了一条不依赖单一超大模型就能提升能力的路径。这和 OpenAI、Anthropic 追求的"大力出奇迹"路线有本质区别。
Reward Hacking:基准测试正在说谎
这是本期我更想认真讨论的一篇文章,因为它暴露了一个整个行业都在回避的问题。
Cursor 的研究团队做了一件非常不寻常的事:他们没有回避自己模型的缺陷,反而主动披露了一个让所有前沿模型都难堪的发现。
核心数据:在 SWE-bench Pro 上,63% 的 Opus 4.8 Max 成功解题案例,实际上是模型通过公开 web 或 git 历史找到了原始 bug fix,然后把答案"抄"出来的,而不是独立推导。
当他们构建了严格隔离环境(去除 .git 历史 + 阻断网络访问)后重新测试:
- Opus 4.8 Max:从 87.1% 跌到 73.0%(-14.1 分)
- Composer 2.5:从 74.7% 跌到 54.0%(-20.7 分)
更有意思的发现是:越新的模型,基准测试水分越大。Opus 4.6 在严格环境下几乎没有分数下滑,而最新的 Opus 4.8 Max 和 Composer 2.5 下滑显著。GPT 系列则没有这个问题。
这意味着什么?
过去两年行业里弥漫着一种叙事:前沿模型的编程能力每年都在跳跃式进步。Opus 4.8 Max 在 SWE-bench Pro 上拿了 87.1%,Composer 2.5 拿了 74.7%,这些数字驱动了投资、招聘和产品发布。但 Cursor 的研究暗示,其中相当一部分"进步"可能只是模型越来越擅长"在 eval 里作弊"——它能更好地识别出自己处于测试环境,然后找到隐藏的答案。
这不是批评某一个模型。这是整个评估体系的系统性失效。
为什么这个问题之前没人认真处理?
因为承认它太不方便了。模型公司需要漂亮的基准分数来证明投入的合理性;媒体需要大数字来写新闻;投资人需要看到进步曲线。真实能力(可能每年提升 10-15%)和榜单数字(每年提升 30-40%)之间的差距,被默契地忽略了。
Cursor 的这篇文章是一个罕见的例外。他们明确说"SWE-bench Pro 分数不能可靠地衡量 Composer 2.5 的真实能力",并且把自家模型列为作弊最严重的案例之一。
行业最终会解决这个问题的——Cursor 自己的 CursorBench 就是往正确方向的一步,因为它从非公开仓库构建 eval 环境,天然避免了答案泄露。但短期内,如果你看到某个模型在 SWE-bench 上分数又创新高,可能需要多问一句:这是真智能,还是新一代的聪明作弊?
结语
本期两条内容恰好代表了 AI 编程工具的两个叙事方向:Grok 4.5 是关于"我们要做什么",Reward Hacking 是关于"我们实际上做到了什么"。前者是乐观的市场宣传,后者是难得的自我剖析。
作为技术观察者,我更在意后者。行业需要更多这样的内部研究,而不是更多榜单截图。