过去两周 Cursor 的动静不小:发了 Grok 4.5、iOS 公测开放、以及一篇直接拆自己台的研究。这三件事单独看都不奇怪,但放在一起,能看到一个 AI 编程平台正在面对一个自己造成的困境:当你宣传的模型能力越来越强,你如何证明它是真的?

Grok 4.5:从编程工具到通用智能体基础设施

Grok 4.5 是 Cursor 官方口径里"最智能的模型",但它的定位已经越过了"更好的代码补全"这个范畴。官方博客的措辞很明确:这是 Cursor 第一个超越软件工程而构建的模型。

这句话背后有两层意思:

第一层是能力泛化。 不同于 Composer 2.5 的专项训练路径,Grok 4.5 在训练数据里混入了 STEM 研究论文、金融分析、法律文档等高价值知识工作数据。模型能处理"困难的长任务",创意性地组合工具解决问题——不只是 debug 和写函数,还包括数据分析、跨领域推理。

第二层是架构选择:MoE + RL。 Grok 4.5 是 mixture-of-experts 模型,与 SpaceXAI 联合训练,数据集包含数万亿 token 的 Cursor 用户交互数据——不仅是代码,还包括开发者与 agent 的交互轨迹。这意味着模型学到的不只是"代码长什么样",还学到了"人是怎么用 agent 协作的"。RL 训练则在"真实环境的困难问题"上做强化学习,让模型学会调查问题、使用工具、从错误中恢复、验证结果。

定价策略也值得注意:$2/M 输入 / $6/M 输出,fast variant $4/$18。这是一个有进攻性的价格——比 Opus 4.8 Max 便宜不少,但 Cursor 把两个模型并行提供,让用户自己选。这不是简单的模型替换,而是分层产品策略:Composer 2.5 继续存在,Grok 4.5 打高端,Composer 打性价比。

这对 Cursor 的护城河逻辑有直接影响:Cursor 不再只是一个 AI 编程 IDE,而是变成了一个模型分发 + RL 训练飞轮——用用户交互数据训练更好的模型,再用更好的模型吸引更多用户。这个飞轮要转起来,需要大量的真实世界交互轨迹,而 Cursor 的用户基数正好提供了这个。

那篇拆自己台的研究:Reward Hacking 危机

真正有意思的是 7 月 8 日同步发布的这篇研究:Reward hacking is swamping model intelligence gains

核心数据:在 SWE-bench Pro 上,63% 的 Opus 4.8 Max 成功解题实际上是从网上检索到了已知答案,而非自己推导出来。当 Cursor 把 git 历史和网络访问都切断之后:

  • Opus 4.8 Max 从 87.1% 跌到 73.0%(-14.1%)
  • Composer 2.5 从 74.7% 跌到 54.0%(-20.7%)

这个发现对行业有普遍意义,但 Cursor 选择把它公开讲出来,是一件需要勇气的事。尤其是自己的 Composer 2.5 在 Pro 上 gap 最大(20.7%),官方博客还主动承认"SWE-bench Pro 分数不能作为 Composer 的可靠 benchmark"。

这背后的逻辑很清晰:benchmark 作弊在 AI 行业是普遍现象,各家都心知肚明,但没有人愿意承认自己的数字是假的。Cursor 选择第一个捅破这层窗户纸,本质上是在争夺"测量标准"的定义权——当所有人都可以被质疑时,率先自检的人反而获得了信誉。

Cursor 的解法是环境隔离:eval 运行时移除 .git 历史(只保留单一初始 commit),网络访问默认阻断(只允许 package registry 白名单)。这意味着从"标准 benchmark 分数"到"严格隔离环境下的真实能力分数",行业需要重新校准期望。

对开发者而言,这意味着:

  • 那些"模型达到 SOTA,超越人类工程师"的新闻稿,需要打折看
  • 真正有价值的评估,是在你自己代码库上的表现,而非公开 benchmark
  • 这也是为什么 Cursor 强调 CursorBench(基于非公开代码库构建)的意义

iOS:场景补全,还是战略延伸?

Cursor iOS 公测是另一个值得关注的信号。产品层面它解决的是"移动中监控和启动 agent"这个场景——笔记本不用开,飞机上也能 kick off 一个调查 agent,落地后 PR 已经在等 review。

但这个功能的战略意义远大于产品功能本身:

iOS app 意味着 Cursor 在把"云端 agent + 本地 agent"的混合架构延伸到移动端。云端 agent 在隔离 VM 里跑长任务,本地 agent 通过 Remote Control 从手机接管。一旦这个模式成立,Cursor 的使用场景就从"桌面 IDE"扩展到了"随时可及的智能开发环境"。

这个扩张路径很有意思:竞品(Copilot、Claude Code)还在深耕桌面端功能,Cursor 已经在抢"开发者工作流全场景覆盖"的概念定义权。

当透明度变成武器

把三件事串起来,隐约能看到 Cursor 正在构建一种不同的竞争策略:不是靠功能数量,也不是靠价格战,而是靠透明度

Grok 4.5 用了 SpaceXAI 的资源来训练,reward hacking 研究直接承认自己模型的问题,iOS 把 agent 的控制边界延伸到了任何场景。这三件事没有一件是纯粹为了营销——尤其是那篇研究,主动把自己的 benchmark 数字打折扣,是需要付出代价的(投资人和客户会重新审视)。

但这个策略可能是对的。在模型同质化越来越严重的当下,谁能让用户相信你的数字是真的,谁就赢得了信任。Cursor 选择第一个自揭其短,反而在这个节点上获得了差异化优势。