本期导读

本期三条主线值得关注:Google发布Gemini 3.6 Flash,以65% Token消耗降幅重新定义中端性价比,API价格战进入新阶段;美国初创Poolside以1180亿参数开源模型击败万亿参数竞品,打破过去一年顶级开源模型全由中国公司垄断的局面;Inflection AI卷土重来,押注"关系智能"新范式,尝试从问答工具向人生伙伴转型。


一、Google Gemini 3.6 Flash:65% Token效率提升,价格战进入新赛点

原文标题: Google's Gemini 3.6 Flash model cuts AI agent token costs by up to 65% on long horizon engineering tasks
链接: https://venturebeat.com/technology/googles-gemini-3-6-flash-model-cuts-ai-agent-token-costs-by-up-to-65-on-long-horizon-engineering-tasks-and-3-5-pro-is-on-the-way
发布日期: 2026年7月24日

核心事实:

  • Google DeepMind发布Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash-Cyber三款新模型
  • Gemini 3.6 Flash在长周期工程任务中Token消耗降低65%,API定价$1.50输入/$7.50输出每百万Token
  • 3.5 Flash-Lite仅$0.30/$2.50,成为Google史上性价比最高模型之一
  • Gemini全球月活用户已达9.5亿(2月为7.5亿)
  • 同场发布3.5 Flash-Cyber,专攻网络安全,仅向政府及可信合作伙伴开放

为什么重要:

Token效率65%的提升不是边际优化,而是量级变化。在AI Agent的实际部署中,长周期任务(如代码审查、多轮调试、复杂数据分析)的Token成本往往是企业最大的成本变量。65%的效率提升意味着同等预算下可以执行近3倍的任务量,或者用1/3的预算完成同等任务量。

从第一性原理来看:这场价格战的本质是计算资源的优化效率之争。Google不追求最低绝对价格(那是中国开源模型的领地),而是在"性能-成本"帕累托前沿上找到了新的最优点。$1.50/$7.50这个定价区间,刚好卡在企业级Agent应用的主力成本区间。

分析观点:

API价格战的格局已经清晰:中国开源模型(小米MiMo、DeepSeek)占据绝对低价位,Google占据中端性价比王座,OpenAI/Anthropic占据高端。这张图在2026年底之前不会有根本性变化,但Google的65%效率提升会压缩所有中端玩家的生存空间——因为它不只是降价,而是同时提升了性能。


二、Poolside Laguna S 2.1:1180亿参数开源模型击败万亿参数竞品

原文标题: Poolside drops Laguna S 2.1, an open-weight coding model that beats rivals 10x its size
链接: https://venturebeat.com/infrastructure/poolside-drops-laguna-s-2-1-an-open-weight-coding-model-that-beats-rivals-10x-its-size
发布日期: 2026年7月24日

核心事实:

  • Poolside发布Laguna S 2.1,1180亿参数MoE架构,激活8B参数/Token,支持100万Token上下文
  • Terminal-Bench 2.1得分70.2%,超越DeepSeek-V4-Pro-Max(1.6万亿参数,64.0%)和Nvidia Nemotron 3 Ultra(5500亿参数,56.4%)
  • SWE-Bench Multilingual得分78.5%,9周训练完成,完全开源(OpenMDW-1.1许可)
  • 这是11个月来首款进入该参数级别的西方开源模型

为什么重要:

过去将近一年,顶级开源模型几乎全来自中国:DeepSeek、Qwen、Kimi、智浦…… Laguna S 2.1打破了这个格局。Terminal-Bench 2.1的70.2%得分尤其值得关注——这是一个测试长周期终端任务的基准,考验的是模型在真实开发场景中的持续推理能力,而不是静态问答准确率。

MoE架构+激活8B参数的路线再次被验证:小参数高效率不是奇迹,而是工程上的正确路径。1.6万亿参数的DeepSeek-V4-Pro-Max被1180亿参数的Laguna S 2.1击败,说明参数规模在Agentic coding任务中并不是决定性因素。

分析观点:

Poolside的核心客户是政府和国防机构,开源不是情怀,而是战略工具。OpenMDW-1.1许可证允许商业使用且无强制开源义务——这是美国国防AI采购的标准法律框架。Laguna S 2.1的开源,本质上是美国政府通过Poolside向全球输出"西方开源AI"标准,与中国开源模型形成地缘对称。

从技术趋势看,MoE架构在编程任务上的优势已经被充分验证。接下来会看到更多"小参数、高效率"的顶级开源编程模型出现,密集大模型在编程领域的统治地位正在动摇。


三、Inflection AI押注「关系智能」:从问答工具到人生伙伴的哲学转身

原文标题: Inflection AI returns to consumer market with Pi Journeys after Microsoft upheaval
链接: https://venturebeat.com/orchestration/inflection-ai-returns-to-consumer-market-with-pi-journeys-after-microsoft-upheaval
发布日期: 2026年7月24日

核心事实:

  • Inflection AI推出Inflection AI Labs研究部门及首个产品Pi Journeys
  • Pi Journeys核心定位:AI根据用户人生阶段(育儿、照护、职业转型等)构建关系记忆,主动促进人与人的互动
  • Pi新增语音、记忆、Agent工具(提醒、待办、购物)全面升级
  • CEO Sean White:行业过度优化「交易型」AI,下一个竞争维度是「关系型」AI

为什么重要:

Inflection AI曾融资15亿美元,2025年核心团队动荡后几乎从公众视野消失。这次回归不是技术突破,而是一次哲学转向——从"问答工具"到"关系伙伴"。

"关系智能"这个概念本身很有意思:它不追求准确率,不追求推理速度,而是追求"理解用户人生状态并适时介入"的能力。Pi Journeys试图记住用户正在经历什么(职业转型、育儿期、照护家人),然后在关键时刻提供支持——不是回答问题,而是创造人的连接。

分析观点:

这个方向的潜力与风险都很清晰。潜力在于:所有主流AI产品都在做"更快的问答",关系智能是一个真实的差异化路径。风险在于:隐私问题是核心障碍——用户是否愿意将核心人际关系数据交给商业AI公司?这是监管的地雷区。

Inflection的背水一战能否成功,取决于他们能否在隐私合规和关系深度之间找到平衡点。这不是纯粹的技术问题,而是产品哲学和商业模式的根本性重新设计。


数据来源

  • VentureBeat(多篇)
  • Google DeepMind官方博客
  • Poolside AI官方博客及Hugging Face

#AI #大模型 #开源模型 #价格战 #关系智能