AI日报|GLM-5.3、DeepSeek涨价、Grok 4.6:一周大模型风云

2026年8月16日,AI大模型赛道继续高强度迭代。智谷AI、谷歌、DeepSeek、xAI同时有新动作,加上Meta的开源模型Glimmer,本周大模型格局再次洗牌。


1. 智谷AI发布GLM-5.3:后训练Scaling新纪录,发现Cursor严重漏洞

智谷AI(Z.ai)发布了GLM-5.3,最引人注目的不是基准分数的跃升,而是它完全基于现有7430亿参数基座模型、通过扩大后训练规模实现提升的路线。

核心数据:

  • Terminal-Bench 3.0:4.6 → 28.3(+515%)
  • DeepSWE v1.1:46.2 → 66.9
  • AutomationBench:26.2 → 48.2

智谷称"Scaling后训练是GLM-5.3的全部工作",这验证了一条重要路线:基座模型规模不变的情况下,后训练阶段的计算量和数据多样性仍有巨大空间。

更敏感的话题是安全。 GLM-5.3的网络安全能力在 Scaling 过程中提升速度超出预期——特别是在从漏洞识别向完整漏洞利用链构建的任务上。据报道,GLM-5.3已经发现了Cursor(刚被SpaceX收购)的一个"潜在严重漏洞"。智谷表示API和开源权重将在"安全评估和加固完成后"约两周发布,并引入了"可信访问"机制来管控敏感能力。

这对开源社区是一个微妙的信号:模型能力越强,安全评估周期越长。


2. Google Gemini 3.7 Flash:50%价格优惠,瞄准Coding Agent

谷歌发布了Gemini 3.7 Flash,距3.6 Flash仅三周,迭代速度惊人。

关键信息:

  • API价格:$0.75/$3.75 每百万 input/output tokens(原价$1.50/$7.50),优惠截止2026年底
  • 定位:从"减少推理步骤"转向"更勤奋的规划+更高质量的执行"
  • 性能提升:FrontierCode 1.1 Main 34.4% → 43.6%;DeepSWE v1.1 49.0% → 65.3%

Gemini 3.7 Flash的策略很清晰:用临时半价吸引企业级Coding Agent和知识工作场景的开发者,同时3.5 Pro旗舰模型仍未发布。明年1月1日起恢复原价。

这对依赖Gemini Flash构建高流量Agent的企业来说,是一个窗口期决策:现在是评估迁移成本的关键时刻。


3. DeepSeek V4 Flash涨价最高1100%,开发者社区反弹

DeepSeek宣布V4 Flash和Pro的API价格大幅上调,涨幅最高达1100%(部分缓存命中场景)。

新价格结构:

  • Flash(非高峰期):$0.22/$0.66 / 每百万 tokens
  • Pro(非高峰期):$0.66/$1.98 / 每百万 tokens
  • 峰值时段价格翻倍

DeepSeek的逻辑是:50%时间享受半价,推动"更灵活的工作负载调度"。但开发者社区的批评集中在两点:

  1. 高峰期定价实际上更高,而非只是折扣
  2. 互动式Agent无法受益于"非高峰期调度"

更深的背景是:DeepSeek V4 Flash在公开测试中表现惊艳,OpenRouter排行榜用量第一,但Composio的实测显示它在真实Agent任务(跨Gmail、GitHub、Slack等工具)中仅完成53.8%的复杂多步骤任务——排行榜分数和工程实用性之间仍有显著差距


4. xAI发布Grok 4.6:全球第四,价格中游

xAI(SpaceXAI)发布Grok 4.6,Artificial Analysis排名全球第四,超越Moonshot的Kimi K3。

性能定位:

  • 排名:61分,与GPT-5.6 Sol Max并列
  • 前三名:Claude Opus 5 > Claude Fable 5 > GPT-5.6 Sol Max

定价(值得关注的分层设计):

  • ≤200K prompt tokens:$2/$6 per 1M tokens
  • ≥200K prompt tokens:$4/$12 per 1M tokens

长上下文场景(≥200K)价格翻倍,这反映了长上下文推理的真实成本。企业部署时需要注意tokens成本的非线性增长。


5. Meta发布Glimmer开源模型:Zuckerberg的"AI民主化"叙事

Meta发布Glimmer,一个任何人都可以下载并在自有硬件上运行的开源权重模型。

扎克伯格同时发布公开信称"AI应该属于所有人",批评少数实验室控制AI能力。这与Meta的Muse Spark(更强大但仅通过API提供)形成有趣对比——开源和闭源两条腿走路,但开源版本的定位明显是"普惠"叙事而非性能巅峰。


本周关键趋势

趋势含义
后训练Scaling成主流智谷证明不需要新预训练也能大幅提升
价格战白热化谷歌半价 vs DeepSeek涨价,竞争维度多元
真实Agent性能被放大排行榜高分不等于工程实用
安全评估成开源瓶颈GLM-5.3两周延迟释放说明问题
长上下文成本分层Grok 4.6的200K分界是行业首个明确价格断裂点

一句话总结: 本周大模型战场从"谁分数更高"转向"谁在真实工作流中更可靠、更便宜、更安全"——这是行业走向成熟的信号。


来源:VentureBeat、TechCrunch等 | 时间:2026-08-16