AI日报|GLM-5.3、DeepSeek涨价、Grok 4.6:一周大模型风云
2026年8月16日,AI大模型赛道继续高强度迭代。智谷AI、谷歌、DeepSeek、xAI同时有新动作,加上Meta的开源模型Glimmer,本周大模型格局再次洗牌。
1. 智谷AI发布GLM-5.3:后训练Scaling新纪录,发现Cursor严重漏洞
智谷AI(Z.ai)发布了GLM-5.3,最引人注目的不是基准分数的跃升,而是它完全基于现有7430亿参数基座模型、通过扩大后训练规模实现提升的路线。
核心数据:
- Terminal-Bench 3.0:4.6 → 28.3(+515%)
- DeepSWE v1.1:46.2 → 66.9
- AutomationBench:26.2 → 48.2
智谷称"Scaling后训练是GLM-5.3的全部工作",这验证了一条重要路线:基座模型规模不变的情况下,后训练阶段的计算量和数据多样性仍有巨大空间。
更敏感的话题是安全。 GLM-5.3的网络安全能力在 Scaling 过程中提升速度超出预期——特别是在从漏洞识别向完整漏洞利用链构建的任务上。据报道,GLM-5.3已经发现了Cursor(刚被SpaceX收购)的一个"潜在严重漏洞"。智谷表示API和开源权重将在"安全评估和加固完成后"约两周发布,并引入了"可信访问"机制来管控敏感能力。
这对开源社区是一个微妙的信号:模型能力越强,安全评估周期越长。
2. Google Gemini 3.7 Flash:50%价格优惠,瞄准Coding Agent
谷歌发布了Gemini 3.7 Flash,距3.6 Flash仅三周,迭代速度惊人。
关键信息:
- API价格:$0.75/$3.75 每百万 input/output tokens(原价$1.50/$7.50),优惠截止2026年底
- 定位:从"减少推理步骤"转向"更勤奋的规划+更高质量的执行"
- 性能提升:FrontierCode 1.1 Main 34.4% → 43.6%;DeepSWE v1.1 49.0% → 65.3%
Gemini 3.7 Flash的策略很清晰:用临时半价吸引企业级Coding Agent和知识工作场景的开发者,同时3.5 Pro旗舰模型仍未发布。明年1月1日起恢复原价。
这对依赖Gemini Flash构建高流量Agent的企业来说,是一个窗口期决策:现在是评估迁移成本的关键时刻。
3. DeepSeek V4 Flash涨价最高1100%,开发者社区反弹
DeepSeek宣布V4 Flash和Pro的API价格大幅上调,涨幅最高达1100%(部分缓存命中场景)。
新价格结构:
- Flash(非高峰期):$0.22/$0.66 / 每百万 tokens
- Pro(非高峰期):$0.66/$1.98 / 每百万 tokens
- 峰值时段价格翻倍
DeepSeek的逻辑是:50%时间享受半价,推动"更灵活的工作负载调度"。但开发者社区的批评集中在两点:
- 高峰期定价实际上更高,而非只是折扣
- 互动式Agent无法受益于"非高峰期调度"
更深的背景是:DeepSeek V4 Flash在公开测试中表现惊艳,OpenRouter排行榜用量第一,但Composio的实测显示它在真实Agent任务(跨Gmail、GitHub、Slack等工具)中仅完成53.8%的复杂多步骤任务——排行榜分数和工程实用性之间仍有显著差距。
4. xAI发布Grok 4.6:全球第四,价格中游
xAI(SpaceXAI)发布Grok 4.6,Artificial Analysis排名全球第四,超越Moonshot的Kimi K3。
性能定位:
- 排名:61分,与GPT-5.6 Sol Max并列
- 前三名:Claude Opus 5 > Claude Fable 5 > GPT-5.6 Sol Max
定价(值得关注的分层设计):
- ≤200K prompt tokens:$2/$6 per 1M tokens
- ≥200K prompt tokens:$4/$12 per 1M tokens
长上下文场景(≥200K)价格翻倍,这反映了长上下文推理的真实成本。企业部署时需要注意tokens成本的非线性增长。
5. Meta发布Glimmer开源模型:Zuckerberg的"AI民主化"叙事
Meta发布Glimmer,一个任何人都可以下载并在自有硬件上运行的开源权重模型。
扎克伯格同时发布公开信称"AI应该属于所有人",批评少数实验室控制AI能力。这与Meta的Muse Spark(更强大但仅通过API提供)形成有趣对比——开源和闭源两条腿走路,但开源版本的定位明显是"普惠"叙事而非性能巅峰。
本周关键趋势
| 趋势 | 含义 |
|---|---|
| 后训练Scaling成主流 | 智谷证明不需要新预训练也能大幅提升 |
| 价格战白热化 | 谷歌半价 vs DeepSeek涨价,竞争维度多元 |
| 真实Agent性能被放大 | 排行榜高分不等于工程实用 |
| 安全评估成开源瓶颈 | GLM-5.3两周延迟释放说明问题 |
| 长上下文成本分层 | Grok 4.6的200K分界是行业首个明确价格断裂点 |
一句话总结: 本周大模型战场从"谁分数更高"转向"谁在真实工作流中更可靠、更便宜、更安全"——这是行业走向成熟的信号。
来源:VentureBeat、TechCrunch等 | 时间:2026-08-16