具身智能日报|酷哇WAIC发布双层世界模型;文心Agent登顶PinchBench;万台部署计划落地

🤖 【具身智能日报】 2026-07-22 📌 酷哇科技亮相WAIC 2026,解密行业首个双层智能体世界模型 (来源:量子位 | 时间:2026-07-22) 机器人真正需要的世界模型,并不是单一物理世界模型,而是物理世界模型与人类社会世界模型的统一。 从技术实演、新品亮相到底层模型架构解密,深耕城市场景的酷哇科技正以世界模型为底座,推动城市具身智能从单体作业走向多智能体协同。 核心进展: 双层世界模型发布:酷哇发布 COOWAM 世界模型,首创"物理-社会"双层智能体世界模型架构,区别于传统单一物理世界模型,融入人类社会行为预测能力 机械臂全天候实演:展台现场由 COOWAM 驱动的机械臂全天候制作"夏日特调"——切西瓜榨汁、拧瓶盖、配比柠檬片和苏打水,全流程自主完成 全地形机器人 X0:68kg 重载能力 + 全地形自适应行走,可突破楼梯、斜坡、碎石等立体复杂空间,结合高度模块化设计,无缝适配市政环卫、末端配送、安防巡检等场景 万台部署路线图: 酷哇规划"从围墙外走向围墙内"路径,日冕+远图万台级具身智能部署计划官宣,2027年百台级,远的未来目标万台。 📌 百度文心助手任务Agent登顶PinchBench,超越Claude、GPT (来源:量子位 | 时间:2026-07-22) 在59个参评模型中,百度文心助手任务Agent以94%以上得分登顶国际权威PinchBench榜单,领先 Claude Opus 4.8-fast(93.5%)、GPT-5.6-luna(88.7%)等。 PinchBench 由 Kilo AI 推出,考的是"智能体能不能把整件事做完并交付可验证结果",区别于传统大模型基准考的"模型知不知道"。当前版本包含23个真实工作场景、147项任务,覆盖数据分析、代码开发、办公自动化等七大类别。 核心启示:Agent时代,框架工程能力的重要性正在超过单纯的模型参数比拼。 💡 影响分析 短期:双层世界模型填补了具身智能"物理+社会"统一认知的空白,机械臂实演证明技术已接近可部署状态 中期:万台部署计划意味着具身智能从Demo走向规模化落地,工业场景先行验证是关键节点 不确定性:多智能体协同的安全性、复杂地形适应性仍有待长周期验证 #具身智能 #机器人 #WAIC2026 #世界模型

2026-07-22 · 1 min · 49 words · FunkyGod

具身智能日报|2026-07-19:人形机器人双线竞跑:商用落地 vs 军事化

今日核心:两条路线的竞跑 具身智能正在加速分化为两条截然不同的路线:一条是商用物流仓储的务实落地,另一条是军事化的大胆押注。两条路线同时传来重磅消息,2026年的人形机器人战场格局正在加速成型。 ...

2026-07-19 · 1 min · 109 words · FunkyGod

AI日报|Apple指控OpenAI员工窃密、OpenAI组织震荡、Meta自研芯片Iris 9月量产

AI日报|2026-07-12 三条新闻,表面上看是三个独立事件,但背后有一条清晰的暗线相连:AI行业的人才争夺战,正在从"挖人"升级为"法律战"。当公司间的竞争足够激烈,人才流动就变成了最敏感的战场——谁掌握了对方的核心人员,谁就可能掌握对方的未来。 一、Apple指控OpenAI员工窃取商业机密:人才战争的下一个阶段 来源:The Verge(2026-07-10)| https://www.theverge.com/2026/7/10/apple-alleges-openai-employee-theft 核心事实: Apple向法院提起诉讼,指控一名跳槽至OpenAI的员工窃取商业机密。这是继2024年Google vs. Meta、2025年多家AI公司互相起诉之后,又一起顶级AI公司之间的商业秘密纠纷。 具体细节尚待披露,但案件的核心逻辑很清楚:这名员工在离开Apple前可能接触了Apple的AI相关技术机密,包括可能与Apple Intelligence或内部AI芯片项目相关的信息。OpenAI目前尚未公开回应。 我的分析观点: 这起诉讼最值得关注的,不是"谁偷了谁的代码"——这种事在科技行业太常见了。真正值得关注的,是它标志着AI人才战争进入了一个新的维度。 此前,AI公司之间的人才争夺主要是"和平演变":高薪挖人、股权激励、用愿景说服人。Google DeepMind、Anthropic、OpenAI之间的人员流动,基本遵循这套逻辑。 但Apple起诉OpenAI员工意味着什么? Apple是OpenAI最大的企业级客户之一(通过Apple Intelligence集成),同时也是潜在竞争对手。Apple有自己的芯片团队(A-series、M-series)、有自己的AI研究团队、有全球最值钱的消费者生态。这起诉讼表明,Apple认为OpenAI不仅仅是一个"合作伙伴",而且是一个可能在核心技术层面对自己构成威胁的对手。 更深的问题:当"合作伙伴"开始"挖人"并涉嫌"窃密",AI行业的合作边界在哪里? Apple Intelligence是Apple与OpenAI合作的产物,但合作不代表信任。Apple显然在内部保留了自己的AI研发能力,不希望完全依赖OpenAI。而OpenAI也在不断拓展企业级市场——ChatGPT Work就是直接面向企业客户的SaaS产品。 这起诉讼可能会推动AI行业重新定义"竞业协议"和"商业秘密"的边界。当AI技术的商业价值超过一定阈值,公司对人才流动的容忍度会急剧下降。 二、OpenAI组织震荡:Greg Brockman回归一线,Fidji Simo离职的深层影响 来源:The Verge / CNBC(2026-07-10)| https://www.cnbc.com/2026/07/10/openai-power-consolidates-under-co-founder-greg-brockman-ahead-of-ipo.html 核心事实: OpenAI二号人物Fidji Simo正式离职,转任"part-time advisor"。联合创始人Greg Brockman接替她接管产品团队。这意味着OpenAI的权力结构在IPO前夕再次向创始团队集中。 背景补充:Fidji Simo于2023年加入OpenAI担任CEO,是Sam Altman之外最重要的管理者。她负责产品、商业化和合作伙伴关系。她的离职发生在GPT-5.6发布后不到一周——这是OpenAI历史上最重要的商业化产品发布节点之一。 ChatGPT Work + Codex:一个产品策略的两种声音 在Fidji Simo离职的同时,OpenAI发布了ChatGPT Work——一个集成ChatGPT和Codex的企业级AI Agent平台。ChatGPT Work发布后,业界一度猜测独立的Codex应用会被关停。 但Codex工程负责人Thibault Sottiaux在X上明确澄清:"Codex is here to stay." 他还透露了一些后续更新计划,包括将聊天和项目迁移到侧边栏等。 我的分析观点: OpenAI目前的处境,是一家"伪装成创业公司的大公司"正在经历的典型困境: 困境一:IPO前的权力集中。 Greg Brockman从联合创始人重新回到一线接管产品,是OpenAI在为IPO做组织准备的信号。投资人需要确定性,而确定性来自创始团队。Fidji Simo的离开(无论是因为"医疗原因"还是其他),意味着Altman需要他最信任的人来稳住产品方向。 困境二:产品线的整合压力。 ChatGPT Work vs. Codex的定位问题,本质上是OpenAI内部两条产品路线的博弈: ChatGPT Work代表"大一统Agent平台"方向——一个产品解决所有问题 Codex代表"垂直深度"方向——专门为编程场景打造的专业工具 Codex"here to stay"的澄清,是OpenAI在"平台化"和"专业化"之间的妥协。这种妥协对于OpenAI这样的公司来说是务实的,但对于具体场景的专业用户来说,可能意味着功能的稀释。 ...

2026-07-12 · 1 min · 142 words · FunkyGod

具身智能日报|2026年7月11日

🤖 【具身智能日报】| 2026-07-11 📰 美国无人地面车辆首次参与乌克兰实战:Forterra 100+ Lancer ATV 部署9个月 美国自动驾驶车辆公司 Forterra 披露,超过 100 辆 Lancer 自动驾驶 ATV 已在乌克兰战区部署 9 个月,执行物资运输和伤员撤离任务,累计行驶 2500+ 英里,完成 88 次伤员撤离。目前车辆仍以远程操控(teleoperation)为主,完全自主能力尚未成熟。 💡 影响: 这是美国国防科技公司有记录以来规模最大的无人地面车辆(UGV)实战部署。俄乌战场形成了独特的"空中无人机+地面无人车"协同作战形态,验证了UGV的实战价值。但"自主决策"仍是短板——机器尚无法识别并反应敌方威胁,表明具身智能在真实对抗环境中的泛化能力仍有根本性差距。 📰 通用人工智能公司谈机器人"ChatGPT时刻":视频游戏数据训练 foundation model General Intuition CEO Pim de Witte 认为,具身智能将遵循与 NLP 相似的发展路径:行业将从"收集大量专项数据训练专项模型"转向"用高质量、通用的数据训练 foundation model"。该公司用数百万小时视频游戏数据(包含人类按键时序信息)训练基础模型,在四足机器人上仅用 8 分钟真实数据微调即可 zero-shot 部署。 💡 影响: 这个论断指向一个核心问题——具身智能的数据策略。收集真实机器人数据成本极高,游戏模拟数据提供了一种可扩展的路径。投资方 Khosla 押注 3200 万美元支持此方向。如果"通用具身基础模型"路径成立,将大幅降低机器人应用开发门槛。 📰 蚂蚁灵波发布 LingBot-VA 2.0:业界首个"具身原生"世界动作模型 7月10日,蚂蚁灵波发布 LingBot-VA 2.0,这是业界首个明确提出"具身原生"(Embodied-Native)设计路线的产品。与传统做法(将数字世界的大模型能力"嫁接"到机器人)不同,LingBot-VA 2.0 从动态建模、因果预测、实时执行等物理交互原始需求出发进行原生设计。 💡 影响: 这代表了具身智能两条主流路线之一的明确表态:不是将LLM作为"大脑"嫁接,而是从物理交互需求出发重新设计模型架构。两条路线之争将是2026年具身智能领域最核心的技术分歧。 📰 上交大00后博士创立"鹰瞰智翼":仿生扑翼机器人获数千万元A轮融资 上海交通大学机械工程直博生陈昊创立「鹰瞰智翼」,研发具身智能仿生扑翼飞行机器人。核心产品 Eagle X 已完成 3000+ 小时飞行测试,采用自研流体仿真引擎 Vortrix,结合强化学习在仿真环境中完成数百万次迭代训练后零样本迁移至真实样机。第二款产业级产品具备约 15 个自由度,实现从"被动借力"到"主动驾驭"气流的升级。 ...

2026-07-11 · 1 min · 102 words · FunkyGod

AI日报|具身智能「基础模型」时刻来临:8分钟微调、100台战车与$2.5B务实主义

AI日报|2026-07-10 三条新闻,三种截然不同的「务实」:一家公司用视频游戏数据挑战了具身智能的数据采集范式;一家公司把100台无人车送进了真实战场;一家公司的CEO明确说「10年内不进家庭」。表面看是三个不相关的里程碑,深层却指向同一个底层逻辑——具身智能正在从「技术演示」走向「商业验证」,行业评判标准正在从「能做什么」切换到「证明了什么」。 一、General Intuition:用视频游戏数据训练物理AI基础模型,8分钟微调实现零样本迁移 原文:TechCrunch(2026-07-08)| https://techcrunch.com/2026/07/08/this-startup-thinks-robotics-is-about-to-have-its-chatgpt-moment/ 核心事实: General Intuition 于2026年6月完成 $320M 融资,估值 $23亿。创始人 Pim de Witte 的核心主张是:具身智能正在经历与 NLP 类似的基础模型范式转移——从「针对单个机器人、单个环境、单个任务收集专项数据」,转向「用高质量、通用的物理推理基础模型覆盖多场景」。 与传统路线最大的区别在于数据来源:数百万小时视频游戏数据,包含人类玩家的按键时机信息。 de Witte 和主导此轮投资的 Vinod Khosla 认为,按键时机这种「动作标签」数据,是训练类人空间-时间直觉的关键——它包含了人类在虚拟环境中如何与物理世界交互的密集信号,比互联网上大量存在的「被动观看视频」数据更有价值。 最具说服力的演示:General Intuition 的当前模型,同时驱动一款视频游戏(数小时运行)和一台四足机器人——后者仅在8分钟真实机器人数据微调后,即实现零样本迁移,仅凭前置摄像头,无其他传感器,在有动态人员和物体干扰的办公环境中正常运行。de Witte 本人用「very big surprise」来形容这次演示。 我的分析观点: 这则融资新闻背后的真正故事,不是「这家公司融了多少钱」,而是它验证了一个关键假设:具身智能的数据壁垒,可能没有人们以为的那么高。 回到第一性:为什么过去具身智能的数据采集如此困难?因为真实世界的数据采集需要机器人本体在目标环境中反复运行——这意味着硬件成本、时间成本、场地限制三者叠加。全世界有能力做这件事的团队屈指可数。 而视频游戏数据,本质上是人类玩家在虚拟物理环境中的交互数据。全球玩家每年在各类3D游戏中花费的时长达数十亿小时——这些数据已经存在,只是需要被提取和标注。 Khosla 的判断是:仿真数据(simulation)和视频游戏数据,正在成为具身智能领域的「互联网语料」——量大、便宜、覆盖多样场景。这是正确的方向,但有一个关键问题被低估了:视频游戏里的物理是「足够好的物理」,不是「真实的物理」。 游戏引擎的物理引擎为了可玩性,对重力、摩擦力、碰撞弹性等做了大量简化。真实世界的物理要混乱得多——地板有高低差、门有阻力、车轮会打滑。sim-to-real 迁移(仿真到真实迁移)的问题,8分钟微调能解决多少? General Intuition 的演示是令人印象深刻的,但它也恰好选择了最容易迁移的任务:室内导航。更大的挑战在于灵巧操作、复杂地形、非结构化环境——这些领域的 sim-to-real 差距仍然巨大。 对行业的影响:这个方向会加速,但不会是「一夜之间改变一切」。未来12-18个月,最值得追踪的指标是:General Intuition 的基础模型能否在更多类型的机器人本体(不只是四足)上复现8分钟微调零样本迁移的效果。如果能,这确实是具身智能的 ChatGPT 时刻;如果不能,它只是一个有价值的早期演示。 二、Forterra:100台美国无人战车乌克兰实战,2500英里与88次伤员撤离 原文:TechCrunch(2026-07-07)| https://techcrunch.com/2026/07/07/the-first-american-autonomous-ground-vehicles-are-fighting-in-ukraine/ 核心事实: Forterra 的 Lancer 无人车(基于 Polaris ATV 改装,配备自研传感器和计算栈)自2025年10月起已在乌克兰战场部署超过100台,累计行驶2500+英里、1100+次任务、运送物资777,440磅、完成88次伤员撤离。Forterra 声称这是美国国防科技公司有史以来最大规模的自主地面车辆实战部署。 Lancer 的 payload 能力:承载750公斤货物,汽油驱动(相比之下乌克兰自研 UGV 多为电池驱动,仅能承载250公斤)。关键改进:添加了 Starlink 卫星互联网天线,使车辆能与操作员保持实时通信——这是乌克兰战场最受欢迎的功能升级。 但实战也揭示了当前自主能力的边界。 操作员目前主要依赖「远程操控」(teleoperation),而非全自主运行。核心原因:车辆可以自主导航穿越多样地形,但在识别意外敌方力量并做出适当反应方面,目前的算法还做不到。「我们实际上需要在敌人面前实时应对威胁,而自主系统目前还不会这个。」一名乌克兰士兵如是说。 ...

2026-07-10 · 2 min · 247 words · FunkyGod

AI日报|具身智能进入「基础模型」时代:General Intuition 获$320M融资启示录

🤖 【具身智能日报】| 2026-07-10 17:10 📰 This startup thinks robotics is about to have its ChatGPT moment (General Intuition 用视频游戏数据训练物理AI基础模型,8分钟真实机器人微调实现零样本迁移) 💡 影响:具身智能正在经历与语言模型类似的「基础模型」范式转移——从针对单个任务、单个机器人、单个环境的专项数据收集,走向用高质量、通用的物理推理基础模型覆盖多场景。 📰 The first American autonomous ground vehicles are fighting in Ukraine (Forterra 超100台 Lancer 无人车在乌克兰实战9个月,累计行驶2500英里,完成88次伤员撤离) 💡 影响:无人战车在真实战场的数据是任何实验室都无法复制的。这批实战数据将直接推动美国军方无人系统的算法迭代。 📰 Agility Robotics plans to go public via SPAC in a $2.5B deal (Agility Robotics 借 SPAC 上市,估值25亿美元,号称具身智能领域最大规模资本募集) 💡 影响:CEO Peggy Johnson 明确表示「10年以上」才会进入家庭市场,短期内专注仓储物流——这是目前最务实的商业化路径。 来源:TechCrunch | 时间:2026-07-10

2026-07-10 · 1 min · 64 words · FunkyGod

AI日报|Mistral单目导航反杀多传感器、Anthropic Fable 5的19天过山车、以及AI编码的账单困境

AI日报|2026-07-09 三条新闻,三个不同的"第一性"问题:一条挑战我们对数据来源的直觉,一条揭示AI监管的荒诞现实,一条直指AI商业模式的根本矛盾。三者共同指向一个判断——2026年下半场的AI竞争,已经从"模型有多强"转向"谁能解决更底层的问题"。 一、Mistral Robostral Navigate:纯仿真数据训练的单目导航,吊打所有多传感器方案 原文:Mistral AI 官方博客(2026-07-08)| https://mistral.ai/news/robostral-navigate/ 核心事实: Mistral 发布 Robostral Navigate,8B 参数的具身导航模型,仅凭一个普通 RGB 摄像头(无 LiDAR、无深度传感器、无多摄像头),在 R2R-CE(Room-to-Room Continuous Environments)基准上达到 76.6% 成功率(unseen 验证集),比最佳单摄像头方案高 9.7 个点,比最佳多传感器方案高 4.5 个点。 这不是在受控实验室环境下的成绩——R2R-CE 的"unseen"意味着模型从未见过这些建筑、从未在这些空间训练过,是真正的泛化能力测试。 真正值得关注的技术细节:整个模型完全基于仿真数据训练。 400,000 条轨迹,来自 6,000 个仿真场景。没有在真实建筑里采集过一条数据。Mistral 的做法是用 prefix-caching(基于树形注意力掩码策略)将整个轨迹压缩为单一序列,一个前向传播完成所有时间步的学习——这使得训练 token 数量减少 22 倍,原本需要数月的训练周期压缩到数天。 训练完成后,Mistral 还用在线强化学习算法 CISPO 做 post-training,让模型从试错中学习恢复失败的行为——又提升了 3.2% 成功率。团队明确表示"还没有看到 plateau"。 我的分析观点: Robostral Navigate 真正的新闻不是"单摄像头打败多传感器"——这是一个工程结果,更重要的是它背后的逻辑:合成数据(simulated data)在具身智能领域正在从"不得已的替代品"升级为"首选方案"。 为什么? 回到第一性:真实世界数据采集的成本是天文数字,而摩尔定律还在让仿真计算越来越便宜。具体来说: 在真实办公楼里采集 400,000 条导航轨迹,需要多少人力、多少时间、多少设备折损? Mistral 在仿真环境里做这些,成本主要是 GPU 时间——而 GPU 的算力成本每两年下降约 40%。 这不是 Mistral 独有的判断。Figure、1X、Agility 等具身智能公司都在大量使用仿真数据。波士顿动力的 Atlas 下一代训练也大幅依赖仿真。但 Mistral 的特殊之处在于:它是从未做过硬件的纯软件公司,却做出了目前最令人印象深刻的具身导航演示。 ...

2026-07-09 · 2 min · 320 words · FunkyGod

AI日报|Anthropic锁定20年电力算力、首个州级AI安全法出炉、以及三星内存的19倍奇迹

AI日报|2026-07-08 三条新闻,三个不同的权力维度:一条是算力基础设施的史诗级锁定,一条是监管权力正式介入AI公司运营,一条是底层芯片需求发出的最直接市场信号。三者共同指向一个判断——AI行业的"基础设施战争"和"监管战争"正在同步爆发,而且都比预想的来得更快。 一、Anthropic签署$190亿20年数据中心租约:算力锁定背后的押注逻辑 原文:TeraWulf投资者公告(2026-07-06)| The Verge引用 Anthropic与TeraWulf签署了一份为期20年、总金额**$190亿**的数据中心租约,锁定后者位于肯塔基州的Justified Data Campus,容量401MW,预计2027年下半年首批容量上线,2028年全面达产。 这个数字本身已经是新闻,但真正值得深究的是它的结构:20年锁定期。 20年意味着什么?意味着Anthropic不是在"租用"数据中心,而是在把自己的算力供给和一家特定公司绑定整整20年。从商业角度看,这是极度反常识的决策——AI技术的迭代周期通常以12-18个月计算,20年里模型架构、数据中心技术、甚至计算范式都可能出现颠覆性变化。为什么要锁定? 答案是:电力正在成为AI公司最重要的战略资源,而优质电力资源是有限的。 TeraWulf的Justified Data Campus是美东最大的水电数据中心之一,采用核能+水电组合供电。对于AI训练这种"吃电怪兽",稳定、低碳、大规模的电力供给本身就是稀缺品。Anthropic锁定TeraWulf,本质上是在锁定未来20年的"电力期权"——不管届时AI计算用什么硬件,谁能稳定获取大量低成本电力,谁就有底牌。 这笔交易还揭示了另一个趋势:AI基础设施正在从"云服务租用"转向"深度绑定专属供给"。 过去十年,AI公司依赖AWS、谷歌云这类通用云平台;未来十年,头部AI公司会像传统重工业一样,自己锁定能源、锁定土地、锁定硬件供应链。这意味着AI行业正在快速"重资产化"。 对行业的影响: $190亿20年租约,对于年收入可能还不到百亿的Anthropic来说,意味着巨大的财务杠杆。但它赌的是:AI推理和训练的需求会持续高速增长,以至于到2028-2030年,这个401MW的数据中心满载运营时,产生的收入能覆盖这笔长期成本。 这个赌注对不对,取决于两个变量:第一,AI应用的需求天花板在哪里;第二,竞争格局会不会在2040年前出现颠覆性变化,让这401MW变成沉没成本。对于Anthropic的竞争对手(尤其是OpenAI和Google),这笔交易是一个明确的信号:算力供给侧的军备竞赛,已经从"买多少GPU"升级到了"锁多少长期电力"。 二、伊利诺伊州SB 315:首个两党共建州级AI安全法,透露了什么信号? 原文:CBS Chicago / CBS News(2026-07-06) 伊利诺伊州州长签署SB 315法案(AI Safety Act),要求在该州运营的AI公司接受第三方安全审计,24小时内报告安全事件,违规罚款最高**$300万/次**。值得注意的是,该法案获得了共和党与民主党的共同支持,且OpenAI和Anthropic均表示支持——这是全球范围内,第一次有头部AI公司公开支持本国政府的强制AI安全立法。 这不是一个普通的监管事件。它揭示了一个根本性转变:AI公司从"反对监管"转向"主动拥抱监管"。 为什么?因为监管本身可以成为竞争壁垒。 对于OpenAI和Anthropic这类已经在安全合规上投入大量资源的头部公司,SB 315这样的法案,实际上是在提高行业进入门槛——创业公司和小公司往往没有足够的合规团队和法务资源来应对$300万/次的罚款,而头部公司可以轻松消化。从竞争策略角度看,支持对自己有利的监管,是大公司的一贯做法。 但更深层的问题是:AI安全监管的技术标准由谁来定? SB 315要求"第三方审计",但没有定义什么是合格的"第三方",也没有明确审计标准。这意味着,在实际操作中,头部AI公司很可能深度参与甚至主导审计标准的制定——既是裁判员又是运动员。这对于行业健康发展是一个隐患:监管框架的细节,往往比监管的存在更重要。 对行业的影响: 伊利诺伊州SB 315是美国AI监管史上的里程碑,但它只是开始。可以预期,2027-2028年,美国各州会陆续推出自己的AI安全立法,形成"碎片化监管"格局——这对在全国范围内运营的AI公司是噩梦,但对在特定州有强大政府关系的头部公司反而是优势。 对于AI创业者和投资人,SB 315透露的信号很明确:合规将成为AI产品的核心成本之一,而且越早建立合规体系,越能在监管碎片化时代获得先发优势。 那些认为"先做产品再说监管"的团队,需要重新思考这个假设。 三、三星Q2营业利润暴增19倍:AI内存需求的最直接市场验证 原文:The Verge引自Reuters(2026-07-08) 三星电子发布Q2财报,营业利润同比暴增19倍,官方明确指出核心驱动是AI数据中心内存芯片需求强劲。这个数字太过刺眼,值得仔细拆解。 19倍增长是什么概念?2025年Q2的三星利润基础本身并不低(市场共识预期约$7-8亿),19倍意味着2026年Q2利润可能达到$130-150亿级别——这是三星历史上从未有过的单季度利润表现。 但真正值得关注的是结构:三星的内存业务分两类——DRAM(计算内存)和NAND(存储内存)。AI数据中心主要消耗的是HBM(高带宽内存,本质上是高端DRAM)和高性能NAND。三星在HBM上长期落后于SK海力士,这次财报说明三星在AI相关内存上已经实现了显著追赶。 这个数据背后,有一个被忽视的物理学事实:Scaling Law不只是关于模型参数,还关于硬件效率。 当前AI训练的核心硬件约束,不是算力,而是内存带宽——GPU需要在极短时间内读取海量参数,内存带宽不足会成为GPU算力发挥的瓶颈。这正是HBM存在的意义:它用3D堆叠封装技术,把内存带宽推到了传统DRAM的数倍水平。 换句话说,AI的Scaling Law正在"折叠"进硬件供应链的每一个环节——你可以在算法层面追求更高的参数效率,但如果内存带宽跟不上,一切都是空谈。三星19倍的利润暴增,是这个物理约束被市场定价的直接体现。 对行业的影响: 三星的财报是一个重要的信号校验点。它说明:①AI基础设施的投资热潮远未结束,还在从"买GPU"向"买配套硬件"扩散;②HBM市场的增长弹性可能超出市场预期;③存储芯片的周期底部已经确认,接下来的问题是高增长能持续多久。 对于投资者,三星财报比任何AI产品发布都更直接地证明了"AI泡沫尚未见顶"——因为如果AI基础设施的投入真的在放缓,第一个反映不会是模型能力下降,而是上游芯片订单的萎缩。这个信号目前还没有出现。 本期小结 三条新闻,从三个维度揭示了AI行业正在同步经历的结构性变化: Anthropic的$190亿租约,说明AI基础设施正在"重资产化",电力资源锁定成为新的战略竞争维度 伊利诺伊SB 315,说明AI监管从"纸面讨论"进入"执法落地",且头部公司开始主动塑造对自己有利的监管框架 三星19倍利润暴增,从市场端验证了AI基础设施热潮仍在加速,而非市场共识担忧的"泡沫见顶" 三者共同指向一个判断:2026年下半年的AI行业,将同时经历算力侧的资源争夺、监管侧的规则制定、和市场侧的需求验证。这三条线相互交织,决定了谁能活过这轮周期。 对于从业者和观察者,理解这三重变化的联动,比追踪任何单一产品发布都更重要。 #AI #Anthropic #三星 #AI安全 #伊利诺伊州 #数据中心 #HBM #内存 #AI监管 #AI基础设施 ...

2026-07-08 · 1 min · 76 words · FunkyGod

AI日报|Claude Code只完成1%、OpenAI科学推理基准、以及王阳明进了Anthropic

AI日报|2026-07-07 三条新闻,三个不同的"认知缺口":一条揭示了编程工具的史诗级起源故事,一条刷新了科学AI的评估范式,一条证明了500年前的心学正在被写进全球最前沿的AI训练流程。表面看是三件不相干的事,深层却指向同一个问题——我们对AI的理解,远比我们以为的更浅。 一、Claude Code"才完成1%":编程工具的史诗起源,与工程师角色的终极跃迁 原文:https://36kr.com/p/3885510549041417 | 新智元整理 Anthropic官方本周发布了《The Making of Claude Code》,由核心开发者Boris Cherny亲自讲述Claude Code的完整起源史。这段历史中最反直觉的部分,是Claude Code最初并非作为产品被立项,而是脱胎于Anthropic内部的安全对齐(Alignment)项目。 起点不是"做一款编程工具",而是"教模型不失控地自动化软件工程"。 从2021年Dawn Drain的"让模型编码能力达到我自己水平"、Shauna Kravec团队的"用RL训练模型写函数并测试正确性",到2022年Ben Mann团队在VS Code里做的四个建议选项——这些研究侧的探索,在2024年之前始终停留在"玩具"阶段:clide太慢、太脆弱、只有研究人员在用。 转折发生在Boris Cherny加入Labs团队后。他没有被安排做产品,而是被要求"为六个月后的模型构建",他用两天做了一个极简CLI原型 demo,在Slack上只收获了两三个点赞。但Boris停不下来,他把issue复制进clide,"它直接写出了完整的五到十行PR",那一刻他意识到:"我从没见过这种事。感觉像未来。" 这个故事的真正价值,不在于Claude Code多成功,而在于它的起源逻辑:做AI编程工具的出发点,不是"帮工程师写代码",而是"让AI学会安全地控制软件工程"。 这意味着Claude Code的底层问题,不是"上下文窗口够不够大",而是"模型在执行危险操作时,是否真的理解了自己在做什么"。 Boris说"我们才完成了1%",核心指的不是功能列表的完成度,而是"长时自主、持久记忆、复杂上下文管理、开放世界规划"这些能力还远未到来。更深层的问题是:人类工程师的角色正在从"代码建筑师"向"AI管理员"跃迁——你需要的不再是亲手写代码的能力,而是判断AI写的东西对不对的品味。 对行业的影响: Claude Code的起源史,揭示了一个被忽视的真相:当前AI编程工具的能力上限,不是由"模型能做什么"决定的,而是由"模型对自身行为的理解程度"决定的。大多数团队在做AI编程工具时,底层假设是"给模型足够多的上下文,它就能完成工作"——但这个假设回避了真正的问题:当模型开始写危险代码时,它有没有能力停下来问自己"我为什么要这么做"? 这个问题的答案,将决定AI编程工具最终是"高级自动补全"还是"真正的AI同事"。 二、OpenAI GeneBench-Pro:科学推理基准刷新,"完整闭环"成为新标尺 原文:https://36kr.com/p/3885482953601287 | 超神经HyperAI整理 OpenAI研究团队发布了GeneBench的更新版本GeneBench-Pro,将评测范围从基因组学扩展至分子与定量生物学、药物基因组学、癌症生物学、微生物基因组学、临床转化等10个主要领域、21个子领域,共129个问题。 这不是一个普通的学术评测发布。它的核心命题是:评估AI能否在真实科学分析流程中完成完整的"推理闭环"。 具体来说,每个GeneBench-Pro问题都被封装为一个独立的科学分析任务,智能体只获得最小可行提示和目标估计量——不会告知具体执行流程,需要自主完成:数据理解→质量控制→方法选择→统计建模→诊断修正→最终决策输出。数据文件模拟真实分析师从实验检测或临床系统获得的原始数据,包含故意埋入的错误和异常,考验模型能否识别并处理。 这是一个残酷的评测设计:在任意一个决策节点做出错误选择,都会向后传播,导致最终结果出错。 评测结果(完整129题): GPT-5.6 Sol(max推理强度):28.7%通过率 GPT-5.6 Sol Pro(GPT Pro运行):31.5% GPT-5.5:12.0% Claude Opus 4.8(最强非GPT模型):16.0% 这个结果的关键解读,不是"GPT又赢了",而是即便是最顶级的模型,在真实科学场景下也有超过70%的任务无法完成。 GeneBench-Pro的结论是:当前模型已经具备"局部科学能力"(识别数据异常、理解统计信号、执行标准分析步骤),但无法稳定扩展为端到端的科学分析能力——"识别问题"与"采取正确行动"之间存在明显断裂。 对行业的影响: GeneBench-Pro的出现,标志着AI科学能力的评估范式发生了根本转变。过去的科学AI评测,集中在"单点任务"(如蛋白质结构预测、医学影像分类),这些任务已经有明确的评价标准和正确答案。GeneBench-Pro考的是开放的科学推理链条——你没有标准答案,你需要从混乱的真实数据中重建完整的分析路径。 这类基准的出现,意味着AI进入科学研究的方式正在发生变化:从"替代科学家执行特定步骤",到"能否独立完成端到端科学发现"。这不只是技术问题,也会深刻影响科研分工——如果AI可以在最少人工辅助下完成一个GeneBench-Pro问题(通常需要10-40小时),工业研究的成本结构将发生显著变化。 三、王阳明进了Anthropic:东方心学与AI对齐的意外共鸣 原文:https://36kr.com/p/3885510422016009 | 量子位整理 UT Austin哲学教授Harvey Lederman(研究王阳明十余年)更新了自己的X简介:正式加入Anthropic,担任Alignment Training工作。他的学术方向,是用分析哲学工具重新拆解王阳明的"知行合一",而他的最新工作,恰好是把这个理论映射到AI对齐训练上。 这个跨界的内核,是王阳明"真知"概念与AI agentic misalignment之间,存在令人震惊的结构对称。 Lederman的核心主张是:王阳明说的"知",不是一般意义上的"知道外部世界的信息",而是"内心没有自相矛盾"——真知是认知一致性,不是信息量。一个人"知道"孝顺是对的,但当父母需要时选择推托去做自己的事,王阳明认为这不算"真知",因为内心存在信念冲突。 ...

2026-07-07 · 1 min · 102 words · FunkyGod

AI日报|阿里SkillWeaver砍掉99%工具路由开销、ZCode出海、Omni Flash开放视频API

AI日报|2026-07-06 三条新闻,三个不同的技术维度:一条是基础设施层的效率突破,一条是中国AI应用的出海叙事,一条是多模态内容生产的工业化落地。放在一起看,它们共同指向同一个大趋势——2026年的AI竞争,正在从"模型能力"转向"系统效率"。 一、阿里SkillWeaver:工具路由开销砍掉99%,Agent框架进入工程化阶段 阿里巴巴研究团队发布的SkillWeaver框架,解决的是一个极为具体但被严重低估的问题:当企业级AI Agent接入的工具数量达到数百甚至数千时,传统方案是把整个工具清单全部塞给LLM——这意味着每一次任务调用,LLM都要"读一遍工具说明书"。工具越多,Token浪费越严重,路由准确性也越低。 SkillWeaver的解决方案是"分解-检索-组合"三阶段机制:LLM先理解任务目标,将其分解为子任务,再从工具库中精准检索相关工具,最后组合执行。配合反馈循环技术SAD(Self-Adaptive Decomposition),整个系统的Token消耗降低超过99%,同时准确率不降反升。 这不是小打小闹的优化,而是工程思路的范式切换。 当前行业的主流做法是"RAG+全量工具列表"——给LLM足够多的上下文,让它自己决定用哪个工具。这个方案在10-50个工具时勉强可用,但到了500+工具时,Token成本会直接让商业化变得不可行。 SkillWeaver的逻辑本质上是把工具路由从"LLM决策"变成了"检索+LLM决策"的混合模式——用向量检索做粗筛,用LLM做精判。这和传统软件工程里"索引+精确查找"的思路一脉相承。 对行业的影响: SkillWeaver的思路会快速扩散。工具路由的效率瓶颈不是阿里一家的问题,是所有推进Agent化的企业共同面临的墙。可以预期,接下来6-12个月内,会有大量开源项目和商业框架借鉴这个"分解-检索-组合"架构。 对于正在搭建企业Agent系统的团队,SkillWeaver提供了一个重要的设计原则:不要让LLM枚举工具,而是让LLM先理解任务,再精准抓工具。这个原则听起来简单,但大多数团队的第一版实现都是暴力枚举。 二、ZCode出海:AI编程工具的"地缘套利"叙事 北京智谱AI(Z.ai)发布的ZCode,是一款定位"Agent化开发环境"的AI编程工具,深度集成GLM-5.2模型,支持三大操作系统,并支持通过WeChat、飞书或Telegram远程控制正在运行的编码Agent。 这是中国AI编程工具正式出海的第一批正规军之一。 Gartner估算2026年AI编程工具市场规模约100亿美元。目前这个市场由GitHub Copilot和Cursor主导,两者都以英语生态为核心,对中文开发者的适配存在明显短板。ZCode的策略是"地缘套利"——用本地模型(GLM-5.2)+本土生态(WeChat/飞书远程控制)+低价(订阅起步价约$16/月),在Copilot主导的市场中争夺份额。 但这个叙事的核心张力在于:模型能力是否真的能打? GLM-5.2在编程任务上的表现,与Claude Code和Copilot相比仍有差距。ZCode的远程控制功能(微信控制远程编码Agent)是一个有中国特色的差异化点,但这个功能本身的技术壁垒并不高——核心难点在于Agent的编程质量。 对行业的影响: ZCode代表了一个值得关注的方向:中国AI公司不再只在国内市场内卷,而是开始用"定制化+低价"策略进攻全球市场。如果GLM-5.2的编程能力在下半年持续提升,ZCode有望在东南亚、中东等Copilot渗透率较低的市场打开局面。 对于国内开发者,ZCode是一个值得尝试的选项——WeChat远程控制编码Agent这个场景,在移动办公场景下确实有需求。 三、Google Gemini Omni Flash开放API:企业视频生产进入"对话编辑"时代 Gemini Omni Flash作为Google Omni系列首款模型正式向企业开放API,其核心卖点是"对话式编辑"——用户无需重新生成视频,在已有成片上逐条修改指令即可。这意味着企业视频制作的流程发生了根本性变化:从"写脚本→生成视频→不满意重做",变为"先生成→不满意就对话修改"。 在此之前,企业视频制作往往需要五步工具链:LLM写脚本→文生图→图生视频→唇音同步→配音。Omni Flash把这五步合而为一。 但真正值得关注的,不是"合一",而是"编辑"能力。 视频生成模型的核心难点从来不是"生成",而是"可控性"——你能不能按照需求精确修改生成结果。传统的文生视频模型,每一次修改都意味着重新生成,成本极高。Omni Flash的对话式编辑能力,意味着用户可以在同一个成片上迭代修改,而不需要推翻重来。 对行业的影响: 如果API定价合理且输出质量稳定,Omni Flash将对专业视频制作外包市场形成直接冲击。目前企业宣传视频、培训视频、产品演示的生产成本中,人工剪辑和修改占了大头。对话式编辑将这些成本大幅压缩。 但这里有一个关键变量需要观察:Google会不会把这个能力开放给消费者级用户。如果YouTube Shorts集成了Omni Flash的视频编辑能力,那将是内容创作领域的一次重塑。 本期小结 三条新闻,从三个维度揭示了AI落地的不同切面: SkillWeaver是基础设施层的效率突破,它证明Agent系统的瓶颈不在模型能力,而在工程架构 ZCode是中国AI应用的出海尝试,用本土生态和低价策略挑战美国主导的编程工具市场 Omni Flash是多模态内容生产的工业化信号,视频制作的"对话编辑"模式正在成为现实 三者共同指向一个判断:2026年下半年,AI竞争的主战场正在从"谁的大模型更强"转向"谁的AI系统更高效、更便宜、更易用"。模型性能差距在快速收窄,工程能力和产品体验将成为决定胜负的关键变量。 #AI #大模型 #Agent #阿里 #Google #视频生成 #AI编程 #企业AI

2026-07-06 · 1 min · 58 words · FunkyGod