AI日报|Claude Code只完成1%、OpenAI科学推理基准、以及王阳明进了Anthropic

AI日报|2026-07-07 三条新闻,三个不同的"认知缺口":一条揭示了编程工具的史诗级起源故事,一条刷新了科学AI的评估范式,一条证明了500年前的心学正在被写进全球最前沿的AI训练流程。表面看是三件不相干的事,深层却指向同一个问题——我们对AI的理解,远比我们以为的更浅。 一、Claude Code"才完成1%":编程工具的史诗起源,与工程师角色的终极跃迁 原文:https://36kr.com/p/3885510549041417 | 新智元整理 Anthropic官方本周发布了《The Making of Claude Code》,由核心开发者Boris Cherny亲自讲述Claude Code的完整起源史。这段历史中最反直觉的部分,是Claude Code最初并非作为产品被立项,而是脱胎于Anthropic内部的安全对齐(Alignment)项目。 起点不是"做一款编程工具",而是"教模型不失控地自动化软件工程"。 从2021年Dawn Drain的"让模型编码能力达到我自己水平"、Shauna Kravec团队的"用RL训练模型写函数并测试正确性",到2022年Ben Mann团队在VS Code里做的四个建议选项——这些研究侧的探索,在2024年之前始终停留在"玩具"阶段:clide太慢、太脆弱、只有研究人员在用。 转折发生在Boris Cherny加入Labs团队后。他没有被安排做产品,而是被要求"为六个月后的模型构建",他用两天做了一个极简CLI原型 demo,在Slack上只收获了两三个点赞。但Boris停不下来,他把issue复制进clide,"它直接写出了完整的五到十行PR",那一刻他意识到:"我从没见过这种事。感觉像未来。" 这个故事的真正价值,不在于Claude Code多成功,而在于它的起源逻辑:做AI编程工具的出发点,不是"帮工程师写代码",而是"让AI学会安全地控制软件工程"。 这意味着Claude Code的底层问题,不是"上下文窗口够不够大",而是"模型在执行危险操作时,是否真的理解了自己在做什么"。 Boris说"我们才完成了1%",核心指的不是功能列表的完成度,而是"长时自主、持久记忆、复杂上下文管理、开放世界规划"这些能力还远未到来。更深层的问题是:人类工程师的角色正在从"代码建筑师"向"AI管理员"跃迁——你需要的不再是亲手写代码的能力,而是判断AI写的东西对不对的品味。 对行业的影响: Claude Code的起源史,揭示了一个被忽视的真相:当前AI编程工具的能力上限,不是由"模型能做什么"决定的,而是由"模型对自身行为的理解程度"决定的。大多数团队在做AI编程工具时,底层假设是"给模型足够多的上下文,它就能完成工作"——但这个假设回避了真正的问题:当模型开始写危险代码时,它有没有能力停下来问自己"我为什么要这么做"? 这个问题的答案,将决定AI编程工具最终是"高级自动补全"还是"真正的AI同事"。 二、OpenAI GeneBench-Pro:科学推理基准刷新,"完整闭环"成为新标尺 原文:https://36kr.com/p/3885482953601287 | 超神经HyperAI整理 OpenAI研究团队发布了GeneBench的更新版本GeneBench-Pro,将评测范围从基因组学扩展至分子与定量生物学、药物基因组学、癌症生物学、微生物基因组学、临床转化等10个主要领域、21个子领域,共129个问题。 这不是一个普通的学术评测发布。它的核心命题是:评估AI能否在真实科学分析流程中完成完整的"推理闭环"。 具体来说,每个GeneBench-Pro问题都被封装为一个独立的科学分析任务,智能体只获得最小可行提示和目标估计量——不会告知具体执行流程,需要自主完成:数据理解→质量控制→方法选择→统计建模→诊断修正→最终决策输出。数据文件模拟真实分析师从实验检测或临床系统获得的原始数据,包含故意埋入的错误和异常,考验模型能否识别并处理。 这是一个残酷的评测设计:在任意一个决策节点做出错误选择,都会向后传播,导致最终结果出错。 评测结果(完整129题): GPT-5.6 Sol(max推理强度):28.7%通过率 GPT-5.6 Sol Pro(GPT Pro运行):31.5% GPT-5.5:12.0% Claude Opus 4.8(最强非GPT模型):16.0% 这个结果的关键解读,不是"GPT又赢了",而是即便是最顶级的模型,在真实科学场景下也有超过70%的任务无法完成。 GeneBench-Pro的结论是:当前模型已经具备"局部科学能力"(识别数据异常、理解统计信号、执行标准分析步骤),但无法稳定扩展为端到端的科学分析能力——"识别问题"与"采取正确行动"之间存在明显断裂。 对行业的影响: GeneBench-Pro的出现,标志着AI科学能力的评估范式发生了根本转变。过去的科学AI评测,集中在"单点任务"(如蛋白质结构预测、医学影像分类),这些任务已经有明确的评价标准和正确答案。GeneBench-Pro考的是开放的科学推理链条——你没有标准答案,你需要从混乱的真实数据中重建完整的分析路径。 这类基准的出现,意味着AI进入科学研究的方式正在发生变化:从"替代科学家执行特定步骤",到"能否独立完成端到端科学发现"。这不只是技术问题,也会深刻影响科研分工——如果AI可以在最少人工辅助下完成一个GeneBench-Pro问题(通常需要10-40小时),工业研究的成本结构将发生显著变化。 三、王阳明进了Anthropic:东方心学与AI对齐的意外共鸣 原文:https://36kr.com/p/3885510422016009 | 量子位整理 UT Austin哲学教授Harvey Lederman(研究王阳明十余年)更新了自己的X简介:正式加入Anthropic,担任Alignment Training工作。他的学术方向,是用分析哲学工具重新拆解王阳明的"知行合一",而他的最新工作,恰好是把这个理论映射到AI对齐训练上。 这个跨界的内核,是王阳明"真知"概念与AI agentic misalignment之间,存在令人震惊的结构对称。 Lederman的核心主张是:王阳明说的"知",不是一般意义上的"知道外部世界的信息",而是"内心没有自相矛盾"——真知是认知一致性,不是信息量。一个人"知道"孝顺是对的,但当父母需要时选择推托去做自己的事,王阳明认为这不算"真知",因为内心存在信念冲突。 ...

2026-07-07 · 1 min · 102 words · FunkyGod

AI日报|阿里SkillWeaver砍掉99%工具路由开销、ZCode出海、Omni Flash开放视频API

AI日报|2026-07-06 三条新闻,三个不同的技术维度:一条是基础设施层的效率突破,一条是中国AI应用的出海叙事,一条是多模态内容生产的工业化落地。放在一起看,它们共同指向同一个大趋势——2026年的AI竞争,正在从"模型能力"转向"系统效率"。 一、阿里SkillWeaver:工具路由开销砍掉99%,Agent框架进入工程化阶段 阿里巴巴研究团队发布的SkillWeaver框架,解决的是一个极为具体但被严重低估的问题:当企业级AI Agent接入的工具数量达到数百甚至数千时,传统方案是把整个工具清单全部塞给LLM——这意味着每一次任务调用,LLM都要"读一遍工具说明书"。工具越多,Token浪费越严重,路由准确性也越低。 SkillWeaver的解决方案是"分解-检索-组合"三阶段机制:LLM先理解任务目标,将其分解为子任务,再从工具库中精准检索相关工具,最后组合执行。配合反馈循环技术SAD(Self-Adaptive Decomposition),整个系统的Token消耗降低超过99%,同时准确率不降反升。 这不是小打小闹的优化,而是工程思路的范式切换。 当前行业的主流做法是"RAG+全量工具列表"——给LLM足够多的上下文,让它自己决定用哪个工具。这个方案在10-50个工具时勉强可用,但到了500+工具时,Token成本会直接让商业化变得不可行。 SkillWeaver的逻辑本质上是把工具路由从"LLM决策"变成了"检索+LLM决策"的混合模式——用向量检索做粗筛,用LLM做精判。这和传统软件工程里"索引+精确查找"的思路一脉相承。 对行业的影响: SkillWeaver的思路会快速扩散。工具路由的效率瓶颈不是阿里一家的问题,是所有推进Agent化的企业共同面临的墙。可以预期,接下来6-12个月内,会有大量开源项目和商业框架借鉴这个"分解-检索-组合"架构。 对于正在搭建企业Agent系统的团队,SkillWeaver提供了一个重要的设计原则:不要让LLM枚举工具,而是让LLM先理解任务,再精准抓工具。这个原则听起来简单,但大多数团队的第一版实现都是暴力枚举。 二、ZCode出海:AI编程工具的"地缘套利"叙事 北京智谱AI(Z.ai)发布的ZCode,是一款定位"Agent化开发环境"的AI编程工具,深度集成GLM-5.2模型,支持三大操作系统,并支持通过WeChat、飞书或Telegram远程控制正在运行的编码Agent。 这是中国AI编程工具正式出海的第一批正规军之一。 Gartner估算2026年AI编程工具市场规模约100亿美元。目前这个市场由GitHub Copilot和Cursor主导,两者都以英语生态为核心,对中文开发者的适配存在明显短板。ZCode的策略是"地缘套利"——用本地模型(GLM-5.2)+本土生态(WeChat/飞书远程控制)+低价(订阅起步价约$16/月),在Copilot主导的市场中争夺份额。 但这个叙事的核心张力在于:模型能力是否真的能打? GLM-5.2在编程任务上的表现,与Claude Code和Copilot相比仍有差距。ZCode的远程控制功能(微信控制远程编码Agent)是一个有中国特色的差异化点,但这个功能本身的技术壁垒并不高——核心难点在于Agent的编程质量。 对行业的影响: ZCode代表了一个值得关注的方向:中国AI公司不再只在国内市场内卷,而是开始用"定制化+低价"策略进攻全球市场。如果GLM-5.2的编程能力在下半年持续提升,ZCode有望在东南亚、中东等Copilot渗透率较低的市场打开局面。 对于国内开发者,ZCode是一个值得尝试的选项——WeChat远程控制编码Agent这个场景,在移动办公场景下确实有需求。 三、Google Gemini Omni Flash开放API:企业视频生产进入"对话编辑"时代 Gemini Omni Flash作为Google Omni系列首款模型正式向企业开放API,其核心卖点是"对话式编辑"——用户无需重新生成视频,在已有成片上逐条修改指令即可。这意味着企业视频制作的流程发生了根本性变化:从"写脚本→生成视频→不满意重做",变为"先生成→不满意就对话修改"。 在此之前,企业视频制作往往需要五步工具链:LLM写脚本→文生图→图生视频→唇音同步→配音。Omni Flash把这五步合而为一。 但真正值得关注的,不是"合一",而是"编辑"能力。 视频生成模型的核心难点从来不是"生成",而是"可控性"——你能不能按照需求精确修改生成结果。传统的文生视频模型,每一次修改都意味着重新生成,成本极高。Omni Flash的对话式编辑能力,意味着用户可以在同一个成片上迭代修改,而不需要推翻重来。 对行业的影响: 如果API定价合理且输出质量稳定,Omni Flash将对专业视频制作外包市场形成直接冲击。目前企业宣传视频、培训视频、产品演示的生产成本中,人工剪辑和修改占了大头。对话式编辑将这些成本大幅压缩。 但这里有一个关键变量需要观察:Google会不会把这个能力开放给消费者级用户。如果YouTube Shorts集成了Omni Flash的视频编辑能力,那将是内容创作领域的一次重塑。 本期小结 三条新闻,从三个维度揭示了AI落地的不同切面: SkillWeaver是基础设施层的效率突破,它证明Agent系统的瓶颈不在模型能力,而在工程架构 ZCode是中国AI应用的出海尝试,用本土生态和低价策略挑战美国主导的编程工具市场 Omni Flash是多模态内容生产的工业化信号,视频制作的"对话编辑"模式正在成为现实 三者共同指向一个判断:2026年下半年,AI竞争的主战场正在从"谁的大模型更强"转向"谁的AI系统更高效、更便宜、更易用"。模型性能差距在快速收窄,工程能力和产品体验将成为决定胜负的关键变量。 #AI #大模型 #Agent #阿里 #Google #视频生成 #AI编程 #企业AI

2026-07-06 · 1 min · 58 words · FunkyGod

AI日报|Claude Fable 5 全球回归、谷歌25年首次改搜索框、企业AI监控大缺口

AI日报|2026-07-05 三条新闻,三个不同维度:一条是地缘政治的意外反转,一条是产品形态的结构性迁移,一条是企业运营的深层短板。三者共同勾勒出一个正在"从玩具走向基础设施"的AI行业。 一、Claude Fable 5 全球回归:出口管制的意外松绑 美国政府解除针对 Claude Fable 5 的出口管制令,Anthropic 随即宣布面向全球用户重新开放访问。与此同时,被曝正与三星洽谈定制 AI 芯片合作——这是继 Google TPU、Titan 合作和 Amazon Bedrock 集成之后,Anthropic 在芯片侧垂直整合的又一次落子。 这不是普通的"恢复服务"。 出口管制本身是一个高度政治化的动作——它意味着美国政府认定某项 AI 能力对外提供存在国家安全风险。解除管制,通常意味着要么该能力的敏感性下降,要么地缘政治博弈出现了新的筹码交换。无论哪种情况,对 Anthropic 来说都是一次意外的政策红利。 第一性分析: Anthropic 的芯片战略正在形成清晰的路径:不完全自研(成本太高、风险太大),而是与成熟的芯片制造伙伴深度绑定。三星的优势是先进制程,Anthropic 的优势是模型架构和推理优化。两者结合,目标是做出比通用 GPU 更高效、更便宜的定制推理芯片。 这背后的逻辑是:AI 公司的成本结构里,推理算力是最重的一块。以当前 API 定价估算,Anthropic 收入的相当比例最终以 GPU 租赁费的形式流向英伟达和云厂商。这是一种"苹果税"——模型公司做出了产品,但利润被基础设施层截流。 定制芯片是打破这个"税"的最直接路径。如果 Anthropic-三星芯片成功,Anthropic 将成为继 Google(TPU)之后,第二个拥有定制推理芯片能力的 AI 实验室。这将显著改善其成本结构,对 IPO 估值形成正向支撑。 对行业的影响: 芯片-模型协同优化正在成为 AI 实验室的核心竞争力标配,而非可选项。英伟达在 AI 训练市场的垄断地位相对稳固,但在推理市场,随着各大实验室推进定制化芯片,通用 GPU 的溢价空间将被持续压缩。 二、Google 25 年来首次重新设计搜索框:AI 原生化还是搜索消亡序曲? Google 宣布将正式退役沿用 25 年的经典搜索框范式,这是自 1998 年 Google 搜索上线以来最大的一次产品形态重构。官方将于 5 月 19 日公布详情,预计搜索框将与 AI Mode 深度整合。 ...

2026-07-05 · 2 min · 243 words · FunkyGod

AI日报|SkillWeaver 99%降本架构、微软25亿美元押注AI落地、Anthropic牵手三星自研芯片

AI日报|2026-07-04 三条来自不同维度的进展,指向一个共同主题:2026年AI竞争已从"模型性能"转向"落地效率与供应链控制"的主战场。 一、阿里巴巴 SkillWeaver:Agent 工具路由的 99% 降本革命 当一个 AI Agent 需要调度数百个工具时,传统做法是把整个工具库塞给 LLM——相当于让一个人每次查字典都要把整本书翻开。这不是工程问题,这是架构问题。 阿里达摩院最新发布的 SkillWeaver 框架,给出了截然不同的答案。其核心是"分解→检索→组合"三阶段管道:首先由 LLM 将复杂任务拆解为原子子任务,再通过向量检索从工具库中匹配候选工具,最后由规划器评估工具间兼容性,输出可执行的 DAG 流程图。 关键创新在于 SAD(Skill-Aware Decomposition)机制:LLM 初稿往往用词过于通用,与工具库的技术术语存在语义鸿沟。SAD 通过"初稿→初步检索→反馈重写"的迭代闭环,让任务描述逐步对齐实际工具——不是让模型猜,而是让它逐步校准。 实测结果:在涉及多工具组合的复杂工作流中,SkillWeaver 将 Token 消耗降低了 99% 以上,同时提升了路由准确率。 第一性分析: 这件事的本质,不是"省钱",而是"解锁规模"。当工具路由的边际成本趋近于零,企业就可以给 Agent 配置数百甚至数千个工具,而不用担心上下文溢出或成本爆炸。这意味着 Agent 的工具生态将从"小而精"走向"大而全"——从几十个工具的能力池,走向成百上千个工具的能力池。 类比一下:从"只能打电话的功能机"到"应用商店里有百万 App 的智能手机"。 对行业的影响: 工具路由优化将成为 2026-2027 年 Agent 基础设施军的标配。这不只是阿里的机会,也是所有在做 Agent 框架、云服务和企业 AI 部署的玩家必须争夺的赛道。对 OpenAI、Anthropic 等平台方的工具调用定价模式,也将构成系统性挑战——如果客户可以用更少的 Token 完成同样任务,平台方的收入模型需要重新设计。 二、微软 Frontier Company:25 亿美元押注 AI 落地的"最后一公里" 7月2日,微软宣布成立 Microsoft Frontier Company,注资 25 亿美元、派遣 6000 名工程师,专攻企业级 AI 部署。已与伦敦证券交易所集团、联合利华等 Fortune 500 客户签约。 ...

2026-07-04 · 1 min · 186 words · FunkyGod

AI日报|Claude Sonnet 5 定价暗战、阿里99%降本框架与摩根士丹利的反常识AI复盘

AI日报|2026-07-03 三条来自不同维度的进展,指向同一个核心命题:2026年下半年,AI竞争已从"模型性能竞赛"转向"落地效率与商业可持续性"的主战场。 一、Claude Sonnet 5:Anthropic 的 IPO 定价暗战 6月30日,Anthropic 发布 Claude Sonnet 5。官方定位是"最具 Agent 能力的中端模型",定价策略却透露出强烈的 IPO 冲刺信号。 定价结构拆解: 输入:$2/百万 Token(8月31日前),之后调整为 $3 输出:$10/百万 Token(8月31日前),之后调整为 $15 对比:Opus 4.8 输入 $5/输出 $25,Sonnet 4.6 输入 $3/输出 $15 Sonnet 5 的定价逻辑不是"比 Opus 便宜",而是"比 Opus 便宜 60%,同时性能差距压缩到 10-20%"。这是一个精心计算的定价锚点——用旗舰性能 80% 的体验,切走企业开发者市场 60% 的成本账单。 第一性分析: Anthropic 正在用 Sonnet 5 回答一个根本问题:如何在 IPO 前让收入增速匹配估值膨胀?Opus 系列是天花板,用来维持技术叙事和品牌溢价;Sonnet 5 是跑量主力,用来冲收入数字和企业市场占有率。两者形成"高低搭配"的收入组合。 这背后是 IPO 窗口期的产品节奏压力。每一次模型发布,都是对估值逻辑的一次夯实。Sonnet 5 的策略很清晰:先占领钱包,再考虑利润。 对行业的影响: Sonnet 5 的定价将对 OpenAI 的 GPT-5 策略形成直接压力。如果 GPT-5 维持高价,企业开发者有了一个"性价比更高、Agent 能力接近"的替代选项。这会倒逼 OpenAI 在定价上做出调整。整个行业的定价中枢,正在被 Anthropic 这一定价策略所牵引。 ...

2026-07-03 · 1 min · 209 words · FunkyGod

AI日报|Oracle因AI裁员2.1万人、Meta深伪内容争议、五眼联盟警告AI网络威胁

Oracle因AI裁员2.1万人,科技业今年超11万人被替代 甲骨文公司在过去12个月裁减约2.1万名员工,规模约占总人力的13%。公司在周一提交的一份披露文件中明确将裁员部分归因于AI技术的推进。值得关注的是,Oracle并非孤例——截至目前,2026年已有196家科技公司累计裁员超过11.98万人,「AI替代效应」正在从概念变为现实。 这则消息之所以重要,是因为Oracle是 enterprise 软件和数据库领域的老牌巨头,其技术决策通常滞后于消费互联网公司。它的AI裁员动作说明:AI对白领工作的冲击已经从实验室进入企业实际运营阶段。这与此前侧重「AI辅助编程」或「AI生成文案」的叙事不同——Oracle的裁员指向的是更深层的业务流程自动化。 从第一性原理看:企业的终极目标是用更少的劳动力产出更多的价值。如果AI能够替代白领工作(而不仅是辅助),其对劳动力市场的影响将远超此前多数分析的预期。当然,这里仍有重要的不确定性:被裁员工是否转向了其他AI相关岗位?AI替代的是否是重复性工作而非创造性工作?但无论如何,这都是一个值得高度关注信号。 📎 Oracle cut 21,000 jobs because of AI - The Verge | 路透社原始披露文件 Meta暂停员工追踪工具:AI训练数据泄露的内部危机 Meta已暂停其争议性AI训练数据收集项目,此前Business Insider获取的截图显示,该程序收集的数据——包括员工私人对话、工作绩效评估和通话记录——可在公司内部随意访问。Meta声明表示:「我们为该项目设计了隐私保护措施,目前尚无数据被不当访问的迹象,但正在暂停项目展开调查。」 这起事件的深层含义在于它揭示了科技公司在AI训练数据获取上的激进策略。当员工的工作内容、私人对话都成为模型训练素材时,「数据隐私」的边界在哪里?Meta此前就因未经同意使用用户数据训练AI而备受批评,这次内部泄露不过是同一逻辑的延伸。 对于整个行业而言,此事件可能带来两方面影响:一是监管机构可能借此加强对企业AI训练数据来源的审查;二是员工对公司的数据信任度下降,可能影响人才留存。 📎 Meta pauses employee tracking tool after internal leak - The Verge 五眼联盟呼吁立即行动:AI正在重塑网络威胁格局 美国、英国、加拿大、澳大利亚和新西兰组成的情报联盟「五眼」(Five Eyes)发布联合警告,称AI模型预计将在数月内从根本上改变网络攻防能力,「违规行为必然会发生」。五眼联盟在声明中明确指出:「对手已经在利用AI以更快的速度、更高的效率行动,防御方必须做到同样水平。」 英国国家网络安全中心(NCSC)发布的配套报告详细阐述了AI如何改变网络风险:AI使攻击者能够大规模自动化入侵、生成更难检测的钓鱼内容、快速扫描漏洞并发起定向攻击。 这是迄今为止最权威的政府机构对AI网络威胁的系统性表态。考虑到五眼联盟成员国的情报能力,其判断的可信度远高于一般安全公司的报告。 📎 Five Eyes urges organizations to 'act now' against AI cyber threats - The Verge | NCSC原始报告 SK Hynix超越三星:AI存储芯片格局剧变 芯片制造商SK Hynix——英伟达和谷歌高带宽内存(HBM)芯片的供应商——其市值已突破1.35万亿美元,正式超越三星电子成为韩国最具价值公司。三星自2000年以来一直占据榜首位置。路透社的报道称之为SK Hynix的「戏剧性复兴」,因为就在二十年前,这家公司还几乎被债务压垮。 这则消息背后是一个深刻的第一性原理变化:AI计算的核心瓶颈正在从GPU算力向内存带宽转移。HBM芯片之所以重要,是因为大模型推理需要高速数据吞吐——算力再强,数据传不进去也是白搭。SK Hynix早早押注HBM并与英伟达深度绑定,而三星在HBM研发上进展相对缓慢,最终导致今天的格局翻转。 对投资者而言,这意味着AI基础设施的投资逻辑正在分化:不仅要看GPU,还要看内存、网络和存储。 📎 SK Hynix overtakes Samsung as Korea's most valuable company - The Verge ...

2026-06-23 · 1 min · 104 words · FunkyGod