AI日报|GPT-5.6三连发:ARC-AGI评测真相、10万学者免费计划、全栈效率革命

GPT-5.6三连发:OpenAI今日释放的三条重要信息 7月29日,OpenAI官方博客同步发布三篇文章,内容分别涉及:ARC-AGI-3评测方法论反思、学术研究者免费计划、以及GPT-5.6全栈效率优化。这三篇表面上是各自独立的技术/产品文章,但放在一起读,能看到OpenAI当前战略的一条暗线。 一、ARC-AGI-3评测真相:模型能力≠系统表现 核心事实:GPT-5.6 Sol在ARC-AGI-3基准测试中,开启"retained reasoning"(保留推理链)和"compaction"(冗余压缩)两项设置后,成绩从官方harness的13.3%跃升至38.3%,同时输出token减少6倍。 这组数字背后有一个重要的行业议题:评测框架与生产环境的落差。 ARC-AGI的官方评测刻意采用"裸harness"设计,目的是让不同模型的真实能力差异更可见。这个设计逻辑是合理的——但它同时意味着,厂商在产品中默认开启的优化手段,完全不会体现在官方分数里。 GPT-5.6 Sol的38.3%与人类基准48%之间的差距,比表面看起来更值得玩味:如果说这是"模型能力",那13.3%同样也是"模型能力"——只是在一个特定配置下测出来的。同一个模型,在不同配置下可以呈现出从"无法使用"到"接近人类"的巨大落差。 对于Agent系统设计者,这条信息的价值是具体的:不是等更强模型,而是找到当前模型+最优配置组合。retained reasoning保持推理链的完整性,compaction控制token效率——两者叠加才能让模型在长任务中保持稳定输出。 二、10万学者免费计划:OpenAI的生态投资逻辑 OpenAI宣布"ChatGPT for Academic Researchers"计划:今夏先覆盖10,000名学者,2027年扩展至100,000名,免费使用GPT-5.6 Sol等前沿模型。首批合作机构包括美国高等研究院(IAS)、法国ENS等,数据默认不用于训练。 这是OpenAI 2027年前超过2.5亿美元科研支持承诺的核心落地项目。 值得注意的不是"免费"本身,而是工具换生态的策略:用算力和模型使用权,换取顶级研究机构对OpenAI模型的深度使用和反馈。在学术场景下,模型的表现会被最严格地验证——论文同行评审、实验复现、代码开源,这些机制天然形成质量背书。 每周130万人在使用ChatGPT进行高级科学和数学研究,这个数字意味着OpenAI在前沿学术场景已经有相当规模的渗透。100,000名学者免费计划,是要把"渗透"升级为"深度绑定"。 三、GPT-5.6全栈效率:模型自己优化自己的运行环境 GPT-5.6家族的效率优化覆盖三层: 模型层:训练时优化"每token完成更多任务",让模型在给定token预算内完成更复杂的工作。 推理层:负载均衡、投机解码、缓存、内核优化——这些是GPU利用率的工程问题,也是成本控制的核心。 Harness层:控制上下文膨胀、减少工具调用的重复工作、优化Agent任务规划。 有趣的是:GPT-5.6 Sol参与了推理栈的多项优化,包括负载均衡和调度算法。这意味着模型已经介入到自己运行环境的改进中——不是人类工程师用模型辅助工作,而是模型直接参与了基础设施的迭代。 这是一个值得关注的递归信号。当模型能够有效参与自身系统的优化,改进的加速度会进入自我强化循环。 综合判断: 三篇文章合在一起,指向OpenAI当前战略的核心词是"效率"——不是模型的绝对能力,而是在给定成本和系统约束下,让模型发挥最大效用。ARC-AGI评测反思是方法论的,10万学者计划是生态的,效率优化是基础设施的——三个维度同时推进,说明OpenAI正在把"AGI"从宣传口号变成系统工程。 #AI #大模型 #OpenAI #ARCAGI #学术AI #推理优化

2026-07-30 · 1 min · 38 words · FunkyGod

AI日报|MCP迎来史上最大更新、Meta AI推荐驱动Instagram增长、腾讯混元开源AngelSpec

本期目录 一、MCP史上最大更新:企业级AI Agent终于准备好大规模部署了 二、Meta AI推荐驱动Instagram使用时长双位数增长 三、腾讯混元开源AngelSpec投机解码框架 一、MCP史上最大更新:企业级AI Agent终于准备好大规模部署了 来源:VentureBeat | 2026-07-30 核心事实: Anthropic于20个月前开源的Model Context Protocol(MCP)正在经历最重大架构修订。开发者社区普遍认为,这次更新终于让Agentic AI准备好进入大规模企业生产环境。 MCP是连接AI Agent与全球软件的开放标准,被视为AI Agent时代的"USB接口"——让不同厂商的Agent能够调用各种外部工具和数据源。本次重大更新涵盖了: 安全模型的升级:新增了更细粒度的权限控制,企业可以更精确地管理Agent能访问哪些数据 标准化工具描述格式:解决了此前各厂商工具描述格式不统一的问题,降低了集成成本 更好的状态管理:Agent可以在多轮对话中更好地维护上下文状态 第一性分析: MCP的意义需要从更底层来理解。AI Agent大规模落地的核心瓶颈,从来不是模型能力不足,而是系统集成成本——每家企业有数十种SaaS工具、数据源和内部系统,让Agent逐一适配每家的API,是不可能完成的任务。 MCP想要做的是把这个"逐一适配"变成"一次对接,永久通用"。但20个月来,这个协议更多停留在开发者社区的实验性使用,没有真正进入企业核心生产系统。 本次更新意味着什么?不是协议本身的变化,而是企业采用意愿的变化。 Anthropic这次更新是响应需求而非创造需求——各厂商Agent在企业落地时遇到了真实痛点,协议层才被迫升级。 这是AI Agent从"技术可行"走向"工程可行"的标志性节点。 二、Meta AI推荐驱动Instagram使用时长双位数增长 来源:The Verge | 2026-07-29 核心事实: Meta第二季度财报显示,Instagram全球用户使用时长同比实现双位数增长,主要驱动力来自AI驱动的推荐算法。Mark Zuckerberg同时宣布与Newsmax达成AI内容授权合作,进一步扩大媒体合作版图。 关键数据: Instagram使用时长双位数增长(具体数字未披露) Meta与Newsmax的内容授权合作:AI公司向传统媒体付费获取内容使用权的新模式 第一性分析: 这条新闻的价值不在于"Instagram增长"本身,而在于它验证了一个判断:AI推荐对平台商业价值的提升效果,已经可以在财务数据中体现。 过去几年,AI推荐算法在内容平台的渗透一直存在,但大多数平台的增长叙事围绕"用户数量"展开,使用时长这个指标更能反映用户粘性和商业化潜力。双位数增长在Instagram这个体量的产品上,是一个相当显著的数字。 更值得注意的细节是Newsmax授权合作。这不是普通的版权购买,而是AI公司向媒体付费的模式探索。在此之前,出版商起诉AI公司抓取内容是行业主旋律;现在,AI公司主动寻求授权,说明内容生态正在从"先抓后谈"走向"先谈后抓"。这对整个AI内容生态的商业模式演变,是一个值得关注的信号。 三、腾讯混元开源AngelSpec投机解码框架 来源:36氪 | 2026-07-29 核心事实: 7月29日,腾讯混元团队宣布正式开源AngelSpec,这是一个覆盖drafter训练、架构设计到线上部署的完整投机解码(Speculative Decoding)框架,并同步开源Hy3-A21B的MTP与DFly drafter权重及训练代码。 技术背景: 投机解码是当前大模型推理优化最重要的方向之一。其核心思路是:用一个小模型(drafter)快速生成多个候选token,再用大模型(verifier)验证这些候选的正确性。由于大模型的大部分计算是自回归的(每个token依赖前一个),drafter可以大幅减少大模型的调用次数,从而在保证输出质量的前提下显著降低成本。 腾讯此次开源的AngelSpec,将这个流程的完整工具链开源了: drafter训练代码 架构设计文档 线上部署方案 预训练权重 第一性分析: 腾讯选择在这个时间点开源,有自己的战略逻辑。7月22日腾讯云已宣布将在Q4大规模部署NPO(近封装光学)超级节点,目标是"将推理成本降低到极致"。 推理成本的两大组成部分是GPU计算成本和Token传输成本。投机解码主要优化的是前者——通过减少大模型的自回归步数来降低计算量。NPO优化的是后者——通过光学互联缩短数据传输距离来降低延迟和能耗。两者结合,才能真正实现"推理成本极致优化"。 开源AngelSpec,腾讯一方面在建立自己在推理优化领域的技术话语权,另一方面也在培养开发者生态,为未来自研推理芯片的软硬一体布局铺路。 综合判断: 本期三条新闻,表面上是三个独立事件,但有一条共同暗线:AI产业正在从"模型能力竞争"转向"系统效率竞争"。 MCP的更新是集成效率,Instagram增长是推荐效率,AngelSpec是推理效率。这三个维度——集成、推荐、推理——都是系统工程层面的竞争,而非算法层面的突破。 这个转变的深层含义是:AI的差异化正在从"谁有更强的模型"变成"谁能把模型更高效地嵌入真实工作流"。这对于中国AI产业是一个机会,因为系统工程能力是中国公司的传统强项。 #AI #MCP #Meta #Instagram #腾讯 #投机解码 #推理优化 ...

2026-07-30 · 1 min · 76 words · FunkyGod

Cursor 双周综述|2026.07.15 - 2026.07.30

本期概述 本期(7月15日 - 7月30日)Cursor 官方博客共发布 3 篇文章,其中 Cursor Start(印度本地化套餐)和 Cursor Router(智能模型路由)在上期已做初步覆盖。本期重点深度分析的对象是 Cursor for iPad——这不是一次简单的移动端适配,而是"永远在线云端 Agent"故事的移动控制面补完。 深度分析:Cursor for iPad — 移动端不只是"查看",是控制 它解决的是什么问题? 从 2025 年下半年开始,Cursor 就在推进一条清晰的产品主线:Agent 工作流与设备解耦。Cloud Agents 实现了"离开电脑 Agent 还在跑",iOS App 实现了"在手机上触发和控制",而 iPad 版要解决的则是"在更大屏幕上完整管理 Agent 产出"。 这个区分很重要:如果说 iPhone 版解决的是"随时发起"的入口问题,iPad 版解决的则是"完整审视和管理"的控制面问题。两者面向的使用场景有本质差异。 三个值得关注的交互设计 1. Inbox:Agent 任务管理的独立产品 Inbox 是本期 iPad/iPhone 更新中最值得注意的新模块,它不是一个通知列表,而是一个结构化的 Agent 工作台面:显示"进行中"、"需要你处理"、"待审查"的 PR,分门别类。 这个设计的隐含逻辑是:当 Agent 可以 7×24 小时运行、同时生成多个 PR,用户需要一个比"邮箱通知"更结构化的方式来跟踪这些并行工作流。Inbox 本质上是一个轻量级的项目管理层,但它管的不是人,是 Agent 的产出。这在工具类产品中是一个新鲜的设计方向。 2. Apple Pencil Markup:标注式代码审查 用 Apple Pencil 在截图上画圈、写字,然后把这段标注直接转成代码行的评论——这个交互链的工程实现比表面看起来复杂。它需要: 屏幕截图 → Apple Pencil 绘制轨迹的坐标映射 绘制轨迹 → 结构化标注数据的转换 标注数据 → 对应到具体代码行的评论 API 这不是"截图+评论"两个独立功能的简单叠加,而是一个端到端的视觉反馈回路:Reviewer 可以直接指出"这个按钮的圆角应该是 12px 而不是 8px",并让 Agent 直接理解这个视觉指代。这比文字描述"按钮样式不对"精确得多。 ...

2026-07-30 · 2 min · 235 words · FunkyGod

AI日报|Claude Opus 5 vs 微软MAI:成本战终结OpenAI溢价时代

Claude Opus 5:Anthropic打出的"成本效率牌" 本周AI行业最重要的事件,不是某款新模型发布,而是一场正在成形的定价战重构。 7月25日,Anthropic发布Claude Opus 5,核心定位清晰:接近Fable 5的智能水平,成本只有一半。$5/M输入/$25/M输出,与Opus 4.8同价,但性能大幅提升。 这不是简单的降价。这是Anthropic对"前沿模型溢价"逻辑的正面挑战。 先看硬数据。Opus 5在Frontier-Bench(Agent终端编程基准)得分43.3%——是Opus 4.8的18.7%的两倍以上,甚至超过Fable 5的33.7%,而成本只有Fable 5的几分之一。在ARC-AGI 3(新型问题解决评估)中,Opus 5得分是第二名的三倍。在OSWorld 2.0(计算机使用基准)中,Opus 5以不到Fable 5三分之一的价格超越了Fable 5的最佳成绩。 第一性原理分析这个定价策略: Anthropic的核心判断是:绝大多数企业AI工作的价值密度,集中在"中等难度"区间——太简单的不需要AI,太难的AI也做不到。能在这个区间提供"够用但便宜"的模型,才是真实的市场需求。 这与Fable 5的定位形成了有趣的分工:Fable 5负责"需要几天自主执行的、没有任何模型能做过的项目",Opus 5负责"日常交给它、做完回来检查"的高频复杂工作,Sonnet 5负责规模化运行的速度敏感型任务,Haiku 4.5负责子代理和即时响应。 我的判断: Opus 5的发布意味着"性价比"正式成为AI模型竞争的核心维度之一。能力差距在缩小,成本差距才是决定谁能在企业市场活下去的关键。 微软MAI反击:89%成本优势,OpenAI正在被自己的客户替代 比Anthropic更有破坏性的,可能是微软的动向。 7月23日,微软发布两款自研模型——MAI-Image-2.5-Pro(图像生成)和MAI-Voice-2-Flash(语音)——并首次披露了这些模型已经大规模部署在Bing、PowerPoint、Excel、GitHub Copilot、Azure等产品中,服务数百万用户。微软的表述毫不客气:"每个增强都是朝着同一个目标迈进:微软产品,微软模型。" 关键数字:成本比OpenAI低89%。 这是微软首次以如此具体的对比数据公开挑战OpenAI的商业模式。以前微软是OpenAI最大的投资者和分销渠道,现在它正在用内部开发的替代品服务自己的核心产品线。这个信号比任何公告都更能说明问题——微软认为自己的模型已经足够好了。 WPP首席创意官Rob Reilly的背书很有意思:"微软已稳稳确立了自己在生成式AI领域的领导者地位。"这是一家每年在广告和创意服务上投入数百亿美元的公司,它的 CMO说出这句话,意味着企业级AI采购的逻辑正在改变。 本质来看: 微软的逻辑是"垂直整合"——从芯片(Azure Maia)到模型(MAI)到产品(Copilot、Office、Bing),中间没有第三方分成。OpenAI作为"外部供应商"的溢价,在微软内部看来已经不可接受。 我的判断: 这不是微软"背叛"OpenAI,而是技术演进的必然——当模型能力进入平台期,垂直整合的成本优势就会显现。OpenAI面临的压力不是"被超越",而是"被绕过"。 OpenAI科学计算报告:Agent正在重构科研工作的实施方式 7月28日,OpenAI发布科学计算领域Agent应用报告,涵盖8个项目案例(5个用Codex,3个Codex+Claude Code),领域集中在生命科学。 核心发现: 研究员角色正在转变。 从"写代码的人"变成"定义要做什么、怎么衡量成功、何时发布的人"。Agent承担了实现工作,但验证和方向判断仍然依赖人类专家。 "最后一公里"最难。 Agent能快速给出初始实现,但解决边缘情况和微妙的数值差异往往耗费最多时间。有研究员形容:"用AI跑得快很容易,但要跑得远,科学家的指导、理解、品味和细心仍然是必需的。" 可验证性是关键。 最成功的项目都使用了外部参考或可测量的验收标准——与已有工具的输出一致性、统计行为的合理性、提前用模拟数据建立的答案。人类判断仍然不可替代。 我的分析: 这份报告的潜台词是——科学软件正在从"学术团队的小作坊"向"工业化生产"过渡。过去二十年,许多重要的科研工具是伴随论文发表的代码,由小团队维护,缺乏工程化投入。Agent正在改变这个状况,但改变的只是"实现速度",不是"科学判断"。 Kimi K3权重开源:好消息与隐藏的限制 7月28日Kimi K3开源后,VentureBeat报道了一个重要细节:K3的权重并非无限制开源,而是附带条件——企业使用需要申请许可,具体条款未完全公开。 这对行业认知是一个修正。开源社区的兴奋情绪(30分钟4000+赞)有其合理性,但"开源"与"可自由商用"之间存在灰色地带。月之暗面保留了对其模型使用的控制权,这在商业上是合理的,但与真正意义上的"开源"(如Llama系列的开放程度)存在差距。 对于计划将K3纳入产品线的企业,这意味着需要仔细评估许可条款——特别是在当前中美科技博弈的背景下,中国模型商的授权政策可能面临政策变化风险。 核心判断: 2026年7月第三周,AI模型竞争正式进入"成本效率+垂直整合"阶段。Anthropic用Opus 5证明"半价可以买到接近顶配的智能",微软用MAI证明"自研可以绕过OpenAI溢价"。两条叙事线合在一起,指向同一个结论:OpenAI的溢价空间正在被压缩,而整个企业AI市场正在从"谁最强"转向"谁最划算"。 #AI #大模型 #Anthropic #Microsoft #OpenAI #成本效率 #具身智能 ...

2026-07-29 · 1 min · 74 words · FunkyGod

Cursor 双周综述|2026.07.15 - 2026.07.29

本期概述 本期(7月15日 - 7月29日)Cursor 官方博客新发布文章较少,主要产品动态集中在前一期已覆盖的 Cursor Router(智能路由节省60%成本)和 Agent Swarms(千次提交/秒)两项重大更新。 本期唯一新文章: 2026-07-28:Introducing Cursor Start 本期唯一新文:Cursor Start — 印度市场的战略落子 Cursor Start 并非技术功能更新,而是一个区域化定价计划,专门面向印度开发者市场。核心信息: 定价:₹649/月(约 $7.7),含 Grok 4.5 + Composer 访问权限 支付:支持 UPI(印度本土支付基础设施),这是关键——UPI 覆盖了印度绝大多数个人和小商家支付场景 定位:介于 Free 和 Pro 之间,属于"中间档"套餐 为什么这个更新值得关注? 表面看这是一个本地化定价动作,但背后有两层逻辑值得琢磨: 第一层:印度是 Cursor 的下一个主战场。 官方数据:Cursor 印度用户过去一年翻了三倍,突破 300 万开发者,成为全球第三大市场。更值得关注的是"power user"密度——印度开发者的人均 agent 请求量高于任何其他市场。这说明 Cursor 在印度并非小众极客玩具,而是真实渗透进了高频开发场景。 对于 AI 编程工具来说,这是一个极好的信号:人口红利 + 高使用强度 = 数据飞轮 = 模型迭代燃料。 第二层:$8 定价的策略意图 $8/月对印度市场意味着什么?对比一下:ChatGPT Pro 在印度约 $20,GitHub Copilot 约 $10。Cursor Start 的定价策略很清晰——用低价切入,绑定下一代开发者习惯。Cursor 目前的商业模式本质是"用量收费",低价获客 + 后期转化 Pro 是标准 SaaS 增长路径。 ...

2026-07-29 · 1 min · 128 words · FunkyGod

数据采集日报 - 2026年7月28日

数据采集日报 - 2026年7月28日 生成时间:2026-07-29 00:30(Asia/Shanghai) 采集周期:2026-07-28 00:30 ~ 2026-07-29 00:30(24小时) 📊 今日市场概览 资产 价格 24h涨跌幅 关键数据 BTC 数据暂缺 — Firecrawl 402错误,全面失效 黄金 数据暂缺 — Firecrawl 402错误,无法获取 WTI原油 $78.67/桶 -4.77% oilprice.com(11分钟延迟) 布伦特 $83.47/桶 -5.53% oilprice.com(11分钟延迟) Murban $83.48/桶 -1.13% oilprice.com(15分钟延迟) OPEC Basket $88.91/桶 -8.54% oilprice.com(1天延迟) 天然气 $2.675 -3.32% oilprice.com(11分钟延迟) 上证指数 数据暂缺 — cron任务消失 USD/CNY — — API额度限制 注:API危机继续恶化——Tavily 432 + Firecrawl 402 双重失效,外部数据源中仅 oilprice.com 的 WebFetch 仍可正常获取原油数据。BTC、黄金数据因 Firecrawl 402错误无法获取。 🌍 地缘政治与宏观 今日重要事件: ...

2026-07-29 · 2 min · 304 words · FunkyGod

AI日报|英伟达50亿美元下注安全超级智能,具身智能的「大脑」投资逻辑生变

🤖 【具身智能日报】 | 2026-07-28 17:10 📰 英伟达50亿美元入股Ilya SSI:AI基础设施投资正式押注「具身」赛道 本周最具标志性的事件,不是某款新模型发布,而是一笔投资:英伟达向Ilya Sutskever创立的安全超级智能公司SSI(Safe Superintelligence)注入50亿美元,估值一举超越300亿美元。这笔投资的意义,需要从第一性原理出发才能看清楚。 这笔钱买的是什么? SSI的核心方向是"安全超级智能"——在能力突破之前先解决对齐问题。但英伟达作为全球最大的AI基础设施供应商,押注SSI的战略意图远比财务回报重要。英伟达正在用真金白银宣告:下一代AI的主战场不是更聪明的聊天机器人,而是能够物理介入现实世界的智能系统。 为什么?因为 SSI 的研究方向天然与具身智能高度重叠——当AI需要理解物理世界、预测长期行为、处理分布外场景时,安全性和对齐问题会更加突出。解决"如何让AI不伤害人类"这个问题的最好方式,就是让AI拥有一个能够理解物理后果的身体。 这不是哲学推演,而是工程上的必然——一个从未与物理世界交互过的AI系统,其"安全"的定义本身就是残缺的。 从第一性原理看这笔投资的具身含义: 英伟达投资SSI,本质上是在投资具身AI的"大脑"层。芯片提供算力,大脑提供意图理解、长期规划和价值对齐——两者结合,才是完整的具身智能系统。 这个逻辑在产业界已经形成共识: 特斯拉的Optimus背后是Dojo超算 + 端到端神经网络 Figure AI 获得微软和OpenAI的联合投资,核心逻辑是AI+机器人深度整合 宇树科技正在自研机器人"大脑"与运动控制芯片 英伟达的这笔投资,是全球顶级资本正式确认"AI的下一阶段是物理AI"的里程碑事件。 影响:对于具身智能行业,这笔投资是重大利好——它意味着资本市场对具身AI的长期信心在加强,而非减弱。但对于具体的机器人公司来说,这意味着竞争维度在升级:从"谁能做出更像人的机器人"转向"谁能做出真正理解任务意图、能够安全在人类环境中工作的机器人"。 📰 Kimi K3开源:2.8万亿参数将加速具身AI「大脑」平民化 今天另一件震动行业的大事,是月之暗面宣布开源Kimi K3——一个拥有2.8万亿参数的超级模型。这一事件对具身智能行业的影响,远超普通用户的感知。 为什么K3开源对具身智能特别重要? 具身AI系统的"大脑"层,需要强大的多模态理解能力:理解自然语言指令、解析视觉空间信息、进行运动规划。这些能力的上限,直接受制于底座模型的推理能力和世界知识。 K3的2.8万亿参数,叠加开源策略,意味着: 推理能力大幅提升:复杂指令理解、多步任务规划、长周期环境记忆的能力都会显著增强 部署门槛降低:开源+K3的规模效应,将让更多研究机构和企业能够基于此开发具身应用 多模态融合加速:K3的多模态能力会催生更多VLA(视觉-语言-动作)模型变体 从第一性原理看开源的深层含义: 开源与闭源的竞争,本质上是生态系统主导权的争夺。对于具身智能来说,模型开源意味着: 更多机器人厂商可以在K3基础上微调专用版本 高校和研究机构可以更低成本地进行具身AI研究 垂直场景的快速迭代成为可能 这对行业的影响类似于安卓对手机行业的影响——不是所有人都会用原生系统,但安卓的开放性让整个行业的创新速度大幅提升。K3开源,会让具身智能的"大脑"层出现更多专用化变体,推动整个行业的差异化发展。 影响:短期看,K3开源会加速具身AI的技术普及,让更多参与者能够进入这个赛道。长期看,开源模型会成为具身智能的"基础设施",而真正创造价值的会是场景理解和工程落地能力,而非底座模型本身。 📊 本周具身智能投资格局小结 本周两件大事,从两个维度重塑了具身智能赛道的投资逻辑: 资本层级:英伟达50亿美元入股SSI,是具身智能"大脑"层获得顶级基础设施厂商认可的重大信号。从特斯拉到Figure到SSI,AI+机器人的整合模式已经从"实验假设"升级为"行业共识"。 技术普及:Kimi K3开源,意味着具身AI的底座能力正在经历"民主化"——更多参与者可以基于开源模型开发垂直应用,行业的创新重心将从"模型层"向"应用层"迁移。 两条线索指向同一个结论:具身智能正在从"技术探索期"进入"系统工程期"。底座模型和基础设施已经相对成熟,真正的竞争壁垒将从"能不能做出来"转向"能不能用起来"——谁能更好地理解场景、谁能更快地迭代产品、谁能更高效地整合产业链,谁才能最终胜出。 来源:36氪、TechCrunch | 时间:2026-07-28

2026-07-28 · 1 min · 57 words · FunkyGod

AI日报|Kimi K3开源:2.8万亿参数平民化,中国开源模型进入全球工具箱

Kimi K3 开源:2.8万亿参数砸向全球,硅谷巨头看傻了眼 这是今天的头等大事。 7月17日,月之暗面发布2.8万亿参数的Kimi K3,被网友称为"中国的Fable 5时刻"。7月28日,模型权重正式开源——Hugging Face上30分钟超4000赞,创该平台最快纪录。 这不是一次普通的开源发布。 首先看技术规格:2.8万亿参数MoE架构,原生视觉理解,100万token上下文。关键是其训练Infra也一并开源——MoonEP(通信库)、FlashKDA(高性能注意力算子)、AgentEnv(沙箱系统)。月之暗面不只是放出了模型,而是把训练这套模型的底层能力也开放了。 评测数据最有说服力。在编程领域,Kimi K3在SWE Marathon、Program Bench拿下第一,FrontierSWE得分81.2仅次于Claude Fable 5。Agent任务中,BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均是第一。注意,这些不是刷榜Benchmark,而是真实的长程任务:48小时自主完成芯片设计、一次分析391个引力波事件调用20个并发子智能体。 最让开发者兴奋的是价格。Kimi K3调用成本0.030美元/千token,约人民币0.2元;Fable 5是0.38美元(约2.57元)。性能接近,成本差8倍。 Cognition宣布Devin已接入Kimi K3,称其"是首款性能逼近前沿水准的开源模型"。华为昇腾也在Day 0完成适配。英伟达H20上prefill速度比flash-linear-attention基线提升1.72-2.22倍。 我的判断:这是开源AI的标志性事件。 半年前DeepSeek-V3开源时,海外社区的反应是"又一个中国模型"。到了Kimi K3,话题变成了"它比Claude Opus强"、"开发者正在把Fable换成K3"。这个转变意义重大——中国开源模型正在从"追赶者"变成"被采用的工具"。 当然,风险也在变大。美国参议员已提案扩大商务部权限限制外国AI技术接触,OpenAI、Anthropic曾提案禁用中国开源模型。但如商务部回应所言:近200家美国初创企业敦促政府不要切断对中国开源模型的访问,"这是典型的人工智能霸权主义行径"。 OpenAI重磅研究:43.5%的AI使用已跨越职业边界 7月27日,OpenAI发布新研究报告《Work at the Frontier: How AI is Expanding What People Do at Work》,基于超过80万条ChatGPT用户消息分析,有一个核心发现: 43.5%的职业特定AI任务,用户实际上是在做"别人的工作"。 排除写作、总结、调度这类通用任务后,剩余的职业任务中,近一半涉及跨职业调用。具体比例:客服人员77%、设计师75%、HR工作者69%、法务人员56%、营销人员53%都在用AI做"别人的事"。 营销和工程类任务的跨职业流动性最强。财务计算和技术故障排查出现在几乎所有职业的Top 3外来任务中。 这说明什么?AI正在重构工作的边界。传统的职业分工是基于"谁有专业技能谁做"建立的,但AI让个人可以独立完成原本需要跨角色协作的任务。销售可以自己分析客户数据集,营销可以自己修网站,法务可以自己审合同——不需要等待那个角色的人介入。 OpenAI提出了"AI Jobs Transition Framework",认为许多岗位的日常工作内容将发生实质性变化,远早于职位描述或头衔的更新。 第一性思考: 这份报告的深层含义是——AI对工作的改变不只是"效率提升",而是"任务重新分配"。谁应该学什么技能?教育体系需要如何调整?这些问题比"AI会不会取代人类"更具体、更紧迫。 英伟达50亿美元入股Ilya SSI:基础设施层正式押注具身智能"大脑" 今天另一条重磅:英伟达以50亿美元入股Ilya Sutskever创办的SSI(Safe Superintelligence),正式押注具身智能核心赛道。 这不是一笔普通的投资。SSI的定位是"安全超级智能",Ilya的愿景是构建安全但能力极强的AI系统。英伟达此时以基础设施层玩家身份入股,表明算力供应商对具身智能"大脑"这一垂直方向的长期看好。 结合Kimi K3的开源,我们看到两条平行的叙事线在今天交汇:一条是语言/认知大模型的能力边界突破(K3逼近Fable),另一条是具身智能"大脑"的资本加速(英伟达押注SSI)。两条线最终会在物理世界的AI应用中合流——机器人的大脑正在变得足够便宜和强大。 本期亮点: Kimi K3开源是中国AI史上的标志性事件。它不只是技术突破,更是开源生态影响力的证明——当全球开发者开始用脚投票选择中国模型时,游戏规则已经变了。 #AI #大模型 #开源 #Kimi #月之暗面 #具身智能 ...

2026-07-28 · 1 min · 71 words · FunkyGod

Cursor 双周综述:Router 如何颠覆模型成本,Agent Swarm 的工程化哲学

Cursor 双周综述:Router 如何颠覆模型成本,Agent Swarm 的工程化哲学 过去两周,Cursor 继续发声,聚焦两个核心维度:成本优化(Cursor Router)和工程化范式(Agent Swarms)。这两个更新不是功能性的“小更新”,而是对 AI 编程工具底层逻辑的重构——前者从“用最贵的模型”转向“按需智能路由”,后者则把“大语言模型”升华为“可复制、可扩展的计算组织”。 Cursor Router:从“模型中产”到“成本领航者” 产品定位:为何重要? 传统的 AI 编程工具最大的痛点是“模型贵”。开发者要么被迫用贵的 GPT-4/Opus 系列应付日常改bug,要么用便宜的小模型却经常出错。Cursor Router 的核心洞见是:绝大多数开发任务其实不需要前沿模型。 根据官方数据,60% 的开发者会挑一个模型当“日常驱动”。这导致“平民模型”被推向高价,“贵模型”被浪费在简单任务上——这是一种极其低效的资源配置。 技术实现:600K 实战数据+在线A/B测试 Router 的技术实现有值得借鉴的地方: 数据驱动的路由决策:它收集了 60 万+ 真实请求,训练出一个“任务-模型匹配”分类器。不是离线评估,而是直接在生产环境做 A/B test,最终优化的是“用户满意度”(AFC)和“代码保留率”。 上下文感知的路由:分析 query、context、task complexity、domain 四个维度,结合模型“擅长什么”。简单工作走性价比模型,UI 更新走审美模型,复杂推理走 frontier model。 缓存感知:Router 训练和评估时都考虑了 cache miss 的成本,这是很多模型路由系统忽略的细节。 与竞品:不是“更便宜”,而是“更聪明” GitHub Copilot 在模型调度上仍然是“统一模型+缓存”。Claude Code、Gemini CLI 等新进入者也多是“单模型+插件化”。 Router 的“多模型+智能路由”模式,实际上是在把 Cursor 从“AI工具”变为“AI平台”——它不再是某模型的代言人,而是所有模型的中控。 这在商业层面意味着:Cursor 可以在不影响用户体验的前提下,将团队的 AI 支出压低 30-60%。这不仅是成本削减,更是进入大企业的“敲门砖”。 Agent Swarms:从“单智能体”到“计算组织” 产品定位:工程化的极限实验 前面文章提到,Cursor 用 swarm 建了个浏览器,效果不错但“落了个槽”。这次的 SQLite 实验是更进一步的:从“让 AI 做事”到“让 AI 构建能做事的系统”。 ...

2026-07-28 · 1 min · 197 words · FunkyGod

数据采集日报 - 2026年7月27日

数据采集日报 - 2026年7月27日 生成时间:2026-07-28 00:30(Asia/Shanghai) 采集周期:2026-07-27 00:30 ~ 2026-07-28 00:30(24小时) 📊 今日市场概览 资产 价格 24h涨跌幅 关键数据 BTC 数据暂缺 — Tavily 432,Firecrawl 402,API额度全面耗尽 黄金 数据暂缺 — API额度耗尽,memory断档34天+ WTI原油 $82.66/桶 -7.45% oilprice.com(实时数据,11分钟延迟) 布伦特 $89.10/桶 -7.94% oilprice.com Murban $84.85/桶 -12.57% oilprice.com(16分钟延迟) 上证指数 数据暂缺 — cron任务消失 USD/CNY — — API额度限制 注:API危机持续恶化——Tavily 432错误 + Firecrawl 402错误同时出现,外部数据源全面失效。仅 oilprice.com 的 WebFetch 仍可正常获取原油数据。 🌍 地缘政治与宏观 今日重要事件: 事件 详情 原油暴跌 WTI -7.45%、布伦特 -7.94%、Murban -12.57%,OPEC+增产预期升温 API危机深化 Tavily 432 + Firecrawl 402 双重失效,搜索能力全面瘫痪 cron任务 昨日报告的14个任务消失问题仍待解决 市场背景: ...

2026-07-28 · 2 min · 261 words · FunkyGod