追踪具身智能与人形机器人领域最新进展,每日更新。
今日要闻
🤖 Boston Dynamics × Google DeepMind:Gemini Robotics 赋能 Atlas 人形机器人
2026年1月CES展会上,Boston Dynamics 与 Google DeepMind 宣布重磅合作:Gemini Robotics AI 基座模型将整合进新版 Atlas 人形机器人,共同推进工业自动化。双方计划从汽车制造开始,让人形机器人完成多样化工业任务。
📌 核心看点:Boston Dynamics 以"运动智能"见长,DeepMind 以"认知智能"见长——两者结合意味着人形机器人首次有望真正打通"感知-理解-执行"全链路。
📖 原文链接
🧠 RoboEdit:将人类操作视频转为大规模机器人训练数据
斯坦福等机构提出 RoboEdit 框架,能够将人类手-物交互视频自动重定向为多本体机器人视频,无需昂贵的手动标注。已构建 RoboEdit-14M 数据集:174K 视频对、覆盖7种机器人本体、14M 帧。
📌 核心看点:机器人数据稀缺是具身智能最大的工程瓶颈。RoboEdit 证明了"跨本体视频迁移"的可行性,为"把互联网视频资源转化为机器人技能"打开了大门。
🖐️ ADEPT:预训练+强化学习加速多指灵巧操作
MIT 提出 ADEPT 框架,先在通用物体翻转任务上预训练多指机械手策略,再迁移到下游任务微调。解决了"从零训练多指灵巧操作样本效率极低"的问题,且 post-training 阶段不会遗忘已学到的技能。
📌 核心看点:预训练+微调范式在 NLP/CV 领域已成熟,在机器人操作领域这是又一次成功的迁移学习实践,指向"通用灵巧操作基础模型"的可能。
🗂️ LT-Mem:让机器人记住"物体去哪儿了"——跨会话长期记忆框架
机器人长期运行面临"时间遗忘"问题:每次重建地图都会丢失物体历史位置。LT-Mem 提出了"挥发感知记忆演化"框架,让机器人能回答"这把绿椅子之前在哪个房间"这类跨时间查询。
📌 核心看点:场景理解从"瞬时感知"走向"跨时记忆",这是机器人在真实环境长期部署的必要能力,也是具身智能从demo走向product的关键。
🏠 RoomWright:让3D场景"功能性"服务于机器人任务
现有3D场景生成注重视觉真实性,RoomWright 提出了"使用驱动"(Usage-Driven)场景推理:给定任务,算法自动补全任务所需物体及其功能属性(如"切菜任务→需要砧板+刀+食材"),并建模物体间的因果依赖关系。
📌 核心看点:从"好看"到"好用",RoomWright 代表了具身智能环境构建的新思路——场景不是静态布景,而是任务相关的功能集合。
一句话点评
Boston Dynamics×DeepMind 的合作是行业标志性事件:最强运动能力 + 最强认知能力,这可能是具身智能领域"iPhone 时刻"的前奏。但技术落地仍有长路——当前 Gemini Robotics 在复杂精细操作上的成功率仍是瓶颈。可以关注下半年 Atlas 在真实汽车产线的试点部署报告。
来源:arXiv Robotics (cs.RO) 2026-08-20 | Boston Dynamics News | 机器之心
标签:#具身智能 #人形机器人 #Boston Dynamics #Google DeepMind #Gemini Robotics #机器人学习