具身智能日报 | RSS 2026 三大核心突破:从仿真到现实的世界模型评测、139.6倍轨迹优化加速、Chelsea Finn多维偏好学习
具身智能日报 | 2026-08-19 一、影眸科技 cuNRTO:139.6倍加速的 GPU 轨迹优化,入围 RSS 最高论文奖 原文:https://www.roboticsproceedings.org/rss22/p102.pdf | 项目主页:cunrto.deemos.dev 核心事实: 影眸科技(头部3D生成大模型公司)合伙人 Joel Wang 作为共同一作的论文《cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization》入围 RSS 2026 Outstanding Paper Award 提名(全球仅8篇) 这是中国大陆机构与企业首次在 RSS 最高奖中获得双席提名之一(另一家是银河通用) 技术突破:将非线性鲁棒轨迹优化(NRTO)搬上 GPU,实现最高 139.6 倍加速(独轮车任务从 30423 秒→218 秒),同时保持 100% 安全约束 核心思路:不追求完美的仿真器,而是让策略对仿真器的不完美具备鲁棒性——把模型误差与外部扰动显式表示为有界不确定性集合,对集合内每种扰动都满足全部安全约束 算法重构:用 Douglas-Rachford 分裂替换内点法,把串行大规模矩阵分解拆解为可并行的稀疏线性求解和二阶锥投影两类操作 影响分析: 直接影响:具身智能从仿真到现实(Sim-to-Real)的部署效率大幅提升,此前"算不动"的鲁棒优化现在可以在秒级完成 中期影响:影眸科技的商业模式已从"3D资产生成"扩展到"具身训练仿真闭环",cuNRTO 补全了从仿真资产到真机部署的关键一跳 不确定性:139.6 倍加速的数字来自独轮车任务,机械臂等更复杂任务的加速比能否维持同等水平有待验证 行业意义:这篇论文回答了一个根本问题——仿真的上限,不只取决于它能多真实,也取决于策略能否承受它不真实的部分。这打破了行业"不断提升仿真精度"的惯性思维,转向"让策略对不完美鲁棒"的新路线。 二、北大 RoboWM-Bench:世界模型的「具身可执行性」评测基准 原文:深蓝具身智能编译自 https://mp.weixin.qq.com/s/pf9-MpmB8WPEsBGlM-752w 核心事实: 北京大学提出 RoboWM-Bench,首个专门评估视频世界模型「具身可执行性」的基准测试 核心发现:现有世界模型生成的视频"看起来完美",但手指可能"穿模"过了物体,或者抓取姿态在力学上根本不稳定——视觉逼真 ≠ 物理可行 评估流水线:给定初始场景和任务描述 → 世界模型生成预测视频 → 通过 HaMeR(人手)或 IDM(机械臂)提取可执行动作 → 在高保真仿真环境中执行验证 任务矩阵:从刚体操作(拾取)→ 关节体交互(开抽屉)→ 柔性物体(折叠毛巾)→ 长程多步任务(组装汉堡) 测试结果:Veo 3.1、Wan 2.6 等主流模型在机械臂操作任务上失败率显著高于人手操作;机器人数据微调可大幅提升具身可执行性(Cosmos-Finetune 关抽屉任务从 0%→90%) 影响分析: ...