具身智能日报 | 2026-08-19

一、影眸科技 cuNRTO:139.6倍加速的 GPU 轨迹优化,入围 RSS 最高论文奖

原文:https://www.roboticsproceedings.org/rss22/p102.pdf | 项目主页:cunrto.deemos.dev

核心事实

  • 影眸科技(头部3D生成大模型公司)合伙人 Joel Wang 作为共同一作的论文《cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization》入围 RSS 2026 Outstanding Paper Award 提名(全球仅8篇)
  • 这是中国大陆机构与企业首次在 RSS 最高奖中获得双席提名之一(另一家是银河通用)
  • 技术突破:将非线性鲁棒轨迹优化(NRTO)搬上 GPU,实现最高 139.6 倍加速(独轮车任务从 30423 秒→218 秒),同时保持 100% 安全约束
  • 核心思路:不追求完美的仿真器,而是让策略对仿真器的不完美具备鲁棒性——把模型误差与外部扰动显式表示为有界不确定性集合,对集合内每种扰动都满足全部安全约束
  • 算法重构:用 Douglas-Rachford 分裂替换内点法,把串行大规模矩阵分解拆解为可并行的稀疏线性求解和二阶锥投影两类操作

影响分析

  • 直接影响:具身智能从仿真到现实(Sim-to-Real)的部署效率大幅提升,此前"算不动"的鲁棒优化现在可以在秒级完成
  • 中期影响:影眸科技的商业模式已从"3D资产生成"扩展到"具身训练仿真闭环",cuNRTO 补全了从仿真资产到真机部署的关键一跳
  • 不确定性:139.6 倍加速的数字来自独轮车任务,机械臂等更复杂任务的加速比能否维持同等水平有待验证

行业意义:这篇论文回答了一个根本问题——仿真的上限,不只取决于它能多真实,也取决于策略能否承受它不真实的部分。这打破了行业"不断提升仿真精度"的惯性思维,转向"让策略对不完美鲁棒"的新路线。


二、北大 RoboWM-Bench:世界模型的「具身可执行性」评测基准

原文:深蓝具身智能编译自 https://mp.weixin.qq.com/s/pf9-MpmB8WPEsBGlM-752w

核心事实

  • 北京大学提出 RoboWM-Bench,首个专门评估视频世界模型「具身可执行性」的基准测试
  • 核心发现:现有世界模型生成的视频"看起来完美",但手指可能"穿模"过了物体,或者抓取姿态在力学上根本不稳定——视觉逼真 ≠ 物理可行
  • 评估流水线:给定初始场景和任务描述 → 世界模型生成预测视频 → 通过 HaMeR(人手)或 IDM(机械臂)提取可执行动作 → 在高保真仿真环境中执行验证
  • 任务矩阵:从刚体操作(拾取)→ 关节体交互(开抽屉)→ 柔性物体(折叠毛巾)→ 长程多步任务(组装汉堡)
  • 测试结果:Veo 3.1、Wan 2.6 等主流模型在机械臂操作任务上失败率显著高于人手操作;机器人数据微调可大幅提升具身可执行性(Cosmos-Finetune 关抽屉任务从 0%→90%)

影响分析

  • 直接影响:为具身智能世界模型的评测提供了统一标准,终结了"视频看起来好就算好"的混乱局面
  • 中期影响:将推动世界模型在训练目标中融入物理先验,而非仅在视觉数据上 Scaling
  • 不确定性:当前任务矩阵覆盖的场景仍然有限,真实世界操作的复杂度远超现有基准

行业意义:这揭示了视频世界模型的一个深层缺陷——对物理接触、空间推理和非刚体动力学的理解不足。仅仅在视觉上Scaling是远远不够的。


三、Chelsea Finn 团队 FPL:让机器人理解「多维度的好」

原文:雷峰网编译自 https://mp.weixin.qq.com/s/tFfBQaXAMH4HM9obaSqjYg

核心事实

  • Stanford IRIS Lab(Chelsea Finn 团队)提出 FPL(Freeform Preference Learning),让人类用自然语言定义评判维度(偏好轴),而非强行给出一个整体分数
  • 背景问题:机器人做长程任务(如摆餐桌)时,"好"从来不止一个维度——快不快、稳不稳、下手轻不轻。现有偏好学习逼着标注员把所有维度压成一个整体分数,收上来的标签模糊且互相打架
  • 技术方案:基于 Qwen VL 3.5 4B 构建轴条件奖励模型,同一模型通过不同轴标签给不同维度打分;策略底座使用 Physical Intelligence 的 VLA(π0.5),训练时将多维奖励目标作为条件输入
  • 真机结果:四个 Franka 机器人任务(放方块、叠短裤、装盘、摆餐桌),FPL 平均比最优基线高 38 个百分点绝对成功率

影响分析

  • 直接影响:机器人长程任务的学习效率和效果显著提升,"好"的定义不再模糊
  • 中期影响:这种「语言条件多维奖励」的范式,可能会成为具身大模型训练的标准组件
  • 不确定性:FPL 依赖自然语言定义偏好轴,标注员的能力和一致性会显著影响效果

行业意义:Chelsea Finn 同时是 Physical Intelligence 的联合创始人,这条工作线从偏好学习基础研究到 VLA 底座再到真机验证,形成了完整的产学研闭环——这是具身大模型公司应有的样子


四、OAT(Ordered Action Tokenization):机器人领域的 Scaling Law 时刻

原文:未来索引编译自 https://mp.weixin.qq.com/s/75cThzwP1ButXnr0O4e3Wg

核心事实

  • OAT 通过引入"层级秩序",将连续的物理动作转化为 Transformer 可理解的离散 Token,从而打通机器人控制领域的 Scaling Law
  • 核心机制:基于 RVQ(残差矢量量化)的分层策略,前几个 Token 决定动作"大意"(如手臂向左上方挥动),后几个 Token 补充"细节"(手腕微调5度)
  • 杀手级特性:Anytime Inference(随时推理)——算力紧张时只解码前几个 Token 做"大概正确"的动作,算力充足时解码完整序列精准操作
  • 跨形态可能:机械臂、人形机器人、四足狗的动作都可映射到同一个 Token 空间,跨形态(Cross-embodiment)大规模预训练成为可能

影响分析

  • 直接影响:机器人动作数据的"孤岛效应"可能被打破——不同形态机器人的数据可以在同一个 Token 空间里互通
  • 中期影响:一旦 Scaling Law 在动作空间生效,机器人能力可能会迎来类似 GPT-2→GPT-3的涌现时刻
  • 不确定性:OAT 的实际效果高度依赖大量动作数据的获取和标注

行业意义:OAT 的本质是将连续、混沌的物理信号,坍缩成离散、有序的数字信号——当物理世界的因果律被压缩成一组组有序的 Token,机器人将从"执行代码的机械装置"进化为"理解物理世界语法的数字化物种"


本周核心观点

RSS 2026 揭示的三个具身智能底层趋势

本届 RSS 呈现了具身智能领域的三个关键突破,都指向同一个方向——从"看起来厉害"到"真的能用"

  1. 仿真到现实不再是玄学:cuNRTO 和 RoboWM-Bench 分别从"优化速度"和"评测标准"两个方向填平了 Sim-to-Real Gap。仿真资产终于可以真正训练出 Real-World Ready 的策略。

  2. 多维偏好正在取代单一奖励:FPL 证明了"多维度的好"可以被语言定义并被机器学习。机器人不再需要人类强行把多把尺子压成一把——这把尺子本来就应该是一组。

  3. 动作表征的离散化是 Scaling 的前提:OAT 的意义不只是技术突破,而是打开了机器人数据 Scaling 的大门——当不同形态机器人的动作都能用同一套 Token 表征,互联网级别的数据收集和训练才成为可能。

这三条线索汇聚成一个判断:具身智能的基础设施正在成熟,但应用层的爆发还需要等待真实的物理世界数据积累。这不是一件可以靠算法快速解决的问题,而是需要真实机器人长时间在物理世界中积累经验。

关键词:具身智能、RSS 2026、世界模型评测、轨迹优化、多维偏好学习、OAT、动作Token化、Sim-to-Real


来源:雷峰网、深蓝具身智能、未来索引 | 时间:2026年8月19日