眸深智能完成近亿元Pre-A+轮,端侧具身大脑的野心与底气

本周,具身智能行业最受关注的消息来自36氪的报道:眸深智能(Motion Brain) 于7月26日宣布完成近亿元Pre-A+轮追加融资,投资方包括瑾悦投资(由头部物业服务公司、香港财团及多家上市公司联合打造)、创合汇资本及老股东徐洪资本。这是该公司继2026年5月完成3亿元Pre-A轮后,两个月内再度获得融资,且Pre-A+轮的近5亿元也在交割中。

一家2025年1月才注册成立的公司,何以在一年半内连续获得大额融资,且估值增长超10倍?

动作Token化:一条与VLA分道扬镳的技术路径

眸深智能的核心技术路线,与当前主流的VLA(视觉-语言-动作)模型截然不同——以动作为核心,构建"世界动作模型"

具体来说,团队将人体姿态拆解为约3000个"动作基元",类比大语言模型预测下一个token的逻辑,MotionGPT通过预测下一个"动作token"来生成复杂行为序列。这是全球首个把连续动作离散化为token的具身大模型方案,发表于NeurIPS 2023。

这一路径的物理意义在于:传统VLA需要海量真机数据训练,成本极高且数据采集困难;而眸深智能采用"80%互联网视频 + 10%动捕数据 + 10%真机数据"的训练配方,真机数据需求降低了90%,动作准确度却提升至99%。

这背后的关键创新是MLD(隐空间动作扩散模型)——将动作映射到隐空间后,模型可以在不需要逐帧教机器人如何运动的情况下,像画家去噪一样从随机噪声中还原出自然、连贯的人体姿态。

端侧部署:国产算力芯片的软硬协同

真正决定具身智能规模化的,不仅是算法本身,还有端侧推理成本。

眸深智能从第一代模型起就同步推进两个方向:模型压缩与国产芯片适配。通过蒸馏、量化、动态优化等技术,千亿参数模型被压缩至百亿级别,端侧推理延迟从约200毫秒压缩到10毫秒左右。同时同步适配海思昇腾310/910、地平线、燧原S60等国产芯片平台。

结果是:端侧推理成本从20万元降至1万元,大脑续航时间提升10倍。这一模型压缩工作还帮助团队获得了IJCAI 2025全球最佳论文奖,是近五年唯一获此奖项的中国大陆团队。

眸深智能的技术原生基于国产算力芯片开发,而非先在英伟达卡上训练再移植到国产芯片——这种"软硬协同原生开发"的路径,避免了性能损耗与兼容性问题,也规避了供应链风险。

行业分化信号:大脑赛道正在快速收敛

从融资和技术路线两个维度看,具身智能大脑赛道正在出现明显分化:

资金加速向头部集中。 眸深智能年内已累计融资超4亿元,Pre-A+轮近5亿元正在交割,估值增长超10倍。这说明资本市场对具身大脑的认可度在提升,但资金正在向少数有明确技术路线和商业化验证的团队集中。

技术路线分化愈发清晰。 VLA路线(以Google RT系列、OpenAI Figure系列为代表)与动作Token路线(以眸深智能为代表)的争论,正在从学术讨论走向工程化落地验证。前者依赖海量真机数据,后者通过互联网视频+动捕数据大幅降低对真机数据的依赖——这直接影响成本和规模化速度。

商业化已不是空白。 眸深智能2025年审计回款收入千万元,2026年上半年3000万元,预计全年5000万元以上。客户覆盖物业、环卫、连锁零售、白色家电工厂等场景。这说明端侧具身大脑在特定场景的落地速度,可能比通用人形机器人本体更快。

值得持续跟踪的问题

  1. 眸深智能的T²MB(Task*Task Motion Brain)端侧自进化能力,解决了机器人落地后无法在线升级的痛点——但端侧算力能否支撑持续学习,仍有待大规模部署验证。

  2. 动作Token的组合爆炸问题——3000个动作基元的组合空间巨大,眸深智能通过学习动作排列规律而非穷举来规避这一问题,但其泛化上限在哪里,需要更多长序列任务的数据支撑。

  3. 具身智能芯片的机会窗口——眸深智能判断未来模型需要1000-2000TOPS算力,目前国内芯片公司大多瞄准200TOPS,可能跟不上模型迭代。这意味着芯片-模型联合优化可能成为下一个竞争焦点。


来源:36氪 | 时间:2026-07-26