技术2026/9/16·聚身之家事件日期 2026/9/15查看历史位置

VLA 之外,具身智能正在长出完整的软件栈|每日开源 2026-09-16

每日开源具身智能VLAVLM人形机器人机器人学习开源数据集Physical AgentRobot CI

摘要

本期聚焦 WEAVE、Show-Harness 与 Neverwhere:从人类交互数据到 Physical Agent 接口,再到 Robot CI,具身智能正在从单一 VLA 模型竞争扩展为完整基础设施竞争。

VLA 之外,具身智能正在长出完整的软件栈

今天的开源更新不适合再用“又出了几个模型”来概括。

更值得记录的变化,是具身智能正在从单一 Policy/VLA 模型竞争,向一套更完整的软件与数据基础设施扩展:人类行为如何转成机器人可执行数据、通用 VLM 如何跨本体控制机器人,以及机器人策略如何在真实世界数字副本里持续回归测试。

本期正式收录三项:WEAVE、Show-Harness、Neverwhere。它们分别对应全身操作学习、Physical Agent 接口和 Robot CI / 高真实感评测。


1. WEAVE:从人类交互学习全身灵巧移动操作

项目定位: Learning Whole-Body Dexterous Loco-Manipulation from Human–Object Interactions

WEAVE 把捕获的人类—物体交互先转换为机器人可执行的 robot-object reference,再通过 contact-aware retargeting、approach-motion completion 和强化学习,让人形机器人的身体、移动与灵巧手共同完成连续操作。

官方实验基于 Unitree G1 与双 Inspire 灵巧手:机器人身体包含 29 个驱动自由度,双手包含 12 个手指驱动自由度。训练集包含 7,869 条轨迹、19.56 小时;测试集 1,605 条轨迹、3.67 小时。项目同时释放约 23 小时、约 9,000 条 physically executed rollouts,并带 robot-object trajectory 与 contact annotation。

在官方结果中,一个统一策略在训练交互上达到约 92.5% 成功率,在未见过的同类交互序列上、无需额外训练仍达到约 65%。

为什么值得关注

过去很多 humanoid manipulation 本质上仍是“先走到目标前,再停下来做手部操作”。WEAVE 更接近真实的人类行为:行走、平衡、身体姿态、手指接触和物体运动是一个连续问题。

更重要的是,它把一条越来越清晰的数据路线做实了:

人类行为数据 → 接触感知重定向 → 机器人可执行参考 → 大规模仿真学习 → 真机/物理执行数据。

这意味着未来海量人类交互视频、动捕和 Ego 数据,不一定要直接训练 VLA,也可以先被转换成结构化、物理一致的机器人学习资产。

适用方向: 人形机器人、whole-body control、灵巧手、模仿学习、强化学习、Human-to-Robot 数据转换。

时间线判断:强烈建议纳入。 这是“人类交互数据规模化转化为人形机器人全身操作能力”的代表节点。


2. Show-Harness:VLM 不一定先变成 VLA,也能直接控制机器人

Show-Harness 在视觉语言模型和机器人之间增加了一层轻量的 Embodied Harness

模型不直接预测连续关节动作,而是在一组离散、增量式的语义动作单元中进行决策,再由不同机器人本体的 interpreter 确定性地映射成实际运动。这样一来,Franka、AgileX Piper、ManiSkill 与 Isaac Lab 可以共享同一套模型侧动作词表和提示结构。

项目同时开放了 GUMI(GUI Manipulation Interface):人或 GUI Agent 可以直接在浏览器里像“玩机器人”一样做示教,系统自动记录 observation-action 数据,不要求专门的遥操作设备。

官方仓库已经公开 harness 主体、GUMI、插件体系和训练流水线;配套的 Show-Harness-VLMs 也释放了多组 LoRA adapters,并提供真实机器人和仿真示教数据。

为什么值得关注

Show-Harness 提出的是一条和“大一统端到端 VLA”并行的路线:

通用大脑(VLM) + 标准语义动作接口 + 本体解释器 + 技能/工具。

这和软件世界里的 Agent 很像:模型不必自己重新学习每一个底层 API,而是通过稳定工具接口行动。

如果这条路线继续成熟,未来机器人开发的核心资产可能不只是某个 VLA checkpoint,还会包括一套跨机器人共享的 action vocabulary、interpreter、skills、plugins 和 rollout runtime。

适用方向: Physical Agent、VLM Agent、跨本体控制、低成本遥操作与数据采集、多机器人迁移。

时间线判断:强烈建议纳入。 它代表“具身智能从 Policy Model 向 Agent Runtime / Harness 扩展”的明显趋势。


3. Neverwhere:给机器人建立自己的持续集成测试环境

Neverwhere 解决的重点不是“怎么再训练一个策略”,而是:机器人策略部署到真实世界之前,怎么做规模化、可重复的闭环测试?

它使用真实城市室内/室外场景的重建结果,将 3D Gaussian Splatting 的高真实感视觉与可碰撞几何结合,构建面向腿式机器人视觉 locomotion / parkour 的 real-to-sim 评测环境。

项目公开 Paper、Code 与 Data,并提供可扩展的环境构建与评测工具。其核心意义并不只是“又一个仿真器”,而是把软件工程里熟悉的 CI / regression testing 思路带到机器人领域:

每次策略发生变化,都可以先在一套固定的真实世界数字副本中持续回归测试,再决定是否进入真机。

为什么值得关注

具身智能进入真实部署阶段以后,只有训练 benchmark 远远不够。机器人需要像软件一样拥有:

训练 → 自动评测 → 回归测试 → 部署前验证 → 真机上线。

Neverwhere 给出的方向可以概括为 Robot CI

同时需要注意,官方也专门讨论了只依赖少量 3D Gaussian 重建场景作为训练数据的泛化风险。因此更合理的定位是:高真实感评测与部署基础设施,而不是替代真实世界多样数据的数据生成万能方案。

适用方向: 腿式机器人、视觉 locomotion、Sim-to-Real、3DGS、机器人自动评测与 CI。

时间线判断:建议纳入。 可进入“机器人研发基础设施 / 仿真评测”支线。


开源状态观察:TEMPO / TempoBench 暂不列入正式开放数据集

今天同时核查了 TEMPO 与 TempoBench。其公开 GitHub 仓库已经包含动态目标操作数据的结构、257 个 episodes、97,265 frames、机器人 proprioception/action 与 object trajectory/velocity 等内容,技术方向本身很值得跟踪。

但截至本期核验时,TempoBench 仓库的 License 部分仍明确写着 “currently a placeholder (internal use). Set the intended terms before any external release.”

因此聚身之家暂时不把它标记为“正式开放数据集”,避免把“公开可浏览的仓库”误写成“拥有明确外部使用许可的数据集”。等作者补齐正式许可证后,再升级为正式收录项。


今天真正值得记录的变化

把这三项放在一起,会看到具身智能的竞争边界正在明显外扩:

WEAVE 解决“人类行为如何转化为机器人全身操作数据”;

Show-Harness 解决“通用模型如何通过稳定接口控制不同机器人”;

Neverwhere 解决“策略如何在进入真实世界之前持续自动验证”。

于是一个更完整的具身智能技术栈开始出现:

人类/真实世界数据 → 数据转换与重定向 → 模型/Agent → 本体接口 → 仿真与回归测试 → 真机部署 → 新数据回流。

真正长期有价值的开源基础设施,可能不会只是一份模型权重,而是这整个闭环里那些可以被所有机器人、所有 Agent 重复调用的公共组件。

正在为场景选型?

获取文中机型的参数对比、成本价与落地价方案

相关阅读