技术2026/9/24·聚身之家事件日期 2026/9/24查看历史位置

每日开源|宇树 Dex1 管道在收官判定线前两天复活:单日 19 个任务集,首次出现双机协作(2026-09-24)

开源机器人GitHubAI机器人追踪具身智能

摘要

Hugging Face 官方记录显示,2026-09-23 UTC 新建 19 个 G1 Dex1 数据集,其中首次出现 Two_Robot_Clean_Table_Left/Right 成对双机器人任务;τ₀-VLA 官方仓库则在 9/20 发布 LIBERO 后训练与仿真评测、9/21 发布 Proposal 与 World Model 权重及推理/微调代码。本文同时明确区分“训练使用 40,115 小时数据”与“原始训练语料已公开”这两个状态。

2026-09-24 每日开源机器人追踪

今天先看结论

今天最明确的变化来自宇树的 G1 Dex1 数据管道:Hugging Face 官方数据记录显示,2026-09-23(UTC)新建了 19 个 G1_Dex1_ 数据集*。这一批不只是继续堆叠单机抓取与整理任务,还第一次在本轮追踪里出现了成对的双机器人任务命名:G1_Dex1_Two_Robot_Clean_Table_LeftG1_Dex1_Two_Robot_Clean_Table_Right。这说明数据组织开始从“一个机器人完成一个任务”向协同场景延伸。

另一条值得补录的开源节点是 τ₀-VLA。上海创智学院团队的官方仓库在 9 月 20 日发布 LIBERO 后训练与仿真评测,在 9 月 21 日继续放出高层 Proposal 与 World Model 的权重、推理和微调代码。需要特别区分:论文和模型卡写明低层策略预训练使用了 40,115 小时异构真机数据,但这不等于 40,115 小时原始训练语料已经作为公开数据集释出

本期只记录一手可核验状态,不把“论文中描述过”“计划开放”“模型卡提到训练数据”自动等同为“代码 / 权重 / 数据已经可下载”。

1. 宇树 G1 Dex1:单日 19 个新数据集,出现双机器人清桌任务

按 Hugging Face 官方 API 的 createdAt 字段统计,2026-09-23 UTC 新建的 19 个 G1 Dex1 数据集包括:

  • Unzip
  • Thread Sausages
  • Take Stationery
  • Take Shoes Out Shoes Box
  • Take Out Oatmeal
  • Take Out Hat
  • Store Socks
  • Store Hexagonal Wrenches
  • Store Coins
  • Store Camera
  • Squeeze Dish Soap
  • Spread Bread
  • Remove Trousers From Storage Bag
  • Put Phone Case
  • Put Pens In Box
  • Put Motor Rotor Into Box
  • Put Fruit Into Juicer
  • Two Robot Clean Table Left
  • Two Robot Clean Table Right

此外,G1_Dex1_Wipe_Table 在同一时间段也出现更新,但它不是当天新建数据集,所以不计入“19 个新增”。

这批任务的变化有两个信号。第一,数据管道依旧保持高频发布,任务从家务整理延伸到装配、工具、食品和日常操作。第二,左右两个 Two_Robot_Clean_Table 数据集首次把多机器人协同直接写进任务身份里。它目前只说明数据集结构与任务设计发生了变化,不能据此推断已经形成成熟的多机器人协同策略,但足以作为后续观察点。

2. τ₀-VLA:从“论文与低层策略”继续走向高层规划和世界模型可复现

τ₀-VLA 官方仓库的 News 记录显示:

  • 2026-09-20:发布 LIBERO post-training 与 simulation evaluation。
  • 2026-09-21:发布 high-level proposal 与 world model,包括权重、推理和微调代码。

当前公开组件已经包括低层 VLA、LIBERO checkpoint、高层 Proposal 以及 World Model。Proposal 用任务指令、头部和腕部相机图像与任务记忆提出下一步子任务;World Model 根据当前观察和候选子任务生成目标图像,用于测试时搜索。

这里仍要保留一个边界:低层策略的模型卡明确写着其预训练使用 40,115 小时异构真实机器人数据,但公开仓库提供的是模型、代码、示例数据与后训练路径,而不是把这 40,115 小时原始语料整体作为可下载数据集发布。

3. 为什么今天值得记录

第一,开源机器人数据正在变成持续运行的数据管道,而不是一次性“数据集发布会”。 当同一官方组织连续按小时新增任务,追踪重点就不应只看“有没有新项目”,还要看任务空间、协同方式、硬件手型和数据格式如何持续扩展。

第二,世界模型开始从论文结构图走向可下载组件。 τ₀-VLA 把高层 Proposal 与 World Model 的权重和训练/推理代码放出来后,外部团队终于可以更具体地复现“提出子任务 → 预测物理后果 → 再做选择”这条路线,而不是只复现低层动作策略。

第三,训练数据规模与数据开放程度必须分开写。 “用过 40,115 小时训练数据”和“公开了 40,115 小时数据”是两件不同的事;聚身之家的开源追踪继续把这两个状态严格拆开。

来源


正在为场景选型?

获取文中机型的参数对比、成本价与落地价方案

相关阅读