2026/9/10·聚身之家编辑部事件日期 2026/9/8

智元发布 GE-Act 2.0:3 万小时数据,Token 量为 DINOv3 的 1/16

智元具身智能世界模型人形机器人GE-Act 2.0AGILE 2.0灵犀X2
智元发布 GE-Act 2.0:3 万小时数据,Token 量为 DINOv3 的 1/16

摘要

9 月 8 日智元发布 GE-Act 2.0 世界-动作模型(训练数据 3 万小时、Token 量为 Meta DINOv3 的 1/16、指令匹配准确率 97.95%,均为厂商自述),同日灵犀 X2 由 AGILE 2.0 感控一体模型驱动上演杂技。质量依据:生成前快照 criticalCount=2(Robot20251111612 绝影X30 续航-4h、Robot20251111567 伟景晓唯 续航0h,均 error 级,本稿未关联),unitInconsistencyCount=9;本稿唯一关联机器人智元灵犀X2(Robot20251112937)无 critical 异常,选题为技术资讯、不作硬性结论。

文中机型智元灵犀X2智元灵犀X2

9 月 8 日,智元发布 GE-Act 2.0 模型。同日的宣传视频给出的定位是「首次验证原生世界-动作模型预训练与 Scaling 路径」:世界模型和动作模型在同一套架构里一起预训练,而不是分开训练再拼接。

这次更新的关键数字都出自智元自己的口径。一个 9 月 9 日的 B 站视频概括为:训练数据达到 3 万小时;Token 数只有 Meta DINOv3 的 1/16,但理解能力「不降反升」;指令匹配准确率 97.95%;学习素材「不挑好坏」,还会「脑补未来」。其中 97.95% 的准确率是厂商宣称的数据,未经独立核验

这组数字里有两个点值得留意。一是 Token 对比:GE-Act 2.0 的 Token 量仅为 DINOv3 的 1/16,却自称理解能力更高,智元把它表述为数据利用效率的提升。二是「不挑好坏」,即混合质量的数据也可以直接进训练,对应的是具身数据规模扩大之后的成本问题。这两点目前都只有厂商表述,完整的评测设置没有公开。

同一天,智元还发布了 AGILE 2.0 感控一体模型,公开演示是智元灵犀 X2 表演的《杂技BOT》。据 B 站视频,这套模型让机器人「边看边想边动」,官方用语是「机器人进入『睁眼运动』时代」,即表演过程中依赖实时视觉信息来驱动动作。

灵犀 X2 是智元产品线里的人形机型。按本站档案:36kg、39 个关节、最高 1.5m/s,配 3D 激光雷达加 RGBD 相机,定位是舞台、课堂、展厅一类的互动场景,这次是 AGILE 2.0 的演示载体。

GE-Act 2.0 和 AGILE 2.0 分别对应操作理解与运动控制两条线。3 万小时的数据规模、97.95% 的指令匹配准确率都来自智元自述,模型本身的 Scaling 曲线和跨任务泛化效果未见公开,本次核查也未找到独立复现。

正在为场景选型?

获取文中机型的参数对比、成本价与落地价方案

文中提到的机型

相关阅读