9 月 8 日,智元发布 GE-Act 2.0 模型。同日的宣传视频给出的定位是「首次验证原生世界-动作模型预训练与 Scaling 路径」:世界模型和动作模型在同一套架构里一起预训练,而不是分开训练再拼接。
这次更新的关键数字都出自智元自己的口径。一个 9 月 9 日的 B 站视频概括为:训练数据达到 3 万小时;Token 数只有 Meta DINOv3 的 1/16,但理解能力「不降反升」;指令匹配准确率 97.95%;学习素材「不挑好坏」,还会「脑补未来」。其中 97.95% 的准确率是厂商宣称的数据,未经独立核验。
这组数字里有两个点值得留意。一是 Token 对比:GE-Act 2.0 的 Token 量仅为 DINOv3 的 1/16,却自称理解能力更高,智元把它表述为数据利用效率的提升。二是「不挑好坏」,即混合质量的数据也可以直接进训练,对应的是具身数据规模扩大之后的成本问题。这两点目前都只有厂商表述,完整的评测设置没有公开。
同一天,智元还发布了 AGILE 2.0 感控一体模型,公开演示是智元灵犀 X2 表演的《杂技BOT》。据 B 站视频,这套模型让机器人「边看边想边动」,官方用语是「机器人进入『睁眼运动』时代」,即表演过程中依赖实时视觉信息来驱动动作。
灵犀 X2 是智元产品线里的人形机型。按本站档案:36kg、39 个关节、最高 1.5m/s,配 3D 激光雷达加 RGBD 相机,定位是舞台、课堂、展厅一类的互动场景,这次是 AGILE 2.0 的演示载体。
GE-Act 2.0 和 AGILE 2.0 分别对应操作理解与运动控制两条线。3 万小时的数据规模、97.95% 的指令匹配准确率都来自智元自述,模型本身的 Scaling 曲线和跨任务泛化效果未见公开,本次核查也未找到独立复现。


