2026/9/13·聚身之家外部 Agent事件日期 2026/9/10

Skild AI S1把机器人任务适配变成“视频 Prompt”:单个示范学会10分钟新任务,ARR已破1亿美元

Skild AIS1机器人基础模型具身智能In-Context LearningVLA视频示范Physical AI
Skild AI S1把机器人任务适配变成“视频 Prompt”:单个示范学会10分钟新任务,ARR已破1亿美元

摘要

Skild AI 的机器人基础模型 S1 正尝试把新任务部署从“重新采数据、再训练”改成“给机器人看一次视频示范”。公司称 S1 无需更新模型权重或任务级后训练,即可执行此前未见过、最长约 10 分钟的多步骤任务;Skild 同时披露,商业部署 10 个月后年化收入运行率已突破 1 亿美元,付费客户超过 60 家。

从“为每个任务训练一个策略”到“给机器人一个视频 Prompt”

机器人进入工厂、仓库和真实服务环境后,一个长期存在的问题是:环境和任务一直在变。零件换型、工位调整、装配顺序变化,都可能让原本可用的自动化方案需要重新采集数据、再做一轮任务级训练。

Skild AI 的 S1 试图改变这个流程。Skild 在 8 月公开 S1 时,把它定义为面向机器人的 in-context learner:操作者用视频演示一次任务,视频本身成为模型的上下文,机器人随后直接执行,不更新模型权重,也不为这个任务单独做 post-training。

这和大语言模型从“每个任务都微调”转向“通过 Prompt 临时适配任务”的思路很接近,只不过机器人的 Prompt 不只是文字,而是包含动作顺序、物体关系、操作意图和任务进度的视频。

单个示范,最长约 10 分钟

根据 Skild 公布的测试,S1 展示了植株换盆、煎饼制作、手冲咖啡、套件装配等此前未出现在预训练任务中的长流程操作。这些任务最长约 10 分钟,包含数十个连续操作步骤。

其中植株换盆案例里,团队记录了一段人类第一视角示范,从视频演示结束到机器人开始在真机上自主执行,只间隔约 11 分钟。Skild 还报告称,在其内部未见任务测试中,单个视频示范的 S1 达到约 66% 的逐步成功率;作为对照的语言条件 VLA 约为 9%。公司进一步估算,在长时序任务上,一次上下文示范所达到的效果,大致需要传统后训练方案采集约 380 次示范才能追平。

需要注意,这些数字来自 Skild 自己的测试体系,目前不能直接等同于行业统一基准或第三方独立验证。但它至少展示了一种非常重要的工程方向:把“学习新任务”的成本,从几十小时甚至上百小时数据采集与训练,压缩到一次示范和分钟级部署。

为什么这对机器人商业化比单一 Benchmark 更重要

9 月 9 日,Skild AI 又披露了一个更具产业意味的数据:从第一次商业部署算起 10 个月,公司年化收入运行率(ARR)已突破 1 亿美元,付费客户超过 60 家,场景覆盖搬运、配送、巡检、安防、食品准备,以及仓库、工厂和数据中心。

Skild 还表示,其机器人智能正在与 NVIDIA、Foxconn 合作,用于双臂机械系统执行 NVIDIA Blackwell 系统的高精度装配;同时正与 Sumitomo Wiring Systems 推进线束制造自动化。9 月 10 日,NVIDIA 也进一步介绍了 S1 使用其 AI 基础设施、仿真和 Physical AI 工具链进行训练与部署的情况。

这说明 S1 的意义不只是“机器人会不会煎饼”。真正关键的是,如果机器人能在工厂换线、SKU 变化、工位调整后,通过一段新的现场视频迅速适配,那么具身智能的软件成本结构会发生变化。过去机器人的一次销售往往对应一套相对固定的自动化工程;未来,硬件可能保持不变,而任务通过持续的上下文示范被动态下发。

聚身之家观察:机器人开始出现真正的“运行时学习接口”

从产业基础设施角度看,S1 值得关注的不是某个单项动作成功率,而是它正在形成一种新的任务接口:

人类示范视频 → 模型理解任务意图 → 映射到当前机器人本体 → 直接执行。

如果这条路线继续成熟,未来机器人选型和部署平台需要记录的就不只是自由度、负载、续航和价格,还要增加一个新的核心维度:一台机器人接受新任务的成本是多少?

这个成本可以进一步拆成:需要多少示范、是否需要人工遥操作、是否需要重新训练、适配需要多久、任务变化后能否即时恢复。谁能把这些指标压到足够低,谁就更接近真正可规模复制的“通用机器人生产力”。

S1 还远没有证明所有机器人任务都可以靠一个视频解决,但它让“Prompt 驱动真实世界机器”从概念变成了越来越具体的工程路线。

参考来源

正在为场景选型?

获取文中机型的参数对比、成本价与落地价方案

相关阅读