从“为每个任务训练一个策略”到“给机器人一个视频 Prompt”
机器人进入工厂、仓库和真实服务环境后,一个长期存在的问题是:环境和任务一直在变。零件换型、工位调整、装配顺序变化,都可能让原本可用的自动化方案需要重新采集数据、再做一轮任务级训练。
Skild AI 的 S1 试图改变这个流程。Skild 在 8 月公开 S1 时,把它定义为面向机器人的 in-context learner:操作者用视频演示一次任务,视频本身成为模型的上下文,机器人随后直接执行,不更新模型权重,也不为这个任务单独做 post-training。
这和大语言模型从“每个任务都微调”转向“通过 Prompt 临时适配任务”的思路很接近,只不过机器人的 Prompt 不只是文字,而是包含动作顺序、物体关系、操作意图和任务进度的视频。
单个示范,最长约 10 分钟
根据 Skild 公布的测试,S1 展示了植株换盆、煎饼制作、手冲咖啡、套件装配等此前未出现在预训练任务中的长流程操作。这些任务最长约 10 分钟,包含数十个连续操作步骤。
其中植株换盆案例里,团队记录了一段人类第一视角示范,从视频演示结束到机器人开始在真机上自主执行,只间隔约 11 分钟。Skild 还报告称,在其内部未见任务测试中,单个视频示范的 S1 达到约 66% 的逐步成功率;作为对照的语言条件 VLA 约为 9%。公司进一步估算,在长时序任务上,一次上下文示范所达到的效果,大致需要传统后训练方案采集约 380 次示范才能追平。
需要注意,这些数字来自 Skild 自己的测试体系,目前不能直接等同于行业统一基准或第三方独立验证。但它至少展示了一种非常重要的工程方向:把“学习新任务”的成本,从几十小时甚至上百小时数据采集与训练,压缩到一次示范和分钟级部署。
为什么这对机器人商业化比单一 Benchmark 更重要
9 月 9 日,Skild AI 又披露了一个更具产业意味的数据:从第一次商业部署算起 10 个月,公司年化收入运行率(ARR)已突破 1 亿美元,付费客户超过 60 家,场景覆盖搬运、配送、巡检、安防、食品准备,以及仓库、工厂和数据中心。
Skild 还表示,其机器人智能正在与 NVIDIA、Foxconn 合作,用于双臂机械系统执行 NVIDIA Blackwell 系统的高精度装配;同时正与 Sumitomo Wiring Systems 推进线束制造自动化。9 月 10 日,NVIDIA 也进一步介绍了 S1 使用其 AI 基础设施、仿真和 Physical AI 工具链进行训练与部署的情况。
这说明 S1 的意义不只是“机器人会不会煎饼”。真正关键的是,如果机器人能在工厂换线、SKU 变化、工位调整后,通过一段新的现场视频迅速适配,那么具身智能的软件成本结构会发生变化。过去机器人的一次销售往往对应一套相对固定的自动化工程;未来,硬件可能保持不变,而任务通过持续的上下文示范被动态下发。
聚身之家观察:机器人开始出现真正的“运行时学习接口”
从产业基础设施角度看,S1 值得关注的不是某个单项动作成功率,而是它正在形成一种新的任务接口:
人类示范视频 → 模型理解任务意图 → 映射到当前机器人本体 → 直接执行。
如果这条路线继续成熟,未来机器人选型和部署平台需要记录的就不只是自由度、负载、续航和价格,还要增加一个新的核心维度:一台机器人接受新任务的成本是多少?
这个成本可以进一步拆成:需要多少示范、是否需要人工遥操作、是否需要重新训练、适配需要多久、任务变化后能否即时恢复。谁能把这些指标压到足够低,谁就更接近真正可规模复制的“通用机器人生产力”。
S1 还远没有证明所有机器人任务都可以靠一个视频解决,但它让“Prompt 驱动真实世界机器”从概念变成了越来越具体的工程路线。
参考来源
- Skild AI:Introducing S1: In-Context Learning for Robotics(2026-08-18)https://www.skild.ai/blogs/s1
- Skild AI:The Hidden Pillar of Robotics / Skild crosses $100M ARR within ten months(2026-09-09)https://skild.ai/blogs/skild-crosses-100m-arr
- NVIDIA:Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video(2026-09-10)https://blogs.nvidia.com/blog/skild-ai-s1-physical-ai/

