TenStep

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

Zhihao Liu · Qiuyi Gu · Yitao Wang · Dongming Qiao · Yixian Zhang · Shuaihang Chen · Liangzhi Shi · Tianxing Zhou 等

首要单位:Institute of Automation CAS Institute of Automation, Chinese Academy of SciencesTsinghua UniversityStriding AIZhongguancun AcademyPengcheng LaboratoryInfinigence AI Striding AIInfinigence AI

一句话结论

STEAM 值得记住的点,是它把真实机器人数据清洗问题改写成“逐帧 advantage 建模”:不用人工奖励、不用 VLM 打分,也不假设整条轨迹好坏一致,而是从专家轨迹内部的时间顺序中学习哪些 frame pair 代表推进、停滞或倒退。它尤其适合 VLA/机器人策略在真实 rollout、人工纠正和混合质量数据上继续提升:先找出真正推进任务的局部片段,再把这些片段作为 CFGRL 的高质量训练信号。

摘要

中文摘要

真实世界机器人学习越来越依赖异质数据,但示范和 rollout 往往混合了有用进展、停滞、纠正和次优行为。因此,有效的策略学习需要逐帧 advantage 来区分可靠的局部进展与失败或回退。本文提出 Self-supervised Temporal Ensemble Advantage Modeling(STEAM),一种无需标签的方法,从专家示范中学习这样的 advantage。STEAM 在专家轨迹内部的帧对上训练 temporal-offset predictor ensemble,以两帧之间的归一化时间偏移作为自监督信号。每个 predictor 将帧对映射到时间偏移分布,再转换为标量 advantage。随后 STEAM 在 ensemble 中取最小 advantage,以保守方式给混合质量 rollout 数据打分。在真实双臂叠毛巾、薯片结账、可乐补货以及单臂 pick-and-place 任务中,STEAM 能识别停滞、失败和恢复。与 CFGRL 结合后,STEAM 相比基线进一步将策略成功率分别提升 59%、54.3%、23% 和 16.2%。

英文摘要

Real-world robot learning increasingly relies on heterogeneous data, but demonstrations and rollouts often mix useful progress with stalls, corrections, and suboptimal behavior. Effective policy learning therefore requires frame-level advantages that distinguish reliable local progress from failures and regressions. We propose Self-supervised Temporal Ensemble Advantage Modeling (STEAM), a label-free method that learns such advantages from expert demonstrations. STEAM trains an ensemble of temporal-offset predictors on frame pairs within expert trajectories, using the normalized temporal offset between two frames as a self-supervised signal. Each predictor maps a frame pair to a distribution over temporal offsets, which is converted into a scalar advantage. STEAM then takes the minimum advantage across the ensemble to score mixed-quality rollout data conservatively. Across real-world bimanual towel folding, chip checkout, cola restocking, and single-arm pick-and-place tasks, STEAM identifies stalls, failures, and recoveries. When combined with CFGRL, STEAM further improves policy success rate by 59%, 54.3%, 23% and 16.2% over baselines, respectively.

直观理解

可以把 STEAM 理解成一个“机器人进展感知器”。它观察同一条专家示范里的两个画面,学习第二个画面相对第一个画面是向前推进了多少;反过来播放专家轨迹,则自然得到“倒退”的负样本。训练好以后,它用多个 temporal-offset predictor 对新 rollout 打分,并取 ensemble 中最保守的最低分,避免把分布外的错误动作误判成高价值动作。

STEAM overview

STEAM overview:从专家演示中自监督学习 frame-level advantage,再用于混合质量数据筛选和策略优化。

背景与问题

方法

方法概述

STEAM 的流程是:从专家示范构造 frame pair → 用归一化时间偏移作为自监督目标训练多个 temporal-offset predictor → 把 predictor 的分布输出转成 frame-level advantage → 对混合质量数据取 ensemble-min 的保守分数 → 用分数生成 optimality label,并接入 CFGRL 训练 VLA/机器人策略。

STEAM framework

STEAM framework:时间偏移自监督、distributional predictor、ensemble-min advantage 与 CFGRL 集成。

STEAM framework
STEAM framework

结果

Robot setup and tasks
Robot setup and tasks

结果速览表

维度结论
核心问题混合质量真实机器人数据中,如何逐帧判断哪些动作真正推进任务
核心方法用专家轨迹 frame pair 的归一化时间偏移做自监督,训练 temporal-offset predictor ensemble
关键机制Distributional temporal bin prediction + scalar advantage + ensemble-min conservative aggregation
策略接口将 STEAM advantage 转成 optimality label,接入 CFGRL 改进策略
最强结果叠毛巾 33.3→92.3,薯片结账 39.5→93.8,可乐补货 52.0→75.0,pick-and-place 63.8→80.0
最值得借鉴用相对时间顺序做数据质量监督,用 conservative ensemble 降低分布外高估
主要风险依赖专家轨迹时间顺序质量;保守聚合可能漏掉有价值的新行为

洞察

风险与判断

局限

  • STEAM 依赖“专家轨迹时间顺序大体代表任务进展”这一假设;如果专家示范中包含大量无效等待、反复调整或非单调策略,temporal offset 会变成噪声。
  • 论文主要在四个真实 manipulation 任务上验证,虽然任务多样,但还不足以证明它能泛化到所有 VLA、大规模开放世界任务或多机器人平台。
  • Advantage 只来自视觉帧对和语言指令,对力觉、触觉、接触稳定性等隐变量的捕捉有限;接触密集任务中可能需要融合 tactile/force 信号。
  • Ensemble-min 保守策略降低 false positive,但可能漏掉一些真实有用但分布外的新行为;在探索型任务中可能过度保守。

适用场景

  • 长程、多阶段机器人 manipulation,尤其是一条 episode 内既有推进也有失败/恢复的任务。
  • 已有一批专家示范,但还想利用人工纠正、失败 rollout、半成功轨迹来提升策略的真实机器人训练。
  • VLA/CFGRL/weighted BC 类 pipeline 中,需要一个 frame-level data selection 或 optimality labeling 模块。
  • 需要降低人工奖励设计和人工标注成本的真实机器人数据闭环。

最终判断

  • STEAM 是一篇很值得放进 FollowHub wiki 的机器人学习论文。它不是追求更大的 foundation model,而是补上了真实数据闭环里的关键环节:如何从混合质量机器人数据中抽取可靠的局部训练信号。对后续 VLA real-world adaptation、offline-to-online RL、人工纠正数据利用都有参考价值。

图表

Vision-Language-Action

> 把视觉、语言和动作统一进同一策略建模框架,是当前具身智能主线之一。

打开主题

Online RL for VLA

> 通才策略已经有了,接下来的问题是怎样把它快速打磨到高精度 specialist 表现。

打开主题

继续阅读

上一篇

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

这篇工作最重要的点,是给 VLA 和在线 RL 之间找到了一个足够轻量的接口。作者没有直接对整套大模型做昂贵 RL,而是让预训练 VLA 暴露一个紧凑的 `RL token`,再在这个表示上训练小型 actor-critic,从而把 VLA 的泛化能力和 real-world online RL 的样本效率拼接起来。