Hana's Blog
StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究Blur image
Arxiv ID 2604.05014
幻觉翻译 2604.05014
publication pending

StarVLA 将 VLA 拆为可独立替换的基础模型与动作头,复用数据、训练、评测和部署层来对比 FAST、OFT、π 与 GR00T,并覆盖 VLM 与世界模型骨干。

推荐指数:

1. 论文概述#

论文名称:《StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing》
作者:StarVLA Community、Von Neumann Institute, HKUST
论文链接arXiv:2604.05014
代码 / 项目页StarVLA GitHubProject Page

一句话总结#

【Paper】 StarVLA 不是提出一种新的 VLA policy,而是一套研究基础设施:将系统分解为提供多模态表征的 backbone 与生成动作的可插拔 action head,让 FAST 离散自回归、OFT 并行回归、π\pi flow matching、GR00T 双系统共享同一数据契约、训练入口、基准评测与部署接口。

核心贡献#

【Paper】

  1. 以 backbone–action-head 分解容纳四类动作解码范式,并让 Qwen3-VL、Cosmos-Predict2 等 VLM / world-model backbone 可替换。
  2. 把 behavior cloning、multimodal co-training 和 cross-embodiment data mixture 做成与具体 action head 无关的训练配方。
  3. 用统一服务端—客户端接口接入 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。
  4. 提供少数据工程、可复现的单 benchmark baseline,并报告跨 benchmark、跨 embodiment 的单模型训练结果。

【Analysis】 它的关键交付物不是某一行最高分,而是控制变量的能力:当数据、I/O、trainer 与 evaluator 固定时,性能变化才能更可靠地归因于 backbone、action representation 或 action head。

2. 背景与相关工作#

【Paper】 现有 VLA 常被分为两条独立路线:一类把 vision-language model 的 token 表示转成动作,另一类借助生成式 world model 的去噪过程产生动作或未来观测。动作又可表示成离散 token、连续回归或 flow matching;各项目还常绑定专属的数据预处理、训练框架和 benchmark protocol,使横向结果混入实现差异。

【Paper】 StarVLA 用 policy-centric 表述把它们放在共同坐标中:未来观测预测、语言推理等可作为附加监督或归纳偏置;部署接口仍是从观测和语言到 action chunk 的 policy。

StarVLA 的统一 VLA 形式:以动作损失为核心、以辅助预测为可选归纳偏置(论文 Figure 1)

【Analysis】 统一的是软件接口和比较单位,并不证明所有 world model 与 VLM policy 在建模或成本上等价;后者仍受辅助信号、数据规模、采样开销和闭环控制方式影响。

3. 问题定义#

【Paper】 在时刻 tt,系统根据多模态历史观测 xt\mathbf{x}_{\leq t} 和语言指令 \ell 预测未来 kk 步动作,以及可选辅助输出:

π(at:t+k,yauxxt,).\pi(\mathbf a_{t:t+k},\mathbf y_{\mathrm{aux}}\mid\mathbf x_{\leq t},\ell).
  • Observationxt\mathbf{x}_{\leq t} 可含 RGB、深度、触觉、proprioception 等;具体任务可只使用其中一部分。
  • Actionat:t+k\mathbf a_{t:t+k} 是连续或离散化的 future action chunk,维度和归一化依 embodiment 而定。
  • Language\ell 是自然语言任务指令。
  • Auxiliary outputyaux\mathbf y_{\mathrm{aux}} 可为未来视觉、子目标或语言推理;direct policy 可为空。

【Paper】 总目标为:

L=Laction+Laux.\mathcal L=\mathcal L_{\mathrm{action}}+\mathcal L_{\mathrm{aux}}.

Laction\mathcal L_{\mathrm{action}} 监督动作,Laux\mathcal L_{\mathrm{aux}} 表示可选的语言对齐或未来观测信号。该公式是共同的比较语言,不要求每个模型都预测世界状态。

4. 方法#

4.1 Overall Architecture#

四种 action decoding 在相同 VL foundation model 接口下的实例化:FAST、OFT、GR00T 与 π(论文 Figure 2)

【Paper】 原始多视角图像、语言和可选 state 先经 backbone 得到多模态 hidden states,再由 action head 输出归一化 action chunk。模型内部唯一的可替换边界是“multimodal representation → actions”,所以数据、训练和评测不因 head 改变而改变。

4.2 核心模块#

统一 I/O 与可替换边界#

【Paper】 所有 framework 都暴露训练入口 forward({raw images, str, ...}),返回 loss dictionary;推理入口 predict_action({raw images, str, ...}),返回 normalized_actions。训练与部署都消费接近环境层的 raw observation,避免 tokenizer、图像处理或 action scaling 散落在 benchmark 脚本中。

【Code】 截至 2026-08-10 的官方仓库提交 0ed0aadstarVLA/model/framework/base_framework.pyforward(examples) 约定为返回含 action_loss 的字典,将 predict_action(examples) 约定为返回 [B,T,action_dim]normalized_actions。代码也提醒:持续演进的最新 revision 未必复现旧 checkpoint,应锁定发布时 revision 与 checkpoint config。

四种 action head#

变体动作表示与解码论文中的作用
StarVLA-FASTFAST tokenizer 离散化动作,以 next-token prediction 自回归生成检验 VLM-native token decoding
StarVLA-OFT在预定义 action token 的 hidden state 上接轻量 MLP,并行回归连续动作最轻量的可插拔连续 head
StarVLA-π\pilayer-wise cross-DiT 以多层 VL hidden states 为条件,迭代 flow-matching 去噪检验生成式连续控制
StarVLA-GR00TVL backbone 作慢速 System 2,DiT flow-matching 作快速 System 1容纳双系统推理 / 控制模式

【Code】 当前仓库的 VLM4A/QwenFast.pyQwenOFT.pyQwenPI.pyQwenGR00T.py 分别实现相近变体。QwenOFT.py 将 action special token 加入 prompt,抽取对应 hidden state,以 MLP 和 L1 loss 回归 action horizon;QwenFast.py 将轨迹编码成 FAST token,再用语言模型 generation 解码。这里是代码核验结果,不应把 2026-08 的参数与模块倒推成论文冻结版本。

Backbone、data 与 benchmark adapters#

【Paper】 VLM 与 world-model backbone 通过 adapter 接到共同 hidden-state 边界;异构机器人数据通过统一 mixture 接入。benchmark 以 policy server 和独立 evaluator 通信,adapter 负责 resize、归一化 / 反归一化、chunk 选择、sticky gripper 等环境规则。

【Code】 starVLA/dataloader/lerobot_datasets.py 根据 data_mix 建立带 robot type / embodiment tag 的 LeRobotMixtureDatasetdeployment/model_server/server_policy.py 启动 WebSocket policy server;LIBERO、SimplerEnv、RoboTwin examples 各保留 model2*_interface.py。这对应论文的“核心 policy 不 import simulator,差异留在薄 adapter”。

4.3 关键公式#

辅助目标如何区分范式#

Laux={0,direct VLA,Llanguage/reasoning,VLM-based VLA,Lfuture observation,world-model-based VLA.\mathcal L_{\mathrm{aux}}= \begin{cases} 0,&\text{direct VLA},\\ \mathcal L_{\mathrm{language/reasoning}},&\text{VLM-based VLA},\\ \mathcal L_{\mathrm{future\ observation}},&\text{world-model-based VLA}. \end{cases}

【Paper】 direct policy 只优化动作;VLM-based 模型可加子任务、spatial grounding 或 reasoning token;WM-based 模型可预测 image / video,或把它作为隐式 latent structure。共享动作损失不表示三者训练难度或推理成本相同。

多目标 co-training 损失#

Lco=Laction+λvlmLvlm.\mathcal L_{\mathrm{co}}=\mathcal L_{\mathrm{action}}+\lambda_{\mathrm{vlm}}\mathcal L_{\mathrm{vlm}}.

【Paper】 Lvlm\mathcal L_{\mathrm{vlm}} 来自额外 vision-language web data,λvlm\lambda_{\mathrm{vlm}} 平衡动作拟合和多模态能力保持。【Code】 train_starvla_cotrain.py 每步对 VLA batch 反传 action_loss,并对 VLM batch 反传乘以 trainer.loss_scale.vlm 的 language-model loss,是公式的直接对应。

4.4 Training#

StarVLA 将异构数据、dataloader、foundation model、action head 与训练 / 部署连成统一管线(论文 Figure 3)

【Paper】 基础配方是 benchmark 内 supervised fine-tuning:从公开 VL 权重初始化,只用该 benchmark 的标准 demonstrations,不使用 VLA-specific 大规模预训练、data augmentation 或 DAgger。两种可复用扩展分别是双 dataloader 的 multimodal co-training,以及按 sampling weights 混合不同机器人数据的 cross-embodiment training。

Algorithm 1 StarVLA 的统一训练流程
输入:

机器人样本(image、lang、action、可选 state)、backbone / action head / data mix 配置,以及可选 VLM 数据

输出:
保存 config 与 dataset statistics 的 StarVLA checkpoint
  1. 构建单数据集或带 embodiment tag 的加权 mixture;保持 batch 为模型无关的原始字典。

  2. 加载 backbone 并附加所选 action head,调用 framework.forward 计算该范式的 action loss。

  3. 若开启 co-training,同时从 VLM loader 计算 language-model loss,并以配置权重共同更新。

  4. 应用配置的冻结模块、混合精度、gradient accumulation / clipping 和学习率调度;保存权重、config 与归一化统计量。

【Analysis】 统一训练不等于所有 head 获得相同的 hyperparameter budget;action horizon、采样步数、backbone size 和 batch size 仍会改变成本。框架的价值是让这些差异显式化,而不是自动抹平。

4.5 Inference#

【Paper】 evaluator 将图像、语言和可选 state 打包到 policy interface;server 调用 predict_action 得到 normalized action chunk;adapter 用 checkpoint 的 dataset_statistics.json 反归一化并转换为环境控制。模拟与真实机器人可沿用同一边界。

Algorithm 2 StarVLA 的 server-client 推理与执行
输入:
当前观测、任务语言、checkpoint 的 config 与 action statistics
输出:
环境原生控制 API 可执行的下一段动作
  1. benchmark / 机器人 adapter 将多视角图像、语言与可选 state 组装为 payload,发送给 policy server。

  2. server 用 checkpoint 构建 framework,调用统一的 predict_action 得到 normalized action chunk。

  3. client 按 dataset statistics 反归一化,并实施 action ensembling、夹爪与坐标系等环境规则。

  4. 执行控制、获取新观测并重复,直到 evaluator 或机器人控制器结束 episode。

4.6 代码实现对照#

论文抽象当前官方代码对应阅读边界
framework registry + 可替换组件base_framework.pybuild_framework() 与 registry现有 registry 含论文后加入的模型
机器人监督训练starVLA/training/train_starvla.pytrainer 读取 framework 返回的 action_loss
VLA + VLM 双目标train_starvla_cotrain.py两次 forward/backward,使用 loss_scale.vlm
cross-embodiment mixturedataloader/lerobot_datasets.pymixture 名称与数据格式会随 release 增长
模拟与实机部署deployment/model_server/examples/**/eval_files/WebSocket 默认,另有 GR00T 兼容 ZMQ 路径

【Code】 README 显示报告发布后仓库仍加入 WM4A、RL post-training、Franka、DOMINO、RoboDojo 等能力。本文因此把论文的四个代表范式和五个主 benchmark 作为论文事实,把当前 checkout 的行为单独标为代码事实。

5. 实验#

5.1 Experimental Setup#

【Paper】 单 benchmark 结果尽量遵循官方训练和评测流程。LIBERO 使用四 suite 的联合 policy,按每 suite 10 task、每 task 50 episode 汇总;SimplerEnv 使用 Visual Matching / Variant Aggregation;RoboTwin 2.0 覆盖 50 task 的 clean 与 randomized 条件;RoboCasa-GR1 汇总 24 task。generalist setting 则将 LIBERO、SimplerEnv、RoboTwin 2.0 和 RoboCasa-GR1 合并训练一个模型,不做 benchmark-specific fine-tuning。

5.2 Main Results#

【Paper】 下表摘取最能体现不同 head 可在同一基础设施比较的结果;不同 benchmark 的 success rate 不可横向相减。

Benchmark / 设置StarVLA 代表结果对照信息
LIBERO,Qwen3-VL-4BOFT 96.6% avg,GR00T 96.5%,π\pi 95.7%,FAST 95.4%(30K steps)OpenVLA-OFT 为 97.1%(175K steps)
LIBERO,Cosmos-Predict2-2BOFT 95.8%π\pi 95.5%,GR00T 95.2%(30K steps)世界模型 backbone 可接同一 head 边界
SimplerEnv WidowX VM,Qwen3-VL-4BGR00T 65.3%,OFT 64.6%,π\pi 60.9%文中 GR00T N1.5 为 61.9%
SimplerEnv Google RobotOFT:VM 76.0%,VA 70.2%只报告 OFT 代表配置
RoboCasa-GR1(24 tasks)OFT 48.8%,GR00T 47.8%,π\pi 43.9%,FAST 39.0%连续 head 在该设置更强
RoboTwin 2.0π\pi:clean 88.1%、random 88.8%;OFT:88.2% / 88.3%unified policy 覆盖 50 task

【Analysis】 这些数字说明在作者 recipes 和 protocol 下,多个 backbone–head 组合能达到强基线;它们不足以证明某动作表示在所有数据规模、所有真实机器人上占优。

5.3 Ablation Study#

【Paper】 technical report 的实验重心是 framework baseline 与 cross-benchmark demonstration,而不是严格模块消融;论文未给出“移除统一接口 / 只替换某组件”且其余预算完全不变的标准 ablation。因此不能把不同 head 的横向成绩当作每个工程设计的因果效应。

空间 grounding 与机器人动作的 co-training 曲线:仅动作微调会快速遗忘感知能力,spatially guided co-training 更稳定(论文 Figure 4,图中研究引用自 ST4VLA)

【Paper】 论文引用的 StarVLA-based ST4VLA study 显示:action-only 的 Google Robot VM / VA、WidowX VM 为 66.1 / 63.5、54.7;加入 co-training 后为 70.2 / 66.5、61.1;加 spatial pretraining 后为 84.6 / 75.9、73.2。Vanilla VLA 的 RefCOCO-g IoU@0.5 在约 20K step 内接近随机。此证据支持 co-training infrastructure,但结果应归属于 ST4VLA,而非 StarVLA 四种 head 的消融。

5.4 Generalization#

【Paper】 一个 jointly trained generalist 在不做下游专门微调时,得到 LIBERO 平均 97.8%,SimplerEnv WidowX / Google VA / Google VM 为 70.2 / 73.8 / 79.3%,RoboTwin random 为 87.8%,RoboCasa-GR1 为 57.3%。训练采用 10410^{-4} 学习率、总 batch 256,将低自由度 action padding 到共享 32 维向量;RoboCasa 高于表中对应 specialist 的最佳 48.8%。

【Analysis】 generalist 在部分列更高、在另一些列不是最高。更稳妥的结论是:统一 padding 与 mixture 训练没有使模型在多套件上崩溃,并且 RoboCasa 出现正迁移;对新机器人和真实长时程任务仍需额外验证。

6. 方法分析#

6.1 为什么有效?#

【Analysis】 标准 raw I/O 减少“方法差异实为 preprocessing 差异”的风险;独立 action head 使研究者可以复用昂贵的 data / evaluator investment;server-client 边界又允许各 simulator 在独立环境运行,降低多 benchmark 的依赖冲突。

6.2 核心创新#

【Paper】 创新是双向模块化:外层以 raw observation 到 action 的契约固定训练 / 部署边界,内层以 backbone representation 到 action head 的契约固定模型组合边界。四个范式用来证明该边界不只服务单一 decoding family。

6.3 与已有方法的本质区别#

路线常见耦合StarVLA 的改变
单论文 VLA 实现model、data、trainer、evaluator 共演化将 backbone / head 移至显式配置与 registry
单一动作范式工具包action representation 绑定 backbone 与 trainer用同一外部 contract 运行四类 head
benchmark 专用脚本evaluator 依赖混入 policy runtimepolicy server 与 benchmark client 分离

【Analysis】 它更像 VLA 研究的实验操作系统,而不是替代 FAST、OFT、π\pi 或 GR00T 的新 policy;评价重点应是可复现性、组合速度和接口语义一致性,不只是单项 SOTA。

6.4 关键假设#

【Paper】 设计假设不同 backbone 都能提供 action head 可消费的对齐表征,且 raw example 与 normalized action 的共同契约足以覆盖不同 benchmark。【Analysis】 对 image-text-action 任务这通常务实;在高频触觉、复杂接触或全身 humanoid 控制中,同步、时延、action frequency 与 safety constraints 仍可能是不能由统一字典抹平的差异。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】 报告明确说明 StarVLA 仍在积极维护和扩展。RL fine-tuning 在论文撰写时仍是计划中的集成,公开重点是 supervised 和 co-training;工作定位是可复现、低数据工程 baseline,而非解决全部 generalist robot 问题。

7.2 自己分析得到的局限#

【Analysis】

  1. 统一 API 可能隐藏 delta / absolute action、夹爪离散化、延迟与 chunk 执行等关键语义差异。
  2. 统一 framework 降低实现门槛,却不能消除大规模 GPU、专有数据和 simulator 环境的复现成本。
  3. 仓库快速演进;若论文、config、checkpoint 和 evaluator revision 不一起固定,复现责任边界仍模糊。
  4. 多 benchmark 成功率主要来自 simulation protocol;可部署到实体机器人不等于所有 embodiment 都已有闭环实机验证。

8. 启发与研究思考#

【Analysis】 对后续 VLA 工作,一个值得发布的最小实验单元是四元组:(checkpoint revision, dataset statistics, training config, evaluator revision)。它比只发布权重更接近可验证的科学对象。提出新方法时也应明确它改变的是 backbone、action head、auxiliary objective、data mix 还是 adapter;改变面越清晰,结果越可解释和复用。

StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究
https://agusexp25.top/blog/paper-deep-dive-starvla
Author 菊花花
Published at August 26, 2026