

StarVLA 论文精读:用可插拔骨干与动作头统一 VLA 研究
精读 StarVLA:以 backbone–action-head 分解统一 FAST、OFT、π 与 GR00T,并复用训练、评测和部署接口降低 VLA 复现实验门槛。
StarVLA 将 VLA 拆为可独立替换的基础模型与动作头,复用数据、训练、评测和部署层来对比 FAST、OFT、π 与 GR00T,并覆盖 VLM 与世界模型骨干。
1. 论文概述#
论文名称:《StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing》
作者:StarVLA Community、Von Neumann Institute, HKUST
论文链接:arXiv:2604.05014 ↗
代码 / 项目页:StarVLA GitHub ↗、Project Page ↗
一句话总结#
【Paper】 StarVLA 不是提出一种新的 VLA policy,而是一套研究基础设施:将系统分解为提供多模态表征的 backbone 与生成动作的可插拔 action head,让 FAST 离散自回归、OFT 并行回归、 flow matching、GR00T 双系统共享同一数据契约、训练入口、基准评测与部署接口。
核心贡献#
【Paper】
- 以 backbone–action-head 分解容纳四类动作解码范式,并让 Qwen3-VL、Cosmos-Predict2 等 VLM / world-model backbone 可替换。
- 把 behavior cloning、multimodal co-training 和 cross-embodiment data mixture 做成与具体 action head 无关的训练配方。
- 用统一服务端—客户端接口接入 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。
- 提供少数据工程、可复现的单 benchmark baseline,并报告跨 benchmark、跨 embodiment 的单模型训练结果。
【Analysis】 它的关键交付物不是某一行最高分,而是控制变量的能力:当数据、I/O、trainer 与 evaluator 固定时,性能变化才能更可靠地归因于 backbone、action representation 或 action head。
2. 背景与相关工作#
【Paper】 现有 VLA 常被分为两条独立路线:一类把 vision-language model 的 token 表示转成动作,另一类借助生成式 world model 的去噪过程产生动作或未来观测。动作又可表示成离散 token、连续回归或 flow matching;各项目还常绑定专属的数据预处理、训练框架和 benchmark protocol,使横向结果混入实现差异。
【Paper】 StarVLA 用 policy-centric 表述把它们放在共同坐标中:未来观测预测、语言推理等可作为附加监督或归纳偏置;部署接口仍是从观测和语言到 action chunk 的 policy。

【Analysis】 统一的是软件接口和比较单位,并不证明所有 world model 与 VLM policy 在建模或成本上等价;后者仍受辅助信号、数据规模、采样开销和闭环控制方式影响。
3. 问题定义#
【Paper】 在时刻 ,系统根据多模态历史观测 和语言指令 预测未来 步动作,以及可选辅助输出:
- Observation: 可含 RGB、深度、触觉、proprioception 等;具体任务可只使用其中一部分。
- Action: 是连续或离散化的 future action chunk,维度和归一化依 embodiment 而定。
- Language: 是自然语言任务指令。
- Auxiliary output: 可为未来视觉、子目标或语言推理;direct policy 可为空。
【Paper】 总目标为:
监督动作, 表示可选的语言对齐或未来观测信号。该公式是共同的比较语言,不要求每个模型都预测世界状态。
4. 方法#
4.1 Overall Architecture#

【Paper】 原始多视角图像、语言和可选 state 先经 backbone 得到多模态 hidden states,再由 action head 输出归一化 action chunk。模型内部唯一的可替换边界是“multimodal representation → actions”,所以数据、训练和评测不因 head 改变而改变。
4.2 核心模块#
统一 I/O 与可替换边界#
【Paper】 所有 framework 都暴露训练入口 forward({raw images, str, ...}),返回 loss dictionary;推理入口 predict_action({raw images, str, ...}),返回 normalized_actions。训练与部署都消费接近环境层的 raw observation,避免 tokenizer、图像处理或 action scaling 散落在 benchmark 脚本中。
【Code】 截至 2026-08-10 的官方仓库提交 0ed0aad,starVLA/model/framework/base_framework.py 将 forward(examples) 约定为返回含 action_loss 的字典,将 predict_action(examples) 约定为返回 [B,T,action_dim] 的 normalized_actions。代码也提醒:持续演进的最新 revision 未必复现旧 checkpoint,应锁定发布时 revision 与 checkpoint config。
四种 action head#
| 变体 | 动作表示与解码 | 论文中的作用 |
|---|---|---|
| StarVLA-FAST | FAST tokenizer 离散化动作,以 next-token prediction 自回归生成 | 检验 VLM-native token decoding |
| StarVLA-OFT | 在预定义 action token 的 hidden state 上接轻量 MLP,并行回归连续动作 | 最轻量的可插拔连续 head |
| StarVLA- | layer-wise cross-DiT 以多层 VL hidden states 为条件,迭代 flow-matching 去噪 | 检验生成式连续控制 |
| StarVLA-GR00T | VL backbone 作慢速 System 2,DiT flow-matching 作快速 System 1 | 容纳双系统推理 / 控制模式 |
【Code】 当前仓库的 VLM4A/QwenFast.py、QwenOFT.py、QwenPI.py 和 QwenGR00T.py 分别实现相近变体。QwenOFT.py 将 action special token 加入 prompt,抽取对应 hidden state,以 MLP 和 L1 loss 回归 action horizon;QwenFast.py 将轨迹编码成 FAST token,再用语言模型 generation 解码。这里是代码核验结果,不应把 2026-08 的参数与模块倒推成论文冻结版本。
Backbone、data 与 benchmark adapters#
【Paper】 VLM 与 world-model backbone 通过 adapter 接到共同 hidden-state 边界;异构机器人数据通过统一 mixture 接入。benchmark 以 policy server 和独立 evaluator 通信,adapter 负责 resize、归一化 / 反归一化、chunk 选择、sticky gripper 等环境规则。
【Code】 starVLA/dataloader/lerobot_datasets.py 根据 data_mix 建立带 robot type / embodiment tag 的 LeRobotMixtureDataset;deployment/model_server/server_policy.py 启动 WebSocket policy server;LIBERO、SimplerEnv、RoboTwin examples 各保留 model2*_interface.py。这对应论文的“核心 policy 不 import simulator,差异留在薄 adapter”。
4.3 关键公式#
辅助目标如何区分范式#
【Paper】 direct policy 只优化动作;VLM-based 模型可加子任务、spatial grounding 或 reasoning token;WM-based 模型可预测 image / video,或把它作为隐式 latent structure。共享动作损失不表示三者训练难度或推理成本相同。
多目标 co-training 损失#
【Paper】 来自额外 vision-language web data, 平衡动作拟合和多模态能力保持。【Code】 train_starvla_cotrain.py 每步对 VLA batch 反传 action_loss,并对 VLM batch 反传乘以 trainer.loss_scale.vlm 的 language-model loss,是公式的直接对应。
4.4 Training#

【Paper】 基础配方是 benchmark 内 supervised fine-tuning:从公开 VL 权重初始化,只用该 benchmark 的标准 demonstrations,不使用 VLA-specific 大规模预训练、data augmentation 或 DAgger。两种可复用扩展分别是双 dataloader 的 multimodal co-training,以及按 sampling weights 混合不同机器人数据的 cross-embodiment training。
机器人样本(image、lang、action、可选 state)、backbone / action head / data mix 配置,以及可选 VLM 数据
-
构建单数据集或带 embodiment tag 的加权 mixture;保持 batch 为模型无关的原始字典。
-
加载 backbone 并附加所选 action head,调用 framework.forward 计算该范式的 action loss。
-
若开启 co-training,同时从 VLM loader 计算 language-model loss,并以配置权重共同更新。
-
应用配置的冻结模块、混合精度、gradient accumulation / clipping 和学习率调度;保存权重、config 与归一化统计量。
【Analysis】 统一训练不等于所有 head 获得相同的 hyperparameter budget;action horizon、采样步数、backbone size 和 batch size 仍会改变成本。框架的价值是让这些差异显式化,而不是自动抹平。
4.5 Inference#
【Paper】 evaluator 将图像、语言和可选 state 打包到 policy interface;server 调用 predict_action 得到 normalized action chunk;adapter 用 checkpoint 的 dataset_statistics.json 反归一化并转换为环境控制。模拟与真实机器人可沿用同一边界。
-
benchmark / 机器人 adapter 将多视角图像、语言与可选 state 组装为 payload,发送给 policy server。
-
server 用 checkpoint 构建 framework,调用统一的 predict_action 得到 normalized action chunk。
-
client 按 dataset statistics 反归一化,并实施 action ensembling、夹爪与坐标系等环境规则。
-
执行控制、获取新观测并重复,直到 evaluator 或机器人控制器结束 episode。
4.6 代码实现对照#
| 论文抽象 | 当前官方代码对应 | 阅读边界 |
|---|---|---|
| framework registry + 可替换组件 | base_framework.py 的 build_framework() 与 registry | 现有 registry 含论文后加入的模型 |
| 机器人监督训练 | starVLA/training/train_starvla.py | trainer 读取 framework 返回的 action_loss |
| VLA + VLM 双目标 | train_starvla_cotrain.py | 两次 forward/backward,使用 loss_scale.vlm |
| cross-embodiment mixture | dataloader/lerobot_datasets.py | mixture 名称与数据格式会随 release 增长 |
| 模拟与实机部署 | deployment/model_server/、examples/**/eval_files/ | WebSocket 默认,另有 GR00T 兼容 ZMQ 路径 |
【Code】 README 显示报告发布后仓库仍加入 WM4A、RL post-training、Franka、DOMINO、RoboDojo 等能力。本文因此把论文的四个代表范式和五个主 benchmark 作为论文事实,把当前 checkout 的行为单独标为代码事实。
5. 实验#
5.1 Experimental Setup#
【Paper】 单 benchmark 结果尽量遵循官方训练和评测流程。LIBERO 使用四 suite 的联合 policy,按每 suite 10 task、每 task 50 episode 汇总;SimplerEnv 使用 Visual Matching / Variant Aggregation;RoboTwin 2.0 覆盖 50 task 的 clean 与 randomized 条件;RoboCasa-GR1 汇总 24 task。generalist setting 则将 LIBERO、SimplerEnv、RoboTwin 2.0 和 RoboCasa-GR1 合并训练一个模型,不做 benchmark-specific fine-tuning。
5.2 Main Results#
【Paper】 下表摘取最能体现不同 head 可在同一基础设施比较的结果;不同 benchmark 的 success rate 不可横向相减。
| Benchmark / 设置 | StarVLA 代表结果 | 对照信息 |
|---|---|---|
| LIBERO,Qwen3-VL-4B | OFT 96.6% avg,GR00T 96.5%, 95.7%,FAST 95.4%(30K steps) | OpenVLA-OFT 为 97.1%(175K steps) |
| LIBERO,Cosmos-Predict2-2B | OFT 95.8%, 95.5%,GR00T 95.2%(30K steps) | 世界模型 backbone 可接同一 head 边界 |
| SimplerEnv WidowX VM,Qwen3-VL-4B | GR00T 65.3%,OFT 64.6%, 60.9% | 文中 GR00T N1.5 为 61.9% |
| SimplerEnv Google Robot | OFT:VM 76.0%,VA 70.2% | 只报告 OFT 代表配置 |
| RoboCasa-GR1(24 tasks) | OFT 48.8%,GR00T 47.8%, 43.9%,FAST 39.0% | 连续 head 在该设置更强 |
| RoboTwin 2.0 | :clean 88.1%、random 88.8%;OFT:88.2% / 88.3% | unified policy 覆盖 50 task |
【Analysis】 这些数字说明在作者 recipes 和 protocol 下,多个 backbone–head 组合能达到强基线;它们不足以证明某动作表示在所有数据规模、所有真实机器人上占优。
5.3 Ablation Study#
【Paper】 technical report 的实验重心是 framework baseline 与 cross-benchmark demonstration,而不是严格模块消融;论文未给出“移除统一接口 / 只替换某组件”且其余预算完全不变的标准 ablation。因此不能把不同 head 的横向成绩当作每个工程设计的因果效应。

【Paper】 论文引用的 StarVLA-based ST4VLA study 显示:action-only 的 Google Robot VM / VA、WidowX VM 为 66.1 / 63.5、54.7;加入 co-training 后为 70.2 / 66.5、61.1;加 spatial pretraining 后为 84.6 / 75.9、73.2。Vanilla VLA 的 RefCOCO-g IoU@0.5 在约 20K step 内接近随机。此证据支持 co-training infrastructure,但结果应归属于 ST4VLA,而非 StarVLA 四种 head 的消融。
5.4 Generalization#
【Paper】 一个 jointly trained generalist 在不做下游专门微调时,得到 LIBERO 平均 97.8%,SimplerEnv WidowX / Google VA / Google VM 为 70.2 / 73.8 / 79.3%,RoboTwin random 为 87.8%,RoboCasa-GR1 为 57.3%。训练采用 学习率、总 batch 256,将低自由度 action padding 到共享 32 维向量;RoboCasa 高于表中对应 specialist 的最佳 48.8%。
【Analysis】 generalist 在部分列更高、在另一些列不是最高。更稳妥的结论是:统一 padding 与 mixture 训练没有使模型在多套件上崩溃,并且 RoboCasa 出现正迁移;对新机器人和真实长时程任务仍需额外验证。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 标准 raw I/O 减少“方法差异实为 preprocessing 差异”的风险;独立 action head 使研究者可以复用昂贵的 data / evaluator investment;server-client 边界又允许各 simulator 在独立环境运行,降低多 benchmark 的依赖冲突。
6.2 核心创新#
【Paper】 创新是双向模块化:外层以 raw observation 到 action 的契约固定训练 / 部署边界,内层以 backbone representation 到 action head 的契约固定模型组合边界。四个范式用来证明该边界不只服务单一 decoding family。
6.3 与已有方法的本质区别#
| 路线 | 常见耦合 | StarVLA 的改变 |
|---|---|---|
| 单论文 VLA 实现 | model、data、trainer、evaluator 共演化 | 将 backbone / head 移至显式配置与 registry |
| 单一动作范式工具包 | action representation 绑定 backbone 与 trainer | 用同一外部 contract 运行四类 head |
| benchmark 专用脚本 | evaluator 依赖混入 policy runtime | policy server 与 benchmark client 分离 |
【Analysis】 它更像 VLA 研究的实验操作系统,而不是替代 FAST、OFT、 或 GR00T 的新 policy;评价重点应是可复现性、组合速度和接口语义一致性,不只是单项 SOTA。
6.4 关键假设#
【Paper】 设计假设不同 backbone 都能提供 action head 可消费的对齐表征,且 raw example 与 normalized action 的共同契约足以覆盖不同 benchmark。【Analysis】 对 image-text-action 任务这通常务实;在高频触觉、复杂接触或全身 humanoid 控制中,同步、时延、action frequency 与 safety constraints 仍可能是不能由统一字典抹平的差异。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】 报告明确说明 StarVLA 仍在积极维护和扩展。RL fine-tuning 在论文撰写时仍是计划中的集成,公开重点是 supervised 和 co-training;工作定位是可复现、低数据工程 baseline,而非解决全部 generalist robot 问题。
7.2 自己分析得到的局限#
【Analysis】
- 统一 API 可能隐藏 delta / absolute action、夹爪离散化、延迟与 chunk 执行等关键语义差异。
- 统一 framework 降低实现门槛,却不能消除大规模 GPU、专有数据和 simulator 环境的复现成本。
- 仓库快速演进;若论文、config、checkpoint 和 evaluator revision 不一起固定,复现责任边界仍模糊。
- 多 benchmark 成功率主要来自 simulation protocol;可部署到实体机器人不等于所有 embodiment 都已有闭环实机验证。
8. 启发与研究思考#
【Analysis】 对后续 VLA 工作,一个值得发布的最小实验单元是四元组:(checkpoint revision, dataset statistics, training config, evaluator revision)。它比只发布权重更接近可验证的科学对象。提出新方法时也应明确它改变的是 backbone、action head、auxiliary objective、data mix 还是 adapter;改变面越清晰,结果越可解释和复用。