

StarVLA-α 论文精读
StarVLA-α 用 Qwen3-VL、轻量 MLP action head 和统一数据管线重新审视 VLA 复杂度,系统分析 action head、机器人预训练与数据工程。
一个强 VLM 加轻量 MLP action head,就足以在四个 benchmark 和真实机器人上形成强竞争力的通用 VLA 基线。
1. 论文概述#
一句话总结#
【Paper】StarVLA-α 不追求新的 action architecture,而是固定强大的 Qwen3-VL backbone,使用最小化的数据处理、连续 action regression 和跨 benchmark 的统一训练,回答“VLA 中哪些复杂设计真的必要”。

核心贡献#
- 【Paper】提出一个由 Qwen3-VL 和轻量 MLP action head 组成的简单 baseline,在 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 四个 benchmark 上统一评测。
- 【Paper】在控制 backbone、数据和训练协议后,比较 FAST 离散 token、MLP regression、flow-matching 以及 GR00T 式双系统 action head,发现连续 action 很重要,但连续 head 之间差距有限。
- 【Paper】重新评估 OXE、InternData-A1、RoboTwin-Rand 等 action-specific pretraining,说明预训练收益依赖目标 embodiment 和数据域,OOD 数据甚至会伤害性能。
- 【Paper】提出 all-in-one generalist 评估:单个模型联合训练四类 benchmark,使用 32 维 zero padding 统一 action interface;RoboCasa-GR1 平均成功率达到 57.3%。
- 【Paper】在 ARX5 的 RoboChallenge 真实世界评测中达到 33.6% success rate、54.5 progress score,分别高于 π0.5 的 12.7% 和 27.6%。
2. 背景与相关工作#
【Paper】当前 VLA 结果难以直接比较,原因不是单一模型结构,而是整条 pipeline 同时变化:vision tower、language backbone、action tokenizer、action chunk、proprioception、历史帧、动作坐标系、预训练数据和 benchmark-specific evaluation 往往一起变化。这样一来,论文报告的提升可能来自数据清洗或评测工程,而不是模型本身。
【Analysis】StarVLA-α 的价值更接近“实验控制组”而非传统意义上的新架构。它把问题拆成三个可检验的轴:action head 是否需要复杂化、action-specific pretraining 是否普适、数据工程是否在强 VLM 上仍然必要。
3. 问题定义#
给定多视角 RGB 观测 和语言指令 ,模型需要输出长度为 的连续动作块:
其中 是 action horizon, 是 embodiment 的 action dimension。单 benchmark 训练时, 可为 7、14、29 等;all-in-one 训练时,论文将不同机器人的动作向量补零到 。输入默认只有 RGB 和语言,state、历史帧、delta/relative action 都作为可控 ablation,而不是默认输入。
4. 方法#
4.1 Overall Architecture#

【Paper】统一流程是 RGB + instruction → Qwen3-VL → action-token hidden states → MLP → continuous action chunk;benchmark-specific 部分只保留薄适配器,用于 observation、action interface 和 evaluator 的格式转换。
4.2 核心模块#
Qwen3-VL backbone#
【Paper】Qwen3-VL 原生接收图像和文本,不需要额外拼接 CLIP/SigLIP 等视觉塔。它输出融合后的 token hidden states,承担视觉理解、指令 grounding 和跨任务表征。
Action token 与 MLP head#
【Paper】在指令末尾追加 个 action token,每个 token 对应一个未来时间步。第 个 token 的 hidden state 输入共享的 MLPResNet,直接回归 维连续动作。
【Code】官方 starVLA/model/framework/VLM4A/QwenOFT.py 使用特殊字符 🔍 作为 action token,在 prompt 中构造 “Please predict the next H robot actions” 后,从 Qwen 输出的最后 hidden state 中收集这些 token 的 embedding。MLP_ActionHeader.py 的 head 是 LayerNorm → Linear → ReLU → 2 个 residual MLP block → LayerNorm → Linear,对每个 chunk step 独立映射到 action vector。
Minimal data pipeline#
【Paper】训练 split 上计算 action 的均值和标准差,并做 zero-mean、unit-variance normalization;评测遵循各 benchmark 官方 protocol。默认不加入 proprioception、历史帧或复杂 action transform。
【Code】代码仓库的通用 LeRobot dataloader 会保存 dataset_statistics.json,推理接口返回 normalized_actions;具体 robot 的反归一化和 gripper 语义由 benchmark/robot adapter 负责。
Cross-embodiment padding#
【Paper】all-in-one 模型把低维 action 右侧补零到 32 维,再用同一个 action head 预测。论文比较了 RDT action 和 multi-action head,说明简单 padding 在多个 benchmark 上不逊色,且在 Google Robot VM 和 RoboCasa-GR1 上分别提升 2.9 和 4.8 个百分点。
4.3 关键公式#
VLM 的融合表示写作:
其中 是追加的 action tokens,(此处为矩阵)包含每个 token 的 hidden state。取出对应位置后:
其中 是 action horizon, 是共享参数的 MLP action head,输出维度为 。
训练目标是逐元素 L1 regression:
【Analysis】L1 目标与 diffusion/flow-matching 相比没有采样过程或噪声时间变量,优化和推理路径都更短;代价是它不能显式表示同一观测下的多峰动作分布。
对于多 embodiment 的统一接口:
【Paper】该式不是新的 action representation,而是把异构维度的接口复杂度下沉到 padding;模型依靠视觉、语言和训练分布学习哪些维度有效。
4.4 Training#
【Paper】specialist 训练分别使用每个 benchmark 的训练集;generalist 训练将 LIBERO、SimplerEnv、RoboTwin 2.0 和 RoboCasa-GR1 合并。all-in-one 实验使用 learning rate 、batch size 256,并将 action 维度补到 32。
【Code】训练入口是 starVLA/training/train_starvla.py,采用 PyTorch + Accelerate + DeepSpeed,优化器为 AdamW,模型 forward 返回 action_loss。QwenOFT 的 forward 取 action chunk 的最后 个标签并计算 L1 loss;配置文件决定 action dimension、horizon、batch size 和冻结模块。
- 从训练 split 统计 action mean/std,并归一化每个 action chunk。
- 在指令末尾追加 H 个 action tokens,构造 Qwen3-VL 的多模态输入。
- 前向运行 VLM,收集 action token 的 hidden states。
- 用共享 MLP head 逐步回归连续动作,并计算 L1 loss。
- 通过 AdamW 更新 VLM 与 action head(按配置可冻结部分 backbone)。
4.5 Inference#
【Code】Qwenvl_OFT.predict_action 在 torch.inference_mode() 下处理输入,按训练分辨率 resize 图像,追加相同的 action prompt,读取 action-token hidden states 后一次性输出 [B,H_a,D] 的 normalized_actions。部署 adapter 再按 robot 的统计量反归一化,并按 action chunk 的步长执行。
【Paper】论文没有把推理写成额外的 sampling algorithm;MLP variant 是单次 forward,π/GR00T/FAST 变体则由各自 action head 的实现决定。
- 将图像调整为训练分辨率,并拼接 action-token prompt。
- 运行 Qwen3-VL,定位并提取 H 个 action-token hidden states。
- 用 MLP action head 回归归一化动作块。
-
使用 dataset statistics 反归一化,交给 benchmark 或真实机器人接口执行。
4.6 代码实现对照#
| 论文描述 | 官方代码位置 | 对照结论 |
|---|---|---|
| Qwen3-VL + MLP | model/framework/VLM4A/QwenOFT.py | Qwenvl_OFT 组合 VLM interface 与 action model。 |
| action token | QwenOFT.py::_gather_action_token_embeddings | 通过 token id 从最后一层 hidden states 中收集 action queries。 |
| 连续 action regression | model/modules/action_model/MLP_ActionHeader.py | 两个 residual MLP block,输出每步 action。 |
| L1 objective | QwenOFT.py::forward | nn.L1Loss() 对预测 chunk 与末端标签 chunk 求损失。 |
| normalization / deployment | dataloader/*、examples/*/eval_files | 统计量落盘,adapter 负责反归一化与 action 语义。 |
| 多种 action head | QwenFast.py、QwenPI.py、QwenGR00T.py | 代码提供 FAST、flow-matching 和 dual-system 可替换实现。 |
【Analysis】论文中的 StarVLA-α 是一个受控 baseline,而 GitHub 仓库是持续演进的 Lego-like 平台,包含更多 backbone、benchmark 和部署支持;不能把仓库当前全部功能都当成论文实验的一部分。
5. 实验#
5.1 Experimental Setup#
【Paper】实验覆盖五类 embodiment/场景:LIBERO 单臂仿真、SimplerEnv 的 WidowX 与 Google Robot、RoboTwin 2.0 双臂、RoboCasa-GR1 humanoid,以及真实 ARX5 RoboChallenge。比较对象包括 FAST、OpenVLA-OFT、π0、π0.5 和 GR00T-N1.6。

5.2 Main Results#
| 方法 | LIBERO avg | Simpler WidowX | Google VM | RoboTwin clean* | RoboCasa-GR1 |
|---|---|---|---|---|---|
| π0.5 | 96.9 | 46.9 | 72.7 | 82.7 | 37.0 |
| GR00T-N1.6 | 97.0 | 62.0 | 67.7 | — | 47.6 |
| StarVLA-α specialist | 98.8 | 64.6 | 76.0 | 88.2 | 53.8 |
| StarVLA-α generalist | 97.8 | 65.2 | 74.3 | 88.7 | 57.3 |
【Paper】specialist StarVLA-α 在 LIBERO 达到 98.8%,在 Google VM 达到 76.0%;generalist 在 RoboCasa-GR1 达到 57.3%,比 specialist 高 3.5 个百分点。表中 * 表示 clean 与 random 数据共同训练,— 表示论文未报告。

真实机器人上,StarVLA-α 在 ARX5 的 11 个 RoboChallenge 任务平均 success rate 为 33.6%、progress score 为 54.5;π0.5 分别为 12.7% 和 27.6%。
5.3 Ablation Study#

Action head#
| 变体 | LIBERO avg | WidowX | RoboCasa-GR1 |
|---|---|---|---|
| StarVLA-α-FAST | 97.8 | 35.6 | 45.0 |
| StarVLA-α-MLP | 98.8 | 64.6 | 53.8 |
| StarVLA-α-GR00T | 98.7 | 65.3 | 52.8 |
| StarVLA-α-π | 98.1 | 65.9 | 48.9 |
【Paper】离散 FAST 在几乎所有 benchmark 上落后;连续 MLP、flow-matching 和 dual-system 的差距则很小。论文据此认为“连续 action”比“连续 action 的具体 head”更关键。
Action-specific pretraining#
【Paper】在 RoboTwin clean 50×50 上,直接 fine-tune 为 50.3%,+OXE 降到 30.2%,+InternData-A1 为 63.6%,+RoboTwin-Rand 为 79.7%。但在 RoboCasa-GR1 上,这些预训练变体分别只有 27.8%、35.4% 和 33.3%,低于无额外预训练的 53.8%。
Data engineering#
【Paper】proprioception、历史帧、delta action、relative action 在低数据区间有时带来小幅收益;数据足够时通常接近 baseline。例如 RoboCasa 24×1000 时,baseline 53.8%,四种变体为 54.2%、52.6%、54.8%、55.5%。
5.4 Generalization#
【Paper】模型规模从 2B 增加到 4B 会显著改善 SimplerEnv,8B 相对 4B 的额外收益通常不超过 1%;在当前训练规模下,4B 是性能与成本的折中点。总 batch size 从 64 增加到 1024 时,SimplerEnv WidowX 与 RoboCasa 平均成功率总体上升,说明跨数据集训练中 batch diversity 本身就是重要变量。
【Analysis】这组结果提醒我们,所谓“模型泛化”同时受 backbone capacity、数据混合比例和优化噪声影响。若不控制 batch size,容易把训练动力学误判为 architecture gain。
6. 方法分析#
6.1 为什么有效?#
【Analysis】第一,Qwen3-VL 已经提供强视觉-语言先验,动作学习主要变成把语义 grounding 映射到连续控制空间;第二,MLP head 避免了 tokenizer、迭代采样和双系统之间的额外误差源;第三,统一数据管线减少了 benchmark-specific overfitting,使 backbone 的迁移能力真正暴露出来。
6.2 核心创新#
【Paper】创新点不是新模块,而是将“复杂设计是否必要”变成可复现实验问题:固定 backbone、数据规模和训练协议后逐项替换 action head、预训练数据与输入接口。
6.3 与已有方法的本质区别#
| 维度 | 常见 VLA 做法 | StarVLA-α |
|---|---|---|
| 目标 | 在单 benchmark 上追求最好分数 | 建立可解释的控制组并测跨 benchmark 泛化 |
| action head | FAST、diffusion、flow、dual-system 并存 | 默认连续 MLP,其他 head 作为受控对照 |
| 数据 | 大量 embodiment-specific preprocessing | raw RGB + language,最小 normalization |
| 多机器人接口 | RDT action / multi-head 等专用设计 | 统一补零到 32 维 |
| 评测 | specialist 常见 | specialist 与 all-in-one generalist 并列 |
6.4 关键假设#
- 【Paper】强 VLM 的语义和视觉表征足以支撑动作学习,不必依赖大规模 action pretraining。
- 【Paper】不同 embodiment 的 action 可以通过 padding 放入同一输出空间。
- 【Analysis】训练数据需要覆盖足够的 embodiment 和任务,否则 padding 只是在输出端制造未监督维度。
- 【Analysis】单步 MLP regression 对当前任务的动作多峰性影响有限;在接触丰富、长时域或强不确定性任务上,这个假设可能不成立。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】作者强调额外 pretraining 的收益具有域依赖性;OXE 等异域数据可能损害目标任务。论文也没有声称简单 MLP 在所有机器人、控制频率和长时域任务上都优于 diffusion/flow head。
7.2 自己分析得到的局限#
- 【Analysis】论文的“简单”依赖强大的 Qwen3-VL-4B 初始化,算力和显存门槛并不简单;小模型结论不能直接外推。
- 【Analysis】zero padding 没有显式 embodiment ID,模型只能从图像、语言和数据分布隐式推断机器人身份,数据混合不平衡时可能产生负迁移。
- 【Analysis】action chunk 仍是 benchmark-specific 配置(代码示例中可见 8、16、50 等 horizon),因此 pipeline 并未完全消除时序工程。
- 【Analysis】真实世界结果只展示有限 robot/task 组合,且部署 adapter 仍负责反归一化、gripper 索引和控制频率对齐;这些工程细节会影响可复现性。
8. 启发与研究思考#
- 【Analysis】VLA 研究应先建立强 baseline,再引入复杂 action head;如果 MLP 已经达到同等水平,复杂度的收益必须用吞吐、延迟、稳定性或 OOD 指标证明。
- 【Analysis】action pretraining 更像“域适配器”而非通用能力来源。未来可按 embodiment/task 相似度选择性混合数据,而不是默认扩大数据规模。
- 【Analysis】all-in-one 评测值得成为标准:同一 checkpoint 不经 benchmark-specific fine-tuning,才能测出真正的跨 embodiment 能力。
- 【Analysis】batch size、数据混合和模型初始化应当进入 VLA 论文的标准 ablation,否则 architecture comparison 仍然会被训练动力学混淆。
- 【Analysis】一个自然的后续方向是保留 StarVLA-α 的统一接口,同时让模型按任务不确定性动态选择 MLP、flow-matching 或更长 horizon 的 action decoder。