Hana's Blog
StarVLA-α 论文精读Blur image
Arxiv ID 2604.11757
幻觉翻译 2604.11757
publication pending

一个强 VLM 加轻量 MLP action head,就足以在四个 benchmark 和真实机器人上形成强竞争力的通用 VLA 基线。

推荐指数:

1. 论文概述#

一句话总结#

【Paper】StarVLA-α 不追求新的 action architecture,而是固定强大的 Qwen3-VL backbone,使用最小化的数据处理、连续 action regression 和跨 benchmark 的统一训练,回答“VLA 中哪些复杂设计真的必要”。

StarVLA-α overview from paper Figure 1

核心贡献#

  • 【Paper】提出一个由 Qwen3-VL 和轻量 MLP action head 组成的简单 baseline,在 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 四个 benchmark 上统一评测。
  • 【Paper】在控制 backbone、数据和训练协议后,比较 FAST 离散 token、MLP regression、flow-matching 以及 GR00T 式双系统 action head,发现连续 action 很重要,但连续 head 之间差距有限。
  • 【Paper】重新评估 OXE、InternData-A1、RoboTwin-Rand 等 action-specific pretraining,说明预训练收益依赖目标 embodiment 和数据域,OOD 数据甚至会伤害性能。
  • 【Paper】提出 all-in-one generalist 评估:单个模型联合训练四类 benchmark,使用 32 维 zero padding 统一 action interface;RoboCasa-GR1 平均成功率达到 57.3%。
  • 【Paper】在 ARX5 的 RoboChallenge 真实世界评测中达到 33.6% success rate、54.5 progress score,分别高于 π0.5 的 12.7% 和 27.6%。

2. 背景与相关工作#

【Paper】当前 VLA 结果难以直接比较,原因不是单一模型结构,而是整条 pipeline 同时变化:vision tower、language backbone、action tokenizer、action chunk、proprioception、历史帧、动作坐标系、预训练数据和 benchmark-specific evaluation 往往一起变化。这样一来,论文报告的提升可能来自数据清洗或评测工程,而不是模型本身。

【Analysis】StarVLA-α 的价值更接近“实验控制组”而非传统意义上的新架构。它把问题拆成三个可检验的轴:action head 是否需要复杂化、action-specific pretraining 是否普适、数据工程是否在强 VLM 上仍然必要。

3. 问题定义#

给定多视角 RGB 观测 II 和语言指令 ll,模型需要输出长度为 HH 的连续动作块:

A^={a^1,,a^H},a^tRD.\hat{A}=\{\hat{a}_1,\ldots,\hat{a}_H\},\qquad \hat{a}_t\in\mathbb{R}^{D}.

其中 HH 是 action horizon,DD 是 embodiment 的 action dimension。单 benchmark 训练时,DD 可为 7、14、29 等;all-in-one 训练时,论文将不同机器人的动作向量补零到 Dmax=32D_{max}=32。输入默认只有 RGB 和语言,state、历史帧、delta/relative action 都作为可控 ablation,而不是默认输入。

4. 方法#

4.1 Overall Architecture#

StarVLA-α architecture from paper Figure 2

【Paper】统一流程是 RGB + instruction → Qwen3-VL → action-token hidden states → MLP → continuous action chunk;benchmark-specific 部分只保留薄适配器,用于 observation、action interface 和 evaluator 的格式转换。

4.2 核心模块#

Qwen3-VL backbone#

【Paper】Qwen3-VL 原生接收图像和文本,不需要额外拼接 CLIP/SigLIP 等视觉塔。它输出融合后的 token hidden states,承担视觉理解、指令 grounding 和跨任务表征。

Action token 与 MLP head#

【Paper】在指令末尾追加 HH 个 action token,每个 token 对应一个未来时间步。第 tt 个 token 的 hidden state hth_t 输入共享的 MLPResNet,直接回归 DD 维连续动作。

【Code】官方 starVLA/model/framework/VLM4A/QwenOFT.py 使用特殊字符 🔍 作为 action token,在 prompt 中构造 “Please predict the next H robot actions” 后,从 Qwen 输出的最后 hidden state 中收集这些 token 的 embedding。MLP_ActionHeader.py 的 head 是 LayerNorm → Linear → ReLU → 2 个 residual MLP block → LayerNorm → Linear,对每个 chunk step 独立映射到 action vector。

Minimal data pipeline#

【Paper】训练 split 上计算 action 的均值和标准差,并做 zero-mean、unit-variance normalization;评测遵循各 benchmark 官方 protocol。默认不加入 proprioception、历史帧或复杂 action transform。

【Code】代码仓库的通用 LeRobot dataloader 会保存 dataset_statistics.json,推理接口返回 normalized_actions;具体 robot 的反归一化和 gripper 语义由 benchmark/robot adapter 负责。

Cross-embodiment padding#

【Paper】all-in-one 模型把低维 action 右侧补零到 32 维,再用同一个 action head 预测。论文比较了 RDT action 和 multi-action head,说明简单 padding 在多个 benchmark 上不逊色,且在 Google Robot VM 和 RoboCasa-GR1 上分别提升 2.9 和 4.8 个百分点。

4.3 关键公式#

VLM 的融合表示写作:

H=VLMϕ(I,l,τ1:Ha),H=\operatorname{VLM}_{\phi}(I,l,\tau_{1:H_a}),

其中 τ1:Ha\tau_{1:H_a} 是追加的 action tokens,HH(此处为矩阵)包含每个 token 的 hidden state。取出对应位置后:

a^t=fθ(ht),t=1,,Ha,\hat{a}_t=f_{\theta}(h_t),\qquad t=1,\ldots,H_a,

其中 HaH_a 是 action horizon,fθf_\theta 是共享参数的 MLP action head,输出维度为 DD

训练目标是逐元素 L1 regression:

LL1=1HaDt=1Haj=1Da^t,jat,j.\mathcal{L}_{\mathrm{L1}}=\frac{1}{H_aD}\sum_{t=1}^{H_a}\sum_{j=1}^{D}\left|\hat{a}_{t,j}-a_{t,j}\right|.

【Analysis】L1 目标与 diffusion/flow-matching 相比没有采样过程或噪声时间变量,优化和推理路径都更短;代价是它不能显式表示同一观测下的多峰动作分布。

对于多 embodiment 的统一接口:

a~t=[at(1:D),0,,0]R32.\tilde{a}_t=[a_t^{(1:D)},0,\ldots,0]\in\mathbb{R}^{32}.

【Paper】该式不是新的 action representation,而是把异构维度的接口复杂度下沉到 padding;模型依靠视觉、语言和训练分布学习哪些维度有效。

4.4 Training#

【Paper】specialist 训练分别使用每个 benchmark 的训练集;generalist 训练将 LIBERO、SimplerEnv、RoboTwin 2.0 和 RoboCasa-GR1 合并。all-in-one 实验使用 learning rate 1×1041\times10^{-4}、batch size 256,并将 action 维度补到 32。

【Code】训练入口是 starVLA/training/train_starvla.py,采用 PyTorch + Accelerate + DeepSpeed,优化器为 AdamW,模型 forward 返回 action_loss。QwenOFT 的 forward 取 action chunk 的最后 HaH_a 个标签并计算 L1 loss;配置文件决定 action dimension、horizon、batch size 和冻结模块。

Algorithm 1 StarVLA-α 训练
输入:
多视角 RGB、语言指令、归一化动作块与训练配置
输出:
训练后的 Qwen3-VL + MLP Policy
  1. 从训练 split 统计 action mean/std,并归一化每个 action chunk。
  2. 在指令末尾追加 H 个 action tokens,构造 Qwen3-VL 的多模态输入。
  3. 前向运行 VLM,收集 action token 的 hidden states。
  4. 用共享 MLP head 逐步回归连续动作,并计算 L1 loss。
  5. 通过 AdamW 更新 VLM 与 action head(按配置可冻结部分 backbone)。

4.5 Inference#

【Code】Qwenvl_OFT.predict_actiontorch.inference_mode() 下处理输入,按训练分辨率 resize 图像,追加相同的 action prompt,读取 action-token hidden states 后一次性输出 [B,H_a,D]normalized_actions。部署 adapter 再按 robot 的统计量反归一化,并按 action chunk 的步长执行。

【Paper】论文没有把推理写成额外的 sampling algorithm;MLP variant 是单次 forward,π/GR00T/FAST 变体则由各自 action head 的实现决定。

Algorithm 2 StarVLA-α 推理
输入:
当前 RGB 观测、语言指令与 robot adapter
输出:
可执行的连续动作块
  1. 将图像调整为训练分辨率,并拼接 action-token prompt。
  2. 运行 Qwen3-VL,定位并提取 H 个 action-token hidden states。
  3. 用 MLP action head 回归归一化动作块。
  4. 使用 dataset statistics 反归一化,交给 benchmark 或真实机器人接口执行。

4.6 代码实现对照#

论文描述官方代码位置对照结论
Qwen3-VL + MLPmodel/framework/VLM4A/QwenOFT.pyQwenvl_OFT 组合 VLM interface 与 action model。
action tokenQwenOFT.py::_gather_action_token_embeddings通过 token id 从最后一层 hidden states 中收集 action queries。
连续 action regressionmodel/modules/action_model/MLP_ActionHeader.py两个 residual MLP block,输出每步 action。
L1 objectiveQwenOFT.py::forwardnn.L1Loss() 对预测 chunk 与末端标签 chunk 求损失。
normalization / deploymentdataloader/*examples/*/eval_files统计量落盘,adapter 负责反归一化与 action 语义。
多种 action headQwenFast.pyQwenPI.pyQwenGR00T.py代码提供 FAST、flow-matching 和 dual-system 可替换实现。

【Analysis】论文中的 StarVLA-α 是一个受控 baseline,而 GitHub 仓库是持续演进的 Lego-like 平台,包含更多 backbone、benchmark 和部署支持;不能把仓库当前全部功能都当成论文实验的一部分。

5. 实验#

5.1 Experimental Setup#

【Paper】实验覆盖五类 embodiment/场景:LIBERO 单臂仿真、SimplerEnv 的 WidowX 与 Google Robot、RoboTwin 2.0 双臂、RoboCasa-GR1 humanoid,以及真实 ARX5 RoboChallenge。比较对象包括 FAST、OpenVLA-OFT、π0、π0.5 和 GR00T-N1.6。

Action-head comparison from paper Figure 3

5.2 Main Results#

方法LIBERO avgSimpler WidowXGoogle VMRoboTwin clean*RoboCasa-GR1
π0.596.946.972.782.737.0
GR00T-N1.697.062.067.747.6
StarVLA-α specialist98.864.676.088.253.8
StarVLA-α generalist97.865.274.388.757.3

【Paper】specialist StarVLA-α 在 LIBERO 达到 98.8%,在 Google VM 达到 76.0%;generalist 在 RoboCasa-GR1 达到 57.3%,比 specialist 高 3.5 个百分点。表中 * 表示 clean 与 random 数据共同训练, 表示论文未报告。

Scaling and batch-size results from paper Figure 5

真实机器人上,StarVLA-α 在 ARX5 的 11 个 RoboChallenge 任务平均 success rate 为 33.6%、progress score 为 54.5;π0.5 分别为 12.7% 和 27.6%。

5.3 Ablation Study#

Action parameterization comparison from paper Figure 4

Action head#

变体LIBERO avgWidowXRoboCasa-GR1
StarVLA-α-FAST97.835.645.0
StarVLA-α-MLP98.864.653.8
StarVLA-α-GR00T98.765.352.8
StarVLA-α-π98.165.948.9

【Paper】离散 FAST 在几乎所有 benchmark 上落后;连续 MLP、flow-matching 和 dual-system 的差距则很小。论文据此认为“连续 action”比“连续 action 的具体 head”更关键。

Action-specific pretraining#

【Paper】在 RoboTwin clean 50×50 上,直接 fine-tune 为 50.3%,+OXE 降到 30.2%,+InternData-A1 为 63.6%,+RoboTwin-Rand 为 79.7%。但在 RoboCasa-GR1 上,这些预训练变体分别只有 27.8%、35.4% 和 33.3%,低于无额外预训练的 53.8%。

Data engineering#

【Paper】proprioception、历史帧、delta action、relative action 在低数据区间有时带来小幅收益;数据足够时通常接近 baseline。例如 RoboCasa 24×1000 时,baseline 53.8%,四种变体为 54.2%、52.6%、54.8%、55.5%。

5.4 Generalization#

【Paper】模型规模从 2B 增加到 4B 会显著改善 SimplerEnv,8B 相对 4B 的额外收益通常不超过 1%;在当前训练规模下,4B 是性能与成本的折中点。总 batch size 从 64 增加到 1024 时,SimplerEnv WidowX 与 RoboCasa 平均成功率总体上升,说明跨数据集训练中 batch diversity 本身就是重要变量。

【Analysis】这组结果提醒我们,所谓“模型泛化”同时受 backbone capacity、数据混合比例和优化噪声影响。若不控制 batch size,容易把训练动力学误判为 architecture gain。

6. 方法分析#

6.1 为什么有效?#

【Analysis】第一,Qwen3-VL 已经提供强视觉-语言先验,动作学习主要变成把语义 grounding 映射到连续控制空间;第二,MLP head 避免了 tokenizer、迭代采样和双系统之间的额外误差源;第三,统一数据管线减少了 benchmark-specific overfitting,使 backbone 的迁移能力真正暴露出来。

6.2 核心创新#

【Paper】创新点不是新模块,而是将“复杂设计是否必要”变成可复现实验问题:固定 backbone、数据规模和训练协议后逐项替换 action head、预训练数据与输入接口。

6.3 与已有方法的本质区别#

维度常见 VLA 做法StarVLA-α
目标在单 benchmark 上追求最好分数建立可解释的控制组并测跨 benchmark 泛化
action headFAST、diffusion、flow、dual-system 并存默认连续 MLP,其他 head 作为受控对照
数据大量 embodiment-specific preprocessingraw RGB + language,最小 normalization
多机器人接口RDT action / multi-head 等专用设计统一补零到 32 维
评测specialist 常见specialist 与 all-in-one generalist 并列

6.4 关键假设#

  • 【Paper】强 VLM 的语义和视觉表征足以支撑动作学习,不必依赖大规模 action pretraining。
  • 【Paper】不同 embodiment 的 action 可以通过 padding 放入同一输出空间。
  • 【Analysis】训练数据需要覆盖足够的 embodiment 和任务,否则 padding 只是在输出端制造未监督维度。
  • 【Analysis】单步 MLP regression 对当前任务的动作多峰性影响有限;在接触丰富、长时域或强不确定性任务上,这个假设可能不成立。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】作者强调额外 pretraining 的收益具有域依赖性;OXE 等异域数据可能损害目标任务。论文也没有声称简单 MLP 在所有机器人、控制频率和长时域任务上都优于 diffusion/flow head。

7.2 自己分析得到的局限#

  • 【Analysis】论文的“简单”依赖强大的 Qwen3-VL-4B 初始化,算力和显存门槛并不简单;小模型结论不能直接外推。
  • 【Analysis】zero padding 没有显式 embodiment ID,模型只能从图像、语言和数据分布隐式推断机器人身份,数据混合不平衡时可能产生负迁移。
  • 【Analysis】action chunk 仍是 benchmark-specific 配置(代码示例中可见 8、16、50 等 horizon),因此 pipeline 并未完全消除时序工程。
  • 【Analysis】真实世界结果只展示有限 robot/task 组合,且部署 adapter 仍负责反归一化、gripper 索引和控制频率对齐;这些工程细节会影响可复现性。

8. 启发与研究思考#

  1. 【Analysis】VLA 研究应先建立强 baseline,再引入复杂 action head;如果 MLP 已经达到同等水平,复杂度的收益必须用吞吐、延迟、稳定性或 OOD 指标证明。
  2. 【Analysis】action pretraining 更像“域适配器”而非通用能力来源。未来可按 embodiment/task 相似度选择性混合数据,而不是默认扩大数据规模。
  3. 【Analysis】all-in-one 评测值得成为标准:同一 checkpoint 不经 benchmark-specific fine-tuning,才能测出真正的跨 embodiment 能力。
  4. 【Analysis】batch size、数据混合和模型初始化应当进入 VLA 论文的标准 ablation,否则 architecture comparison 仍然会被训练动力学混淆。
  5. 【Analysis】一个自然的后续方向是保留 StarVLA-α 的统一接口,同时让模型按任务不确定性动态选择 MLP、flow-matching 或更长 horizon 的 action decoder。
StarVLA-α 论文精读
https://agusexp25.top/en/blog/paper-deep-dive-starvla-alpha
Author 菊花花
Published at August 26, 2026