

InternVLA-A1 论文精读:把理解、想象与动作统一起来
精读 InternVLA-A1:用 Mixture-of-Transformers 统一场景理解、视觉前瞻与 Flow Matching 动作,在动态双臂操作中提升泛化。
InternVLA-A1 用三个 Transformer 专家把语义理解、未来视觉状态预测和 Flow Matching 动作生成放进同一条信息流,并用仿真、真实机器人与人类视频的混合数据提升动态操作泛化。
1. 论文概述#
论文名称:《InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation》
作者:InternVLA-A1 Team(第一作者 Junhao Cai、Zetao Cai 等)
机构:上海人工智能实验室等
年份:2026(arXiv:2601.02456)
论文链接:arXiv ↗
代码:InternVLA-A1 ↗
项目主页:InternVLA-A1 ↗

一句话总结#
【Paper】 传统 VLA 擅长“看懂并执行”,却不擅长推断动作会如何改变世界;视频世界模型能预测变化,却容易缺少语义锚点。InternVLA-A1 以 Mixture-of-Transformers(MoT)把 Understanding、Generation 和 Action 三个专家接成统一模型,让语义上下文与未来视觉动态共同决定动作。
核心贡献#
【Paper】
- 用统一的 masked self-attention 串联三个专家:Understanding Expert 编码多视角图像和语言,Generation Expert 预测未来视觉状态,Action Expert 以 Flow Matching 生成动作 chunk。
- 采用轻量、非自回归的 Generation Expert:三视角、两个时间点共 6 张图像先经 COSMOS VAE,再压缩为 96 个 token,一次前向预测未来帧,目标运行频率约 13 Hz。
- 设计混合预训练配方:InternData-A1、RoboTwin 仿真数据,AgiBot-World、RoboMind 真实机器人数据,以及 EgoDex 人类第一视角视频,共约 692M 帧。
- 在 10 个静态、2 个动态真实任务和 RoboTwin 2.0 上验证。3B 模型静态任务平均成功率 75.1%,动态任务平均 86.7%,RoboTwin Easy/Hard 为 89.4%/89.6%。
2. 背景与相关工作#
【Paper】 以 、 和 GR00T 为代表的 VLA 通常从 MLLM 的视觉—语言特征直接回归动作。文本 token 对物理规律、接触和惯性的表达并不自然,因此策略多是反应式的:看到当前画面后立刻选动作,却很少显式考虑“执行后场景会变成什么”。在传送带分拣、运动中取食材等任务中,这种缺少 foresight 的策略容易错过时机。
另一条路线是 World Model:根据当前观察和动作预测未来视频,再据此规划。它能表达动态,但预测误差会逐步累积,而且视频生成模型未必理解“哪个物体与指令相关”。InternVLA-A1 的出发点是让语义和动力学共享上下文,而不是把两个独立模型串联。
【Analysis】 论文的关键取舍是:未来图像不需要达到可供人欣赏的像素级保真度,只要 latent 中保留足够的运动趋势和接触线索,就能为动作专家提供有用的条件,同时保持控制频率。
3. 问题定义#
【Paper】 将机器人操作建模为从多视角观察 、语言指令 、本体状态 到动作 chunk 的策略学习问题。输入包括头部相机和左右腕部相机图像、历史帧、语言以及关节/末端执行器状态;输出是连续动作序列。模型还要预测时间间隔 后的视觉状态,以学习局部动力学。
| 项目 | 论文设定 |
|---|---|
| Robot / Embodiment | Agibot Genie-1、ARX Lift-2、ARX AC One,均为双臂平台 |
| Observation | 头部 + 左右腕部多视角图像,当前与 历史帧,本体状态 |
| Action | 连续动作 chunk,使用 Flow Matching 从噪声积分到目标动作 |
| Horizon | 未来视觉间隔 ;动作 chunk 长度由配置 chunk_size 决定 |
| 数据 | 396M InternData-A1、17M RoboTwin、206M AgiBot-World、5M RoboMind、68M EgoDex 帧 |
| 评测 | 10 个静态真实任务、Express Sorting、In-motion Ingredient Picking、RoboTwin 2.0 |
4. 方法#
4.1 Overall Architecture#

【Paper】 信息按 Understanding → Generation → Action 的方向流动:理解专家产生语义上下文,生成专家基于上下文和历史图像预测未来视觉 latent,动作专家再结合本体状态输出动作。三个 token 流通过 blockwise masked self-attention 连接,后面的 block 可以看见前面的 block,前面的 block 不能反向读取后面的输出。
4.2 核心模块#
Understanding Expert#
- 输入:多视角图像 与语言指令 。
- 处理:2B 版本采用 InternVL3-1B,3B 版本采用 Qwen3-VL-2B;视觉编码器将图像变成视觉 token,文本 tokenizer 产生语言 token。
- 输出:语义上下文 ,作为后两个专家的共享 KV 上下文。
- 作用:把“要做什么”和“场景中有什么”对齐,给动态预测和动作生成提供任务相关语义。
Generation Expert#

- 输入:头部、左腕、右腕三个视角在 和 的 6 张 图像。
- Tokenization:COSMOS CI8×8 VAE 把每张图像编码为 latent grid(1024 token)。
- 压缩: 卷积把每张图压到 (16 token),6 张图总计 96 token,再投影到 Transformer hidden size。
- 上下文交互:Generation token 可双向注意自身,并通过统一注意力读取 Understanding token;实现上使用前一专家的 KV cache。
- 输出:沿时间轴平均池化 96 token 得到 48 token,经上采样和 COSMOS VAE decoder 并行重建 的三视角图像。
- 为什么需要:用一个前向 pass 获得粗粒度未来状态,避免自回归视频生成的高延迟;论文 Figure 10 显示虽然细节被牺牲,但主要运动趋势仍被保留。
Action Expert#
- 输入:、、本体状态 ,以及 Flow Matching 中的带噪动作 和时间 。
- 结构:由 Qwen2.5(2B 版本)或 Qwen3(3B 版本)的 Transformer block 构成,前接状态投影和动作/时间嵌入,后接线性 action head。
- 输出:动作 chunk 的速度场 ;推理时通过 ODE 积分得到连续动作。
- 注意力:Action block 的 state token 只能看自己和前面 block;action token 可看 state token、前序 block 及同一 action block 的 token。
4.3 关键公式#
视觉前瞻损失#
设 COSMOS VAE 编码器为 ,,生成专家为 :
; 表示 stop-gradient。该项让模型在 latent 空间学习“当前状态向未来如何演化”,而不是只记住静态外观。
Flow Matching 动作损失#
从高斯噪声 和示教动作 chunk 构造:
动作专家学习把噪声搬运到示教动作的速度场:
其中 。总目标为:
4.4 Training#
【Paper】 训练分为预训练和任务后训练两阶段,但两阶段使用相同的视觉前瞻 + 动作联合目标。预训练混合三类数据;后训练针对目标任务降低学习率。预训练 700K steps、batch size 512、AdamW、 恒定学习率;后训练 60K steps、batch size 128,学习率从 衰减到 ,warmup 2000 steps,均使用 bfloat16 和 1.0 梯度裁剪。
【Paper】 训练数据的采样权重为 InternData-A1 0.64、RoboTwin 0.08、AgiBot-World 0.18、RoboMind 0.02、EgoDex 0.08。作者还提出 Load-balanced Parallel Training(LPT):按数据集规模降序,将下一个数据集分配给当前负载最小的 worker;数据集少于 worker 时允许受控复制,以减少 I/O 竞争和隐式重加权。
【Code】 官方 A1 分支通过 launch/internvla_a1_3b_pretrain.sh 和 launch/internvla_a1_3b_finetune.sh 进入 LeRobot 训练入口;策略实现位于 src/lerobot/policies/InternVLA_A1_3B/modeling_internvla_a1.py。代码冻结 COSMOS tokenizer 参数,可按配置冻结视觉编码器或仅训练专家;默认以 bfloat16 运行,并支持 gradient checkpointing 与 torch.compile。
- 用 MLLM 视觉编码器和文本 tokenizer 得到理解 token,并计算 hund。
- 用 COSMOS VAE 编码历史/当前/未来图像;对输入 latent 下采样后送入 Generation Expert。
- 用 masked self-attention 融合三个专家的 token,得到未来 latent 表示和动作专家输出。
- 计算 Lgen 与 Flow Matching 的 Lact,按 λ 加权后反向传播。
4.5 Inference#
【Code】 推理时先缓存 Understanding Expert 的 KV,再处理当前/历史图像的 Generation Expert 输出;随后从高斯噪声开始,以固定步数 Euler ODE 反向积分动作速度场。视觉未来帧只在需要可视化时解码,低延迟部署可跳过 COSMOS decoder。
- 编码语言和图像,运行 Understanding Expert 并缓存其 KV。
- 编码 t−15 与 t 的三视角图像,运行 Generation Expert 得到未来上下文。
- 采样 x₁~N(0,I),对 τ 从 1 积分到 0:x←x+Δτ·vθ(qₜ,x;hund,hgen)。
- 将最终 x 的前若干动作发送给机器人,下一控制周期重新观察并闭环执行。
4.6 代码实现对照#
| 论文概念 | 官方代码位置 / 行为 |
|---|---|
| 三专家 MoT | Qwen3VLWithExpertModel 将 Understanding、Generation、Action 三个 Transformer 的同层 Q/K/V 拼接后统一注意力计算 |
| Understanding 输入 | embed_prefix 调用 Qwen3-VL vision encoder,并将 image token 替换为视觉 embedding |
| Generation token 压缩 | get_cosmos_features → cosmos_in_proj → downsample_conv;embed_middle 展平为中间 token |
| 未来图像解码 | decode_cosmos 做时间平均、upsample_conv 和线性投影;COSMOS tokenizer 全程冻结 |
| Flow Matching | forward 用噪声与动作插值构造 x_t,监督速度 u_t=noise-actions;sample_actions 用 Euler 步进 |
| 注意力 mask | make_att_2d_masks 以累计 segment mask 实现 prefix → middle → suffix 的信息流 |
| 工程优化 | 配置支持 gradient_checkpointing、compile_model,并可冻结视觉编码器或只训练专家 |
5. 实验#
5.1 Experimental Setup#
【Paper】 真实评测覆盖 Genie-1、ARX Lift-2 和 ARX AC One。静态任务包括 Zip Bag、Unscrew Cap、Make Sandwich、Operate Oven、Sort Parts、Sort Rubbish、Sweep Trash、Wipe Stain、Place Markpen、Place Flower;动态任务为 Express Sorting 和 In-motion Ingredient Picking。每个任务在 30 个预定义设置上各执行一次。

RoboTwin 2.0 覆盖 50 个双臂任务,Easy 使用干净场景,Hard 使用域随机化;微调共 27,500 条示范,评估结果平均 100 次试验。
5.2 Main Results#
【Paper】 静态任务平均成功率如下:
| 方法 | 平均成功率 |
|---|---|
| GR00T N1.5 | 33.0% |
| π₀ (3.3B) | 60.6% |
| π₀.₅ | 70.7% |
| InternVLA-A1 (2B) | 64.7% |
| InternVLA-A1 (3B) | 75.1% |
3B 模型在 Make Sandwich 达到 93.3%,Operate Oven 86.7%,Zip Bag 73.3%。它比 π₀.₅ 的静态平均值高 4.4%,说明视觉前瞻不仅改善高层任务选择,也能帮助接触丰富的低层控制。
动态任务结果更能体现方法动机:
| 方法 | Express Sorting | In-motion Ingredient Picking | 平均 |
|---|---|---|---|
| GR00T N1.5 | 40.0% | 20.0% | 30.0% |
| π₀ | 36.7% | 20.0% | 28.4% |
| π₀.₅ | 53.3% | 66.7% | 60.0% |
| InternVLA-A1 (2B) | 70.0% | 20.0% | 45.0% |
| InternVLA-A1 (3B) | 80.0% | 93.3% | 86.7% |
RoboTwin 2.0 上,InternVLA-A1 (3B) 的 Easy/Hard 平均成功率为 89.4%/89.6%,分别比 π₀.₅ 高 2.6 个百分点。
5.3 Ablation Study#

【Paper】 去掉预训练后,12 个真实任务平均成功率从 77.0% 降到 25.4%,下降 51.6 个百分点。仅仿真数据在 RoboTwin 上已达 88.3%/88.5%,但真实 Place Flower 只有 53.3%、Sort Parts 只有 33.3%;加入人类视频后,Sort Parts 升至 40.0%;再加入真实机器人数据,Place Flower/Sort Parts 达到 60.0%/53.3%。

去掉 Generation Expert 后平均成功率由 77.0% 降到 57.6%,12 个任务中有 11 个变差,动态任务降幅尤其明显。这直接支持“预测未来状态是动作生成的有效条件”这一设计。
5.4 Generalization#
【Paper】 三种数据源承担互补角色:仿真提供大规模场景和轨迹多样性,真实机器人数据提供接触动力学与 sim-to-real 锚点,人类视频提供手—物交互和第一视角运动先验。三者联合训练在仿真和真实任务上同时最好,而不是只优化某一个 benchmark。
【Analysis】 动态任务的提升(相对 π₀.₅ 平均 +26.7 个百分点)比静态任务更大,说明 Generation Expert 学到的不是单纯的物体识别,而是与时间相关的决策线索,例如传送带速度、目标即将出现的位置和双臂协同的时机。
6. 方法分析#
6.1 为什么有效?#
【Analysis】 反应式 VLA 只需拟合 ;InternVLA-A1 先构造一个近似的 ,再让动作专家读取这个动态表征。即使未来图像不够清晰,latent 中的运动方向也能把动作从“看到再追”变成“预测后拦截”。同时,三个专家共享 attention 层,避免独立 world model 与 policy 之间的表示错位。
6.2 核心创新#
- 架构创新:MoT 不是简单并排堆模型,而是用累积 attention mask 明确信息流,让理解、生成、动作在同一 Transformer 深度内交互。
- 效率创新:Generation Expert 采用 VAE token 压缩、时间平均池化和并行解码,避免昂贵的自回归视频生成。
- 训练创新:同一个联合目标同时接纳有动作标签的机器人轨迹和只有视频标签的人类数据,扩大可用数据范围。
- 工程创新:官方实现提供 KV cache、gradient checkpointing、torch.compile 和 action-only 后端,能把 3B 模型推到约 13 Hz。
6.3 与已有方法的本质区别#
| 路线 | 语义理解 | 动态预测 | 动作生成 | 主要问题 |
|---|---|---|---|---|
| 传统 VLA | 强 | 隐式 | 直接/Flow Matching | 对快速变化场景缺少 foresight |
| 视频策略 + 独立动作头 | 中等 | 强 | 独立模块 | 多阶段训练、模块接口脆弱 |
| 独立 World Model + Planner | 取决于模型 | 强 | 规划器 | 误差累积、语义和控制分离 |
| InternVLA-A1 | MLLM | Generation Expert | Action Expert | 统一训练,仍需更强语义与更高保真预测 |
6.4 关键假设#
- 与 的短时间窗口足以提供当前任务所需的局部动力学线索。
- 低频、低保真的未来图像 latent 对动作比像素级重建更重要。
- 仿真、真实机器人和人类视频的视觉/运动先验可以在共享表示中互补,而不会产生不可控的负迁移。
- Flow Matching 能以有限 Euler 步数覆盖示教动作的多模态分布。
7. 局限性#
7.1 作者明确提出的局限#
【Paper】
- Understanding Expert 没有与大规模多模态 VQA 数据联合训练,因此复杂语义推理和长指令跟随能力仍有限。
- 为满足实时推理,Generation Expert 牺牲了图像预测的高频细节,未来帧的像素级保真度不足。
7.2 自己分析得到的局限#
【Analysis】
- 预测间隔固定为 15 帧,面对不同速度的传送带或长时延接触,单一时间尺度可能不够;多尺度 foresight 尚未验证。
- 论文主要报告成功率,缺少控制频率、ODE 步数、视觉解码开关对能耗和端到端延迟的完整消融,因此“13 Hz”不等于所有机器人部署条件下都能达到 13 Hz。
- 混合数据的采样权重由经验设定,数据集之间的动作空间和相机分布差异可能导致隐性偏置;LPT 解决负载问题,但不自动解决语义/动力学域偏移。
- 未来视觉预测目前作为动作条件使用,论文没有证明生成图像本身能支持可解释的显式规划或失败恢复。
8. 启发与研究思考#
- 把“想象”做成可训练的中间监督:未来状态预测不必追求视频生成的观感,只需保留会改变动作选择的因素,这为低延迟 world model 提供了实际目标。
- 统一架构的价值在接口而非参数共享:MoT 的关键是 attention mask 定义了语义→动态→动作的因果接口;未来可以把触觉、力矩或语言计划作为新的 block 插入同一信息流。
- 数据互补应与任务难度对齐:仿真扩大覆盖面,真实数据校准接触,人类视频补充运动先验。对动态任务,后两者可能比继续增加静态仿真轨迹更有价值。
- 下一步可研究自适应时间尺度:让模型同时预测短期和长期 latent,并让动作专家按不确定性选择观察/规划频率,可能比固定 15 帧更适合跨平台部署。
- 评测应加入预测质量与控制质量的因果联系:除了成功率,还应报告未来 latent 的校准度、动作对预测误差的敏感性,以及关闭 foresight 后的能耗和延迟变化。