Hana's Blog
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台Blur image
Arxiv ID 2508.05635
幻觉翻译 2508.05635
publication pending

Genie Envisioner 用多视角视频世界模型 GE-Base 统一支撑动作策略 GE-Act、动作条件模拟器 GE-Sim 与 EWMBench 评测,试图把机器人学习从“训练一次、现实测试一次”变成可预测、可模拟、可评估的闭环。

推荐指数:
Website

1. 论文概述#

【Paper】 Genie Envisioner(简称 GE)不是一个单独的 VLA policy,而是一个由四部分组成的平台:

  • GE-Base:instruction-conditioned、多视角、autoregressive video diffusion world model;
  • GE-Act:从 GE-Base 的视觉 latent 直接解码 action trajectory 的轻量 action model;
  • GE-Sim:把 GE-Base 改造成 action-conditioned 的视频神经模拟器;
  • EWMBench:面向 embodied world model 的视觉、运动和语言-动作一致性评测套件。

Genie Envisioner 平台总览(论文 Figure 1)

一句话总结#

【Analysis】 GE 的真正野心不是“用视频生成替代 VLA”,而是先学习一个能预测机器人未来视觉状态的 embodied visual space,再让动作解码和策略评测共享这个空间:GE-Act 负责从 latent 到动作,GE-Sim 负责从动作回到未来视频。

核心贡献#

【Paper】

  1. 在约 1,000,000 个 AgiBot-World-Beta 双臂 manipulation episodes(约 2,967 小时)上训练多视角、语言条件视频世界模型 GE-Base。
  2. 用 160M 参数的 parallel action decoder GE-Act,把 GE-Base 的时空表示映射为 54-step action chunk,并通过 Slow-Fast Asynchronous Inference 在 RTX 4090 上约 200 ms 完成一次前向。
  3. 用 GE-Sim 将视频生成模型改造成 action-conditioned neural simulator,支持闭环 policy rollout 和大规模、低成本的策略比较。
  4. 提出 EWMBench,以 scene consistency、action trajectory quality、motion semantics 等指标评估 embodied video model,而不是只依赖 FVD、CLIP 或人类偏好。

【Code】 官方仓库已经公开训练、推理和示例入口,并提供 GE-Base slow/fast 权重说明、LeRobot 数据接口、GE-Act server 和 GE-Sim Cosmos2 推理脚本;论文中“将公开”的内容在当前仓库中已部分落地。

2. 背景与相关工作#

【Paper】 传统机器人系统通常把数据采集、policy training、仿真和评测拆成多个工程栈。真实机器人评测可靠但昂贵,物理模拟器高效却需要手工建模,VLA 则通常直接做 observation-to-action 的行为克隆。这种 patchwork 带来三个问题:失败模式难以定位,策略迭代速度受真实执行限制,训练和评测之间缺少共享的内部状态。

主流 VLA 往往借助 VLM 把图像映射到语言中心的 semantic space,再预测动作。【Analysis】 GE 选择的是相反的归纳偏置:把未来的空间布局、机械臂姿态、接触过程和任务语义压进 vision-centric generative space;语言用于控制生成方向,而不是成为唯一的中间表示。

与一般 text-to-video world model 相比,机器人 manipulation 还要求:

  • 相机视角和背景不能随时间漂移;
  • robot morphology、物体位置和接触关系要保持物理上合理;
  • 高层 instruction 必须落到可执行的时间序列动作;
  • 模型还要能接受 action 作为条件,完成闭环 rollout。

3. 问题定义#

【Paper】 对第 tt 个视频 chunk,GE-Base 的目标是给定初始观察、语言指令和稀疏历史记忆,预测未来 NN 帧:

x1:N(t)=W(x^0:t1, x0, q).\mathbf{x}_{1:N}^{(t)} = \mathcal{W}(\hat{\mathbf{x}}_{0:t-1},\ \mathbf{x}_0,\ q).

其中:

  • x0\mathbf{x}_0:初始多视角观察;
  • x^0:t1\hat{\mathbf{x}}_{0:t-1}:从历史 chunk 稀疏采样的 memory frames;
  • qq:自然语言 instruction;
  • W\mathcal{W}:GE-Base world model;
  • x1:N(t)\mathbf{x}_{1:N}^{(t)}:下一个多视角视频 chunk。

GE-Act 则学习从视觉 latent 和 instruction 到动作 chunk 的映射。论文以双臂末端执行器的 14 维控制为例(每臂 [x,y,z,roll,pitch,yaw,o][x,y,z,roll,pitch,yaw,o]),而官方 LeRobot 配置将 action expert 的输入通道设为 14、chunk 长度设为 54,并允许 joint action space 与 delta action type。【Code】 因此,论文的 embodiment-level action 表述与代码当前数据适配层不是完全同一抽象,实际使用时需要按数据集配置对齐。

GE-Sim 的输入是观察和动作轨迹 ARK×14\mathbf{A}\in\mathbb{R}^{K\times14},输出是动作执行后的下一段多视角视频;再把生成视频反馈给 policy,形成:

instruction + observation → policy → action chunk → GE-Sim → predicted video
                                      ↑                       │
                                      └────── closed loop ────┘
text

4. 方法#

4.1 Overall Architecture#

GE-Base 的多视角 autoregressive world model 与 cross-view causal block(论文 Figure 2)

【Paper】 GE-Base 接收 head、left wrist、right wrist 三路同步相机,分别编码初始图像与稀疏历史帧;不同 view 的 latent 与 noise 加上 2D rotary position embedding、view-specific embedding 和 timestep embedding 后进入 DiT。部分 block 做跨视角 self-attention,其余 block 将 view 维折叠进 batch,以平衡一致性和计算量。

【Analysis】 这个设计把“多视角一致性”从后处理问题变成 backbone 内部的 token interaction:head view 负责全局布局,wrist views 提供接触细节,cross-view block 则约束三者描述的是同一个动作过程。

4.2 核心模块#

GE-Base:带稀疏记忆的视频世界模型#

  • 输入:三路同步视觉观察、四张稀疏历史帧、文本指令和随机噪声。
  • 输出:下一个多视角 video chunk;反复 autoregressive 生成直到任务结束。
  • 视频骨干:论文选用 LTX-Video 2B 与 COSMOS2 2B 两类 DiT;LTX 更偏低延迟,COSMOS2 更偏高保真模拟。
  • 语言条件:冻结的 T5-XXL encoder 产生文本 embedding,经 DiT cross-attention 注入。
  • 记忆机制:训练时从历史中随机抽 sparse memory;推理时按固定间隔均匀采样,避免只依赖最近帧。

【Code】 README 将两个公开视频模型区分为 GE-Base-slow(中频、与 action dynamics 同步)和 GE-Base-fast(低频、低延迟)。视频推理示例目录显式放置每个样本的四张多视角 history images 与 prompt,印证了论文的 sparse-memory 接口。

GE-Act:共享视觉 backbone 的 action branch#

GE-Act 的 parallel action branch 与 flow-matching decoder(论文 Figure 5)

  • 输入:GE-Base visual tokens、instruction embedding、噪声初始化的 action tokens。
  • 中间模块:视觉 DiT block 与 action DiT block 并行;action branch 通过 cross-attention 读取每层视觉表示。
  • 输出:一段时间结构化 action policy,不需要在部署时显式解码完整视频。
  • 为什么需要:直接从视频生成结果取动作会带来额外延迟;GE-Act 在 latent 空间做 action decoding,保留视觉语义同时绕开视频像素生成。
  • 实际规模:论文描述为约 160M 参数的轻量 action decoder;官方配置中 action_expert: trueaction_in_channels: 14action_chunk: 54

GE-Sim:把动作重新注入世界模型#

GE-Sim 的 Pose2Image、motion token 与 action-conditioned video generation(论文 Figure 8)

GE-Sim 要解决的不是“生成一段看起来像机器人视频”,而是让低层动作与高层视觉 latent 对齐。它包含两条条件路径:

  1. Pose2Image:把末端位姿投影到相机平面,绘制位置、姿态轴和 gripper openness,再与对应历史图像分别编码后相加;
  2. Motion Vector:计算相邻位姿的 Δai\Delta\mathbf a_i,经 learnable encoder 变成 motion tokens,并与 reference image style token 一起通过 cross-attention 注入 DiT。

【Paper】 GE-Sim 同时支持基于 LTX-Video 的快速版本和基于 COSMOS2 的高保真版本;训练时还加入错误执行、不完整行为和次优控制轨迹,以覆盖失败模式。

4.3 关键公式#

GE-Base 的多视角预测#

x^t=W({v0(i),vt^(i),z(i)}i{h,l,r}, T(q)).\hat{x}_t = \mathcal{W}\left(\{v_0^{(i)},v_{\hat t}^{(i)},z^{(i)}\}_{i\in\{h,l,r\}},\ \mathcal{T}(q)\right).

这里 v0(i)v_0^{(i)}vt^(i)v_{\hat t}^{(i)} 是第 ii 个视角的初始和历史 latent,z(i)z^{(i)} 是 view-specific noise,T(q)\mathcal{T}(q) 是 T5-XXL 文本表示。公式表达的重点是:每个 view 有自己的观测和噪声,但在 DiT 中被联合建模。

GE-Act 的视觉-动作交互#

vi=Bivis(vin,T(q)),ai=Biact(zact,CrossAttn(zact,vi)).\mathbf v_i=\mathcal B_i^{vis}(\mathbf v_{in},\mathcal T(q)),\qquad \mathbf a_i=\mathcal B_i^{act}\left(\mathbf z_{act},\operatorname{CrossAttn}(\mathbf z_{act},\mathbf v_i)\right).

视觉 block Bivis\mathcal B_i^{vis} 先产生语义和时空上下文,action block Biact\mathcal B_i^{act} 再以噪声动作 token 为 query 读取视觉特征。【Analysis】 这比把最终视觉 embedding 一次性喂给 MLP 更接近“逐层共享中间状态”,有利于动作和预测的视觉动态保持一致。

Flow matching 的动作去噪#

设真实动作为 a1a_1、高斯噪声为 a0a_0,线性路径为 aσ=(1σ)a1+σa0a_\sigma=(1-\sigma)a_1+\sigma a_0,模型学习速度场 vθ(aσ,σ,c)v_\theta(a_\sigma,\sigma,c)

LFM=Eσ,a0,a1[vθ(aσ,σ,c)(a1a0)22].\mathcal L_{FM}=\mathbb E_{\sigma,a_0,a_1}\left[\left\|v_\theta(a_\sigma,\sigma,c)-(a_1-a_0)\right\|_2^2\right].

其中 cc 是视觉 latent、语言和可选 robot state 的条件。推理时从噪声动作开始,沿 flow-matching ODE 迭代得到 action chunk。【Code】 训练器会按 scheduler 采样 action sigma、混合真实动作与噪声,并对 action loss 做 flow weighting;配置默认 flow_weighting_scheme: none

GE-Sim 的动作条件#

vi=E(Ii)+E(Pi),Δai=aiai1.\mathbf v_i=\mathcal E(\mathbf I_i)+\mathcal E(\mathbf P_i),\qquad \Delta\mathbf a_i=\mathbf a_i-\mathbf a_{i-1}.

图像 latent 与 pose-image latent 的逐元素相加保留场景语义和空间目标,动作差分则提供时间方向。两者分别解决“要在哪里动”和“应该如何继续动”。

4.4 Training#

GE-Base 两阶段预训练#

【Paper】

  • Stage I — GE-Base-MR:57 帧、3–30 Hz 随机采样,配 4 张 sparse memory,编码为 8 个 latent frames;32 张 A100 训练约 7 天。
  • Stage II — GE-Base-LF:固定 5 Hz 采 9 帧,配 4 张 memory,压缩为 2 个 latent frames;冻结 video encoder/decoder,只更新生成组件;32 张 A100 约 3 天。

第一阶段学习对采样率变化更鲁棒的运动表示,第二阶段把时间抽象对齐到下游 action policy 的低频视觉更新。

GE-Act 训练与任务适配#

GE-Act 的 text-video-policy 三阶段训练流程(论文 Figure 6)

【Paper】 action pretraining 固定 GE-Base-LF,只训练 action decoder;输入 4 张 5 Hz memory,预测 30 Hz 的 54-step action。之后先做 video adaptation,再做 action specialization:前者适配新任务视觉分布,后者在任务数据上微调整个 action policy。

【Code】 官方 LeRobot 配置把这条流程拆成可执行的两个阶段:将 return_video: truetrain_mode: video_only 用于视频适配,再切换为 return_action: truetrain_mode: action_full 训练 action expert;训练数据可指定三路相机、action_type(absolute/delta)和 action_space(joint)。

GE-Sim 训练#

【Paper】 GE-Sim 从高时间分辨率 GE-Base-MR 初始化,以真实 action trajectory 条件生成视频,同时混入 teleoperation 和真实部署中的 failure cases;VAE 与 CLIP encoder 冻结,其余生成参数用 flow-matching loss 优化。

Algorithm 1 Genie Envisioner Training
输入:
AgiBot-World-Beta 的多视角视频、instruction、action trajectory 与可选 failure cases
输出:
GE-Base、GE-Act 与 GE-Sim 参数
  1. Stage I 用多帧率视频和稀疏记忆进行 GE-Base-MR domain adaptation
  2. Stage II 用低频视频微调 GE-Base-LF,使视觉 chunk 与动作时间抽象对齐
  3. Stage III 冻结 GE-Base-LF,使用 text-video-policy triplet 训练 GE-Act action branch
  4. Stage IV 对新任务先做 video adaptation,再做 action specialization
  5. Stage V 用 action-conditioned 视频和失败轨迹训练 GE-Sim

4.5 Inference#

GE-Base / GE-Act 的 Slow-Fast Asynchronous Inference#

【Paper】 视频 DiT 以 5 Hz 工作,action model 以 30 Hz 工作,频率比为 1:6。每次视觉 forward 只做一次 flow-matching denoising 并缓存 visual latent;同一缓存被 action model 复用,action 分支做 5 次 denoising 以获得 54-step 高频动作。论文报告在机器人上的 RTX 4090 上约 200 ms 完成一次推理。

【Code】 README 的 video_model_infer_fast.yaml 关闭 action expert、只返回视频;policy 配置则开启 action expert、关闭视频返回。也就是说,官方实现把“单独生成视频”和“只解码动作”作为两个运行模式,而不是每次部署都输出两种结果。

Algorithm 2 GE-Act Inference
输入:
当前三路视觉、稀疏历史帧、instruction、训练好的 GE-Act
输出:
54-step action chunk
  1. 按固定间隔从历史视频中采样 memory,并编码当前三路观察
  2. 视频 DiT 做一次 denoising,得到并缓存 instruction-conditioned visual latent
  3. 从高斯 action tokens 开始,在 5 个 flow-matching steps 中逐步去噪
  4. 输出 action chunk,由机器人低层控制器执行;下一次视觉更新时刷新缓存

GE-Sim 闭环 rollout#

【Paper】 policy 先根据 instruction 和初始观察产生动作,GE-Sim 用该动作生成未来视频,再把视频反馈给 policy,如此迭代直到任务完成。相同动作还可以在不同初始视觉环境中重放,构造更多训练或评测样本。

4.6 代码实现对照#

官方仓库的实现边界很清楚:

论文模块代码位置 / 入口代码中可确认的行为
GE-Base / GE-Actmodels/ltx_models/, runner/ge_trainer.py, configs/ltx_model/LTX 多视角模型、action expert 开关、flow scheduler、54-step chunk
数据加载data/agibotworld_dataset.py, data/lerobot_like_dataset.pyAgiBotWorld 与 LeRobot 风格数据;三路相机字段可配置
动作推理runner/ge_inferencer.py, scripts/infer.sh输出 action prediction,并可绘制与 GT 对比的 open-loop 曲线
视频推理video_gen_examples/infer.py从 prompt 和四张多视角历史图生成 GE-Base slow/fast 视频
GE-Simmodels/pipeline/gesim_pipeline.py, gesim_video_gen_examples/infer_gesim.py读取 .npy 的相机内外参与 action,运行 Cosmos2-based simulator
在线部署web_infer_scripts/, web_infer_utils/提供基于 websocket/openpi 风格的 server-client 示例

【Analysis】 当前代码更像“可复现实验骨架”而不是开箱即用的机器人系统:权重、VAE、tokenizer、相机标定和数据集路径都需要用户自行准备;README 也要求先修改 YAML 中的 checkpoint 与数据字段。

5. 实验#

5.1 Experimental Setup#

【Paper】 数据主干是 AgiBot-World-Beta 的约百万条双臂真实操作轨迹。GE-Act 在 AgiBot G1 上测试 sandwich、pour tea、clean table、microwave、conveyor 上抓取洗衣液等任务;跨 embodiment 实验覆盖 Agilex Cobot Magic、Dual Franka 和 RoboTwin。

  • 评价指标:Step-wise Success Rate(SR)统计子步骤完成比例,End-to-End Success Rate(E2E)只看整任务最终结果。
  • 对比方法:UniVLA、GR00T N1、π0\pi_0 等 VLA baselines。
  • 跨 embodiment 适配:Agilex 和 Dual Franka 各用约 250 条示教,约 1 小时;新 embodiment 重新训练 action head,保留 GE-Base 视觉 backbone。

5.2 Main Results#

AgiBot G1 上 GE-Act 与 VLA baselines 的 SR/E2E 对比(论文 Figure 7)

【Paper】 在 AgiBot G1 的多项真实任务上,GE-Act 的 SR 与 E2E 总体高于 UniVLA 和 GR00T N1;fast mode 在动态目标跟踪和 conveyor 抓取等低延迟任务上尤其有优势。论文将收益归因于 GE-Base 提供的时空先验和视觉-语言 grounding,而不仅是 action head 本身。

【Paper】 跨 embodiment 结果也显示,GE-Act 用约 1 小时示教即可在 Agilex Cobot Magic 的 box folding、cloth folding 上完成复杂操作;在 Dual Franka 上,即使 π0\pi_0 和 GR00T N1 有更多 Franka 数据,GE-Act 仍保持竞争力。

5.3 Ablation Study#

论文在固定的“抓取红色圆柱并放入纸杯”任务上比较预训练来源、task video adaptation 与 robot state:

VidAW(GE-Base 初始化)VidAdaE2E(有 state)E2E(无 state)SR(有 state)SR(无 state)
0.150.300.050.11
0.000.050.000.00
0.810.490.640.26
0.890.370.760.37

【Paper】 关键结论有两层:第一,来自 embodied video pretraining 的表示是 action learning 的主要基础;第二,加入 state 并非总是有益——没有 GE-Base 先验时,state 可能诱发 shortcut learning,反而损害性能。

5.4 Generalization#

不同 embodiment 上的任务成功率对比(论文 Figure 10)

【Paper】 RoboTwin 中,GE-Act 用一个 all-in-one 模型联合适配四个任务,在四个任务中的三个超过 π0\pi_0 和 GO-1;lift pot 的小幅落后被作者解释为 joint training 的 task interference。这个结果说明 GE 的泛化不只来自“为每个任务训练一套 policy”,而是共享 world representation 后再适配 action head。

GE-Sim 的 action-conditioned 表格结果显示,LTX 和 COSMOS2 版本在 BLEU、CLIP、dynamic、scene 等指标上总体接近,COSMOS2 在动态一致性上更好;EWMBench 与人类偏好排序的一致性也高于通用 VBench。【Analysis】 这验证的是“模拟器可用性”而非真实 task success:视频与动作对齐是必要条件,但还不是安全部署的充分条件。

EWMBench 对多个视频世界模型的多维度比较(论文 Figure 12)

6. 方法分析#

6.1 为什么有效?#

【Analysis】 GE 的收益可以拆成三个互补因素:

  1. 视觉空间保留了控制细节:视频 latent 同时编码场景、机器人姿态和未来变化,比单一语义 embedding 更接近 manipulation 所需的几何信息。
  2. 稀疏 memory 延长了有效上下文:模型可以看到“物体已经被放进盒子、随后被遮挡”的历史,而不是只看最近一帧。
  3. 动作与视频共享中间表示:GE-Act 不用从零学习视觉到动作的映射,GE-Sim 又能把动作结果投回视觉空间,形成学习、执行、评测的闭环。

6.2 核心创新#

  • 平台级创新:把 world model、policy、simulator、benchmark 组合为同一个接口,而不是只提出一个新 decoder。
  • 建模级创新:多视角 cross-view attention + sparse memory + language-conditioned autoregressive video generation。
  • 控制级创新:并行 action branch 与异步 slow-fast inference,把视频频率和动作频率解耦。
  • 评测级创新:EWMBench 把 scene、motion、semantics 和 action-conditioned controllability 放到同一套指标中。

6.3 与已有方法的本质区别#

路线中间表示是否能内部预测未来是否能动作条件模拟主要瓶颈
传统 VLAVLM / language-centric feature通常不能通常不能行为克隆与真实评测成本
通用视频模型pixel/latent video能生成视频多数没有机器人动作接口物理与控制对齐不足
GEembodied visual latentGE-Sim 支持数据来源和评测仍有限

【Analysis】 GE 并没有证明“视频生成天然优于 VLA”;它证明的是:当视觉世界模型在足够多的机器人视频上预训练后,它可以成为 policy、simulation 和 evaluation 的共享 substrate。

6.4 关键假设#

  • 三路相机同步且标定稳定,视角之间的对应关系可以由模型学习。
  • AgiBot-World-Beta 的操作分布足以提供可迁移的 embodied prior。
  • 视觉预测的高保真与动作执行质量存在可利用的相关性。
  • action chunk 的低频规划和高频低层控制可以通过异步架构解耦。
  • video-based simulator 即使没有显式物理引擎,也能在任务相关指标上提供有价值的策略排序。

7. 局限性#

7.1 作者明确提出的局限#

【Paper】

  1. 数据来源单一:预训练主要依赖单一真实平台和 AgiBot-World-Beta,没有互联网规模或仿真数据,跨传感器和低资源 domain 的稳健性未充分验证。
  2. embodiment 范围有限:当前集中在上半身桌面操作和平行夹爪,没有涉及灵巧手、多接触 manipulation 或全身 locomotion。
  3. 评测仍是 proxy:EWMBench 依赖视觉、轨迹和 VLM 指标,并只有部分人工验证,尚不能完全自动、可靠地判断复杂失败下的真实任务成功。

7.2 自己分析得到的局限#

【Analysis】

  • 世界模型的错误会被闭环放大:GE-Sim 生成的“看起来合理”视频可能掩盖碰撞、摩擦或力学失败,policy 若在模拟器中优化,可能学到 simulator-specific shortcut。
  • 稀疏记忆不是免费午餐:遮挡、相机漂移或历史采样错误会让 latent 记忆携带过时状态;论文没有给出 memory dropout、长度和采样策略的系统消融。
  • action representation 仍依赖 embodiment:论文用 14D EEF 表达说明统一接口,代码却需要在 joint/delta/absolute 等数据配置间适配;真正跨机器人共享 action semantics 仍未解决。
  • 成本和复现门槛很高:论文训练阶段使用数十张 A100,代码还要求用户自行准备大模型 VAE、tokenizer、标定和权重,普通实验室很难完整复现实验规模。
  • 基准与任务成功之间仍有间隙:EWMBench 能比较视频动态与语义,但不等价于抓取成功、接触稳定性或安全性;后续需要 simulator-to-real 校准和真实闭环验证。

8. 启发与研究思考#

【Analysis】 这篇工作最值得借鉴的不是“把机器人视频做得更清晰”,而是接口设计:同一个 latent space 同时服务 prediction、control 和 evaluation。由此可以得到几条研究路线:

  1. 从视觉预测到 belief state:把 GE-Base latent 显式拆成可校准的 scene state、robot state 和 uncertainty,减少“视频逼真但状态错误”。
  2. 把 simulator 用作主动数据引擎:让 policy 在 GE-Sim 中提出失败轨迹,再把高价值失败样本回流到 GE-Base 和 GE-Act 训练。
  3. 统一 action tokenization:在 EEF、joint、torque 之间学习 embodiment-conditioned action token,使新机器人只需少量 adapter,而不是重新训练 action head。
  4. 从指标相关性到安全保证:EWMBench 可以加入碰撞、接触力、可逆性和不确定性指标,并与真实任务 success 做 calibration。
  5. 更长时域的记忆机制:将 sparse memory 与事件级摘要、object-centric memory 结合,解决遮挡后依赖内部记忆的长流程任务。

【Analysis】 如果把 VLA 看作“当前观察到动作”的函数,那么 Genie Envisioner 更接近一个可查询的 embodied dynamics service:可以问它“接下来可能发生什么”,也可以问“如果执行这组动作,视觉上会怎样”。这正是机器人从一次性 imitation 走向可预测、可评估、可迭代 learning system 的关键一步。

Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台
https://agusexp25.top/blog/paper-deep-dive-genie-envisioner
Author 菊花花
Published at August 26, 2026