

Paper Reading: MLLM 1
读一些多模态相关的论文
CLIP#
用大规模图文对比学习把图像和自然语言映射到同一空间,从而支持零样本分类与跨任务迁移。

研究动机:传统视觉模型依赖固定类别和人工标注,换任务就要重新训练;网络上已有大量带自然语言描述的图像,论文希望直接利用这些弱标注学习通用视觉概念。
核心方法:CLIP 使用独立的图像编码器和文本编码器,把一批图文对的匹配样本拉近、非匹配样本推远,采用对称的对比损失训练。推理时把类别名写成文本提示,与图像特征比较相似度即可完成零样本预测,不需要为每个下游任务增加分类头。
实验/数据:作者从互联网收集大规模图文对,并在 ImageNet 及多个分类、检索、细粒度识别和 OCR 数据集上测试零样本迁移,也比较了少量标注微调与线性探测效果。
主要结论:自然语言监督能够替代一部分任务专用标注,模型在许多分布外数据上仍有可用的零样本能力;图文共享语义空间也成为后续视觉语言模型的通用接口。
局限:网络字幕噪声和社会偏见会被模型继承;全局特征对精确定位、计数、文字识别和复杂组合关系不够敏感,提示词写法也会显著影响结果,预训练计算与数据规模很大。
建议配图:论文 Figure 1(双编码器与零样本分类流程)。
SigLip#

研究动机:CLIP 的 softmax 对比损失需要在整个 batch 内归一化,扩大 batch 才能提供足够多的负样本,训练通信和显存成本较高。论文希望让每个图文对独立判断是否匹配,降低对超大 batch 的依赖。
核心方法:SigLIP 保留图像、文本双编码器,但把每个配对关系写成二元分类,匹配对标签为正、不匹配对为负,并使用 sigmoid loss 独立计算各对的损失。模型仍通过大规模图文预训练获得共享嵌入,可直接用于检索和零样本分类。
实验/数据:作者在大规模网页图文数据上训练不同规模的 ViT 版本,并在 ImageNet 零样本分类、图文检索和迁移学习任务上与 CLIP 系列比较,同时测试不同 batch 大小和分辨率设置。
主要结论:SigLIP 在不依赖全局 batch 归一化的情况下取得与 CLIP 相当或更好的效果,小 batch 训练更容易扩展到不同硬件;其嵌入也适合为后续多模态语言模型提供视觉特征。
局限:模型仍是全局图文表示,不能自然地产生文字或像素级定位;网页数据的噪声、多语种覆盖和偏见没有被目标函数根本解决,细粒度组合推理仍需额外模块。
建议配图:论文 Figure 1(sigmoid 对比损失与 CLIP softmax 的对比)。
SigLipV2#

研究动机:原始 SigLIP 的全局对齐已经很强,但在局部定位、密集预测和多语种语义上仍有限;固定方形缩放也会损失文档、网页和宽幅图像中的空间信息。论文希望用统一训练配方改善这些能力。
核心方法:SigLIP 2 以 sigmoid 图文目标为基础,加入 captioning、image-text matching、自蒸馏和 masked prediction 等辅助任务,并进行在线数据筛选与去偏。视觉编码器提供固定分辨率版本,也提供保留输入原生宽高比的 NaFlex 变体,使特征更适合检测、分割和视觉语言模型。
实验/数据:训练数据覆盖更丰富的多语种图文来源,评测包括零样本分类、图文检索、视觉语言迁移、目标定位和密集预测,并比较不同模型规模、分辨率及训练目标的消融。
主要结论:多目标训练并未牺牲全局对齐,反而在同等规模下改善语义理解、定位和 dense feature;原生宽高比模型对文档和非方形图像更实用,多语种与去偏数据也提升了跨语言表现。
局限:训练配方更复杂、计算开销更高,辅助损失和数据配比需要调参;模型仍主要输出编码特征而非生成结果,对长链推理和开放式对话的能力取决于外接语言模型。
建议配图:论文 Figure 1(SigLIP 2 多任务训练配方与模型变体)。
Dino V1#

研究动机:监督预训练依赖昂贵标签,而无监督方法常只学到纹理或实例相似度。DINO 研究自蒸馏能否让视觉 Transformer 自己发现物体和部件的语义组织。
核心方法:学生网络和教师网络结构相同,教师参数由学生参数的指数移动平均更新;同一图像的全局裁剪和局部裁剪分别送入两者,学生通过交叉熵匹配教师输出。中心化与 sharpening 稳定教师分布,多裁剪迫使模型在尺度变化下保持一致。
实验/数据:论文在 ImageNet 无标签图像上预训练不同规模的 ViT 和 ResNet,并用线性分类、k-NN、图像检索、分割和注意力可视化评估表示质量。
主要结论:DINO 的 ViT 注意力会自发聚焦物体区域,特征在分类、检索和分割迁移中表现出较好的语义泛化;EMA 教师和多裁剪是避免坍塌、获得结构化表示的关键。
局限:训练仍需较大计算量和精心的增强/温度设置,注意力显著性不等于可靠的像素级分割;模型没有语言监督,对文字、跨模态对齐和细粒度关系理解有限。
建议配图:论文 Figure 1(教师—学生自蒸馏与多裁剪流程)。
Dino V2#

研究动机:DINO 等自监督模型已经显示出迁移潜力,但数据规模、长训练稳定性和跨域鲁棒性仍不足。DINOv2 的目标是训练一个不依赖下游微调、可作为视觉基础模型的高质量特征提取器。
核心方法:作者先从海量网页图像中筛选并去重出高质量、多样化的数据集,再结合 DINO 的全局自蒸馏、iBOT 的 masked patch prediction 与 KoLeo 特征均匀性正则。模型采用较大的 ViT,并通过蒸馏得到更小的可部署版本。
实验/数据:预训练数据覆盖自然图像和不同领域的无标签图片;评测包含 ImageNet 线性探测、物体/语义分割、深度估计、检索以及跨域数据集,并比较冻结特征和少量微调两种设置。
主要结论:数据清理与联合自监督目标让 DINOv2 在多种任务上提供稳定的通用特征,冻结骨干也能取得很强结果;它证明视觉基础模型不必依赖人工类别标签。
局限:高质量数据管线和大规模预训练成本高,数据分布仍可能带来地域与内容偏差;特征不包含显式语言语义,生成、问答和需要精确几何推理的任务仍需专门模型。
建议配图:论文 Figure 1(DINOv2 预训练与跨任务迁移示意)。
Dino V3#

研究动机:自监督视觉模型在长训练和大规模扩展时,patch 级特征可能逐渐退化,导致密集任务收益停滞;同时同一骨干还要适应不同分辨率、模型大小和跨模态应用。DINOv3 试图把这些问题纳入一个可扩展的基础模型方案。
核心方法:论文系统扩大数据、模型和优化设置,并提出 Gram anchoring,约束特征之间的 Gram 结构在训练中保持稳定,以减缓 dense feature 崩坏。训练完成后再用后处理策略调整输入分辨率、蒸馏不同尺寸模型,并与文本空间对齐,而不必重新端到端训练。
实验/数据:数据涵盖自然、遥感等多种图像来源;作者在分类、检测、分割、深度、匹配和跨域密集任务上进行冻结特征评测,并比较不同模型规模、训练时长和后处理策略。
主要结论:Gram anchoring 让长 schedule 下的局部特征保持可用,DINOv3 在无需微调的多项任务上超过此前自监督或弱监督基础模型;后处理提供了性能、分辨率和部署成本之间的灵活折中。
局限:报告依赖极大规模数据和计算资源,完整训练配方与数据覆盖仍难以由普通研究者复现;文本对齐是后处理得到的,模型的细粒度语言理解和生成能力并非本文重点。
建议配图:论文 Figure 1(Gram anchoring 与 DINOv3 整体训练流程)。
ViLT#

研究动机:当时主流视觉语言模型依赖 Faster R-CNN 区域特征,预处理慢、系统复杂且难以端到端扩展。ViLT 探索只用 patch embedding 是否足以完成图文理解。
核心方法:图像被切成 patch,经线性投影后与文本 token 拼成序列,由单个 Transformer 编码器处理。预训练联合使用 masked language modeling、image-text matching 和 word-patch alignment 等目标,视觉侧不再运行区域提议网络。
实验/数据:作者在 Conceptual Captions、SBU、GQA 等图文数据上预训练,并在图文检索、视觉问答、视觉蕴含和 NLVR2 等任务上与区域特征模型比较,也报告了推理速度和参数效率。
主要结论:简单 patch 表示能以更低的预处理成本获得有竞争力的跨模态结果,证明视觉语言 Transformer 不必绑定目标检测器;端到端结构更容易迁移到新的分辨率和任务。
局限:缺少区域检测器带来的显式物体归纳偏置,在细粒度定位、复杂文字和高分辨率场景上较弱;统一 Transformer 仍需大量图文预训练,早期版本的语言生成能力有限。
建议配图:论文 Figure 1(ViLT patch-token 序列与预训练目标)。
ALBEF#

研究动机:直接在 cross-modal encoder 中融合会把模糊或错配的网页字幕传播到表示中;但只做独立编码又缺乏细粒度交互。ALBEF 提出先对齐、后融合的训练顺序来稳定学习。
核心方法:图像编码器和文本编码器先通过 image-text contrastive loss 学习全局对齐,再把两者送入 cross-attention 模块进行 image-text matching 和 masked language modeling。动量编码器产生更平滑的目标分布,配合 hard negative mining 和 momentum distillation 为噪声样本提供软监督。
实验/数据:预训练使用多个公开图文数据集,随后在图文检索、视觉问答、视觉蕴含和 NLVR2 等任务上微调,并做损失组合、动量教师及负样本策略的消融。
主要结论:先对齐可提升跨模态融合的样本效率,动量蒸馏能从噪声网页数据中提取更稳定的监督;模型在检索和理解任务上都达到当时强基线。
局限:需要两套编码器、动量队列和负样本管理,训练与部署复杂度高;软标签仍可能放大数据偏差,模型主要面向判别式理解,开放式生成与精确空间推理不是重点。
建议配图:论文 Figure 1(align-before-fuse 两阶段架构)。
VLMo#

研究动机:视觉语言预训练通常为单模态和跨模态任务维护不同网络,参数重复且难以联合扩展;完全共享又会让视觉和语言的统计规律互相干扰。VLMo 试图用一个可切换的 Transformer 兼顾二者。
核心方法:MoME-Transformer 共享 self-attention,同时为视觉、文本和视觉语言输入提供不同的 feed-forward experts,并用路由选择相应专家。预训练先进行单模态学习,再逐步加入图文对齐与融合目标,使同一骨干获得多种工作模式。
实验/数据:作者在大规模图文对和单模态语料上训练,并评估图文检索、视觉问答、视觉蕴含和 NLVR2;消融比较专家共享方式、训练阶段和路由策略。
主要结论:模态专属专家能保留单模态表示能力,同时共享注意力促进跨模态交互;统一模型在多项理解任务上超过分别训练或简单拼接的基线。
局限:专家路由增加参数、显存和实现复杂度,训练顺序与任务配比较敏感;模型仍是编码式架构,对长文本生成、复杂对话和像素级输出支持有限。
建议配图:论文 Figure 1(MoME Transformer 的共享/专属模块)。
BLIP#

研究动机:网页图文对经常错配、字幕简短或包含无关信息;同时已有模型往往只擅长检索/问答或只擅长描述生成。BLIP 希望在同一个预训练框架中兼顾两类能力并清理训练信号。
核心方法:模型包含图像编码器、文本编码器和带跨注意力的文本解码器,联合优化 image-text contrastive、image-text matching 与 language modeling。CapFilt 先用 captioner 为网页图像生成候选字幕,再由 filter 判断并剔除不匹配文本,把合成数据与原始数据一起训练。
实验/数据:预训练混合网页图文与 COCO、Visual Genome 等标注数据,覆盖图文检索、图像描述、视觉问答、视觉对话和基于图像的文本生成;论文还比较了不同过滤阈值与模型规模。
主要结论:合成并过滤字幕能显著提高噪声数据的有效性,统一的 encoder-decoder 在理解和生成任务之间取得较好平衡;BLIP 也为后续 BLIP-2 的视觉语言接口提供了基础。
局限:CapFilt 质量依赖 captioner 和过滤器,可能引入模型偏见;多任务训练和解码器使模型比纯双编码器更重,对高分辨率定位、复杂推理及开放世界事实性仍有限。
建议配图:论文 Figure 1(BLIP 架构与 CapFilt 数据引导流程)。
CoCa#

研究动机:对比学习擅长学习全局语义但不能生成文字,自回归 captioning 能生成却未必保持跨模态检索结构。CoCa 探索用共享图像编码器和文本解码器把两种训练信号结合起来。
核心方法:文本 Transformer 前半段以自注意力得到 unimodal text embedding,与图像 embedding 做 contrastive loss;后半段加入图像 cross-attention,按因果顺序预测 caption token。图像侧使用大规模视觉编码器,两个目标共享参数并联合优化。
实验/数据:模型在大规模图文数据上预训练,并测试零样本分类、图文检索、图像描述、视觉问答和少量下游迁移;实验还比较只用对比或只用生成目标的版本。
主要结论:对比和生成目标可以互补,单一骨干既保留强零样本分类/检索,又具备高质量描述能力;该设计为视觉语言模型接入语言解码器提供了简洁范式。
局限:自回归解码推理慢于双编码器,文本生成仍受网页字幕质量影响;模型以全局图像条件为主,对局部定位、计数和长链视觉推理支持不足,训练数据与算力门槛也很高。
建议配图:论文 Figure 1(CoCa 的 unimodal/ multimodal decoder 分工)。
BEiT V3#

研究动机:图像和文字通常由两套预训练骨干处理,跨模态模型难以共享大规模表示学习;论文希望用统一 Transformer 同时吸收纯图像、纯文本和图文数据。
核心方法:BEiT-3 采用 Multiway Transformer,共享 self-attention,视觉和文本使用各自的 feed-forward expert。图像先由视觉 tokenizer 转为离散视觉词,文本使用子词 token;两种模态都进行 masked data modeling,并在图文阶段加入匹配和任务微调。
实验/数据:预训练混合图文对、ImageNet 类纯图像和文本语料,评测覆盖图像分类、图文检索、视觉问答、视觉蕴含和 NLVR2 等任务,比较共享骨干与模态专属专家的效果。
主要结论:统一的掩码建模和专家路由能让同一模型在视觉、语言及跨模态任务上都保持竞争力;共享注意力促进迁移,而专家隔离减轻了模态间干扰。
局限:视觉 tokenizer 和大规模预训练管线复杂,离散化可能损失细节;模型主要输出编码/分类结果而非开放式图像生成,训练数据规模和计算资源不易复现。
建议配图:论文 Figure 1(BEiT-3 Multiway Transformer 与三种数据流)。
BLIP2#

研究动机:端到端更新视觉模型和大语言模型需要巨大算力,并容易破坏语言能力。BLIP-2 试图在两者之间学习一个小而通用的接口,让已有单模态模型直接协同工作。
核心方法:Q-Former 使用一组可学习 query 从冻结视觉编码器提取与文本相关的少量视觉特征;第一阶段通过对比、匹配和视觉条件生成对齐视觉与查询,第二阶段用线性投影把查询接入冻结的 OPT 或 FlanT5,并训练图像到文本生成目标。
实验/数据:预训练使用图文描述和网页数据,评测包含零样本图像描述、视觉问答、知识型 VQA、视觉对话和指令跟随;论文还测试不同视觉编码器、LLM 及查询数量的组合。
主要结论:Q-Former 这一窄接口足以把冻结视觉表征传给不同 LLM,训练参数和成本远低于端到端方案,同时获得较强的描述、问答和跨模态生成能力。
局限:冻结视觉编码器会限制领域适应和细粒度空间理解,固定数量 query 可能丢失小目标与文字;语言模型的先验也会造成幻觉,模型并非真正的像素级 grounding 或复杂图像推理系统。
建议配图:论文 Figure 1(Q-Former 连接冻结视觉编码器和冻结 LLM 的两阶段训练)。
LLava#

研究动机:已有视觉语言预训练模型在固定任务上很强,却不能像通用聊天模型一样遵循自然语言指令。LLaVA 研究能否用简单视觉接口和高质量指令数据,把语言模型的对话与推理能力迁移到图像场景。
核心方法:图像由 CLIP ViT 编码,经线性 projector 映射到 Vicuna 的词向量空间,并与用户文本拼接输入。训练分为图文特征对齐和视觉指令微调两阶段,后者使用 GPT-4 根据图像描述、问答和复杂推理模板生成多轮对话。
实验/数据:作者在 COCO 等图文数据上做对齐,再用视觉指令对评测通用 VQA、图像对话、科学图表和视觉推理基准,并进行人工对话质量比较。
主要结论:语言模型原有的指令跟随和解释风格能够通过轻量 projector 迁移到视觉输入,LLaVA 以较小工程复杂度建立了开源 MLLM 的强基线。
局限:合成指令继承 GPT-4 的偏差和幻觉,单一图像 token 化方式对高分辨率 OCR、精确定位和多图关系支持不足;模型的知识主要来自语言先验,回答不一定由图像证据支撑。
建议配图:论文 Figure 1(视觉 projector 与两阶段视觉指令调优)。
Flamingo#

研究动机:大语言模型通常只看文本,视觉模型又需要每个任务单独训练;更现实的多模态场景还包含图文交错和视频。Flamingo 希望尽量冻结已有模型,只增加少量模块,就能在新任务上用几个示例完成适应。
核心方法:冻结视觉 backbone 和 Chinchilla 类语言模型,用 Perceiver Resampler 把可变数量的图像或视频特征压缩成固定视觉 token,并在语言模型层间插入零初始化的 gated cross-attention。训练数据采用图文交错网页序列,语言模型自回归预测文本,支持图像、视频和文本混排。
实验/数据:预训练混合网页交错数据、单图文对和视频文本数据;评测覆盖少样本图像问答、图像描述、视觉对话、视频问答及多种检索任务,并与需要全量微调的模型比较。
主要结论:冻结骨干加少量跨注意力模块即可获得很强的 few-shot 多模态迁移,交错上下文让模型能在一个提示中引用多张图和视频帧。
局限:训练数据、模型权重和大部分基础设施不公开,复现门槛高;视觉 token 压缩会损失细节,少样本性能受示例顺序影响,模型仍会产生事实幻觉和社会偏见。
建议配图:论文 Figure 1(Perceiver Resampler 与 gated cross-attention 结构)。
Visual Instruction Tuning#

研究动机:视觉问答数据往往只覆盖单一问题类型,不能训练出可交互的通用助手;同时高质量人工多轮视觉指令数据稀缺。该工作把“如何构造指令数据并调优语言模型”作为视觉语言助手的关键问题。
核心方法:沿用 CLIP 视觉编码器、线性投影和 Vicuna 语言模型,将图像特征作为序列前缀。先用图像字幕做特征对齐,再把 GPT-4 改写的对话、详细描述和复杂问答统一为 next-token 监督,训练模型生成完整回答而非额外分类标签。
实验/数据:视觉指令数据包含单轮问答、多轮对话、详细描述和视觉推理,评测覆盖通用 VQA、图像对话、OCR/图表和科学问题,并通过人工偏好比较回答的有用性与一致性。
主要结论:数据格式和质量对能力提升与模型结构同样重要;在不改变语言模型主体的情况下,视觉指令调优就能产生可用的开放式图像对话能力,并推动后续开源复现。
局限:指令由强语言模型合成,存在风格与事实偏差;模型对小字、空间关系和需要外部知识的题目仍不稳,回答可能出现视觉幻觉。
建议配图:论文 Figure 2(视觉指令数据类型与训练样例)。
Qwen-VL#

研究动机:早期 MLLM 多把图像压成低分辨率全局特征,中文、多图、文字识别和目标定位能力不足。Qwen-VL 希望在保持大语言模型对话能力的同时,显式学习视觉空间信息。
核心方法:图像经过视觉编码器和视觉语言适配器映射为一串视觉 token,再与 Qwen-7B 文本序列联合建模;训练中加入图文对齐、图像描述、问答、OCR 以及带边界框坐标的 grounding 任务。模型提供基础版和更强的聊天版,支持中英文指令和多图交互。
实验/数据:预训练与指令调优混合网页图文、中文图文、OCR/文档和检测标注,并在通用 VQA、OCR、图像描述、视觉对话、引用表达和 grounding 基准上测试。
主要结论:显式坐标监督和较高输入分辨率显著增强文字识别、目标定位及中文对话,Qwen-VL 也说明开源 LLM 可以通过视觉适配器扩展为通用助手。
局限:视觉 token 数量和高分辨率带来显存与延迟压力,复杂场景仍会漏检小目标;坐标与文本生成容易受语言先验干扰,模型在开放世界事实性和安全拒答上仍需额外校准。
建议配图:论文 Figure 1(Qwen-VL 视觉编码、坐标 token 和对话接口)。
Gemini#

研究动机:把视觉编码器外挂到文本 LLM 往往难以处理交错模态、长视频和跨模态推理;论文报告 Gemini 系列从训练阶段就联合建模多种输入,目标是让一个模型在不同模态间迁移知识。
核心方法:技术报告披露 Gemini 使用 decoder-only Transformer 和统一的多模态 token/序列接口,支持图文交错、音频和视频帧输入;同时提供面向端侧的 Nano、通用的 Pro 以及高能力的 Ultra,并配合监督微调、人类偏好优化和安全评测。
实验/数据:训练数据包含网页文本、图像、音频、视频及多模态文档,具体配比未完全公开;评测覆盖学科知识、数学、代码、图像理解、OCR、视频/音频理解、跨模态推理和安全性。
主要结论:原生多模态训练能在长上下文、跨模态组合和多项学术基准上取得强表现,不同规模模型可在能力与成本之间取舍;报告也强调了安全过滤和分层部署的重要性。
局限:架构细节、数据来源和训练配方大多未公开,外部难以完全复现;报告中的基准选择与污染风险难独立核验,模型仍可能产生幻觉、偏见和不安全建议。
建议配图:技术报告 Figure 1(Gemini 多模态输入与模型家族概览)。
GPT-4V#

研究动机:为 GPT-4 增加图像输入会带来 OCR、图表推理、面部与地理识别等新能力,也会引入隐私、偏见和危险建议风险。系统卡的目标是公开已知能力边界与安全测试结果,帮助部署者评估风险。
核心方法:文档不披露 GPT-4V 的具体视觉编码器或训练细节,而是描述端到端产品评测流程:使用公开样例、内部测试集和红队提示,检查视觉问答、文字/图表理解、医学与科学图像、敏感属性推断、网络安全及越权行为,并配套拒答策略、内容过滤和人工审核。
实验/数据:评测覆盖普通照片、文档、手写体、图表、医学图像和多语言文字,另有针对隐私、仇恨、错误信息和高风险专业建议的对抗测试;许多样例与数据集未公开。
主要结论:GPT-4V 展现出较强的通用视觉理解和跨模态推理,但在小字、空间关系、事实核验和敏感内容上仍会出错;系统卡把“能力提升”与“新增风险”同时列为上线约束。
局限:这是产品安全文档而非可复现实验论文,模型结构、数据和完整指标不透明;红队覆盖不可能穷尽真实使用情境,缓解措施也可能随版本更新而改变。
建议配图:系统卡中的能力/风险评测框架图(通常为 Figure 1 或 Overview 图)。
LISA#

研究动机:传统 referring segmentation 处理“图中左边的狗”这类短指令,却难以回答包含常识、属性比较或多步推理的指代问题;纯 LLM 又只能生成文字,无法给出像素级区域。LISA 将语言推理和分割输出放到同一对话中。
核心方法:模型采用 CLIP 视觉编码器和 LLaVA/Vicuna 类语言模型,语言模型生成特殊的 SEG token;该 token 的隐藏状态经投影后作为 SAM mask decoder 的提示,输出目标掩码。训练先进行视觉—语言特征对齐,再用普通指代分割与带推理解释的 LISA-Chat 指令数据联合微调。
实验/数据:评测覆盖 ReasonSeg、RefCOCO 系列、复杂场景语义分割和视觉对话,比较是否加入推理文本、SAM 适配器及不同视觉特征的消融。
主要结论:一个离散 token 就能把语言模型的推理决策传给像素解码器,模型在复杂指代和需要解释的分割问题上优于只做短指令的基线。
局限:掩码质量受 SAM 分辨率和候选特征影响,小目标、边界和歧义指代仍易失败;推理文本可能看似合理但与掩码不一致,训练数据中的合成解释也会带来偏差。
建议配图:论文 Figure 1(SEG token 连接 LLM 与 SAM 的流程)。
Cambrian-1#

研究动机:许多 MLLM 把主要容量和调参放在语言模型,视觉输入却被压缩成少量低分辨率 token,导致细节、文字和空间关系不足。Cambrian-1 反过来系统研究视觉编码器选择、特征层级和视觉—语言连接器。
核心方法:模型组合多个互补视觉编码器(语义、局部和高分辨率特征),通过 Spatial Vision Aggregator 在空间上对齐、融合并压缩多层 token,再接入开源 LLM。作者还设计视觉语言适配器和高分辨率分支,使同一语言骨干能处理不同尺寸图像。
实验/数据:训练使用公开图文预训练数据、合成/人工筛选的视觉指令数据和高分辨率任务样本;在 MMBench、MMMU、MathVista、OCR、图表、定位及多种视觉问答基准上比较不同编码器、连接器和分辨率设置。
主要结论:视觉编码器组合与空间聚合对 MLLM 质量的影响不亚于更换 LLM,vision-centric 配置在细粒度理解和高分辨率任务上显著增强,并提供了较开放的训练配方。
局限:多编码器需要重复计算和更大显存,工程部署复杂;模型能力仍依赖语言骨干与合成指令数据,视频、音频、长时序和像素级生成不在主要覆盖范围内。
建议配图:论文 Figure 1(Cambrian-1 多视觉编码器与 Spatial Vision Aggregator)。
Qwen2-VL#

研究动机:固定分辨率会裁掉文档和长宽幅图像的内容,均匀采样视频又难以表达时间关系;同时 MLLM 需要更可靠的坐标和细粒度文字理解。Qwen2-VL 以“任意分辨率与时间”作为核心设计目标。
核心方法:Naive Dynamic Resolution 把图像按内容切成可变网格并保留相应数量的视觉 token,减少强制缩放的信息损失;M-RoPE 将位置拆为时间、高度、宽度三轴,让图像和视频共享位置机制。模型还加入窗口注意力、视频时间戳以及框/点坐标 token,支持多图和视频对话。
实验/数据:预训练与指令调优混合多语种图文、文档/OCR、视频字幕和 grounding 数据;评测覆盖通用 VQA、数学图表、OCR、视频理解、指代表达和目标定位,并比较固定分辨率与动态分辨率。
主要结论:动态 token 和 M-RoPE 提升了不同宽高比、长视频及空间定位任务的表现,Qwen2-VL 在中文、多语言和文档场景中更实用,同时保持通用对话能力。
局限:高分辨率或长视频会线性增加 token、显存和延迟,窗口化可能损失全局关系;模型仍会幻觉或误读小字,坐标输出的稳定性依赖指令格式和数据覆盖。
建议配图:论文 Figure 1(Naive Dynamic Resolution 与 M-RoPE 三轴位置编码)。
Qwen2.5-VL#

研究动机:真实应用不仅需要看懂单张图片,还要处理长视频、密集文字、复杂文档和带坐标的操作指令。Qwen2.5-VL 试图把这些能力统一到一个可对话模型,而不是依赖多个专用工具。
核心方法:视觉编码器采用更细粒度的窗口注意力和动态分辨率策略,视频按内容自适应采样并显式编码绝对时间;语言侧延续多模态旋转位置编码,输出边界框、点和时间区间等结构化坐标。训练中加入文档解析、图表/OCR、长视频问答、指令跟随和视觉代理轨迹,使模型能生成动作与工具调用格式。
实验/数据:数据覆盖多语种图文、PDF/表格、合成文字渲染、视频和 GUI 操作轨迹;评测包括通用 VQA、OCR、数学、视频理解、空间 grounding、文档解析及代理任务,并报告不同规模模型的迁移结果。
主要结论:改进后的视觉编码与时间表示显著增强了长视频、文字密集图像和空间指令能力,模型在通用对话之外可以作为文档助手或视觉代理的基础模型。
局限:长序列的推理成本和显存占用仍高,代理动作对页面变化和错误恢复不够稳;报告数据与评测管线复杂,模型在细小文字、罕见布局和开放世界事实性上仍可能出错。
建议配图:论文 Figure 1(Qwen2.5-VL 图像/视频编码与代理输出示意)。
InstructBLIP#

研究动机:BLIP-2 的 Q-Former 用固定 query 抽取视觉信息,但不同任务需要关注不同区域和语义;同时仅靠图文预训练不能保证模型遵循自然语言指令。InstructBLIP 将指令注入视觉抽取阶段。
核心方法:冻结图像编码器和大语言模型,使用 instruction-aware Q-Former:文本指令与 learnable query 一起参与 cross-attention,使 query 选择与任务相关的视觉内容。模型在多个视觉语言任务上统一成指令—回答格式,并用生成目标微调语言模型接口。
实验/数据:作者把多类公开数据集改写为自然语言指令,覆盖图像描述、通用/知识型 VQA、视觉推理、检索和视觉对话;实验比较不同指令模板、冻结策略、query 数量及 BLIP-2 基线。
主要结论:让指令参与视觉特征抽取比只在 LLM 端提示更有效,单一模型能在未见任务上进行零样本或少样本迁移,说明任务条件化的视觉瓶颈具有通用性。
局限:冻结骨干限制了新领域适应,高分辨率定位和 OCR 仍不理想;多任务指令混合易产生任务冲突,模型回答仍可能受语言先验影响而产生幻觉。
建议配图:论文 Figure 1(instruction-aware Q-Former 与任务统一格式)。
LLaMA-Adapter#

研究动机:全量微调大语言模型成本高且容易破坏原有语言能力,研究者需要在有限显存下快速把 LLaMA 扩展到图像对话。LLaMA-Adapter 探索参数高效的视觉注入方式。
核心方法:图像由预训练视觉编码器提取特征,经投影得到视觉提示 token,并通过零初始化 attention 或适配层注入 LLaMA 的高层。文本主干大部分冻结,只更新适配器、视觉投影和少量归一化/偏置参数,再用视觉指令对进行监督微调。
实验/数据:训练使用图文描述和视觉问答/对话指令数据,评测图像描述、VQA、视觉对话及通用指令跟随,并比较全量微调、不同注入层和参数量的效果。
主要结论:极少的可训练参数也能保留 LLaMA 的语言能力并获得可用视觉对话,零初始化使训练初期接近原始语言模型、稳定性较好。
局限:适配器容量有限,复杂视觉推理、OCR 和空间 grounding 弱于全量训练模型;性能依赖视觉编码器与指令数据质量,低资源场景仍可能出现幻觉。
建议配图:论文 Figure 1(视觉提示注入 LLaMA 的适配器结构)。
VisionLLM#

研究动机:检测、分割、姿态和问答通常各自维护模型与输出头,任务扩展和人机交互成本高。VisionLLM 试图用语言指令描述任务,让一个 LLM 负责多种视觉输出并支持开放式组合。
核心方法:视觉编码器产生图像 token,经过连接器送入 LLM;提示中指定任务、类别或区域格式,语言模型以文本 token 和特殊视觉 token 自回归解码。专用的视觉解码器把这些 token 还原为边界框、掩码、关键点等结构化结果,并用统一的视觉指令调优目标训练。
实验/数据:训练混合检测、实例/语义分割、姿态估计、图像描述和视觉问答数据,评测覆盖 COCO、ADE20K、Visual Genome 及多种开放式视觉任务,并做任务指令、输出格式和多任务配比消融。
主要结论:语言接口可以统一不同视觉任务并支持任务间迁移,模型还能在同一对话中根据指令切换输出类型,为视觉系统增加了更灵活的交互方式。
局限:把坐标和掩码序列化为 token 会增加长度与解码延迟,精确几何输出仍不如专用头稳定;多任务数据和格式设计复杂,模型对未覆盖任务、长图像和细粒度文字的泛化有限。
建议配图:论文 Figure 1(VisionLLM 统一视觉指令与多任务解码流程)。