一文搞懂多模态大模型:视觉-语言模型(VLM)

人类通过眼睛看世界,通过语言描述世界。当我们看到一朵盛开的玫瑰,大脑会自动将视觉信息转换为「红色」「花朵」「美丽」等语言概念。反过来,当听到「夕阳西下」这个词汇时,脑海中会浮现出温暖的橙色天空画面。

视觉与语言在人类认知中是天然融合的,而让机器也具备这种跨模态理解能力,正是视觉-语言模型(VLM)要解决的核心问题。

VLM 工作原理与关键挑战示意图(Encord)

1- 核心挑战:视觉像素与语言符号的鸿沟

**计算机视觉模型(Computer Vision,CV)只会「看」不会「说」——它能识别图像中有一只猫,但无法用自然语言描述这只猫的特征;而自然语言处理模型(Natural Language Processing,NLP)**只会「说」不会「看」——它理解「猫」这个词的含义,但不知道真实的猫长什么样。传统 AI 的局限性在于模态割裂,这种割裂导致了一个严重问题:机器无法建立视觉内容与语言描述之间的语义对应关系。

CV 与 NLP 模态割裂示意图(Moosa Ali)

**多模态视觉-语言模型(Vision-Language Model, VLM)**则是一种能够同时理解图像(或视频)与文本,并建立两者关联关系的模型。它突破了传统单一模态(纯文本或纯视觉)模型的局限,实现跨模态的联合推理、生成与分析能力。

视觉语言模型(VLM)概念示意图

2- VLM 面临的挑战:如何让机器建立起视觉感知与语言理解之间的桥梁?

2.1- 视觉世界:连续的像素宇宙

视觉信息是连续、稠密、高维的。一张 224×224 的 RGB 图像包含 150,528 个连续数值,每个像素的 RGB 值都在 0-255 之间连续变化。更重要的是,视觉信息具有强烈的空间结构性

# 视觉信息的连续性示例
import torch

image = torch.randn(3, 224, 224)  # RGB图像
print(f"图像数据点数量: {image.numel()}")  # 150,528个连续值

# 相邻像素的语义相关性
center_pixel = image[:, 112, 112]      # 中心像素
neighbor_pixel = image[:, 112, 113]    # 相邻像素
# 在自然图像中,相邻像素的值通常非常接近

2.2- 语言世界:离散的符号空间

与连续的视觉像素不同,语言世界是离散、符号化的。文本通过分词器(Tokenizer)被切分为词表中的离散 token,每个 token 对应唯一的编号,模型在有限的符号空间中进行理解与生成。要让机器真正看懂图像,第一步就是把这两种本质不同的信息表示统一起来。

VLM 统一多模态表示示意图

2.3- 序列结构性

无论是语言还是视觉,信息都具有序列结构:文本天然是 token 序列,图像也可以被切分为按空间位置排列的 patch 序列。这种序列化表示为跨模态的统一建模提供了基础,也是「万物皆可 Token 化」思路的起点。

视觉与语言的序列结构示意图

3- VLM 解决的方法:生成式统一架构 + 万物皆可 Token 化

经过多年发展,VLM 已进入第三代:生成式统一架构。这一阶段的代表性模型包括 GPT-4V、LLaVA、Qwen2.5-VL 等,它们不仅能理解视觉内容,更能基于视觉输入生成自然语言响应,实现真正的视觉-语言对话。

GPT-4V、LLaVA、Qwen2.5-VL 等第三代 VLM 示意图

通过建立统一的多模态表示空间,将不同模态的信息转换为统一的 token 表示,然后在同一个架构中进行联合建模和推理。既然大语言模型擅长处理 token 序列,那么就把所有模态的信息都转换成 token。

这种设计让模型能够在 token 级别建立跨模态的注意力连接,实现真正的视觉-语言理解。

4- 架构设计:视觉-语言模型的技术路线

  • 自适应视觉 Token:支持任意分辨率和宽高比的图像输入,动态生成合适数量的视觉 token
  • 统一注意力机制:文本 token 和视觉 token 在同一注意力矩阵中交互,实现深度跨模态理解
  • 多粒度视觉表示:同时捕捉像素级细节和语义级概念,支持从 OCR 到场景理解的多层次任务
  • 分阶段训练策略:第一阶段冻结视觉编码器和语言模型,只训练投影层;第二阶段冻结视觉编码器,微调投影层和语言模型——即先进行特征对齐预训练,再进行指令微调
  • 高效参数利用:新增参数量不到总参数的 5%,却能实现完整的视觉对话能力

LLaVA的成功证明了「组合创新」的价值——通过巧妙的工程设计,将成熟组件组合出新的能力。

LLaVA 架构代码解读示意图(Allen Liang)

5- 代表性 VLM 模型

5.1- GPT-4V:统一架构的技术突破

**GPT-4V 的核心创新在于彻底打破了模态边界,实现了真正的统一多模态架构。**不同于传统的「视觉编码器 + 语言解码器」拼接方式,GPT-4V 将视觉和语言信息在同一个 Transformer 中进行统一处理。

5.2- Qwen2.5-VL:本土化与推理能力强化

  • 动态分辨率处理:支持 256×256 到 1280×1280 的任意分辨率,采用分块策略处理超高分辨率图像
  • 增强推理架构:引入多步推理机制,支持「观察→分析→推理→结论」的完整思维链路
  • 中文视觉优化:专门优化了对中文文字、标志、文档的理解能力

**多步推理能力是 Qwen2.5-VL 的突出特点。**模型能够先描述图像内容,再分析关键信息,最后得出推理结论,整个过程逻辑清晰、步骤完整。如图所示:视觉特征输出后,传递到「Qwen2.5 LM Decoder」(基于通义千问语言模型的解码器),完成多模态推理(如图像描述、事件问答)。图中显示了完整的处理流程:视觉编码器提取特征→语言模型解码→生成文本输出(如结构化数据、时间点定位等)。

Qwen2.5-VL 多步推理流程示意图