当语言模型学会了“看”,AI的边界正在被重新定义

你是否想过这样一个问题:为什么我们现在能对着ChatGPT发一张图片,让它描述画面内容?为什么Midjourney能根据文字生成逼真图像?

这背后,是一场正在重塑AI世界的技术革命——多模态大模型

今天,我将带你深入这项技术的核心,揭秘一个关键创新:视觉Transformer(ViT)。正是这项技术,让原本只能处理文本的LLM,真正“睁开了眼睛”。


一、为什么LLM需要学会“看”?

大语言模型(LLM)的涌现能力令人惊叹——泛化推理、数学运算、语言理解,这些技能随着模型规模的扩大而自然涌现。

但有一个问题:语言从来不是孤立存在的

想象一下日常交流的场景:

  • 你说“这猫真可爱”,同时指着手机里的猫咪照片

  • 朋友说“我太高兴了”,配合着眉飞色舞的表情

  • 客服说“您的账户已冻结”,语气却充满可疑的诱导

在这些场景中,非语言信息——图像、表情、语调——承载着与语言同等重要的信息量。

这正是多模态模型的用武之地。

多模态模型,顾名思义,是能够处理多种数据类型(每种类型称为一种“模态”)的模型。它可以接收文本、图像、音频、视频等输入,甚至在某些情况下生成这些模态的输出。

如下图所示,一个多模态模型可以同时理解文本描述、代码结构、图像内容和音频信号,这种能力让它在应用场景中远超纯文本模型。


二、视觉Transformer:让图像变成“视觉词汇”

那么问题来了:如何让基于Transformer的LLM理解图像?

要知道,Transformer的“母语”是文本——它天生擅长处理由词元(token)组成的序列。而图像是由像素组成的二维网格,两者之间存在天然的“语言鸿沟”。

传统的解决方案是卷积神经网络(CNN),但CNN与Transformer架构差异巨大,难以无缝集成。

直到2020年,一篇题为《An Image is Worth 16x16 Words》的论文横空出世,提出了视觉Transformer(ViT),彻底改变了游戏规则。

2.1 核心思想:把图像切分成“词”

ViT的核心理念极其巧妙:如果图像不能直接输入Transformer,那我们就把它变成Transformer能理解的形式

具体怎么做?让我们一步步拆解:

第一步:图像分块(Patch)

假设我们有一张512×512像素的猫咪图片。单个像素的信息量有限,但当我们将像素聚合成图像块时,就能逐步提取出更高层次的特征。

ViT沿图像的水平方向和垂直方向进行网格化切割,将完整图像转换为多个子图像块。如下图所示,原始图像被分割成规则排列的“图像块”。

第二步:展平输入

切割后的图像块需要被“展平”,转换成线性序列。这类似于文本的分词处理——图像块在这里扮演了“视觉词汇”的角色。

第三步:线性投影(嵌入)

但有一个关键问题:与文本词汇不同,图像块无法被赋予固定的ID——因为图像的多样性太强了,同一图像块在不同场景中重复出现的概率极低。

解决方案是线性嵌入。系统对每个图像块进行线性投影,将其转换为数值化的嵌入向量。这些向量蕴含了图像的语义信息,成为Transformer可以理解的标准输入格式。

如下图所示,经过分块处理和线性投影后,图像块的嵌入向量将以与文本词元完全相同的方式进入编码器。

2.2 技术细节:为何是16×16?

论文标题“一图胜16×16言”并非随意为之。在原始ViT方案中,图像被分割成16×16的图像块。

为什么是16×16?这相当于将一张图像分割成256个图像块(16×16=256)。对于一张224×224的标准输入图像,每个图像块的大小是16×16像素。

这个粒度经过实验验证,在计算效率和特征提取能力之间取得了最佳平衡。更大的分块会损失细节,更小的分块则计算量过大。

2.3 革命性意义:统一的架构

ViT的真正革命性之处在于:当嵌入向量进入编码器后,视觉与文本模态的处理路径完全相同

这意味着什么?

意味着我们可以将ViT作为“视觉前端”,无缝接入任何基于Transformer的LLM。文本词元进入编码器,图像块嵌入也进入编码器——两者在模型内部使用完全相同的机制进行处理。

这种架构统一性,为多模态模型的构建奠定了重要基础。正是得益于这种跨模态兼容性,ViT成为扩展语言模型多模态能力的关键模块。


三、从ViT到多模态LLM:如何让模型“既看又说”?

有了ViT,我们就有了将图像转化为“视觉词汇”的能力。但如何让LLM真正理解这些视觉词汇,并与文本词汇建立关联?

3.1 联合嵌入:对齐不同模态

最典型的应用场景,是训练跨模态的联合嵌入模型

其核心思想是:将图像和文本映射到同一个向量空间中。在这个共享空间中,“猫的图像”和“cat”这个单词的向量表示应该彼此靠近,而“狗的图像”则应该远离。

如何实现这种对齐?

通常采用对比学习的方法:模型同时处理图像和文本,学习最大化匹配的图像-文本对的相似度,同时最小化不匹配对的相似度。

这种训练方式让模型学会了“看图说话”——给定一张图像,模型能够在文本空间中寻找最匹配的描述;反过来,给定一段文本,模型也能在图像空间中寻找最匹配的图像。

3.2 端到端的多模态大模型

更先进的方案,是将ViT与LLM进行端到端融合。这类模型通常包含三个核心组件:

  1. 视觉编码器(通常是ViT):将图像转换为视觉嵌入

  2. 文本编码器:处理文本输入

  3. 跨模态融合模块:对齐和融合两种模态的信息

通过大规模多模态数据训练,这类模型能够实现真正的“所见即所得”——输入一张图片,模型不仅能描述画面内容,还能回答关于图片的问题,甚至根据对话上下文进行推理。


四、实际应用:多模态LLM能做什么?

多模态能力的加入,大幅拓展了LLM的应用边界。以下是几个典型的应用场景:

4.1 图像问答

用户上传一张X光片,问道:“这个位置有没有异常?”多模态LLM能够“看”图像,结合医学知识给出分析和建议。

4.2 视觉内容审核

在社交平台内容审核中,模型同时分析文字和配图,判断是否存在违规内容。例如,一条写着“打折促销”的帖子,配图却是假冒名牌包——多模态模型能识别这种图文不一致的欺诈行为。

4.3 多模态对话

想象一个旅游助手:用户拍摄一张街景照片,问“这是什么地方?附近有什么好吃的?”模型识别地标位置,结合本地知识库,推荐周边餐厅,并能根据用户后续提问进行多轮对话。

4.4 教育辅导

学生拍摄一道数学题,多模态LLM不仅能识别题目文字,还能理解几何图形,给出分步解答。


五、技术挑战与未来方向

尽管ViT和多模态LLM取得了巨大成功,但仍有诸多挑战需要克服:

5.1 计算复杂度

ViT的自注意力机制计算复杂度与图像块数量的平方成正比。对于高分辨率图像,计算成本会急剧上升。如何高效处理高分辨率视觉输入,仍是研究热点。

5.2 数据效率

多模态模型通常需要海量的图像-文本对进行训练。如何减少对大规模标注数据的依赖,提升数据效率,是实际应用中的关键问题。

5.3 模态对齐

如何让模型真正“理解”不同模态之间的关系,而不仅仅是表面关联,是通往通用人工智能的必经之路。

5.4 生成能力

目前大多数多模态模型擅长理解,但在生成多模态内容(如图像、视频)方面仍有限。真正的多模态模型应该既能“看”也能“画”。


总结

回顾本文,我们从多模态LLM的概念出发,深入探讨了视觉Transformer如何让语言模型“看见”世界:

  1. 多模态能力让LLM突破了纯文本的限制,能够处理图像、音频等多种数据类型,大幅拓展了应用场景。

  2. 视觉Transformer(ViT)通过将图像分割成图像块并进行线性嵌入,实现了与文本处理统一的架构,为多模态模型奠定了基础。

  3. ViT的核心创新在于“图像分词”思想——将图像转化为Transformer可理解的“视觉词汇”,保留了原始编码器的架构特性。

  4. 跨模态联合嵌入通过对齐不同模态的向量空间,让模型能够建立图像与文本之间的语义关联。

  5. 实际应用涵盖图像问答、内容审核、多模态对话、教育辅导等多个领域,展示了多模态技术的巨大潜力。

可以预见,随着多模态技术的持续演进,未来的AI系统将不再局限于单一模态的“孤岛”,而是能够像人类一样,综合运用视觉、语言、听觉等多种感知渠道,实现更自然、更智能的人机交互。

正如Jason Wei等人所指出的:随着模型规模的扩大与智能水平的提升,其技能图谱将持续拓展。而多模态能力,正是这一拓展过程中最令人兴奋的方向之一。

毕竟,当语言模型学会了“看”,它离真正理解世界,又近了一步。

本文参考:图解大模型:生成式AI原理与实战

书籍pdf免费下载地址:https://pan.baidu.com/s/1mTaUQ5czcfGpBM8KvJuS2g?pwd=un44

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐