多模态(Multimodal)指人工智能模型能同时理解和生成文字、图片、语音、视频等多种信息形式的能力。多模态大模型可以看图答题、听懂语音、生成视频,是当前 AI 发展的核心方向之一。

| 类型 | 人工智能技术概念 |
| 英文名 | Multimodal / Multimodality |
| 涉及模态 | 文本 图像 音频 视频 |
| 代表模型 | GPT 系列 Gemini Claude 等 |
| 应用领域 | 图像理解 语音交互 内容生成 |
多模态(Multimodal)是人工智能领域的一个概念,指模型能够同时处理和理解文字、图像、音频、视频等多种不同形式的信息,而不再局限于单一的文本输入输出。
「模态」可以理解为信息的载体形式:文字是一种模态,图片、声音、视频各是另一种模态。早期的语言模型只能读文字、写文字,属于单模态;而多模态模型打通了这些界限,可以「看图说话」「听声辨意」,更接近人类感知世界的方式——人类本来就是通过视觉、听觉、语言等多种渠道综合理解信息的。
近年来,主流 AI 厂商的旗舰模型普遍走向多模态,例如 OpenAI 的 GPT 系列、谷歌的 Gemini、Anthropic 的 Claude 等都支持图像理解,部分还支持语音对话和视频生成。多模态被广泛认为是通向更通用人工智能的必经之路,也是 AIGC 应用爆发的技术基础。
多模态模型通常先用编码器把图像、音频等转换成与文字类似的向量表示(可类比为统一「翻译」成模型内部语言),再在同一个模型中联合训练与推理。原生多模态模型从训练之初就混合多种数据,而不是事后拼接多个单模态模型,因此跨模态理解能力往往更强。
问:多模态模型和普通大语言模型有什么区别?答:普通大语言模型只能处理文字,多模态模型在此基础上还能理解或生成图片、语音、视频等内容,输入输出的形式更丰富。
问:多模态有哪些实际用途?答:常见场景包括拍照识物与解题、文档和截图内容提取、AI 绘画与视频生成、语音助手、辅助视障人士描述画面等。
问:多模态就是 AIGC 吗?答:不完全等同。AIGC 强调「AI 生成内容」这一应用形态,多模态强调模型能处理多种信息形式;多模态能力让 AIGC 从纯文本扩展到了图像、音频和视频。

| 类型 | 人工智能技术概念 |
| 英文名 | Multimodal / Multimodality |
| 涉及模态 | 文本 图像 音频 视频 |
| 代表模型 | GPT 系列 Gemini Claude 等 |
| 应用领域 | 图像理解 语音交互 内容生成 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧