多模态大模型是能同时理解文字、图片、音频、视频等多种信息的人工智能模型,让 AI 不仅会读写文字,还能看图、听声、识视频,是大语言模型的升级形态,广泛用于图像问答、语音助手、内容创作等场景。

| 类型 | 人工智能模型 / AI 术语 |
| 英文名 | Multimodal Large Model(MLLM / LMM) |
| 代表模型 | GPT 系列、Gemini、Claude、通义千问等 |
| 核心技术 | Transformer、跨模态对齐、预训练 |
| 应用领域 | 图像问答、语音交互、视频理解、内容生成 |
多模态大模型(Multimodal Large Model,常缩写为 MLLM 或 LMM)是指能够同时理解乃至生成文本、图像、音频、视频等多种信息形式的大规模人工智能模型,可以看作大语言模型向「看得见、听得懂」方向的延伸。
传统的大语言模型只能处理文字,而人类接收信息的方式天然是多模态的:我们同时用眼睛看、用耳朵听。多模态大模型的目标就是让 AI 具备类似能力——给它一张图片,它能描述内容、回答问题;给它一段语音或视频,它能听懂并总结要点。
在技术实现上,多模态大模型通常由多个模态编码器(如视觉编码器、音频编码器)、一个大语言模型主干,以及负责「翻译」的模态对齐模块组成。不同模态的数据被映射到统一的表示空间,模型便可以在同一套推理能力上处理文字之外的信息。
目前主流的旗舰 AI 模型基本都已多模态化,例如 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude,以及国内的通义千问、文心一言、GLM 等,均支持图文混合输入,部分还支持语音实时对话和图像生成。
多模态大模型的应用非常广泛:拍照识题、票据和文档识别、无障碍读图、电商图片描述、视频内容审核、语音助手、医疗影像辅助分析等。对普通用户来说,最直观的体验就是在 ChatGPT、豆包等应用里直接发图片提问。
问:多模态大模型和大语言模型有什么区别?答:大语言模型只处理文字;多模态大模型在其基础上增加了图像、音频等输入输出能力,可以理解为「会看会听的大语言模型」。
问:多模态大模型能生成图片吗?答:取决于具体模型。有些只支持理解图片,生成图片需要调用专门的文生图模型;也有一体化模型可以直接生成图像或语音。
问:普通人如何用上多模态大模型?答:主流 AI 聊天应用大多已支持发送图片提问,直接上传图片并用文字描述需求即可。

| 类型 | 人工智能模型 / AI 术语 |
| 英文名 | Multimodal Large Model(MLLM / LMM) |
| 代表模型 | GPT 系列、Gemini、Claude、通义千问等 |
| 核心技术 | Transformer、跨模态对齐、预训练 |
| 应用领域 | 图像问答、语音交互、视频理解、内容生成 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧