加载中...
| 类别 | AI术语 |
| 英文名 | Multimodal |
| 领域 | 人工智能 |
多模态(Multimodal)是指人工智能系统能够同时接收、理解、关联并生成两种或两种以上不同信息形态(模态)的能力,常见模态包括文本、图像、音频、视频、三维点云与传感器信号等。多模态学习旨在打破单一模态的信息局限,模拟人类综合运用多种感官认知世界的方式。[1]
多模态模型的核心挑战在于跨模态表征的统一与对齐。技术路径通常包括:为各模态设计专属编码器(如文本用 Transformer、图像用视觉编码器),将异构输入映射为向量表征;再通过对齐机制将不同模态的语义投射至共享的嵌入空间,代表性方法如 CLIP 采用对比学习,使语义匹配的图文对在向量空间中相互靠近。融合策略可分为早期融合、晚期融合与跨注意力融合,后者让一个模态的特征作为查询去注意另一模态。生成式多模态模型则在统一架构内实现跨模态的理解与生成。
多模态的优势在于信息互补:不同模态可相互印证、消解歧义,提升理解的鲁棒性与准确性。其难点包括模态间的异质性、数据对齐与配对的稀缺、不同模态信息粒度与时序的差异,以及训练所需的庞大算力。如何在模态缺失时保持稳健,亦是研究重点。
多模态技术支撑图文问答、图像描述生成、文生图与文生视频、视频理解、跨模态检索、语音助手与具身智能等众多场景。当前主流大模型正加速向原生多模态演进,使其能够无缝处理混合形态的输入输出,是迈向更通用、更贴近人类认知的人工智能的关键方向。
| 类别 | AI术语 |
| 英文名 | Multimodal |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧