加载中...
多模态模型能同时理解和生成多种数据类型(文本、图像、音频、视频),而非局限于单一模态。GPT-4V、Gemini 1.5 Pro、Claude 3 Opus 都是多模态大模型,它们重新定义了 AI 助手的交互方式。

| 类型 | 跨模态 AI 系统 |
| 代表模型 | GPT-4V、Gemini 1.5 Pro、LLaVA、CLIP |
| 核心技术 | 对比学习对齐 / 跨模态注意力 / 视觉 Token 化 |
多模态模型面临的核心问题是:如何把不同模态的信息对齐到同一表示空间。目前有两条主要技术路线:
GPT-4V(2023)的内部实现未公开,但从行为推测是把图像 patch 编码后作为额外 token 送入 Transformer,和文本 token 统一处理。[1]
多模态模型最具价值的场景是那些单靠文字描述无法完整传达信息的任务:
音频模态方面,OpenAI 的 GPT-4o(2024)支持实时语音对话,延迟降至 232ms,首次让 AI 实时语音交互体验接近真人。视频理解则是 Gemini 1.5 Pro(百万 token 上下文)的强项,可以分析一小时以上的视频内容。

| 类型 | 跨模态 AI 系统 |
| 代表模型 | GPT-4V、Gemini 1.5 Pro、LLaVA、CLIP |
| 核心技术 | 对比学习对齐 / 跨模态注意力 / 视觉 Token 化 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧