加载中...

| 开发者 | OpenAI |
| 发布时间 | 2024年5月 |
| 特点 | 原生多模态,音频端到端处理 |
GPT-4o(o代表omni,全能)的核心突破是将语音处理从「文字转语音→文字推理→语音合成」的三步流水线变为单一端到端模型——音频直接输入,音频直接输出,中间不经过文字转换。这让模型能感知说话者的情绪(音调变化、犹豫、笑声),也能用不同语气(急促、平静、幽默)回应,而不只是机器人般的朗读。
发布时的演示视频展示了GPT-4o在用户解一道数学题时实时观察并「家教式」提问引导,以及识别用户情绪并作出回应,视觉、语音、推理无缝协同。[1]
GPT-4o API定价为输入$5/百万token、输出$15/百万token,是GPT-4 Turbo的一半。这使得原本只有高预算项目才能使用GPT-4级能力的场景大幅扩展。ChatGPT免费用户也能使用GPT-4o(有次数限制),不再需要付费升级才能体验旗舰模型。
2024年底,GPT-4o的视觉能力经历了多轮更新,能更准确地理解图表、截图,并在实时视频流(通过Advanced Voice Mode)中「看懂」用户的环境。

| 开发者 | OpenAI |
| 发布时间 | 2024年5月 |
| 特点 | 原生多模态,音频端到端处理 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧