加载中...
法国AI公司Mistral AI于2023年12月发布的开源混合专家模型,8x7B版本在性能上接近GPT-3.5,但推理成本低得多;2024年的Mixtral 8x22B进一步缩小与GPT-4的差距,是开源社区最受欢迎的高效模型之一。

| 开发者 | Mistral AI |
| 发布时间 | 2023年12月 |
| 架构 | 稀疏混合专家(Sparse MoE) |
Mixtral采用稀疏混合专家(Sparse MoE)架构:模型共有8个「专家」前馈网络,每次前向传播时由路由器选择最合适的2个专家激活,其余6个不参与计算。总参数量46.7B,但每次推理只使用约12.9B的活跃参数,使得推理速度接近7B模型,同时保留了接近70B模型的知识容量。
这种「大脑袋、小激活」的设计让Mixtral在同等推理成本下能提供更强的能力——在大多数基准上超越了Llama 2 70B,在代码任务上接近GPT-3.5 Turbo。[1]
Mistral AI由前DeepMind和Meta研究员创办,是欧洲最受瞩目的AI公司,2023年估值达20亿美元。公司策略是开源旗舰模型获取开发者生态,同时提供商业API和企业私有化部署服务盈利。
2024年推出的Mistral Large是闭源的顶级模型,与Claude 3 Sonnet和GPT-4 Turbo竞争企业市场。Mistral还与微软达成合作,通过Azure提供模型服务,是欧洲AI在全球市场布局的重要棋子。

| 开发者 | Mistral AI |
| 发布时间 | 2023年12月 |
| 架构 | 稀疏混合专家(Sparse MoE) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧