社区供稿 | MiniMax-01 开源: 新架构开启 Agent 时代

近日，MiniMax发布并开源了MiniMax-01全新系列模型，其中包含两个模型，基础语言大模型MiniMax-Text-01和视觉多模态大模型MiniMax-VL-01。

论文链接：
https://filecdn.minimax.chat/_Arxiv_MiniMax_01_Report.pdf

全新模型架构、性能比肩GPT-4o

在 MiniMax-01系列模型中，我们做了大胆创新：首次大规模实现线性注意力机制，传统Transformer架构不再是唯一的选择。这个模型的参数量高达4560亿，其中单次激活459亿。模型综合性能比肩海外顶尖模型，同时能够高效处理全球最长400万token的上下文，是GPT-4o的32倍，Claude-3.5-Sonnet的20倍。

超长上下文、开启Agent时代

我们相信2025年会是Agent高速发展的一年，不管是单Agent的系统需要持续的记忆，还是多Agent的系统中Agent之间大量的相互通信，都需要越来越长的上下文。在这个模型中，我们走出了第一步，并希望使用这个架构持续建立复杂Agent所需的基础能力。

极致性价比、不断创新

受益于架构的创新、效率的优化、集群训推一体的设计以及我们内部大量并发算力复用，我们得以用业内最低的价格区间提供文本和多模态理解的API，标准定价是输入token 1元/百万token，输出token 8元/百万token。欢迎大家在MiniMax开放平台体验、使用。

MiniMax 开放平台:

https://www.minimaxi.com/platform

MiniMax 开放平台海外版:

https://www.minimaxi.com/en/platform
MiniMax 的 Hugging Face 主页:
https://huggingface.co/MiniMaxAI

MiniMax-01系列模型在 https://github.com/MiniMax-AI 开源，后续也会持续更新。

基于业界主流的文本和多模态理解测评，结果如下图所示，我们在大多数任务上追平了海外公认最先进的两个模型，GPT-4o-1120以及Claude-3.5-Sonnet-1022。

在长文任务上，我们对比了之前长文最好的模型Google的Gemini。如图(c)所示，随着输入长度变长，MiniMax-Text-01是性能衰减最慢的模型，显著优于Google Gemini。

受益于我们的架构创新，我们的模型在处理长输入的时候有非常高的效率，接近线性复杂度。和其他全球顶尖模型的对比如下：

我们使用的结构如下，其中每8层中有7个是基于Lightning Attention的线性注意力，有1层是传统的SoftMax注意力。

这是业内第一次把线性注意力机制扩展到商用模型的级别，我们从Scaling Law、与MoE的结合、结构设计、训练优化和推理优化等层面做了综合的考虑。由于是业内第一次做如此大规模的以线性注意力为核心的模型，我们几乎重构了训练和推理系统，包括更高效的MoE All-to-all通讯优化、更长的序列的优化，以及推理层面线性注意力的高效Kernel实现。

在大部份的学术集上，我们都取得了比肩海外第一梯队的结果：

在长上下文的测评集上，我们显著领先：

在400万的Needle-In-A-Haystack（大海捞针）检索任务上全绿：

除了学术数据集，我们构建了一个基于真实数据的助手场景中的测试集。在这个场景中，MiniMax-Text-01的模型表现显著领先，具体的对比如下：

在多模态理解的测试集中，MiniMax-VL-01的模型也较为领先：

为方便开发者做更多的研究，我们开源了两个模型的完整权重，https://github.com/MiniMax-AI。这一系列模型的后续更新，包括代码和多模态相关的后续强化，我们会第一时间上传。

选择开源，一是因为我们认为这有可能启发更多长上下文的研究和应用，从而更快促进Agent时代的到来，二是开源也能促使我们努力做更多创新，更高质量地开展后续的模型研发工作。

除了开源和极高性价比的API之外，在海螺AI（国内APP以及网站hailuoai.com），以及海外网站（hailuo.ai）上都可以访问使用。

欢迎访问 MiniMaxAI 的 Hugging Face 主页
https://huggingface.co/MiniMaxAI

本文由 Hugging Face 中文社区内容共建项目提供，稿件由社区成员投稿，经授权发布于 Hugging Face 公众号。文章内容不代表官方立场，文中介绍的产品和服务等均不构成投资建议。了解更多请关注公众号:

如果你有与开源 AI、Hugging Face 相关的技术和实践分享内容，以及最新的开源 AI 项目发布，希望通过我们分享给更多 AI 从业者和开发者们，请通过下面的链接投稿与我们取得联系:

https://hf.link/tougao

（文：Hugging Face）

一	二	三	四	五	六	日
	1	2	3	4	5	6
7	8	9	10	11	12	13
14	15	16	17	18	19	20
21	22	23	24	25	26	27
28	29	30	31

发表评论 取消回复

发表评论取消回复