深入解析:MiniMax 开源一个为极致编码与智能体工作流打造的迷你模型——MiniMax-M2

在这里插入图片描述

认识MiniMax-M2

今天我们发布并开源MiniMax-M2——一个为极致编码与智能体工作流打造的迷你模型。

MiniMax-M2重新定义了智能体的效率标准。这款紧凑、高效且经济高效的混合专家模型(总参数量2300亿,激活参数量100亿)专为编码和智能体任务打造精英级性能,同时保持强大的通用智能。仅需激活100亿参数,MiniMax-M2就能提供当前主流模型所具备的端到端复杂设备使用性能,但其精简架构使得部署和扩展变得前所未有的轻松。

在这里插入图片描述


亮点

卓越智能。根据Artificial Analysis的基准测试,MiniMax-M2在数学、科学、指令遵循、编码和智能体工具应用方面展现出极具竞争力的通用智能水平。其综合得分位列全球开源模型榜首。

先进编码。专为端到端开发者工作流设计,MiniMax-M2擅长多文件编辑、编码-运行-修复循环及测试验证的代码修正。在Terminal-Bench和(Multi-)SWE-Bench类任务中的出色表现,证明了其在终端、集成开发环境和跨语言持续集成中的实际效能。

智能体表现。MiniMax-M2能规划执行涉及终端、浏览器、检索系统和代码运行器的复杂长流程工具链。在BrowseComp类评估中,它始终能定位深层资源,保持可追溯的证据链,并能从容应对不稳定操作步骤。

高效设计。经过激活100亿参数(总参数2300亿),MiniMax-M2为交互式智能体和批量采样提供更低延迟、更低成本与更高吞吐——完美契合当前行业向高可部署模型转型的趋势,同时在编码和智能体任务中保持卓越表现。


编码与智能体基准测试

这套综合评估体系测试现实场景中的端到端编码与智能体工具运用:编辑真实代码库、执行命令、浏览网页并交付功能性解决方案。其测试表现与开发者日常在终端、IDE和CI中的体验高度相关。

BenchmarkMiniMax-M2Claude Sonnet 4Claude Sonnet 4.5Gemini 2.5 ProGPT-5 (thinking)GLM-4.6Kimi K2 0905DeepSeek-V3.2
SWE-bench Verified69.472.7 *77.2 *63.8 *74.9 *68 *69.2 *67.8 *
Multi-SWE-Bench36.235.7 *44.3//3033.530.6
SWE-bench Multilingual56.556.9 *68//53.855.9 *57.9 *
Terminal-Bench46.336.4 *50 *25.3 *43.8 *40.5 *44.5 *37.7 *
ArtifactsBench66.857.3*61.557.7*73*59.854.255.8
BrowseComp4412.219.69.954.9*45.1*14.140.1*
BrowseComp-zh48.529.140.832.26549.528.847.9*
GAIA (text only)75.768.371.260.276.471.960.263.5
xbench-DeepSearch7264.6665677.8706171
HLE (w/ tools)31.820.324.528.4 *35.2 *30.4 *26.9 *27.2 *
τ²-Bench77.265.5*84.7*59.280.1*75.9*70.366.7
FinSearchComp-global65.54260.842.6*63.9*29.229.5*26.2
AgentCompany36374139.3*/353034

注:带星号(*)的资料点直接取自模型官方技术报告或博客。其余指标均采用下文所述的评估方法获得。

  • SWE-bench Verified:我们在OpenHands上使用与R2E-Gym(Jain等人,2025年)相同的脚手架,对SWE任务中的智能体进行测试。所有分数均在我们内部基础设施上验证,上下文长度为128k,最大步数100,且未进行测试时扩展。所有git相关内容已移除,确保智能体仅看到障碍点的代码。
  • Multi-SWE-Bench & SWE-bench Multilingual:所有分数为使用claude-codeCLI(最大步数300)作为评估脚手架的8次运行平均值。
  • Terminal-Bench:所有分数使用原始Terminal-Bench仓库(提交94bf692)的官方claude-code评估,8次运行取平均通过率。
  • ArtifactsBench:所有分数为使用ArtifactsBench官方达成、以稳定版Gemini-2.5-Pro作为评判模型的三次运行平均值。
  • BrowseComp & BrowseComp-zh & GAIA(纯文本)& xbench-DeepSearch:报告分数均采用与WebExplorer(Liu等人,2025年)相同的智能体框架,仅对器具描述稍作调整。我们遵循WebExplorer(Liu等人,2025年)使用103样本的纯文本GAIA验证子集。
  • HLE(带工具):所有报告分数均启用搜索工具和Python工具获取。搜索工具采用与WebExplorer(Liu等人,2025年)相同的智能体框架,Python器具在Jupyter环境中运行。我们利用纯文本HLE子集。
  • τ²-Bench:所有报告分数采用"扩展思维器具使用"模式,并选用GPT-4.1作为用户模拟器。
  • FinSearchComp-global:官方结果报告了GPT-5-Thinking、Gemini 2.5 Pro和Kimi-K2的分数。其他模型使用开源FinSearchComp(Hu等人,2025年)框架评估,同时启用搜索和Python应用以保证一致性。
  • AgentCompany:所有报告分数使用OpenHands 0.42智能体框架。

智能基准测试

我们与Artificial Analysis保持一致,该平台采用统一的方法整合具有挑战性的基准测试,以全面评估模型在数学、科学、指令遵循、编码及软件代理使用等领域的综合智能水平。

Metric (AA)MiniMax-M2Claude Sonnet 4Claude Sonnet 4.5Gemini 2.5 ProGPT-5 (thinking)GLM-4.6Kimi K2 0905DeepSeek-V3.2
AIME257874888894865788
MMLU-Pro8284888687838285
GPQA-Diamond7878838485787780
HLE (w/o tools)12.59.617.321.126.513.36.313.8
LiveCodeBench (LCB)8366718085706179
SciCode3640454343383138
IFBench7255574973434254
AA-LCR6165666676545269
τ²-Bench-Telecom8765785485717334
Terminal-Bench-Hard2430332531232329
AA Intelligence6157636069565057

AA: MiniMax-M2的所有分数均按照人工智能分析基准方法(https://artificialanalysis.ai/methodology/intelligence-benchmarking)对齐。其他模型分数均来自https://artificialanalysis.ai/。


为何激活规模至关重要

将激活参数维持在约100亿量级,可优化智能体工作流中"计划→执行→验证"的循环效率,既提升响应速度又降低计算开销:

  • 在编译-运行-测试和浏览-检索-引用链中实现更快的反馈周期
  • 同等预算下协助更高并发量,适用于回归测试集和多种子探索
  • 容量规划更简单,单请求内存占用更小,尾延迟更稳定

简言之:100亿激活参数 = 敏捷的智能体循环 + 更优的单元经济效益

核心优势速览

若您需要前沿级编程与智能体能力,却不愿承担超大模型成本,MiniMax-M2正是理想选择:具备快速推理速度、强大应用调用能力,以及便于部署的轻量化特性。

我们期待您的反馈,并愿与开发者和研究者携手,共同推进智能协作新纪元。

使用方式

  • 基于MiniMax-M2打造的MiniMax Agent现已限时免费开放:https://agent.minimax.io/

  • MiniMax-M2 API 现已登陆MiniMax 开放平台,并限时免费开放使用:https://platform.minimax.io/docs/guides/text-generation

  • MiniMax-M2 模型权重现已开源,支持本地部署使用:https://huggingface.co/MiniMaxAI/MiniMax-M2

本地部署指南

从 HuggingFace 仓库下载模型:https://huggingface.co/MiniMaxAI/MiniMax-M2。我们推荐采用以下推理框架(按字母顺序排列)来部署模型:

SGLang

推荐使用 SGLang部署 MiniMax-M2。SGLang 为 MiniMax-M2 模型给出了完善的 Day-0 承受。请参考大家的SGLang 部署指南获取详情,特别感谢 SGLang 团队的合作承受。

vLLM

推荐使用 vLLM部署 MiniMax-M2。vLLM 为 MiniMax-M2 模型提供了高效的 Day-0 协助,最新部署指南请查看:https://docs.vllm.ai/projects/recipes/en/latest/MiniMax/MiniMax-M2.html。大家也提供了vLLM 部署指南。

推理参数

推荐使用以下参数以获得最佳性能:temperature=1.0,top_p=0.95,top_k=40。

重要说明: MiniMax-M2 是一个交错思考模型。因此,在使用时,必须保留助手回合中的思考内容作为历史消息。在模型的输出内容中,我们使用 <think>...</think> 格式包裹助手的思考内容。使用时,必须确保将历史内容按原始格式传回,切勿删除 <think>...</think> 部分,否则将影响模型性能。

器具调用指南

请参考我们的工具调用指南。

联系我们

发送邮件至 model@minimax.io。

---

技能提升

根据本文内容,精选以下优质课程:

  1. 编译原理之美
    ‍ 宫文学 | 深入理解编译原理核心技术
posted @ 2025-11-26 16:46  clnchanpin  阅读(672)  评论(0)    收藏  举报