AIGC标识 一次没有定价的发布:MiniMax M3.1-Flash-Preview 的匿名压测与静默上线

一篇技术读法。对象是 2026 年 9 月 27 日 MiniMax 上线的 MiniMax-M3.1-Flash-Preview。 本文所有数字都标注了来源,口径冲突的地方我直接标出来,不做「取一个看起来最漂亮的数」这种事。


一、先说结论

这不是一次模型发布,这是一次产品内测开关被打开。

MiniMax 在 2026 年 9 月 27 日把 M3.1-Flash-Preview 开进了自家编程智能体 MiniMax Code,9 月 28 日又把它挂到了 Token Plan 订阅下。整个公告只有一句话:「今日在 MiniMax Code 首发,为日常开发而生,快速、可靠,从快速修 bug 到完整功能开发都能胜任」。

然后就没有然后了:

  • 没有模型卡(model card)
  • 没有基准测试报告
  • 没有参数规模
  • 没有公开 API 端点
  • 没有每 token 定价
  • 不开源权重

一个模型发布时官方什么都不说,这件事本身就是信息。 下面我把这条线索拆成三层:它上线前做了什么、上线时官方给了什么、以及这些对调用方(也就是我们)意味着什么。


二、时间线:先当匿名模型跑了一周,再以自己的名字登场

这条线索真正的起点比 9 月 27 日更早。

9 月 23 日前后的四天里,OpenRouter 和 OpenCode 上出现了一个匿名模型,标识符 stealth/space-bunny-alpha。它没有任何厂商署名,没有模型卡,输入输出定价都是 0。但它带着一组相当具体的特征:100 万 token 上下文、文本 / 图片 / 视频三模态输入、工具调用、可调推理档位。

几天之内,它冲上了 OpenRouter 与 OpenCode 的日用量榜首。

然后 9 月 27 日,MiniMax 在自己产品里打开了 M3.1-Flash-Preview。

这个顺序(匿名免费跑真实流量 → 数天后以正式名字静默上线)不是偶然,后面第五节会讲它在商业上的合理性。


三、社区是怎么「认出」它的

这一段是本文技术含量最高的部分,也是最值得学的部分:当厂商不说的时候,怎么判断一个黑盒模型是谁。

开发者用了三套指纹手段,我认为第二套最容易被人忽略。

1. 分词器比对(tokenizer fingerprinting)

把同一批文本分别喂给匿名模型和 MiniMax 已知的模型家族,逐 token 比对切分结果。分词器是模型的「齿痕」——不同厂商、不同代际在 BPE 合并规则、特殊 token 表上几乎不可能完全一致。

一项跑在 OpenCode 上的研究给出 24/24 全匹配;另一项更大规模的测量给出 50/50。

2. 越界输入的报错行为指纹(adversarial probes)

这一套比分词器更狠,也更容易被忽略:故意构造畸形 / 越界输入,然后比对报错格式与截断行为。

为什么这个有效?因为报错文案、错误码、截断策略这些东西通常写在推理网关的适配层里,而不是模型权重里。厂商换模型时经常不换网关;反过来,网关的指纹会泄露它是哪一家的栈。这跟当年靠 TCP 指纹识别操作系统是同一个思路。

3. 官方开源仓库里的「预埋」线索

这是最硬的一条:MiniMax 自己开源的 MiniMax Code 仓库里,测试代码提前写入了 MiniMax-M3.1、一百万 token 上下文,以及 low / high / max 推理档位。

对比一下 Space Bunny 对外公布的特征——1M 上下文、可调档位——高度重合。

严谨表述:目前证据链指向「MiniMax 家族指纹,具体版本未确认」。MiniMax 至今没有确认 Space Bunny 的身份。直接说「Space Bunny 就是 M3.1」是不严谨的,请说「社区指纹高度指向前者」。

有意思的是,上线后暴露出来的档位是五档(low / medium / high / xhigh / max),比当初泄露的三档(low / high / max)更细。也就是说,泄露线索本身就是过期的。


四、能确认的 / 不能确认的

这是本文最实用的一节。我把 M3.1-Flash-Preview 的规格分成两栏——官方明确写了,和完全没说。

项目 状态
上下文窗口 ✅ 1,000,000 token(MiniMax 官方文档)
最大输出 ⚠️ 有来源称 512K,但各站口径不一,官方未明确
输入模态 ✅ 文本 / 图片 / 视频 → 文本输出
工具调用 ✅ 支持 function calling
推理档位 ✅ 五档:low / medium / high / xhigh / max
档位默认值 ⚠️ 不传则按 max 处理
关闭思考 ✅ 不行——传 effort: "none" 或禁用 thinking 返回 400 错误
结构化输出 / JSON Schema 约束 ⚠️ 未报告
每 token 定价 ❌ 未公布
速度(tok/s) ❌ 未公布
任何公开基准跑分 ❌ 未公布
参数量 ❌ 未公布
开放权重 ❌ 无,无 Hugging Face 模型卡
公开 API ❌ 无,只能走 MiniMax Code / Token Plan

先说那个 400。 这是本次唯一一个真正的技术设计决策,不是换标签。

M3 允许你把思考关掉;M3.1-Flash-Preview 不允许。它给了一个五档地板:你可以让模型想得少一点,但不能让它不想。要降延迟、降 token 消耗,你的唯一手段是把档位往下调,而不是把思考整个摘掉。

我倾向于把这理解成一种「产品化的能力下限约束」:既然这个版本是被定位成编程助手交付的,那么「模型不思考时输出质量塌方」这种最容易被用户投诉的状态,厂商干脆从接口层面禁掉了。代价是把开关从调用方手里拿走了。

再说那些空着的格子。 MiniMax 在同一份文档里会给自家其他模型标注速度,唯独这一款只字不提——这不是疏漏,是选择性沉默。一个名字里带 Flash 的模型,如果连一个公开的速度数字都没有,那「Flash」这个词目前承载的只是命名,不是承诺。


五、把 M3 摆在一起看,落差就出来了

M3.1-Flash-Preview 之所以让人不好评估,是因为它的哥哥 M3 是发布得极其标准的那一类。对照着看意义更大:

项目 M3.1-Flash-Preview MiniMax M3
发布时间 2026-09-27 2026-06-01
上下文 1M 1M
架构 未公布 MoE,428B 总参 / 23B 激活,原生多模态
SWE-bench Verified 未公布 80.5%
SWE-bench Pro 未公布 59.0%(官方称超过 GPT-5.5 与 Gemini 3.1 Pro)
Terminal-Bench 未公布 66.0%(Terminal-Bench 2.1)
BrowseComp 未公布 83.5
MCP-Atlas 未公布 74.2%
定价 未公布 $0.30 / $1.20 每百万 token(512K 以内)
速度 未公布 约 100 tok/s(另有来源称 80 tok/s)
开放权重 无 ✅ 有(Hugging Face)
可调用范围 仅 MiniMax Code / Token Plan API + MiniMax Code

M3 的核心叙事是性价比,不是性能冠军:在 SWE-bench Pro 上以同级模型 5%–10% 的成本超过 GPT-5.5 和 Gemini 3.1 Pro;SWE-bench Verified 80.5% 在开源模型里排第二,仅次于 DeepSeek V4 Pro 的 80.6%。

⚠️ 几处口径冲突,我不给准数:

  1. M3 的 $0.30/$1.20 到底是永久价还是促销价——有来源说这是 MiniMax 标注的「永久 5 折」、512K 以上涨到 $0.60/$2.40;也有来源直接把这组数字列为标准价。这个必须以官方定价页为准。
  2. M3 的许可证——多数来源写 MiniMax Community License(商用需署名 + 告知,年收入超 2000 万美元需事先书面授权,禁止军事用途),也有来源标 MIT。很可能是「代码 MIT / 权重走 Community License」这个组合被不同的站点简化错了。自托管之前请自己去看 LICENSE 原文。
  3. Token Plan 的档位价格——两处来源分别给出 $22 / $55 / $132 和 $20 / $50 / $120。我不采用任何一个,你自己登录看。

六、对调用方的三条实际建议

如果只看「这个模型好不好」,上面那些空格会让你无从下手。但把视角换成「我要不要把它接进我的调用层」,风险点就非常具体了,一共三笔账。

1. 身份可变(mutable identity)

今天这条路由指向 M3.1,明天底层 checkpoint 可能被无声替换。你以为在测 A,其实在测 A′。

这意味着:任何基于匿名路由测出来的性能结论,都有有效期,而且是厂商单方面决定的。 你不可能靠这条路做长期回归基线。

2. 数据条款可能和你想的不一样(data terms)

这一条最容易被忽略,而且我自己第一遍看的时候也差点掠过去:

同一条模型,两条路由,条款完全不同。

  • OpenRouter 的匿名 provider 页面明确提示可能保留 prompt 与补全内容;
  • OpenCode 的免费路由则单独标注零保留、不用于训练。

如果你在对比两条路径上的同一个模型,你实际上在对比两种数据处理协议。这个区别对涉及业务代码、内部文档的场景是决定性的——尤其是像我这种平时把公司项目代码往里贴的场景,这一条直接否掉一半用途。

3. 寿命不确定(uncertain lifetime)

预览窗口一结束,端点可能立刻消失;免费价目表随时可以归零。把关键路径绑上去,等于把 SLA 交给一个不承诺任何东西的对手方。

落到工程上:评测归评测,兜底归兜底

社区共识很务实,我完全同意,并且建议把它固化成架构习惯:

把匿名 / 预览端点当评测端点用,不要当生产端点用。

在自有的仓库上把它和主力模型并排跑,换的只是一个模型字符串:

from openai import OpenAI

client = OpenAI(
    base_url="https://your-gateway.example/v1",
    api_key="your-key",
)

# 评测阶段:同一个 base_url,只改 model 字符串
for model in ["stealth/space-bunny-alpha", "your-workhorse-model"]:
    resp = client.chat.completions.create(
        model=model,
        messages=[{
            "role": "user",
            "content": "审查这段代码的边界条件处理,指出可能的下标越界。",
        }],
    )
    print(model, resp.choices[0].message.content)

评测通过之后,再考虑把它放进兜底链的末位——主力模型在前,便宜的预览模型在后,预览端点下线时请求自动落到主力上,业务无感。

这里有个前提,也是我唯一想强调的原则:你的调用层必须做到「换模型 = 改一个字符串」。 只要这个前提成立,那么无论下一个匿名爆款是 M3.1 还是别的什么,你都能在一小时内完成评估,而不是花两周重写集成代码。


七、回到日报那个问题:它为什么没出现在新闻里

补一句元信息,因为这件事和上面的判断是同一回事。

我查了 AIHOT 的两种池子:

查询池 窗口 命中
精选池(selected) 7 天 0 条
全量池(all) 7 天 2 条,均未进精选,热度分 44 / 38

两条 AIHOT 条目加起来就一句话:模型叫 MiniMax-M3.1-Flash-Preview,09-27 上线 MiniMax Code,09-28 进 Token Plan,官方同步发了额度重置卡。

信息量这么低,不是 AIHOT 漏了,是发布的官方口径就只有这么多。 一个发布方自己不给模型卡、不给跑分、不给定价,聚合层和媒体自然也没法写出一篇有信息密度的稿子。

这也解释了它为什么进不了当日重点:新闻价值需要「可被转述的事实」来承载,而这次发布几乎全是空位。


八、结论

现在的 M3.1-Flash-Preview 没法评估,也不该被评估。

  • 一个不给定价的预览,没法做预算;
  • 一个不给跑分的模型,没法横向对比;
  • 一个锁在单一厂商工具里的模型,没法放进你自己的路由里和现有主力并排。

如果你今天在找一个便宜的编程模型,有价格、有 SWE-bench Verified 80.5% 的是 M3,不是 M3.1-Flash-Preview。

但我不会就这么把它划掉,因为它有两个值得盯的信号:

  1. 强制思考地板——五档没有 off 开关,effort: "none" 直接 400。这是一个真实的设计取舍,不是命名游戏。如果这个约束后续被保留到正式版,它会成为 M3.1 系列一个有辨识度的接口性格。
  2. MiniMax 的发布节奏——先用免费匿名路由收真实负载数据,几周后以很凶的价格放完整版。M3 就是先例。

所以重新审视它的时机很明确:等它有了定价和 API 的那一天。 到那时再拿自己仓库的活儿去跑一遍,比现在看它说不说都强。


附录:依据与不确定项

AIHOT 条目(2 条,均未进精选池)

公开网络报道(非 AIHOT 数据,请自行核对)

  • Startup Fortune《MiniMax slips a new coding model into its agent tool without a price tag》
  • Web Pulse 同题报道(含 Space Bunny Alpha 指纹排查细节)
  • BlockBeats《OpenRouter 上线新匿名模型 Space Bunny,多项指纹指向 MiniMax M3.1》
  • dev.to《Space Bunny Tops OpenRouter: A Public Stress Test, and a Lesson for the Routing Layer》
  • DataNorth AI / eesel / modelcompare.dev — M3.1-Flash-Preview 规格与可达性
  • theairankings / tensorfeed.ai / traictory / llmreference / swfte — M3 规格、跑分与定价

明确标注为不确定的项(写进正文时已标 ⚠️ 或 ❌)

  1. M3.1-Flash-Preview 的最大输出长度(各站口径不一)
  2. M3.1-Flash-Preview 的速度与任何基准成绩(官方从未公布)
  3. M3 的 $0.30/$1.20 是标准价还是永久折扣价
  4. M3 的许可证究竟是 Community License 还是 MIT(大概率是「代码 MIT + 权重 Community License」被简化传播)
  5. Token Plan 各档位月费(两个来源不一致)
  6. Space Bunny Alpha 与 M3.1 的同一性(社区指纹强烈指向,MiniMax 未确认;严谨表述为「MiniMax 家族指纹,具体版本未确认」)

防追问要点

  • 本文没有采用任何厂商自己没公布的数字来「补全」规格表,空格就是空格。
  • 「Flash」在本文中不作为性能事实使用,只作为命名观察。
  • 三模态输入、1M 上下文、五档 effort、thinking 不可关闭,这四项是有官方文档或可复现行为支撑的。
  • 所有价格、跑分在引用前请回第三方原文与官方文档核对;本文不构成采购建议。

写于 2026-09-29。若后续 M3.1 公布定价与公开 API,本文第四、五节与结论需要整体重写。

posted on 2026-09-29 11:11  fox_charon  阅读(73)  评论(0)    收藏  举报

导航