七月的AI圈,Kimi K3是个绕不开的话题。
2.8万亿参数,全球参数最大的开源模型。

月之暗面自己在官方博客里的表述相当克制 —— 承认整体能力仍落后于Claude Fable 5和GPT-5.6 Sol —— 但这不妨碍它在几个具体场景里展现出令人印象深刻的能力。
几个案例被媒体反复提及:
Arena AI前端编程榜单登顶。

在前端领域,Kimi-K3 在 7 个评估维度中的 6 个领域中均位居第一:品牌与营销、基于参考的设计、数据与分析、消费品、模拟功能以及内容创作工具。仅在“游戏”领域,Kimi-K3 排名第二,仅次于《Fable 5》。
芯片设计。
Kimi K3连续自主运行48小时,基于开源EDA工具和Nangate 45nm工艺库,独立完成了一款专用芯片的构建、优化与验证。芯片面积4mm²,集成146万个标准单元、0.277 MB SRAM,在100MHz频率下完成时序收敛。整个过程完全绕开了Cadence和Synopsys的商用EDA软件。报道称,受此消息影响,Cadence和新思科技美股当日分别下跌9.47%和7.85%。
天体物理复现。
在复现天体物理I-Love-Q关系时,K3自主阅读并交叉验证了20多篇论文,评估了300多种状态方程,生成了3000多行Python代码,仅用约两小时完成 —— 而这项工作通常需要资深研究人员一到两周。
行业研究。
在生成AI ASIC行业研究网站时,K3经历了120轮以上递归改进,完成2800次以上网页搜索与抓取、1100次以上终端数据调用,处理超过1.1万页内容,覆盖87份季度报告和99份原始PDF。
更多的案例看: https://www.kimi.com/blog/kimi-k3
这些案例的共同特征是什么?
不是“Kimi很聪明”这种模糊的赞美,而是一个更具体的事实:它已经能在无人干预的情况下,连续工作、自主决策、跨领域迁移 —— 从编程到芯片设计,从天体物理到行业研究,覆盖的领域跨度相当大。
02
很多人好奇:为什么是月之暗面?
一个经常被提及的线索,是该公司技术副总裁付强在2025年脉脉MAX年度职场盛典上提出的一套“AI Native人才观”。

核心有五层:
-
好奇心 > 永远正确:追求真相的好奇心,优于“我一直是对的”。
-
品味 > 共识:独立思考的审美,优于跟随共识的安全感。
-
AI Scale > 单线程努力:用AI放大自己,优于单线程地拼命干活。
-
学习率 > 经验值:进化速度,优于过去履历。
-
泛化 > 特化:通用智能,优于单一技能。
初看这五条,容易觉得是套漂亮的价值观 —— 放在任何一家公司的文化墙上都不违和。它们和Kimi K3的业绩之间,到底有什么真实的联系?
03
2025年下半年,前OpenAI联合创始人Ilya Sutskever多次公开表示,单纯堆砌预训练算力的时代正在进入平台期。业内确实有不少公司开始调整方向,削减预训练投入,转向后训练和强化学习。
但也有一些玩家选择了另一条路 —— 继续在预训练和大参数方向上投入。
月之暗面是其中之一。他们把K3的参数规模推到了2.8万亿。
阿里巴巴也是其中之一。就在今天(7月19日),阿里千问官宣Qwen3.8即将发布并开源,参数规模同样达到2.4T。官方称其“正在以‘天’为单位持续进化”。
所以与其说月之暗面做了一件“逆势”的事,不如说在行业出现分歧的节点上,不同公司做出了不同的路线选择。一部分收缩预训练,一部分继续加注 —— 这两条路同时在走。
真正值得问的问题是:为什么月之暗面敢在不确定性中做这样的押注?
如果把这件事放在付强那套人才观的框架里看,会发现一个有趣的逻辑 —— 这五层理念,本质上构成了一套降低试错成本的机制。
逐层拆解一下:
-
“好奇心 > 永远正确” —— 降低的是试错的心理成本。如果组织只奖励“正确”、惩罚“犯错”,没人会提出反共识的预训练方向。允许好奇,意味着允许员工在不确定的领域投入精力,而不必担心失败后的问责。
-
“品味 > 共识” —— 降低的是试错的决策成本。当所有人都在往后训练和RL方向涌时,跟随共识是最安全的。但共识本身会制造拥挤 —— 人才溢价、算力成本、数据稀缺性都会急剧上升。独立判断意味着不需要层层审批,个体被信任可以在关键方向上做决策。
-
“AI Scale > 单线程努力” —— 降低的是试错的执行成本。一个人用AI能干原来十个人的活。付强在演讲中以广告投放为例提到,Kimi通过将员工经验“Agent化”,实现了工作流程的自动化。试错需要资源,而AI Scale让同样的资源能做更多的尝试。
-
“学习率 > 经验值” —— 降低的是试错的切换成本。方向错了,能快速转向新领域。在一个模型能力每几个月就跃迁一次的行业里,过去会什么不重要,重要的是多久能重新建立优势。
-
“泛化 > 特化” —— 降低的是试错的领域成本。一种能力能在多个领域复用,意味着在A领域积累的经验可以迁移到B领域。Kimi K3能同时做芯片设计和天体物理复现,本身就是这种泛化能力在模型层面的投射。
五层拼在一起,其实是一套完整的“低成本试错引擎”。
04
这就能解释为什么月之暗面敢在行业普遍收缩预训练的时候反向押注。
不是因为他们“赌对了” —— 而是因为这套机制让他们能用更低的成本试更多的错,在更短的时间内做更多的尝试,然后从尝试中筛选出可行的路径。
Kimi K3不是某一次押注的“成果”,而是这套机制在无数次试错之后“幸存下来”的那条路径。
这就像进化论 —— 不是最强的物种存活,而是对变化响应最快的物种存活。
2025年DeepSeek R1发布后,行业震动。但月之暗面团队的反应不是恐惧,而是兴奋 —— 看到了新的可能性。这种反应模式,本身就说明了“好奇心 > 永远正确”和“学习率 > 经验值”在组织文化中的渗透程度。
05
当然,上面这套分析也需要保持一定的审慎。
首先,人才观与业绩之间的因果关系很难严格证明。 一家公司的成功从来不是单一因素决定的 —— 技术路线、融资能力、市场时机、团队执行力,缺一不可。把Kimi K3的成果完全归因于“人才观”,是一种过度简化。
其次,这套理念的实际落地程度还有待观察。 价值观是一回事,组织在日常管理中是否真正践行是另一回事。“好奇心 > 永远正确”说起来容易,但在绩效考核、晋升决策中是否真的能容忍失败,需要更长的时间来验证。
第三,这套模式的可持续性存疑。 低成本试错需要资源支撑 —— 算力、数据、人才,缺一不可。随着公司规模扩大、商业化压力增加,“允许犯错”的空间可能会被压缩。
但即便如此,月之暗面这套人才观的逻辑仍然值得关注。它提供了一个观察角度:在一个技术路线极度不确定的行业里,组织的核心竞争力可能不在于“做出正确的预测”,而在于“用更低的成本试错”。
06
回到Kimi K3那几个案例。
48小时芯片设计、2小时天体物理复现、2800次搜索生成行业研究 —— 这些不是“炫技”,而是一个组织试错机制的产物。
一个不敢让模型连续跑48小时的团队,做不出能连续跑48小时的模型。一个不鼓励跨领域探索的团队,训练不出能跨领域迁移的模型。一个惩罚失败的组织,培养不出敢于挑战共识的人才。
Kimi K3的能力,某种程度上是月之暗面组织能力的镜像。
在一个大模型能力每三个月就跃迁一次的时代,最强的个人可能不是经验最丰富的,而是试错成本最低的;最强的公司可能不是资源最多的,而是组织试错成本最低的。
这大概就是“AI Native”不那么好听、但更接近本质的底色 —— 不是用AI的人,而是把不确定性当作常态、把试错当作方法论的组织。
浙公网安备 33010602011771号