7月16号晚上,Kimi K3 悄悄上线了。为什么说"悄悄"?因为月之暗面先是偷偷把它化名"Kivine"扔到了大模型竞技场 Arena 上,被人扒出来之后才发的公告。这操作挺鸡贼的,但不得不说,效果拉满了——排行榜一出来,全网炸了。
我用了三天,拿它写了代码、做了文档分析、跑了几个实际项目任务,今天来聊聊真实感受。不吹不黑,优缺点都说明白。
先放一组硬数据

你看这组数据就知道:K3 综合排第三,但在编程这个细分赛道上,它真的能把 Fable 5 和 GPT-5.6 Sol 按在地上摩擦。而且价格只有人家的三分之一。
优点:确实有几把刷子
- 编程能力:从"会写"变成了"能干活"
这是我最佩服 K3 的地方。之前用 K2.6 写代码,它能写,但你得盯着它,时不时要纠正。K3 不一样,我丢给它一个中型项目的重构任务,它能自己读代码、理解上下文、分步骤改、跑测试、修报错,一条龙干完。
有个开发者说得特别好:“K3 最强的不是生成一个函数,而是能把代码、研究、文档和工具调用串成一条更长、更稳定的任务链。” 我深有同感。
在 Terminal-Bench 2.1(终端编程和 Agent 工作流测试)里,K3 拿了 88.3%,只比 GPT-5.6 Sol 差 0.5 个百分点。这意味着在真实开发场景里,它已经跟最顶级的闭源模型几乎打平了。
- 前端编程:全球第一,不是吹的
Frontend Code Arena 是匿名盲测,用户看不到模型名字,纯看结果投票。K3 拿了 1679 分,全球第一,7 个细分领域拿了 6 个第一——品牌营销、参考设计、数据分析、消费产品、模拟、内容创建工具,只在游戏领域输给了 Fable 5。
上一代 K2.6 排第 18。一代产品,狂涨 17 名,直接干到第一。这个进步幅度,离谱。
-
100 万 Token 上下文:真能用,不是摆设
很多模型号称支持长上下文,但实际一塞满就降智。K3 的 100 万 Token 上下文我实测过,扔了整个项目代码库进去(大概 40 万 Token),它确实能记住前面的内容,不会前后矛盾。做长文档分析、大代码库重构的时候,这个窗口大小真的能省很多事。 -
价格:国产模型终于不靠低价取胜了
K3 的定价是输入 $3、输出 $15 每百万 Token。听起来比之前的国产模型贵了不少,但跟 Fable 5(输出 $36)和 GPT-5.6 Sol(输出 $21)比,还是便宜了一半多。
而且编程场景下缓存命中率超过 90%,实际输入成本大约只有标价的四分之一。算下来,K3 的实际使用成本大概是 Fable 5 的三分之一。
第一次有国产模型不靠"白菜价"打市场,而是靠能力定价。这其实是一种自信。
- 不用FQ,直接用
对国内用户来说,这个真的太重要了。http://kimi.com 直接打开就能用,不需要任何网络工具,不需要海外信用卡,不需要注册海外账号。Claude 和 GPT 你还得折腾半天中转站、代理、API Key,K3 这边登录就完事了。
缺点:也别捧太高,问题不少
- 慢,是真的慢
这是所有用户反馈里最一致的一条。K3 比竞品慢两到三倍,这不是夸张,是真实体感。
同样一个编程任务,Claude Fable 5 可能 30 秒出结果,K3 要等 1 分多钟。如果你是那种"问了就想马上看到答案"的性格,K3 会让你很着急。
尤其是当前默认思考强度是 max(极致),什么都往深了想。简单问题也给你想半天,杀鸡用牛刀。官方说后续会增加 low 和 high 两种模式,但目前还没上线。
- Token 消耗猛,账单比预期高
K3 很能"说"。同一个任务,它的输出长度明显比其他模型长,加上思考过程也要算 Token,实际消耗量比 K2.6 大不少。
有用户吐槽:“成品偶尔很惊艳,但 token 消耗猛,订阅转眼见底。” 我自己的感受差不多,用 K3 跑了一下午的编程任务,消耗的 Token 够我用 K2.6 跑两天。
虽然单价便宜,但用量大,算总账其实并不一定比竞品省。就像油耗低的车,但你跑的里程多,油费照样高。
- 事实可靠性:偶尔一本正经地胡说
K3 在事实准确性上还有提升空间。问它一些需要精确事实的问题时,它有时候会给出看起来很专业但实际是错的答案。
官方评测里,K3 在事实可靠性和边界控制上只拿了 6.5 分(满分10分),是所有维度里最低的。代码能力 9 分,长上下文 9 分,但事实可靠性只有 6.5 分。
这意味着:写代码可以用 K3,但如果让它做事实核查、数据验证这类工作,你得自己再验一遍。
- 输出太啰嗦
K3 的回答普遍偏长。问它一个简单问题,它能给你写一篇小论文。有时候你只是想要一个简短的答案,它给你来个"首先"“其次”"综上所述"全套。
这个问题的反面是——它的详细解释有时候确实有帮助,特别是学新东西的时候。但日常快速问答场景下,真的有点烦。
- 跟闭源顶级模型还有差距
月之暗面自己也没回避这一点。官方原话:“虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。”
综合智能指数差 3 分,这 3 分在高端任务上就能体现出差距。特别是那种需要极强推理能力的复杂任务,K3 偶尔会跑偏,而 Fable 5 和 GPT-5.6 Sol 能稳住。
数据对比总结

什么人该用,什么人别用
适合用 K3 的:
程序员,尤其是前端开发和中型项目重构
需要处理超长文档、大代码库的人
不想折腾FQ、中转站的国内开发者
预算有限但需要接近顶级模型能力的人
不适合用 K3 的:
需要快速响应的客服、实时对话场景
对事实准确性要求极高的任务(法律、医疗等)
只需要简单问答的人(K2.6 就够了,还便宜)
对 Token 消耗敏感的大规模调用场景
我的结论
用了三天,我对 K3 的评价是:国产开源模型的里程碑,但不是万能药。
它的编程能力和长上下文处理确实惊艳,前端编程全球第一不是白拿的。但慢、费 Token、偶尔胡说这些问题也是真实的。它不是那种"什么都能干好"的模型,而是在特定场景下(编程、长文档、前端开发)能跟闭源顶级模型掰手腕的模型。
月之暗面自己也说了,K3 只是开始,后面还会继续优化。7月27号完整权重开放后,社区的力量进来,K3 还能进化到什么程度,我挺期待的。
最后说句大实话:如果你是搞编程的国内开发者,K3 值得试。它不是完美的,但在这个价位、这个能力水平上,它是目前最好的选择之一。
本文使用的数据是由下面链接的AI大模型提供:
www.xinyuntoken.com/sign-up?aff=ix9L
浙公网安备 33010602011771号