Kimi K3 把开源追赶的故事,从「便宜」改写成「能打」
先说结论
7 月 16 日 Moonshot 放出 Kimi K3,值得长期跟踪的不是「2.8 万亿参数、中国最大开源模型」这个体量数字,而是一个判断的转向:过去两年,中国开源模型对西方闭源前沿的冲击,主要是「便宜」的故事;从 K3 开始,它多了一根「能力」的轴。 提出这个判断的是 Nathan Lambert(Interconnects,7 月 20 日)——他把开源到闭源的性能时差,从业界争论的「6–9 个月」下修到「3–5 个月」。我认同这个方向,但要给它三个刹车:这是前端偏好榜的快照、权重还没真正放出、K3 上线 48 小时就被 GPU 算力卡住停了订阅。能力追近是真的,可持续交付是另一回事。
事情是怎么发生的
K3 是稀疏 MoE 架构,2.8 万亿总参数、1M 上下文,权重预计 7 月 27 日前后完整放出。真正引爆讨论的是 Arena 的前端代码盲测榜:K3 以 1679 分登顶,压过 Claude Fable 5(1631)、GPT-5.6 Sol(1618)和 GLM-5.2(1587),在 7 个前端子项里拿下 6 项第一,比上一代 K2.6 的第 18 名一次跳了 17 位。
但要把话说全:在 Artificial Analysis 的综合智能指数 v4.1 上,K3 是 57.1 分、排第 4,落后 GPT-5.6 Sol(58.9)和 Claude Fable 5,只领先 Opus 4.8。Moonshot 自己也承认,整体性能「仍不及最强的闭源模型」。所以榜首是「前端」的榜首,不是「前沿」的榜首。Lambert 的观点力度恰恰在这里——他不谈蒸馏抄袭那套叙事,直接说「中国公司在造模型这件事上,和领先的美国公司一样好」,并给出一个更狠的经济判断:开源模型对闭源大厂是「减速主义」的(压毛利、拖慢再投资与融资节奏),对整个经济的 AI 扩散却是「加速主义」的。
为什么重要
因为它改写了辩论的坐标。此前「开源 vs 闭源」的争论几乎都锚在价格:开源便宜、闭源强。K3 把「能力差多久」这个更硬的问题摆上桌,而且答案从「以年计」变成「以月计」。对做系统、做落地的人,这个时差决定了一件很实际的事:你还要不要为闭源 API 的能力溢价买单,能不能改用可本地部署、可微调的开源前沿模型。 差距是 5 个月还是 5 年,两种世界的工程选型完全不同。
我的正反评价
正面:Lambert 把「便宜→能打」这根新轴点出来,是准确的。前端代码盲测是人类偏好投票,不易靠刷题作弊,K3 从第 18 到第 1 的跃迁是真信号。他拒绝「中国模型=蒸馏」的懒惰归因,也符合我这两年读代码的观感——工程与训练配方的差距在实打实地收窄。
反面,三点:其一,别把前端榜当前沿榜。榜首前 3% 的分差极窄,前端偏好高度受审美与交互模板影响,和长链推理、科学求解不是一个能力维度;单榜登顶不等于综合登顶,综合榜 K3 仍是第 4。其二,「3–5 个月」是快照不是定论。它是某一时刻的基准测试差,闭源方一次迭代就可能重新拉开;把一个瞬时读数当成稳定结论,正是我在色彩科学里反复警惕的 metric trap。其三,能力追近 ≠ 能交付。K3 上线两天就撞上 GPU 上限、暂停订阅,暴露的是算力受限下开源策略的真实瓶颈——权重放出前,很多结论其实是有条件的。
对研究、教学和影像系统的启发
对我们做颜色与 ISP 的人,落点很具体。一是选型窗口打开了:near-frontier 的开源 VLM 若能本地跑、可微调,实验室做颜色推理、光源判读、ISP 参数解释这类任务,就不必被闭源 API 锁死,学生也能在可控成本下复现。二是那根「能力轴」要自己量:别人替我们评的是前端 Elo,我们该问的是——开源 VLM 在同 CCT 异谱、色貌一致性这类颜色难题上到底行不行,得用自己的 benchmark 去测,而不是信通用榜。三是教学素材现成:K3 前端登顶、综合第 4 这个反差,是讲「基准测试选择即结论」的绝佳案例——换一张榜,冠军就换人。这和我一直提醒学生的一致:先看清指标测的是什么,再决定它值不值得信。