7月17日,北京月之暗面科技有限公司发布新一代开源大模型Kimi K3。这款总参数2.8万亿、原生搭载视觉理解、支持百万词元超长上下文窗口的模型,一举拿下Frontend Code Arena编程榜单榜首,实现开源模型首次超越头部闭源模型登顶。发布短短数日,Kimi K3成为全球人工智能行业焦点。这一模型底层创新逻辑是什么?记者走进月之暗面深入探寻。
革新底层算法
Kimi K3一经发布,凭借硬核性能迅速引发全球关注:SpaceX首席执行官埃隆·马斯克在相关评测报道的评论区留言称“令人印象深刻”,并将Kimi K3列为自家Grok 4.5模型重点追赶目标;OpenAI战略负责人迪恩·鲍尔直言,该模型性能无法依靠简单蒸馏或类似手段实现,复杂智能体编程场景下,性能对标2026年一季度全球顶尖公开模型。
随着大量新用户涌入,平台自7月19日起宣告暂停C端新用户订阅,优先保障存量用户使用体验。月之暗面Kimi企业业务负责人黄震昕坦言,尽管团队提前筹备了扩容预案,但市场热情超乎预期。“我们非常努力地通过模型效能优化和算力供给尽快解决问题,还在努力恢复中。”
一款大模型何以引发如此热度?用户反映,Kimi K3很聪明。这份聪明劲儿,不同于众多靠后天学习打磨补齐能力的模型,其核心优势在于原生具备超强长程高难度复杂推理能力,可完成高难度芯片设计、一句话生成完整游戏、整合数十份研报产出图文并茂的行业深度报告等硬核生产力任务。从编程到金融、法律、科研、商业航天等专业赛道,大模型把人们从繁琐工作中解放出来。
“Kimi K3最本质的能力提升一定是参数量带来的,我们一直坚持底层架构技术创新,而不只是工程效率的优化。”黄震昕总结,性能质变的根基,源于企业迭代了行业内多项沉寂多年的基础核心技术,依托万亿级参数规模叠加底层算法革新,实现模型综合能力跨越式提升。
“我们的目标从来不是做高性价比的雕琢。”黄震昕说。月之暗面英文名“Moonshot”是登月之意,彰显了企业理念——专注攻克通用人工智能(AGI)领域无人涉足的硬核难题,完成如同登月一般“难而正确”“难而有价值”的技术探索。
破解算力瓶颈
2.8万亿参数背后,是算力约束下的技术创新。
2017年,谷歌研究人员提出Transformer架构,其中的注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”,注意力机制则决定模型“会不会抓重点”。Kimi K3的突破,不只是“装得更多”,更在于处理信息的方式更高效。
在算力约束下实现效率质变,两大自研核心技术成为月之暗面关键抓手。其中,一个是KDA混合线性注意力机制。传统全注意力机制处理长文本时,文本量翻番,计算成本将提升4倍,极大限制超长内容处理能力。通过注意力机制创新,同等算力条件下,模型能读取更长文本、完成更复杂任务,适配智能体时代高频出现的长程工作需求。
另一个是注意力残差技术。模型越大、层数越多,信息传递的“路程”就越长,容易出现信号衰减、失真问题。这项技术改进了信息在不同网络层之间的传递和复用方式,为超大模型装上运行“稳定器”,让2.8万亿参数能稳定高效地用起来。
前者让“超长文本怎样算得更省”,后者让“超大模型怎样训得更稳”。二者相辅相成,标志月之暗面从单纯堆砌参数进阶至原创基础架构、底层算法自主创新层面。
这些技术突破的初衷,旨在破解行业共性难题。大模型领域有一个影响深远的“大力出奇迹”(Scaling Law)定律。其核心在于,只要不断加码算力、扩充数据、提升参数,模型智能水平将稳步提升。但当下,模型算力投入扩大100倍,才能获得能力增强10倍。在全球算力紧缺、数据见顶的今天,粗放扩张已面临瓶颈。
“Kimi致力于做最大的模型,一直在寻求将能源转化成智能的最优解。解决问题的钥匙,就是底层的技术创新。”黄震昕给出的答案很明确:“我们首先要做到最强的模型;其次是尽可能通过底层技术创新、尽可能多的算法创新,在有限的算力资源下做出最强模型;最终目标是让AGI普惠全世界。”
这些企业共识早已付诸实践:围绕Token效率革命,自研新型二阶优化器,同等15万亿Token训练预算下,模型智能密度较行业通用方案提升1倍,同样性能下训练功耗直接减半,让有限的数据可以发挥出更高的智能;自研Kimi Linear长上下文架构,补齐传统线性注意力长距离推理性能短板,牢牢抓住衡量高端大模型的核心标尺——长时程复杂任务执行能力。
探寻最优路径
Kimi K3发布,被高盛研报解读为中国大模型走向定价权的新节点。此前,中国大模型主要靠性价比进入全球市场;未来,中国模型可能凭借前沿能力进入全球开发者的核心工作流。摩根士丹利则关注到,Kimi K3的API价格处于中国头部模型高位,并认为较高定价对大模型市场格局具有积极意义。
“我们既能做非常前沿的研究,又愿意把模型开源出来、把技术开放出来,这在全球来看是其他国家的企业很难做到的。”月之暗面创始人杨植麟说。
创立伊始,月之暗面就贴着“开源”标签。很多创新技术在模型面世前,已被写进技术报告,开源给全世界。而大模型是一个高投入的赛道,可持续商业化是技术长期迭代的根基。开源大模型怎样做好商业化,是企业必须面对的问题。
“从战略上来讲,公司一直坚定于‘模型公司一定要做模型’。模型的强度是企业一切业务的根基。”黄震昕认为,模型能力强到一定程度后,智能体(Agent)包括C端市场就是自然而然的事情。另外,企业也有大量的C端智能体产品,依托海量用户端智能体真实使用反馈反向迭代优化模型,对齐用户真实需求与模型能力边界。
“开源和闭源不是竞争关系,是面向不同客户群体、适配多元业务需求的并行发展路径。”黄震昕说,这次Kimi引人瞩目,就在于彻底撕掉“开源模型等于低价廉价”的固有标签。“开源模型不该贴上低价标签,我们没有陷入价格战,反而把模型的能力和商业化价值拉高了一档。”
面向未来,Kimi也早已做出取舍:放弃娱乐性场景,离开生图生视频赛道,聚力打造编程、金融、法律、科学研究等高门槛生产力场景。所有的技术创新都锚定3个核心研发方向:百万词元超长上下文,拉长模型“工作记忆”,连贯处理超长复杂任务;翻番Token利用效率,提升单位算力下模型智力水平;智能体集群技术Agent Swarm,寻找智能体并行协作最优解。三大技术路线协同发力,将持续挖掘算力向智能转化的最优路径。