备受瞩目的Kimi K3,被算力卡住了脖子。
近日,月之暗面一纸公告搅动整个AI行业:旗舰模型Kimi K3上线仅48小时,用户请求量突破现有算力集群承载极限,公司紧急暂停全部C端新用户订阅,有限算力优先供给存量付费会员;后续还将拆分普通权益与高算力消耗的Kimi Code(AI编程助手),单独计费。
《中国经营报》记者7月24日登陆Kimi官网发现,其依然全面暂停C端新用户付费订阅,所有套餐均显示需“预约订阅”,预约成功后将“在算力扩容后”开通购买权限,具体恢复日期未披露。截至发稿,Kimi方面未回应记者采访。
这是一款刚一发布便搅动全球舆论的模型。K3参数规模达2.8万亿,是目前全球最大开源模型,综合智能水平仅次于Claude Fable5(美国Anthropic公司旗舰大模型)和GPT-5.6Sol(美国OpenAI公司旗舰大模型)两款前沿闭源模型。发布不到48小时,马斯克在相关评测下留言“Impressive(令人印象深刻)”,K3更以1679分登顶Frontend Code Arena编程榜单,这也是开源模型首次在同一榜单超越Claude、GPT等闭源模型。
猝不及防的算力告急
K3的爆发,几乎超出了很多人的预期。
7月16日,月之暗面正式发布Kimi K3,原生支持视觉理解,具备100万词元上下文窗口。技术评测同样亮眼:在ProgramBench(AI编程能力评估基准测试)中,K3得分77.8,以0.2分微弱优势超过GPT-5.6Sol的77.6;在FrontierSWE(评估AI模型能否像顶级软件工程师和研究员一样,在长时间内独立完成复杂技术项目)上得分81.2,大幅领先后者的71.3。
热度暴增的同时,争议随之而来。有海外从业者质疑K3存在模型蒸馏行为,OpenAI相关负责人公开批评其发展模式。7月21日,月之暗面企业业务负责人黄震昕首次系统性回应,否认蒸馏复刻,强调性能跃升来自底层原创架构创新,包括首次应用于万亿级训练的二阶优化器Moon Clip、自研线性注意力机制Kimi Linear Tension。
市场热度并非普通用户的猎奇围观,而是大量重度开发者、产业创业者涌入平台。
顺福资本&行行AI合伙人李云龙是K3的“首日用户”。“发布前后,网上出现了大量真实产品的测评,整体好评非常集中,不只是几张跑分表,所以开放第一天我就直接买了199元的月度会员。”他告诉记者。
作为高强度使用者,李云龙日常依赖GPT-5.6Sol与Claude Fable5仍常感“不够用”,他拿K3对自己正在用海外模型开发的真实项目做Code Review(代码审核),大部分改进建议经GPT-5.6Sol与Fable5交叉验证后都成立。
李云龙说道:“生成一个看起来不错的页面,和真正理解一个大型项目、发现问题并提出有效修改建议,完全是两个层次的能力。”
这次涌入K3的用户多是算力刚需明确、付费意愿充足的专业开发者,海量高消耗请求直接压垮现有算力集群。
K3发布48小时后,Kimi宣布暂停C端新用户订阅,并将基础权益与Kimi Code拆分。
在用户看来这是“一票难求”的稀缺,在业内人士眼中则是一次被迫的“刹车”。
“主要还是算力不足后的服务保障措施,不宜简单理解为饥饿营销。”全联并购公会信用管理委员会专家安光勇告诉记者,优先保障付费用户和高价值场景,“也反映出这家独立大模型公司正从‘抢用户’转向‘重收入、重效率’”。
月之暗面方面给出的解释是,用户请求量已大幅超出预估,逼近现有集群承载极限。
中国企业资本联盟副理事长柏文喜则对记者指出,事件核心在于“K3通过了需求测试,却未通过供给与利润测试”。
暂时放弃新用户
为什么一款登顶全球的模型,会在自家用户面前“卡壳”?
从公告细节看,K3发布48小时内请求量大幅超出内部预估,海量百万上下文长文本与代码生成请求持续占用稀缺的HBM(高带宽内存)显存,集群并发吞吐逼近红线,免费用户排队、付费会员卡顿风险同步显现。
有媒体的一组成本测算更能解释月之暗面的两难:单一重度用户每日两次百万上下文深度对话,仅推理侧算力折旧与电费便已超过59元月度会员定价;叠加长上下文必需的KVCache(缓存机制)常驻显存,单用户边际亏损持续扩大。而同样一块HBM显存,供给B端企业API可收取100元/百万Token(词元)的高端定价,供给C端低价会员则长期亏损。
柏文喜分析,此次限流具有双重属性:被动面是保障存量付费用户体验,避免卡顿损害口碑;主动面是B端API收入已占整体收入70%以上,将算力向高价值场景倾斜。
这背后是一条成型的收入曲线,据柏文喜梳理,Kimi的ARR(年度经常性收入)三个月内从1亿美元飙升至3亿美元,API收入占比超70%,海外用户增长400%。
从买家账本看,K3的“能力溢价”带着明显的性价比底色。李云龙测算,按公开API口径,K3每百万输入Token为3美元、输出15美元,Fable5分别为10美元和50美元,K3单价不到对方的1/3。
不过李云龙补充道,实际用下来K3会额外多消耗一些Token,“综合成本差不多是Fable的一半”。对于需要持续生成大量课程、代码和图纸的创业公司,这种量级差异直接决定产品能否规模化。
在顺福资本&行行AI投资的AI学习平台“铱芯社”中,K3已是唯一达到实际生产要求的国产模型。“在课程前端、页面交互和视觉呈现方面,K3能力远超Claude Opus4.8,和Claude Fable5比较接近。”李云龙说道。
面对突然暴增的需求,月之暗面选择以“模型分层+产品分层+缓存优化”应对:完整K3树标杆,低成本模型承接普通请求,Kimi Code按高消耗任务单独收费。据悉,其Code场景缓存命中率超90%,将输入成本压至2元/百万Token,展现出较高的工程化能力。
“不能再依赖‘低价API、无限使用、低价订阅’。”在大模型行业将迎来商业变革的大环境下,安光勇提醒AI创业者,应采用大小模型搭配、智能路由、缓存和额度管理,“并确保每次AI调用创造高于成本的实际价值”。
国产大模型的“K型分化”时刻
K3暂停新用户订阅,撕开的是整个行业正在发生的分化。
过去一年,国内独立大模型公司路线悄然分岔。柏文喜归纳为三条:Kimi路线(B端API+高价值C端),智谱路线(暂缓变现、深耕AGI,启动“TouchHigh”计划拟投入百亿元攻坚AGI),以及DeepSeek、字节路线(低价走量,以极致性价比换取生态位)。在定价层面,行业呈鲜明的“K型分化”:K3输出定价100元/百万Token,约为Claude Fable5的1/3;智谱年内提价83%,调用量反增400%——行业正从“性价比内卷”转向“能力定价”,通用Token商品化,高端Token获溢价。
“K3在编程、长上下文和智能体等部分能力上已接近国际第一梯队,但综合稳定性和产品体验仍有差距。”安光勇认为,高价并非告别性价比,“而是旗舰模型开始尝试能力溢价”。
在投资视角下,K3的意义不止于“又多了一个模型”。
李云龙认为,K3显著降低了中国AI创业公司的能力门槛与生产成本——过去很多团队为完成复杂产品不得不绑定Claude、GPT,还要应付账号、支付与访问稳定性问题。“现在相当一部分任务可以先在国产模型体系内完成。”
他给出更现实的落地公式:99%的商业应用其实不需要每个环节都用Fable5。“企业真正需要的,并不是一个在所有Bench上都排名第一的模型,而是一个能力足够强、上下文足够长、成本可控、调用稳定,同时能够持续迭代的模型。”
李云龙建议,可以让K3承担绝大多数生产任务,只把极少数最复杂、风险最高的交给Fable5复核。当模型能力逐渐变成基础设施,真正的壁垒将回到行业数据、垂直流程与产品交付能力上。
算力紧缺并非月之暗面一家企业所面临的问题,而是全行业结构性短板。安光勇表示,Kimi在需求预判、算力扩容节奏上存在优化空间,但高端HBM芯片供给短缺、集群调度难度高、推理成本居高不下,是所有国产大模型厂商共同面对的制约。
柏文喜则将2026年7月视为国产大模型从“中国版ChatGPT”迈向“全球AI巨头”的转折时刻:“K3算力限流事件,标志行业从简单复刻ChatGPT,迈向具备全球竞争力的AI赛道。当前K型分化格局已定,头部企业依靠技术、商业双重闭环抢占市场红利,中部厂商深耕细分场景生存,缺乏盈利逻辑、无差异化能力的尾部玩家逐步离场。”