• 最近访问:
发表于 2026-07-29 06:18:50 股吧网页版
如何炼成全球参数最大开源模型
来源:人民日报

  7月27日,我国科技企业月之暗面发布Kimi K3的模型权重、技术报告,正式开源Kimi K3,人人都可下载。Kimi K3是月之暗面开发的AI(人工智能)大模型,于7月17日发布,是全球参数最大的开源模型。该模型总参数达到2.8万亿,原生支持视觉理解,具备100万词元上下文窗口,主要面向长程编程、知识工作和复杂推理等场景。

  在大模型编码评估系统Frontend Code Arena榜单中,Kimi K3以1679分位居榜首,超过Claude Fable 5、GPT—5.6 Sol等闭源模型,这也是开源模型首次在该榜单上超过闭源模型并登顶。

  在大模型研发中,参数规模是关键变量。参数就像人脑里的神经连接,它决定模型“能装下多少知识”。参数越大,能力的上限越高,也就可以提供更智能的模型表现。2.8万亿参数,意味着模型能把更多的知识和规律装进“脑子”,懂得更多、想得更深、答得更准。

  注意力机制同样重要。自2017年Transformer架构提出以来,注意力机制就成为全球主流大模型的技术基石之一。注意力机制决定了模型“会不会抓重点”,能不能从海量信息中快速找到关键、建立联系并形成答案。传统全注意力机制在处理长文本时,计算量随文本长度接近平方级增长——模型“读”的内容增加1倍,计算量就增至约4倍,这正是超长文本难落地的关键原因。

  Kimi K3的突破,不只是参数大、“装得多”,还在于处理信息的方式更高效。首先,它应用了月之暗面提出的一种创新的线性注意力模块——KDA混合线性注意力机制,通过混合线性设计,把计算量降到接近线性增长。这意味着在同等算力条件下,模型能“读”得更长、处理更多信息、完成更复杂任务。

  另一方面,模型越大、层数越多,信息传递的“路程”就越长,信号容易衰减、失真,训练也越容易失败,这是全球大模型开发共同面对的工程难题。月之暗面开发的注意力残差技术,则改进了信息在不同网络层之间的传递和复用方式,相当于为巨型模型加装了一套“稳定器”,让2.8万亿参数能稳定高效地用起来。

  在训练新一代基座大模型的过程中,月之暗面使用了自主研发的底层模型架构,并积累形成了一整套科学的模型训练方法。如果说KDA混合线性注意力机制回答的是“超长文本怎样算得更省”,注意力残差技术回答的就是“超大模型怎样训练得更稳”。两项技术共同表明,我国大模型企业的竞争力,正从扩大参数规模延伸到基础架构和原创算法层面。

  性能强、成本低,使得中国大模型成为全球开发者的重要选择。

  全球人工智能模型聚合平台OpenRouter的数据显示,7月20日至26日,中国大模型周调用量达33万亿词元,连续13周稳居全球首位。高盛集团认为,中国开源及开放权重模型的智能水平,正在达到面向全球扩散的关键临界点;预计2026年下半年,中国可能出现更多总参数达到2万亿至5万亿的大模型。

  在月之暗面创始人兼首席执行官杨植麟看来,从部分性能在全球大模型榜单登顶,到多模态模型能力攀升,再到单个智能体衍生出智能体集群,中国大模型的发展壮大不仅体现在数量上,更体现在质量、应用深度和全球影响力等多方面。

  北京中关村学院院长刘铁岩认为,一批中国开源大模型从“单点亮相”走向“群体突破”,为世界人工智能发展提供了新方案、新路径,将加快推动人工智能技术向上向善发展。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500