月之暗面Kimi K3开源,阿里与华为火速适配算力
来源:李智衍发布时间:18 小时前178浏览
询问 AI近日,月之暗面(Moonshot AI)正式对外开放了其大型语言模型Kimi K3的开源代码。据法新社报道,国内两大人工智能算力巨头阿里云与华为紧随其后,快速完成了该模型的训练与推理部署工作。
在技术架构方面,Kimi K3基于Stable LatentMoE架构构建,参数总规模高达2.8万亿。该模型内置896个专家模块,但在单次推理过程中仅激活16个专家进行计算,从而在保障模型容量的同时大幅提升了推理效率。此外,据官方透露,通过引入Kimi Delta Attention(KDA)混合线性注意力机制与Attention Residuals架构,该模型能够处理长达100万Token的上下文信息。与前代产品相比,其长文本解码速度最高可实现6.3倍的增长,而KV Cache的显存占用量则下降了约75%。
在算力生态支持方面,阿里云于7月28日对外宣布,其真武(M890)超级节点在模型发布当天便实现了首日适配。除了提供基础计算资源外,通义千问AI平台以及百炼(Model Studio)模型服务平台也将同步上线Kimi K3的API接口服务。阿里云方面指出,真武M890超级节点现已全面支持该模型的运行,未来双方将持续深化国产人工智能算力领域的合作。开发者与企业用户能够通过百炼平台直接调用相关API,进而推动模型的商业化落地进程。
与此同时,华为也对外确认其昇腾(Ascend)计算平台已顺利完成Kimi K3的训练与推理部署。据华为技术团队介绍,他们在模型发布当日即实现了“零日(0 Day)”支持。在训练环节,借助MindSpeed MM框架,已在Atlas 800 A3和Atlas 900 A3 SuperPod集群上完成了模型训练的重现。在推理环节,该平台不仅兼容vLLM Ascend和SGLang等主流开源推理框架,昇腾950超级节点还原生支持了模型所使用的MXFP4量化权重格式。
针对超大规模MoE模型在训练时面临的专家并行、显存调度及跨节点通信等挑战,华为公布了多项专属优化方案。这些技术涵盖FSDP与EP混合并行策略、GEMM分组专家矩阵乘法、Triton Ascend编译框架以及ChunkLoss显存优化等,有效降低了896专家架构下的显存消耗与通信开销。在推理部署层面,昇腾平台不仅兼容Prefix Cache、分块预填充(Chunked Prefill)及异步调度机制,还针对KDA线性注意力和LatentMoE等创新架构引入了融合算子优化。此外,通过MC2技术提升了跨节点(EP64)的数据交互效率,并结合MXFP4权重与MXFP8动态量化技术,进一步提升了整体推理速度。
业内观察指出,阿里云与华为几乎在同一时间宣布对Kimi K3提供支持,这表明国内人工智能产业的竞争焦点正从单一的模型性能,逐渐向“模型+算力+平台”的综合生态体系转移。以往大型语言模型通常依赖于单一的云服务提供商,而现在Kimi K3同时获得了阿里云公有云以及华为昇腾国产算力的双重支持,这使得企业能够根据自身的实际部署需求,在公有云与私有化部署之间拥有更加灵活的选择。
此外,Kimi K3在海外开源社区的关注度也在不断攀升。与半年前DeepSeek-V3开源时的反响不同,当前海外开发者更加看重该模型的实际性能,部分社区开发团队已开始将现有工作流迁移至Kimi K3。然而,据相关消息透露,伴随国内开源模型国际影响力的提升,美国针对中国人工智能技术的限制动作也呈现出加剧趋势。近期有美国参议员提出相关法案,计划扩大美国商务部的权限以限制竞争对手获取人工智能技术,市场方面也在密切关注美方是否会将更多中国人工智能企业列入出口管制或实体清单。
新闻来源:李智衍,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

