华为携手湖北移动测AI推理,吞吐率大增372%
来源:龙灵发布时间:2026-06-26126浏览
询问 AI在2026年MWC上海展会期间,华为携手中国移动通信集团湖北有限公司(简称“湖北移动”),共同宣布了一项重要进展。双方已顺利完成国内运营商领域首个AI推理加速解决方案的现网验证工作。
据悉,此次验证工作在湖北移动的实际网络环境中展开,部署了vLLM-Ascend框架,并针对GLM-5.1、MiniMax M2.5等当前主流的大语言模型,模拟了从8K到190K的长序列输入条件。该测试依托华为昇腾A3超节点架构以及OceanStor A800存储设备,同时引入了UCM(推理记忆数据管理)功能。在长序列AI推理的应用场景中,Token吞吐率实现了最高372%的大幅增长,从而为电信运营商高效部署智算业务奠定了坚实的技术基础。
验证数据表明,当启用UCM功能并在MiniMax M2.5模型下运行时,首个Token的生成延迟(TTFT)降低了26%到62%,同时单张NPU卡的Token输出速率(TPS)也有显著改善。具体而言,序列长度为64K时TPS增加了58%,而达到128K时则提高了78%。而在GLM-5.1模型的测试中,加速表现更为优异,TTFT的优化区间扩大至51%到93%,TPS的增长幅度则介于56%到372%之间。特别是在128K序列环境中,TPS达到了372%的最高提升比例,64K序列下也提升了313%。
华为方面指出,上述结果证实,当上下文长度持续增加时,此类AI推理加速方案的优势会愈发凸显,能够切实克服长序列推理过程中遇到的KV Cache容量限制。对电信运营商来说,这不仅意味着在内容生成、智能客服、大模型推理及行业智能体等依赖长序列的AI业务里,现有网络的智算资源利用率将得到进一步提升,还能有效缓解因长上下文推理而产生的系统性能负担。
新闻来源:龙灵,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

