DeepSeek联手北大,大模型推理提速超六成
来源:龙灵发布时间:2026-06-27393浏览
询问 AI据界面新闻报道,北京大学与DeepSeek团队在6月27日共同推出了一篇聚焦推测解码技术的学术文章《DSpark》,探讨了一种旨在加快大型语言模型推理过程的新型方案。为了促进学术界的后续探索,该研究还同步开放了DeepSpec训练框架以及相关的模型权重检查点。
研究团队发现,传统的并行草稿生成技术尽管能够单次产出更多的词元(token),却因词元彼此间缺乏足够的关联性,造成拒绝率攀升及验证算力的无端消耗。针对这一痛点,《DSpark》在并行生成的基础架构中融入了轻量化的顺序模块,构建出半自回归结构,进而强化了词元间的依赖程度并优化了草稿的整体质量。
此外,该方案还设计了一套依托置信度的动态验证机制。此机制能够依据系统负载状况及各项请求的成功几率,自动调节验证序列的长度,以此削减不必要的计算成本。离线环境下的测试数据表明,此技术大幅增加了可被接受的生成序列长度。而在DeepSeek-V4的实际线上部署中,相较于基础模型,其推理效率实现了60%至85%的增长,同时显著缓解了高并发场景中的吞吐量衰减问题。
新闻来源:龙灵,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
