中昊芯英发布新一代张量处理器,降低AI推理成本
来源:林慧宇发布时间:2026-07-16654浏览
询问 AI随着生成式人工智能应用的迅速普及,算力开销已变成制约其商业化落地的关键因素。以往由图形处理器(GPU)统领的加速计算市场,正涌现出更多专用架构的尝试。其中,张量处理器(TPU)凭借针对AI模型矩阵运算的深度优化,再次成为业界瞩目的焦点。
在此背景下,中昊芯英杭州科技有限公司(简称中昊芯英)作为国内少数坚定布局TPU赛道的企业,于近日正式发布了自主研发的新一代高性能TPU产品“须臾”,并同步推出了搭载该芯片的软硬件一体化智能计算平台“泰则2.0”。
中昊芯英创始人兼首席执行官杨龚轶凡指出,与需要兼顾图形渲染和通用计算的GPU不同,TPU专注于大模型的核心矩阵运算,在特定的AI负载下能够提供更高的性能和成本优势。其核心目标在于压低AI推理阶段单位Token的开销,从而缓解企业在规模化部署AI服务时面临的算力资金压力。
他进一步解释,当前AI智能体在交互时,通常需对历史对话进行重新处理并输入模型,导致输入Token量远超实际输出。长期大规模调用会因反复处理历史数据而产生巨额计算费用。为此,“须臾”芯片引入了Prefill-Decode(PD)分离推理架构,将输入处理与内容生成解耦,交由不同的硬件单元执行,有效减少了资源冲突。
据公司公布的数据,新一代产品的处理能力比上一代提高了约3倍,且在同等任务规模下,整机功耗仅为传统通用算力服务器的80%左右。杨龚轶凡强调,低功耗是TPU架构的核心优势。在AI数据中心不断扩建的当下,电力和能源配额已成为限制算力增长的关键瓶颈。采用低功耗方案完成同等任务,不仅能削减运营开支,还能在有限的电力条件下部署更多计算设备。
从产业演进的角度观察,中昊芯英选择TPU赛道,折射出国内AI芯片厂商正在探索区别于GPU的竞争策略。由于GPU在软件生态、开发工具及模型适配方面已建立起深厚的护城河,国内企业若直接硬刚成熟的GPU生态,面临极高的门槛。因此,部分厂商转向专用AI架构,试图通过针对特定负载的优化,避开与GPU在通用性能上的正面交锋。
然而,杨龚轶凡也坦言,TPU的发展仍面临诸多考验,其中软件生态是本土算力产业亟待攻克的最大难关。国际GPU巨头经过二三十年的积累,已构建了完善的编译器、函数库及开发者环境,国内企业仍需时间来弥补这一差距。此外,高端存储器、先进封装及半导体制造等供应链环节,同样决定着AI芯片的最终竞争力。AI芯片的较量不仅是单一元器件的比拼,更是涵盖设计、制造、封装、系统集成及软件工具链的整体生态竞争。
尽管中昊芯英在TPU领域的布局对国内AI算力产业具有风向标意义,但杨龚轶凡认为,TPU整体仍处于发展初期。相较于GPU,TPU架构在性能、功耗与芯片面积(PPA)的平衡等方面仍有广阔的优化空间,这需要依靠多代产品的迭代来积累经验。他预计,TPU大约还需要5年时间、经历数代产品的更迭,才能步入更为成熟的PPA阶段,进而全面展开在成本效率、能效比以及应用落地能力上的综合较量。
新闻来源:林慧宇,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
