页面加载中,请稍候
来源:杨智家发布时间:2023-05-121359浏览
询问 AI近几个月可见大型语言模型(LLM)和生成式人工智能(Generative AI)进入人类日常生活,而模型训练与运行需要大量运算能力。继微软(Microsoft)、IBM后,Google Cloud也在2023年I/O开发者大会发布一款由NVIDIA H100绘图芯片(GPU)支持运算的A3超级电脑虚拟机,提供达26exaFlops的AI运算效能,以减少训练更大机器学习模型所需时间和成本。
Google称A3 GPU虚拟机专为当前机器学习工作负载提供最高效能的训练,配备现代化CPU、改良的主机存储器、下一代NVIDIA GPU和主要网络升级。具体来说,Goolgle正为这些AI运算设备导入NVIDIA H100 GPU,并结合专门数据中心,以获得具高吞吐量和低延迟的庞大运算能力。
据VentureBeat、Tom's Hardware及TechCrunch报导,A3虚拟机一大特点,是加速GPU之间的沟通,有助训练时加快模型收敛。
NVIDIA GPU将以Google称专用设计的200-Gbps基础建设处理器(IPU)进行沟通,提供绕过CPU主机的GPU对GPU(GPU-to-GPU)数据传输。Google估计数据在GPU之间的传输速度,将比早期传统通讯路径硬件快10倍。Google称A3代表其GPU对GPU数据界面的首次生产级部署。
每部A3超级电脑均搭载第4代英特尔(Intel)Xeon Scalable处理器,提供2TB DDR5-4800存储器。但真正的运算核心来自内建8个NVIDIA H100 Hopper GPU,借由运用NVLink 4.0和NVSwitch可近用3.6TBps的对分带宽。
A3工作负载在Google专门Jupiter数据中心网络结构中运行,Google形容Jupiter好比2.6万个高度互连的GPU,并称此途径有助降低运行工作负载的成本。
Google将以多种方式提供A3客户自行运行,或者将其作为托管服务运行,Google会为客户处理大部分繁重工作负载。目前A3近用资格仅开放注册预览等候名单。
Google另一目标是将A3这类超级电脑与其软件和云端产品整合,如OpenAI透过让自有用户能够微调其基础模型来转售Azure的运算。Google称A3将可透过Vertex AI,提供希望在无需维护情况下,开发复杂机器学习模型的客户。同时Google还宣布扩展功能和更多基础模型。
外界分析,Google非唯一一家采NVIDIA技术途径的业者。2022年11月微软宣布与NVIDIA合作生产微软自有超级电脑,微软还将采用H100这类芯片作为互连结构(Fabric)或网状网络(Mesh)基础,这些结构或网状网络经过优化以训练超大型模型。
另外,IBM也于2023年2月宣布开发自有Vela超级电脑,可为政府客户如美国国家太空总署( NASA)训练非常大的模型。
责任编辑:游允彤
新闻来源:DIGITIMES科技网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。
暂无评论哦,快来评论一下吧!

2026-06-01
2026-06-15

2026-06-04