让 AI 推理变得更便宜的竞赛 正推动芯片设计超越通用加速器。我们正朝着针对单一模型量身定制的硅片迈进。而 Google 据称的 “Frozen v2” 项目表明,Gemini AI 模型正成为这一趋势的一部分。

该项目由 The Information 率先报道。据称,这款尚未公布的芯片将把 Gemini 架构的部分组件硬编码进硅片,同时保留可更新的权重。这种折中方案有望让 Google 获得模型专用硅片的绝大部分效率优势,同时避免每当 Gemini 更新时硬件就过时。

Google 发言人告诉 The New Stack:“我们的团队正在不断研究和试验新的创新,以为用户和客户提供最大性能和效率。”

Google 发言人告诉 The New Stack:“我们的团队正在不断研究和试验新的创新,以为用户和客户提供最大性能和效率。虽然并非每个项目都会进入量产,但这种严谨的探索是我们全栈方法的核心。通过从底层共同设计硬件和软件,我们确保系统高度集成并针对真实工作负载进行了高度优化。”

据报道,Google 希望该芯片能缓解 AI 计算紧缺 问题,这一问题已使云服务商难以满足需求,同时还能让 Gemini 的服务成本大幅降低、效率显著提升。内部预测显示,该设计有望比 Google 当前一代 AI 芯片多提供 6 至 10 倍的每瓦特 token 数量。

如果该项目推进,将代表一种不同的 AI 基础设施方法:Google 将专门为 Gemini 打造硬件。对开发者而言,这也预示着未来的 AI 系统可能会在模型与底层硬件之间实现更紧密的集成。

专用硅片取代灵活性

目前,绝大多数 AI 推理运行在 Nvidia GPU 或 Google 自己的张量处理单元(TPU)上。由于这些芯片旨在支持多种 AI 模型,因此承载了较高的处理负载。

类似转变已有先例。比特币挖矿经历了从 CPU 到 GPU,再到最终采用 ASIC 的路径。AI 推理可能正朝着同一方向发展。训练仍受益于 GPU 的灵活性,但当模型进入生产阶段后,优先级就转向以更低功耗服务尽可能多的请求。

训练仍受益于 GPU 的灵活性,但当模型进入生产阶段后,优先级就转向以更低功耗服务尽可能多的请求。

竞争对手也在硬编码自己的方案

Google 并非唯一一家在 AI 推理领域超越通用 GPU 的公司。随着推理在 AI 工作负载中占比越来越高,越来越多的公司正在试验专用硬件,以在降低功耗的同时提升性能。即使是主导 AI 市场的 Nvidia,也在推理领域投入巨资,去年据称与 Groq 达成 200 亿美元的交易,授权该初创公司的技术。

在更具野心的努力中,加拿大初创公司 Taalas 已展示了一款将整个 80 亿参数 Llama 模型直接嵌入硅片的芯片。通过将模型保留在芯片上,而非不断与外部内存交换数据,Taalas 表示可大幅加速推理,宣称吞吐量约达每秒 17,000 token。与此同时,其他公司正在优化内存与计算单元之间的物理距离,以避免 硬件锁定

d-Matrix 的新 Corsair 平台采用基于 SRAM 的内存计算架构,而非依赖标准高带宽内存(HBM)封装。同样,SambaNova 正在部署定制数据流技术,采用三层内存架构,以最大化高级工作流的每瓦特 token 数量。

Google 的 Frozen v2 在这一格局中独树一帜——借鉴了 Taalas 等硬编码架构的超高效率,同时保留了足够的灵活性,使其能在多个产品周期内保持可用。

冻结架构,而非权重

“Frozen” 这一名称据称源于将 Gemini 部分设计永久刻入芯片的想法。据 The Information 报道,Google 工程师多年来一直在寻找效率与灵活性之间的最佳平衡点。

早期由 Google DeepMind 首席科学家 Jeff Dean 领导的概念,据称会将 Gemini 的模型权重直接嵌入硅片。该想法最终被放弃,因为它会将硬件绑定到模型的单一版本上,随着 Gemini 的持续演进,硬件的使用寿命将大幅缩短。

据称 Frozen v2 采取了不同的方法:芯片不会锁定权重,而是将 Gemini 底层设计的部分组件硬编码,同时允许权重随时间更新。这将使 Google 能够持续改进模型,而无需在 Gemini 每次更新时更换硬件。

芯片不会锁定权重,而是将 Gemini 底层设计的部分组件硬编码,同时允许权重随时间更新。

更廉价的推理惠及开发者

通过将 Gemini 部分执行过程移入芯片本身,Google 可减少在通用硬件上运行模型时产生的一些开销。这可能转化为更低的延迟,尤其适用于依赖近实时响应的应用。

Google 据称的目标是实现每瓦特 6 至 10 倍的 token 数量,最终着眼于效率,而这些节省最终可能通过更低的 API 成本或更多可用容量,传递给 基于 Gemini 构建的企业团队。虽然 Google 尚未说明将如何传递这些收益,但 降低推理成本已成为整个行业的优先事项

YOUTUBE.COM/THENEWSTACK

技术发展迅速,不要错过任何一集。订阅我们的 YouTube 频道,观看所有播客、访谈、演示等内容。

Group Created with Sketch.