在 Google,AI 是一项从头到尾的系统工程。显然,我们打造了 Gemini 和 Nano Banana 等领先的 AI 模型。我们将 AI 融入日常使用的工具(例如 Gmail、BigQuery、AlloyDB、Google Cloud Code 和 Google Cloud Assist)。我们构建了帮助您使用 AI 进行开发的软件框架,例如 Gemini Enterprise Agent Platform、JAX 或 MaxTest。我们还与合作伙伴共同设计了强大的基础设施平台,包括各类标准计算资源、TPU 和 GPU 等加速器、优化网络和存储,以及 GKE 和 Cluster Director 等编排软件。然后,我们将这些组件整合为 AI Hypercomputer 等超级计算平台,驱动整个行业向 AI 和代理化未来转型。

在当今代理化时代,这一点至关重要。AI 正从回答问题演进为推理并采取行动。希望在 AI 下一阶段领先的企业需要专为这些新需求设计和优化的计算基础设施,以便更快创新、提供卓越的用户和客户体验,并在大规模场景下实现成本与能效的最优化。

为此,我们正在快速发布 AI 基础设施与编排相关新闻。在本博客中,我们每月为您提供最新发布和里程碑的快照,帮助您了解最新动态,提供架构和性能调优的深度解析,并探讨特定用例,同时附上更多学习资源的链接。请持续关注本博客的每月更新。


2026 年 7 月

产品、技术与工具更新

  • 产品更新: Google Cloud Managed Lustre 现已正式发布(GA),提供四种性能层级,吞吐量从 125 MB/s、250 MB/s、500 MB/s 至 1000 MB/s 每 TiB 容量不等,存储容量最高可扩展至 8 PB。Managed Lustre 解决方案由 DDN 的 EXAScaler 提供支持,融合了 DDN 在高性能存储领域数十年的领先经验与 Google Cloud 在云基础设施方面的专业技术。

  • 产品更新: C4N 网络与存储优化型虚拟机现已正式发布(GA)。C4N 是我们首款专为消除数据传输瓶颈而设计的网络和块存储优化型虚拟机系列,搭载第五代 Intel Xeon 可扩展处理器,并基于 Google 的 Titanium 卸载硬件,可实现 400 Gbps 网络带宽、每秒 9500 万数据包(MPPS),以及搭配 Hyperdisk Extreme 时最高 25 GiB/s 的块存储吞吐量。

  • 新功能: GKE Dataplane V2 支持最多 15K 节点并启用网络策略(GA)。此功能支持标准 GKE 集群扩展至 15,000 个节点,同时保持完整的网络策略主动执行,满足大型企业和 AI/ML 客户的大规模基础设施需求。

  • 新功能: llm-d 中的协作时间切片。如果您正在运行强化学习(RL)工作负载,现在可以将独立的 RL 作业交错运行在共享物理硬件上,在不影响模型收敛或准确性的前提下,将加速器整体利用率从约 40% 的基线提升至 70%。

  • 新 AI 安全工具: 如果您希望在 GKE 上保护 AI 供应链,安全部署 AI 工作负载并减少影子 AI,我们已开源 k8s-aibom,这是一款轻量级、无特权的 Kubernetes 控制器,可持续监控容器集群,自动检测正在运行的 AI 运行时(如 vLLM 和 Triton),并生成标准的 CycloneDX 机器学习物料清单(ML-BOM)。欢迎查看 k8s-aibom 项目 并参与贡献。

实践指南与操作手册

  • 操作指南:7 月 27 日,Google 宣布为 Moonshot AI 的 Kimi K3 提供 Day 0 支持,该模型参数量达 2.8 万亿,支持开放权重。无论您选择通过 Model Garden、自定义编排还是 GKE 与 llm-d 配方部署,本指南都提供了详细的逐步操作说明,帮助您在 Google Cloud 上评估和试用 Kimi K3。

  • 操作指南: Google Kubernetes Engine (GKE) 托管 DRANET 现已同时支持 GPU 和 TPU。您可选择多种配置,包括标准集群(完全自主控制)和 autopilot 集群(由 Google 完成繁重配置)。更多实践详情,请参阅动手实验室 GKE Autopilot 集群搭配 TPU、GKE 托管 DRANET 与 Gemma 4

  • 操作指南:学习如何在 TPU 而非 GPU 上运行 Ray。在本系列的 第一部分中,我们将讨论 TPU 切片(提示:Ray 将其视为另一种可供调度的加速器),随后介绍 Ray 的各类 AI 库(第二部分)。

  • 操作指南:使用新的微基准测试套件评估 TPU 在示例工作负载上的表现,帮助您准确判断设备是否达到理论性能规格,并识别具体的性能差距或架构瓶颈。详情请参阅此处

  • 操作指南:在不超出预算的前提下扩展您的代理。阅读如何借助 GKE 编排在固定计算资源上安全地部署更多代理,利用 GKE Agent Sandbox 和 Pod 快照实现目标。无论您的重点是性能还是成本优化,我们都将指导您调整关键参数以实现最佳代理效率。

  • 技术蓝图:Mistral 3 大模型在 Ironwood 上的推理优化实践。本文详细介绍了 Google 团队如何在 Google 的 Ironwood(TPU v7x)上优化 Mistral 3 大规模 MoE 模型推理,实现 1.5 倍性能提升。他们通过混合分片、将线性 VPU 求和替换为树形归约、优化 GMM/MLA 内核以及采用异步调度,最终将吞吐量提升高达 48%,同时保持基准准确性中性。完整博文请点击此处

研究、报告与深度解析

  • 报告:Google 在 Gartner 首份 Gartner Magic Quadrant™ for AI Infrastructure 中被评为领导者,在“执行能力”和“愿景完整性”两项指标中均位居前列。Gartner 特别指出 Google 专有的可扩展计算、集成的 AI Hypercomputer 架构以及庞大的 AI 计算容量是核心优势。下载报告请点击此处

  • 报告:我们近期对 1400 多位高级 IT 领导者进行了调研,发布 《AI 基础设施现状报告》,结果显示:AI 雄心与基础设施现实之间的差距正在扩大。事实上,83% 的组织表示需要升级基础设施以支持生产级代理化 AI。阅读配套博文,了解如何调整基础设施以满足代理化应用对系统的需求,从而实现从试点到生产的跨越。


2026 年 6 月

产品、技术与工具更新

实践指南与操作手册

  • 操作指南:学习如何在 GKE Inference Gateway 上构建高可用 AI 推理工作负载,运行在 TPU、Cloud Storage FUSE 和动态资源分配(DRA)之上。本博文 提供概览,您也可以在动手 codelab 中获取全部技术细节。

  • 操作指南:您知道可以通过模型上下文协议(MCP)将 AI 代理连接到 Cloud Storage 中的非结构化数据吗?在本博文 中,您将通过三个客户示例了解为何需要这样做,以及如何选择全托管服务或自托管本地服务器来实现更多定制和控制。

研究、报告与深度解析

  • 报告:根据独立基准测试报告,GKE Inference Gateway 相比下一代领先托管 Kubernetes 服务,吞吐量高出 15.7%,等待时间缩短 92.8%,令牌间延迟降低 62.6%。这一性能得益于前缀缓存的使用,通过存储长重复提示前缀的 KV 缓存(激活状态)来优化 LLM 性能。更多详情请阅读博文

  • 架构深度解析:深入探讨 TPU 与 GKE 的冷启动问题,以及 Run:ai Model Streamer 如何帮助改变这一局面。

客户与合作伙伴更新

  • 客户案例:借助 GKE、BigQuery、Cloud SQL 和 Gemini Enterprise Agent Platform,Pager Health 正在消除运营碎片化,为美国医疗保健提供简化的个性化体验,改变生活。

  • 客户案例:客户评论平台 Trustpilot 使用经过微调的 Gemma 模型,借助 Dataflow 和 Gemini Enterprise Agent Platform,在成本优化的 A2 VM(搭载 A100 GPU)上构建了高吞吐量流式处理管道,同时使用了 Gemini Enterprise Agent Platform 维护的优化版 vLLM。


2026 年 5 月

产品、技术与工具更新

  • 产品更新: GKE Agent Sandbox 现已正式发布(GA)。

  • 新开源项目: Agent Substrate 是一个新的开源项目,旨在持续突破代理化基础设施密度的极限。

  • 新功能: Google AI Edge Portal,用于大规模测试和基准测试设备端机器学习(ML)的解决方案,现已支持设备端 LLM 的基准测试和调试。更多详情请阅读此处

  • 产品深度解析:我们深入探讨了 Cloud Storage Rapid,这是一个专为 AI 工作负载设计的高性能存储产品系列。发布时包含 Rapid Bucket(原 Rapid Storage),一种高性能的区域对象存储服务,以及 Rapid Cache(原 Anywhere Cache),可按需加速读取并将计算与数据在现有存储桶中并置。

研究、报告与深度解析

  • 架构深度解析:Google 全球基础设施副总裁 Bikash Koley 和工程院士 Arjun Singh 对 AI 工作负载对网络基础设施带来的挑战进行了高层次概述,并讨论了我们对数据中心网络结构、广域网和全球网络所做的深度增强,以更好地支持这些工作负载。

  • 架构深度解析:我们发布了一个全新的集群级可靠性模型,用于在 TPU 上开发前沿 AI 模型,摒弃了实例级可靠性。

客户与合作伙伴更新

发布于