在 Google,AI 是一項從頭到尾的全面事業。顯而易見,我們開發了 Gemini、Nano Banana 等領先的 AI 模型。我們將 AI 整合到日常使用的工具中(例如 Gmail、BigQuery、AlloyDB、Google Cloud Code 與 Google Cloud Assist)。我們建立軟體框架協助您建置 AI 應用,例如 Gemini Enterprise Agent Platform、JAX 或 MaxTest。我們也共同設計執行所有這些功能的強大基礎架構平台,包含各種標準運算、TPU 與 GPU 等加速器、最佳化網路與儲存,以及 GKE、Cluster Director 等協調軟體。最後,我們將這些功能全部打包成 AI Hypercomputer 等超級運算平台,驅動整個產業轉型為 AI 與代理式未來。
這在當今的代理式時代至關重要,因為 AI 正從回答問題進化到進行推理與採取行動。想要在 AI 的下一階段領先的公司,需要為這些新需求設計並最佳化的運算基礎架構,以便更快創新、提供吸引人的使用者與客戶體驗,並最佳化成本與能源效率——同時達到大規模水準。
為支援此目標,我們以驚人的速度發布 AI 基礎架構與協調平台相關消息。在這篇部落格中,我們每月提供您需要了解的最新發布與里程碑、架構與效能調校的深入解析,以及專門使用案例的探討,並附上更多學習資源的連結。請持續關注每月更新。
2026 年 7 月
產品、技術與工具更新
-
產品更新: Google Cloud Managed Lustre 現已正式推出(GA),提供四種不同的效能層級,傳輸量從每 TiB 容量 125 MB/s、250 MB/s、500 MB/s 到 1000 MB/s 不等,儲存容量最高可擴充至 8 PB。Managed Lustre 解決方案由 DDN 的 EXAScaler 提供支援,結合 DDN 在高效能儲存領域數十年的領先地位與 Google Cloud 在雲端基礎架構的專業知識。
-
產品更新: C4N 網路與儲存最佳化 VM 現已正式推出(GA)。C4N 是我們首個針對網路與區塊儲存最佳化的 VM 系列,旨在消除資料傳輸瓶頸。採用第 5 代 Intel Xeon Scalable 處理器,並建構於 Google 的 Titanium 卸載硬體之上,可達成 400 Gbps 網路頻寬、每秒 9500 萬封包(MPPS),搭配 Hyperdisk Extreme 時,區塊儲存傳輸量最高可達 25 GiB/s。
-
新功能: GKE Dataplane V2 支援高達 15K 節點與網路政策(GA)。此功能讓標準 GKE 叢集可擴充至 15,000 個節點,同時維持完整的動態網路政策執行,滿足大型企業與 AI/ML 客戶的大規模基礎架構需求。
-
新功能: llm-d 中的協同時間切片。若您正在執行強化學習(RL)工作負載,現在可將獨立的 RL 工作交錯安排在共用實體硬體上執行,將加速器整體使用率從約 40% 的基準提升至 70%,且不影響模型收斂或準確度。
-
全新 AI 安全工具: 若您想在 GKE 上保護 AI 供應鏈,安全部署 AI 工作負載,並減少影子 AI,我們已開源 k8s-aibom。這是一個輕量、非特權的 Kubernetes 控制器,可持續監控容器叢集,自動偵測正在執行的 AI 執行環境(如 vLLM 與 Triton),並產生標準的 CycloneDX 機器學習物料清單(ML-BOM)。請查看 k8s-aibom 專案 並參與貢獻。
實務指南與操作教學
-
操作指南: 7 月 27 日,Google 宣布 針對 Moonshot AI 的 Kimi K3 提供 Day 0 支援。這是一款 2.8 兆參數的開放權重模型,於權重發布當天即提供支援。無論您偏好哪種部署途徑——透過 Model Garden、自訂協調,或使用 llm-d 配方搭配 GKE——本指南皆提供詳細的逐步操作說明,協助您在 Google Cloud 上評估並試用 Kimi K3。
-
操作指南: Google Kubernetes Engine (GKE) 受管理的 DRANET 同時支援 GPU 與 TPU。此實作有多種設定方式,包含標準叢集(您擁有完整控制權)與 autopilot 叢集(Google 為您處理繁複設定)。您可參考動手實驗室深入了解:GKE Autopilot 叢集搭配 TPU、GKE 受管理 DRANET 與 Gemma 4。
-
操作指南: 學習如何在 TPU 而非 GPU 上執行 Ray。在這個兩部分系列的 第 1 部分 中,我們會討論 TPU 切片(提示:Ray 將其視為另一種可排程的加速器),接著逐步介紹 Ray 的各種 AI 函式庫(第 2 部分)。
-
操作指南: 使用全新的微基準測試套件評估 TPU 的範例工作負載,幫助您準確判斷裝置是否達到理論效能規格,並找出特定的效能差距或架構特定的瓶頸。請至此處 深入了解。
-
操作指南: 在不超出預算的前提下擴展您的代理程式。了解 GKE 協調如何協助您在固定的運算資源中安全地容納更多代理程式,使用 GKE Agent Sandbox 與 Pod 快照。無論您的目標是效能還是成本最佳化,我們都會教您如何調整正確的參數以達到最佳代理程式效率。
-
技術藍圖: Mistral 3 大型模型在 Ironwood 上的推論最佳化內幕。本文說明 Google 團隊如何在 Google 的 Ironwood(TPU v7x)上最佳化 Mistral 3 大型 MoE 模型推論,達成 1.5 倍效能提升。他們採用混合分片、將線性 VPU 加總替換為樹狀歸約、最佳化 GMM/MLA 核心,並採用非同步排程,最終將吞吐量提升高達 48%,同時維持基準準確度中性。請至此處 閱讀完整文章。
研究、報告與深入解析
-
報告: Google 在 Gartner 首份 GartnerⓇ Magic Quadrant™ for AI Infrastructure 中獲選為領導者,在「執行能力」與「願景完整性」兩項指標中皆名列前茅。Gartner 特別指出 Google 專有的可擴充運算、整合式 AI Hypercomputer 架構,以及 AI 運算容量的規模是主要優勢。您可至此處 下載報告副本。
-
報告: 我們最近針對 1,400 多位資深 IT 主管進行 State of AI Infrastructure 調查,發現一個明確的模式:AI 雄心與基礎架構現實之間的差距正在擴大。事實上,83% 的組織表示需要升級基礎架構以支援正式營運等級的代理式 AI。請閱讀隨附的部落格文章,了解如何調整基礎架構以滿足代理式應用對系統的需求,協助您從試驗階段邁向正式營運。
2026 年 6 月
產品、技術與工具更新
-
產品更新: 保護用於 AI 的敏感資料是進階且安全的雲端基礎架構的重要一環。Confidential Computing 利用硬體式可信任執行環境(TEE)以密碼學方式保護使用中的資料,並提供可驗證的資料完整性,現已於加速器最佳化的 G4 機器系列 上推出,搭載 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU。您可透過 Confidential G4 VM 與 Confidential G4 GKE 節點 開始使用。
-
開發人員資源: 新的 TPU Developer Hub 是模型建置者、最佳化人員與開發人員學習如何充分發揮 Google Cloud TPU 效能的首選平台。請參閱此篇部落格 了解詳情。
-
新產品: 使用新的 基於 OpenTelemetry 的 TPU AI 遙測收集代理程式 擴展您的 AI 工作負載。您可以將高保真度的 TPU 硬體遙測資料路由至 Google Cloud Monitoring、Google Managed Prometheus,或您自行託管的 Grafana 堆疊。
實務指南與操作教學
-
操作指南: 學習如何在 GKE Inference Gateway 上使用 TPU、Cloud Storage FUSE 與動態資源分配(DRA)建置高可用性的 AI 推論工作負載。本篇部落格 提供概觀,您也可以在動手實驗室 中取得所有技術細節。
-
操作指南: 您知道可以透過 Model Context Protocol (MCP) 將 AI 代理程式連線至 Cloud Storage 中的非結構化資料嗎?在本篇部落格 中,您將從三個客戶範例了解這樣做的原因,然後學習如何選擇完全託管服務或自行管理的本機伺服器,以進行更多自訂與控制。
研究、報告與深入解析
-
報告: 根據獨立基準測試報告,GKE Inference Gateway 的效能優於次一名的受管理 Kubernetes 服務,吞吐量高出 15.7%、等待時間縮短 92.8%,且 token 間延遲降低 62.6%。此效能歸功於其使用前綴快取,透過儲存長重複提示前綴的 KV 快取(啟動狀態)來最佳化 LLM 效能。請至部落格 了解詳情。
-
架構深入解析: 更深入探討 TPU 與 GKE 的冷啟動問題,以及 Run:ai Model Streamer 如何協助改變現況。
客戶與合作夥伴更新
-
客戶成功案例: Pager Health 運用 GKE、BigQuery、Cloud SQL 與 Gemini Enterprise Agent Platform,消除營運碎片化,提供簡化且個人化的美國醫療保健體驗,改變人們的生活。
-
客戶成功案例: 客戶評論平台 Trustpilot 使用微調後的 Gemma 模型搭配 Dataflow 與 Gemini Enterprise Agent Platform,在採用 A100 GPU 的成本最佳化 A2 VM 上建置高流量串流管線,並使用 Gemini Enterprise Agent Platform 維護的 vLLM 最佳化版本。
2026 年 5 月
產品、技術與工具更新
-
產品更新: GKE Agent Sandbox 現已正式推出(GA)。
-
全新開源專案: Agent Substrate 是一個新的開源專案,旨在持續突破代理式基礎架構密度的極限。
-
新功能: Google AI Edge Portal 是一種用於大規模測試與基準測試裝置端機器學習(ML)的解決方案,現已支援對裝置端 LLM 進行基準測試與偵錯。請至此處 閱讀更多資訊。
-
產品深入解析: 我們深入探討 Cloud Storage Rapid,這是專為 AI 工作負載設計的新一代高效能儲存產品系列。推出時包含 Rapid Bucket(前身為 Rapid Storage),這是一種高效能的區域物件儲存產品,以及 Rapid Cache(前身為 Anywhere Cache),可依需求加速讀取,並將運算與資料共同放置在現有儲存貯體中。
研究、報告與深入解析
-
架構深入解析: Google 全球基礎架構副總裁 Bikash Koley 與工程研究員 Arjun Singh 提供高階概觀,說明 AI 工作負載對網路基礎架構帶來的挑戰,並討論我們對資料中心架構、WAN 與全球網路所做的深度強化,以更好地支援這些工作負載。
-
架構深入解析: 我們針對在 TPU 上開發前沿 AI 模型,推出全新的 叢集層級可靠性模型,捨棄執行個體層級的可靠性。
客戶與合作夥伴更新
-
客戶成功案例: 視覺媒體供應商 Imgix 每天從搭載 NVIDIA RTX PRO 6000 Blackwell GPU 的 G4 VM 所組成的 AI Hypercomputer 處理超過 80 億張影像。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.