讓 AI 推論更便宜的競賽 正把晶片設計推向通用加速器之外。我們正走向針對個別模型量身打造的矽晶。而 Google 據報導的「Frozen v2」專案顯示,Gemini AI 模型正是這波趨勢的一部分。
據 The Information 率先報導,這款尚未公布的晶片據說會將 Gemini 架構的部分硬接進晶片,同時保留權重可更新。這項折衷方案能讓 Google 獲得接近模型專用矽晶的效率,又不會在 Gemini 每次更新時就讓硬體過時。
Google 發言人告訴 The New Stack:「我們的團隊持續研究並實驗新創新,為使用者與客戶提供最大效能與效率。」
Google 發言人告訴 The New Stack:「我們的團隊持續研究並實驗新創新,為使用者與客戶提供最大效能與效率。雖然並非每個專案都會進入量產,但這種嚴謹的探索是我們全端策略的核心。透過從一開始就共同設計硬體與軟體,我們確保系統能高度整合且針對真實工作負載進行最佳化。」
根據報導,Google 希望這款晶片能緩解讓雲端供應商難以滿足需求的 AI 運算短缺,同時讓 Gemini 的服務成本更低、更有效率。內部預估據報導指出,這項設計可提供比 Google 目前世代 AI 晶片多 6 到 10 倍的每瓦特 token 數。
若此專案順利推進,將代表 AI 基礎設施的不同做法,因為 Google 將為 Gemini 打造專用硬體。對開發者而言,這是未來 AI 系統可能在模型與底層硬體之間實現更緊密整合的早期跡象。
專用矽晶取代彈性
目前絕大多數 AI 推論仍運行在 Nvidia GPU 或 Google 自己的 Tensor Processing Unit (TPU) 上。由於這些晶片旨在支援多種 AI 模型,因此承載較高的處理負載。
這類轉變已有先例。比特幣挖礦就走過類似路徑,從 CPU 開始,接著是 GPU,最後演變為 ASIC。AI 推論可能也朝相同方向發展。訓練仍受益於 GPU 的彈性,但當模型進入生產階段,優先事項就轉為以更低功耗服務更多請求。
訓練仍受益於 GPU 的彈性,但當模型進入生產階段,優先事項就轉為以更低功耗服務更多請求。
競爭對手也將自己的模型硬接進晶片
Google 並非唯一超越通用 GPU 尋求 AI 推論的公司。隨著推論在 AI 工作負載中占比越來越高,更多公司正嘗試開發專用硬體,以提升效能並降低功耗。即使是目前主導 AI 市場的 Nvidia,也已大力投資推論領域,去年據報導與 Groq 達成 200 億美元的授權交易。
在較具野心的方案中,加拿大新創公司 Taalas 展示了一款將整個 80 億參數 Llama 模型直接嵌入矽晶的晶片。Taalas 表示,藉由將模型保留在晶片上,而非不斷在外部記憶體之間搬移資料,可大幅加速推論,宣稱每秒可達約 17,000 token。同時,其他公司正最佳化記憶體與運算單元之間的空間距離,以避免 硬體鎖定。
d-Matrix 的新 Corsair 平台採用基於 SRAM 的記憶體內運算架構,而非依賴標準的高頻寬記憶體 (HBM) 封裝。同樣地,SambaNova 則部署自訂資料流技術,搭配三層記憶體架構,為進階工作流程最大化每瓦特 token 數。
Google 的 Frozen v2 在這片領域中獨樹一格——借鏡 Taalas 等硬接架構的極致效率,同時保留足夠彈性,能跨越多個產品週期持續使用。
凍結架構而非權重
據報導,「Frozen」這個名稱來自將 Gemini 部分設計永久蝕刻進晶片的想法。根據 The Information 的報導,Google 工程師已花費數年尋找效率與彈性之間的最佳平衡點。
據報導,由 Google DeepMind 首席科學家 Jeff Dean 主導的早期概念,曾打算將 Gemini 的模型權重直接嵌入矽晶。該想法最終被放棄,因為它會讓硬體綁定在單一版本的模型上,隨著 Gemini 不斷演進,大幅限制硬體的使用壽命。
Frozen v2 據報導採用不同做法。不再鎖定權重,而是將 Gemini 底層設計的部分硬接進晶片,同時仍允許權重隨時間更新。這讓 Google 能在不需每次 Gemini 更新版本就更換硬體的情況下,持續改善模型。
不再鎖定權重,而是將 Gemini 底層設計的部分硬接進晶片,同時仍允許權重隨時間更新。
更便宜的推論惠及開發者
透過將 Gemini 部分執行移入晶片本身,Google 可減少在通用硬體上運行模型時產生的部分開銷。這可能轉化為更低的延遲,尤其對依賴近即時回應的應用程式而言。
Google 據報導目標是提供 6 到 10 倍的每瓦特 token 數,最終目的是提升效率,而這些節省最終可能透過更低的 API 費用或更多可用容量,傳遞給 在 Gemini 上建置的企業團隊。雖然 Google 尚未說明將如何將這些效益傳遞出去,但 降低推論成本已成為產業優先事項。
科技發展迅速,別錯過任何一集。訂閱我們的 YouTube 頻道,收看所有播客、訪談、示範等內容。
Group Created with Sketch.
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.