AI推論をより安価にする競争は、汎用アクセラレータを超えたチップ設計を推進している。私たちは今、個々のモデルに特化したシリコンへと移行しつつある。そしてGoogleが開発中と報じられている「Frozen v2」プロジェクトは、Gemini AIモデルがこの動きの一翼を担っていることを示唆している。

The Informationが最初に報じたところによると、この未発表のチップはGeminiの一部アーキテクチャをハードワイヤリングしつつ、重みは更新可能に保つというものだ。この妥協により、Googleはモデル専用シリコンの効率性の多くを享受しつつ、Geminiが変更されるたびにハードウェアが陳腐化することを避けられる可能性がある。

Googleの広報担当者はThe New Stackに対し、「当社のチームは、ユーザーとお客様に最大限のパフォーマンスと効率を提供するための新しいイノベーションを常に研究・実験しています」と述べた。

Googleの広報担当者はThe New Stackに対し、「当社のチームは、ユーザーとお客様に最大限のパフォーマンスと効率を提供するための新しいイノベーションを常に研究・実験しています。すべてのプロジェクトが量産に至るわけではありませんが、この厳格な探求は当社のフルスタックアプローチの中心です。ハードウェアとソフトウェアを最初から共同設計することで、システムが統合され、実世界のワークロードに高度に最適化されていることを保証しています。」と述べた。

報道によると、Googleはこのチップが、需要に追いつくのが難しくなっているAIコンピュート逼迫の緩和に役立つことを期待している。また、Geminiをより安価で効率的に提供できるようにする狙いもある。内部予測では、現行世代のAIチップと比べて6〜10倍のトークン/ワットを実現できるとされている。

このプロジェクトが実現すれば、GoogleがGemini専用にハードウェアを構築するという、AIインフラに対する異なるアプローチとなる。開発者にとっては、将来のAIシステムがモデルとその下のハードウェアとのより緊密な統合を前提に設計される可能性を示す初期の兆候と言える。

汎用性を犠牲に専門特化したシリコンへ

現在、AI推論の大部分はNVIDIAのGPUまたはGoogle独自のTensor Processing Unit(TPU)上で実行されている。これらのチップは多様なAIモデルに対応することを目的としているため、高い処理負荷を伴う。

この種の移行には前例がある。ビットコインマイニングはCPUからGPUへ、そして最終的にASICへと同様の道をたどった。AI推論も同じ方向に向かっている可能性がある。トレーニングは依然としてGPUの柔軟性の恩恵を受けるが、一度モデルが本番環境に移行すると、消費電力を抑えつつ可能な限り多くのリクエストを処理することが優先される。

トレーニングは依然としてGPUの柔軟性の恩恵を受けるが、一度モデルが本番環境に移行すると、消費電力を抑えつつ可能な限り多くのリクエストを処理することが優先される。

競合他社も独自にハードワイヤリングを推進

AI推論がAIワークロードのより大きな割合を占めるようになる中、汎用GPUを超えた専用ハードウェアを模索しているのはGoogleだけではない。パフォーマンスを向上させつつ消費電力を抑えるために設計された専用ハードウェアの実験が、多くの企業で進んでいる。AI市場を支配するNVIDIAでさえ、推論に多額の投資を行っており、昨年はスタートアップのGroqの技術をライセンスする200億ドルの契約を締結したと報じられている。

より野心的な取り組みの一つが、カナダのスタートアップTaalasだ。同社は8億パラメータのLlamaモデル全体をシリコンに直接埋め込んだチップを実証している。モデルをチップ上に保持することで、外部メモリとの間でデータを絶えずやり取りする必要がなくなり、Taalasは推論を劇的に高速化できると主張し、1秒あたり約17,000トークンのスループットを実現しているという。一方、他の企業はハードウェアロックインを避けるため、メモリと演算ユニットの物理的距離を最適化している。

d-Matrixの新プラットフォーム「Corsair」は、標準的な高帯域幅メモリ(HBM)パッケージングに頼るのではなく、SRAMベースのインメモリコンピュートアーキテクチャを採用している。同様に、SambaNovaは高度なワークロード向けにワットあたりのトークン処理量を最大化するため、3層メモリアーキテクチャを備えたカスタムデータフロー技術を展開している。

GoogleのFrozen v2は、この分野で独自の位置を占めている。Taalasのようなハードワイヤードアーキテクチャの超高効率性を取り入れつつ、複数の製品サイクルにわたって存続可能な柔軟性をわずかに残している。

重みではなくアーキテクチャを凍結

「Frozen」という名称は、Geminiの設計の一部をチップ自体に恒久的に刻み込むという考えに由来すると報じられている。The Informationによると、Googleのエンジニアは効率性と柔軟性の適切なバランスを見つけるために長年取り組んできた。

Google DeepMindのチーフサイエンティストであるJeff Deanが主導した初期のコンセプトでは、Geminiのモデル重みを直接シリコンに埋め込むことが検討されたという。しかし、このアイデアは、Geminiが進化し続ける中でハードウェアが単一バージョンのモデルに縛られ、有効寿命が大幅に制限されるという理由で最終的に放棄された。

Frozen v2は異なるアプローチを採用していると報じられている。重みを固定するのではなく、Geminiの基盤となる設計の一部をハードワイヤリングしつつ、重みは時間とともに更新可能に保つというものだ。これにより、GoogleはGeminiに新しいバージョンが適用されるたびにハードウェアを交換することなく、モデルの改善を継続できる。

重みを固定するのではなく、Geminiの基盤となる設計の一部をハードワイヤリングしつつ、重みは時間とともに更新可能に保つというものだ。

より安価な推論が開発者に届く

Geminiの実行の一部をチップ自体に移すことで、Googleは汎用ハードウェア上でモデルを実行する際に生じるオーバーヘッドの一部を削減できる可能性がある。これにより、特にリアルタイムに近い応答を必要とするアプリケーションにおいて、レイテンシの低減につながる可能性がある。

Googleが目指すとされるワットあたりのトークン処理量を6〜10倍にするという目標は、究極的には効率性に関するものであり、その節約効果は最終的にGeminiを基盤とするエンタープライズチームに、APIコストの低減やより多くのキャパシティの提供という形で還元される可能性がある。Googleがどのようにその利益を還元するかは明らかにしていないが、推論コストの削減は業界全体の優先事項となっている。

YOUTUBE.COM/THENEWSTACK

Tech moves fast, don't miss an episode. Subscribe to our YouTube channel to stream all our podcasts, interviews, demos, and more.

Group Created with Sketch.