AIの急速な進化は、テック業界とアプリ開発の在り方を大きく変えつつあります。従来のサーバーレスコンピューティングは、素早くステートレスなWebアプリのトランザクション向けに設計されていました。しかしLLMとのやり取りには、持続的なコンピュートと継続的な実行パターンが必要です。

この設計のミスマッチは、AIワークロードに適した新しいコンピュートモデルの機会を生み出しています。

Copy link to headingLLM interactions: A sequence, not a single request

LLMとのやり取りは、単にリクエストを送信してレスポンスを受け取るだけではありません。ほとんどのリクエストがミリ秒単位で処理される従来のWebアプリとは異なり、LLMワークロードには長い実行時間と非アクティブな期間が含まれます。

各インタラクションは次のようなマルチステッププロセスに従います:

  • Serverless function is invoked: 関数が初期化され、LLMリクエストを処理する準備をします

  • Function sends request to LLM API: この段階で、関数は積極的にコンピュートリソースを消費します

  • Function enters idle state waiting for response: これには数秒から数分かかる場合がありますが、関数は実行を続け、有用な作業をしていないにもかかわらず課金対象の時間が蓄積されます

  • LLM completes processing and returns response to function: レスポンスは待機中の関数(まだアクティブな場合)に受信されます

  • Response is streamed back to the client: 待機中に関数がタイムアウトした場合、レスポンスを処理するために新しいインスタンスを起動する必要があります

  • Cycle repeats for subsequent requests: 新しいインタラクションごとに通常、新しい関数インスタンスが生成されます。既存のインスタンスが利用可能でも十分に活用されていない場合でもです

このシーケンスは、LLMインタラクションと従来のサーバーレスの間でアーキテクチャ上の前提がどのように異なるかを明らかにします:

  • Transaction timing: 従来のサーバーレスはミリ秒単位のレスポンス向けに設計されていましたが、LLMの処理時間は数秒に及びます

  • Execution patterns: 関数は単一の独立したリクエスト向けに構築されており、連続的なLLM会話向けではありません

  • Resource lifecycle: 従来のモデルは、持続的なインタラクションよりも迅速な完了を前提としています

  • Scaling model: 水平スケーリングは短いバーストのアクティビティ向けに最適化されており、継続的なAIワークロード向けではありません

従来のサーバーレスコンピューティングは、その本来の用途である素早くステートレスなWebトランザクションでは優れた性能を発揮します。LLMインタラクションは、目的に特化したインフラを必要とする異なる計算パラダイムを表しています。

Copy link to headingFluid compute for AI workloads

Fluidは、私たちの新しいコンピュートモデルで、既存のリソースを利用してから新しいリソースをスケーリングすることで、総コンピュート消費量を削減します。リクエストごとに新しい関数を起動する代わりに、利用可能なキャパシティをインテリジェントに再利用し、コンピュートがアイドル状態にならないようにします。これにより、以下のことが可能になります:

  • Prioritizing existing resources before spawning new ones: Fluidはまず単一のインスタンス内でスケーリング(多対一)するため、コールドスタートやコストを増加させる余分なスピンアップを回避します

  • Scaling happens inside a function, not just across instances: 不要な新しい関数の生成を避け、代わりにコンピュートを動的に共有します

  • AI conversations remain fluid and cost-efficient: ユーザーは中断のないレスポンスを得られ、開発者はインフラの非効率性を低減できます

単一のインスタンスが複数のAI推論リクエストを同時に処理できるようになり、オーバーヘッドを削減し、より効率的なスケーリングを実現します。Fluidは必要に応じてコンピュートを動的に再割り当てすることで、AIワークロードがすべてのリソースを積極的に処理に貢献しながらピークパフォーマンスで実行されることを保証します。

さらに、Fluidはデータに近いリージョンにリソースを戦略的に配置し、パフォーマンスと一貫性の両方を最適化するとともに、リソース集約型のAIワークロードの効率的な実行を可能にします。

Fluid computeにより、LLMワークロードはスケーラビリティと効率性のどちらかを選ぶ必要がなくなり、両方を同時に実現できます。AIアプリは安全で応答性が高く保たれ、コストは予測可能になり、すべての関数呼び出しが単なる待機ではなく処理に積極的に貢献します。アイドル状態のコンピュートに対して料金を支払うのではなく、Fluid computeは関数のすべての時間を完全に活用します。

See how Fluid compute works on Vercel

Fluid compute boosts serverless performance by reusing idle compute during LLM calls, keeping functions active and scaling dynamically.

Learn more

Copy link to headingSecure by default

最適化を超えて、Fluid computeは最新のAIワークロードの要求に対応するセキュリティと信頼性の基盤の上に構築されています。

  • Edge security with Vercel Firewall: リクエストは最寄りのVercel Point of Presence (PoP)にルーティングされ、Vercel Functions routerに到達する前にVercel Firewallによって検査されます。このLayer 7 protectionはDoS攻撃を含むほとんどのアプリケーションレベルの脅威をブロックし、不審なトラフィックをフィルタリングすることで、正当なリクエストのみがアプリに到達することを保証します

  • Secure instance architecture: Fluid computeインスタンスはインターネットに直接公開されることはありません。代わりに、セキュアで永続的なTCPトンネルを通じてVercel Functions routerに接続します。関数呼び出しやレスポンスを含むすべての通信は、この制御されたチャネルを介して流れ、強力な分離と正確なワークロード管理を保証します

  • Enhanced reliability and availability: Fluidはリージョン内の複数のアベイラビリティゾーン間で自動的にフェイルオーバーします。Enterpriseのお客様向けには、Fluidはマルチリージョンフェイルオーバー機能も備えています。これらのセーフガードにより、アップタイムを確保し、ローカライズされた障害に直面してもアプリをレジリエントに保ちます

このレイヤードセキュリティモデルにより、Fluidは機密性の高いAIワークロードに必要な保護を損なうことなく、パフォーマンスと効率性を提供します。

Copy link to headingStart building with AI

AIワークロードにはスケール以上のものが必要です。効率性とセキュリティが必要です。Fluid computeはリソースの完全な活用を保証し、コストを削減しながら安全で高性能な実行を実現します。

これはAIチームが求めていたインフラです。高速で適応性があり、リアルタイム推論とバックグラウンドタスクをサポートするように構築されています。Fluid computeは新しいプロジェクトのデフォルトになりました。既存のプロジェクトでは有効化できます

Deploy an AI-powered app with Fluid compute today

Optimize your AI applications with Fluid compute and maximize your compute.

Get started