記事一覧に戻る

本日、4つの優れたサーバーレスInference Provider – fal, Replicate, Sambanova, Together AI – をHubのモデルページに直接統合してリリースします。また、これらはクライアントSDK(JSおよびPython)にもシームレスに統合されており、お気に入りのプロバイダーで動作する多様なモデルのサーバーレス推論をこれまで以上に簡単に探索できるようになります。 Inference Providers

私たちは長年Hub上でサーバーレスInference APIをホストしてきました(2020年夏にv1をリリースしました – 時の流れは速いですね 🤯)。これにより簡単な探索とプロトタイピングが可能になりましたが、私たちはコミュニティとの大規模データセットやモデルのコラボレーション、保存、バージョン管理、配布というコアバリュープロポジションを洗練してきました。同時に、サーバーレスプロバイダーは急成長を遂げ、Hugging Faceが優れたプロバイダー群を通じてサーバーレス推論への簡単で統一されたアクセスを提供するタイミングが到来しました。

AWSやNvidiaなどと提携してモデルページのDeployボタン経由で専用デプロイメントオプションを提供しているのと同様に、モデル中心のサーバーレス推論向けに次世代のサーバーレス推論プロバイダーと提携することは自然な流れでした。

ここ数日で一躍有名になったDeepSeek-ai/DeepSeek-R1をタイムリーな例として、これが実現する内容をご紹介します 🔥:

SambaNovaの共同創業者兼CEO、Rodrigo Liang氏:「Hugging FaceのInference APIの加速に向けたパートナーシップに興奮しています。Hugging Faceの開発者は、幅広い最高のオープンソースモデルで大幅に高速な推論速度を利用できるようになりました。」

ReplicateのFounding Designer、Zeke Sikelianos氏:「Hugging Faceはオープンソースモデルウェイトの事実上のホームであり、AIを世界中の人々にアクセスしやすくする上で重要な役割を果たしてきました。私たちはReplicate社内でHugging Faceをウェイトレジストリとして利用しており、このローンチで紹介される最初のinference providerの一員として光栄に思います。」

これはまだ始まりに過ぎません。今後数週間、コミュニティとともにさらに発展させていきます

仕組み

ウェブサイトUIでの利用

  1. ユーザーアカウント設定では、以下の操作が可能です:
  • サインアップ済みのプロバイダー用のAPIキーを設定できます。設定しなくても利用可能で、リクエストはHF経由でルーティングされます。
  • プロバイダーの優先順位を設定できます。これはモデルページのウィジェットとコードスニペットに適用されます。

Inference Providers

  1. 前述の通り、Inference APIの呼び出しには2つのモードがあります:
  • カスタムキー(リクエストは対応するinference providerに直接送信され、そのinference providerのAPIキーが使用されます)
  • HF経由のルーティング(この場合、プロバイダーのトークンは不要で、料金はプロバイダーアカウントではなくHFアカウントに直接適用されます)

Inference Providers

  1. モデルページには、現在のモデルと互換性のあるサードパーティinference providerが表示されます(ユーザーの優先順位でソート)

Inference Providers

クライアントSDKからの利用

Python(huggingface_hubを使用)

以下の例は、Together AIをinference providerとしてDeepSeek-R1を利用する方法を示しています。Hugging Faceトークンを使用してHugging Face経由で自動ルーティングするか、Together AI APIキーをお持ちの場合はそちらを使用できます。

huggingface_hub v0.28.0以降をインストールしてください(リリースノート)。

from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="together",
    api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)

messages = [
    {
        "role": "user",
        "content": "What is the capital of France?"
    }
]

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-R1", 
    messages=messages, 
    max_tokens=500
)

print(completion.choices[0].message)

注: OpenAIクライアントライブラリを使用してInference Providersを呼び出すこともできます。DeepSeekモデルの例はこちらをご覧ください。

また、FLUX.1-devfal.aiで実行してテキストプロンプトから画像を生成する方法は以下の通りです:

from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="fal-ai",
    api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)

# output is a PIL.Image object
image = client.text_to_image(
    "Labrador in the style of Vermeer",
    model="black-forest-labs/FLUX.1-dev"
)

別のプロバイダーに切り替える場合は、プロバイダー名を変更するだけで、他の部分はすべて同じままです:

from huggingface_hub import InferenceClient

client = InferenceClient(
-	provider="fal-ai",
+	provider="replicate",
    api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)

JS(@huggingface/inferenceを使用)

import { HfInference } from "@huggingface/inference";

const client = new HfInference("xxxxxxxxxxxxxxxxxxxxxxxx");

const chatCompletion = await client.chatCompletion({
    model: "deepseek-ai/DeepSeek-R1",
    messages: [
        {
            role: "user",
            content: "What is the capital of France?"
        }
    ],
    provider: "together",
    max_tokens: 500
});

console.log(chatCompletion.choices[0].message);

HTTPコールからの利用

huggingface.coドメイン直下にRouting proxyを公開しているため、直接呼び出すことができ、OpenAI互換APIなどに便利です。ベースURLとしてURLを置き換えるだけです:https://router.huggingface.co/{:provider}

以下は、Sambanovaをinference providerとしてLlama-3.3-70B-InstructをcURL経由で呼び出す例です。

curl 'https://router.huggingface.co/sambanova/v1/chat/completions' \
-H 'Authorization: Bearer xxxxxxxxxxxxxxxxxxxxxxxx' \
-H 'Content-Type: application/json' \
--data '{
    "model": "Llama-3.3-70B-Instruct",
    "messages": [
        {
            "role": "user",
            "content": "What is the capital of France?"
        }
    ],
    "max_tokens": 500,
    "stream": false
}'

請求

直接リクエスト(inference providerのキーを使用する場合)は、対応するproviderから請求されます。たとえば、Together AIキーを使用する場合はTogether AIアカウントから請求されます。

ルーティングされたリクエスト(Hub経由で認証する場合)は、標準のprovider API料金のみをお支払いいただきます。追加のマークアップは一切ありません。providerコストをそのままお渡しします。(将来的には、providerパートナーとの収益分配契約を締結する可能性があります。)

重要なお知らせ ‼️ PROユーザーは毎月$2相当のInferenceクレジットを受け取れます。これらのクレジットはすべてのプロバイダーでご利用いただけます。 🔥

Inferenceクレジット、ZeroGPU、Spaces Dev Mode、20倍高い制限などへのアクセスを得るには、Hugging Face PROプランに登録してください。

サインイン済みの無料ユーザー向けに少額のクォータで無料推論も提供していますが、可能であればPROへのアップグレードをお願いします!

フィードバックと次のステップ

フィードバックをお待ちしています!以下のHub discussionをご利用ください:https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49