Debugging LLM Calls: How to Trace What Your AI Agent Actually Did のカバー画像

John

少ししたサイドプロジェクトで、世界について質問に答えるチャットボットを作っていました。楽しい、低リスクで、誰かの給料がかかっているわけでもありません。

誰かが「トーナメントはもう終わった?」と尋ねました。

「いいえ」と自信たっぷりに答えました。間違いです。実際には数週間前に終わっていました。

まあ、モデルは時々間違えるもので、それほど新しい話ではありません。実際に驚いたのは次の質問でした:なぜ? チェックしようとしたのか? それとも記憶から推測しただけなのか? 正直、知る方法がありませんでした。モデルは日記を残しません。回答し、それだけです。推論はただ消え去ります。

これは趣味のプロジェクトであっても、本物のユーザーを持つものであっても同じことです。ログもなく、「回答する前に見たものがこれです」というものもありません。何もありません。スクリーンショットと勘でブラックボックスをデバッグする羽目になります。

まだ深く関わっていない人向けの1文バージョン

ここで何が言いたいのか、もう正確にわかっている人が多いと思います:OpenTelemetryです。すでに知っている方は、先に進んでください。

「名前は聞いたことがあるけど、実際に見たことはない」という人向けに、短く説明します:基本的にAI呼び出し用のブラックボックス式フライトレコーダーです。コードがモデルに何かを尋ねるたびに、尋ねた内容、返ってきた内容、かかった時間、コストを静かに記録します。

実際に設定する方法:インフラの知識は不要

  1. 使用しているモデルプロバイダー向けに作られた小さなライブラリを入手します。既存のコードを自動的にラップするので、呼び出しを書き直す必要はありません
  2. データを送信する場所を指定します。URLとキーを指定するだけです
  3. いつも通りボットに質問します
from openinference.instrumentation.anthropic import AnthropicInstrumentor

AnthropicInstrumentor().instrument(tracer_provider=provider)

# Nothing else changes below. This call is now traced automatically.
response = client.messages.create(model=model_name, messages=messages)

Enter fullscreen mode Exit fullscreen mode

その直後に完全な記録が表示されます:プロンプト、回答、タイミング、コスト。初めて見たとき、「ああ、そういうことだったのか」という本当に満足感のある瞬間です。

必要なもの:すでに使用しているモデルのAPIキーと、データを送信する場所です。いくつかの優れた無料オプションがあります。

設定にかかる時間:30分未満で、ほとんどがすでに書いたコードに2行を貼り付けるだけです。

利用可能なツール群

この分野の既存ツール:LangSmith、Langfuse、Helicone、PromptLayer、Braintrust、Arize Phoenix(セルフホストしたい場合は無料でオープンソース)です。

何かにコミットせずに試してみたい場合は、Enpromptaが初心者向けの良い出発点です。

実際に試すための小さな公開サンプルプロジェクトもあります:

2026 World Cup Assistant

2026 FIFAワールドカップ(米国/カナダ/メキシコ、2026年6月11日~7月19日)に関する質問に答える軽量アシスタントです。Claudeの組み込みウェブ検索ツールを呼び出すので、回答は最新の結果と試合日程を反映できます。

ウェブアプリとコマンドラインツールの2つの形式があり、1つのプロンプトと1つの依存関係を共有します。

アプリは意図的に計装されていません。計装の追加は学生向けの演習です。

Enpromptaで計装する

計装が何を追加するかを確認したいですか? Colabでクイックスタートノートブックを開いてください。このアプリをクローンし、OpenTelemetryトレーシング、バージョン管理されたプロンプト、単一のLLM呼び出しサイト周りの評価を配線し、トレースをEnpromptaプロジェクトにストリーミングします。

Open In Colab

コースを受講する:AIエージェントの評価

トレースしたら、評価する方法を学びましょう。このアプリはEnpromptaのエージェント評価に関する無料コースの実行例です。以下のような観点でスコアリングします…

クローンしてトレーシングを配線し、自分自身の「なぜそんなことを言ったのか」を見つけてください。