何が間違ったのか分からなくなる三つの地点
「AIが変な答えをした」という報告しか来ません
会話IDからトレースを探し、検索・ツール・モデルのどの段階が原因かを確認します。
モデルを変えても良くなったかわかりません
自動採点スコアとモデル別の推移、Arenaランキングで比較します。
LLMコストが月末にならないと見えません
モデルごとの単価を登録すれば、使用量画面でコストがすぐに推定されます。
一回の実行をたどる機能
トレース
- LLM呼び出し・ツール・検索・ガードレールまで、回答1件の全経路を記録します。
- ツリー・タイムライン・トークンの3つのビューで確認でき、最も時間がかかった区間が自動で表示されます。
- ノードをクリックすると入力と出力(プロンプト・検索結果・SQL・ツール応答)を確認できます。
- 推論モデルを使うと、推論サマリーと推論トークンもトレースに表示されます。
自動品質評価
- エージェントに自動評価を有効にすると、審査モデルが回答を検索品質・忠実性・応答品質の基準で0〜1点で採点します。
- ユーザーがアップロードした添付ファイルは検索品質の採点から除外し、公平に評価します。
- モデル別・エージェント別のスコア推移を確認できます。
フィードバック・Arena
- ユーザーフィードバックを項目ごとに構造化して収集します。
- モデル同士の回答を比較した結果からEloベースのランキングを算出します。
使用量
- モデル・ユーザー・グループ・組織・エージェント別にトークンを集計します。
- 時系列・トリーマップ・曜日×時間帯ヒートマップ・ランキング表で確認できます。
- モデルごとの単価(入力・出力・キャッシュ)を登録するとコストが推定され、表示通貨も設定できます。プロンプトキャッシュによる削減量も時系列に表示されます。
- 会話ログをフィルターで検索できます。
設定状態チェック
- 管理画面の1か所で、LLM接続・埋め込み・抽出エンジン・検索・Web検索・コード実行・コードゲートウェイ・通知・音声・画像・暗号化・ライセンスが設定されているかと、その影響範囲を確認します。
ライセンス
トレース・評価はProfessionalティアから含まれます。使用量集計はすべてのティアで提供されます。→ 料金・ライセンス
