本文へスキップ
製品・評価・観測

答えが間違っていたとき、
どこで間違えたのかが見えます

質問1件に対してモデルが何回呼び出されたか、どのドキュメントを検索したか、どのSQLを実行したか、どこで時間がかかったかがすべて残ります。回答品質は人が一件ずつ読まなくてもスコアとして蓄積されます。

モデル呼び出し・検索・SQLを記録 TRACE
ステップごとの所要時間 LATENCY
自動評価で品質スコアを蓄積 SCORE
TRACE
エージェントトレースと区間別所要比率

何が間違ったのか分からなくなる三つの地点

「AIが変な答えをした」という報告しか来ません

会話IDからトレースを探し、検索・ツール・モデルのどの段階が原因かを確認します。

モデルを変えても良くなったかわかりません

自動採点スコアとモデル別の推移、Arenaランキングで比較します。

LLMコストが月末にならないと見えません

モデルごとの単価を登録すれば、使用量画面でコストがすぐに推定されます。

一回の実行をたどる機能

トレース

  • LLM呼び出し・ツール・検索・ガードレールまで、回答1件の全経路を記録します。
  • ツリー・タイムライン・トークンの3つのビューで確認でき、最も時間がかかった区間が自動で表示されます。
  • ノードをクリックすると入力と出力(プロンプト・検索結果・SQL・ツール応答)を確認できます。
  • 推論モデルを使うと、推論サマリーと推論トークンもトレースに表示されます。

自動品質評価

  • エージェントに自動評価を有効にすると、審査モデルが回答を検索品質・忠実性・応答品質の基準で0〜1点で採点します。
  • ユーザーがアップロードした添付ファイルは検索品質の採点から除外し、公平に評価します。
  • モデル別・エージェント別のスコア推移を確認できます。

フィードバック・Arena

  • ユーザーフィードバックを項目ごとに構造化して収集します。
  • モデル同士の回答を比較した結果からEloベースのランキングを算出します。

使用量

  • モデル・ユーザー・グループ・組織・エージェント別にトークンを集計します。
  • 時系列・トリーマップ・曜日×時間帯ヒートマップ・ランキング表で確認できます。
  • モデルごとの単価(入力・出力・キャッシュ)を登録するとコストが推定され、表示通貨も設定できます。プロンプトキャッシュによる削減量も時系列に表示されます。
  • 会話ログをフィルターで検索できます。

設定状態チェック

  • 管理画面の1か所で、LLM接続・埋め込み・抽出エンジン・検索・Web検索・コード実行・コードゲートウェイ・通知・音声・画像・暗号化・ライセンスが設定されているかと、その影響範囲を確認します。

トレースと自動品質評価の画面

製品画面の例 · トレース 0:09

一回の実行の各段階がツリーで積み上がり、最も時間のかかった区間の入力・出力が開きます。

エージェントが実行したSQLと結果がそのままノードに残ります。
モデルごとの単価を登録すると、使用量がコストとして見えます。

ライセンス

トレース・評価はProfessionalティアから含まれます。使用量集計はすべてのティアで提供されます。→ 料金・ライセンス

関連する更新情報

1.3.0 2026-07

使用量 使用量の可視化とコスト見積もり

更新履歴をすべて見る →

自社の質問を一つ、トレースで追ってお見せします

導入方式・連携範囲・ガバナンス要件に基づいてデモ環境をご用意します。