自動評価と AI アシスタントの監視
AI アシスタントの応答品質、パフォーマンス指標、コストを自動テストおよびリアルタイムで監視します
自動評価
自動評価機能では、あらかじめ作成したテストデータセットを使用して、AI アシスタントの応答品質を自動的にテストできます。システムはテスト質問を AI アシスタントに送信し、実際の応答と期待される応答を照合して、詳細な評価レポートを生成します。
自動評価へのアクセス
左側のメニューから「AgentOps」に入り、「自動テスト」をクリックします。

このページには、評価名、テストセット、AI アシスタント、成功率、平均秒数、作成日時を含むすべての評価記録が表示されます。
テストの作成と実行
テストデータセットが作成済みであることを確認します(テストデータセット管理を参照)
「テストを作成」ボタンをクリックします
評価名と説明を入力し、テストデータセットと AI アシスタントを選択します
「評価を開始」をクリックすると、システムがすべてのテストケースを自動的に実行します
評価結果の確認
評価記録をクリックすると、詳細レポートを確認できます。

詳細レポートには以下が含まれます。
成功率:テストに合格したケースの割合
AI インサイト:システムが自動分析した評価概要と改善提案
指標統計:品質評価、回答関連性などの指標
テストケース明細:各質問の期待される応答、実際の応答、評価、ステータス
成功率の参考基準:
製品照会アシスタント
≥ 95%
カスタマーサポートアシスタント
≥ 90%
汎用対話アシスタント
≥ 80%
評価記録の管理
検索とフィルタリング:テストセット、AI アシスタント、またはキーワードで記録をフィルタリングします
再実行:ナレッジベースや AI 設定を変更した後、再テストして改善効果を検証します
エクスポート:評価結果を Excel 形式でエクスポートします
評価名と説明の編集
テストの完了後も、テストを削除したり再実行したりせずに、評価名と説明を変更できます。テストデータセット、AI アシスタント、評価結果、実行ステータスは変更されません。
たとえば、Mai が毎週のカスタマーサポート品質テストを作成した後、評価名の週番号に誤りがあることに気づいたとします。自動テスト一覧から編集画面を開き、名前を修正してテストの目的を追記します。保存すると、一覧には新しい内容がすぐに表示され、元のテスト結果もそのまま保持されます。

AI アシスタント監視
AI アシスタント監視は、リアルタイムの対話運用データを提供し、各対話の処理詳細、パフォーマンス指標、品質評価を詳しく把握できるようにします。
AI アシスタント監視へのアクセス
左側のメニューから「AgentOps」に入り、「AI アシスタント監視」をクリックします。

監視項目の説明
ユーザー入力メッセージ
ユーザーが AI に送信した質問
出力メッセージ
AI アシスタントの応答内容
AI アシスタント
この対話を処理した AI アシスタントの名前
ユーザーフィードバック
高評価 👍 または低評価 👎
誠実性スコア
応答がナレッジベースの内容に忠実かどうか
回答関連性スコア
応答と質問の関連度
応答時間
AI が応答を生成するまでの全体の時間
LLM 処理推論時間
LLM の推論と応答生成にかかった時間
総文字数
対話で消費された総文字数(質問と回答を含む)
LLM
使用した言語モデルの名前
ユーザー
対話を開始したユーザー
検索とフィルタリング
キーワード検索:入力/出力メッセージまたはユーザー名を検索します
LLM フィルタリング:特定の言語モデルを選択し、異なるモデルのパフォーマンスを比較します
AI アシスタントフィルタリング:特定のアシスタントを選択し、その運用状況を追跡します
期間:直近 7 日間、30 日間、90 日間、またはカスタム日付を選択します
エクスポート:監視データを Excel または CSV 形式でエクスポートします
ダッシュボード指標とエラー率
「ダッシュボード」タブに切り替えると、サービス全体の指標と、直前の同じ長さの期間と比較した変化率を確認できます:
対話数
期間内の対話の総数
エラー率
システムエラーが発生した応答の割合(計算方法は以下を参照)
平均応答時間
メッセージを受信してから応答が完了するまでの平均時間
平均 TTFT
ユーザーがメッセージを送信してから最初の文字が表示されるまでの平均時間
対話数、応答時間、エラー率の推移、LLM モデル分布などのグラフも表示されます。また、「アシスタントサービスランキング」では、各アシスタントのエラー率と応答速度を比較できます。

エラー率の計算方法
エラー率 = システムエラーが発生した応答数 ÷ 総応答数 × 100%
モデル呼び出しの失敗やタイムアウトなど、システムレベルのエラーのみが集計されます。過大評価を避けるため、以下はエラーに含まれません:
ユーザーによる応答の中断(Client Interrupt)
コンテンツ保護機能(Hook)による正常なブロック
監視のベストプラクティス
毎日の確認:直近 24 時間の対話を確認し、異常な応答時間やエラーを特定します
パフォーマンスのボトルネックの特定:
応答時間 > 10 秒:ナレッジベースの検索効率を確認するか、より高速な LLM の利用を検討します
Token 使用量が多すぎる:System Prompt や対話履歴を短縮できるか評価します
品質問題の追跡:
キーワード検索を使用して問題のある対話を見つけます
根本原因を分析します(ナレッジベース不足 / AI の理解誤り / モデルの制約)
問題のケースをテストデータセットに追加し、自動評価を実行して修正を検証します
よくある質問
Q:自動評価と AI アシスタント監視は何が違いますか?
用途
定期的な品質テスト
リアルタイムの運用監視
データソース
あらかじめ設定したテストデータセット
実際のユーザー対話
主な指標
成功率、応答時間
パフォーマンス、コスト、品質評価
適した対象
品質検証、回帰テスト
日常的な監視、問題の切り分け
Q:評価はどのくらいの頻度で実行すればよいですか?
推奨:コア機能は週 1 回、完全なテストは月 1 回、重要なアップデート後はただちに実行します。
Q:評価は実際のユーザーに影響しますか?
いいえ。自動評価は独立した環境を使用するため、実際のユーザーの対話を妨げることはありません。
Q:監視データはどのくらいの期間保持されますか?
デフォルトでは 90 日間保持されます。重要なデータは定期的にエクスポートして長期保存できます。
最終更新
役に立ちましたか?
