For the complete documentation index, see llms.txt. This page is also available as Markdown.

AgentOps 總覽

AgentOps 提供完整的 AI 助理運作管理與品質控管工具

什麼是 AgentOps?

AgentOps (Agent Operations) 是 MaiAgent 平台提供的 AI 助理運作管理模組,專注於測試、評估與監控 AI 助理的實際表現。透過 AgentOps,您可以系統化地管理 AI 助理的品質,確保持續提供優質的服務體驗。

為什麼需要 AgentOps?

建立 AI 助理只是第一步,持續監控與優化才能確保長期成功。AgentOps 幫助您:

確保品質穩定

  • 建立標準化的測試機制

  • 追蹤 AI 助理表現的變化趨勢

  • 及時發現並修正品質問題

提升運作效率

  • 自動化測試流程,節省人力

  • 快速識別效能瓶頸

  • 優化系統資源與成本

數據驅動決策

  • 量化 AI 助理的表現指標

  • 比較不同設定或模型的效果

  • 根據實際數據制定優化策略

AgentOps 核心功能

1. 測試資料集管理

建立並管理測試案例集合,用於驗證 AI 助理的回應品質。

主要功能:

  • 建立多組測試資料集

  • 管理測試案例與預期回應

  • 支援搜尋與分類

  • 團隊共同維護測試案例

適用情境:

  • 知識庫更新後驗證回應準確性

  • 建立標準測試流程

  • 收集常見問題作為測試基準

詳細說明: 測試資料集管理

2. 自動評估

使用測試資料集自動化執行評估,產生詳細的品質報告。

主要功能:

  • 一鍵執行批量測試

  • 計算成功率與回應時間

  • 產生詳細的通過/失敗報告

  • 比較不同時期或 AI 助理的表現

適用情境:

  • 定期品質檢查

  • 更新前後的回歸測試

  • 比較不同 AI 助理或模型的效果

詳細說明: 自動評估

3. AI 助理監控

即時監控 AI 助理的運作狀況,深入分析每一次對話的細節。

主要功能:

  • 查看輸入/輸出訊息內容

  • 追蹤回覆時間與處理時間

  • 監控 Token 用量與成本

  • 分析品質評分與使用者回饋

適用情境:

  • 即時監控系統運作狀況

  • 識別效能問題與異常

  • 追蹤成本與用量

  • 深度分析個別對話

詳細說明: AI 助理監控

4. 評估洞察報告

批次測試完成後,系統自動分析結果並產生一份改善建議報告,不需要人工逐筆解讀評分數據。

主要功能:

  • 自動識別測試結果中的問題模式

  • 依嚴重程度與影響範圍建議處理的優先順序

  • 提供具體的改善方向,而非只給分數

  • 支援多語言報告

適用情境:

  • 成功率不如預期,需要知道問題出在哪裡

  • 一次測試產生大量失敗案例,需要決定先修哪些

  • 需要向團隊或主管說明品質現況與改善計畫

詳細說明: 評估洞察報告

5. 工具執行記錄

追蹤 AI 助理調用外部工具的完整歷史,快速定位工具執行失敗的原因。

主要功能:

  • 記錄每次工具調用的輸入參數、執行結果、耗時與成功/失敗狀態

  • 保留詳細錯誤訊息,協助定位失敗原因

  • 統計各工具的使用次數與成功率

  • 涵蓋 API 工具、Text-to-SQL 工具、爬蟲工具與自訂工具

適用情境:

  • AI 助理答不出需要查詢外部系統的問題

  • 工具偶發失敗,需要釐清是逾時、認證還是參數問題

  • 評估某支工具是否需要調整設定或汰換

詳細說明: 工具執行記錄

AgentOps 工作流程

子功能關係圖

AgentOps 的五個子功能分成兩條線:上線前用測試資料集與自動評估建立品質基準,上線後用監控與工具記錄觀察真實運作。兩條線透過「把線上發現的問題補回測試資料集」串成一個循環。

各子功能的先後關係與依賴:

子功能
用在哪個階段
需要先有
產出
接著做什麼

測試資料集管理

上線前

常見問題與預期回應

可重複執行的測試案例集

交給自動評估執行

自動評估

上線前

測試資料集、要測的 AI 助理

成功率、平均回應秒數、逐案通過或失敗

交給評估洞察報告分析

評估洞察報告

上線前

一次已完成的自動評估

問題模式、優先順序、具體改善方向

依建議調整知識庫或角色指令,再測一次

AI 助理監控

上線後

已上線的真實對話

每次對話的輸入輸出、耗時、Token 用量、評分

把發現的問題補回測試資料集

工具執行記錄

上線後

已配置工具的 AI 助理

工具調用的參數、結果、耗時與錯誤訊息

修正工具設定,或補一則測試案例

兩個常被混淆的地方:

  • 「自動評估」測的是測試資料集裡的題目,「AI 助理監控」看的是使用者實際問過的對話——前者是上線前的把關,後者是上線後的觀察。

  • 「評估洞察報告」不是獨立功能,它是自動評估的延伸:必須先跑完一次批次測試才會有洞察報告可看。

標準品質管理流程

快速上手步驟

第一週: 建立基礎測試

  1. 收集 20-30 個常見問題

  2. 建立第一個測試資料集

  3. 執行初次自動評估

  4. 記錄當前成功率作為基準線

第二週: 持續優化

  1. 分析失敗的測試案例

  2. 更新知識庫或調整 AI 設定

  3. 重新執行評估驗證改善效果

  4. 開始使用 AI 助理監控觀察實際對話

第三週: 建立習慣

  1. 每週執行一次自動評估

  2. 每天查看監控數據識別異常

  3. 持續新增測試案例涵蓋更多情境

  4. 建立品質報告追蹤長期趨勢

AgentOps 與其他功能的整合

AgentOps + 知識庫管理

整合應用:

  • 知識庫更新後,立即執行自動評估驗證

  • 監控數據顯示知識不足時,補充知識庫內容

  • 根據實際對話建立測試案例,反向優化知識庫

相關文檔: 打造企業知識庫

AgentOps + 使用分析

互補分析:

  • 使用分析: 提供整體趨勢與統計 (對話量、滿意度等)

  • AgentOps: 提供深度品質分析與個別對話細節

結合使用可以:

  • 從整體趨勢發現異常

  • 從監控細節找出根本原因

  • 全面評估 AI 助理表現

相關文檔: 使用分析

AgentOps + 回覆品質控管

整合應用:

  • AgentOps 提供技術面的品質監控

  • 回覆品質控管提供人工審核與標註

  • 兩者結合可建立完整的品質保證體系

相關文檔: 回覆品質控管

最佳實踐建議

1. 建立定期評估機制

每日檢查 (5 分鐘):

  • 查看 AI 助理監控識別異常

每週評估 (30 分鐘):

  • 執行核心測試資料集

  • 檢視成功率是否維持穩定

  • 更新或新增測試案例

每月分析 (2 小時):

  • 執行完整評估

  • 匯出監控數據深度分析

  • 製作品質報告

  • 規劃下月優化目標

2. 設定品質基準線

為您的 AI 助理設定合理的品質目標:

指標
基準
目標
說明

自動評估成功率

≥ 85%

≥ 95%

標準測試案例通過率

平均回覆時間

< 5 秒

< 3 秒

使用者感知的回應速度

使用者滿意度

≥ 80%

≥ 90%

讚/總回饋比例

Token 用量

-

-

根據預算設定上限

3. 建立問題追蹤流程

當發現品質問題時:

4. 團隊協作

建立 AgentOps 責任分工:

AI 管理者:

  • 整體品質監控

  • 制定優化策略

  • 定期評估與報告

知識庫管理員:

  • 根據評估結果更新知識庫

  • 補充缺失的知識內容

技術人員:

  • 分析效能問題

  • 優化系統設定

  • 處理技術異常

5. 持續改善循環

AgentOps 的核心是持續改善:

  1. 測量: 透過評估與監控取得數據

  2. 分析: 識別問題與改善機會

  3. 行動: 實施優化措施

  4. 驗證: 確認改善效果

  5. 標準化: 將成功經驗納入流程

常見問題

Q1: AgentOps 與「使用分析」有什麼不同?

使用分析:

  • 整體趨勢與統計 (對話量、字數、滿意度)

  • 適合了解 AI 助理的使用概況

  • 關注業務指標

AgentOps:

  • 深度品質分析與個別對話細節

  • 適合技術面的品質管理

  • 關注技術指標 (成功率、回應時間、成本)

兩者互補,建議結合使用。

Q2: 需要多久執行一次評估?

建議頻率:

  • 核心功能: 每週一次

  • 完整測試: 每月一次

  • 重大更新後: 立即執行

  • 發現問題時: 隨時測試驗證

您可以根據 AI 助理的重要性與變更頻率調整。

Q3: 測試資料集應該包含多少測試案例?

建議數量:

  • 最少: 20 個測試案例 (涵蓋核心功能)

  • 建議: 50-100 個測試案例 (平衡覆蓋率與效率)

  • 完整: 200+ 個測試案例 (大型或關鍵系統)

從核心功能開始,逐步擴充。

Q4: 成功率多少才算合格?

取決於 AI 助理的用途:

  • 高風險應用 (金融、醫療): ≥ 95%

  • 客服支援: ≥ 90%

  • 通用對話: ≥ 85%

  • 實驗性功能: ≥ 80%

重要的是建立基準線並持續改善。

Q5: AgentOps 會影響實際用戶嗎?

不會。AgentOps 的測試與監控都是在獨立環境或後台執行,不會干擾實際用戶的使用體驗。

Q6: 可以針對不同業務建立多組測試嗎?

可以。建議針對不同業務或功能建立多個測試資料集:

  • 產品查詢測試集

  • 訂單處理測試集

  • 技術支援測試集

  • ...等

這樣可以分別追蹤各領域的品質表現。


開始使用 AgentOps

準備好開始使用 AgentOps 了嗎?建議按照以下順序:

  1. 建立測試資料集: 收集常見問題,建立第一個測試集

  2. 執行自動評估: 測試 AI 助理並查看成功率與回應時間

  3. 閱讀評估洞察報告: 了解問題出在哪、該優先改哪些

  4. 使用 AI 助理監控: 上線後深入了解實際運作狀況

  5. 查看工具執行記錄: 若 AI 助理有配置工具,追蹤工具調用是否正常

透過 AgentOps,您可以建立系統化的品質管理流程,確保 AI 助理持續提供優質服務。

最後更新於

這有幫助嗎?