AgentLoop 評估任務執行完成後,每個評估器的結果會以一條日誌的形式寫入您 AgentSpace 對應的 SLS Project 下的 evaluation_detail Logstore。本文描述該 Logstore 中各欄位的含義與類型。
名詞解釋
評估任務(Task):使用者建立的一次評估配置,包含資料來源、評估器、調度策略等定義。
運行(Run):一次評估任務的實際執行,可以是手動觸發,也可以是持續評估視窗內的自動調度。
評估器(Evaluator):對資料執行打分或判定的單元。一個任務可以包含多個評估器,每個評估器獨立產出一條結果日誌。
評估結果(Evaluation Result):單個評估器對單條資料的打分、判定及解釋,是
evaluation_detail中的一條日誌。
公用欄位
以下欄位在每條評估結果日誌中均存在。
欄位名 | 類型 | 說明 |
timestamp | long | 評估結果產生時間,毫秒時間戳記。 |
task_id | text | 評估任務 ID。 |
eval_id | text | 單條評估結果的唯一 ID。 |
eval_base_id | text | 評估資料 ID,用於串聯評估隊列與結果記錄。 |
run_id | text | 本次運行 ID。 |
window_id | text | 持續評估視窗 ID,僅持續評估模式下有值。 |
user_id | long | 使用者識別碼。 |
region_id | text | 地區(Region)。 |
agentSpace | text | AgentSpace 標識。 |
status | text | 評估狀態: |
任務與運行資訊
描述本條評估結果所屬的任務和運行上下文。
欄位名 | 類型 | 說明 |
task_name | text | 評估任務名稱。 |
task_mode | text | 任務模式。取值: |
run_name | text | 運行名稱。 |
run_type | text | 運行類型。取值: |
channel | text | 任務來源。取值: |
data_start_time | long | 本次啟動並執行資料範圍開始時間,毫秒時間戳記。 |
data_end_time | long | 本次啟動並執行資料範圍結束時間,毫秒時間戳記。 |
eval_latency | long | 從運行建立到結果產出的端到端耗時,單位:毫秒。 |
評估結果
描述單個評估器的打分、判定和解釋資訊。
欄位名 | 類型 | 說明 |
evaluator_name | text | 評估器名稱。 |
evaluator_display_name | text | 評估器顯示名稱。 |
score_name | text | 分數名稱,用於標識評估器產出的指標項。 |
score_value | double | 評估器原始分數值。 |
normalized_score_value | double | 歸一化分數(0~1)。僅在評估器配置了分數範圍時有值。 |
score_range | text | 原始分數範圍,格式為 |
result_type | text | 結果類型。取值: |
explanation | text | 評分說明,面向使用者的可讀解釋。 |
evaluation_process | text | 分數與說明的推導過程。 |
trajectory_summary | text | Session 逐輪軌跡摘要,僅相關評估結果寫入。 |
錯誤資訊
當評估狀態為 failed 時,以下欄位記錄失敗原因。
欄位名 | 類型 | 說明 |
error_code | text | 失敗錯誤碼。 |
error_message | text | 失敗原因描述。 |
資料關聯(data_link)
data_link 為 JSON 類型欄位,記錄被評估資料的關聯資訊,用於追溯評估結果對應的未經處理資料來源。
欄位名 | 類型 | 說明 |
dataset_id | text | 資料集 ID。 |
dataset_item_id | text | 資料集中的資料條目 ID。 |
trace_id | text | 被評估資料的 Trace ID。 |
span_id | text | 被評估資料的 Span ID。 |
session_id | text | 被評估資料的 Session ID。 |
experiment_id | text | 實驗 ID。 |
service_id | text | 被評估應用 ID。 |
service_name | text | 被評估應用程式名稱。 |
agent_name | text | 被評估 Agent 名稱。 |
data_scope | text | 資料粒度。取值: |
start_time | text | 被評估資料的時間範圍起始。 |
end_time | text | 被評估資料的時間範圍結束。 |
plan_id | text | 實驗計劃 ID。 |
project | text | 日誌資料來源 SLS Project。 |
logstore | text | 日誌資料來源 SLS Logstore。 |
logstore_item_id | text | 日誌條目 ID。 |
experiment_group_name | text | 實驗分組名稱。 |
plan_name | text | 實驗計劃名稱。 |
record_id | text | 記錄 ID。 |
record_name | text | 記錄名稱。 |
run_env | text | 運行環境。 |
評估器中繼資料(eval_meta)
eval_meta 為 JSON 類型欄位,記錄評估器執行過程中的調用元資訊。
欄位名 | 類型 | 說明 |
model_name | text | 評估使用的模型名稱。 |
evaluator_request_id | text | 評估器調用請求 ID。 |
evaluator_trace_id | text | 評估器自身執行的 Trace ID(非被評估資料的 trace_id)。 |
evaluator_log_id | text | 評估器調用日誌 ID。 |
evaluator_thread_id | text | 評估器會話 Thread ID。 |
評估器度量(eval_metrics)
eval_metrics 為 JSON 類型欄位,記錄評估器執行的 Token 消耗與耗時資訊。
欄位名 | 類型 | 說明 |
input_tokens | long | 輸入 Token 數。 |
output_tokens | long | 輸出 Token 數。 |
total_tokens | long | 總 Token 數。 |
latency | long | 單個評估器執行耗時,單位:毫秒。 |
評估器輸入(eval_info)
eval_info 為 JSON 類型欄位,記錄實際送入評估器的變數內容。欄位 Key 對應評估器 variableMapping 中定義的變數名,Value 為該變數的實際取值。
樣本:若評估器配置了如下變數映射:
{
"variableMapping": {
"input": "question",
"expected": "label"
}
}則 eval_info 中將包含:
{
"input": "question 欄位的實際值",
"expected": "label 欄位的實際值"
}自訂輸出(custom_outputs)
custom_outputs 為 JSON 類型欄位,儲存評估器標準結果之外的自訂輸出。欄位結構由評估器定義,無固定 Schema。