全部產品
Search
文件中心

AgentLoop:評估結果欄位說明

更新時間:Sep 01, 2026

AgentLoop 評估任務執行完成後,每個評估器的結果會以一條日誌的形式寫入您 AgentSpace 對應的 SLS Project 下的 evaluation_detail Logstore。本文描述該 Logstore 中各欄位的含義與類型。

名詞解釋

  • 評估任務(Task):使用者建立的一次評估配置,包含資料來源、評估器、調度策略等定義。

  • 運行(Run):一次評估任務的實際執行,可以是手動觸發,也可以是持續評估視窗內的自動調度。

  • 評估器(Evaluator):對資料執行打分或判定的單元。一個任務可以包含多個評估器,每個評估器獨立產出一條結果日誌。

  • 評估結果(Evaluation Result):單個評估器對單條資料的打分、判定及解釋,是 evaluation_detail 中的一條日誌。

公用欄位

以下欄位在每條評估結果日誌中均存在。

欄位名

類型

說明

timestamp

long

評估結果產生時間,毫秒時間戳記。

task_id

text

評估任務 ID。

eval_id

text

單條評估結果的唯一 ID。

eval_base_id

text

評估資料 ID,用於串聯評估隊列與結果記錄。

run_id

text

本次運行 ID。

window_id

text

持續評估視窗 ID,僅持續評估模式下有值。

user_id

long

使用者識別碼。

region_id

text

地區(Region)。

agentSpace

text

AgentSpace 標識。

status

text

評估狀態:success(成功)、failed(失敗)、unknown(未知)。

任務與運行資訊

描述本條評估結果所屬的任務和運行上下文。

欄位名

類型

說明

task_name

text

評估任務名稱。

task_mode

text

任務模式。取值:batch(批量)、oneshot(單次)、stream(流式)。

run_name

text

運行名稱。

run_type

text

運行類型。取值:backfill(回填)、continuous(持續)。

channel

text

任務來源。取值:default(預設)、experiment(實驗)、AgentRun(Agent 運行觸發)。

data_start_time

long

本次啟動並執行資料範圍開始時間,毫秒時間戳記。

data_end_time

long

本次啟動並執行資料範圍結束時間,毫秒時間戳記。

eval_latency

long

從運行建立到結果產出的端到端耗時,單位:毫秒。

評估結果

描述單個評估器的打分、判定和解釋資訊。

欄位名

類型

說明

evaluator_name

text

評估器名稱。

evaluator_display_name

text

評估器顯示名稱。

score_name

text

分數名稱,用於標識評估器產出的指標項。

score_value

double

評估器原始分數值。

normalized_score_value

double

歸一化分數(0~1)。僅在評估器配置了分數範圍時有值。

score_range

text

原始分數範圍,格式為 [min,max]。

result_type

text

結果類型。取值:score(數值打分)、binary(二值判定)、text(文本)。

explanation

text

評分說明,面向使用者的可讀解釋。

evaluation_process

text

分數與說明的推導過程。

trajectory_summary

text

Session 逐輪軌跡摘要,僅相關評估結果寫入。

錯誤資訊

當評估狀態為 failed 時,以下欄位記錄失敗原因。

欄位名

類型

說明

error_code

text

失敗錯誤碼。

error_message

text

失敗原因描述。

資料關聯(data_link)

data_link 為 JSON 類型欄位,記錄被評估資料的關聯資訊,用於追溯評估結果對應的未經處理資料來源。

欄位名

類型

說明

dataset_id

text

資料集 ID。

dataset_item_id

text

資料集中的資料條目 ID。

trace_id

text

被評估資料的 Trace ID。

span_id

text

被評估資料的 Span ID。

session_id

text

被評估資料的 Session ID。

experiment_id

text

實驗 ID。

service_id

text

被評估應用 ID。

service_name

text

被評估應用程式名稱。

agent_name

text

被評估 Agent 名稱。

data_scope

text

資料粒度。取值:span、trace、session、log、dataset。

start_time

text

被評估資料的時間範圍起始。

end_time

text

被評估資料的時間範圍結束。

plan_id

text

實驗計劃 ID。

project

text

日誌資料來源 SLS Project。

logstore

text

日誌資料來源 SLS Logstore。

logstore_item_id

text

日誌條目 ID。

experiment_group_name

text

實驗分組名稱。

plan_name

text

實驗計劃名稱。

record_id

text

記錄 ID。

record_name

text

記錄名稱。

run_env

text

運行環境。

評估器中繼資料(eval_meta)

eval_meta 為 JSON 類型欄位,記錄評估器執行過程中的調用元資訊。

欄位名

類型

說明

model_name

text

評估使用的模型名稱。

evaluator_request_id

text

評估器調用請求 ID。

evaluator_trace_id

text

評估器自身執行的 Trace ID(非被評估資料的 trace_id)。

evaluator_log_id

text

評估器調用日誌 ID。

evaluator_thread_id

text

評估器會話 Thread ID。

評估器度量(eval_metrics)

eval_metrics 為 JSON 類型欄位,記錄評估器執行的 Token 消耗與耗時資訊。

欄位名

類型

說明

input_tokens

long

輸入 Token 數。

output_tokens

long

輸出 Token 數。

total_tokens

long

總 Token 數。

latency

long

單個評估器執行耗時,單位:毫秒。

評估器輸入(eval_info)

eval_info 為 JSON 類型欄位,記錄實際送入評估器的變數內容。欄位 Key 對應評估器 variableMapping 中定義的變數名,Value 為該變數的實際取值。

樣本:若評估器配置了如下變數映射:

{
  "variableMapping": {
    "input": "question",
    "expected": "label"
  }
}

則 eval_info 中將包含:

{
  "input": "question 欄位的實際值",
  "expected": "label 欄位的實際值"
}

自訂輸出(custom_outputs)

custom_outputs 為 JSON 類型欄位,儲存評估器標準結果之外的自訂輸出。欄位結構由評估器定義,無固定 Schema。