全部產品
Search
文件中心

Alibaba Cloud Model Studio:調優資料上傳規則

更新時間:Aug 26, 2026

介紹文本產生模型調優資料的格式規格、打包要求、大小與數量限制及 API 上傳配額,協助使用者按訓練方式構造並上傳合規的 SFT/DPO/CPT 訓練資料。

概述

本文檔闡述文本產生模型調優資料的格式規格、打包要求、大小與數量限制及 API 上傳配額。適用範疇為文本產生模型調優(text/image/video → text),涵蓋純文字 SFT/DPO/CPT、千問 VL 圖片與視頻理解、視頻抽幀、工具調用(function calling)與深度思考(thinking)。視頻產生模型調優(image → video)不屬於本範疇。

資料集類型(訓練集或評測集)建立後不可變更。各訓練方式與元素的支援情況詳見訓練方式與元素支援矩陣,各組合的格式構造規則見下文對應章節。

警告發布與刪除操作無法復原:發行版本不可再編輯,僅草稿版本可刪除或線上編輯;資料集類型建立後不可變更。切換類型、情境或訓練方式會清空已上傳檔案。

管理類操作(建立參數、版本管理、評測集管理規則、匯入方式選型、資料清洗、安全合規)引導到同級文檔,詳見訓練集與評測集模型調優簡介等。建議在建立資料集頁面下載對應情境的資料範本,按模板結構準備資料可避免匯入失敗。

資料集構建建議(推薦資料規模、多樣性與均衡、資料擴充策略)詳見模型調優簡介-資料集構建技巧

訓練方式與元素支援矩陣

訓練集支援 SFT、DPO、CPT 三種訓練方法,各訓練方式與元素的支援情況見下文矩陣表。調優推薦順序為 CPT(可選)→ SFT → DPO(可選),三者遞進非互斥。

地區可用性:

  • SFT、本地上傳、日誌迴流、API 上傳、多模態資料格式全地區支援。
  • DPO、CPT、OSS 匯入、雲端儲存掛載僅支援北京地區。

訓練方式與元素的支援矩陣如下:

訓練方式

文本產生

視覺理解-圖片輸入

視覺理解-視頻輸入(qwen3.5+)

視覺理解-工具調用(qwen3.5+)

深度思考

SFT

DPO

CPT

評測集

各訓練方式版本新增時的資料繼承策略如下(CPT 不支援繼承已有資料,每次新增版本均需建立):

資料繼承策略

SFT

DPO

CPT

繼承已有資料

建立新資料

支援(強制建立)

訓練方法 SFT/DPO/CPT 欄位定義詳見模型調優簡介

文本產生 - SFT 格式

SFT 文本產生訓練資料採用 jsonl 檔案格式,基於 ChatML messages 多輪結構。

  • 支援 system、user、assistant 三種角色,content 欄位為字串(多模態情境的 content 數組結構見對應多模態格式章節)。
  • 單檔案大小上限 200 MB。
  • 一個資料集可混合不同格式行——每條記錄獨立選格式,無需統一為單一格式。
  • 可選格式:普通對話、深度思考、工具調用、工具與思考組合(見下方標籤頁範例)。

SFT 文本產生支援以下範例格式,各範例的完整 JSON 結構見對應標籤頁:

普通 ChatML

普通 ChatML 格式範例(system/user/assistant 多輪對話):

{
  "messages": [
    {"role": "system", "content": "系統輸入1"},
    {"role": "user", "content": "使用者輸入1"},
    {"role": "assistant", "content": "期望的模型輸出1"},
    {"role": "user", "content": "使用者輸入2"},
    {"role": "assistant", "content": "期望的模型輸出2"}
  ]
}

進階用法

  1. 支援loss_weight參數,取值範圍 (0.0, 1.0],數值越大代表訓練時該條資料的重要性越高。

    預設支援 Qwen3.5 及以上版本模型;如需支援 Qwen3、Qwen2.5 系列模型,請聯絡商務經理。

{"role": "assistant", "content": "期望的模型輸出", "loss_weight": "1.0"}

深度思考(thinking)

深度思考(thinking)格式範例(思考標籤放最後一條 assistant,前後換行必須保留):

{
  "messages": [
    {"role": "system", "content": "系統輸入1"},
    {"role": "user", "content": "使用者輸入1"},
    {"role": "assistant", "content": "模型輸出1"},
    {"role": "user", "content": "使用者輸入2"},
    {"role": "assistant", "content": "<think>\n期望的思考內容2\n</think>\n\n期望的輸出2"}
  ]
}

工具調用(function calling)

請使用視覺理解-SFT 格式

思考模式格式說明

深度思考內容用 <think>\n…\n</think>\n\n 標籤包裹,置於 assistant 輸出文本內(與最終回覆同屬最後一條 assistant 的 content)。規則:

  • 只能放在最後一條 assistant 輸出中;中間的 assistant 輸出不加思考標籤。
  • 思考標籤前後的分行符號必須保留。
  • 若訓練樣本設定模型不輸出思考標籤,訓練完成後不建議再開啟思考模式調用。

評測集格式

評測集僅服務文本產生情境,與 SFT/DPO/CPT 訓練方式無關——DPO/CPT 訓練後的模型同樣使用文本產生評測集進行評測,不區分訓練方式。

評測集規格:

  • 檔案格式 xlsx,列結構見控制台下載模板。
  • 入庫方式:本地上傳、日誌迴流;不支援Object Storage Service匯入與雲端儲存掛載。
  • 僅草稿版本支援線上編輯(Prompt/Completion),發行版本不可編輯。

本地上傳檔案格式為 xlsx(列結構見控制台下載模板),每條評測資料為一組 Prompt/Completion 內容,樣本如下:

{"prompt": "誰在文藝複興時期繪製人體?", "completion": "文藝複興時期是一個關於藝術、文化和學術的複興運動,在這個時期,許多藝術家都繪製了人體。"}
{"prompt": "為什麼太陽會發光發熱?", "completion": "太陽是由氫原子核在高溫高壓下聚變而產生的巨大能量。這種聚變反應釋放出大量的光和熱能。"}
{"prompt": "為什麼天空是藍色的?", "completion": "陽光照射到地球大氣層中時,波長較短的藍光會被大氣中的氣體分子散射開來,形成我們看到的藍天。"}

日誌迴流入庫限制:

  • 支援日誌範圍為最近 30 天內。
  • 單次匯入上限 10 萬條。
  • 需授權服務關聯角色並指定 API Key 與模型篩選條件。
  • 訓練集僅 SFT 文本產生情境可用(評測集文本產生亦支援)。

日誌迴流匯入方式詳情見日誌迴流

評測集應準備資料不重疊的獨立集合,用於客觀評估模型泛化能力。評測集管理規則詳見訓練集與評測集

文本產生 - DPO 格式

DPO 文本產生訓練資料採用 jsonl 格式,基於 ChatML messages 多輪結構,額外含 chosen 與 rejected 兩條對比的 assistant 輸出,用於偏好對齊訓練。messages 內的所有內容均作為輸入,DPO 用於訓練模型對最後一條 user 輸入的正負反饋。messages 多輪結構規則見文本產生 - SFT 格式

針對深度思考內容,chosen 或 rejected 的 assistant 輸出可使用思考標籤包裹,思考標籤只能放最後一條 assistant 行,規則見文本產生 - SFT 格式

loss_weight (邀測)參數支援 chosen 模組,取值範圍 0.0 至 1.0,數值越大訓練重要性越高,詳見文本產生 - SFT 格式

DPO 訓練資料單檔案大小上限為 200 MB,與 SFT 文本產生一致。DPO 定義詳見模型調優簡介,草稿與發佈動作見訓練集與評測集

DPO 文本產生訓練資料範例見下文代碼塊:

普通 ChatML

普通 chosen/rejected 對比格式範例(兩條對比的 assistant 輸出):

{
  "messages": [
    {"role": "system", "content": "系統輸入"},
    {"role": "user", "content": "使用者輸入1"},
    {"role": "assistant", "content": "模型輸出1"},
    {"role": "user", "content": "使用者輸入2"},
    {"role": "assistant", "content": "模型輸出2"},
    {"role": "user", "content": "使用者輸入3"}
  ],
  "chosen": {"role": "assistant", "content": "贊同的模型期望輸出3"},
  "rejected": {"role": "assistant", "content": "反對的模型期望輸出3"}
}

深度思考(thinking)

思考標籤格式範例(深度思考內容用思考標籤包裹,放最後 assistant):

{
  "messages": [
    {"role": "system", "content": "系統輸入"},
    {"role": "user", "content": "使用者輸入1"},
    {"role": "assistant", "content": "模型輸出1"},
    {"role": "user", "content": "使用者輸入2"}
  ],
  "chosen": {"role": "assistant", "content": "<think>\n期望的思考內容\n</think>\n\n期望的模型輸出"},
  "rejected": {"role": "assistant", "content": "反對的模型期望輸出2"}
}

文本產生 - CPT 格式

CPT 文本產生訓練資料採用 jsonl 純文字格式,每行一個 jsonl 對象,結構為 {text},text 欄位為純文字內容。messages 多輪結構規則見文本產生 - SFT 格式

CPT 訓練資料約束:

  • 建議至少 5000 萬 Token,單檔案大小上限 300 MB。
  • 不支援草稿狀態與資料繼承,每次新增版本均需建立資料並立即發布。

CPT 定義詳見模型調優簡介,版本管理與資料繼承操作見訓練集與評測集。CPT 純文字範例完整 JSON 結構見下文代碼塊。

{text} 純文字格式範例(每行一個 jsonl 純文字對象):

{
  "text": "常值內容"
}

視覺理解-SFT 格式

SFT 圖片訓練資料用於千問 VL 多模態理解(控制台 UI 選項為「圖片理解」)情境,採用 zip 壓縮包格式,包含 data.jsonl 訓練文本資料檔案與圖片檔案。data.jsonl 須置於壓縮包根目錄,data.jsonl 中每條訓練資料的 messages 採用 content 數組結構,數組項含圖片欄位(image)與文字欄位(text)。推薦使用單層目錄結構,打包規則詳見多模態壓縮包打包規則

圖片輸入限制

圖片准入限制如下:

  • 單張圖片寬度和高度均不超過 1024 px。
  • 單張圖片不超過 10 MB。
  • 支援格式:bmp、jpeg、jpg、png、tif、tiff、webp。

resized_width 與 resized_height 為可選的目標縮放控制參數,用於指定圖片目標縮放尺寸,非圖片准入上限。圖片准入上限為寬高不超過 1024 px、單張不超過 10 MB。圖片准入具體數值以控制台實際展示為準。

圖片消耗 token 計算詳見映像與視頻理解-計費與限流

視頻輸入限制

僅 qwen3.5 及以後的多模態模型支援。支援兩種視頻輸入模式:

  • 視頻檔案路徑模式:video 欄位為字串(如 "video1.mp4"),由平台處理抽幀。適用於使用完整視頻檔案的情境。
  • 圖片幀列表模式:video 欄位為圖片檔案名稱列表(如 ["0.jpg","1.jpg"]),使用者自行準備幀序列。適用於已有抽幀圖片的情境。

說明訓練資料中的圖片與視頻須同時滿足模型調用的輸入限制(如映像解析度、視頻時間長度、幀率等),調用限制詳見視頻限制

視頻消耗 token 計算詳見映像與視頻理解-計費與限流

兩種模式的欄位對比與範例見下文:

欄位/參數

視頻檔案路徑模式

圖片幀列表模式

video

str(視頻檔案路徑,必填)

List[str](圖片幀列表,必填)

sample_fps

不適用

float([0.1, 10],預設 2.0,可選)

fps

float([0.1, 10],預設 2.0,可選)

不適用

resized_width

int(縮放寬度,可選)

int(縮放寬度,可選)

resized_height

int(縮放高度,可選)

int(縮放高度,可選)

video_start

float(截取起始時間,可選)

不適用

video_end

float(截取結束時間,可選)

不適用

SFT 圖片訓練範例見下文標籤頁:

普通 ChatML

普通 ChatML 格式範例(system/user/assistant 多輪對話):

{
  "messages": [
    {"role": "system", "content": [{"text": "系統輸入1"}]},
    {"role": "user", "content": [{"text": "使用者輸入1"}]},
    {"role": "assistant", "content": [{"text": "期望的模型輸出1"}]},
    {"role": "user", "content": [{"text": "使用者輸入2"}]},
    {"role": "assistant", "content": [{"text": "期望的模型輸出2"}]}
  ]
}

深度思考(thinking)

深度思考(thinking)格式範例(思考標籤放最後一條 assistant,前後換行必須保留):

{
  "messages": [
    {"role": "system", "content": [{"text": "系統輸入1"}]},
    {"role": "user", "content": [{"text": "使用者輸入1"}]},
    {"role": "assistant", "content": [{"text": "模型輸出1"}]},
    {"role": "user", "content": [{"text": "使用者輸入2"}]},
    {"role": "assistant", "content": [{"text": "<think>\n期望的思考內容2\n</think>\n\n期望的輸出2"}]}
  ]
}

工具調用(function calling)

說明qwen3.5+的模式支援使用工具調用資料格式。

工具調用(function calling)格式範例(tools 定義 + messages 多輪含 tool 角色,tool_call_id 一一對應):

{
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查詢指定城市的即時天氣",
        "parameters": {
          "type": "object",
          "properties": {
            "city": {"type": "string", "description": "城市名稱,例如:北京"}
          },
          "required": ["city"]
        }
      }
    }
  ],
  "messages": [
    {"role": "user", "content": [{"text": "幫我查一下北京的天氣"}]},
    {
      "role": "assistant",
      "content": [{"text": "好的,我來幫您查詢北京的天氣。"}],
      "tool_calls": [
        {
          "id": "call_3a11c1ba883b41b6a4e0cb",
          "type": "function",
          "function": {
            "name": "get_weather",
            "arguments": "{\"city\": \"北京\"}"
          }
        }
      ]
    },
    {"role": "tool", "tool_call_id": "call_3a11c1ba883b41b6a4e0cb", "content": [{"text": "{\"city\": \"北京\", \"weather\": \"晴\", \"temperature\": \"25℃\"}"}]},
    {"role": "assistant", "content": [{"text": "北京今天天氣晴朗,氣溫 25℃,適合出行。"}]}
  ]
}

圖片輸入

圖片加文字格式設定範例(content 數組含圖片項與文本項):

{
  "messages": [
    {"role": "system", "content": [{"text": "系統輸入"}]},
    {
      "role": "user",
      "content": [
        {"text": "使用者輸入1"},
        {"image": "影像檔名1.jpg", "resized_width": 200, "resized_height": 200}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型輸出1"}]}
  ]
}

視頻檔案路徑模式

視頻檔案路徑模式格式範例(video 欄位為視頻檔案路徑字串):

{
  "messages": [
    {"role": "system", "content": [{"text": "系統輸入"}]},
    {
      "role": "user",
      "content": [
        {"text": "使用者輸入1"},
        {"video": "視頻檔案名稱1.mp4", "fps": 3.0, "resized_width": 200, "resized_height": 200, "video_start": 0.0, "video_end": 3.0}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型輸出1"}]}
  ]
}

圖片幀列表模式

圖片幀列表模式格式範例(video 為幀列表,含 sample_fps):

{
  "messages": [
    {"role": "system", "content": [{"text": "系統輸入"}]},
    {
      "role": "user",
      "content": [
        {"text": "使用者輸入2"},
        {"video": ["0.jpg", "1.jpg", "2.jpg", "3.jpg"], "sample_fps": 5.0, "resized_width": 200, "resized_height": 200}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型輸出2"}]}
  ]
}

多模態理解定義詳見模型調優簡介

工具調用格式說明

工具調用(function calling)模式在 messages 多輪結構基礎上增加 tools 定義與 tool_calls/role:tool 機制,欄位約束如下:

  • tools:工具定義數組,每項含 type:"function" 與 function{name, description, parameters};parameters 為 JSON Schema(含 type/properties/required)。
  • messages:多輪對話數組,角色含 user、assistant、tool。
  • content:多模態內容數組,可含 image、text、video 等項(與多模態理解格式一致)。
  • assistant.tool_calls:模型產生的工具調用數組,含 id、type:"function"、function{name, arguments};arguments 為 JSON 字串。
  • role:"tool":工具返回,tool_call_id 必須與對應 tool_calls[].id 一一對應,content 內為工具返回結果。

多輪對話最後一條通常為 assistant 基於工具返回的最終回覆。

百鍊不支援 OpenAI 的 name、weight 參數,所有 assistant 輸出都會被訓練。從 OpenAI/Azure 遷移的訓練資料不可攜帶 name/weight 欄位。

資料多樣性與均衡性建議:各情境資料數量應相對均衡,資料比例符合實際情境比例,避免某一類資料過多導致模型偏向於學習該類特徵,影響泛化能力。

思考模式格式說明

深度思考內容用 <think>\n…\n</think>\n\n 標籤包裹,置於 assistant 輸出文本內(與最終回覆同屬最後一條 assistant 的 content)。規則:

  • 只能放在最後一條 assistant 輸出中;中間的 assistant 輸出不加思考標籤。
  • 思考標籤前後的分行符號必須保留。
  • 若訓練樣本設定模型不輸出思考標籤,訓練完成後不建議再開啟思考模式調用。

多模態壓縮包打包規則

多模態理解訓練資料以 zip 壓縮包形式通過新增数据集頁面上傳,打包須滿足以下約束:

  • 壓縮包最大支援 2 GB。
  • 包內檔案夾與檔案名稱允許的字元集為 ASCII 字母(a-z、A-Z)、數字(0-9)、底線(_)、連字號(-)。
  • 訓練文本資料檔案固定為 data.jsonl,必須位於壓縮包根目錄——確保壓縮後開啟 zip 檔案直接看到 data.jsonl,外層不能再包裹檔案夾。

圖片或視頻檔案名稱應在壓縮包內全域唯一,即使分布在不同檔案夾中。data.jsonl 內只需聲明檔案名稱而非檔案路徑——正確樣本:image1.jpg;錯誤樣本:jpg_folder/image1.jpg。

雲端儲存掛載不支援 zip 壓縮包。使用雲端儲存掛載載入資料集時,須將未經壓縮的資料集檔案夾整體上傳到 OSS Bucket,通過 MountStorage 的 file_path 指定 data.jsonl 檔案路徑;包含多檔案時只需指定 data.jsonl 路徑,其餘同目錄檔案自動掛載。雲端儲存掛載詳見使用 API 進行模型調優

命名樣本與目錄結構見下文代碼塊。雲端儲存掛載授權操作見在控制台進行模型調優,OSS 匯入 Bucket 標籤打標操作見訓練集與評測集

# 單層目錄(推薦)
Trainingdata_vl.zip
  |--- data.jsonl        # 必須在根目錄,外層不再包裹檔案夾
  |--- image1.png
  |--- video1.mp4

# data.jsonl 內聲明檔案名稱(非路徑)
# 正確:image1.jpg
# 錯誤:jpg_folder/image1.jpg

前往控制台新增資料集頁面上傳多模態壓縮包並完成打包校正。

檔案大小與數量限制

本地上傳檔案大小與數量上限按訓練方式分情境設定,詳見下文分情境表。圖片准入限制見視覺理解-SFT 格式,評測集格式限制見評測集格式,日誌迴流入庫限制見評測集格式

max_length 取值區間 500 至 131072 為訓練序列長度配置參數,非上傳准入上限。單條訓練資料上傳准入大小上限以控制台頁面展示為準。

本地上傳檔案大小與數量上限按訓練方式分情境設定,推薦資料量為最低建議值:

訓練方式/情境

單檔案大小上限

檔案數量上限(maxCount)

推薦資料量

文本產生 - SFT 格式

200 MB

10(預設)

至少上千條

文本產生 - DPO 格式

200 MB

10(預設)

至少上百條

文本產生 - CPT 格式

300 MB

1

至少 5000 萬 Token

多模態(zip)

2 GB

1

根據實際情境準備充足樣本

檔案名稱(不含尾碼)

≤120 字元且不重名

副檔名

須在 新增資料集 列表中

API 上傳配額

通過 DashScope API 上傳調優檔案(用途標記為模型調優)的配額見下文配額表。控制台建立資料集時,File API 列表最多支援 10 個檔案合并註冊;通過 API 上傳的調優檔案在控制台模型調優頁面與 API 呼叫中均可見可用。

雲端儲存掛載載入資料集的約束:

  • 通過 MountStorage 的 file_path 指定 data.jsonl 根目錄清單路徑,不支援 zip 壓縮包。
  • 選擇雲端儲存掛載儲存位置時強制立即發布,不支援草稿狀態。
  • 掛載前需授權百鍊服務訪問 OSS 資料。

超限承接與加密:

  • 單檔案超過 300 MB:通過雲端儲存掛載或多模態 ZIP 2 GB 通道上傳。
  • 總配額超額:刪除歷史檔案釋放空間。
  • 匯入資料自動啟用 OSS 服務端加密(SSE-OSS,AES256)。

API 呼叫、認證、SDK、錯誤碼、MountStorage 欄位細節見使用 API 進行模型調優

API 上傳調優檔案配額如下:

配額項

限制值

說明

單檔案大小

不超過 300 MB

調優檔案(模型調優用途)

有效檔案總空間

100 GB

未刪除檔案累計

有效檔案總數量

10000 個

未刪除檔案累計

檔案儲存體時間長度

無時間限制

不自動到期

File API 列表上限

10 個

控制台建立資料集時合并註冊

OSS 匯入與雲端儲存掛載的差異對比如下:

維度

OSS 匯入

雲端儲存掛載

前置條件

百鍊資料訪問授權標籤

授權百鍊服務訪問 OSS 資料

資料形態

單個或批量檔案

未經壓縮的資料集檔案夾整體(不支援 zip)

入口

資料管理 > 新增資料集 > OSS 匯入

模型調優 > 建立訓練任務 > 資料配置 > 資料集掛載

版本草稿

支援草稿與立即發布

強制立即發布(不支援草稿)

評測集

上傳校正與常見錯誤

新增数据集頁面本地上傳檔案時,前端校正會拒絕不符合準入規則的檔案並彈出提示。常見校正拒絕與上傳出錯情境見下文摺疊項:

Details

問題:上傳檔案時前端提示檔案數量超過上限,檔案被拒絕上傳。

定位:maxCount 按訓練方式設定——SFT/DPO 文本預設 10,多模態 zip 與 CPT 為 1。上傳檔案數超過對應訓練方式的上限即被前端拒絕。

處置:按以下方式調整後重傳:

  1. 核對當前訓練方式對應的 maxCount 上限,詳見檔案大小與數量限制
  2. 減少檔案數至上限內;多模態資料合併為單個 zip,CPT 資料合併為單個 jsonl。
  3. 檔案數仍超限時拆分為多個資料集分批上傳。

Details

問題:檔案名稱(不含尾碼)長度超過 120 字元,前端拒絕上傳。

定位:檔案名稱不含尾碼上限 120 字元,且須僅含 ASCII 字母、數字、底線、連字號。

處置:按以下方式調整後重傳:

  1. 重新命名檔案,使檔案名稱(不含尾碼)縮短至 120 字元以內。
  2. 僅使用 a-z/A-Z/0-9/_/- 字元,去除中文及其他非 ASCII 字元。
  3. 多模態壓縮包內檔案名稱還須全域唯一。

Details

問題:檔案名稱(不含尾碼比對)重複,前端拒絕上傳。

定位:同一資料集內檔案名稱不含尾碼須唯一,比對時忽略副檔名。

處置:按以下方式調整後重傳:

  1. 排查重名檔案,重新命名使其不含尾碼部分唯一。
  2. 同名不同副檔名的檔案(如 image.jpg 與 image.png)也會被判重名,須同時區分。
  3. 多模態 zip 內檔案名稱須全域唯一,即使分布在不同檔案夾。

Details

問題:單檔案大小超過對應訓練方式上限,前端拒絕上傳。

定位:單檔案大小上限按訓練方式分情境——SFT/DPO 文本 200 MB、多模態 zip 2 GB、CPT 300 MB。

處置:按以下方式調整後重傳:

  1. 核對檔案大小是否超過對應訓練方式上限。
  2. 拆分 jsonl 為多個檔案分批上傳(SFT/DPO);CPT 資料拆分需建立多個資料集。
  3. 單檔案超 300 MB 的承接方式見API 上傳配額

Details

問題:副檔名不在 supportedExtension 列表,前端彈出 warning 並拒絕上傳。

定位:副檔名須在支援列表內——文本訓練用 jsonl,評測集用 xlsx,多模態圖片支援 bmp/jpeg/jpg/png/tif/tiff/webp,多模態視頻支援 mp4 等格式。

處置:按以下方式調整後重傳:

  1. 核對副檔名是否在對應情境的支援列表內。
  2. 將檔案轉換為支援的副檔名後重新打包上傳。
  3. 多模態 zip 內圖片與視頻副檔名須逐一符合,否則整包匯入失敗。

Details

問題:OSS 上傳過程中檔案被置為 error 狀態,上傳未完成。

定位:常見原因為 Bucket 標籤缺失、百鍊服務訪問 OSS 授權異常或檔案格式不符。

處置:按以下方式排查後重試:

  1. 核對 OSS Bucket 已添加百鍊資料訪問授權標籤。
  2. 確認已授權百鍊服務訪問 OSS 資料。
  3. 檢查 data.jsonl 與檔案格式符合打包規則後重試上傳,詳見多模態壓縮包打包規則

無法復原操作風險提示:

  • 發布與刪除操作均無法復原;發行版本不可再編輯,僅草稿版本可刪除或線上編輯。
  • 資料集類型(訓練集/評測集)建立後不可變更、不可互換,選錯需建立資料集重新匯入全部資料。
  • 切換資料集類型、訓練情境、訓練方式時會清空已上傳檔案並重設儲存位置與匯入方式。

驗證集自動切分會從訓練集中隨機抽取 10% 資料作為驗證集,減少實際訓練資料量。小資料集建議選擇獨立驗證集,驗證集配置操作見在控制台進行模型調優

建議先下載對應情境的資料範本,按模板結構準備資料可避免匯入失敗,資料範本下載建議見概述。常見問題排障詳見下文摺疊項。草稿資料清洗與增強操作見,安全合規資料領域見。

上傳校正失敗時,可前往控制台新增資料集頁面核對檔案格式與准入規則。