介紹文本產生模型調優資料的格式規格、打包要求、大小與數量限制及 API 上傳配額,協助使用者按訓練方式構造並上傳合規的 SFT/DPO/CPT 訓練資料。
概述
本文檔闡述文本產生模型調優資料的格式規格、打包要求、大小與數量限制及 API 上傳配額。適用範疇為文本產生模型調優(text/image/video → text),涵蓋純文字 SFT/DPO/CPT、千問 VL 圖片與視頻理解、視頻抽幀、工具調用(function calling)與深度思考(thinking)。視頻產生模型調優(image → video)不屬於本範疇。
資料集類型(訓練集或評測集)建立後不可變更。各訓練方式與元素的支援情況詳見訓練方式與元素支援矩陣,各組合的格式構造規則見下文對應章節。
警告發布與刪除操作無法復原:發行版本不可再編輯,僅草稿版本可刪除或線上編輯;資料集類型建立後不可變更。切換類型、情境或訓練方式會清空已上傳檔案。
管理類操作(建立參數、版本管理、評測集管理規則、匯入方式選型、資料清洗、安全合規)引導到同級文檔,詳見訓練集與評測集、模型調優簡介等。建議在建立資料集頁面下載對應情境的資料範本,按模板結構準備資料可避免匯入失敗。
資料集構建建議(推薦資料規模、多樣性與均衡、資料擴充策略)詳見模型調優簡介-資料集構建技巧。
訓練方式與元素支援矩陣
訓練集支援 SFT、DPO、CPT 三種訓練方法,各訓練方式與元素的支援情況見下文矩陣表。調優推薦順序為 CPT(可選)→ SFT → DPO(可選),三者遞進非互斥。
地區可用性:
- SFT、本地上傳、日誌迴流、API 上傳、多模態資料格式全地區支援。
- DPO、CPT、OSS 匯入、雲端儲存掛載僅支援北京地區。
訓練方式與元素的支援矩陣如下:
訓練方式 | 文本產生 | 視覺理解-圖片輸入 | 視覺理解-視頻輸入(qwen3.5+) | 視覺理解-工具調用(qwen3.5+) | 深度思考 |
|---|---|---|---|---|---|
✓ | ✓ | ✓ | ✓ | ✓ | |
✓ | ✗ | ✗ | ✗ | ✓ | |
✓ | ✗ | ✗ | ✗ | ✗ | |
✓ | ✗ | ✗ | ✗ | ✗ |
各訓練方式版本新增時的資料繼承策略如下(CPT 不支援繼承已有資料,每次新增版本均需建立):
資料繼承策略 | SFT | DPO | CPT |
|---|---|---|---|
繼承已有資料 | ✓ | ✓ | ✗ |
建立新資料 | ✓ | ✓ | 支援(強制建立) |
訓練方法 SFT/DPO/CPT 欄位定義詳見模型調優簡介。
文本產生 - SFT 格式
SFT 文本產生訓練資料採用 jsonl 檔案格式,基於 ChatML messages 多輪結構。
- 支援 system、user、assistant 三種角色,content 欄位為字串(多模態情境的 content 數組結構見對應多模態格式章節)。
- 單檔案大小上限 200 MB。
- 一個資料集可混合不同格式行——每條記錄獨立選格式,無需統一為單一格式。
- 可選格式:普通對話、深度思考、工具調用、工具與思考組合(見下方標籤頁範例)。
SFT 文本產生支援以下範例格式,各範例的完整 JSON 結構見對應標籤頁:
普通 ChatML
普通 ChatML 格式範例(system/user/assistant 多輪對話):
{
"messages": [
{"role": "system", "content": "系統輸入1"},
{"role": "user", "content": "使用者輸入1"},
{"role": "assistant", "content": "期望的模型輸出1"},
{"role": "user", "content": "使用者輸入2"},
{"role": "assistant", "content": "期望的模型輸出2"}
]
}
進階用法
-
支援
loss_weight參數,取值範圍(0.0, 1.0],數值越大代表訓練時該條資料的重要性越高。預設支援 Qwen3.5 及以上版本模型;如需支援 Qwen3、Qwen2.5 系列模型,請聯絡商務經理。
{"role": "assistant", "content": "期望的模型輸出", "loss_weight": "1.0"}
深度思考(thinking)
深度思考(thinking)格式範例(思考標籤放最後一條 assistant,前後換行必須保留):
{
"messages": [
{"role": "system", "content": "系統輸入1"},
{"role": "user", "content": "使用者輸入1"},
{"role": "assistant", "content": "模型輸出1"},
{"role": "user", "content": "使用者輸入2"},
{"role": "assistant", "content": "<think>\n期望的思考內容2\n</think>\n\n期望的輸出2"}
]
}
工具調用(function calling)
請使用視覺理解-SFT 格式。
思考模式格式說明
深度思考內容用 <think>\n…\n</think>\n\n 標籤包裹,置於 assistant 輸出文本內(與最終回覆同屬最後一條 assistant 的 content)。規則:
- 只能放在最後一條 assistant 輸出中;中間的 assistant 輸出不加思考標籤。
- 思考標籤前後的分行符號必須保留。
- 若訓練樣本設定模型不輸出思考標籤,訓練完成後不建議再開啟思考模式調用。
評測集格式
評測集僅服務文本產生情境,與 SFT/DPO/CPT 訓練方式無關——DPO/CPT 訓練後的模型同樣使用文本產生評測集進行評測,不區分訓練方式。
評測集規格:
- 檔案格式 xlsx,列結構見控制台下載模板。
- 入庫方式:本地上傳、日誌迴流;不支援Object Storage Service匯入與雲端儲存掛載。
- 僅草稿版本支援線上編輯(Prompt/Completion),發行版本不可編輯。
本地上傳檔案格式為 xlsx(列結構見控制台下載模板),每條評測資料為一組 Prompt/Completion 內容,樣本如下:
{"prompt": "誰在文藝複興時期繪製人體?", "completion": "文藝複興時期是一個關於藝術、文化和學術的複興運動,在這個時期,許多藝術家都繪製了人體。"}
{"prompt": "為什麼太陽會發光發熱?", "completion": "太陽是由氫原子核在高溫高壓下聚變而產生的巨大能量。這種聚變反應釋放出大量的光和熱能。"}
{"prompt": "為什麼天空是藍色的?", "completion": "陽光照射到地球大氣層中時,波長較短的藍光會被大氣中的氣體分子散射開來,形成我們看到的藍天。"}
日誌迴流入庫限制:
- 支援日誌範圍為最近 30 天內。
- 單次匯入上限 10 萬條。
- 需授權服務關聯角色並指定 API Key 與模型篩選條件。
- 訓練集僅 SFT 文本產生情境可用(評測集文本產生亦支援)。
日誌迴流匯入方式詳情見日誌迴流。
評測集應準備資料不重疊的獨立集合,用於客觀評估模型泛化能力。評測集管理規則詳見訓練集與評測集。
文本產生 - DPO 格式
DPO 文本產生訓練資料採用 jsonl 格式,基於 ChatML messages 多輪結構,額外含 chosen 與 rejected 兩條對比的 assistant 輸出,用於偏好對齊訓練。messages 內的所有內容均作為輸入,DPO 用於訓練模型對最後一條 user 輸入的正負反饋。messages 多輪結構規則見文本產生 - SFT 格式。
針對深度思考內容,chosen 或 rejected 的 assistant 輸出可使用思考標籤包裹,思考標籤只能放最後一條 assistant 行,規則見文本產生 - SFT 格式。
loss_weight (邀測)參數支援 chosen 模組,取值範圍 0.0 至 1.0,數值越大訓練重要性越高,詳見文本產生 - SFT 格式。
DPO 訓練資料單檔案大小上限為 200 MB,與 SFT 文本產生一致。DPO 定義詳見模型調優簡介,草稿與發佈動作見訓練集與評測集。
DPO 文本產生訓練資料範例見下文代碼塊:
普通 ChatML
普通 chosen/rejected 對比格式範例(兩條對比的 assistant 輸出):
{
"messages": [
{"role": "system", "content": "系統輸入"},
{"role": "user", "content": "使用者輸入1"},
{"role": "assistant", "content": "模型輸出1"},
{"role": "user", "content": "使用者輸入2"},
{"role": "assistant", "content": "模型輸出2"},
{"role": "user", "content": "使用者輸入3"}
],
"chosen": {"role": "assistant", "content": "贊同的模型期望輸出3"},
"rejected": {"role": "assistant", "content": "反對的模型期望輸出3"}
}
深度思考(thinking)
思考標籤格式範例(深度思考內容用思考標籤包裹,放最後 assistant):
{
"messages": [
{"role": "system", "content": "系統輸入"},
{"role": "user", "content": "使用者輸入1"},
{"role": "assistant", "content": "模型輸出1"},
{"role": "user", "content": "使用者輸入2"}
],
"chosen": {"role": "assistant", "content": "<think>\n期望的思考內容\n</think>\n\n期望的模型輸出"},
"rejected": {"role": "assistant", "content": "反對的模型期望輸出2"}
}
文本產生 - CPT 格式
CPT 文本產生訓練資料採用 jsonl 純文字格式,每行一個 jsonl 對象,結構為 {text},text 欄位為純文字內容。messages 多輪結構規則見文本產生 - SFT 格式。
CPT 訓練資料約束:
- 建議至少 5000 萬 Token,單檔案大小上限 300 MB。
- 不支援草稿狀態與資料繼承,每次新增版本均需建立資料並立即發布。
CPT 定義詳見模型調優簡介,版本管理與資料繼承操作見訓練集與評測集。CPT 純文字範例完整 JSON 結構見下文代碼塊。
{text} 純文字格式範例(每行一個 jsonl 純文字對象):
{
"text": "常值內容"
}
視覺理解-SFT 格式
SFT 圖片訓練資料用於千問 VL 多模態理解(控制台 UI 選項為「圖片理解」)情境,採用 zip 壓縮包格式,包含 data.jsonl 訓練文本資料檔案與圖片檔案。data.jsonl 須置於壓縮包根目錄,data.jsonl 中每條訓練資料的 messages 採用 content 數組結構,數組項含圖片欄位(image)與文字欄位(text)。推薦使用單層目錄結構,打包規則詳見多模態壓縮包打包規則。
圖片輸入限制
圖片准入限制如下:
- 單張圖片寬度和高度均不超過 1024 px。
- 單張圖片不超過 10 MB。
- 支援格式:bmp、jpeg、jpg、png、tif、tiff、webp。
resized_width 與 resized_height 為可選的目標縮放控制參數,用於指定圖片目標縮放尺寸,非圖片准入上限。圖片准入上限為寬高不超過 1024 px、單張不超過 10 MB。圖片准入具體數值以控制台實際展示為準。
圖片消耗 token 計算詳見映像與視頻理解-計費與限流。
視頻輸入限制
僅 qwen3.5 及以後的多模態模型支援。支援兩種視頻輸入模式:
- 視頻檔案路徑模式:video 欄位為字串(如 "video1.mp4"),由平台處理抽幀。適用於使用完整視頻檔案的情境。
- 圖片幀列表模式:video 欄位為圖片檔案名稱列表(如 ["0.jpg","1.jpg"]),使用者自行準備幀序列。適用於已有抽幀圖片的情境。
說明訓練資料中的圖片與視頻須同時滿足模型調用的輸入限制(如映像解析度、視頻時間長度、幀率等),調用限制詳見視頻限制。
視頻消耗 token 計算詳見映像與視頻理解-計費與限流。
兩種模式的欄位對比與範例見下文:
欄位/參數 | 視頻檔案路徑模式 | 圖片幀列表模式 |
|---|---|---|
video | str(視頻檔案路徑,必填) | List[str](圖片幀列表,必填) |
sample_fps | 不適用 | float([0.1, 10],預設 2.0,可選) |
fps | float([0.1, 10],預設 2.0,可選) | 不適用 |
resized_width | int(縮放寬度,可選) | int(縮放寬度,可選) |
resized_height | int(縮放高度,可選) | int(縮放高度,可選) |
video_start | float(截取起始時間,可選) | 不適用 |
video_end | float(截取結束時間,可選) | 不適用 |
SFT 圖片訓練範例見下文標籤頁:
普通 ChatML
普通 ChatML 格式範例(system/user/assistant 多輪對話):
{
"messages": [
{"role": "system", "content": [{"text": "系統輸入1"}]},
{"role": "user", "content": [{"text": "使用者輸入1"}]},
{"role": "assistant", "content": [{"text": "期望的模型輸出1"}]},
{"role": "user", "content": [{"text": "使用者輸入2"}]},
{"role": "assistant", "content": [{"text": "期望的模型輸出2"}]}
]
}
深度思考(thinking)
深度思考(thinking)格式範例(思考標籤放最後一條 assistant,前後換行必須保留):
{
"messages": [
{"role": "system", "content": [{"text": "系統輸入1"}]},
{"role": "user", "content": [{"text": "使用者輸入1"}]},
{"role": "assistant", "content": [{"text": "模型輸出1"}]},
{"role": "user", "content": [{"text": "使用者輸入2"}]},
{"role": "assistant", "content": [{"text": "<think>\n期望的思考內容2\n</think>\n\n期望的輸出2"}]}
]
}
工具調用(function calling)
說明qwen3.5+的模式支援使用工具調用資料格式。
工具調用(function calling)格式範例(tools 定義 + messages 多輪含 tool 角色,tool_call_id 一一對應):
{
"tools": [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "查詢指定城市的即時天氣",
"parameters": {
"type": "object",
"properties": {
"city": {"type": "string", "description": "城市名稱,例如:北京"}
},
"required": ["city"]
}
}
}
],
"messages": [
{"role": "user", "content": [{"text": "幫我查一下北京的天氣"}]},
{
"role": "assistant",
"content": [{"text": "好的,我來幫您查詢北京的天氣。"}],
"tool_calls": [
{
"id": "call_3a11c1ba883b41b6a4e0cb",
"type": "function",
"function": {
"name": "get_weather",
"arguments": "{\"city\": \"北京\"}"
}
}
]
},
{"role": "tool", "tool_call_id": "call_3a11c1ba883b41b6a4e0cb", "content": [{"text": "{\"city\": \"北京\", \"weather\": \"晴\", \"temperature\": \"25℃\"}"}]},
{"role": "assistant", "content": [{"text": "北京今天天氣晴朗,氣溫 25℃,適合出行。"}]}
]
}
圖片輸入
圖片加文字格式設定範例(content 數組含圖片項與文本項):
{
"messages": [
{"role": "system", "content": [{"text": "系統輸入"}]},
{
"role": "user",
"content": [
{"text": "使用者輸入1"},
{"image": "影像檔名1.jpg", "resized_width": 200, "resized_height": 200}
]
},
{"role": "assistant", "content": [{"text": "期望的模型輸出1"}]}
]
}
視頻檔案路徑模式
視頻檔案路徑模式格式範例(video 欄位為視頻檔案路徑字串):
{
"messages": [
{"role": "system", "content": [{"text": "系統輸入"}]},
{
"role": "user",
"content": [
{"text": "使用者輸入1"},
{"video": "視頻檔案名稱1.mp4", "fps": 3.0, "resized_width": 200, "resized_height": 200, "video_start": 0.0, "video_end": 3.0}
]
},
{"role": "assistant", "content": [{"text": "期望的模型輸出1"}]}
]
}
圖片幀列表模式
圖片幀列表模式格式範例(video 為幀列表,含 sample_fps):
{
"messages": [
{"role": "system", "content": [{"text": "系統輸入"}]},
{
"role": "user",
"content": [
{"text": "使用者輸入2"},
{"video": ["0.jpg", "1.jpg", "2.jpg", "3.jpg"], "sample_fps": 5.0, "resized_width": 200, "resized_height": 200}
]
},
{"role": "assistant", "content": [{"text": "期望的模型輸出2"}]}
]
}
多模態理解定義詳見模型調優簡介。
工具調用格式說明
工具調用(function calling)模式在 messages 多輪結構基礎上增加 tools 定義與 tool_calls/role:tool 機制,欄位約束如下:
- tools:工具定義數組,每項含 type:"function" 與 function{name, description, parameters};parameters 為 JSON Schema(含 type/properties/required)。
- messages:多輪對話數組,角色含 user、assistant、tool。
- content:多模態內容數組,可含 image、text、video 等項(與多模態理解格式一致)。
- assistant.tool_calls:模型產生的工具調用數組,含 id、type:"function"、function{name, arguments};arguments 為 JSON 字串。
- role:"tool":工具返回,tool_call_id 必須與對應 tool_calls[].id 一一對應,content 內為工具返回結果。
多輪對話最後一條通常為 assistant 基於工具返回的最終回覆。
百鍊不支援 OpenAI 的 name、weight 參數,所有 assistant 輸出都會被訓練。從 OpenAI/Azure 遷移的訓練資料不可攜帶 name/weight 欄位。
資料多樣性與均衡性建議:各情境資料數量應相對均衡,資料比例符合實際情境比例,避免某一類資料過多導致模型偏向於學習該類特徵,影響泛化能力。
思考模式格式說明
深度思考內容用 <think>\n…\n</think>\n\n 標籤包裹,置於 assistant 輸出文本內(與最終回覆同屬最後一條 assistant 的 content)。規則:
- 只能放在最後一條 assistant 輸出中;中間的 assistant 輸出不加思考標籤。
- 思考標籤前後的分行符號必須保留。
- 若訓練樣本設定模型不輸出思考標籤,訓練完成後不建議再開啟思考模式調用。
多模態壓縮包打包規則
多模態理解訓練資料以 zip 壓縮包形式通過新增数据集頁面上傳,打包須滿足以下約束:
- 壓縮包最大支援 2 GB。
- 包內檔案夾與檔案名稱允許的字元集為 ASCII 字母(a-z、A-Z)、數字(0-9)、底線(_)、連字號(-)。
- 訓練文本資料檔案固定為 data.jsonl,必須位於壓縮包根目錄——確保壓縮後開啟 zip 檔案直接看到 data.jsonl,外層不能再包裹檔案夾。
圖片或視頻檔案名稱應在壓縮包內全域唯一,即使分布在不同檔案夾中。data.jsonl 內只需聲明檔案名稱而非檔案路徑——正確樣本:image1.jpg;錯誤樣本:jpg_folder/image1.jpg。
雲端儲存掛載不支援 zip 壓縮包。使用雲端儲存掛載載入資料集時,須將未經壓縮的資料集檔案夾整體上傳到 OSS Bucket,通過 MountStorage 的 file_path 指定 data.jsonl 檔案路徑;包含多檔案時只需指定 data.jsonl 路徑,其餘同目錄檔案自動掛載。雲端儲存掛載詳見使用 API 進行模型調優。
命名樣本與目錄結構見下文代碼塊。雲端儲存掛載授權操作見在控制台進行模型調優,OSS 匯入 Bucket 標籤打標操作見訓練集與評測集。
# 單層目錄(推薦)
Trainingdata_vl.zip
|--- data.jsonl # 必須在根目錄,外層不再包裹檔案夾
|--- image1.png
|--- video1.mp4
# data.jsonl 內聲明檔案名稱(非路徑)
# 正確:image1.jpg
# 錯誤:jpg_folder/image1.jpg
前往控制台新增資料集頁面上傳多模態壓縮包並完成打包校正。
檔案大小與數量限制
本地上傳檔案大小與數量上限按訓練方式分情境設定,詳見下文分情境表。圖片准入限制見視覺理解-SFT 格式,評測集格式限制見評測集格式,日誌迴流入庫限制見評測集格式。
max_length 取值區間 500 至 131072 為訓練序列長度配置參數,非上傳准入上限。單條訓練資料上傳准入大小上限以控制台頁面展示為準。
本地上傳檔案大小與數量上限按訓練方式分情境設定,推薦資料量為最低建議值:
訓練方式/情境 | 單檔案大小上限 | 檔案數量上限(maxCount) | 推薦資料量 |
|---|---|---|---|
文本產生 - SFT 格式 | 200 MB | 10(預設) | 至少上千條 |
文本產生 - DPO 格式 | 200 MB | 10(預設) | 至少上百條 |
文本產生 - CPT 格式 | 300 MB | 1 | 至少 5000 萬 Token |
多模態(zip) | 2 GB | 1 | 根據實際情境準備充足樣本 |
檔案名稱(不含尾碼) | ≤120 字元且不重名 | — | — |
副檔名 | 須在 新增資料集 列表中 | — | — |
API 上傳配額
通過 DashScope API 上傳調優檔案(用途標記為模型調優)的配額見下文配額表。控制台建立資料集時,File API 列表最多支援 10 個檔案合并註冊;通過 API 上傳的調優檔案在控制台模型調優頁面與 API 呼叫中均可見可用。
雲端儲存掛載載入資料集的約束:
- 通過 MountStorage 的 file_path 指定 data.jsonl 根目錄清單路徑,不支援 zip 壓縮包。
- 選擇雲端儲存掛載儲存位置時強制立即發布,不支援草稿狀態。
- 掛載前需授權百鍊服務訪問 OSS 資料。
超限承接與加密:
- 單檔案超過 300 MB:通過雲端儲存掛載或多模態 ZIP 2 GB 通道上傳。
- 總配額超額:刪除歷史檔案釋放空間。
- 匯入資料自動啟用 OSS 服務端加密(SSE-OSS,AES256)。
API 呼叫、認證、SDK、錯誤碼、MountStorage 欄位細節見使用 API 進行模型調優。
API 上傳調優檔案配額如下:
配額項 | 限制值 | 說明 |
|---|---|---|
單檔案大小 | 不超過 300 MB | 調優檔案(模型調優用途) |
有效檔案總空間 | 100 GB | 未刪除檔案累計 |
有效檔案總數量 | 10000 個 | 未刪除檔案累計 |
檔案儲存體時間長度 | 無時間限制 | 不自動到期 |
File API 列表上限 | 10 個 | 控制台建立資料集時合并註冊 |
OSS 匯入與雲端儲存掛載的差異對比如下:
維度 | OSS 匯入 | 雲端儲存掛載 |
|---|---|---|
前置條件 | 百鍊資料訪問授權標籤 | 授權百鍊服務訪問 OSS 資料 |
資料形態 | 單個或批量檔案 | 未經壓縮的資料集檔案夾整體(不支援 zip) |
入口 | 資料管理 > 新增資料集 > OSS 匯入 | 模型調優 > 建立訓練任務 > 資料配置 > 資料集掛載 |
版本草稿 | 支援草稿與立即發布 | 強制立即發布(不支援草稿) |
評測集 | ✗ | ✗ |
上傳校正與常見錯誤
在新增数据集頁面本地上傳檔案時,前端校正會拒絕不符合準入規則的檔案並彈出提示。常見校正拒絕與上傳出錯情境見下文摺疊項:
Details
問題:上傳檔案時前端提示檔案數量超過上限,檔案被拒絕上傳。
定位:maxCount 按訓練方式設定——SFT/DPO 文本預設 10,多模態 zip 與 CPT 為 1。上傳檔案數超過對應訓練方式的上限即被前端拒絕。
處置:按以下方式調整後重傳:
- 核對當前訓練方式對應的 maxCount 上限,詳見檔案大小與數量限制。
- 減少檔案數至上限內;多模態資料合併為單個 zip,CPT 資料合併為單個 jsonl。
- 檔案數仍超限時拆分為多個資料集分批上傳。
Details
問題:檔案名稱(不含尾碼)長度超過 120 字元,前端拒絕上傳。
定位:檔案名稱不含尾碼上限 120 字元,且須僅含 ASCII 字母、數字、底線、連字號。
處置:按以下方式調整後重傳:
- 重新命名檔案,使檔案名稱(不含尾碼)縮短至 120 字元以內。
- 僅使用 a-z/A-Z/0-9/_/- 字元,去除中文及其他非 ASCII 字元。
- 多模態壓縮包內檔案名稱還須全域唯一。
Details
問題:檔案名稱(不含尾碼比對)重複,前端拒絕上傳。
定位:同一資料集內檔案名稱不含尾碼須唯一,比對時忽略副檔名。
處置:按以下方式調整後重傳:
- 排查重名檔案,重新命名使其不含尾碼部分唯一。
- 同名不同副檔名的檔案(如 image.jpg 與 image.png)也會被判重名,須同時區分。
- 多模態 zip 內檔案名稱須全域唯一,即使分布在不同檔案夾。
Details
問題:單檔案大小超過對應訓練方式上限,前端拒絕上傳。
定位:單檔案大小上限按訓練方式分情境——SFT/DPO 文本 200 MB、多模態 zip 2 GB、CPT 300 MB。
處置:按以下方式調整後重傳:
- 核對檔案大小是否超過對應訓練方式上限。
- 拆分 jsonl 為多個檔案分批上傳(SFT/DPO);CPT 資料拆分需建立多個資料集。
- 單檔案超 300 MB 的承接方式見API 上傳配額。
Details
問題:副檔名不在 supportedExtension 列表,前端彈出 warning 並拒絕上傳。
定位:副檔名須在支援列表內——文本訓練用 jsonl,評測集用 xlsx,多模態圖片支援 bmp/jpeg/jpg/png/tif/tiff/webp,多模態視頻支援 mp4 等格式。
處置:按以下方式調整後重傳:
- 核對副檔名是否在對應情境的支援列表內。
- 將檔案轉換為支援的副檔名後重新打包上傳。
- 多模態 zip 內圖片與視頻副檔名須逐一符合,否則整包匯入失敗。
Details
問題:OSS 上傳過程中檔案被置為 error 狀態,上傳未完成。
定位:常見原因為 Bucket 標籤缺失、百鍊服務訪問 OSS 授權異常或檔案格式不符。
處置:按以下方式排查後重試:
- 核對 OSS Bucket 已添加百鍊資料訪問授權標籤。
- 確認已授權百鍊服務訪問 OSS 資料。
- 檢查 data.jsonl 與檔案格式符合打包規則後重試上傳,詳見多模態壓縮包打包規則。
無法復原操作風險提示:
- 發布與刪除操作均無法復原;發行版本不可再編輯,僅草稿版本可刪除或線上編輯。
- 資料集類型(訓練集/評測集)建立後不可變更、不可互換,選錯需建立資料集重新匯入全部資料。
- 切換資料集類型、訓練情境、訓練方式時會清空已上傳檔案並重設儲存位置與匯入方式。
驗證集自動切分會從訓練集中隨機抽取 10% 資料作為驗證集,減少實際訓練資料量。小資料集建議選擇獨立驗證集,驗證集配置操作見在控制台進行模型調優。
建議先下載對應情境的資料範本,按模板結構準備資料可避免匯入失敗,資料範本下載建議見概述。常見問題排障詳見下文摺疊項。草稿資料清洗與增強操作見,安全合規資料領域見。
上傳校正失敗時,可前往控制台新增資料集頁面核對檔案格式與准入規則。