iTAG語音類標註模板包含音頻分類、音頻分割和音頻識別三種類型。建立標註任務時,請根據應用情境選擇模板,並按對應的資料結構準備輸入資料、解析輸出資料。
背景資訊
音頻分類
音頻分類(Audio Classification)從固定的標籤集合中,為輸入音頻匹配一個或多個標籤。該模板支援單標籤和多標籤分類。
-
應用情境
情境聲音分類等。
-
資料結構
-
輸入資料
manifest檔案的每行對應一道題目,每行必須包含source欄位。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
輸出資料
manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/6.wav" }, "label-1432993193909231616": { "results": [ { "questionId": "1", "data": "標籤1", "markTitle": "單選", "type": "survey/value" } ] } }
-
音頻分割
音頻分割(Audio segmentation)基于波形識別,將一段音頻切分為多個片段,並為每個片段匹配標籤。
-
應用情境
對話內容分析等。
-
資料結構
-
輸入資料
manifest檔案的每行對應一道題目,每行必須包含source欄位。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
輸出資料
manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/21.wav" }, "label-1435480301706092544": { "results": [ { "duration": 0, "objects": [ { "result": { "音頻識別結果": "通過音頻識別得到的結果內容1。", "單選": "標籤1" }, "color": null, "id": "wavesurfer_ei0aet9uvp8", "start": 2.3886218302094817, "end": 4.635545755237045 }, { "result": { "音頻識別結果": "通過音頻識別得到的結果內容2。", "單選": "標籤2" }, "color": null, "id": "wavesurfer_kl39gnlb2k", "start": 5.698280044101433, "end": 7.348048511576626 } ], "empty": false } ] } }
-
音頻識別
音頻識別ASR將音頻轉換為文本,並為識別結果匹配標籤。
-
應用情境
方言識別等。
-
資料結構
-
輸入資料
manifest檔案的每行對應一道題目,每行必須包含source欄位。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
輸出資料
manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/14.wav" }, "label-1435448359497441280": { "results": [ { "questionId": "1", "data": "通過音頻識別得到的結果內容。", "markTitle": "音頻識別結果", "type": "survey/value" }, { "questionId": "3", "data": [ "標籤1", "標籤2" ], "markTitle": "多選", "type": "survey/multivalue" } ] } }
-