全部產品
Search
文件中心

Platform For AI:語音類

更新時間:Aug 05, 2026

iTAG語音類標註模板包含音頻分類、音頻分割和音頻識別三種類型。建立標註任務時,請根據應用情境選擇模板,並按對應的資料結構準備輸入資料、解析輸出資料。

背景資訊

語音類標註模板的資料結構如下:

音頻分類

音頻分類(Audio Classification)從固定的標籤集合中,為輸入音頻匹配一個或多個標籤。該模板支援單標籤和多標籤分類。

  • 應用情境

    情境聲音分類等。

  • 資料結構

    • 輸入資料

      manifest檔案的每行對應一道題目,每行必須包含source欄位。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 輸出資料

      manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/6.wav"
          },
          "label-1432993193909231616": {
              "results": [
                  {
                      "questionId": "1", 
                      "data": "標籤1", 
                      "markTitle": "單選", 
                      "type": "survey/value"
                  }
              ]
          }
      }

音頻分割

音頻分割(Audio segmentation)基于波形識別,將一段音頻切分為多個片段,並為每個片段匹配標籤。

  • 應用情境

    對話內容分析等。

  • 資料結構

    • 輸入資料

      manifest檔案的每行對應一道題目,每行必須包含source欄位。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 輸出資料

      manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/21.wav"
          }, 
          "label-1435480301706092544": {
              "results": [
                  {
                      "duration": 0, 
                      "objects": [
                          {
                              "result": {
                                  "音頻識別結果": "通過音頻識別得到的結果內容1。", 
                                  "單選": "標籤1"
                              }, 
                              "color": null, 
                              "id": "wavesurfer_ei0aet9uvp8", 
                              "start": 2.3886218302094817, 
                              "end": 4.635545755237045
                          }, 
                          {
                              "result": {
                                  "音頻識別結果": "通過音頻識別得到的結果內容2。", 
                                  "單選": "標籤2"
                              }, 
                              "color": null, 
                              "id": "wavesurfer_kl39gnlb2k", 
                              "start": 5.698280044101433, 
                              "end": 7.348048511576626
                          }
                      ], 
                      "empty": false
                  }
              ]
          }
      }

音頻識別

音頻識別ASR將音頻轉換為文本,並為識別結果匹配標籤。

  • 應用情境

    方言識別等。

  • 資料結構

    • 輸入資料

      manifest檔案的每行對應一道題目,每行必須包含source欄位。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 輸出資料

      manifest檔案的每行包含題目和標註結果。每行的JSON結構如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/14.wav"
          }, 
          "label-1435448359497441280": {
              "results": [
                  {
                      "questionId": "1", 
                      "data": "通過音頻識別得到的結果內容。", 
                      "markTitle": "音頻識別結果", 
                      "type": "survey/value"
                  }, 
                  {
                      "questionId": "3", 
                      "data": [
                          "標籤1", 
                          "標籤2"
                      ], 
                      "markTitle": "多選", 
                      "type": "survey/multivalue"
                  }
              ]
          }
      }