全部产品
Search
文档中心

人工智能平台 PAI:语音类

更新时间:Aug 04, 2026

iTAG语音类标注模板包含音频分类、音频分割和音频识别三种类型。创建标注任务时,请根据应用场景选择模板,并按对应的数据结构准备输入数据、解析输出数据。

背景信息

语音类标注模板的数据结构如下:

音频分类

音频分类(Audio Classification)从固定的标签集合中,为输入音频匹配一个或多个标签。该模板支持单标签和多标签分类。

  • 应用场景

    场景声音分类等。

  • 数据结构

    • 输入数据

      manifest文件的每行对应一道题目,每行必须包含source字段。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 输出数据

      manifest文件的每行包含题目和标注结果。每行的JSON结构如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/6.wav"
          },
          "label-1432993193909231616": {
              "results": [
                  {
                      "questionId": "1", 
                      "data": "标签1", 
                      "markTitle": "单选", 
                      "type": "survey/value"
                  }
              ]
          }
      }

音频分割

音频分割(Audio segmentation)基于波形识别,将一段音频切分为多个片段,并为每个片段匹配标签。

  • 应用场景

    对话内容分析等。

  • 数据结构

    • 输入数据

      manifest文件的每行对应一道题目,每行必须包含source字段。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 输出数据

      manifest文件的每行包含题目和标注结果。每行的JSON结构如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/21.wav"
          }, 
          "label-1435480301706092544": {
              "results": [
                  {
                      "duration": 0, 
                      "objects": [
                          {
                              "result": {
                                  "音频识别结果": "通过音频识别得到的结果内容1。", 
                                  "单选": "标签1"
                              }, 
                              "color": null, 
                              "id": "wavesurfer_ei0aet9uvp8", 
                              "start": 2.3886218302094817, 
                              "end": 4.635545755237045
                          }, 
                          {
                              "result": {
                                  "音频识别结果": "通过音频识别得到的结果内容2。", 
                                  "单选": "标签2"
                              }, 
                              "color": null, 
                              "id": "wavesurfer_kl39gnlb2k", 
                              "start": 5.698280044101433, 
                              "end": 7.348048511576626
                          }
                      ], 
                      "empty": false
                  }
              ]
          }
      }

音频识别

音频识别ASR将音频转换为文本,并为识别结果匹配标签。

  • 应用场景

    方言识别等。

  • 数据结构

    • 输入数据

      manifest文件的每行对应一道题目,每行必须包含source字段。

      {"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}}
      ...
    • 输出数据

      manifest文件的每行包含题目和标注结果。每行的JSON结构如下。

      {
          "data": {
              "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/14.wav"
          }, 
          "label-1435448359497441280": {
              "results": [
                  {
                      "questionId": "1", 
                      "data": "通过音频识别得到的结果内容。", 
                      "markTitle": "音频识别结果", 
                      "type": "survey/value"
                  }, 
                  {
                      "questionId": "3", 
                      "data": [
                          "标签1", 
                          "标签2"
                      ], 
                      "markTitle": "多选", 
                      "type": "survey/multivalue"
                  }
              ]
          }
      }