iTAG语音类标注模板包含音频分类、音频分割和音频识别三种类型。创建标注任务时,请根据应用场景选择模板,并按对应的数据结构准备输入数据、解析输出数据。
背景信息
音频分类
音频分类(Audio Classification)从固定的标签集合中,为输入音频匹配一个或多个标签。该模板支持单标签和多标签分类。
-
应用场景
场景声音分类等。
-
数据结构
-
输入数据
manifest文件的每行对应一道题目,每行必须包含source字段。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
输出数据
manifest文件的每行包含题目和标注结果。每行的JSON结构如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/6.wav" }, "label-1432993193909231616": { "results": [ { "questionId": "1", "data": "标签1", "markTitle": "单选", "type": "survey/value" } ] } }
-
音频分割
音频分割(Audio segmentation)基于波形识别,将一段音频切分为多个片段,并为每个片段匹配标签。
-
应用场景
对话内容分析等。
-
数据结构
-
输入数据
manifest文件的每行对应一道题目,每行必须包含source字段。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
输出数据
manifest文件的每行包含题目和标注结果。每行的JSON结构如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/21.wav" }, "label-1435480301706092544": { "results": [ { "duration": 0, "objects": [ { "result": { "音频识别结果": "通过音频识别得到的结果内容1。", "单选": "标签1" }, "color": null, "id": "wavesurfer_ei0aet9uvp8", "start": 2.3886218302094817, "end": 4.635545755237045 }, { "result": { "音频识别结果": "通过音频识别得到的结果内容2。", "单选": "标签2" }, "color": null, "id": "wavesurfer_kl39gnlb2k", "start": 5.698280044101433, "end": 7.348048511576626 } ], "empty": false } ] } }
-
音频识别
音频识别ASR将音频转换为文本,并为识别结果匹配标签。
-
应用场景
方言识别等。
-
数据结构
-
输入数据
manifest文件的每行对应一道题目,每行必须包含source字段。
{"data":{"source":"oss://tongxin-lly.oss-cn-hangzhou.aliyuncs.com/iTAG/audio/1.wav"}} ... -
输出数据
manifest文件的每行包含题目和标注结果。每行的JSON结构如下。
{ "data": { "source": "oss://itag.oss-cn-hangzhou.aliyuncs.com/tongxin_audio/14.wav" }, "label-1435448359497441280": { "results": [ { "questionId": "1", "data": "通过音频识别得到的结果内容。", "markTitle": "音频识别结果", "type": "survey/value" }, { "questionId": "3", "data": [ "标签1", "标签2" ], "markTitle": "多选", "type": "survey/multivalue" } ] } }
-