Qwen-Audio Realtime API 的服务端事件参考。所有服务端事件均包含 event_id(服务端自动生成)和 type(事件类型)公共字段。
用户指南:实时语音对话(Qwen-Audio-Realtime)。如需了解事件交互时序,请参见WebSocket API。
error
说明:请求错误或服务异常时返回。客户端错误(invalid_request_error)不中断连接;服务端错误(server_error)将终止连接。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
error 错误的详细信息。 |
session.created
说明:连接建立后服务端发送的首个事件,携带会话默认配置。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
session 会话的配置信息。 |
session.updated
说明:收到 session.update 请求后,若处理成功,则返回此事件,携带更新后的完整会话配置;若出错,则返回 error 事件。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
session 更新后的完整会话配置信息。结构与 |
input_audio_buffer.speech_started
说明:VAD 检测到语音开始(server_vad / smart_turn 模式)。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
audio_start_ms 语音开始的时间戳(毫秒)。 |
|
|
item_id 该段语音最终提交时将创建的 item 的 ID。 |
input_audio_buffer.speech_stopped
说明:VAD 检测到语音结束(server_vad / smart_turn 模式)。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
audio_end_ms 语音结束的时间戳(毫秒)。 |
|
|
item_id 将创建的用户消息项的 ID。 |
|
|
reason 仅 smart_turn 模式返回此字段。取值为 |
input_audio_buffer.committed
说明:音频缓冲已提交为用户消息(push-to-talk 的 commit 或 VAD 自动提交)。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
previous_item_id 前一条对话项的 ID。 |
|
|
item_id 创建的用户消息项的 ID。 |
input_audio_buffer.cleared
说明:音频缓冲已清空(仅 push-to-talk 模式)。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
conversation.item.created
说明:新的对话项创建成功。用户音频提交、客户端手动创建或助手响应开始时触发。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
previous_item_id 前一条对话项的 ID。 |
|
|
item 创建的对话项。 |
conversation.item.deleted
说明:对话项已删除。客户端发送 conversation.item.delete 后返回此确认事件。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 已删除的对话项 ID。 |
conversation.item.retrieved
说明:查询对话项成功返回。客户端发送 conversation.item.retrieve 后返回此事件。音频类型 content 仅包含转写文本,不返回原始音频数据。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item 查询到的对话项完整信息。 |
conversation.item.input_audio_transcription.delta
说明:ASR 转写增量结果,在语音识别过程中流式返回。包含情绪和语种检测信息。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 关联的对话项 ID。 |
|
|
content_index 内容部分的索引。 |
|
|
text 已确定的转写文本。 |
|
|
stash 尚未确定的暂存文本。 |
conversation.item.input_audio_transcription.completed
说明:ASR 转写最终结果。转写文本会写入对应 item 的 transcript 字段。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 关联的对话项 ID。 |
|
|
content_index 内容部分的索引。 |
|
|
transcript 完整的转写文本。 |
conversation.item.input_audio_transcription.failed
说明:ASR 转写失败。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 关联的对话项 ID。 |
|
|
content_index 内容部分的索引。 |
|
|
error 错误的详细信息。 |
conversation.item.ambient_audio_transcription.delta
说明:仅 smart_turn 模式。环境音频转写增量结果。当 VAD 检测到语音活动但语义判定为非有效轮次(如噪声、“嗯”、“啊”等无语义内容)时,将 ASR 识别结果以 ambient 事件透传给客户端。该事件不会关联到对话上下文中的任何 item,item_id 为独立生成的临时 ID。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 独立生成的临时 ID,不关联到对话上下文中的任何 item。 |
|
|
content_index 内容部分的索引。 |
|
|
text 已确定的转写文本。 |
|
|
stash 尚未确定的暂存文本。 |
conversation.item.ambient_audio_transcription.completed
说明:仅 smart_turn 模式。环境音频转写最终结果。与 delta 事件配对,表示一段环境音频的转写结束。该转写结果不会写入对话上下文。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 独立生成的临时 ID,不关联到对话上下文。 |
|
|
content_index 内容部分的索引。 |
|
|
transcript 完整的转写文本。 |
response.created
说明:一轮模型推理开始。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response 响应对象。 |
response.output_item.added
说明:响应中新增一个输出项。普通回复的输出项类型为 message;Function Calling 的输出项类型为 function_call。
|
event_id 本次事件唯一标识符。 |
Function Call 输出项示例: 当输出项为函数调用时,
说明
一轮响应可包含多个 |
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
item 新增的输出项。 |
response.content_part.added
说明:输出项中新增一个内容部分。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
part 新增的内容部分。 |
response.text.delta
说明:纯文本模式下的文本增量事件,流式返回文本片段。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
delta 文本增量片段。 |
response.text.done
说明:纯文本模式下的文本输出完成事件。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
text 完整的文本输出。 |
response.audio_transcript.delta
说明:音频模式下的文字字幕增量事件,流式返回字幕片段。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
delta 字幕增量片段。 |
response.audio_transcript.done
说明:音频模式下的字幕输出完成事件。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
transcript 完整的字幕文本。 |
response.audio.delta
说明:音频模式下的音频数据增量事件。delta 字段为 Base64 编码的 PCM 音频数据。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
delta Base64 编码的 PCM 音频数据片段。 |
response.audio.done
说明:音频模式下的音频输出完成事件,不包含音频数据。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
response.content_part.done
说明:输出项中的内容部分输出完成。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
content_index 内容部分在输出项中的索引。 |
|
|
part 完成的内容部分。 |
response.output_item.done
说明:响应中的输出项输出完成。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
item 完成的输出项完整信息。 |
response.function_call_arguments.delta
说明:Function Calling 参数增量。模型决定调用工具时,服务端会先发送 response.output_item.added(item.type=function_call)和对应的 conversation.item.created,随后通过本事件流式输出参数片段。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
call_id 函数调用的唯一标识符。 |
|
|
delta 函数调用参数的增量片段(JSON 字符串片段)。 |
response.function_call_arguments.done
说明:Function Calling 参数输出完成。收到该事件后,客户端应执行对应工具,并通过 conversation.item.create 写入 function_call_output,随后发送 response.create 触发二轮推理。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
response_id 关联的响应 ID。 |
|
|
item_id 关联的输出项 ID。 |
|
|
output_index 输出项在响应中的索引。 |
|
|
call_id 函数调用的唯一标识符。 |
|
|
name 调用的函数名称。 |
|
|
arguments 完整的函数调用参数(JSON 字符串)。 |
response.done
说明:一轮推理完成。status 表示结束原因。
|
event_id 本次事件唯一标识符。 |
正常完成
被打断取消
|
|
type 事件类型,固定为 |
|
|
response 完整的响应对象。 |
voiceprint_audio_list.in_progress
说明:声纹注册流程异步进行中。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 声纹注册任务的唯一标识符。 |
voiceprint_audio_list.completed
说明:声纹注册流程已完成。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 声纹注册任务的唯一标识符。 |
voiceprint_audio_list.failed
说明:声纹注册失败,不阻塞正常对话调用。
|
event_id 本次事件唯一标识符。 |
|
|
type 事件类型,固定为 |
|
|
item_id 声纹注册任务的唯一标识符。 |
|
|
reason 失败原因描述。 |