Este tópico descreve os parâmetros e os detalhes da interface da API HTTP de reconhecimento de fala não em tempo real Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash.
Guia do usuário: Non-real-time speech recognition. Para requisitos de entrada, como formatos de áudio suportados, limites de tamanho de arquivo e limites de duração, consulte Audio specifications.
Endpoints do service
Singapore
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
Substitua {WorkspaceId} pelo seu Workspace ID real.
China (Beijing)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
Substitua {WorkspaceId} pelo seu Workspace ID real.
ImportanteO Alibaba Cloud Model Studio lançou domínios específicos para workspaces nas regiões China (Beijing) e Singapore. Os novos domínios dedicados oferecem desempenho superior e maior estabilidade para solicitações de inferência. Recomendamos a migração para os novos domínios:
- China (Beijing): de
dashscope.aliyuncs.compara{WorkspaceId}.cn-beijing.maas.aliyuncs.com - Singapore: de
dashscope-intl.aliyuncs.compara{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
Substitua {WorkspaceId} pelo seu Workspace ID real. Os domínios existentes permanecem totalmente funcionais.
Cabeçalhos da solicitação
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
Authorization | string | Sim | O token de autenticação, no formato |
Content-Type | string | Sim | O tipo de mídia do corpo da solicitação. Fixo como |
X-DashScope-SSE | string | Sim | Controla se os resultados são retornados como um fluxo SSE. Defina como |
Corpo da solicitação | Os exemplos a seguir usam a configuração para a região Singapore. Substitua "{WorkspaceId}" pelo ID do seu workspace real. A configuração varia entre as regiões, e a chave de API para a região Singapore difere daquela para a região Beijing. Sem fluxoCom fluxoCom contexto - sem fluxoCom contexto - com fluxoBase64É possível passar dados codificados em Base64 (Data URL) no formato
Palavras-chave inline |
model O nome do modelo. As séries de modelos Qwen-Audio-3.0-ASR-Flash e Fun-ASR-Flash são suportadas. Para mais detalhes, consulte Supported models and regions. | |
input As informações de entrada. | |
parameters Os parâmetros do modelo. ObservaçãoO Refinamento de Texto está desativado por padrão e ainda não está disponível. Refinamento de Texto: Durante a transcrição da fala, o modelo remove automaticamente palavras de preenchimento sem sentido e repetições gaguejadas, lida com autocorreções feitas durante a fala, suaviza expressões coloquiais e padroniza a pontuação e a formatação do texto. Isso resulta em uma saída mais concisa, fluente e legível, preservando ao máximo a intenção original do usuário e as informações principais. |
Corpo da resposta | Sem fluxoCom fluxoQuando Exemplo de resposta: |
request_id O identificador exclusivo desta solicitação. | |
output O resultado de saída. | |
usage As informações de uso. Retornadas apenas quando Propriedades duration A duração do áudio processado, em segundos. |
Lógica de processamento de resultados de fluxo SSE
No modo de fluxo, o cliente precisa lidar com o seguinte:
- Para cada evento SSE recebido, analise o JSON no campo
data. - Use
output.sentence.sentence_endpara determinar se a frase atual terminou. Quando este valor étrue, o reconhecimento da frase está completo, os carimbos de data/hora no nível de palavra estão estabilizados e o resultado pode ser usado como final. Quando este valor éfalse, o reconhecimento ainda está em andamento, e o texto e os carimbos de data/hora podem ser atualizados em eventos subsequentes. - As informações de
usagesão retornadas apenas no evento de fim de frase, e você pode usá-las para medir a duração do áudio processado.