Todos os produtos
Search
Central de documentação

Intelligent Media Services:QuerySmarttagJob

Última atualização: Jun 29, 2026

Consulta uma tarefa de smart tag.

Experimente agora

Experimente esta API no OpenAPI Explorer, sem necessidade de assinatura manual. Chamadas bem-sucedidas geram automaticamente código SDK correspondente aos seus parâmetros. Faça o download com segurança de credenciais integrada para uso local.

Testar

Autorização RAM

A tabela abaixo descreve a autorização necessária para chamar esta API. Você pode defini-la em uma política do Resource Access Management (RAM). As colunas da tabela estão detalhadas abaixo:

  • Ação: As ações que podem ser usadas no elemento Action das instruções de política de permissão do RAM para conceder permissões para executar a operação.

  • API: A API que você pode chamar para executar a ação.

  • Nível de acesso: O nível de acesso predefinido concedido para cada API. Valores válidos: create, list, get, update e delete.

  • Tipo de recurso: O tipo de recurso que suporta autorização para executar a ação. Indica se a ação suporta permissão em nível de recurso. O recurso especificado deve ser compatível com a ação. Caso contrário, a política será ineficaz.

    • Para APIs com permissões em nível de recurso, os tipos de recursos obrigatórios são marcados com um asterisco (*). Especifique o Nome de Recurso Alibaba Cloud (ARN) correspondente no elemento Resource da política.

    • Para APIs sem permissões em nível de recurso, é exibido como Todos os Recursos. Use um asterisco (*) no elemento Resource da política.

  • Chave de condição: As chaves de condição definidas pelo serviço. A chave permite controle granular, aplicando-se somente a ações ou a ações associadas a recursos específicos. Além das chaves de condição específicas do serviço, o Alibaba Cloud fornece um conjunto de chaves de condição comuns aplicáveis a todos os serviços compatíveis com RAM.

  • Ação dependente: As ações dependentes necessárias para executar a ação. Para concluir a ação, o usuário RAM ou a função RAM deve ter permissões para executar todas as ações dependentes.

Ação

Nível de acesso

Tipo de recurso

Chave de condição

Ação dependente

ice:QuerySmarttagJob

get

*All Resource

*

Nenhuma Nenhuma

Parâmetros da solicitação

Parâmetro

Tipo

Obrigatório

Descrição

Exemplo

JobId

string

Sim

O ID da tarefa de smart tag. Você pode obter esse ID na resposta da chamada SubmitSmarttagJob.

88c6ca184c0e47098a5b665e2****

Params

string

Não

Parâmetros de solicitação adicionais, formatados como uma string JSON. Por exemplo: {"labelResultType":"auto"}. O parâmetro labelResultType aceita os seguintes valores:

  • auto: resultados de tag gerados por máquina

  • hmi: resultados de tag human-in-the-loop

{"labelResultType":"auto"}

Elementos de resposta

Elemento

Tipo

Descrição

Exemplo

object

JobStatus

string

O status da tarefa. Valores válidos:

  • Success: A tarefa foi bem-sucedida.

  • Fail: A tarefa falhou.

  • Processing: A tarefa está em andamento.

  • Submitted: A tarefa está na fila para processamento.

Success

RequestId

string

O ID da solicitação.

******11-DB8D-4A9A-875B-275798******

UserData

string

Os dados personalizados transmitidos por meio do callback do MNS. Para obter detalhes sobre o formato da mensagem, consulte as definições de formato de mensagem de callback abaixo.

{"userId":"123432412831"}

Results

object

Result

array<object>

Uma matriz de objetos de resultado de análise.

object

Type

string

The type of the analysis result.

  • - Analysis result types for Tagging v1.0:

  1. TextLabel: text labels

  2. VideoLabel: video labels

  3. ASR: Raw results from automatic speech recognition. This is not returned by default.

  4. OCR: Raw results from optical character recognition. This is not returned by default.

  5. NLP: Results from natural language processing. This is not returned by default.

  • - Analysis result types for Tagging v2.0:

  1. CPVLabel

  2. Meta: Metadata such as the video title. This is not returned by default.

  • - Analysis result types for Tagging v2.0-custom:

  1. CPVLabel

  2. Meta: Metadata such as the video title. This is not returned by default.

Meta

Data

string

The analysis result data, formatted as a JSON string. The data structure depends on the Type value. For more information, see the Result parameter descriptions below.

{"title":"example-title-****"}

Usages

object

Usage

array<object>

object

Type

string

Quota

integer

Formato da mensagem de callback Quando o status de execução de uma tarefa de smart tag é alterado, o MPS envia uma mensagem de callback para uma fila especificada por você usando a API UpdatePipeline do MPS. O corpo da mensagem é uma string JSON que contém os seguintes campos:

ParâmetroTipoDescrição
TypestringUma string fixa com o valor smarttag, indicando uma tarefa de smart tag.
JobIdstringO ID exclusivo da tarefa.
StatestringO estado atual da tarefa. Este valor corresponde ao JobStatus retornado pela operação QuerySmarttagJob.
StatestringO estado atual da tarefa. Este valor corresponde ao JobStatus retornado pela operação QuerySmarttagJob.
UserDatastringOs dados do usuário transmitidos para a operação SubmitSmarttagJob.
UserDatastringOs dados do usuário transmitidos para a operação SubmitSmarttagJob.

Parâmetros de resultado

Estrutura de dados VideoLabel

ParâmetroTipoDescrição
personsJSONArrayUma matriz de objetos, cada um representando uma pessoa detectada.
persons.nameStringO nome da pessoa reconhecida.
persons.categoryStringA categoria da pessoa. Os valores possíveis são: celebrity, politician, sensitive (pessoa sensível) e unknown (pessoa desconhecida). Para uma pessoa de uma biblioteca de pessoas personalizada, este campo contém o ID da biblioteca.
persons.ratiodoubleA taxa de aparição da pessoa. O valor varia de 0 a 1.
persons.occurrencesJSONArrayUma matriz de objetos, cada um detalhando uma ocorrência da pessoa.
persons.occurrences.scoredoubleA pontuação de confiança para o reconhecimento.
persons.occurrences.fromdoubleA hora de início da aparição da pessoa, em segundos.
persons.occurrences.todoubleA hora de término da aparição da pessoa, em segundos.
persons.occurrences.positionJSONObjectAs coordenadas do rosto.
persons.occurrences.position.leftTopint[]As coordenadas x e y do canto superior esquerdo da caixa delimitadora do rosto.
persons.occurrences.position.rightBottomint[]As coordenadas x e y do canto inferior direito da caixa delimitadora do rosto.
persons.occurrences.timestampdoubleO carimbo de data/hora, em segundos, correspondente às coordenadas do rosto.
persons.occurrences.sceneStringO tipo de plano. Os valores possíveis são: closeUp (plano detalhe), medium-closeUp (plano médio detalhe), medium (plano médio) e medium-long (plano médio longo).
tagsJSONArrayUma matriz de objetos que representam tags detectadas, como objetos e cenas. Consulte a tabela abaixo para ver exemplos.
tags.mainTagNameStringA tag principal.
tags.subTagNameStringA subtag.
tags.ratiodoubleA taxa de aparição da tag. O valor varia de 0 a 1.
tags.occurrencesJSONArrayUma matriz de objetos, cada um detalhando uma ocorrência da tag.
tags.occurrences.scoredoubleA pontuação de confiança para a tag.
tags.occurrences.fromdoubleA hora de início da ocorrência, em segundos.
tags.occurrences.todoubleA hora de término da ocorrência, em segundos.
classificationsJSONArrayUma matriz de objetos, cada um representando uma classificação de vídeo.
classifications.scoredoubleA pontuação de confiança para a classificação.
classifications.category1StringA categoria de nível 1, como Lifestyle, Anime ou Automotive.
classifications.category2StringA categoria de nível 2, uma subcategoria da categoria de nível 1. Por exemplo, a categoria Lifestyle inclui subcategorias como Health ou Home.

Tags de vídeo: exemplos.

TagExemplos
program"Where Are We Going, Dad?", "Top Funny Comedian"
charactermédico, enfermeiro, professor
objectpiano, xícara, mesa, ovos mexidos com tomate, carro, cosméticos
logoCCTV-1, CCTV-2, Youku, Dragon TV
actiondançando, beijando, abraçando, reunindo, cantando, fazendo uma ligação, andando a cavalo, lutando
locationPraça Tiananmen, Estátua da Liberdade, Buda Gigante de Leshan, China, Estados Unidos
scenequarto, estação de metrô, campos em socalcos, praia, deserto

Estrutura de dados ImageLabel

ParâmetroTipoDescrição
personsJSONArrayUma matriz de objetos, cada um representando uma pessoa detectada.
persons.nameStringO nome da pessoa reconhecida.
persons.categoryStringA categoria da pessoa. Os valores válidos são celebrity, politician e sensitive.
persons.scoredoubleA pontuação de confiança para a pessoa detectada.
persons.positionJSONObjectAs coordenadas do rosto.
persons.position.leftTopint[]As coordenadas x e y do canto superior esquerdo da caixa delimitadora.
persons.position.rightBottomint[]As coordenadas x e y do canto inferior direito da caixa delimitadora.
persons.sceneStringO plano da câmera. Os valores válidos incluem: closeUp (plano detalhe), medium-closeUp (plano médio detalhe), medium (plano médio) e medium-long (plano médio longo).
tagsJSONArrayTags para objetos e cenas detectados. Para obter mais informações, consulte os exemplos na tabela abaixo.
tags.mainTagNameStringA tag principal.
tags.subTagNameStringA subtag.
tags.scoredoubleA pontuação de confiança para a tag.

Exemplos de tags de imagem.

Tag principalSubtag
characterpor exemplo, médico, enfermeiro, professor
locationpor exemplo, Praça Tiananmen, Estátua da Liberdade, Buda Gigante de Leshan, China, Estados Unidos
actionpor exemplo, falando
logopor exemplo, CCTV1, CCTV2, Youku, Dragon TV
actionpor exemplo, dançando, beijando, abraçando, reunindo, cantando, fazendo uma ligação, andando a cavalo, lutando
objectpor exemplo, piano, xícara, mesa, ovos mexidos com tomate, carro, cosméticos
scenepor exemplo, quarto, estação de metrô, campos em socalcos, praia, deserto

A estrutura de dados TextLabel (Fonte: ASR e OCR)

ParâmetroTipoDescrição
tagsJSONArrayUma lista de tags para o recurso.
tags.nameStringA chave da tag.
tags.valueStringO valor da tag. Use uma vírgula para separar vários valores.

Exemplos de tags de imagem.

ParâmetroValor
regionExemplos: Praça Tiananmen, Estátua da Liberdade, Buda Gigante de Leshan, China, Estados Unidos
organizationExemplos: China Wildlife Conservation Association, China Media Group
logoExemplos: Nike, Li-Ning
keywordExemplo: core strength

Estrutura de dados CPVLabel

  • cates: Categorias hierárquicas (por exemplo, nível 1, nível 2 e nível 3).

  • entities: Atributos de categoria (enriquecidos com informações do grafo de conhecimento).

  • hotwords: Palavras-chave populares (termos que refletem o interesse do usuário).

  • freeTags: Tags de forma livre (palavras-chave definidas pelo usuário).

ParâmetroTipoValor de exemploDescrição
typeStringhmiO tipo de resultado. Valores válidos: hmi (resultado de interação humano-máquina) e autp (resultado de tag automatizada).
catesJSONArray-Os resultados de classificação de categoria.
cates.labelLevel1StringTravelO rótulo de nível 1.
cates.labelLevel2StringTravel SceneryO rótulo de nível 2.
cates.labelString""O nome do rótulo. O algoritmo pode retornar uma string vazia.
cates.appearanceProbabilitydouble0.96A probabilidade de aparição.
cates.detailInfoJSONArray-Informações detalhadas sobre a categoria.
cates.detailInfo.scoredouble0.9A pontuação de confiança.
cates.detailInfo.startTimedouble0.021A hora de início.
cates.detailInfo.endTimedouble29.021A hora de término.
entitiesJSONArray-Entidades detectadas.
entities.labelLevel1StringRegionO rótulo de nível 1.
entities.labelLevel2StringLandmarkO rótulo de nível 2.
entities.labelStringHuangguoshu WaterfallO nome do rótulo.
entities.appearanceProbabilitydouble0.067A probabilidade de aparição.
entities.knowledgeInfoString{"name": "黄果树瀑布", "nameEn": "Huangguoshu Waterfall", "description": "亚洲四大瀑布之一"}Informações do grafo de conhecimento. Para obter uma lista completa de campos, consulte as tabelas para os seguintes tipos de grafo de conhecimento: IP de cinema e televisão, música, pessoa, ponto de referência e objeto.
entities.detailInfoJSONArray-Informações detalhadas sobre a entidade.
entities.detailInfo.scoredouble0.33292606472969055A pontuação de confiança.
entities.detailInfo.startTimedouble6.021A hora de início.
entities.detailInfo.endTimedouble8.021A hora de término.
entities.detailInfo.trackDataJSONArray-As informações estruturadas do rótulo da entidade.
entities.detailInfo.trackData.scoredouble0.32A pontuação de confiança.
entities.detailInfo.trackData.bboxinteger[]23,43,45,67As coordenadas da caixa delimitadora.
entities.detailInfo.trackData.timestampdouble7.9O carimbo de data/hora.
hotwordsJSONArray-Palavras-chave populares detectadas.
hotwords.labelLevel1StringkeywordO rótulo de nível 1.
hotwords.labelLevel1StringkeywordO rótulo de nível 1.
hotwords.labelLevel2String""O rótulo de nível 2.
hotwords.labelString中国气象局O conteúdo da palavra-chave popular.
hotwords.appearanceProbabilitydouble0.96A probabilidade de aparição.
hotwords.detailInfoJSONArrayInformações detalhadas sobre a palavra-chave popular.
hotwords.detailInfo.scoredouble1.0A pontuação de confiança.
hotwords.detailInfo.startTimedouble0.021A hora de início.
hotwords.detailInfo.endTimedouble29.021A hora de término.
freeTagsJSONArrayAs tags de forma livre.
freeTags.labelLevel1StringkeywordO rótulo de nível 1.
freeTags.labelLevel2String""O rótulo de nível 2.
freeTags.labelString中央气象台O conteúdo da tag.
freeTags.appearanceProbabilitydouble0.96A probabilidade de aparição.
freeTags.detailInfoJSONArrayInformações detalhadas sobre a tag de forma livre.
freeTags.detailInfo.scoredouble0.9A pontuação de confiança.
freeTags.detailInfo.startTimedouble0.021A hora de início.
freeTags.detailInfo.endTimedouble29.021A hora de término.

Resultado do ASR

ParâmetroTipoDescrição
detailsJSONArrayResultados detalhados da tarefa.
details.fromdoubleCarimbo de data/hora de início do segmento de fala, em segundos.
details.todoubleCarimbo de data/hora de término do segmento de fala, em segundos.
details.contentStringTexto transcrito do segmento de fala.

Resultados do OCR

ParâmetroTipoDescrição
detailsJSONArrayUma matriz de objetos contendo os detalhes da tarefa.
details.timestampdoubleO carimbo de data/hora, em segundos.
details.infoJSONArrayUma matriz de objetos, cada um contendo informações reconhecidas para o carimbo de data/hora correspondente.
details.info.scoredoubleA pontuação de confiança.
details.info.positionJSONObjectAs coordenadas do texto.
details.info.position.leftTopint[]As coordenadas do canto superior esquerdo.
details.info.position.rightBottomint[]As coordenadas do canto inferior direito.
details.info.contentStringO conteúdo de texto reconhecido.

Resultados da anotação de metadados

Nota

Se você não usar anotação humana e especificar o parâmetro needMetaData ao enviar uma tarefa com SubmitSmarttagJob , o QuerySmarttagJob retornará o title original que você inseriu.

ParâmetroTipoDescrição
titleStringO título.

Resultados da extração de legendas

ParâmetroTipoDescrição
detailsJSONArrayResultados detalhados da tarefa.
details.allResultUrlStringURL para todos os resultados de legendas. A URL é válida por seis meses após a conclusão da tarefa.
details.chResultUrlStringURL para os resultados de legendas em chinês. A URL é válida por seis meses após a conclusão da tarefa.
details.engResultUrlStringURL para os resultados de legendas em inglês. A URL é válida por seis meses após a conclusão da tarefa.
Nota

A URL do resultado da legenda retorna o conteúdo no seguinte formato: número de sequência + intervalo de tempo + conteúdo da legenda (uma legenda por linha).

Resultados do NLP

ParâmetroTipoDescrição
transcriptionobjectA saída de fala para texto.
autoChaptersobjectOs capítulos gerados automaticamente.
summarizationobjectO resumo gerado pelo modelo grande.
meetingAssistanceobjectA ata de reunião inteligente.
translationobjectO texto traduzido.

Transcrição

ParâmetroTipoDescrição
transcriptionobjectO resultado da transcrição de fala.
transcription.paragraphslist[]Uma lista de parágrafos na transcrição de fala.
transcription.paragraphs[i].paragraphIdstringO ID no nível do parágrafo.
transcription.paragraphs[i].speakerIdstringO ID do falante.
transcription.paragraphs[i].wordslist[]Uma lista de palavras no parágrafo.
transcription.paragraphs[i].words[i].idintO número de sequência da palavra. Este campo geralmente pode ser ignorado.
transcription.paragraphs[i].words[i].sentenceIdintO ID da frase. Palavras com o mesmo sentenceId formam uma frase.
transcription.paragraphs[i].words[i].startlongA hora de início da palavra, em milissegundos, em relação ao início do áudio.
transcription.paragraphs[i].words[i].endlongA hora de término da palavra, em milissegundos, em relação ao início do áudio.
transcription.paragraphs[i].words[i].textstringO texto da palavra.

Resumo: resumo de texto completo, resumo do falante e resumo de perguntas

ParâmetroTipoDescrição
summarizationobjectO objeto de resultado do resumo, que pode conter resultados para vários tipos de resumo.
summarization.paragraphSummarystringO resultado do resumo do parágrafo.
summarization.conversationalSummarylist[]Uma lista de resultados de resumo conversacional.
summarization.conversationalSummary[i].speakerIdstringO ID do falante.
summarization.conversationalSummary[i].speakerNamestringO nome do falante.
summarization.conversationalSummary[i].summarystringO resumo para o falante.
summarization.questionsAnsweringSummarylist[]Uma lista de resultados de resumo de perguntas e respostas.
summarization.questionsAnsweringSummary[i].questionstringA pergunta extraída da transcrição de fala.
summarization.questionsAnsweringSummary[i].sentenceIdsOfQuestionlist[]IDs de frases da transcrição de fala original que formam a pergunta.
summarization.questionsAnsweringSummary[i].answerstringA resposta para a pergunta.
summarization.questionsAnsweringSummary[i].sentenceIdsOfAnswerlist[]Os IDs de frases da transcrição de fala original que são resumidas na resposta.
summarization.mindMapSummarylist[object]Uma lista de resultados de resumo de mapa mental, que podem incluir resumos de tópicos e seus relacionamentos.
summarization.mindMapSummary[i].titlestringO título do mapa mental.
summarization.mindMapSummary[i].topiclist[object]Uma lista dos tópicos principais, cada um com seus respectivos subtópicos.
summarization.mindMapSummary[i].topic[i].titlestringO título do tópico.
summarization.mindMapSummary[i].topic[i].topiclist[object]Uma lista de subtópicos para o tópico atual, que pode estar vazia.

Tradução de texto completo

ParâmetroTipoDescrição
translationobjectO objeto de tradução.
translation.paragraphslist[]Uma lista de parágrafos traduzidos, correspondente ao resultado do reconhecimento de fala.
translation.paragraphs.paragraphIdstringO ID do parágrafo, que corresponde ao ParagraphId do resultado do reconhecimento de fala.
translation.paragraphs.sentenceslist[]As frases que compõem o parágrafo.
translation.paragraphs.sentences[i].sentenceIdlongO ID exclusivo da frase.
translation.paragraphs.sentences[i].startlongA hora de início da frase em milissegundos, em relação ao início do áudio.
translation.paragraphs.sentences[i].endlongA hora de término da frase em milissegundos, em relação ao início do áudio.
translation.paragraphs.sentences[i].textstringO texto traduzido da frase.

autoChapters (reconhecimento de capítulos)

ParâmetroTipoDescrição
autoChapterslist[]Uma lista de objetos de visão geral de capítulos.
autoChapters[i].idintID do capítulo.
autoChapters[i].startlongA hora de início do capítulo, como um carimbo de data/hora relativo em milissegundos a partir do início do áudio.
autoChapters[i].endlongA hora de término do capítulo, como um carimbo de data/hora relativo em milissegundos a partir do início do áudio.
autoChapters[i].headlinestringTítulo do capítulo.
autoChapters[i].summarystringResumo do capítulo.

meetingAssistance (extração de resumo, palavra-chave, frase-chave e item de ação)

ParâmetroTipoDescrição
meetingAssistanceobjectO objeto de resultados de atas inteligentes, que pode conter zero ou mais resultados de vários tipos.
meetingAssistance.keywordslist[]Os resultados da extração de palavras-chave.
meetingAssistance.keySentenceslist[]Os resultados da extração de frases-chave, também conhecidos como conteúdo-chave.
meetingAssistance.keySentences[i].idlongO ID da frase-chave.
meetingAssistance.keySentences[i].sentenceIdlongO ID da frase correspondente na transcrição original do ASR.
meetingAssistance.keySentences[i].startlongA hora de início em relação ao início do áudio, em milissegundos.
meetingAssistance.keySentences[i].endlongA hora de término em relação ao início do áudio, em milissegundos.
meetingAssistance.keySentences[i].textstringO texto da frase-chave.
meetingAssistance.actionslist[]Uma lista de itens de ação.
meetingAssistance.actions[i].idlongO ID do item de ação.
meetingAssistance.actions[i].sentenceIdlongO ID da frase correspondente na transcrição original do ASR.
meetingAssistance.actions[i].startlongA hora de início em relação ao início do áudio, em milissegundos.
meetingAssistance.actions[i].endlongA hora de término em relação ao início do áudio, em milissegundos.
meetingAssistance.actions[i].textstringO texto do item de ação.
meetingAssistance.classificationsobjectOs resultados da classificação de cena. Atualmente, apenas três tipos de cena são suportados.
meetingAssistance.classifications.interviewfloatA pontuação de confiança para a cena de entrevista.
meetingAssistance.classifications.lecturefloatA pontuação de confiança para a cena de palestra.
meetingAssistance.classifications.meetingfloatA pontuação de confiança para a cena de reunião.

Exemplos

Resposta de sucesso

JSON formato

{
  "JobStatus": "Success",
  "RequestId": "******11-DB8D-4A9A-875B-275798******",
  "UserData": "{\"userId\":\"123432412831\"}",
  "Results": {
    "Result": [
      {
        "Type": "Meta",
        "Data": "{\"title\":\"example-title-****\"}\t\n"
      }
    ]
  },
  "Usages": {
    "Usage": [
      {
        "Type": "",
        "Quota": 0
      }
    ]
  }
}

Códigos de erro

Consulte Códigos de Erro para uma lista completa.

Notas de versão

Consulte Notas de Versão para uma lista completa.