O recurso de análise estruturada inteligente analisa, traduz e extrai informações essenciais de vídeos longos com alta densidade de conteúdo. Ele ajuda a identificar, marcar, reorganizar e reassistir a conteúdos importantes. O sistema realiza uma análise inteligente do conteúdo dos ativos de mídia e armazena os resultados como dados estruturados nesses mesmos ativos. Após a conclusão da análise, obtenha os resultados por meio de chamadas de API para aumentar a eficiência na leitura e no consumo do conteúdo.
Limites
Este recurso está disponível apenas nas regiões China (Beijing), China (Shanghai) e China (Hangzhou).
Regras de faturamento
O recurso está em visualização pública e, atualmente, é gratuito.
Procedimento
Registre um novo ativo de mídia (RegisterMediaInfo) ou envie um ativo existente (SubmitSmarttagJob) para acionar um job de análise estruturada.
Após a conclusão da análise, os resultados são armazenados na pasta gerada pelo ice, dentro do caminho do Object Storage Service (OSS) do ativo de mídia. Não é possível utilizar um caminho personalizado.
Depois que os resultados forem armazenados, o sistema enviará uma notificação de callback (MediaAiAnalysisComplete).
Chame a operação GetMediaInfo para obter as smart tags dos ativos de mídia.
Pré-requisitos
O Intelligent Media Services (IMS) deve estar ativado. Para mais informações, consulte Activate IMS.
Enviar um job de tagging
Registrar novos ativos de mídia para acionar um job de tagging chamando a operação RegisterMediaInfo
Para analisar novos ativos de mídia, acione um job de tagging durante o registro desses ativos. Especifique um modelo de smart tagging no parâmetro SmartTagTemplateId para que o IMS analise os ativos com base nesse modelo. Para mais detalhes sobre os parâmetros, consulte RegisterMediaInfo.
A especificação de um modelo de smart tagging só é permitida no momento do registro dos ativos de mídia. Não é possível fazer upload de modelos de smart tagging por meio de chamadas de API.
Parâmetros de solicitação (modelos de smart tagging suportados)
Parameter | Type | Required | Description | Example |
SmartTagTemplateId | string | No | Modelo de smart tagging
| S00000101-300080 |
Enviar um job de tagging com base em um ativo de mídia existente chamando a operação SubmitSmarttagJob
Utilize esta operação para analisar ativos de mídia já existentes. Especifique os parâmetros relevantes, incluindo o modelo de parâmetros, a URL de callback e dados personalizados. Quando o job for concluído, uma mensagem de callback será enviada ao seu servidor e os resultados da análise ficarão armazenados na pasta gerada pelo ice, no caminho especificado do OSS. Para mais informações, consulte SubmitSmarttagJob.
Exemplo de parâmetros de entrada
{
"Params": "{\"NlpParams\":{\"SummarizationEnabled\":true,\"SourceLanguage\":\"cn\",\"AutoChaptersEnabled\":true,\"TargetLanguages\":\"en\",\"MeetingAssistanceEnabled\":true,\"DiarizationEnabled\":true,\"SummarizationTypes\":\"Paragraph,Conversational,QuestionsAnswering,MindMap\",\"TranslationEnabled\":true,\"SpeakerCount\":2}}",
"NotifyUrl": "https://***.com.fcapp.run",
"UserData": "{\"test\": \"b\"}",
"Input": "{\"Media\": \"****0d30005971efbfc4f7f6c75a6302****\", \"Type\": \"Media\"}",
"TemplateId": "S00000101-300080"
}
Notificações de callback
Configure definições de callback
Ao enviar um job de tagging via operação SubmitSmarttagJob ou acionar um job automático via RegisterMediaInfo, especifique uma URL de callback HTTP, HTTPS ou Simple Message Queue (SMQ) no parâmetro de solicitação UserData. Assim que o job de tagging terminar e os resultados forem gravados nos ativos de mídia, o sistema enviará uma notificação de callback.
Ao receber essa notificação, chame a operação GetMediaInfo informando o ID do ativo de mídia para consultar as smart tags estruturadas associadas a ele.
Tipo de evento de callback
Análise de ativo de mídia e armazenamento de resultados (MediaAiAnalysisComplete)
Exemplo do corpo da mensagem:
{
"EventType": "MediaAiAnalysisComplete",
"UserId": 183320223010****,
"EventTime": "2022-06-23T13:11:33Z",
"MessageBody": {
"Status":"Success", // Indicates whether the AI analysis result is stored in the system. Valid values: Success and Failed.
"JobStatus": "AnalyzeSuccess", // The status of the AI job. Valid values: AnalyzeSuccess and AnalyzeFailed.
"Type": "StandardSmartTag" // The type of the AI job. The value is StandardSmartTag.
"MediaId":"****b391419aj294m83b459f7435****" // The ID of the media asset.
}
}
Para mais detalhes sobre os parâmetros, consulte Event list.
Chamar a operação GetMediaInfo****
Esta operação permite consultar as smart tags estruturadas de um ativo de mídia. Dependendo das necessidades do seu negócio, defina se deseja retornar informações detalhadas. Para saber mais sobre a operação, veja GetMediaInfo.
Parâmetros de solicitação (É possível definir o retorno de informações detalhadas)
Parameter | Type | Required | Description | Example |
ReturnDetailedInfo | string | No | Define se devem ser retornadas informações detalhadas para campos específicos do ativo de mídia. Se este parâmetro não for configurado, o valor padrão AiRoughData.StandardSmartTagJob=false será utilizado.
| {"AiRoughData.StandardSmartTagJob": true} |
Exemplos de resposta
Campos Type e Data em Results
-
Transcription (reconhecimento básico)
Parameter
Type
Description
transcription
object
Resultado da conversão de fala em texto.
transcription.paragraphs
list[]
Lista de parágrafos contendo o resultado da conversão de fala em texto.
transcription.paragraphs[i].paragraphId
string
ID do parágrafo.
transcription.paragraphs[i].speakerId
string
ID do orador.
transcription.paragraphs[i].words
list[]
Palavras contidas no parágrafo.
transcription.paragraphs[i].words[i].id
int
ID da palavra. Não é necessário prestar atenção a este identificador.
transcription.paragraphs[i].words[i].sentenceId
int
ID da frase. Palavras com o mesmo ID de frase podem ser agrupadas para formar uma sentença completa.
transcription.paragraphs[i].words[i].start
long
Tempo inicial da palavra. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
transcription.paragraphs[i].words[i].end
long
Tempo final da palavra. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
transcription.paragraphs[i].words[i].text
string
Texto da palavra.
-
Summarization (resumo completo, resumo por orador, resumo de perguntas e mapa mental)
Parameter
Type
Description
summarization
object
Resultados do resumo. Podem estar vazios ou conter diferentes tipos de resumo.
summarization.paragraphSummary
string
Resumo do texto completo.
summarization.conversationalSummary
list[]
Lista de resultados de resumo para uma conversa.
summarization.conversationalSummary[i].speakerId
string
ID do orador.
summarization.conversationalSummary[i].speakerName
string
Nome do orador.
summarization.conversationalSummary[i].summary
string
Resumo correspondente ao orador.
summarization.questionsAnsweringSummary
list[]
Lista de resultados de resumo para perguntas e respostas.
summarization.questionsAnsweringSummary[i].question
string
A pergunta formulada.
summarization.questionsAnsweringSummary[i].sentenceIdsOfQuestion
list[]
Lista de IDs das frases geradas a partir da fala original correspondente à pergunta.
summarization.questionsAnsweringSummary[i].answer
string
Resposta à pergunta.
summarization.questionsAnsweringSummary[i].sentenceIdsOfAnswer
list[]
Lista de IDs das frases geradas a partir da fala original correspondente à resposta.
summarization.mindMapSummary
list[]
Mapa mental dos resultados do resumo. Pode conter o resumo de cada tópico e as relações entre eles.
summarization.mindMapSummary[i].title
string
Título do tópico.
summarization.mindMapSummary[i].topic
list[]
Array contendo cada tópico e seus subtópicos.
summarization.mindMapSummary[i].topic[i].title
string
Título do subtópico.
summarization.mindMapSummary[i].topic[i].topic
list[]
Array contendo os subtópicos aninhados. Este array pode estar vazio.
-
Translation (tradução completa do texto)
Parameter
Type
Description
translation
object
Resultado da tradução.
translation.paragraphs
list[]
Lista de parágrafos contendo o resultado da tradução, correspondente ao resultado do ASR.
translation.paragraphs.paragraphId
string
ID do parágrafo, correspondente ao ID do parágrafo no resultado do ASR.
translation.paragraphs.sentences
list[]
Lista de frases do texto traduzido.
translation.paragraphs.sentences[i].sentenctId
long
ID da frase.
translation.paragraphs.sentences[i].start
long
Tempo inicial da frase. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
translation.paragraphs.sentences[i].end
long
Tempo final da frase. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
translation.paragraphs.sentences[i].text
string
Texto traduzido, correspondente ao resultado do ASR.
-
AutoChapters (reconhecimento de capítulos)
Parameter
Type
Description
autoChapters
list[]
Resultado da visão geral dos capítulos, podendo conter zero, um ou múltiplos capítulos.
autoChapters[i].id
int
Número sequencial do capítulo.
autoChapters[i].start
long
Tempo inicial do capítulo. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
autoChapters[i].end
long
Tempo final do capítulo. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
autoChapters[i].headline
string
Título do capítulo.
autoChapters[i].summary
string
Visão geral do capítulo.
-
MeetingAssitance (extração inteligente de ata, incluindo palavras-chave, frases-chave e itens de ação)
Parameter
Type
Description
meetingAssistance
object
Resultado da ata inteligente, podendo estar vazio ou conter diferentes tipos de dados.
meetingAssistance.keywords
list[]
Lista de palavras-chave extraídas.
meetingAssistance.keySentences
list[]
Lista de frases-chave extraídas.
meetingAssistance.keySentences[i].id
long
Número sequencial da frase-chave.
meetingAssistance.keySentences[i].sentenceId
long
ID da frase-chave, correspondente ao ID da frase no resultado original do ASR.
meetingAssistance.keySentences[i].start
long
Tempo inicial da frase-chave. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
meetingAssistance.keySentences[i].end
long
Tempo final da frase-chave. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
meetingAssistance.keySentences[i].text
string
Conteúdo da frase-chave.
meetingAssistance.actions
list[]
Lista de itens de ação (to-do).
meetingAssistance.actions[i].id
long
Número sequencial do item de ação.
meetingAssistance.actions[i].sentenceId
long
ID da frase-chave associada, correspondente ao ID da frase no resultado original do ASR.
meetingAssistance.actions[i].start
long
Tempo inicial da frase associada ao item de ação. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
meetingAssistance.actions[i].end
long
Tempo final da frase associada ao item de ação. Valor representado por um timestamp indicando os milissegundos decorridos desde o início do áudio.
meetingAssistance.actions[i].text
string
Descrição do item de ação.
meetingAssistance.classifications
object
Tipo de cenário. Apenas três tipos são suportados.
meetingAssistance.classifications.interview
float
Pontuação de confiança para o cenário de entrevista.
meetingAssistance.classifications.lecture
float
Pontuação de confiança para o cenário de palestra/apresentação.
meetingAssistance.classifications.meeting
float
Pontuação de confiança para o cenário de reunião.