Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Alibaba Cloud Model Studio - Resumo dos dados de treinamento

Última atualização: Aug 26, 2026

As séries de modelos Qwen e Wan no Alibaba Cloud Model Studio são desenvolvidas internamente e treinadas com conjuntos de dados que contêm trilhões de tokens em texto, imagem, vídeo e áudio. O conjunto de dados mais antigo usado no desenvolvimento é anterior a janeiro de 2022.

Fontes de dados

Os dados de treinamento abrangem quatro categorias:

  • Dados públicos da internet -- conteúdo web acessível ao público geral.
  • Dados de parceiros terceiros -- informações não públicas fornecidas por parceiros mediante contrato.
  • Dados rotulados e contratados -- informações provenientes de serviços de rotulagem de dados e prestadores remunerados.
  • Dados sintéticos -- dados gerados por modelos proprietários da Alibaba Cloud para complementar informações do mundo real.

Os conjuntos de dados podem incluir conteúdo protegido por direitos autorais, marcas registradas ou patentes, além de conteúdo de domínio público.

Dados sintéticos

A geração de dados sintéticos por modelos proprietários atende a quatro necessidades:

  • Preencher lacunas onde os dados de treinamento do mundo real são limitados
  • Lidar com tarefas complexas que exigem exemplos de treinamento especializados
  • Aprimorar a generalização e o desempenho perceptivo do modelo
  • Fortalecer a segurança e a robustez do modelo

Capacidades principais

Os dados de treinamento fundamentam as seguintes capacidades do serviço de inferência:

  • Compreensão geral de linguagem
  • Raciocínio avançado
  • Interação multimodal
  • Processamento de contexto longo
  • Geração visual

Esses dados também dão suporte ao alinhamento de tarefas, à fusão de modalidades e ao refinamento de capacidades, permitindo o tratamento preciso e seguro de solicitações diversificadas, especializadas e multimodais.

Política de dados do cliente

O Alibaba Cloud Model Studio não utiliza dados comerciais dos clientes para desenvolver ou aprimorar modelos sem consentimento explícito.

Governança de dados

Um framework de governança de dados abrange todo o pipeline de treinamento (do pré-treinamento ao pós-treinamento), com medidas para limpeza, processamento e otimização estrutural dos dados.

Pré-treinamento

Os dados brutos de treinamento passam por processos de limpeza e filtragem:

  • Triagem automatizada de segurança de conteúdo remove conteúdos nocivos ou sensíveis.
  • Revisão humana complementa os filtros automatizados como camada adicional de proteção.
  • Filtragem de informações pessoais reduz a presença de dados pessoais nos conjuntos de treinamento durante o pré-processamento.

Tais medidas ajudam o modelo a identificar e reduzir vieses durante a inferência, melhorando a imparcialidade e a justiça nas saídas geradas.

Pós-treinamento

Aumento de dados para modelos de linguagem

A seleção de dados de alta qualidade ocorre por meio de um framework de anotação granular em cinco dimensões:

Dimensão

Objetivo

Valor educacional

Priorizar dados com sinais fortes de aprendizado

Cobertura de domínio

Abranger ampla variedade de áreas de conhecimento

Tipos de linguagem

Dar suporte à compreensão multilíngue

Complexidade de raciocínio

Desenvolver capacidades avançadas de raciocínio

Níveis de segurança

Filtrar com base em critérios de segurança de conteúdo

Dados sintéticos provenientes de modelos especializados, incluindo Qwen-Math e Qwen-Coder, aprimoram ainda mais o desempenho na compreensão multilíngue, no raciocínio complexo e na modelagem de contexto longo.

Processamento de modelos generativos visuais

Os dados multimodais passam por pré-processamento direcionado:

  • OCR de alta precisão e análise estrutural de documentos para extração de texto de imagens e arquivos
  • Anotação semântica espacial 2D/3D para compreensão espacial
  • Alinhamento temporal explícito entre quadros de vídeo e texto para compreensão de vídeo

Conjuntos de dados sintéticos multimodais em grande escala fortalecem o alinhamento intermodal entre visão e linguagem. Eles dão suporte à compreensão de documentos complexos e vídeos longos, além de fornecerem base de treinamento para geração visual e interações baseadas em agentes.

Alinhamento de segurança

Conjuntos de dados dedicados à segurança fortalecem as capacidades integradas do modelo por meio do alinhamento de segurança.

Objetivo

Esses processos melhoram a qualidade dos dados e o alinhamento de tarefas, mantêm a segurança e a conformidade do modelo e atingem o desempenho alvo em inferências de uso geral, especializadas e multimodais.