As séries de modelos Qwen e Wan no Alibaba Cloud Model Studio são desenvolvidas internamente e treinadas com conjuntos de dados que contêm trilhões de tokens em texto, imagem, vídeo e áudio. O conjunto de dados mais antigo usado no desenvolvimento é anterior a janeiro de 2022.
Fontes de dados
Os dados de treinamento abrangem quatro categorias:
- Dados públicos da internet -- conteúdo web acessível ao público geral.
- Dados de parceiros terceiros -- informações não públicas fornecidas por parceiros mediante contrato.
- Dados rotulados e contratados -- informações provenientes de serviços de rotulagem de dados e prestadores remunerados.
- Dados sintéticos -- dados gerados por modelos proprietários da Alibaba Cloud para complementar informações do mundo real.
Os conjuntos de dados podem incluir conteúdo protegido por direitos autorais, marcas registradas ou patentes, além de conteúdo de domínio público.
Dados sintéticos
A geração de dados sintéticos por modelos proprietários atende a quatro necessidades:
- Preencher lacunas onde os dados de treinamento do mundo real são limitados
- Lidar com tarefas complexas que exigem exemplos de treinamento especializados
- Aprimorar a generalização e o desempenho perceptivo do modelo
- Fortalecer a segurança e a robustez do modelo
Capacidades principais
Os dados de treinamento fundamentam as seguintes capacidades do serviço de inferência:
- Compreensão geral de linguagem
- Raciocínio avançado
- Interação multimodal
- Processamento de contexto longo
- Geração visual
Esses dados também dão suporte ao alinhamento de tarefas, à fusão de modalidades e ao refinamento de capacidades, permitindo o tratamento preciso e seguro de solicitações diversificadas, especializadas e multimodais.
Política de dados do cliente
O Alibaba Cloud Model Studio não utiliza dados comerciais dos clientes para desenvolver ou aprimorar modelos sem consentimento explícito.
Governança de dados
Um framework de governança de dados abrange todo o pipeline de treinamento (do pré-treinamento ao pós-treinamento), com medidas para limpeza, processamento e otimização estrutural dos dados.
Pré-treinamento
Os dados brutos de treinamento passam por processos de limpeza e filtragem:
- Triagem automatizada de segurança de conteúdo remove conteúdos nocivos ou sensíveis.
- Revisão humana complementa os filtros automatizados como camada adicional de proteção.
- Filtragem de informações pessoais reduz a presença de dados pessoais nos conjuntos de treinamento durante o pré-processamento.
Tais medidas ajudam o modelo a identificar e reduzir vieses durante a inferência, melhorando a imparcialidade e a justiça nas saídas geradas.
Pós-treinamento
Aumento de dados para modelos de linguagem
A seleção de dados de alta qualidade ocorre por meio de um framework de anotação granular em cinco dimensões:
Dimensão | Objetivo |
|---|---|
Valor educacional | Priorizar dados com sinais fortes de aprendizado |
Cobertura de domínio | Abranger ampla variedade de áreas de conhecimento |
Tipos de linguagem | Dar suporte à compreensão multilíngue |
Complexidade de raciocínio | Desenvolver capacidades avançadas de raciocínio |
Níveis de segurança | Filtrar com base em critérios de segurança de conteúdo |
Dados sintéticos provenientes de modelos especializados, incluindo Qwen-Math e Qwen-Coder, aprimoram ainda mais o desempenho na compreensão multilíngue, no raciocínio complexo e na modelagem de contexto longo.
Processamento de modelos generativos visuais
Os dados multimodais passam por pré-processamento direcionado:
- OCR de alta precisão e análise estrutural de documentos para extração de texto de imagens e arquivos
- Anotação semântica espacial 2D/3D para compreensão espacial
- Alinhamento temporal explícito entre quadros de vídeo e texto para compreensão de vídeo
Conjuntos de dados sintéticos multimodais em grande escala fortalecem o alinhamento intermodal entre visão e linguagem. Eles dão suporte à compreensão de documentos complexos e vídeos longos, além de fornecerem base de treinamento para geração visual e interações baseadas em agentes.
Alinhamento de segurança
Conjuntos de dados dedicados à segurança fortalecem as capacidades integradas do modelo por meio do alinhamento de segurança.
Objetivo
Esses processos melhoram a qualidade dos dados e o alinhamento de tarefas, mantêm a segurança e a conformidade do modelo e atingem o desempenho alvo em inferências de uso geral, especializadas e multimodais.