Se o desempenho de um modelo não atender às suas expectativas após a aplicação de métodos de otimização, como engenharia de prompt e chamadas de plugin, utilize o ajuste fino de modelos no Alibaba Cloud Model Studio. Como estratégia central para melhorar o desempenho, essa prática aprimora significativamente as capacidades do modelo em setores ou cenários de negócios específicos, alinha os resultados às preferências humanas e reduz a latência de saída. O ajuste fino de modelos abrange três métodos de treinamento: ajuste fino supervisionado (SFT), pré-treinamento contínuo (CPT) e otimização direta de preferência (DPO).
Introdução ao ajuste fino de modelos
O ajuste fino de modelos é uma técnica essencial para otimizar o desempenho de modelos. Ele permite:
Melhorar o desempenho do modelo em setores específicos ou para necessidades de negócios específicas
Reduzir a latência de saída do modelo
Suprimir alucinações do modelo
Alinhar o modelo a valores ou preferências humanas
Substituir modelos maiores por modelos leves ajustados finamente
Durante o processo de ajuste fino, o modelo aprende características específicas do negócio ou do cenário a partir dos dados de treinamento, como conhecimento, tom, estilos de expressão e autoconsciência. Como o modelo já assimilou diversos exemplos de setores ou cenários específicos durante o treinamento, seu desempenho com prompts one-shot ou zero-shot após o treinamento supera o desempenho few-shot anterior. Isso economiza tokens de entrada e reduz a latência de saída do modelo.
Processo de ajuste fino de modelos
Para mais informações, consulte:
Faturamento
Método de faturamento | Pagamento conforme o uso com base na quantidade de dados de treinamento |
Fórmula de faturamento | Taxa de treinamento do modelo = (Total de tokens nos dados de treinamento + Total de tokens nos dados de treinamento mistos) × Número de épocas × Preço unitário de treinamento (Unidade mínima de faturamento: 1 token) Consulte a taxa estimada de treinamento na parte inferior do console de Ajuste Fino de Modelo e clique em Computing Details para visualizar o número total de tokens de treinamento, o número de épocas e o preço unitário de treinamento. |
Antes de ajustar um modelo
-
Embora o ajuste fino de modelos de geração de texto possa alcançar resultados excelentes em cenários de negócios específicos, ele apresenta as seguintes limitações:
Consumo de tempo: Isso inclui a criação de um conjunto de dados CPT em grande escala (pelo menos 50 milhões de tokens), a construção de um conjunto de dados SFT eficaz (mais de 1.000 entradas), a coleta de casos negativos suficientes (mais de 100) para criar um conjunto de dados DPO eficaz para o faturamento de implantação de modelo, além da lentidão nas iterações de otimização do modelo.
Custo elevado: Um modelo ajustado só pode ser utilizado após a implantação, e o faturamento de implantação de modelo é alto.
-
O Alibaba Cloud Model Studio recomenda que você tente primeiro usar Engenharia de Prompt ou Function Calling para personalizar sua aplicação. O ajuste fino de modelo geralmente é o "último recurso" para melhorar o desempenho. Isso ocorre porque:
Em muitas tarefas, um modelo pode ter um desempenho inicial ruim, mas a aplicação das técnicas corretas de prompt melhora os resultados sem exigir o ajuste fino do modelo.
A otimização iterativa de prompts e plugins é mais ágil e econômica do que as iterações de ajuste fino, pois este processo pode exigir nova coleta, limpeza e otimização de dados, além da reunião de casos negativos e realização de pesquisas com clientes.
Mesmo que você decida realizar o ajuste fino posteriormente, o trabalho inicial de engenharia de prompt e otimização de plugins não será desperdiçado. Esse esforço preliminar pode ser totalmente reutilizado na construção do conjunto de dados de ajuste fino.
Primeiros passos
Ajustar um modelo usando o console
Etapas de ajuste fino | Captura de tela do console |
Etapa 1: Na página Model Fine-tuning, clique em Create Training Task. |
|
Etapa 2: Configurar treinamento
Essa combinação oferece tempo de treinamento curto e baixos requisitos de dados. | |
Etapa 3: Configurar dados
|
|
Etapa 4: Configurar parâmetros de salvamento de snapshot de parâmetros do modelo (checkpoint)
Nota Após a conclusão do ajuste fino, exporte um snapshot de parâmetros na plataforma Model Studio. Em seguida, implante o modelo no Model Studio com base nesse snapshot. Os snapshots de parâmetros exportados ficam salvos no armazenamento em cloud e não podem ser acessados ou baixados. |
|
Etapa 5: Clique em "Start Training" e aguarde a conclusão do treinamento do modelo. | |
Etapa 6: Utilize o recurso Model Deployment do Alibaba Cloud Model Studio para implantar o modelo personalizado treinado. Após a implantação, avalie o modelo ajustado. Para mais informações, consulte Implantação de modelo. | |
Processo típico de ajuste fino
Os três métodos de ajuste fino fornecidos pelo Model Studio não são excludentes, mas sim progressivos e complementares.
CPT (opcional) → SFT → DPO (opcional)
-
CPT (pré-treinamento contínuo) - Complementa conhecimento (Modelos gerais possuem conhecimento amplo, porém superficial, o que pode não atender aos requisitos de profundidade e precisão de campos profissionais)
Modelo financeiro:
Aprende termos financeirosModelo médico:
Memoriza patologia de medicamentosModelo jurídico:
Compreende artigos legais e precedentes
-
SFT (ajuste fino supervisionado) - Aprende a executar tarefas
Bot de atendimento:
Aprende procedimentos de atendimento ao clienteAssistente de código:
Aprende paradigmas de programaçãoChamada de ferramentas (Agente):
Aprende a usar MCP
-
DPO (otimização direta de preferência) - Executa tarefas com maior qualidade
Segurança e responsabilidade:
Rejeita sugestões nocivasConcisão e eficácia:
Fornece respostas concisasObjetividade e neutralidade:
Avalia de forma justa e objetiva
Formato de dados de ajuste fino
Conjunto de treinamento SFT
Os dados de treinamento no formato SFT ChatML (Chat Markup Language) oferecem suporte a conversas de múltiplas rodadas e várias configurações de papéis.
Os parâmetrosnameeweightda OpenAI não são suportados. Todas as saídas do assistente serão treinadas.
# A single line of training data (in JSON format) has the following typical structure when expanded:
{"messages": [
{"role": "system", "content": "System input 1"},
{"role": "user", "content": "User input 1"},
{"role": "assistant", "content": "Expected model output 1"},
{"role": "user", "content": "User input 2"},
{"role": "assistant", "content": "Expected model output 2"}
...
]}
Para informações sobre as diferenças entre system, user e assistant, consulte Visão geral. Conjuntos de dados de treinamento de exemplo: SFT-ChatML_format_example.jsonl, SFT-ChatML_format_example.xlsx. Os formatos XLS e XLSX suportam apenas conversas de rodada única.
Todas as linhas de assistant em uma única entrada de dados de treinamento suportam o parâmetro "loss_weight", que define a importância relativa dessa linha durante o treinamento. (Intervalo: 0.0 a 1.0. Um valor maior indica maior importância.)
Este parâmetro está disponível em preview por convite. Para utilizá-lo, entre em contato com seu gerente de conta.
{"role": "assistant", "content": "Expected model output 1", "loss_weight": 1.0},
{"role": "assistant", "content": "Expected model output 2", "loss_weight": 0.5}
Dicas para construção de conjuntos de dados
Requisitos de tamanho do conjunto de dados
Para CPT, o conjunto de dados requer pelo menos 50 milhões de tokens de dados de pré-treinamento de alta qualidade. Para SFT, são necessárias pelo menos 1.000 entradas de dados de ajuste fino de alta qualidade. Para DPO, geralmente são necessárias centenas de entradas de dados de preferência humana. Se os resultados da avaliação do modelo após o ajuste fino não forem satisfatórios, a maneira mais simples de melhorar é coletar mais dados para treinamento.
Caso não tenha dados suficientes, recomendamos criar uma aplicação de agente e usar um índice de base de conhecimento para aprimorar as capacidades do modelo. Em muitos cenários de negócios complexos, também é possível combinar o ajuste fino do modelo com a recuperação de base de conhecimento.
Por exemplo, em um cenário de atendimento ao cliente, use o ajuste fino do modelo para resolver questões relacionadas ao tom do agente de atendimento, estilos de expressão e autoconsciência. O conhecimento profissional relacionado ao cenário pode ser introduzido dinamicamente no contexto do modelo por meio de uma base de conhecimento.
O Alibaba Cloud Model Studio recomenda que você primeiro crie e teste uma aplicação de geração aumentada por recuperação (RAG). Após coletar dados suficientes da aplicação, utilize o ajuste fino para melhorar ainda mais o desempenho do modelo.
Também é possível adotar as seguintes estratégias para expandir seu conjunto de dados:
Utilize um modelo de linguagem grande (LLM) para simular a geração de conteúdo para cenários de negócios específicos, ajudando a gerar mais dados para ajuste fino. (Recomendamos selecionar um modelo maior e de alto desempenho para a geração.)
Adquira mais dados por vários métodos, como coleta em cenários de aplicação, web scraping, redes sociais e fóruns online, conjuntos de dados públicos, parceiros e recursos do setor, além de contribuições de usuários.
Diversidade e equilíbrio de dados
Os requisitos para ajuste fino de modelo variam conforme o cenário. Por exemplo, o profissionalismo é crítico para cenários de negócios específicos, enquanto a versatilidade é mais importante para cenários de perguntas e respostas. Projete casos de uso de dados com base nos módulos de negócios ou cenários de uso pelos quais o modelo é responsável. Portanto, a eficácia do treinamento depende não apenas do volume de dados, mas também do profissionalismo e da diversidade dos dados para o cenário específico.
Por exemplo, em um cenário de conversa inteligente com IA, um conjunto de dados profissional e diversificado deve incluir os seguintes cenários de negócios:
|
Negócio específico |
Cenários/negócios diversos |
|
Atendimento ao cliente de e-commerce |
Envio de promoções, consulta pré-venda, orientação durante a venda, serviço pós-venda, acompanhamento pós-venda, tratamento de reclamações, etc. |
|
Serviços financeiros |
Consulta de empréstimos, consultoria de investimentos e gestão de patrimônio, serviços de cartão de crédito, gestão de contas bancárias, etc. |
|
Saúde online |
Consulta de sintomas, agendamento de consultas, instruções de visita, consulta de informações sobre medicamentos, dicas de saúde, etc. |
|
Secretário de IA |
Informações de TI, informações administrativas, informações de RH, consultas sobre benefícios de funcionários, consultas ao calendário da empresa, etc. |
|
Assistente de viagens |
Planejamento de viagens, guias de entrada e saída, consulta de seguros de viagem, apresentações sobre costumes e cultura do destino, etc. |
|
Consultoria jurídica corporativa |
Revisão de contratos, proteção de propriedade intelectual, verificações de conformidade, perguntas e respostas sobre legislação trabalhista, consultoria para transações internacionais, análise jurídica de casos individuais, etc. |
É importante notar também que a quantidade de dados para cada cenário/negócio deve ser relativamente equilibrada, e a proporção de dados deve corresponder à proporção real do cenário. Isso evita excesso de dados de um único tipo, o que poderia fazer com que o modelo tendesse a aprender essas características, afetando sua capacidade de generalização.
Divisão dos conjuntos de treinamento e validação
Realize o ajuste fino do modelo no console.
Divida automaticamente um conjunto de dados de treinamento completo e amostra aleatoriamente uma pequena quantidade de dados para formar um conjunto de validação.
Escolha carregar um conjunto de dados separado.
O console exibe a perda do conjunto de validação e a precisão de tokens em tempo real durante o treinamento.

Perguntas frequentes
É possível ajustar meu próprio modelo?
O Model Studio não oferece suporte para ajuste fino, upload de modelos próprios ou exportação de modelos baixados.


