Todos os produtos
Search
Central de documentação

Platform For AI:Application evaluation

Última atualização: Jun 27, 2026

Avalie o desempenho do fluxo de aplicação antes da implantação em produção. O LangStudio pontua as aplicações em várias dimensões usando modelos de avaliação predefinidos ou personalizados.

Visão geral

Para avaliar um fluxo de aplicação, configure um conjunto de dados de avaliação, mapeie os campos de entrada e selecione um modelo de avaliação. O sistema processa em lote cada linha do conjunto de dados na sua aplicação, pontua cada saída com base em campos auxiliares e agrega os resultados.

image

Antes de começar

  • Crie e depure um fluxo de aplicação. Desenvolver um fluxo de aplicação.

  • Prepare um conjunto de dados de avaliação no formato JSONL e faça upload dele para o OSS. Exemplo:

    {"history":[],"query": "Describe the perilous majesty of Mount Hua", "reference": "Mount Hua stands alone, soaring to the clouds; \nSheer cliffs cut the sky, with rugged, handsome crags. \nGreen pines and bamboo vie for beauty on the cliffs; \nMonkeys cry and eagles fly, lit by frosty swords of light. \n\nPerilous peaks like scissors, jagged swords pointing to the sky; \nNarrow paths on steep slopes, where vines are the only way. \nWind and mist intertwine, as clouds emerge from caves; \nA deep fairyland, with a heavenly ladder hard to climb. \n\nJagged ridges cross, like a surging dragon's spine; \nDangerous paths lead onward, twisting toward the heavens. \nFrom lonely pine tops, eagles strike the vast sky; \nAt the summit of Mount Hua, a majestic and heroic sight.", "contexts": ["Mount Hua is one of the Five Great Mountains of China.", "Mount Hua is famous for its precipitous cliffs."]}
    {"history":[],"query": "Can you list 5 rare metals? Please rank them by global demand.", "reference": "Rare metals are metallic elements that are scarce in the Earth's crust, unevenly distributed, or difficult to mine. They play a crucial role in high-tech fields and emerging industries. The ranking of global demand can change with time and technological progress, but the following are some rare metals that are typically in high demand. This list is not necessarily ranked by absolute demand, as that can vary at different times.\n\n1. **Cobalt (Co)** - Cobalt is a key component of lithium-ion batteries, especially in electric vehicles and portable electronics. It is also used to manufacture heat-resistant alloys, hard alloys, and catalysts.\n\n2. **Neodymium (Nd)** - Neodymium is a rare-earth metal mainly used to produce strong magnets, such as high-performance permanent magnets. These magnets are widely used in computer hard drives, wind turbines, and the drive motors of electric vehicles.\n\n3. **Lithium (Li)** - Lithium is primarily used to manufacture lithium batteries. As the demand for electric vehicles and portable electronic devices increases, the demand for lithium is rising rapidly.\n\n4. **Silver (Ag)** - Although silver is not as rare as the metals listed above, its industrial demand is huge. It is mainly used in electronics, solar panels, jewelry, and currency manufacturing.\n\n5. **Ruthenium (Ru)** - Ruthenium is a rare precious metal widely used for data storage in hard disk drives and large-capacity servers. It is also used in catalysts and electrochemical cells.\n\nThe demand for these metals is influenced by many factors, such as the global economy, technological development, and policy support. Moreover, as time passes and markets change, other rare metals such as tantalum, indium, rhenium, and other rare-earth metals may also appear on the list of most in-demand rare metals.", "contexts": ["Rare metals are metals with low abundance in the Earth's crust that are complex to mine and extract.", "Lithium (Li): Used in battery manufacturing.", "Cobalt (Co): Used in high-performance alloys and battery manufacturing."]}

    Arquivo de exemplo: langstudio_eval_demo.jsonl

  • Crie as conexões de LLM necessárias para a avaliação. Configuração de conexão.

    Nota: Alguns modelos de avaliação exigem um modelo juiz. Configure as conexões de LLM correspondentes antes de usar esses modelos.

Faturamento

A avaliação de fluxo de aplicação utiliza o OSS para armazenamento de conjuntos de dados e o PAI-DLC para execução de tarefas offline. Ambos os recursos são cobrados. Faturamento do OSS. Faturamento do Deep Learning Containers (DLC).

Crie uma tarefa de avaliação

Após depurar a aplicação, clique em Evaluation no canto superior direito para criar uma tarefa de avaliação.

image

Principais parâmetros:

Parâmetro

Descrição

Conjunto de dados de avaliação

Arquivo do OSS

Selecione um arquivo JSONL no OSS como conjunto de dados de avaliação. O conjunto deve conter um campo question como entrada da aplicação, além dos campos exigidos pelo modelo de avaliação escolhido. Anexo: Modelos de avaliação predefinidos.

Mapeamento de entrada do fluxo de aplicação

question/chat_history

Mapeie os campos de entrada da aplicação para as colunas do conjunto de dados.

Nota: A tarefa de avaliação executa a inferência da aplicação antes de pontuar os resultados. Selecione os campos de entrada necessários.

  • No modo workflow, o nó inicial define os campos de entrada. Geralmente, esses campos são question e chat_history.

  • No modo código, o único campo de entrada é question.

Configuração de avaliação

Avaliação com modelo predefinido

Vários modelos predefinidos estão disponíveis. A seleção de múltiplos modelos agrega os resultados na página de detalhes da tarefa. O exemplo a seguir usa Answer Correctness Evaluation:

image

Principais parâmetros:

  • model_configuration: Modelo juiz LLM que pontua a correspondência entre question e answer da aplicação. Selecione um modelo robusto, como qwen3-max.

  • reference: Coluna de referência do conjunto de dados de avaliação. O modelo Answer Correctness Evaluation usa question, answer e reference para gerar uma pontuação de precisão. O LangStudio captura a pergunta e a resposta automaticamente; especifique apenas a coluna de referência. Nota: A maioria dos modelos exige apenas um modelo juiz; o campo de referência é opcional.

Anexo: Modelos de avaliação predefinidos.

Avaliação personalizada

Crie uma avaliação personalizada com um modelo de prompt definido pelo usuário.

image

image

  • É possível criar várias avaliações personalizadas. Cada uma deve ter um nome exclusivo.

  • Configure o modelo de avaliação com judge_template. Exemplos fornecidos. Regras:

    • Não modifique a descrição do formato de saída no prompt.

    • Três placeholders integrados: {query} representa a consulta, {messages} representa o processo de execução do Agent e {response} representa a resposta do Agent.

    • Use {data.***} para referenciar um campo do conjunto de dados. Por exemplo, {data.judge} referencia o campo judge. Consulte o exemplo Dynamic Rule Evaluation.

    • Os caracteres {} são especiais e representam variáveis. Para incluí-los literalmente em um prompt, use {{}}.

Configuração de recursos: Usada para agendar a tarefa de avaliação. Selecione CPU resources conforme a complexidade da tarefa.

Visualize resultados da avaliação

Após enviar uma tarefa de avaliação, o LangStudio redireciona para a página Overview da tarefa. Cada execução possui dois estágios: Batch Run processa cada linha do conjunto de dados na aplicação, e Metric Evaluation pontua cada saída com base em campos auxiliares. Após a conclusão, visualize o rastreamento, as métricas e os detalhes de saída de cada subtarefa.

image

A página Metrics exibe todos os resultados das métricas de avaliação. Os nomes das métricas são definidos em Anexo: Modelos de avaliação predefinidos.

image

Anexo: Modelos de avaliação predefinidos

O LangStudio fornece os seguintes modelos de avaliação integrados:

Nome do modelo

Descrição

Tipo de serviço de modelo

Campos de entrada

Exact Match Evaluation

Compara a saída do Agent com a referência buscando correspondências exatas. Pontuação: 0 (sem correspondência) a 1 (correspondência perfeita).

Nenhum

  • reference: A referência. Tipo de dados: String.

Answer Relevancy Evaluation

Pontua a relevância da saída da aplicação em relação à entrada usando um modelo juiz LLM. Pontuação: 1–5 (maior = mais relevante).

LLM

  • model_configuration: O modelo juiz.

Answer Correctness Evaluation

Avalia a precisão factual, a cobertura de informações e a correspondência de formato em relação a uma referência. Pontuação: 1–5 (maior = maior correspondência).

LLM

  • model_configuration: O modelo juiz.

  • reference (Opcional): A referência. Tipo de dados: String.

Instruction Following Evaluation

Avalia a adesão às instruções quanto ao conteúdo, formato e restrições. Pontuação: 1–5 (maior = melhor conformidade).

LLM

  • model_configuration: O modelo juiz.

Answer Faithfulness Evaluation

Detecta informações fabricadas sem suporte no contexto ou que o contradizem. Pontuação: 1–5 (maior = mais fiel).

LLM

  • model_configuration: O modelo juiz.

  • contexts: Os contextos. Tipo de dados: List[String].

Safety Evaluation

Detecta conteúdo nocivo, ofensivo ou inapropriado. Pontuação: 1–5 (maior = mais seguro).

LLM

  • model_configuration: O modelo juiz.

Trajectory Evaluation

Avalia holisticamente a trajetória de execução do Agent. Pontuação: 1–5 (maior = melhor desempenho).

LLM

  • model_configuration: O modelo juiz.