Avalie o desempenho do fluxo de aplicação antes da implantação em produção. O LangStudio pontua as aplicações em várias dimensões usando modelos de avaliação predefinidos ou personalizados.
Visão geral
Para avaliar um fluxo de aplicação, configure um conjunto de dados de avaliação, mapeie os campos de entrada e selecione um modelo de avaliação. O sistema processa em lote cada linha do conjunto de dados na sua aplicação, pontua cada saída com base em campos auxiliares e agrega os resultados.

Antes de começar
Crie e depure um fluxo de aplicação. Desenvolver um fluxo de aplicação.
-
Prepare um conjunto de dados de avaliação no formato JSONL e faça upload dele para o OSS. Exemplo:
{"history":[],"query": "Describe the perilous majesty of Mount Hua", "reference": "Mount Hua stands alone, soaring to the clouds; \nSheer cliffs cut the sky, with rugged, handsome crags. \nGreen pines and bamboo vie for beauty on the cliffs; \nMonkeys cry and eagles fly, lit by frosty swords of light. \n\nPerilous peaks like scissors, jagged swords pointing to the sky; \nNarrow paths on steep slopes, where vines are the only way. \nWind and mist intertwine, as clouds emerge from caves; \nA deep fairyland, with a heavenly ladder hard to climb. \n\nJagged ridges cross, like a surging dragon's spine; \nDangerous paths lead onward, twisting toward the heavens. \nFrom lonely pine tops, eagles strike the vast sky; \nAt the summit of Mount Hua, a majestic and heroic sight.", "contexts": ["Mount Hua is one of the Five Great Mountains of China.", "Mount Hua is famous for its precipitous cliffs."]} {"history":[],"query": "Can you list 5 rare metals? Please rank them by global demand.", "reference": "Rare metals are metallic elements that are scarce in the Earth's crust, unevenly distributed, or difficult to mine. They play a crucial role in high-tech fields and emerging industries. The ranking of global demand can change with time and technological progress, but the following are some rare metals that are typically in high demand. This list is not necessarily ranked by absolute demand, as that can vary at different times.\n\n1. **Cobalt (Co)** - Cobalt is a key component of lithium-ion batteries, especially in electric vehicles and portable electronics. It is also used to manufacture heat-resistant alloys, hard alloys, and catalysts.\n\n2. **Neodymium (Nd)** - Neodymium is a rare-earth metal mainly used to produce strong magnets, such as high-performance permanent magnets. These magnets are widely used in computer hard drives, wind turbines, and the drive motors of electric vehicles.\n\n3. **Lithium (Li)** - Lithium is primarily used to manufacture lithium batteries. As the demand for electric vehicles and portable electronic devices increases, the demand for lithium is rising rapidly.\n\n4. **Silver (Ag)** - Although silver is not as rare as the metals listed above, its industrial demand is huge. It is mainly used in electronics, solar panels, jewelry, and currency manufacturing.\n\n5. **Ruthenium (Ru)** - Ruthenium is a rare precious metal widely used for data storage in hard disk drives and large-capacity servers. It is also used in catalysts and electrochemical cells.\n\nThe demand for these metals is influenced by many factors, such as the global economy, technological development, and policy support. Moreover, as time passes and markets change, other rare metals such as tantalum, indium, rhenium, and other rare-earth metals may also appear on the list of most in-demand rare metals.", "contexts": ["Rare metals are metals with low abundance in the Earth's crust that are complex to mine and extract.", "Lithium (Li): Used in battery manufacturing.", "Cobalt (Co): Used in high-performance alloys and battery manufacturing."]}Arquivo de exemplo: langstudio_eval_demo.jsonl
-
Crie as conexões de LLM necessárias para a avaliação. Configuração de conexão.
Nota: Alguns modelos de avaliação exigem um modelo juiz. Configure as conexões de LLM correspondentes antes de usar esses modelos.
Faturamento
A avaliação de fluxo de aplicação utiliza o OSS para armazenamento de conjuntos de dados e o PAI-DLC para execução de tarefas offline. Ambos os recursos são cobrados. Faturamento do OSS. Faturamento do Deep Learning Containers (DLC).
Crie uma tarefa de avaliação
Após depurar a aplicação, clique em Evaluation no canto superior direito para criar uma tarefa de avaliação.

Principais parâmetros:
|
Parâmetro |
Descrição |
|
Conjunto de dados de avaliação |
|
|
Arquivo do OSS |
Selecione um arquivo JSONL no OSS como conjunto de dados de avaliação. O conjunto deve conter um campo |
|
Mapeamento de entrada do fluxo de aplicação |
|
|
question/chat_history |
Mapeie os campos de entrada da aplicação para as colunas do conjunto de dados. Nota: A tarefa de avaliação executa a inferência da aplicação antes de pontuar os resultados. Selecione os campos de entrada necessários.
|
|
Configuração de avaliação |
|
|
Avaliação com modelo predefinido |
Vários modelos predefinidos estão disponíveis. A seleção de múltiplos modelos agrega os resultados na página de detalhes da tarefa. O exemplo a seguir usa Answer Correctness Evaluation:
Principais parâmetros:
|
|
Avaliação personalizada |
Crie uma avaliação personalizada com um modelo de prompt definido pelo usuário.
|
|
Configuração de recursos: Usada para agendar a tarefa de avaliação. Selecione CPU resources conforme a complexidade da tarefa. |
|
Visualize resultados da avaliação
Após enviar uma tarefa de avaliação, o LangStudio redireciona para a página Overview da tarefa. Cada execução possui dois estágios: Batch Run processa cada linha do conjunto de dados na aplicação, e Metric Evaluation pontua cada saída com base em campos auxiliares. Após a conclusão, visualize o rastreamento, as métricas e os detalhes de saída de cada subtarefa.

A página Metrics exibe todos os resultados das métricas de avaliação. Os nomes das métricas são definidos em Anexo: Modelos de avaliação predefinidos.

Anexo: Modelos de avaliação predefinidos
O LangStudio fornece os seguintes modelos de avaliação integrados:
|
Nome do modelo |
Descrição |
Tipo de serviço de modelo |
Campos de entrada |
|
Exact Match Evaluation |
Compara a saída do Agent com a referência buscando correspondências exatas. Pontuação: 0 (sem correspondência) a 1 (correspondência perfeita). |
Nenhum |
|
|
Answer Relevancy Evaluation |
Pontua a relevância da saída da aplicação em relação à entrada usando um modelo juiz LLM. Pontuação: 1–5 (maior = mais relevante). |
LLM |
|
|
Answer Correctness Evaluation |
Avalia a precisão factual, a cobertura de informações e a correspondência de formato em relação a uma referência. Pontuação: 1–5 (maior = maior correspondência). |
LLM |
|
|
Instruction Following Evaluation |
Avalia a adesão às instruções quanto ao conteúdo, formato e restrições. Pontuação: 1–5 (maior = melhor conformidade). |
LLM |
|
|
Answer Faithfulness Evaluation |
Detecta informações fabricadas sem suporte no contexto ou que o contradizem. Pontuação: 1–5 (maior = mais fiel). |
LLM |
|
|
Safety Evaluation |
Detecta conteúdo nocivo, ofensivo ou inapropriado. Pontuação: 1–5 (maior = mais seguro). |
LLM |
|
|
Trajectory Evaluation |
Avalia holisticamente a trajetória de execução do Agent. Pontuação: 1–5 (maior = melhor desempenho). |
LLM |
|


