Após implantar um service, use o recurso de depuração online no console para verificar se ele funciona corretamente. Essa interface gráfica (GUI) permite enviar solicitações de teste e visualizar as respostas diretamente, sem escrever código.
Como usar a depuração online
-
Acesse a página de depuração online.
Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Na aba Inference Service, localize o service que deseja testar. Na coluna Actions do service, clique em
> Online Debugging.
-
Construa e envie a solicitação. As definições de API, especialmente o caminho da URL e o formato do corpo da solicitação, variam significativamente conforme o modelo. Forneça os parâmetros corretos. Uma solicitação padrão inclui os seguintes elementos:
Método: Geralmente
POSTouGET.Caminho da solicitação: A ferramenta de depuração online preenche automaticamente o endereço base. Adicione um caminho específico de API, se necessário. Um caminho incorreto é a causa mais comum de erros
404 Not Found.Cabeçalhos da solicitação: O token de
Authorizationgeralmente é preenchido automaticamente e não requer modificações.Corpo da solicitação: Formate o corpo de acordo com os requisitos da API. Um corpo malformatado é a principal causa de erros
400 Bad Requestou500 Internal Server Error.
Exemplo
Este exemplo demonstra como testar a API de chat completions de um service de modelo Qwen2.5-7B-Instruct implantado com vLLM. Os parâmetros são os seguintes:
Método: POST
Caminho da solicitação:
http://***********/v1/chat/completions(Adicione/v1/chat/completionsà URL preenchida automaticamente.)-
Corpo da solicitação:
{ "model": "Qwen2.5-7B-Instruct", "messages": [ { "role": "user", "content": "What is the capital of Canada?" } ] }
Uma solicitação bem-sucedida retorna um código de status 200. O corpo da resposta contém um objeto chat.completion, cujo campo content retorna The capital of Canada is Ottawa. Os detalhes de usage mostram 36 prompt_tokens, 8 completion_tokens e 44 total_tokens.
FAQ
-
Como determinar a URL e o corpo da solicitação corretos?
Isso depende do modelo implantado. Para obter mais informações, consulte Construct Requests for Typical Scenarios.
Próximas etapas
Avalie o desempenho: Use o recurso de stress testing do EAS para analisar o desempenho do service.
Invoque o service: Quando o service atender aos requisitos de desempenho, inicie as invocações. Para obter mais informações, consulte service invocation.