Um modelo de rerank reclassifica os documentos retornados na recuperação inicial e posiciona os resultados mais relevantes no topo.
Visão geral dos modelos
O modelo gte-rerank será descontinuado em 30 de maio de 2026. Migre para o qwen3-rerank.
Singapore
Model | Max documents | Max input tokens per item | Max input tokens per request | Supported languages | Scenarios |
qwen3-rerank | 500 | 4.000 | 120.000 | Mais de 100 idiomas principais, como chinês, inglês, espanhol, francês, português, indonésio, japonês, coreano, alemão e russo |
|
Beijing
Model | Max documents | Max input tokens per item | Max input tokens per request | Supported languages | Scenarios |
qwen3-vl-rerank | Texto: 100 Imagem: 40 Vídeo: 4 | 8.000 | 120.000 | 33 idiomas principais, incluindo chinês, inglês, japonês, coreano, francês e alemão |
|
gte-rerank-v2 | 500 | 4.000 | 30.000 | Mais de 50 idiomas, incluindo chinês, inglês, japonês, coreano, tailandês, espanhol, francês, português, alemão, indonésio e árabe |
|
Máximo de tokens de entrada por item: Limite de tokens por consulta ou documento. Exceder esse valor causa truncamento e pode reduzir a precisão da classificação.
Máximo de documentos: Quantidade máxima de documentos por requisição. No modelo qwen3-vl-rerank, o limite varia conforme o tipo de documento (texto, imagem, vídeo ou misto).
Máximo de tokens de entrada por requisição: Calculado como
Query Tokens × Number of documents + Total document tokens. Não ultrapasse o limite por requisição.
Limitações de entrada
|
Model |
Image |
Video |
|
qwen3-vl-rerank |
JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS e SGI (URL ou Base64) |
MP4, AVI e MOV (apenas URL) |
Pré-requisitos
Obtenha uma chave de API e defina a chave de API como variável de ambiente. Para usar o SDK, instale o DashScope SDK.
HTTP
Cada modelo usa um endpoint diferente:
qwen3-rerank:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-api/v1/reranksqwen3-vl-rerank / gte-rerank-v2:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/rerank/text-rerank/text-rerank
Substitua {WorkspaceId} pelo seu ID do workspace real.
As duas APIs diferem na estrutura do corpo da requisição e no formato da resposta. Consulte os exemplos de requisição e resposta de cada modelo.
Request | qwen3-rerankReplace qwen3-vl-rerankText query Image query gte-rerank-v2 |
Request headers | |
Content-Type Tipo de conteúdo da requisição. Use | |
Authorization Autentica a requisição com uma chave de API do Model Studio. Exemplo: Bearer sk-xxxx. | |
Request body | |
model Nome do modelo. Valores aceitos: qwen3-rerank, gte-rerank-v2, qwen3-vl-rerank. | |
input Conteúdo de entrada. No | |
parameters Parâmetros opcionais. No |
Response | Successful responseqwen3-rerankqwen3-vl-rerank / gte-rerank-v2Failed responseSe a requisição falhar, |
request_id Identificador exclusivo da requisição para rastreamento e solução de problemas. | |
output Saída da tarefa. No | |
usage Estatísticas de uso de tokens. | |
code Código de erro. Retornado apenas em requisições com falha. Consulte Error codes. | |
message Mensagem de erro detalhada. Retornada apenas em requisições com falha. Consulte Error codes. |
Uso do SDK
Exemplo
Chame a API do modelo de rerank.
Os nomes dos parâmetros no SDK correspondem aos da API HTTP, mas a estrutura difere. O HTTP usa objetos aninhadosinputeparameters; já o SDK adota uma estrutura plana.
import dashscope
# China (Beijing) region. Replace {WorkspaceId} with your actual workspace ID. The configuration varies by region.
dashscope.base_http_api_url = "https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1"
def text_rerank():
resp = dashscope.TextReRank.call(
model="gte-rerank-v2",
query="What is a rerank model?",
documents=[
"Rerank models are widely used in search engines and recommendation systems. They sort candidate documents based on text relevance.",
"Quantum computing is a cutting-edge field of computer science.",
"The development of pre-trained language models has brought new advancements to rerank models."
],
top_n=2,
return_documents=True
)
print(resp)
if __name__ == '__main__':
text_rerank()
Use o modelo qwen3-vl-rerank para rerank multimodal com consulta por imagem.
import dashscope
from http import HTTPStatus
import json
# China (Beijing) region. Replace {WorkspaceId} with your actual workspace ID.
dashscope.base_http_api_url = "https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1"
def vl_rerank():
resp = dashscope.TextReRank.call(
model="qwen3-vl-rerank",
query={"image": "https://img.alicdn.com/imgextra/i3/O1CN01rdstgY1uiZWt8gqSL_!!6000000006071-0-tps-1970-356.jpg"},
documents=[
{"text": "Rerank models are widely used in search engines and recommendation systems. They sort candidate documents based on text relevance."},
{"image": "https://img.alicdn.com/imgextra/i3/O1CN01rdstgY1uiZWt8gqSL_!!6000000006071-0-tps-1970-356.jpg"},
{"video": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"}
],
top_n=2,
return_documents=True
)
if resp.status_code == HTTPStatus.OK:
print(json.dumps(resp, default=str, ensure_ascii=False, indent=4))
else:
print(resp)
if __name__ == '__main__':
vl_rerank()
Saída de exemplo
O SDK encapsula a resposta HTTP. Em requisições bem-sucedidas, code e message são sempre strings vazias.
{
"status_code": 200,
"request_id": "4b0805c0-6b36-490d-8bc1-4365f4c89905",
"code": "",
"message": "",
"output": {
"results": [
{
"index": 0,
"relevance_score": 0.9334521178273196,
"document": {
"text": "Rerank models are widely used in search engines and recommendation systems. They sort candidate documents based on text relevance."
}
},
{
"index": 2,
"relevance_score": 0.34100082626411193,
"document": {
"text": "The development of pre-trained language models has brought new advancements to rerank models."
}
}
]
},
"usage": {
"total_tokens": 79
}
}
Códigos de erro
Se a chamada do modelo falhar e retornar uma mensagem de erro, consulte Códigos de erro para resolver o problema.