Parâmetros de entrada e saída para chamar o Qwen-MT por meio da interface compatível com OpenAI ou da API do DashScope.
Referências: Tradução automática (Qwen-MT)
Compatível com OpenAI
Região de Pequim
base_url para SDK: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions
Região de Singapura
base_url para SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions
Região da Virgínia
base_url para SDK: https://dashscope-us.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://dashscope-us.aliyuncs.com/compatible-mode/v1/chat/completions
Região de Singapura
base_url para SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions
Região da Virgínia
base_url para SDK: https://dashscope-us.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://dashscope-us.aliyuncs.com/compatible-mode/v1/chat/completions
Região de Pequim
base_url para SDK: https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
Endpoint HTTP: POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions
O Model Studio lançou domínios específicos por workspace para as regiões China (Pequim), Singapura e China (Hong Kong). Os novos domínios dedicados oferecem desempenho superior e maior estabilidade para solicitações de inferência. Recomendamos a migração para os novos domínios:
China (Pequim): de
https://dashscope.aliyuncs.comparahttps://{WorkspaceId}.cn-beijing.maas.aliyuncs.comSingapura: de
https://dashscope-intl.aliyuncs.comparahttps://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.comChina (Hong Kong): de
https://cn-hongkong.dashscope.aliyuncs.comparahttps://{WorkspaceId}.cn-hongkong.maas.aliyuncs.com
{WorkspaceId} é o ID do seu workspace, disponível na página Workspace Details no console do Model Studio. O domínio existente permanece totalmente funcional.
Primeiro, crie uma chave de API e configure-a como variável de ambiente . Se você usar o SDK da OpenAI, instale o SDK .
Corpo da solicitação |
Uso básicoPython
Node.js
curlEndpoints and API keys differ by region. The following is the Singapore endpoint.
Intervenção de termosPython
Node.js
curlEndpoints and API keys differ by region. The following is the Singapore endpoint.
Memória de traduçãoPython
Node.js
curlEndpoints and API keys differ by region. The following is the Singapore endpoint.
Prompt de domínioPython
Node.js
curlEndpoints and API keys differ by region. The following is the Singapore endpoint.
|
|
model Nome do modelo. Suportados: qwen-mt-plus, qwen-mt-flash, qwen-mt-lite, qwen-mt-turbo. |
|
|
messages Array de mensagens que fornecem contexto ao modelo. Apenas mensagens de usuário são suportadas. |
|
|
stream Ativa o modo de saída em streaming. Valores válidos:
Nota
Os modelos qwen-mt-flash e qwen-mt-lite retornam dados incrementalmente (cada parte contém apenas conteúdo novo). Já os modelos qwen-mt-plus e qwen-mt-turbo retornam dados não incrementalmente (cada parte contém toda a sequência até o momento). Esse comportamento não pode ser alterado. Exemplo: I I didn I didn't I didn't laugh I didn't laugh after ... |
|
|
stream_options Itens de configuração para saída em streaming. Este parâmetro só tem efeito quando |
|
|
max_tokens Número máximo de tokens a serem gerados. Se a saída exceder esse valor, a resposta será truncada. Os valores padrão e máximo correspondem ao comprimento máximo de saída do modelo. Para mais informações, consulte Seleção de modelo. |
|
|
seed Semente de número aleatório para resultados reproduzíveis. Usar a mesma Intervalo de valores: |
|
|
temperature Temperatura de amostragem que controla a diversidade do texto gerado. Valores mais altos produzem texto mais diversificado. Valores mais baixos resultam em texto mais determinístico. Intervalo de valores: [0, 2) Tanto |
|
|
top_p Limiar de probabilidade para amostragem de núcleo que controla a diversidade do texto gerado. Valores mais altos produzem texto mais diversificado. Valores mais baixos resultam em texto mais determinístico. Intervalo de valores: (0, 1,0] Tanto |
|
|
top_k Tamanho do conjunto de candidatos para amostragem durante a geração. Por exemplo, definir isso como 50 significa que apenas os 50 principais tokens por pontuação formarão o pool de amostragem. Valores maiores aumentam a aleatoriedade; valores menores aumentam o determinismo. Se o valor for None ou maior que 100, top_k é desativado e apenas top_p tem efeito. O valor deve ser maior ou igual a 0. Parâmetro não padrão da OpenAI. SDK Python: coloque no objeto extra_body |
|
|
repetition_penalty Penalidade para repetição em sequências consecutivas. Valores mais altos reduzem a repetição. Um valor de 1,0 não aplica penalidade. Deve ser maior que 0, sem limite superior estrito. Parâmetro não padrão da OpenAI. SDK Python: coloque no objeto extra_body |
|
|
translation_options Parâmetros de tradução. Parâmetro não padrão da OpenAI. SDK Python: coloque no objeto extra_body |
Objeto de resposta de chat (saída não streaming) |
|
|
id ID exclusivo da solicitação. |
|
|
choices Array de conteúdo gerado pelo modelo. |
|
|
created Timestamp UNIX de criação da solicitação. |
|
|
model Modelo usado na solicitação. |
|
|
object Sempre é |
|
|
service_tier Atualmente fixo como |
|
|
system_fingerprint Atualmente fixo como |
|
|
usage Consumo de tokens da solicitação. |
Objeto de parte de resposta de chat (saída em streaming) |
Saída incremental
Saída não incremental
|
|
id ID exclusivo da chamada. Cada objeto de parte possui o mesmo ID. |
|
|
choices Um array de conteúdo gerado pelo modelo. Se |
|
|
created Timestamp UNIX de criação da solicitação. Cada parte possui o mesmo timestamp. |
|
|
model Modelo usado na solicitação. |
|
|
object Sempre é |
|
|
service_tier Atualmente fixo como |
|
|
system_fingerprint Atualmente fixo como |
|
|
usage Tokens consumidos pela solicitação. Retornado na última parte apenas quando |
DashScope
Beijing
Endpoint HTTP: POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Não é necessário configurar base_url para chamadas de SDK. O valor padrão é https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1.
Singapore
Endpoint HTTP: POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Defina base_url como:
Python code
dashscope.base_http_api_url = 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1'
Java code
-
Método 1:
import com.alibaba.dashscope.protocol.Protocol; Generation gen = new Generation(Protocol.HTTP.getValue(), "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1"); -
Método 2:
import com.alibaba.dashscope.utils.Constants; Constants.baseHttpApiUrl="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1";
Virginia
Endpoint HTTP: POST https://dashscope-us.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Defina base_url como:
Python code
dashscope.base_http_api_url = 'https://dashscope-us.aliyuncs.com/api/v1'
Java code
-
Método 1:
import com.alibaba.dashscope.protocol.Protocol; Generation gen = new Generation(Protocol.HTTP.getValue(), "https://dashscope-us.aliyuncs.com/api/v1"); -
Método 2:
import com.alibaba.dashscope.utils.Constants; Constants.baseHttpApiUrl="https://dashscope-us.aliyuncs.com/api/v1";
Singapore
Endpoint HTTP: POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Defina base_url como:
Python code
dashscope.base_http_api_url = 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1'
Java code
-
Método 1:
import com.alibaba.dashscope.protocol.Protocol; Generation gen = new Generation(Protocol.HTTP.getValue(), "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1"); -
Método 2:
import com.alibaba.dashscope.utils.Constants; Constants.baseHttpApiUrl="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1";
Virginia
Endpoint HTTP: POST https://dashscope-us.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Defina base_url como:
Python code
dashscope.base_http_api_url = 'https://dashscope-us.aliyuncs.com/api/v1'
Java code
-
Método 1:
import com.alibaba.dashscope.protocol.Protocol; Generation gen = new Generation(Protocol.HTTP.getValue(), "https://dashscope-us.aliyuncs.com/api/v1"); -
Método 2:
import com.alibaba.dashscope.utils.Constants; Constants.baseHttpApiUrl="https://dashscope-us.aliyuncs.com/api/v1";
Beijing
Endpoint HTTP: POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/text-generation/generation
Não é necessário configurar base_url para chamadas via SDK. O valor padrão é https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1.
É obrigatório criar uma chave de API e exportar a chave de API como variável de ambiente . Se utilizar o DashScope SDK, instale o DashScope SDK .
Corpo da requisição |
Uso básicoPython
Java
curlOs endpoints e as chaves de API diferem por região. A seguir, apresentamos o endpoint de Singapura.
Intervenção de termosPython
Java
curlOs endpoints e as chaves de API diferem por região. A seguir, apresentamos o endpoint de Singapura.
Memória de traduçãoPython
Java
curlOs endpoints e as chaves de API diferem por região. A seguir, apresentamos o endpoint de Singapura.
Prompting de domínioPython
Java
curlOs endpoints e as chaves de API diferem por região. A seguir, apresentamos o endpoint de Singapura.
|
|
model Nome do modelo. Suportados: qwen-mt-plus, qwen-mt-flash, qwen-mt-lite, qwen-mt-turbo. |
|
|
messages Array de mensagens que fornecem contexto ao modelo. Apenas mensagens de usuário são suportadas. |
|
|
max_tokens Número máximo de tokens a gerar. Se a saída exceder esse valor, a resposta será truncada. Os valores padrão e máximo correspondem ao comprimento máximo de saída do modelo. Para mais informações, consulte Seleção de modelo. No SDK Java, o parâmetro é maxTokens. Para chamadas HTTP, coloque max_tokens no objeto parameters. |
|
|
seed Semente de número aleatório para resultados reproduzíveis. Usar o mesmo Intervalo de valores: Ao fazer uma chamada HTTP, coloque seed no objeto parameters. |
|
|
temperature Temperatura de amostragem que controla a diversidade do texto gerado. Valores mais altos produzem texto mais diversificado. Valores mais baixos resultam em texto mais determinístico. Intervalo de valores: [0, 2) Tanto Ao fazer uma chamada HTTP, coloque temperature no objeto parameters. |
|
|
top_p Limiar de probabilidade para amostragem de núcleo que controla a diversidade do texto gerado. Valores mais altos produzem texto mais diversificado. Valores mais baixos resultam em texto mais determinístico. Intervalo de valores: (0, 1,0] Tanto No SDK Java, o parâmetro é topPparameters object. |
|
|
repetition_penalty Penalidade para repetição em sequências consecutivas. Valores mais altos reduzem a repetição. Um valor de 1,0 não aplica penalidade. Deve ser maior que 0, sem limite superior estrito. No SDK Java, o parâmetro é repetitionPenalty. Para chamadas HTTP, adicione repetition_penalty ao objeto parameters. |
|
|
top_k Tamanho do conjunto de candidatos para amostragem durante a geração. Por exemplo, definir isso como 50 significa que apenas os 50 principais tokens por pontuação formam o pool de amostragem. Valores maiores aumentam a aleatoriedade; valores menores aumentam o determinismo. Se o valor for None ou maior que 100, top_k é desativado e apenas top_p tem efeito. O valor deve ser maior ou igual a 0. No SDK Java, o parâmetro é topK. Ao fazer uma chamada HTTP, defina top_k no objeto parameters. |
|
|
stream Ativa o modo de saída em streaming. Valores válidos:
Nota
qwen-mt-flash e qwen-mt-lite retornam dados incrementalmente (cada parte contém apenas conteúdo novo). qwen-mt-plus e qwen-mt-turbo retornam dados de forma não incremental (cada parte contém toda a sequência até o momento). Esse comportamento não pode ser alterado. Exemplo: I I didn I didn't I didn't laugh I didn't laugh after ... Esse parâmetro é suportado apenas pelo SDK Python. Para implementar saída em streaming com o SDK Java, chame a interface |
|
|
translation_options Parâmetros de tradução. No SDK Java, o parâmetro é
|
Objeto de resposta de chat (igual para saída em streaming e não streaming) |
|
|
status_code Código de status da requisição. 200 indica sucesso; outros valores indicam falha. O SDK Java não retorna esse parâmetro. Se a chamada falhar, uma exceção será lançada. A mensagem da exceção contém o conteúdo de status_code e message. |
|
|
request_id ID único da requisição. No SDK Java, o parâmetro retornado é requestId. |
|
|
code Código de erro. Vazio em caso de sucesso. Apenas o SDK Python retorna esse parâmetro. |
|
|
output Resultado da chamada. |
|
|
usage Uso de tokens para a requisição. |
Códigos de erro
Se a chamada falhar, consulte Códigos de erro para resolver o problema.