Os nós de modelo de linguagem grande (LLM) permitem processar dados de texto não estruturados, como avaliações de usuários, descrições de produtos e logs de atendimento ao cliente, diretamente nos pipelines do DataWorks. Com instruções em linguagem natural, você pode resumir textos, analisar sentimentos, classificar conteúdos e extrair informações sem escrever algoritmos complexos, integrando a IA de forma transparente aos fluxos de trabalho ETL existentes.
Pré-requisitos
Implante um serviço de modelo no DataWorks. Para mais informações, consulte Implantar um modelo.
A escolha dos modelos e das especificações de recursos afeta diretamente o desempenho e a velocidade de resposta do serviço de modelo. Além disso, esse serviço gera taxas de grupo de recursos.
Configuração do nó LLM
Configure um nó LLM com as seguintes definições.
|
Parâmetro |
Descrição |
|
Serviço de modelo |
Serviço de modelo implantado durante os pré-requisitos. |
|
Nome do modelo |
Modelo proveniente do serviço de modelo. Um modelo padrão vem pré-selecionado. |
|
Prompt do sistema |
Define o comportamento do modelo, incluindo sua função, capacidades e regras. Use o formato ${param} para referenciar parâmetros. |
|
Prompt do usuário |
Pergunta ou instrução específica para o modelo. O DataWorks oferece quatro modelos integrados para seleção rápida. Use o formato ${param} para referenciar parâmetros. Por exemplo, um prompt pode ser: Selecione os itens que correspondem a |
Exemplo
O exemplo a seguir demonstra como usar um nó LLM em um pipeline e passar parâmetros entre nós.
Faça login no serviço LLM do DataWorks e crie um serviço de modelo baseado no Qwen3-1.7B. Em Resource Group, selecione o grupo de recursos vinculado ao workspace atual.
-
Acesse o Data Studio e crie um pipeline contendo os seguintes nós.

-
Configure o nó de atribuição. Na barra de ferramentas no canto inferior direito, defina a linguagem como Shell e insira o código a seguir.
Para mais informações sobre este nó, consulte Nó de atribuição .
echo 'DataWorks'; -
Configure o nó de modelo de linguagem grande.
Selecione o serviço de modelo e o nome do modelo configurados anteriormente.
-
Defina o prompt do usuário com o seguinte conteúdo:
Write an introduction about ${title} with a word limit of ${length}. No painel de configuração à direita, selecione e altere o grupo de recursos para aquele selecionado durante a criação do serviço de modelo grande.
-
No painel de configuração à direita, em , adicione o parâmetro title com o valor output of the upstream node e o parâmetro length com um valor fixo de 300.
Para vincular a saída de um nó upstream, clique em ícone
à direita do campo de entrada de valor.
-
Configure o nó MaxCompute SQL para recuperar o resultado do modelo de linguagem grande.
ImportanteVincule o nó MaxCompute SQL a um recurso do MaxCompute. Caso não possua um recurso, utilize um nó Shell para exibir a saída.
-
Insira o seguinte código:
select '${content}'; No painel de configuração à direita, selecione e altere o grupo de recursos para aquele selecionado durante a criação do serviço de modelo grande.
-
À direita, em , adicione o parâmetro content e defina seu valor como output of the upstream node.
Para vincular a saída de um nó upstream, clique em ícone
à direita do campo de entrada de valor.Após a vinculação, o valor do parâmetro será exibido como The outputs parameter of the llmtest node is bound.
-
Retorne ao pipeline, clique em Execute na parte superior e, na janela pop-up, insira os parâmetros de execução.
-
Após uma execução bem-sucedida, o nó MaxCompute SQL retornará um resultado do modelo de linguagem grande semelhante ao seguinte:
DataWorks is an enterprise data development and management platform from Alibaba Cloud. It supports data collection, cleansing, integration, scheduling, and visualization for large-scale data processing. It provides a visual interface, connects to various data sources, and features powerful task scheduling and data quality monitoring. DataWorks handles both real-time and batch processing, helping enterprises manage data as assets and improve efficiency. Its unified process helps build reliable data pipelines for data governance and intelligent analysis.