Todos os produtos
Search
Central de documentação

:Melhores práticas para personalizar algoritmos de recomendação no PAI-Rec

Última atualização: Jul 03, 2026

Este tutorial orienta você na configuração de uma solução de recomendação personalizada no PAI-Rec com um conjunto de dados público. Ao final, você terá um pipeline de recomendação ponta a ponta funcional, abrangendo engenharia de features, recall e classificação refinada, com o fluxo de trabalho implantado no DataWorks.

Pré-requisitos

Antes de começar, verifique se você:

Etapa 1: Criar uma instância do PAI-Rec e inicializar o serviço

Esta etapa provisiona uma instância do PAI-Rec Premium Edition e a conecta aos recursos de nuvem configurados nos pré-requisitos. A Premium Edition é obrigatória, pois inclui diagnósticos de dados e os recursos de solução de recomendação personalizada usados neste tutorial.

  1. Acesse a página inicial da Personalized Recommendation Platform e clique em Buy Now.

  2. Na página de compra, defina os parâmetros a seguir e clique em Buy Now.

    Parâmetro

    Descrição

    Region and zone

    Região onde seus serviços de nuvem estão implantados.

    Service type

    Selecione Premium Edition. A Premium Edition adiciona diagnósticos de dados e recursos de solução de recomendação personalizada em comparação à Standard Edition.

  3. Faça login no console do PAI-Rec e selecione sua região na barra de menu superior.

  4. No painel de navegação à esquerda, clique em Instance list. Clique no nome da instância para abrir a página de detalhes.

  5. Na seção Operation guide, clique em Init. Você será redirecionado para System configurations > End-to-End service. Clique em Edit, configure os recursos conforme a tabela abaixo e clique em Done.

    Configuração de recursos

    Parâmetro Descrição
    Modeling
    PAI workspace Insira o workspace padrão do PAI que você criou.
    DataWorks workspace Insira o workspace do DataWorks gerado automaticamente.
    MaxCompute project (workspace) Insira o projeto do MaxCompute que você criou.
    OSS bucket Selecione o bucket OSS criado.
    Engine
    Real-time recall engineUse PAI-FeatureStore Selecione Yes.
    Real-time feature queryUse PAI-FeatureStore Selecione Yes.
  6. No painel de navegação à esquerda, escolha System configurations > Permission management. Na aba Access service, verifique se o acesso está concedido para cada produto de nuvem.

Etapa 2: Clonar o conjunto de dados público

Esta etapa carrega dados de exemplo no seu projeto do MaxCompute. O PAI-Rec fornece três tabelas compartilhadas no projeto acessível publicamente pai_online_project:

  • Tabela de usuários: pai_online_project.rec_sln_demo_user_table

  • Tabela de itens: pai_online_project.rec_sln_demo_item_table

  • Tabela de comportamento: pai_online_project.rec_sln_demo_behavior_table

Os dados nessas tabelas são gerados aleatoriamente e não possuem significado comercial real. Portanto, métricas de treinamento como Area Under the Curve (AUC) serão baixas. Isso é esperado para um ambiente de demonstração.

Dois métodos estão disponíveis:

Método

Suporte a agendamento

Quando usar

Sincronizar uma janela de tempo fixa usando SQL

Não

Configuração única para explorar o tutorial

Gerar dados usando um script Python

Sim (diário)

Treinamento rotineiro de modelos com tarefas agendadas

Para geração diária de dados e treinamento de modelos, utilize o método de script Python.

Sincronizar uma janela de tempo fixa

Execute comandos SQL no DataWorks para copiar as três tabelas de pai_online_project para o seu projeto do MaxCompute (por exemplo, project_mc).

  1. Faça login no console do DataWorks e selecione sua região.

  2. No painel de navegação à esquerda, clique em Data development and O&M > Data development.

  3. Selecione o workspace do DataWorks criado e clique em Go to data development.

  4. Passe o mouse sobre Create e escolha Create node > MaxCompute > ODPS SQL. Defina os parâmetros a seguir e clique em Confirm.

    Configuração de recursos

    Parâmetro

    Descrição

    Exemplo

    Engine instance

    Fonte de dados MaxCompute anexada.

    Node type

    ODPS SQL

    ODPS SQL

    Path

    Caminho onde este nó é armazenado.

    Business Flow/Workflow/MaxCompute

    Name

    Nome personalizado para este nó.

    Data

  5. No editor de nós, cole e execute o SQL a seguir. Antes de executar, configure variáveis de agendamento para que ${bizdate} seja definido como a data de ontem e ${bizdate_100} seja definido como 100 dias antes de ${bizdate}. Configure os parâmetros de agendamento da seguinte forma: image Execute o SQL a seguir uma vez para copiar dados do projeto público para o seu projeto:

    CREATE TABLE IF NOT EXISTS rec_sln_demo_user_table_v1(
     user_id BIGINT COMMENT 'Unique user ID',
     gender STRING COMMENT 'Gender',
     age BIGINT COMMENT 'Age',
     city STRING COMMENT 'City',
     item_cnt BIGINT COMMENT 'Number of created items',
     follow_cnt BIGINT COMMENT 'Number of follows',
     follower_cnt BIGINT COMMENT 'Number of followers',
     register_time BIGINT COMMENT 'Registration time',
     tags STRING COMMENT 'User tags'
    ) PARTITIONED BY (ds STRING) STORED AS ALIORC;
    
    INSERT OVERWRITE TABLE rec_sln_demo_user_table_v1 PARTITION(ds)
    SELECT *
    FROM pai_online_project.rec_sln_demo_user_table
    WHERE ds >= "${bizdate_100}" and ds <= "${bizdate}";
    
    CREATE TABLE IF NOT EXISTS rec_sln_demo_item_table_v1(
     item_id BIGINT COMMENT 'Item ID',
     duration DOUBLE COMMENT 'Video duration',
     title STRING COMMENT 'Title',
     category STRING COMMENT 'Primary tag',
     author BIGINT COMMENT 'Author',
     click_count BIGINT COMMENT 'Total clicks',
     praise_count BIGINT COMMENT 'Total likes',
     pub_time BIGINT COMMENT 'Publication time'
    ) PARTITIONED BY (ds STRING) STORED AS ALIORC;
    
    INSERT OVERWRITE TABLE rec_sln_demo_item_table_v1 PARTITION(ds)
    SELECT *
    FROM pai_online_project.rec_sln_demo_item_table
    WHERE ds >= "${bizdate_100}" and ds <= "${bizdate}";
    
    CREATE TABLE IF NOT EXISTS rec_sln_demo_behavior_table_v1(
     request_id STRING COMMENT 'Instrumentation ID/Request ID',
     user_id STRING COMMENT 'Unique user ID',
     exp_id STRING COMMENT 'Experiment ID',
     page STRING COMMENT 'Page',
     net_type STRING COMMENT 'Network type',
     event_time BIGINT COMMENT 'Behavior time',
     item_id STRING COMMENT 'Item ID',
     event STRING COMMENT 'Behavior type',
     playtime DOUBLE COMMENT 'Playback/Read duration'
    ) PARTITIONED BY (ds STRING) STORED AS ALIORC;
    
    INSERT OVERWRITE TABLE rec_sln_demo_behavior_table_v1 PARTITION(ds)
    SELECT *
    FROM pai_online_project.rec_sln_demo_behavior_table
    WHERE ds >= "${bizdate_100}" and ds <= "${bizdate}";

Gerar dados usando um script Python

Utilize este método para agendar a geração diária de dados. O script gera dados sintéticos para um intervalo de tempo especificado.

  1. No console do DataWorks, crie um nó PyODPS 3. Consulte Create and manage MaxCompute nodes.

  2. Baixe o arquivo create_data.py e cole seu conteúdo no nó PyODPS 3.

  3. No painel direito, clique em Scheduling configurations e configure os parâmetros de agendamento. Substitua as seguintes variáveis: Após a substituição: Configure as dependências de agendamento e clique nos ícones Salvar image e Enviar image.

    • $user_table_namerec_sln_demo_user_table

    • $item_table_namerec_sln_demo_item_table

    • $behavior_table_namerec_sln_demo_behavior_table

    image

    image

  4. Acesse o Operation center e escolha Periodic task O&M > Periodic tasks.

  5. Na coluna Actions da tarefa alvo, escolha Backfill data > Current and descendant nodes.

  6. No painel Backfill data, defina o timestamp dos dados e clique em Submit and go. Defina o timestamp dos dados como Scheduled task date - 60 para preencher 60 dias de dados e garantir a integridade dos dados.

Configurar nós de dependência

Adicione três nós virtuais ao seu projeto do DataWorks. Esses nós atuam como âncoras de dependência para as tabelas de dados, garantindo que as tarefas downstream aguardem a disponibilidade dos dados antes da execução.

  1. Passe o mouse sobre Create e escolha Create node > General > Virtual node. Crie três nós virtuais usando as configurações a seguir e clique em Confirm.

    Configuração de recursos

    Parâmetro

    Descrição

    Exemplo

    Node type

    Virtual Node

    Virtual Node

    Path

    Caminho onde o nó é armazenado.

    Workflow/Workflow/General

    Name

    Nome da tabela de dados sincronizada.

    rec_sln_demo_user_table_v1, rec_sln_demo_item_table_v1, rec_sln_demo_behavior_table_v1

    image

  2. Para cada nó virtual, defina o conteúdo do nó como select 1;. Em seguida, clique em Scheduling configurations no painel direito e conclua as seguintes configurações: Configure todos os três nós.

    • Em Time property, defina Rerun property como Rerun when succeeded or failed.

    • Em Scheduling dependencies > Upstream dependencies, insira o nome do workspace do DataWorks, selecione o nó com o sufixo _root e clique em Add.

    image

  3. Clique no ícone image à frente de cada nó virtual para enviá-lo.

Etapa 3: Registrar dados

Registre as três tabelas sincronizadas no PAI-Rec para que fiquem disponíveis para engenharia de features, recall e configuração de classificação nas etapas subsequentes.

  1. Faça login no console do PAI-Rec e selecione sua região.

  2. No painel de navegação à esquerda, clique em Instance list. Clique no nome da instância para abrir a página de detalhes.

  3. No painel de navegação à esquerda, escolha Custom recommendation solution > Data registration. Na aba MaxCompute table, clique em Add data table. Adicione uma tabela de usuário, uma tabela de item e uma tabela de comportamento usando as configurações a seguir e clique em Start import.

    Parâmetro

    Descrição

    Exemplo

    MaxCompute project

    Projeto do MaxCompute criado.

    project_mc

    MaxCompute table

    Tabelas de dados sincronizadas.

    Usuário: rec_sln_demo_user_table_v1; Item: rec_sln_demo_item_table_v1; Comportamento: rec_sln_demo_behavior_table_v1

    Data table name

    Nome de exibição personalizado para a tabela.

    User Table, Item Table, Behavior Table

Etapa 4: Criar um cenário de recomendação

Crie um cenário de recomendação para definir o contexto em que as recomendações são servidas (por exemplo, um feed de página inicial). Para obter informações sobre cenários de recomendação e IDs de tráfego, consulte Terms.

No painel de navegação à esquerda, escolha Recommendation scenarios. Clique em Create scenario, configure os parâmetros a seguir e clique em OK.

Configuração de recursos

Parâmetro

Descrição

Exemplo

Scenario name

Nome personalizado para este cenário.

HomePage

Scenario description

Descrição do cenário.

Etapa 5: Criar e configurar uma solução de algoritmo

Esta etapa configura os algoritmos de recall e classificação para o seu cenário de recomendação. Para uma configuração completa de produção, os seguintes algoritmos estão disponíveis:

  • Global hot recall: Classifica os top-k itens por estatísticas de cliques dos dados de log.

  • Global hot fallback recall: Armazena um conjunto de candidatos de fallback no Redis para evitar resultados vazios caso o mecanismo de recall primário falhe.

  • Grouped hot recall: Recupera itens por grupos de atributos (por exemplo, cidade ou gênero) para melhorar a personalização de itens populares.

  • etrec u2i recall: Recall usuário-para-item baseado no algoritmo de filtragem colaborativa etrec.

  • Swing u2i recall (opcional): Recall usuário-para-item baseado no algoritmo Swing.

  • Cold-start recall (opcional): Recall para novos usuários e itens usando o algoritmo DropoutNet.

  • Fine-grained ranking: Escolha MultiTower para classificação de objetivo único ou DBMTL para classificação multiobjetivo.

Vector recall e PDN recall são normalmente adicionados após a conclusão da fase básica de recall. O Vector recall requer um mecanismo de recall vetorial e não é abordado neste tutorial porque o FeatureDB não oferece suporte a ele.

Para concluir a implantação rapidamente, este tutorial configura apenas global hot recall e etrec u2i recall para a fase de recall, e fine-grained ranking para a fase de classificação.

  1. No painel de navegação à esquerda, escolha Custom recommendation solution > Solution configuration. Selecione o cenário criado, clique em Create recommendation solution, preencha os parâmetros a seguir e clique em Save and configure algorithm solution. Para parâmetros não listados aqui, mantenha os valores padrão. Consulte Data table configuration para detalhes.

    Configuração de recursos

    Parâmetro

    Descrição

    Solution name

    Nome personalizado.

    Scenario name

    Cenário de recomendação criado.

    Offline store

    Projeto do MaxCompute associado ao cenário.

    DataWorks workspace

    Workspace do DataWorks associado ao cenário.

    Workflow name

    Nome do fluxo de trabalho do DataWorks criado ao implantar o script da solução. Por exemplo, Flow.

    StorageAPI configuration

    Para regiões na China continental (como Pequim e Xangai), selecione StorageAPI (DTS pagamento conforme o uso). Para outras regiões (como China (Hong Kong), Singapura e Frankfurt), adquira primeiro um grupo de recursos dedicado do DTS e selecione-o aqui. Adicione um parâmetro à tarefa de treinamento do TorchEasyRec no PAI-DLC no formato: -odps_data_quota_name ot_xxxx_p#ot_yyyy.

    slim_mode

    Selecione No para este tutorial.

    OSS bucket

    Bucket OSS associado ao cenário.

    Project

    Projeto do FeatureStore criado. Para o armazenamento online, selecione FeatureDB.

    User entity

    Entidade de feature de usuário user no projeto do FeatureStore.

    Item entity

    Entidade de feature de item item no projeto do FeatureStore.

  2. No nó Data table configuration, clique em Add ao lado de cada tabela de dados. Configure a tabela de log de comportamento, a tabela de usuário e a tabela de item conforme descrito abaixo e clique em Next. Para parâmetros não listados aqui, mantenha os valores padrão. Consulte Data table configuration. Tabela de log de comportamento Ao configurar a tabela de log de comportamento, ajuste os campos para corresponder aos seus dados reais. O log de comportamento de demonstração contém: ID de solicitação, ID de usuário, página, timestamp de comportamento e tipo de comportamento. Se seus dados tiverem dimensões adicionais, classifique-as como informações de usuário ou item para engenharia de features.

    Configuração de recursos da tabela de log de comportamento

    Parâmetro Descrição Exemplo
    Behavior table name Tabela de comportamento registrada. rec_sln_demo_behavior_table_v1
    Time partition Campo de partição da tabela de comportamento. dsyyyymmdd
    Behavior information configuration
    Request ID UUID que identifica cada solicitação de recomendação. Opcional. request_id
    Behavior event Campo que registra o evento de comportamento. event
    Behavior event enumeration values Tipos de eventos no log de comportamento. expr,click,praise
    Behavior value Profundidade do comportamento, como duração de visualização ou preço da transação. playtime
    Behavior timestamp Hora do evento como timestamp Unix (precisão de segundos). event_time
    Timestamp format Formato do timestamp de comportamento. unixtime
    Behavior scenario Campo de cenário onde o comportamento ocorreu. page
    Scenario enumeration values Valores de cenário a incluir para estatísticas de features. home,detail
    User information configuration
    User ID Campo de ID de usuário na tabela de comportamento. user_id
    User categorical features Features categóricas de usuário na tabela de comportamento. net_type
    Item information configuration
    Item ID Campo de ID de item na tabela de comportamento. item_id

    User table

    Configuração de recursos da tabela de usuário

    Parâmetro Descrição Exemplo
    User table name Tabela de usuário registrada. rec_sln_demo_user_table_v1
    Time partition Campo de partição de tempo da tabela de usuário. dsyyyymmdd
    User information configuration
    User ID Campo de ID de usuário na tabela de usuário. user_id
    Registration timestamp Momento em que o usuário se registrou. register_time
    Timestamp format Formato do timestamp de registro. unixtime
    Categorical features Campos categóricos na tabela de usuário. gender, city
    Numerical features Campos numéricos na tabela de usuário. age, item_cnt, follow_cnt, follower_cnt
    Tag feature Nome do campo de feature de tag. tags

    Item table

    Configuração de recursos da tabela de item

    Parâmetro Descrição Exemplo
    Item table name Tabela de item registrada. rec_sln_demo_item_table_v1
    Time partition Campo de partição de tempo da tabela de item. dsyyyymmdd
    Item information configuration
    Item ID Campo de ID de item na tabela de item. item_id
    Author ID Autor do item. author
    Listing timestamp Campo de timestamp de publicação do item. pub_time
    Timestamp format Formato do timestamp de publicação. unixtime
    Categorical features Campos categóricos na tabela de item. category
    Numerical features Campos numéricos na tabela de item. click_count, praise_count
  3. No nó Feature configuration, defina os parâmetros a seguir, clique em Generate features, defina a versão da feature e clique em Next. Após clicar em Generate features, o sistema deriva features estatísticas para usuários e itens. Os padrões funcionam para este tutorial. Consulte Feature configuration para personalizar features derivadas.

    Configuração de recursos

    Parâmetro

    Descrição

    Exemplo

    Common statistics period

    Janelas de tempo para geração de features em lote. Este tutorial usa 3, 7 e 15 dias. Se o volume de comportamento do usuário for baixo, tente 21 dias.

    3,7,15

    Key behaviors

    Eventos de comportamento a incluir. Adicione-os em ordem: impressão (expr), depois click, e então praise.

    expr, click, praise

  4. No nó Recall configuration, clique em Add ao lado da categoria de recall alvo, configure os parâmetros, clique em Confirm e, em seguida, clique em Next.

    As seções a seguir descrevem cada método de recall. Para uma implantação rápida, configure apenas Global hot recall e etrec u2i recall. Os demais métodos servem como referência. #### Global hot recall O Global hot recall gera uma lista classificada de itens populares (itens top_n) com base em estatísticas de eventos de clique. Após implantar o código no DataWorks, você pode modificar a fórmula de pontuação ou o evento alvo. A fórmula de pontuação é:

    Configuração de recursos

    Global hot recall

    O Global hot recall gera uma lista classificada de itens populares (itens top_n) com base em estatísticas de eventos de clique. Após implantar o código no DataWorks, você pode modificar a fórmula de pontuação ou o evento alvo.

    A fórmula de pontuação é:

    click_uv * click_uv / (expr + adj_factor) * exp(-item_publish_days / fresh_decay_denom)

    Onde:

    • click_uv: Para a mesma taxa de cliques (CTR), mais cliques indicam maior popularidade.

    • click_uv / (expr + adj_factor): A CTR suavizada. click_uv é o número de usuários únicos que clicaram; expr é a contagem de impressões. O fator de ajuste adj_factor evita denominador zero e corrige a CTR quando a contagem de impressões é baixa.

    • exp(-item_publish_days / fresh_decay_denom): Uma penalidade de atualidade que reduz a pontuação de itens mais antigos. item_publish_days é o número de dias desde a publicação.

    image

    etrec u2i recall

    O etrec é um algoritmo de filtragem colaborativa baseado em itens. Consulte Collaborative filtering etrec para detalhes.

    image

    Parâmetro

    Descrição

    Training days

    Número de dias de logs de comportamento usados para treinamento. Padrão: 30. Ajuste conforme o volume de logs.

    Recall count

    Número final de pares usuário-para-item gerados offline.

    U2ITrigger

    Itens com os quais o usuário interagiu (por exemplo, clicou, favoritou ou comprou). Não inclua itens apenas impressos.

    Behavior time window

    Número de dias de dados de comportamento a coletar. Padrão: 15.

    Behavior time attenuation coefficient

    Valor entre 0 e 1. Valores maiores fazem com que comportamentos passados decaiam mais rápido, reduzindo seu peso na construção do item gatilho.

    Trigger selection count

    Número de IDs de item por usuário usados para realizar um produto cartesiano com os dados i2i do etrec. Um valor entre 10 e 50 é típico. Muitos gatilhos resultam em um conjunto de candidatos superdimensionado.

    U2i behavior weight

    Defina o peso do evento de impressão como 0 ou deixe-o indefinido.

    I2I model settings

    Parâmetros do modelo etrec. Consulte Collaborative filtering etrec. Evite definir o número de seleções de itens relacionados muito alto. image

    Grouped hot recall

    Configure classificações por grupos de atributos (por exemplo, cidade e gênero) para fornecer personalização inicial. O exemplo a seguir usa uma combinação de gênero e o valor em buckets de um atributo numérico como grupo.

    image

    Swing u2i recall

    O Swing mede a similaridade de itens com base no princípio User-Item-User.

    image

    image

    Vector recall

    Dois métodos de vector recall estão disponíveis: DSSM e MIND.

    Defina o alvo de recall da seguinte forma:

    • Recall target name: is_click

    • Recall target selection: max(if(event='click', 1, 0))

    O SQL a seguir gera o alvo de recall:

    select max(if(event='click',1,0)) is_click, ...
    from ${behavior_table}
    where dt between ${bizdate_start} and ${bizdate_end}
    group by req_id, user_id, item

    Onde:

    • ${behavior_table}: A tabela de comportamento.

    • ${bizdate_start}: Data inicial da janela de tempo de comportamento.

    • event: Campo de evento na tabela de comportamento. Selecione o valor com base no seu campo específico.

    • is_click: Nome do alvo.

    Fórmulas de dimensão de embedding:

    EMB_SQRT4_STEP8: (8 + Pow(count, 0.25)) / 8) * 8
    EMB_SQRT4_STEP4: (4 + Pow(count, 0.25)) / 4) * 4
    EMB_LN_STEP8:    (8 + Log(count + 1)) / 8) * 8
    EMB_LN_STEP4:    (4 + Log(count + 1)) / 4) * 4

    Use a função Log quando o número de valores de feature for grande.

    image

    image

    Cold-start recall

    O DropoutNet é um modelo de recall de torre dupla (torre de usuário + torre de item) adequado para usuários e itens principais, bem como para usuários e itens de cauda longa e totalmente novos. Consulte DropoutNet.

    image

    Global hot fallback recall

    O Global hot fallback recall serve como rede de segurança: se o mecanismo de recall primário falhar, ele retorna um conjunto de candidatos pré-computado armazenado no Redis. Sua saída é uma única linha de dados.

    image

    Collaborative metric learning i2i recall

    O modelo de recall Collaborative Metric Learning I2I calcula a similaridade de itens com base em dados de cliques de sessão.

    image

  5. No nó Ranking configuration, clique em Add ao lado de Fine-grained ranking, configure os parâmetros, clique em Confirm e, em seguida, clique em Next.

    Configuração de recursos

    O PAI-Rec suporta vários modelos de classificação. Consulte Ranking models para a lista completa. O exemplo a seguir mostra como configurar o DBMTL, um modelo de classificação multiobjetivo.

    image

    Clique em Add ao lado de Refined ranking target settings (labels) e adicione dois rótulos:

    • Alvo 1 image

    • Alvo 2 (o 'l' em 'ln' é um L minúsculo) image

  6. No nó Generate script, clique em Generate deployment script.

    Importante

    Após a geração do script, o sistema produz um endereço OSS onde todos os arquivos de implantação são armazenados. Salve este endereço localmente — você precisará dele se implantar manualmente via Migration Assistant.

    image

  7. Após a conclusão da geração do script, clique em OK na caixa de diálogo. Você será redirecionado para Custom recommendation solution > Deployment records. Se a geração falhar, revise os logs de execução, resolva o erro e regenere o script.

Etapa 6: Implantar a solução de recomendação

Após a geração do script, implante-o no DataWorks usando um dos dois métodos.

Método 1: Implantar pela Personalized Recommendation Platform

  1. Clique em Go to deploy ao lado da solução alvo.

    image

  2. Na página Deployment preview, na seção File diff, selecione os arquivos a implantar. Para a primeira implantação, clique em Select all e, em seguida, clique em Deploy to DataWorks. A página retorna para Deployment records, mostrando a implantação em andamento.

    image

  3. Clique em image para atualizar a lista e verificar o status da implantação.

    • Se a implantação falhar, clique em View log na coluna Actions, resolva o erro e, em seguida, regenere e reimplante o script.

    • Quando o Deployment status mudar para Success, o script estará implantado. Acesse a página de desenvolvimento de dados do DataWorks para visualizar o código implantado. Consulte Data development process guide.

    image

  4. Execute o backfill de dados para preencher dados históricos para treinamento.

    1. Na página Deployment records, clique em Details ao lado da solução implantada com sucesso.

    2. Na página Deployment preview, clique em View task data backfill process para revisar as instruções de backfill e garantir a integridade dos dados.

    3. Confirme se a tabela de usuário, a tabela de item e a tabela de comportamento contêm dados para os últimos _n_ dias, onde _n_ é igual à soma da janela de tempo de treinamento e da janela de tempo máxima de feature. Se estiver usando os dados de demonstração deste tutorial, sincronize as partições de dados mais recentes. Se gerou dados com o script Python, faça o backfill pelo Operation center do DataWorks.

    4. Clique em Create deployment task. Em Backfill task list, clique em Start tasks sequentially. Aguarde até que todas as tarefas sejam concluídas com sucesso. Se uma tarefa falhar, clique em Details para visualizar o log, resolva o erro, execute a tarefa novamente e clique em Continue para prosseguir.

    截屏2025-10-20 15

Método 2: Implantar usando o Migration Assistant

Após a geração do script, implante-o manualmente pelo Migration Assistant do DataWorks. Para instruções completas, consulte Create and view a DataWorks import task. Os parâmetros principais são:

  • Import name: Defina conforme solicitado no console.

  • Upload method: Selecione OSS file, insira o OSS link da Etapa 5 e clique em Verify.

O pacote de implantação é armazenado no endereço OSS gerado na Etapa 5, por exemplo: oss://examplebucket/algoconfig/plan/1723717372/package.zip. Faça login no console do OSS para recuperar a URL do arquivo.

image

Etapa 7: Congelar nós

Este tutorial usa dados de demonstração. Após a conclusão do backfill de dados, congele os três nós virtuais criados na Etapa 2 para evitar que sejam executados em um agendamento diário.

No Operation center do DataWorks, escolha Periodic task O&M > Periodic tasks. Pesquise pelos nomes dos nós (por exemplo, rec_sln_demo_user_table_v1), selecione o nó alvo (Workspace.Nome do nó) e escolha Pause (Freeze).