Todos os produtos
Search
Central de documentação

Platform For AI:FeatureStore overview

Última atualização: Jun 27, 2026

O FeatureStore é uma plataforma centralizada para armazenar, gerenciar e compartilhar dados de features usados no treinamento de machine learning e IA, com consistência automática entre ambientes offline e online.

O que é o FeatureStore?

O FeatureStore armazena e gerencia dados de features para serviços offline e online. Ele se integra ao DataHub, Flink, Hologres, Tablestore e ao Feature Database FeatureDB, um banco de dados de features para busca e recomendação.

As aplicações ingerem logs comportamentais e propriedades em tempo real do DataHub, sincronizam os dados com o MaxCompute, processam as informações com o Flink e gravam os resultados em um repositório online por meio do FeatureStore. Em seguida, aplicações de recomendação, crescimento de usuários e controle de riscos chamam o SDK do FeatureStore para acessar as features no repositório online.

O diagrama a seguir ilustra o fluxo de dados, desde a ingestão e o cálculo de features até o gerenciamento de amostras e a publicação no repositório online.

image

Conceitos principais

  • Entidade de feature: Conjunto nomeado de tabelas de features. Por exemplo, em um cenário de recomendação, defina duas entidades de feature: usuário e item.

  • Visualização de feature: Grupo de features com informações sobre features derivadas. Mapeia uma tabela de features offline para uma tabela de features online.

  • Join ID: Campo que vincula uma visualização de feature a uma entidade de feature. Cada entidade possui um Join ID para conectar features em várias visualizações.

    Nota

    Cada visualização de feature tem uma chave primária, ou chave de índice, para recuperar dados de features. O nome da chave de índice pode diferir do nome do Join ID.

    Por exemplo, em um cenário de recomendação, defina o Join ID como user_id e item_id, que são as chaves primárias das tabelas de usuário e item.

  • Tabela de rótulos: Armazena rótulos de treinamento do modelo, incluindo o alvo de treinamento e o Join ID da entidade de feature. Em cenários de recomendação, geralmente deriva de uma tabela de comportamento usando group by user_id/item_id/request_id.

Casos de uso

  • Sistemas de recomendação e classificação de anúncios: Gerencie centralmente features de usuários e itens, como histórico de navegação, registros de compras e personas. A leitura e gravação em tempo real melhoram o desempenho do modelo e a precisão da veiculação de anúncios.

  • Classificação em mecanismos de busca: Os dados de features incluem correspondência de palavras-chave, CTR e volume de vendas. Treine um modelo de classificação para ordenar resultados de recall de mecanismos como Elasticsearch ou OpenSearch. Use um serviço de pontuação de modelos TensorFlow no EAS para obter resultados de busca personalizados.

  • Crescimento de usuários ou controle de riscos: Administre perfis de usuários, comportamentos de transação e registros de crédito. Combine esses dados com modelos de ML (XGBoost, GBDT) para avaliação de riscos.

  • Sincronização de dados KV offline para repositório online: Gerencie tabelas de atributos de produtos e usuários. Simplifica o agendamento da sincronização de dados do ambiente offline para o online.

Recursos principais

Diversidade de fontes de dados

Gerencie todo o processo, das features aos modelos. Registre e gerencie tabelas de features de várias fontes de dados offline e online:

Benefícios de registrar uma tabela de features no FeatureStore:

  • Sincronização automática: Crie e sincronize tabelas online e offline para garantir a consistência dos dados.

  • Redução de custos: Armazene features uma única vez e compartilhe-as entre várias equipes para diminuir os custos de recursos.

  • Maior eficiência: Exporte tabelas de treinamento ou importe dados para um banco de dados online com apenas uma linha de código.

Gerenciamento de features offline e em tempo real

Gerencie visualizações de features offline e visualizações de features em tempo real. As features offline abrangem atributos e estatísticas de usuários e itens. As features em tempo real incluem novos usuários ou itens gravados em um repositório online (como o Hologres) via Flink, além de estatísticas de janela temporal, como cliques, encaminhamentos, compras e taxa de conversão na última hora.

Features estatísticas em tempo real e features de sequência de usuário

A complexidade das features do modelo e os requisitos de tempo real aumentam com o tempo. Gerencie features estatísticas em tempo real e features de sequência de comportamento do usuário calculadas pelo Flink. Defina features de sequência de usuário offline, como IDs de itens clicados por um usuário. Os modelos frequentemente precisam de features de atributos de itens (SideInfo), mas transmitir SideInfo pela rede consome uma quantidade significativa de dados. No EasyRec, o SDK do FeatureStore armazena features de itens em cache para reduzir o tempo de resposta da inferência e melhorar o desempenho.

Associação automática de features e exportação de amostras de modelo

Gerencie amostras geradas usando o PAI-FeatureStore. Quando um modelo utiliza features de uma visualização de features em tempo real, use o recurso Create Model Feature para gerar amostras corretas a partir de informações de atualização em tempo real no FeatureDB. Isso associa features em tempo real sem a necessidade de uma interface de callback no mecanismo PAI-Rec.

Compartilhamento de features

Quando um desenvolvedor de algoritmos ou BI cria um novo conjunto de features de usuário ou item, projete um novo ModelFeature para associar as features exigidas pelo conjunto de dados de treinamento. Exporte amostras para treinamento offline e publique-as em um repositório online usando o SDK do FeatureStore. Vários modelos que referenciam a mesma visualização de feature compartilham uma única cópia online, simplificando a otimização iterativa do modelo.

SDKs multilíngues

O FeatureStore fornece SDKs em Go, Java e Python para a solução conjunta do PAI-REC e EasyRecProcessor. Use o SDK Java para chamar o EasyRecProcessor ou outros mecanismos de pontuação de modelos a partir de seus próprios mecanismos no lado do servidor (busca, recomendação, controle de riscos). Use o SDK Python para análise de dados e modelagem em repositórios online.

SDK de geração de features

Defina features com um script Python, execute-o e registre a saída no PAI-FeatureStore. O SDK de geração de features é uma ferramenta independente e open source baseada em SQL do MaxCompute que simplifica a geração de features. Ela utiliza dados intermediários diários, reduzindo significativamente os custos computacionais para cálculos como estatísticas de preferência de usuário de 30 dias.

Integração com o mecanismo de recomendação EasyRec

O FeatureStore integra-se profundamente ao EasyRec e ao TorchEasyRec para engenharia de features (FG) e treinamento eficiente de modelos. Implante modelos diretamente no EasyRec Processor e no TorchEasyRec Processor para construir sistemas de recomendação de alto desempenho. O EasyRec oferece cache de memória para tabelas de features de itens e pontuação eficiente de modelos.

O SDK Cpp do FeatureStore integrado ao EasyRec Processor é otimizado para cenários de grande escala. Benefícios:

  • Uso de memória: O SDK Cpp do FeatureStore integrado ao EasyRec Processor otimiza o armazenamento de features, economizando 50% de memória em comparação ao cache nativo. A economia aumenta conforme o número de features cresce.

  • Tempo de busca de features: Visualizações de features offline são carregadas na memória mais de cinco vezes mais rápido do que fontes de dados online, reduzindo a pressão sobre os repositórios online. A fonte offline estável suporta dimensionamento para centenas de instâncias do EAS, cada uma carregando todas as features em minutos. O scale-out não exerce pressão significativa no repositório online.

  • Tempo de pontuação do modelo: A pontuação do modelo extrai features em tempo real do cache otimizado. As otimizações do SDK Cpp do FeatureStore melhoram o desempenho tp100, aumentam a estabilidade e reduzem timeouts.

Como funciona

  • Conecte o armazenamento offline e online para unificar o gerenciamento de dados de features.

  • Registre tabelas de features em visualizações de feature para agregar e mapear dados de features.

  • Armazene e registre tabelas de rótulos no MaxCompute por meio da fonte de dados offline.

  • Use Join IDs para associar visualizações de features entre projetos e vincular todas as features da entidade. Combine-as com tabelas de rótulos para produzir tabelas de Conjunto de Treinamento no MaxCompute.

image

Regiões suportadas

Regiões disponíveis:

Área

Região

Ásia-Pacífico

  • China (Hangzhou)

  • China (Shanghai)

  • China (Pequim)

  • China (Shenzhen)

  • China (Hong Kong)

  • Singapura

  • Indonésia (Jacarta)

Europa e América

  • Alemanha (Frankfurt)

  • EUA (Vale do Silício)

  • EUA (Virgínia)

Primeiros passos

  1. Crie uma fonte de dados. As fontes de dados incluem repositórios offline e online.

  2. Crie um projeto. Crie entidades de features, visualizações de features e tabelas de rótulos para produzir uma tabela de conjunto de treinamento de features do modelo (conjunto de dados de treinamento).

  3. Execute uma tarefa de sincronização de dados para sincronizar dados offline com um repositório online.

  4. Após iniciar a tarefa de sincronização, visualize o status e os detalhes da tarefa no Task Hub.

  5. Para ler e usar dados online em um serviço online Java ou Go, entre no grupo 34415007523 do DingTalk para contatar o suporte técnico.