O AnalyticDB for MySQL integra-se ao Apache Hudi para oferecer uma solução de data lakehouse no Object Storage Service (OSS). Após criar um cluster, comece a ingerir dados em tabelas Hudi no OSS sem precisar configurar um ambiente Spark complexo.

Como funciona
O fluxo de dados ocorre em três etapas:
Ingestão: Use o AnalyticDB Pipeline Service (APS) para transmitir dados de log do Kafka ou do Log Service para tabelas Hudi em tempo quase real. Alternativamente, use o mecanismo Serverless Spark para carregar dados estruturados do ApsaraDB RDS ou de arquivos Parquet em lotes.
Armazenamento: Os dados são gravados em tabelas Hudi no OSS. O sistema mescla automaticamente arquivos pequenos, gerencia o ciclo de vida das partições e executa serviços de tabela, como clustering, de forma assíncrona e isolada do caminho de escrita.
Consulta: Os mecanismos Serverless Spark e XIHE leem os dados diretamente após a gravação. A sincronização automática de metadados elimina a necessidade de registro manual de tabelas.
Capacidades do Apache Hudi
O Apache Hudi fornece a base de armazenamento:
Suporte a várias versões de protocolos de gerenciamento de arquivos
Escritas incrementais em tempo real com garantias de transação ACID (atomicidade, consistência, isolamento e durabilidade)
Mesclagem e otimização automáticas de arquivos pequenos
Evolução de schema e verificação de metadados
Formatos colunares de alta eficiência com otimização de índice
Suporte a tabelas particionadas de grande porte
Melhorias do AnalyticDB for MySQL
O AnalyticDB for MySQL adiciona os seguintes recursos à base open source do Hudi:
Escritas de alto desempenho
O caminho de escrita para o OSS é otimizado para oferecer mais que o dobro do throughput de escrita em comparação ao Hudi open source na maioria das cargas de trabalho de log. O sistema distribui automaticamente os dados quentes entre as partições de forma uniforme, eliminando a distorção de dados e melhorando a estabilidade da escrita.
Gerenciamento de ciclo de vida particionado
Controle a retenção dos dados de partição por quantidade de partições, volume de dados ou tempo de expiração. Execute várias políticas de ciclo de vida simultaneamente para reduzir ainda mais os custos de armazenamento.
Serviços de tabela assíncronos
Serviços como clustering funcionam de maneira totalmente independente do caminho de escrita. Na maioria das cargas de trabalho, o clustering aumenta o desempenho das consultas em mais de 40%.
Sincronização automática de metadados
O gerenciamento centralizado de metadados permite que os mecanismos Serverless Spark e XIHE acessem os dados assim que são gravados em uma tabela Hudi, sem necessidade de sincronização manual. Uma única cópia dos dados ingeridos fica legível para vários mecanismos de computação.
Facilidade de uso
Configure a ingestão de dados pelo console gráfico do APS. Não é necessário usar arquivos de configuração do Spark.
Casos de uso
Ingestão de logs em tempo quase real: Transmita logs de aplicações do Kafka ou do Log Service para tabelas Hudi no OSS com baixa latência e mantenha os custos de armazenamento sob controle por meio do gerenciamento de ciclo de vida.
Migração de dados em lote: Carregue dados estruturados do ApsaraDB RDS ou de arquivos Parquet para o lakehouse usando o Serverless Spark e consulte-os com o Serverless Spark ou o XIHE sem duplicar as informações.
Análise multimotor: Ingira os dados uma única vez e disponibilize-os para vários mecanismos de computação via gerenciamento centralizado de metadados, evitando cópias redundantes e reduzindo a sobrecarga de armazenamento.