O JindoData é um conjunto de aceleração de armazenamento de data lake desenvolvido pela equipe de big data open source da Alibaba Cloud. Ele fornece aceleração abrangente de acesso para sistemas de armazenamento de data lake da Alibaba Cloud e padrão do setor em ecossistemas de big data e IA. Este tópico descreve os recursos introduzidos em cada versão do JindoData.
Contexto
O JindoData é uma versão atualizada do componente original SmartData do Alibaba Cloud EMR. Para obter mais informações, consulte JindoData (available only to existing users).
Versões 4.6.x do JindoData
Visão geral
A série 4.6.x do JindoData introduz a migração simplificada do Hadoop Distributed File System (HDFS) para o OSS-HDFS, simplificando significativamente o processo de migração de dados. O JindoFS adiciona um recurso de inventário de arquivos para ajudar você a entender a distribuição e a propriedade dos dados. Em termos de desempenho, o JindoFS melhora o throughput das operações du e count por meio de otimizações completas e incrementais no lado do servidor. O JindoSDK 4.6.x adiciona verificação de gravação nos níveis de arquivo e bloco para aumentar a estabilidade de gravação e oferece suporte a um protocolo de acesso multicaminho, permitindo alcançar o mesmo caminho de backend por meio de diferentes modos de protocolo.
JindoData 4.6.11
Correções de bugs
JindoSDK: Corrigido um problema em que o JindoCommitter usava uma API mapred legada para gravar dados em um ambiente Alibaba Cloud EMR Hadoop 2.8.5.
JindoTable: Otimizado o recurso de restauração de tabelas ou partições no Object Storage Service (OSS). Agora é possível especificar o número de dias de restauração. Para obter mais informações, consulte Use JindoTable to archive and restore tables or partitions in OSS.
JindoData 4.6.10
Correções de bugs e melhorias
JindoFS: Lógica de pré-busca
preadotimizada.JindoSDK: Adicionado suporte para tarefas de commit simultâneas, melhorando o desempenho do commit de jobs.
JindoSDK: Lógica de reescrita de caminho otimizada.
JindoFuse: Corrigido um problema que ocorria ao anexar objetos.
JindoData 4.6.8
Novos recursos
JindoFS: Os clientes agora podem definir o período de retenção da lixeira.
JindoSDK: Adicionado suporte para
MALLOC_CONFvisando otimizar o uso de memória.JindoFuse: Incluído suporte para desligamento graceful ao montar o OSS-HDFS.
JindoFSx: Adicionado suporte para caracteres curinga para filtrar a lista de arquivos na pré-busca de cache.
Correções de bugs
JindoFSx: Corrigido um problema em que a limpeza do cache não surtia efeito.
JindoData 4.6.7
Novos recursos e melhorias
JindoFuse: Implementado um mecanismo de desligamento graceful.
JindoFuse: Saída de log otimizada.
Correções de bugs
JindoFuse: Corrigido um problema em que
O_APPENDouO_TRUNCnão eram suportados ao montar o OSS.
JindoData 4.6.6
Melhorias
Grau de paralelismo para tarefas
distjobedistcpotimizado. O grau máximo de paralelismo agora está limitado ao número de tarefas.
JindoData 4.6.5
Correções de bugs e melhorias
Adicionado um ServiceLoader para o esquema OSS apontando para
JindoOssFileSystem.Tratamento de exceções para o método
isDirectory()otimizado. Quando chamado com um caminho curinga comoPath *, o método agora retornafalseem vez de lançar uma exceçãoIllegalPath.SDK do Hadoop otimizado para evitar
ConcurrentModificationExceptionem cenários onde as configurações do Hadoop são modificadas simultaneamente.Lógica de nova tentativa do JindoMagicCommitter ao gravar no OSS otimizada para lidar com casos em que diretórios temporários estão anormais ou discos danificados. Isso aumenta as taxas de sucesso de gravação e evita a exceção
InvalidPart:One or more of the specified parts could not be found or the specified entity tag might not have matched the part's entity tag.
JindoData 4.6.4
Novos recursos
O JindoData 4.6.4 adiciona suporte multiplataforma.
Para plataformas suportadas, consulte Download JindoData.
Na plataforma Java, implante vários pacotes
jindo-corepara habilitar o suporte multiplataforma. Por padrão, ojindo-coresuporta os principais sistemas Linux. Para usá-lo em outras plataformas, adicione o pacote de extensão correspondente.Os pacotes de dependência para suporte multiplataforma estão disponíveis no repositório Maven do JindoData. Para configurações de acesso ao OSS baseadas em Maven, consulte jindosdk_ide_hadoop.md.
Exemplo: implantação entre plataformas
Linux principal: Adicione
jindo-core-4.6.4.jarejindo-sdk-4.6.4.jarao classpath.macOS: Adicione
jindo-core-4.6.4.jar,jindo-sdk-4.6.4.jare o pacote de extensãojindo-core-macos-10_14-x86_64-4.6.4.jar.
Baixejindosdk-4.6.10-macos-10_14-x86_64.tar.gzna página Download JindoData . Este pacote incluijindo-core-4.6.4.jar,jindo-sdk-4.6.4.jarejindo-core-macos-10_14-x86_64-4.6.4.jar.
JindoData 4.6.2
Correções de bugs e melhorias
Sistema de armazenamento JindoFS:
Corrigido um problema em que o service travava durante a conversão de Standard para Standard no armazenamento em camadas.
Resolvido um problema em que o service travava devido a um arquivo de manifesto vazio gerado durante o armazenamento em camadas.
Execução de tarefas de armazenamento em camadas acelerada.
Lógica do recurso RootPolicy corrigida.
Corrigido um problema em que a operação
setAclocasionalmente causava falha no service.Corrigido um problema de baixa probabilidade em que arquivos de manifesto de DB enchiam o disco.
Recurso de importação de metadados em lote do service de migração corrigido.
JindoData 4.6.1
Novos recursos e melhorias
Sistema de armazenamento JindoFS:
Saída redundante de logs reduzida.
Corrigidos tamanhos de arquivo incorretos ao exportar inventário de metadados para arquivos não fechados.
Sistema de aceleração de armazenamento JindoFSx:
Adicionada limpeza automática de diretórios temporários de cache.
JindoSDK e ferramentas:
Saída excessiva de logs reduzida.
Ativada por padrão a otimização de caminho no lado do servidor para operações
duecount.Frequência de atualização de tokens STS reduzida para evitar limitação por solicitações frequentes.
Nome da função RAM em URLs sem credenciais alterado para minúsculas, evitando falhas na atualização de tokens no service sem credenciais do ECS.
JindoData 4.6.0
Novos recursos
Sistema de armazenamento JindoFS:
Suporta exportação de inventários de arquivos do OSS-HDFS para ajudar você a entender a distribuição de dados e oferecer suporte ao desenvolvimento personalizado.
Melhora significativamente o desempenho de
duecountpor meio de otimizações completas e incrementais no lado do servidor.Oferece suporte a migração simplificada do HDFS para o OSS-HDFS, simplificando o processo de migração de dados.
Permite acesso por protocolo multicaminho. Acesse o mesmo caminho de backend por meio de diferentes protocolos.
Sistema de aceleração de armazenamento JindoFSx:
Corrigido um problema em que o cliente saía inesperadamente ao gravar no cache.
Corrigido um problema em que o cliente saía inesperadamente durante o relatório de métricas.
Corrigido um vazamento de memória ao usar o Ranger.
JindoSDK e ferramentas:
Suporta verificação de checksum CRC e MD5 para gravações nos níveis de arquivo e bloco.
Suporta a ferramenta Jindo Sync para sincronização de dados sem um ambiente Hadoop.
Suporta o conector TensorFlow do OSS-HDFS.
Versões 4.5.x do JindoData
JindoData 4.5.1
Visão geral
A versão 4.5.1 é uma atualização menor para a 4.5.0 que inclui correções e melhorias importantes. O JindoFS melhora a estabilidade do service e o tratamento de exceções. Tanto o JindoFS quanto o JindoFSx refinam ainda mais o algoritmo de pré-busca adaptativa para maior eficiência. O JindoDistCp inclui inúmeras correções e otimizações para melhorar a estabilidade da cópia de dados. O JindoFuse foi redesenhado desde a base para oferecer um desempenho significativamente superior.
Novos recursos e melhorias
Sistema de armazenamento JindoFS:
Uso de memória aprimorado.
Adicionado tratamento de exceções e alertas baseados em log para erros
ASSUME_ROLE.Suporta atualização de AccessKeys dinâmicos durante novas tentativas.
Algoritmo de pré-busca adaptativa aprimorado para maior eficiência.
Corrigidos caminhos de leitura e gravação para cenários de gravação aleatória de arquivos.
Suporta a API
CheckAccess.
Sistema de aceleração de armazenamento JindoFSx:
Algoritmo de pré-busca adaptativa refinado para maior eficiência.
Suporta espaços em caminhos.
Pontos de congestionamento durante leituras de múltiplas réplicas reduzidos.
JindoSDK e ferramentas:
Os comandos Jindo agora cobrem todos os comandos Hadoop.
Os comandos Jindo incluem suporte nativo ao HDFS para desempenho e usabilidade significativamente aprimorados.
O JindoDistCp suporta integração com o Alibaba Cloud CloudMonitor.
O JindoDistCp suporta verificação de checksum para dados migrados do OSS para um caminho HDFS.
O JindoDistCp suporta parâmetros de divisão de jobs.
O JindoDistCp corrigiu a lógica de tratamento de erros para exclusão de arquivos de origem durante operações de cópia.
O JindoSDK otimiza o uso de memória para leituras aleatórias.
Suporte POSIX do JindoFuse:
Redesenhado usando APIs de baixo nível para desempenho significativamente melhorado em
readdire operações relacionadas.Corrigido um problema em que um programa anormal listava o diretório raiz após a montagem do JindoFSx.
JindoData 4.5.0
Visão geral
A versão 4.5.0 foca no desempenho de operações de metadados para o sistema de armazenamento JindoFS, entregando melhorias significativas. O armazenamento em camadas do JindoFS foi aprimorado para suportar os tipos de armazenamento Acesso Pouco Frequente (IA) e Arquivo Frio. O suporte a gravação em lote foi adicionado para otimizar o desempenho de jobs ETL (extração, transformação e carregamento) em grande escala. Um SDK Java independente do Hadoop foi introduzido para SDKs e componentes do ecossistema.
Novos recursos e melhorias
Sistema de armazenamento JindoFS:
Operações de metadados otimizadas para desempenho significativamente melhorado.
Armazenamento em camadas aprimorado para suportar tipos de armazenamento IA e Arquivo Frio.
Adicionado suporte a gravação em lote para otimizar o desempenho de jobs ETL em grande escala.
Corrigido um problema em que o acesso ao OSS causava uma exceção de service devido a um erro de autorização no lado do servidor.
Sistema de aceleração de armazenamento JindoFSx:
Corrigido um vazamento de identificador de arquivo no service Storage.
Corrigido um problema de segurança de threads no relatório de métricas do lado do cliente.
Desempenho da criação recursiva de diretórios pai otimizado.
Desempenho do recurso de reescrita de caminho otimizado.
JindoSDK e ferramentas:
Suporta um algoritmo de pré-busca adaptativa para maior eficiência.
Suporta operações de renomeação atômica baseadas no Tablestore.
JindoDistCp: recurso
diffotimizado para suportar a saída de arquivos diff.Implementado tratamento unificado para erros de nova tentativa, resolvendo falhas de nova tentativa do cliente causadas por alterações no endereço IP do servidor.
Fornece um SDK Java independente do Hadoop com funcionalidade comparável ao SDK do Hadoop e ao SDK de Objetos.
Suporte POSIX do JindoFuse:
Corrigido um vazamento de memória causado por operações de lista quando o cache está ativado no JindoFSx.
Versões 4.4.x do JindoData
Visão geral
O JindoFS agora inclui recursos de armazenamento em camadas e arquivamento de dados. Aproveitando as capacidades de armazenamento em camadas do OSS e compatível com as políticas de armazenamento em camadas do HDFS, esse recurso permite atribuir políticas de armazenamento de menor custo a dados acessados com pouca frequência, reduzindo os custos totais de armazenamento. O JindoFS também adiciona suporte ao HDFS AuditLog, melhorando a compatibilidade de API, a paridade de recursos e as capacidades de migração de dados com o Apache HDFS. A importação rápida de dados para o OSS e a migração de instâncias semigerenciadas do JindoFS também foram aprimoradas. Os recursos do JindoFS são entregues por meio do service Alibaba Cloud OSS-HDFS. Para obter mais informações, consulte What is the OSS-HDFS service?.
O JindoFSx introduz o cache local do lado do cliente (LocalCache), fornecendo aceleração de cache exclusiva do cliente. Isso melhora significativamente o cache de metadados e aprimora a aceleração de cache para o Alibaba Cloud NAS.
Para SDKs e componentes do ecossistema, o desempenho e o throughput foram substancialmente melhorados em várias operações. O SDK de Objetos agora é suportado — compatível com as APIs de armazenamento de objetos do OSS, oferecendo melhor desempenho e integração perfeita com a aceleração de cache do JindoFSx. A ferramenta JindoDistJob foi introduzida para suportar a migração completa e incremental de metadados de arquivos do JindoFS semigerenciado, permitindo alternar para a solução baseada no service JindoFS sem migrar blocos de dados. O JindoDistCp foi bastante aprimorado para alcançar a migração sem perdas do Apache HDFS para o service JindoFS, incluindo metadados de arquivos.
Novos recursos e melhorias
Sistema de armazenamento JindoFS:
Suporta armazenamento em camadas e arquivamento de dados, compatível com políticas de armazenamento do HDFS.
Suporta
BatchImportpara importar dados de arquivos em lotes.Suporta HDFS AuditLog.
Suporta as APIs
ConcateSymLink.Processo de limpeza em segundo plano para dados de arquivos otimizado.
Desempenho de operações relacionadas a
LeaseeLockotimizado.
Sistema de aceleração de armazenamento JindoFSx:
Suporta plugins de cache com um modo de cache do lado do cliente.
Suporta autorização baseada em plugin. As dependências das bibliotecas KRB5 e SASL não são necessárias por padrão.
Desempenho do cache de metadados e aceleração de cache para o Alibaba Cloud NAS significativamente aprimorados.
JindoSDK e ferramentas:
Suporte HTTPS aprimorado e tolerância a falhas melhorada em ambientes de rede instáveis.
Removida a dependência padrão das bibliotecas KRB5 e SASL para facilitar a implantação.
Adicionado suporte para APIs de armazenamento de objetos do OSS, melhorando o desempenho das operações e integrando-se à aceleração de cache do JindoFSx.
Adicionada a ferramenta JindoDistJob para migração rápida de dados do JindoFS semigerenciado no modo Bloco para o service JindoFS.
O JindoDistCp agora suporta migração sem perdas de metadados de arquivos do Apache HDFS para o service JindoFS.
Suporte POSIX do JindoFuse:
Desempenho de leitura sequencial otimizado para arquivos grandes.
Versões 4.3.x do JindoData
Visão geral
O JindoData 4.3.0 adiciona suporte completo à arquitetura multicloud, entregando uma solução de armazenamento de data lake que abrange múltiplas nuvens, sistemas de armazenamento, extensões de aceleração, protocolos e linguagens de programação. O suporte POSIX no JindoFS foi significativamente aprimorado. O JindoFSx ganha seu primeiro suporte à extensão de segurança Kerberos+Ranger. O JindoSDK e as ferramentas do ecossistema apresentam melhorias substanciais na cobertura de testes.
Novos recursos e melhorias
JindoSDK e ferramentas:
Suporta armazenamento multicloud, incluindo Amazon S3, COS e OBS.
Fornece a ferramenta JindoTable.
Plugin do conector Flink otimizado.
JindoDistCp aprimorado.
Sistema de aceleração de armazenamento JindoFSx:
Suporta armazenamento multicloud, incluindo Amazon S3, COS e OBS.
Cache de dados e cache de metadados otimizados.
Suporta a solução de autorização Kerberos+Ranger.
Métricas de observabilidade significativamente aprimoradas.
Integrado ao Fluid.
Sistema de armazenamento JindoFS:
Suporta capacidades POSIX Lock e Fallocate.
Suporta atualizações para clusters executando versões mais antigas do JindoFS no modo Bloco.
Suporte POSIX do JindoFuse:
Adicionado suporte para APIs relacionadas a XAttr: Setxattr, Getxattr, Listxattr e Removexattr.
Suporta capacidades POSIX Lock e Fallocate.
Suporta objetos anexáveis no OSS: Append, Flush e leitura durante gravação.
Versões 4.2.x do JindoData
Visão geral
O JindoData 4.2.0 melhora significativamente o sistema de aceleração de armazenamento JindoFSx. Ele adiciona aceleração de cache para o Apache HDFS e armazenamento Alibaba Cloud NAS, além de aprimorar o JindoFuse, JindoDistCp e JindoTable.
Novos recursos e melhorias
Sistema de aceleração de armazenamento JindoFSx:
Suporta aceleração de cache transparente para o Alibaba Cloud Apache HDFS (o esquema
hdfs://permanece inalterado) e aceleração de montagem unificada (fsx://).Suporta aceleração de montagem unificada (
fsx://) para armazenamento Alibaba Cloud NAS.Totalmente integrado ao service Alibaba Cloud OSS-HDFS (service JindoFS) com suporte aprimorado ao caminho de gravação.
JindoSDK e ferramentas:
Introduz a primeira versão C/C++ do JindoSDK, fornecendo métodos de API semelhantes ao POSIX.
Suporta JindoFuse POSIX. O JindoFuse foi reconstruído sobre o JindoSDK C/C++.
Suporta migração de dados JindoDistCp. O JindoDistCp foi refatorado para melhorar a usabilidade e a robustez, removendo recursos menos usados da versão 3.x.
Suporta a ferramenta JindoTable. O JindoTable foi refatorado para melhorar a usabilidade e a robustez, removendo recursos menos usados da versão 3.x.
Versões 4.1.x do JindoData
Visão geral
O JindoData 4.1.0 introduz gravações aleatórias no service Alibaba Cloud OSS-HDFS (service JindoFS). Também lança o sistema de aceleração de armazenamento JindoFSx, que suporta cache distribuído para o Alibaba Cloud OSS nativo e o service OSS-HDFS.
Novos recursos
Sistema de armazenamento JindoFS:
Suporta gravações aleatórias de arquivos, permitindo que os arquivos sejam modificados após a criação.
Suporta a lixeira do HDFS. O backend limpa os arquivos com base no tempo de expiração.
Recurso de snapshot do HDFS aprimorado para suportar modificações aleatórias de arquivos.
Mecanismo de exclusão de diretórios aprimorado para desempenho operacional significativamente superior.
Implementado o framework NsWorker, que permite ao service global de metadados descarregar processamentos pesados para nós Follower e Learner.
Suporte CLI do JindoShell:
Defina o tempo de expiração para a lixeira do HDFS usando comandos.
Comando
dumpFileaprimorado para gerar informações sobre arquivos de gravação aleatória.
Suporte POSIX do JindoFuse:
Suporta modificação aleatória de arquivos (Seek e Write).
Sistema de aceleração de armazenamento JindoFSx:
Suporta aceleração de cache transparente para o Alibaba Cloud OSS (o esquema
oss://permanece inalterado).Suporta aceleração de cache transparente para o service Alibaba Cloud OSS-HDFS (service JindoFS) (o esquema
oss://permanece inalterado).Fornece um recurso de namespace unificado para montar o OSS ou OSS-HDFS no mesmo namespace para acesso unificado usando o prefixo
fsx://.Suporta aceleração de cache para metadados de arquivos em grande escala.
Suporta aceleração para cargas de trabalho de treinamento de arquivos pequenos.
Suporta aceleração P2P para melhorar o desempenho de leitura do cache quando muitos nós de treinamento pré-buscam e carregam arquivos de modelo simultaneamente.
Suporte Hadoop do JindoSDK:
Fornece
JindoOssFileSystempara aceleração de cache transparente para OSS e OSS-HDFS.Fornece
JindoFsxFileSystempara uso no modo de namespace unificado.
Suporte CLI do JindoShell:
Suporta comandos de cache de dados do JindoFSx.
Suporta comandos de cache de metadados do JindoFSx.
Suporta comandos de gerenciamento de namespace unificado do JindoFSx.
Suporte POSIX do JindoFuse:
Suporta a montagem de um caminho
oss://com Fuse para leituras e gravações no cache do JindoFSx.Suporta a montagem de um caminho
fsx://com Fuse para leituras e gravações no cache do JindoFSx.
Versões 4.0.x do JindoData
Visão geral
O JindoData 4.0.0 é a primeira versão após a atualização de arquitetura do componente original SmartData do Alibaba Cloud EMR (que atingiu a versão principal 3.8.0). Esta versão foca na integração com o Alibaba Cloud OSS e o service OSS-HDFS (service JindoFS).
O sistema de aceleração de armazenamento JindoFSx não está incluído no JindoData 4.0.0.
Novos recursos
Service Alibaba Cloud OSS:
Suporte Hadoop do JindoSDK:
Fornece um SDK Java Hadoop para o Alibaba Cloud OSS totalmente compatível com o conector Hadoop OSS e com desempenho significativamente superior.
Suporta múltiplos métodos de provedor de credenciais: configuração, Função ECS e o mecanismo sem credenciais do EMR.
Suporta arquivamento durante a gravação, incluindo os tipos de armazenamento Archive e Deep Cold Archive.
Suporte CLI do JindoShell:
Fornece extensões de comando adicionais para Hadoop e HDFS Shell voltadas para operações no OSS.
Suporta o comando estendido
ls2, que mostra o status de armazenamento (Standard, IA ou Archive) de um objeto no OSS junto com a saída padrão dols.Suporta o comando
archivepara operações de arquivamento no nível de diretório.Suporta o comando
restorepara operações de restauração no nível de diretório.
Suporte POSIX do JindoFuse:
Um cliente Fuse otimizado para o Alibaba Cloud OSS. A implementação em código nativo melhora significativamente o desempenho.
Migração de dados JindoDistCp:
Suporta a migração de dados de clusters HDFS autogerenciados para o Alibaba Cloud OSS, com otimizações para arquivos grandes e muitos arquivos pequenos.
Service Alibaba Cloud OSS-HDFS (service JindoFS):
Service JindoFS:
Adiciona uma nova opção de armazenamento de bucket para produtos Alibaba Cloud OSS. Fornece aceleração de metadados, é binariamente compatível e totalmente alinhado com os recursos do Apache HDFS, suportando migração lift-and-shift do HDFS.
Suporta nativamente a semântica de diretório do sistema de arquivos com operações de diretório significativamente otimizadas, incluindo renomeação atômica e em nível de milissegundos para diretórios extremamente grandes.
Suporta nativamente a semântica de arquivo do sistema de arquivos: leases de gravação HDFS, uma-gravação-múltiplas-leituras e leitura-durante-gravação.
Suporta operações
append,flush,syncetruncateem arquivos.Suporta snapshots HDFS com um número quase ilimitado de snapshots, facilitando backup de dados, recuperação de desastres e restauração.
Suporta permissões de arquivo. Importe e defina informações de grupo de usuários (UserGroupsMapping) usando comandos do JindoShell.
Suporta o mecanismo de controle de acesso de usuário proxy do Hadoop.
Suporte Hadoop do JindoSDK:
Acesso integrado ao service Alibaba Cloud OSS-HDFS (service JindoFS), fornecendo uma experiência abrangente de acesso à API HDFS.
Suporte CLI do JindoShell:
Fornece extensões de comando adicionais para Hadoop e HDFS Shell voltadas para operações do service OSS-HDFS.
Importe e defina informações de grupo de usuários (UserGroupsMapping) usando comandos.
Defina regras de usuário proxy do Hadoop usando comandos.
Suporte POSIX do JindoFuse:
Um cliente Fuse otimizado para o service Alibaba Cloud OSS-HDFS (service JindoFS). A implementação completa em código nativo melhora significativamente o desempenho.
Problemas conhecidos
O JindoSDK não suporta a gravação de arquivos maiores que 80 GB no OSS.
O JindoSDK não suporta gravação no OSS no modo append.
O JindoSDK não suporta criptografia baseada em cliente para o OSS.
O JindoSDK não suporta versões mais antigas do JindoFS no modo Bloco ou modo Cache.
O service Alibaba Cloud OSS-HDFS (service JindoFS) não suporta atualizações de sistema a partir de versões mais antigas do JindoFS no modo Bloco. Use a ferramenta de migração JindoDistCp para migrar dados do sistema antigo para o novo service.