OSS-HDFS (JindoFS) est une fonctionnalité de stockage de lac de données native du cloud offrant une gestion unifiée des métadonnées et une compatibilité totale avec l'API Hadoop Distributed File System (HDFS) pour les charges de travail de big data et d'IA.
Notes d'utilisation
Une fois le service OSS-HDFS activé pour un bucket, les données du service sont stockées dans le répertoire
.dlsdata/du bucket. N'effectuez pas d'opérations d'écriture, telles que le renommage ou la suppression, sur ce répertoire et ses objets en utilisant des méthodes autres que celles d'OSS-HDFS. Cela pourrait entraîner des interruptions de service ou une perte de données.Si votre compte présente un impayé ou si le rôle RAM dépendant
AliyunOSSDlsDefaultRoleest supprimé, le service en arrière-plan HDFS peut passer en mode sécurisé. En mode sécurisé, toutes les tâches en arrière-plan, telles que la journalisation d'audit, la suppression asynchrone et la hiérarchisation automatique du stockage, sont suspendues. Le service reprend automatiquement une fois le problème résolu.
Après avoir activé OSS-HDFS, l'écriture dans le répertoire .dlsdata/ via d'autres fonctionnalités OSS peut entraîner une perte, une corruption ou une inaccessibilité des données, comme décrit dans la section Prérequis.
Avantages
OSS-HDFS fonctionne avec les applications Hadoop et Spark existantes sans modification. Après une configuration de base, vous gérez les données comme avec HDFS natif, tout en bénéficiant des avantages d'OSS : capacité pratiquement illimitée, mise à l'échelle élastique, ainsi qu'une sécurité, une fiabilité et une disponibilité améliorées.
OSS-HDFS gère des exaoctets de données et des milliards de fichiers avec un débit de l'ordre du téraoctet. Au-delà de l'espace de noms plat du stockage d'objets standard, il fournit un espace de noms hiérarchique qui organise les objets en répertoires, avec une conversion automatique de l'espace de noms grâce à une gestion unifiée des métadonnées. Au lieu de la redondance NameNode actif-passif traditionnelle d'HDFS, OSS-HDFS utilise une redondance actif-actif multi-nœuds pour une résilience supérieure. Les utilisateurs Hadoop accèdent aux données aussi efficacement que sur un HDFS local, sans réplication ni conversion, ce qui améliore les performances des jobs et réduit les coûts de maintenance.
Fonctionnalités
|
Fonctionnalité |
Description |
Références |
|
RootPolicy |
Configurez un préfixe personnalisé pour OSS-HDFS afin que les jobs s'exécutent sans modifier leur préfixe d'accès |
|
|
ProxyUser |
Autorisez un utilisateur à effectuer des opérations sur le système de fichiers pour le compte d'autres utilisateurs, par exemple pour accéder à des données sensibles. |
|
|
UserGroupsMapping |
Configurez les mappages entre les utilisateurs et les groupes d'utilisateurs. |
UserGroupsMapping (Gérer les mappages d'utilisateurs et de groupes) |
Cas d'utilisation
OSS-HDFS prend en charge les cas d'utilisation de big data et d'IA suivants :
Hive et Spark
OSS-HDFS convient aux entrepôts de données hors ligne construits avec Hive et Spark. Il prend nativement en charge la sémantique des fichiers et des répertoires, les autorisations, les opérations atomiques sur les répertoires, les renommages au niveau de la milliseconde, setTimes, les attributs étendus (XAttrs), les listes de contrôle d'accès (ACL) et l'accélération par cache de lecture local. Pour les charges de travail ETL, OSS-HDFS offre des performances nettement supérieures à celles des buckets OSS standards.
OLAP
OSS-HDFS prend en charge les opérations append, truncate, flush, sync et pwrite avec une prise en charge POSIX complète via JindoFuse. Cela vous permet de remplacer les disques locaux dans les scénarios OLAP (tels que ClickHouse) pour découpler le stockage et le calcul. La mise en cache intégrée accélère les performances.
Découplage HBase
OSS-HDFS prend nativement en charge la sémantique des fichiers et des répertoires ainsi que les opérations flush, ce qui lui permet de remplacer HDFS dans une architecture de stockage et de calcul découplée pour HBase. Contrairement à OSS standard, cela stocke le journal des transactions anticipées (WAL) directement dans OSS-HDFS, simplifiant ainsi l'architecture. Utiliser OSS-HDFS comme stockage sous-jacent pour HBase.
Calcul en temps réel
OSS-HDFS prend en charge les opérations flush et truncate et remplace HDFS de manière transparente pour les puits de données et les points de contrôle dans le calcul en temps réel Flink.
Migration de données
OSS-HDFS permet une migration fluide des données HDFS depuis les environnements sur site vers le cloud, réduisant les coûts de stockage grâce à la mise à l'échelle élastique et à la tarification au paiement à l'utilisation. JindoDistCp migre les données HDFS (y compris les attributs de fichier et les métadonnées) vers OSS-HDFS et fournit une comparaison rapide des données à l'aide des sommes de contrôle HDFS.