Tous les produits
Search
Centre de documentation

Object Storage Service:Qu'est-ce qu'OSS-HDFS ?

Dernière mise à jour :Aug 18, 2026

OSS-HDFS (JindoFS) est une fonctionnalité de stockage de lac de données native du cloud offrant une gestion unifiée des métadonnées et une compatibilité totale avec l'API Hadoop Distributed File System (HDFS) pour les charges de travail de big data et d'IA.

Notes d'utilisation

Avertissement
  • Une fois le service OSS-HDFS activé pour un bucket, les données du service sont stockées dans le répertoire .dlsdata/ du bucket. N'effectuez pas d'opérations d'écriture, telles que le renommage ou la suppression, sur ce répertoire et ses objets en utilisant des méthodes autres que celles d'OSS-HDFS. Cela pourrait entraîner des interruptions de service ou une perte de données.

  • Si votre compte présente un impayé ou si le rôle RAM dépendant AliyunOSSDlsDefaultRole est supprimé, le service en arrière-plan HDFS peut passer en mode sécurisé. En mode sécurisé, toutes les tâches en arrière-plan, telles que la journalisation d'audit, la suppression asynchrone et la hiérarchisation automatique du stockage, sont suspendues. Le service reprend automatiquement une fois le problème résolu.

Après avoir activé OSS-HDFS, l'écriture dans le répertoire .dlsdata/ via d'autres fonctionnalités OSS peut entraîner une perte, une corruption ou une inaccessibilité des données, comme décrit dans la section Prérequis.

Avantages

OSS-HDFS fonctionne avec les applications Hadoop et Spark existantes sans modification. Après une configuration de base, vous gérez les données comme avec HDFS natif, tout en bénéficiant des avantages d'OSS : capacité pratiquement illimitée, mise à l'échelle élastique, ainsi qu'une sécurité, une fiabilité et une disponibilité améliorées.

OSS-HDFS gère des exaoctets de données et des milliards de fichiers avec un débit de l'ordre du téraoctet. Au-delà de l'espace de noms plat du stockage d'objets standard, il fournit un espace de noms hiérarchique qui organise les objets en répertoires, avec une conversion automatique de l'espace de noms grâce à une gestion unifiée des métadonnées. Au lieu de la redondance NameNode actif-passif traditionnelle d'HDFS, OSS-HDFS utilise une redondance actif-actif multi-nœuds pour une résilience supérieure. Les utilisateurs Hadoop accèdent aux données aussi efficacement que sur un HDFS local, sans réplication ni conversion, ce qui améliore les performances des jobs et réduit les coûts de maintenance.

Fonctionnalités

Fonctionnalité

Description

Références

RootPolicy

Configurez un préfixe personnalisé pour OSS-HDFS afin que les jobs s'exécutent sans modifier leur préfixe d'accès hdfs:// d'origine.

Accéder à OSS-HDFS en utilisant RootPolicy

ProxyUser

Autorisez un utilisateur à effectuer des opérations sur le système de fichiers pour le compte d'autres utilisateurs, par exemple pour accéder à des données sensibles.

ProxyUser (Configurer un utilisateur proxy)

UserGroupsMapping

Configurez les mappages entre les utilisateurs et les groupes d'utilisateurs.

UserGroupsMapping (Gérer les mappages d'utilisateurs et de groupes)

Cas d'utilisation

OSS-HDFS prend en charge les cas d'utilisation de big data et d'IA suivants :

Hive et Spark

OSS-HDFS convient aux entrepôts de données hors ligne construits avec Hive et Spark. Il prend nativement en charge la sémantique des fichiers et des répertoires, les autorisations, les opérations atomiques sur les répertoires, les renommages au niveau de la milliseconde, setTimes, les attributs étendus (XAttrs), les listes de contrôle d'accès (ACL) et l'accélération par cache de lecture local. Pour les charges de travail ETL, OSS-HDFS offre des performances nettement supérieures à celles des buckets OSS standards.

OLAP

OSS-HDFS prend en charge les opérations append, truncate, flush, sync et pwrite avec une prise en charge POSIX complète via JindoFuse. Cela vous permet de remplacer les disques locaux dans les scénarios OLAP (tels que ClickHouse) pour découpler le stockage et le calcul. La mise en cache intégrée accélère les performances.

Découplage HBase

OSS-HDFS prend nativement en charge la sémantique des fichiers et des répertoires ainsi que les opérations flush, ce qui lui permet de remplacer HDFS dans une architecture de stockage et de calcul découplée pour HBase. Contrairement à OSS standard, cela stocke le journal des transactions anticipées (WAL) directement dans OSS-HDFS, simplifiant ainsi l'architecture. Utiliser OSS-HDFS comme stockage sous-jacent pour HBase.

Calcul en temps réel

OSS-HDFS prend en charge les opérations flush et truncate et remplace HDFS de manière transparente pour les puits de données et les points de contrôle dans le calcul en temps réel Flink.

Migration de données

OSS-HDFS permet une migration fluide des données HDFS depuis les environnements sur site vers le cloud, réduisant les coûts de stockage grâce à la mise à l'échelle élastique et à la tarification au paiement à l'utilisation. JindoDistCp migre les données HDFS (y compris les attributs de fichier et les métadonnées) vers OSS-HDFS et fournit une comparaison rapide des données à l'aide des sommes de contrôle HDFS.

Moteurs pris en charge

Écosystème

Moteur/Plateforme

Références

écosystème open source

Flink

Utiliser Flink open source avec JindoSDK pour traiter les données dans OSS-HDFS

Flume

Utiliser Flume avec JindoSDK pour écrire des données dans OSS-HDFS

Hadoop

Utiliser Hadoop avec JindoSDK pour accéder à OSS-HDFS

HBase

Utiliser OSS-HDFS comme stockage sous-jacent pour HBase

Hive

Utiliser Hive avec JindoSDK pour traiter les données dans OSS-HDFS

Impala

Utiliser Impala avec JindoSDK pour interroger les données dans OSS-HDFS

Presto

Utiliser Trino avec JindoSDK pour interroger les données dans OSS-HDFS

Spark

Utiliser Spark avec JindoSDK pour interroger les données dans OSS-HDFS

écosystème Alibaba Cloud

EMR

Accéder à OSS-HDFS depuis Hive ou Spark sur EMR

Flink

Flume

Utiliser Flume pour synchroniser les données d'un cluster Kafka EMR vers OSS-HDFS

HBase

Utiliser OSS-HDFS comme stockage sous-jacent pour HBase sur un cluster EMR

Hive

Utiliser Hive sur un cluster EMR pour traiter les données dans OSS-HDFS

Impala

Utiliser Impala sur un cluster EMR pour interroger les données dans OSS-HDFS

Presto

Utiliser Trino sur un cluster EMR pour interroger les données dans OSS-HDFS

Spark

Utiliser Spark sur un cluster EMR pour traiter les données dans OSS-HDFS

Sqoop

Utiliser Sqoop sur un cluster EMR pour lire et écrire des données dans OSS-HDFS