O dataflow do Cloud Parallel File Storage (CPFS) sincroniza dados entre sistemas de arquivos CPFS e buckets do Object Storage Service (OSS). Crie tarefas de dataflow para importar, exportar ou excluir dados entre os dois serviços de armazenamento.
Visão geral
Após a criação de um dataflow entre um fileset do CPFS e um bucket do OSS, o sistema de arquivos CPFS sincroniza automaticamente os metadados dos objetos desse bucket. Assim, você acessa e processa dados do OSS por meio de interfaces de arquivo de alto desempenho compatíveis com POSIX. Também é possível exportar dados para buckets do OSS pelo console do CPFS ou chamando operações da OpenAPI.
-
Carregamento sob demanda
Ao acessar um diretório ou arquivo em um sistema de arquivos CPFS vinculado a um bucket do OSS, o sistema carrega automaticamente os metadados ou dados necessários sob demanda. Por exemplo, executar o comando ls em um diretório vinculado aciona o carregamento de metadados do OSS. O acesso a um arquivo dispara o carregamento dos blocos de dados correspondentes do OSS.
-
Importação e exportação de dados
Crie tarefas de dataflow para importar ou exportar dados entre o CPFS e o OSS. Dessa forma, os dados são sincronizados com o sistema de arquivos CPFS de alto desempenho antes do início dos jobs de computação. O CPFS permite importar e exportar árvores inteiras de diretórios ou listas específicas de arquivos. Após a conclusão da tarefa, consulte o relatório para obter detalhes da execução.
ImportanteO CPFS exporta metadados para os metadados personalizados de um objeto do OSS. Esses metadados recebem o nome
x-oss-meta-afm-xxx. Não exclua nem modifique esses metadados, pois isso pode causar erros nos metadados do sistema de arquivos.Os relatórios de tarefas servem apenas como referência. O estado final dos dados no destino é o registro definitivo. Verifique a consistência dos dados entre a origem e o destino após a conclusão do dataflow.
-
Atualização automática de metadados
Ao ativar a atualização automática de metadados, o CPFS monitora eventos de modificação de dados no OSS e sincroniza os metadados atualizados com o sistema de arquivos CPFS. Isso garante consistência eventual entre o CPFS e o OSS, além de reduzir custos de O&M.
-
Dimensionamento elástico
Ajuste a largura de banda do dataflow conforme necessário. Aumente a largura de banda durante picos de tráfego e reduza-a em períodos de menor demanda.
Limites
-
Fileset
Filesets têm suporte apenas no CPFS 2.2.0 e versões posteriores.
Um único sistema de arquivos CPFS aceita no máximo 10 filesets.
Um fileset pode ser vinculado a um diretório com até oito níveis de profundidade dentro do sistema de arquivos CPFS.
Um fileset pode conter no máximo 1 milhão de arquivos ou diretórios.
Não há suporte para filesets aninhados.
-
Dataflows
Dataflows têm suporte apenas no CPFS 2.2.0 e versões posteriores.
Um único sistema de arquivos CPFS aceita no máximo 10 dataflows.
Um único dataflow pode ter no máximo cinco diretórios de atualização automática.
Um fileset em um sistema de arquivos CPFS pode ser vinculado a apenas um bucket do OSS.
Os registros de tarefas de dataflow são retidos por no máximo 90 dias.
Os relatórios de tarefas de dataflow são armazenados no sistema de arquivos CPFS e consomem espaço de armazenamento. É possível armazenar no máximo 1 milhão de relatórios.
Não há suporte para dataflows entre regiões. O sistema de arquivos CPFS e o bucket do OSS devem estar na mesma região.
-
Limites de dataflow em sistemas de arquivos
Evite renomear diretórios não vazios em um fileset associado a um dataflow. Essa ação pode gerar um erro
Permission Deniedou "directory not empty".Dataflows não aceitam objetos Archive ou Cold Archive no OSS.
Tenha cuidado ao usar caracteres especiais em nomes de diretórios e arquivos. Os caracteres permitidos incluem letras maiúsculas e minúsculas, dígitos, pontos de exclamação (!), hifens (-), sublinhados (_), pontos (.), asteriscos (*) e parênteses ().
Não há suporte para caminhos longos. O comprimento máximo do caminho para um dataflow é de 1.023 caracteres.
-
Limites na exportação de dados
Dataflows não aceitam a exportação de hard links ou links simbólicos para um bucket do OSS.
Não é possível exportar diretórios vazios para um bucket do OSS via dataflow.
Propriedades ChangeTime não são exportadas para buckets do OSS.
Na exportação de dados esparsos, os buracos com valor zero são preenchidos antes que os dados sejam enviados ao bucket do OSS.
-
Limites na atualização automática de metadados
O recurso de atualização automática de metadados está disponível apenas nas seguintes regiões: China (Hangzhou), China (Chengdu), China (Shanghai), China (Shenzhen), China (Zhangjiakou) e China (Beijing).
Procedimento
Crie um fileset do CPFS. Para mais informações, consulte Criar um fileset.
Crie um dataflow. Para mais informações, consulte Criar um dataflow.
Crie uma tarefa de importação, exportação ou exclusão de dados. Para mais informações, consulte Criar uma tarefa de dataflow.
-
Verifique os dados. Após a conclusão da tarefa de dataflow, confirme se os dados no destino estão corretos.
AvisoSe você excluir os dados de origem antes de confirmar que a transferência para o destino ocorreu corretamente, será o único responsável por qualquer perda de dados resultante e todas as suas consequências.
Métricas de desempenho
Tipo de operação
Métrica
Descrição
Importação de dados
Throughput para arquivos maiores que 1 GB
-
Throughput de importação de arquivo único: 200 MB/s.
-
O throughput de importação de vários arquivos pode atingir a largura de banda configurada.
OPS para arquivos na escala de megabytes
Importação de diretório único e múltiplos diretórios: 1.000.
Exportação de dados
Throughput para arquivos maiores que 1 GB
-
Throughput de exportação de arquivo único: 200 MB/s.
-
O throughput de exportação de vários arquivos pode atingir a largura de banda configurada.
OPS para arquivos na escala de megabytes
Exportação de diretório único e múltiplos diretórios: 600.
Exclusão de dados
OPS
Exclusão de diretório único e múltiplos diretórios: 2.000.
Carregamento sob demanda (lazy load)
Throughput para arquivos maiores que 1 GB
-
Throughput de importação de arquivo único: 200 MB/s.
-
O throughput de importação de vários arquivos pode atingir a largura de banda configurada.
OPS para arquivos na escala de megabytes
Importação de diretório único e múltiplos diretórios: 1.000.
Atualização automática de metadados
OPS
-
Dataflow a 600 MB/s: 2.000.
-
Dataflow a 1.200 MB/s: 3.000.
-
Dataflow a 1.500 MB/s: 4.000.