Tous les produits
Search
Centre de documentation

Realtime Compute for Apache Flink:Notes de version du 4 mars 2022

Dernière mise à jour :Aug 19, 2026

Cette rubrique décrit les principales mises à jour fonctionnelles et les corrections de bugs apportées à Realtime Compute for Apache Flink, publiées le 4 mars 2022.

Vue d'ensemble

Le 4 mars 2022, nous avons publié Ververica Runtime (VVR) 4.0.12, basé sur Apache Flink 1.13. Cette nouvelle version prend en charge l'évolution adaptative des schémas JSON pour les pipelines courants Kafka->Flink->Hologres. Pour Data Lake Formation, nous avons publié un connecteur Hudi de niveau entreprise. Afin d'améliorer l'efficacité du développement, nous mettons à disposition plus de 20 modèles de jobs Flink SQL courants. Pour renforcer les services d'exploitation et de maintenance (O&M), nous proposons des outils puissants de diagnostic des jobs ainsi que la possibilité d'ajuster dynamiquement les niveaux de journalisation sans interrompre les jobs. Cette version intègre également de nombreuses fonctionnalités de traitement des données performantes, telles que des fonctionnalités de niveau entreprise pour ClickHouse, de nouveaux connecteurs et une nouvelle syntaxe pour l'ingestion dans les entrepôts de données et les data lakes. Par ailleurs, cette nouvelle version corrige plusieurs bugs résolus par la communauté open source Apache Flink.

Nouvelles fonctionnalités

Fonctionnalité

Détails

Références

Évolution adaptative des schémas JSON pour Hologres

JSON est l'un des formats d'événement les plus courants dans le traitement de flux. Pour les jobs de streaming en temps réel et les tables du moteur de stockage backend, l'évolution du schéma doit être un processus transparent.

Cette nouvelle version inclut les améliorations suivantes :

  • Définissez le schéma de table en fonction du schéma JSON avant la consommation des données.

  • Si le schéma JSON change pendant la consommation des données, le schéma de la table Hologres backend évolue en conséquence.

Capacités renforcées pour la construction de data lakes Iceberg et Hudi

  • Prise en charge d'Alibaba Cloud Data Lake Formation (DLF) en tant que catalogue.

    Un catalogue DLF vous permet d'accéder à Hudi, Iceberg et à d'autres moteurs pris en charge par DLF afin de construire rapidement un data lake en temps réel.

  • Un connecteur Hudi intégré de niveau entreprise pour Realtime Compute for Apache Flink réduit la complexité de l'O&M.

    • Ingérez des bases de données entières dans un data lake à l'aide de Flink CDC et synchronisez automatiquement les modifications de schéma de table.

    • Intégrez des composants tels qu'Alibaba Cloud OSS et DLF pour améliorer la connectivité des données entre les moteurs de calcul.

Amélioration de l'expérience utilisateur pour la consultation et la configuration des journaux

  • Ajout de la pagination des journaux.

    Dans l'onglet Job Explorer, la pagination des journaux empêche l'échec de l'ouverture de la page lorsque les journaux deviennent trop volumineux pour les jobs exécutés sur une longue durée.

  • Prise en charge de la modification dynamique du niveau de journalisation.

    Sans redémarrer un job, modifiez dynamiquement le niveau de journalisation d'un TaskManager (TM) en cours d'exécution depuis l'onglet Job Explorer pour faciliter le dépannage.

  • Prise en charge de la consultation des journaux des TM ayant échoué.

    Dans l'onglet Job Explorer, consultez les journaux des TM qui ont échoué alors que le JobManager (JM) est toujours en cours d'exécution. Cela vous aide à identifier la cause des échecs des TM.

Plusieurs fonctionnalités de niveau entreprise pour Flink et ClickHouse

  • Prise en charge de la sémantique exactly-once.

    Fournit une sémantique exactly-once pour le composant ClickHouse dans la plateforme big data open source E-MapReduce, et non pour le produit ClickHouse cloud.

  • Prise en charge du type Nested de ClickHouse.

    Le type Nested de ClickHouse peut être mappé au type Array de Flink.

  • Prise en charge de l'écriture directe dans les tables locales d'une table distribuée ClickHouse.

    L'écriture directe dans les tables locales d'une table distribuée peut augmenter considérablement le débit d'écriture pour la table distribuée ClickHouse.

Tables de destination ClickHouse

Optimisation des règles et de l'interface de diagnostic des jobs

  • Ajout de plus de 20 nouvelles règles de diagnostic pour analyser de manière exhaustive l'état d'exécution des jobs.

    Propose des alertes de niveau de risque élevé, moyen et faible en fonction de l'état réel du job.

  • L'interface de diagnostic est optimisée pour vous aider à mieux identifier les problèmes.

Diagnostic intelligent des jobs

La synchronisation des données prend en charge l'ajout de colonnes calculées

L'instruction CTAS prend en charge l'ajout d'une colonne calculée à une table source et la définition de la nouvelle colonne comme clé primaire de la table de destination.

Lors de l'ingestion de données dans un entrepôt de données ou un data lake, l'instruction CTAS vous permet de spécifier la position d'une nouvelle colonne calculée et d'en faire une colonne physique dans la table de destination. Les résultats de la colonne calculée sont synchronisés avec la table de destination en temps réel. L'instruction CTAS prend également en charge la modification de la clé primaire de la table de destination vers la nouvelle colonne calculée.

Instructions CREATE TABLE AS (CTAS)

Génération simplifiée des données de test

Ajout d'un connecteur générateur de données simulées.

Le connecteur générateur de données simulées vous aide à générer facilement des données de test pertinentes pour vos scénarios métier. Cela répond à vos besoins de vérification de la logique métier lors du développement et des tests.

Nouveau Template Hub pour accélérer le développement des jobs

  • Mise à disposition de plus de 20 modèles de code.

    Plus de 20 modèles pour les scénarios Flink SQL courants vous aident à apprendre rapidement à écrire du code de job avec Flink SQL.

  • Mise à disposition d'un modèle de synchronisation des données de MySQL vers Hologres.

    Créez rapidement des jobs Flink CDC pour effectuer la synchronisation des données destinée à l'entreposage et à l'ingestion dans les data lakes.

Affichage plus clair de l'utilisation des ressources

Dans le coin inférieur gauche de la console de développement Flink, l'utilisation du CPU et de la mémoire pour le projet actuel est affichée. Cela vous aide à gérer rapidement les ressources du projet.

Aucune

Localisation rapide des journaux pour les nœuds de checkpoint lents

Dans l'historique des snapshots, vous pouvez désormais trier les états des snapshots des nœuds. Vous pouvez également accéder directement aux journaux TM depuis l'interface de l'historique des snapshots en un seul clic pour afficher la cause des checkpoints lents.

Localiser les checkpoints lents et consulter les journaux des TaskManagers correspondants

Prise en charge des tables de destination et des tables de dimension AnalyticDB for PostgreSQL

  • Flink prend en charge l'écriture de données dans les tables de destination AnalyticDB for PostgreSQL.

  • Flink prend en charge la jointure avec AnalyticDB for PostgreSQL pour les requêtes de recherche.

Amélioration de l'expérience utilisateur du backend d'état de niveau entreprise

  • Ajout de la capacité d'optimiser les paramètres en temps réel. Cela minimise la complexité et le coût du réglage manuel et peut éliminer le besoin de réglage manuel des paramètres dans plus de 95 % des cas.

  • Le débit monocœur augmente de 10 % à 40 %. Cela vous aide à gérer facilement les scénarios fluctuants tels que les pics et les creux de trafic.

Optimisations des performances

Le backend d'état de niveau entreprise de cette nouvelle version inclut de nombreuses optimisations. Il améliore considérablement les performances des jobs de jointure à deux flux ou multi-flux. L'utilisation moyenne des ressources de calcul peut être augmentée de 50 %, et de 100 % à 200 % dans les scénarios typiques. Cela vous aide à exécuter plus fluidement les applications de calcul de flux avec état.

Corrections de bugs

  • Optimisation du service Catalog pour résoudre un problème d'échec d'actualisation lorsque le nombre de bases de données ou de tables était élevé.

  • Correction d'un problème où la version Flink n'était pas affichée pour les clusters de session.

  • Correction d'un problème d'affichage de la courbe WatermarkLag sur la page Metrics.

  • Optimisation de l'affichage paginé des courbes sur la page Metrics.

  • Correction de problèmes liés à Flink CDC, notamment la métrique currentFetchEventTimeLag et les conflits de classes.

  • Correction d'un problème empêchant l'utilisation de la syntaxe CTAS pour modifier les colonnes existantes.