Cette rubrique décrit les principales mises à jour fonctionnelles et les corrections de bugs apportées à Realtime Compute for Apache Flink, publiées le 4 mars 2022.
Vue d'ensemble
Le 4 mars 2022, nous avons publié Ververica Runtime (VVR) 4.0.12, basé sur Apache Flink 1.13. Cette nouvelle version prend en charge l'évolution adaptative des schémas JSON pour les pipelines courants Kafka->Flink->Hologres. Pour Data Lake Formation, nous avons publié un connecteur Hudi de niveau entreprise. Afin d'améliorer l'efficacité du développement, nous mettons à disposition plus de 20 modèles de jobs Flink SQL courants. Pour renforcer les services d'exploitation et de maintenance (O&M), nous proposons des outils puissants de diagnostic des jobs ainsi que la possibilité d'ajuster dynamiquement les niveaux de journalisation sans interrompre les jobs. Cette version intègre également de nombreuses fonctionnalités de traitement des données performantes, telles que des fonctionnalités de niveau entreprise pour ClickHouse, de nouveaux connecteurs et une nouvelle syntaxe pour l'ingestion dans les entrepôts de données et les data lakes. Par ailleurs, cette nouvelle version corrige plusieurs bugs résolus par la communauté open source Apache Flink.
Nouvelles fonctionnalités
Fonctionnalité | Détails | Références |
Évolution adaptative des schémas JSON pour Hologres | JSON est l'un des formats d'événement les plus courants dans le traitement de flux. Pour les jobs de streaming en temps réel et les tables du moteur de stockage backend, l'évolution du schéma doit être un processus transparent. Cette nouvelle version inclut les améliorations suivantes :
| |
Capacités renforcées pour la construction de data lakes Iceberg et Hudi |
| |
Amélioration de l'expérience utilisateur pour la consultation et la configuration des journaux |
| |
Plusieurs fonctionnalités de niveau entreprise pour Flink et ClickHouse |
| |
Optimisation des règles et de l'interface de diagnostic des jobs |
| |
La synchronisation des données prend en charge l'ajout de colonnes calculées | L'instruction CTAS prend en charge l'ajout d'une colonne calculée à une table source et la définition de la nouvelle colonne comme clé primaire de la table de destination. Lors de l'ingestion de données dans un entrepôt de données ou un data lake, l'instruction CTAS vous permet de spécifier la position d'une nouvelle colonne calculée et d'en faire une colonne physique dans la table de destination. Les résultats de la colonne calculée sont synchronisés avec la table de destination en temps réel. L'instruction CTAS prend également en charge la modification de la clé primaire de la table de destination vers la nouvelle colonne calculée. | |
Génération simplifiée des données de test | Ajout d'un connecteur générateur de données simulées. Le connecteur générateur de données simulées vous aide à générer facilement des données de test pertinentes pour vos scénarios métier. Cela répond à vos besoins de vérification de la logique métier lors du développement et des tests. | |
Nouveau Template Hub pour accélérer le développement des jobs |
| |
Affichage plus clair de l'utilisation des ressources | Dans le coin inférieur gauche de la console de développement Flink, l'utilisation du CPU et de la mémoire pour le projet actuel est affichée. Cela vous aide à gérer rapidement les ressources du projet. | Aucune |
Localisation rapide des journaux pour les nœuds de checkpoint lents | Dans l'historique des snapshots, vous pouvez désormais trier les états des snapshots des nœuds. Vous pouvez également accéder directement aux journaux TM depuis l'interface de l'historique des snapshots en un seul clic pour afficher la cause des checkpoints lents. | Localiser les checkpoints lents et consulter les journaux des TaskManagers correspondants |
Prise en charge des tables de destination et des tables de dimension AnalyticDB for PostgreSQL |
| |
Amélioration de l'expérience utilisateur du backend d'état de niveau entreprise |
|
Optimisations des performances
Le backend d'état de niveau entreprise de cette nouvelle version inclut de nombreuses optimisations. Il améliore considérablement les performances des jobs de jointure à deux flux ou multi-flux. L'utilisation moyenne des ressources de calcul peut être augmentée de 50 %, et de 100 % à 200 % dans les scénarios typiques. Cela vous aide à exécuter plus fluidement les applications de calcul de flux avec état.
Corrections de bugs
Optimisation du service Catalog pour résoudre un problème d'échec d'actualisation lorsque le nombre de bases de données ou de tables était élevé.
Correction d'un problème où la version Flink n'était pas affichée pour les clusters de session.
Correction d'un problème d'affichage de la courbe WatermarkLag sur la page Metrics.
Optimisation de l'affichage paginé des courbes sur la page Metrics.
Correction de problèmes liés à Flink CDC, notamment la métrique currentFetchEventTimeLag et les conflits de classes.
Correction d'un problème empêchant l'utilisation de la syntaxe CTAS pour modifier les colonnes existantes.