La version VVR 11.6.0 introduit des fonctions d'IA multimodale (PDF, images), le type Variant pour les données semi-structurées et promeut Data Ingestion (Flink CDC) en disponibilité générale (GA). Elle améliore également les connecteurs Kafka, MySQL CDC, OceanBase, Elasticsearch et Hologres, et intègre les correctifs communautaires d'Apache Flink 1.20.2 et 1.20.3.
Ce déploiement s'effectue par vagues dans toutes les régions. Si votre compte n'a pas encore été mis à niveau, ces fonctionnalités ne sont pas disponibles. Pour demander une mise à niveau accélérée, soumettez un ticket.
Améliorations du moteur
IA
De nouvelles fonctions intégrées permettent le traitement en temps réel des images et des documents :
Conversion PDF en image — convertissez les pages PDF en images directement au sein d'un job Flink.
Récupération de fichiers — lisez le contenu des fichiers directement depuis OSS et Message Notification Service (MNS).
Détection de la netteté des images — évaluez la netteté des images à l'aide d'OpenCV.
Compression d'images — réduisez la taille des images à la volée.
Transfert d'images Base64 — transmettez des images encodées en Base64 aux appels de modèles en aval.
Ces fonctions prennent en charge des pipelines d'inférence de bout en bout avec des modèles de langage visuel (VLM) tels que Qwen-VL.
Connecteur Simple Message Queue (MNS)
Un nouveau connecteur MNS vous permet de vous abonner aux événements de modification d'OSS, bouclant ainsi la boucle des pipelines multimodaux en temps réel.
Flink SQL
Type Variant
Le nouveau type VARIANT gère les données semi-structurées sans schéma fixe. Accédez aux champs via la notation par point (variant.field) ou la notation entre crochets (variant['key']), convertissez-les vers et depuis des types de base, et écrivez des colonnes Variant dans des puits Paimon.
Nouvelles fonctions
parse_json— convertit une chaîne JSON en valeur Variant (disponible dans Flink CDCTransform).MD5 et autres fonctions de hachage — disponibles dans Flink CDC
Transform.
Data Ingestion (Flink CDC) — désormais en GA
Data Ingestion (Flink CDC) est sorti de l'aperçu public et est désormais en disponibilité générale (GA).
Statut GA des connecteurs
|
Statut |
Connecteurs |
|
Généralement disponible |
Paimon, StarRocks, Hologres, MySQL, Kafka |
|
Aperçu public |
Doris, OceanBase, MaxCompute, SLS, MongoDB, Postgres |
Nouveautés de cette version
Fusion de colonnes
Fusionnez plusieurs champs amont portant des noms ou des casses différents en une seule colonne cible. Cette fonctionnalité prend en charge la correspondance par expression régulière, la normalisation de la casse et les mappages personnalisés, ce qui s'avère utile pour consolider des sources JSON dont les champs sont nommés de manière incohérente.
Écritures en mode ajout seul dans les tables partitionnées Paimon
Le puit Paimon écrit désormais dans des tables partitionnées sans clé primaire. Auparavant, la clé de partition devait faire partie de la clé primaire ; cette exigence est supprimée pour les cas d'utilisation en mode ajout seul.
Si vous dépendez actuellement de l'ancien comportement, vérifiez la configuration de votre puit Paimon après la mise à niveau.
Améliorations de Transform
Effacez une clé primaire ou une clé de partition en transmettant une valeur
null.Définissez un routage complexe des noms de table à l'aide d'expressions régulières.
Prise en charge du type Variant
Accédez aux champs de type
VARIANTet convertissez-les ; écrivez des données Variant dans Paimon.
Améliorations des sources
Source PolarDB-X CDC (aperçu public) — abonnement au journal des transactions binaires (binlog) avec parallélisme élevé au niveau de la table, et abonnement par dimension de table.
Source SLS — imposez des types d'analyse spécifiques pour les champs.
Source Kafka — divisez un seul message Kafka en plusieurs enregistrements selon les valeurs des champs (routage par champ) et écrivez-les dans différentes tables cibles. Les partitionneurs personnalisés sont également pris en charge.
Améliorations des puits
|
Puit |
Amélioration |
|
Paimon |
Configuration distincte du parallélisme pour les nœuds de validation |
|
MaxCompute |
Mappage du type DATETIME ; logique de validation optimisée pour réduire la consommation de requêtes par seconde (QPS) |
|
Iceberg |
Références de catalogue intégrées ; récupération automatique des URL de connexion et des identifiants |
Connecteurs
Kafka
Le puit écrit des ID de table en trois parties (
Database.Schema.Table) au format JSON Debezium.Après un changement de topic, un redémarrage avec état déclenche désormais une exception d'état incompatible au lieu de consommer silencieusement depuis l'ancien et le nouveau topic. Cela évite la double consommation et les incohérences de données.
Si vos jobs dépendent d'un redémarrage après un changement de topic, examinez ce comportement avant la mise à niveau.
MySQL CDC
Les messages d'erreur liés aux identifiants globaux de transaction (GTID) expirés indiquent désormais clairement la cause racine.
L'ID serveur du consommateur est inclus dans les journaux pour simplifier le dépannage.
PolarDB-X
Désormais pris en charge en tant que source CDC YAML (aperçu public).
OceanBase
Le puit JDBC prend désormais en charge les annulations manuelles de transaction et la réutilisation du pool de connexions, résolvant ainsi les déconnexions fréquentes causées par wait_timeout.
Elasticsearch
La table source et la table de dimension prennent désormais en charge Elasticsearch 8.x (via le client compatible ES7).
Doris
Les messages d'erreur liés aux configurations de port incorrectes sont désormais plus explicites.
Intégration Data Lakehouse
Iceberg
Le puit prend désormais en charge la métrique
numRecordsOutOfSinkPerSecond(OUT RPS).Les paramètres liés à Hadoop peuvent être configurés pour offrir une plus grande flexibilité de connexion.
Les jobs Flink CDC peuvent écrire dans Iceberg via Data Lake Formation (DLF).
Hologres
La table source Binlog prend en charge la consommation à partir du décalage
LATEST.Le catalogue Hologres expose les index secondaires et les clés d'analyse par préfixe.
La lecture du type tableau
varchar[]est désormais prise en charge.La mise en cache de la détection des paramètres est optimisée pour éviter les délais d'initialisation lorsqu'un grand nombre de tables existent.
Le puit prend en charge un parallélisme supérieur au nombre de shards lorsque
sink.reshuffle-by-holo-distribution-key.enabledest configuré.
MaxCompute
Le catalogue utilise des requêtes paginées pour éviter le gel du centre de métadonnées.
La logique de validation du puit YAML est optimisée pour réduire les erreurs OOM liées aux limites de QPS.
Hive
Le catalogue vous permet de spécifier un format de stockage (tel que Parquet) lors de la création d'une table.
Paimon
Ajout de la prise en charge du format de fichier Lance.
Observabilité
Nouvelles métriques :
|
Métrique |
Description |
|
|
Utilisation du disque local |
|
|
Mémoire native GeminiDB utilisée |
|
|
Limite de mémoire native GeminiDB |
|
|
Limite supérieure du parallélisme de l'opérateur Auto-pilot |
Les journaux WARN non essentiels — tels que les alertes lorsqu'un format ne prend pas en charge les snapshots — sont désormais supprimés.
Corrections de bugs
Stabilité
Correctifs de la communauté Apache Flink — intègre les correctifs d'Apache Flink 1.20.2 et 1.20.3.
Perte de données Kafka — correction d'une perte de données lors de la lecture depuis Kafka et de l'écriture dans OSS avec les transactions activées.
Déconnexion PolarDB-X — correction d'un pic de latence soudain et d'une
EOFExceptiondéclenchés par une interruption de connexion PolarDB-X.OceanBase
wait_timeout— correction des déconnexions fréquentes dans le puit JDBC OceanBase causées parwait_timeout.
Exactitude
Flink CDC Canal Protobuf — correction du format d'horodatage incohérent et de la gestion du type
tinyint.Débogage de la source MySQL CDC — correction d'une erreur de comptage (off-by-one) lorsque la réutilisation était activée (le nombre de tables affiche désormais le chiffre correct).
Puit Flink CDC MaxCompute (ODPS) — correction des erreurs OOM Metaspace causées par des validations fréquentes.
Expérience utilisateur
Messages d'erreur Temporal Join — les messages d'erreur relatifs à la syntaxe Temporal Join sont désormais plus clairs.
Journaux WARN internes —
Cannot snapshot the tableet autres alertes internes similaires sont désormais enregistrés au niveau DEBUG.Champs null du journal binlog Hologres — correction d'une exception survenant lorsque certains champs étaient null lors de la consommation du journal binlog Hologres.