本文介绍实时计算 Flink 版 VVR 11.8.0 的重大功能变更和主要体验优化。
本版本计划在全网分步骤完成灰度。具体升级进度请关注实时计算控制台右侧的最新公告;如暂未使用到相关能力,说明您的账号可能尚未完成灰度。如需尽快升级,请提交工单并说明业务诉求,我们将结合实际情况安排。
概述
实时计算 Flink 版 VVR 11.8.0 基于 Apache Flink 1.20.4 构建。本次升级重点增强了 AI 实时推理与多模态数据处理、数据摄入与 CDC、连接器安全和云上凭据管理能力,并同步吸收 Apache Flink 1.20.4 的相关改进。
在 AI 场景中,VVR 新增或完善了 SQL、DataFrame API 和 Flink Agents 对图像、音频、视频等多模态数据及大模型调用的支持。数据摄入方面,Kafka、MySQL CDC、SQL Server CDC、Paimon、StarRocks 等链路在格式兼容性、表结构变更、并发调优和数据类型处理方面持续增强。连接器侧进一步完善 KMS、免密、AssumeRole、SSL/TLS 证书等安全能力,以及 MySQL、Hologres、Redis、Iceberg、Fluss 等连接器的易用性与稳定性。
引擎侧
持续增强 AI 实时推理、多模态计算、向量检索、异步查找与 Apache Flink 社区能力,为智能化实时数据处理场景提供更完善的基础支撑。
AI Function、DataFrame API 与多模态计算
-
多模态 AI Function 支持 :SQL AI Function 支持音频、视频等多模态数据处理场景,并完善图像、视频、音频算子的能力与端到端测试覆盖。
-
内置模型免注册:提供 Flink AI 内置模型服务,开箱即用,无需配置API-Key、Endpoint或私网连接,提供更佳性能与稳定性。
-
DataFrame API 增强:提供了多模态算子,用于在 Flink 作业中处理图像、视频等多模态数据。覆盖图像变换、检测、质量评估、嵌入向量、人脸处理、视频抽帧等场景。
-
Flink Agents 集成:支持在 SQL 作业中以表值函数(TVF)方式调用 Flink Agents,并适配 Flink Agents 0.3 版本。
向量检索与异步查找
-
DLF Paimon 向量检索:
vector_search和vector_search_agg支持检索 DLF Paimon 向量表,增强湖仓数据与向量检索场景的集成能力。 -
Lookup Join 超时处理:基于
AsyncLookupFunction和AsyncTableFunction的 Lookup Join 支持用户自定义超时处理逻辑,提升异步查询场景的可控性。
Apache Flink 1.20.4 社区能力同步
-
同步 Apache Flink 1.20.4 的相关改进与缺陷修复,持续提升作业运行的正确性、稳定性和开发体验。
数据摄入(Flink CDC)
本版本持续完善 Kafka、MySQL CDC、SQL Server CDC、Paimon、StarRocks 等数据摄入链路,提升格式兼容性、类型处理能力和运维效率。
Kafka 与 Canal JSON
-
Canal JSON 元数据与 DDL:支持保留
mysqlType、sqlType等元数据信息,并支持同步 DDL 变更,提升与 Canal 协议链路的兼容性。 -
按变更字段输出:Kafka Canal JSON 写入支持仅保留变更后的字段,减少下游数据处理负担。
-
自定义格式与类型推断优化:Kafka 连接器支持自定义 format;针对 Canal JSON、Debezium JSON 和 JSON 数据的类型推断,可避免将字符串自动尝试转换为时间类型。
-
Kafka 幂等配置校验:针对特定云上 Kafka 场景,作业会识别不兼容的幂等配置并给出明确提示,降低配置错误风险。
MySQL、SQL Server 与 StarRocks
-
MySQL CDC 参数校验:规范 Debezium 参数校验,增强配置问题的可发现性。
-
Binlog 下游传递控制:支持通过配置项按需控制 MySQL Binlog 信息向下游传递。
-
Source 限流:MySQL Source 支持针对
numRecordsInOfSourcePerSecond等指标进行限流配置,帮助控制下游处理压力。 -
SQL Server CDC:数据摄入支持 SQL Server Source,并支持
op_type元数据列,便于识别变更操作类型。 -
StarRocks Sink 增强:支持
sink.ignore-update-before参数。
Paimon、YAML 与摄入运维
-
Paimon 无数据表跳过提交:当某张表没有写入数据时可跳过该表提交,减少无效提交开销。
-
Paimon DLS Catalog:Filesystem Catalog 支持 DLS,扩展湖仓部署和访问场景。
-
Source 到 Sink 分发策略:支持以策略模式配置 Source 到 Sink 的数据分发方式,提升复杂拓扑的可配置性。
-
YAML 作业 Autopilot:YAML 作业支持通过 Autopilot 调整更新并发,改善弹性调优体验。
-
表结构变更同步支持说明:梳理并完善各类 Sink 对表结构变更的支持情况,方便作业设计与变更评估。
连接器
安全、凭据与认证
-
KMS 凭据集成:新增或完善连接器侧 KMS 集成能力,便于统一管理数据库等外部系统凭据;PostgreSQL CDC Connector 支持集成 KMS。
-
OSS AssumeRole:OSS 支持通过 AssumeRole 使用自定义角色替代 AK/SK,提升云上访问的安全性与灵活性。
MySQL、Hologres、Redis 与 Iceberg
-
MySQL Sink 批量写入:MySQL Connector 写入无主键表时支持批量插入,提升写入吞吐。
-
MySQL 删除处理:MySQL Sink 支持配置忽略 DELETE 事件的模式,满足特定同步策略。
-
Hologres Sink 优化:
ignore-null走表达式时支持客户端去重,改善写入链路性能与结果一致性。 -
Redis 连接池优化:优化 Redis Connector 连接池实现,提升高并发连接场景的稳定性。
-
Iceberg OSS 客户端参数:Iceberg Connector 支持调整 OSS Client 参数,增强对象存储访问的可配置性。
兼容性与稳定性改进
-
优化数据摄入与连接器的配置校验、格式处理、类型推断和运行时提示,降低作业配置与运维成本。
-
持续修复 Apache Flink、Flink CDC 及核心连接器中的正确性与稳定性问题,提升生产作业可靠性。