Flink x TiDB smart bud creates a new solution for real-time analysis
1. プロダクトアーキテクチャ
前述の図は、Wisdom Bud APP のプロダクトアーキテクチャ図です。バックエンド管理システム、AI、コンテンツエンジン、ヘルプセンターを含み、顧客に知的財産情報サービスと技術革新情報システムを提供します。
2. テクニカルアーキテクチャ
2.1 従来のリアルタイム分析スキーム
前述の図は、従来のリアルタイム分析ソリューションです。プロセスは概ね次のとおりです。顧客が条件を検索すると、取得された関連条件が分析 API を通じて異なる検索エンジンに送信されます。このソリューションでは、4 つの問題が発生します。
* 検索パフォーマンスへの影響
* 複雑な分析にはプラグインサポートの開発が必要
* 複数の検索エンジンにまたがる分析の複雑さ
* 異なるディメンションのデータを保存できない
リアルタイムデータウェアハウスを構築する前に、ビジネスで要求されるリアルタイムデータウェアハウスの特徴を収集しました。
* 秒レベルの応答
* 準リアルタイムデータ更新
* 一定レベルの同時実行能力のサポート
* 検索エンジンデータとの整合性
* 複雑な分析のサポート
* 統一された使用と主流機能のサポート
* 検索エンジンとのインタラクションのサポート
* ストレージ容量の水平スケーリングのサポート
前述の図は、データプラットフォームの概要です。下から上に向かって:
最下層はデータベースで、データストレージとデータ計算を含みます。データ計算レイヤーは Spark、Kafka、Flink で構成されています。
中間層はデータプラットフォームで、データ開発、データ分類、データ管理、データサービスを含みます。
上層はデータアプリケーションで、主にデータビジネス、外部分析サービス、内部分析ビジネスで構成されています。
2.2 新しいリアルタイム分析ソリューション
新しい技術選定は主に TiDB に基づいており、主にデータストレージとデータウェアハウスサービスの 2 つの部分を含みます。データウェアハウスサービスは、セキュリティチェック、ドライバーテーブル管理、キャッシュ管理、クラスターロードチェック、executor に分割されます。
TiDB を選択した理由は、クラウドネイティブであり、アクティブなコミュニティを持ち、TP と AP のビジネスシナリオを満たし、豊富なエコシステムツールと複数のプラットフォームを持ち、使いやすく、MySQL とビッグデータ機能と互換性があるためです。
Flink も選択されました。これは、オープンソースのビッグデータ計算エンジンであり、アクティブなクラウドネイティブコミュニティを持ち、データのタイムリーさの要求を満たし、Exactly-Once セマンティクスで一貫性を提供し、低レイテンシと高スループットを実現するためです。
オンラインビジネスデータの書き込みプロセス:ソースデータの変更をメッセージキューに入れ、インデックスプログラムを通じてデータを異なる検索エンジンに配布します。検索エンジンもインデックスプログラムにメッセージを送信します。
オフライン分析技術システム:オフライン分析技術システム全体は OSS に大きく依存しています。日次増分データをオフラインで OSS に保存し、フルデータ量に対して複雑な分析を実行します。
オフラインビジネスデータの書き込みプロセス:データの変更は OSS への永続的ストリーミングをトリガーし、OSS は同時に履歴ストリームとマージして、フルデータ量を OSS に保存します。
2.3 従来のユーザー行動分析ソリューション
従来のユーザー行動分析ソリューションは非常に複雑なスキームです。このソリューションには、フロントエンドに JS と Java API があります。JS はユーザーの埋め込みポイントデータを Segment に配置し、Gainsight と AMPLITUDE という 2 つの統合エンジンがあります。
2.4 新しいユーザー行動分析ソリューション
新しいユーザー行動分析スキームは比較的シンプルです。まず、ユーザー行動データを収集し、Kinesis を通じて Flink にストリーミングし、リアルタイム指標を計算して、計算結果を異なるテーブルに保存し、視覚的な開発を提供します。
2.5 Flink + Iceberg の探索
Flink + Iceberg の探索では、数百ギガバイトのテーブルを Kafka にストリーミングし、次に OSS にプッシュします。現在、市場には成熟したソリューションがないため、この方法は本番環境には適用されていません。
3. 将来の計画
* クラウドネイティブデータベースアーキテクチャの移行
* より完全な指標とアクセスシステムの提供
* データ生産のフルリンクモニタリングと早期警告の構築
* 会社のデータ消費とサービス能力のサポート
* オンラインリアルタイム分析データウェアハウスとそのデータ処理パイプラインの継続的な進化
* クラウドネイティブデータ技術システムと次世代ビッグデータプラットフォームの構築
前述の図は、Wisdom Bud APP のプロダクトアーキテクチャ図です。バックエンド管理システム、AI、コンテンツエンジン、ヘルプセンターを含み、顧客に知的財産情報サービスと技術革新情報システムを提供します。
2. テクニカルアーキテクチャ
2.1 従来のリアルタイム分析スキーム
前述の図は、従来のリアルタイム分析ソリューションです。プロセスは概ね次のとおりです。顧客が条件を検索すると、取得された関連条件が分析 API を通じて異なる検索エンジンに送信されます。このソリューションでは、4 つの問題が発生します。
* 検索パフォーマンスへの影響
* 複雑な分析にはプラグインサポートの開発が必要
* 複数の検索エンジンにまたがる分析の複雑さ
* 異なるディメンションのデータを保存できない
リアルタイムデータウェアハウスを構築する前に、ビジネスで要求されるリアルタイムデータウェアハウスの特徴を収集しました。
* 秒レベルの応答
* 準リアルタイムデータ更新
* 一定レベルの同時実行能力のサポート
* 検索エンジンデータとの整合性
* 複雑な分析のサポート
* 統一された使用と主流機能のサポート
* 検索エンジンとのインタラクションのサポート
* ストレージ容量の水平スケーリングのサポート
前述の図は、データプラットフォームの概要です。下から上に向かって:
最下層はデータベースで、データストレージとデータ計算を含みます。データ計算レイヤーは Spark、Kafka、Flink で構成されています。
中間層はデータプラットフォームで、データ開発、データ分類、データ管理、データサービスを含みます。
上層はデータアプリケーションで、主にデータビジネス、外部分析サービス、内部分析ビジネスで構成されています。
2.2 新しいリアルタイム分析ソリューション
新しい技術選定は主に TiDB に基づいており、主にデータストレージとデータウェアハウスサービスの 2 つの部分を含みます。データウェアハウスサービスは、セキュリティチェック、ドライバーテーブル管理、キャッシュ管理、クラスターロードチェック、executor に分割されます。
TiDB を選択した理由は、クラウドネイティブであり、アクティブなコミュニティを持ち、TP と AP のビジネスシナリオを満たし、豊富なエコシステムツールと複数のプラットフォームを持ち、使いやすく、MySQL とビッグデータ機能と互換性があるためです。
Flink も選択されました。これは、オープンソースのビッグデータ計算エンジンであり、アクティブなクラウドネイティブコミュニティを持ち、データのタイムリーさの要求を満たし、Exactly-Once セマンティクスで一貫性を提供し、低レイテンシと高スループットを実現するためです。
オンラインビジネスデータの書き込みプロセス:ソースデータの変更をメッセージキューに入れ、インデックスプログラムを通じてデータを異なる検索エンジンに配布します。検索エンジンもインデックスプログラムにメッセージを送信します。
オフライン分析技術システム:オフライン分析技術システム全体は OSS に大きく依存しています。日次増分データをオフラインで OSS に保存し、フルデータ量に対して複雑な分析を実行します。
オフラインビジネスデータの書き込みプロセス:データの変更は OSS への永続的ストリーミングをトリガーし、OSS は同時に履歴ストリームとマージして、フルデータ量を OSS に保存します。
2.3 従来のユーザー行動分析ソリューション
従来のユーザー行動分析ソリューションは非常に複雑なスキームです。このソリューションには、フロントエンドに JS と Java API があります。JS はユーザーの埋め込みポイントデータを Segment に配置し、Gainsight と AMPLITUDE という 2 つの統合エンジンがあります。
2.4 新しいユーザー行動分析ソリューション
新しいユーザー行動分析スキームは比較的シンプルです。まず、ユーザー行動データを収集し、Kinesis を通じて Flink にストリーミングし、リアルタイム指標を計算して、計算結果を異なるテーブルに保存し、視覚的な開発を提供します。
2.5 Flink + Iceberg の探索
Flink + Iceberg の探索では、数百ギガバイトのテーブルを Kafka にストリーミングし、次に OSS にプッシュします。現在、市場には成熟したソリューションがないため、この方法は本番環境には適用されていません。
3. 将来の計画
* クラウドネイティブデータベースアーキテクチャの移行
* より完全な指標とアクセスシステムの提供
* データ生産のフルリンクモニタリングと早期警告の構築
* 会社のデータ消費とサービス能力のサポート
* オンラインリアルタイム分析データウェアハウスとそのデータ処理パイプラインの継続的な進化
* クラウドネイティブデータ技術システムと次世代ビッグデータプラットフォームの構築
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
