General introduction to real-time computing Flink version
Apache Flink 技術の発展
ビッグデータは 10 年以上にわたり高速で発展を続けており、大規模コンピューティングからよりリアルタイムな処理へと進化しています。
たとえば、Alibaba が主催する独身の日のショッピングフェスティバルでは、イベント全体のリアルタイム取引額と取引高をリアルタイム大型スクリーンに表示し、ミリ秒単位で更新できます。世界中の中国人視聴者が視聴する CCTV 春節聯歓晩会では、大型スクリーンを通じて全国視聴率とオーディエンスのユーザープロファイルをリアルタイムに統計処理しています。また、現在多くの都市で推進されている都市ブレインプロジェクトでは、IoT カメラの情報を通じて各都市の交通、車両、人の流れなどの情報をリアルタイムに把握し、交通監視とガバナンスに活用しています。さらに金融業界では、銀行や証券取引所などの機関のコア業務シナリオにおいて、ビッグデータのリアルタイムコンピューティングパワーによる取引行動のリアルタイムモニタリングと、不正行為検出およびマネーロンダリング対策を行っています。Taobao の EC 取引シナリオ全体では、ユーザーの行動に基づいてリアルタイムにパーソナライズドレコメンデーションが行われます。ユーザーが直近 1 分間または 30 秒間に閲覧した商品に基づき、システムがアルゴリズムに従ってユーザープロファイルを算出し、その後のブラウジングでユーザーが好みそうな関連商品をリアルタイムにレコメンドします。このように、日常生活に関わる多くのシナリオが、リアルタイムコンピューティングによって日夜生産性の向上を推進しています。
リアルタイムコンピューティングには、バックグラウンドに極めて強力なビッグデータコンピューティング能力のセットが必要です。Apache Flink はオープンソースのビッグデータリアルタイムコンピューティング技術として登場しました。設計当初からストリームコンピューティングを起点としており、Hadoop や Spark などの従来のコンピューティングエンジンは本質的にバッチコンピューティングエンジンであり、限られたデータセットに対するデータ処理では処理遅延を保証できませんでした。Apache Flink はストリーミングコンピューティングエンジンとして、リアルタイムデータをリアルタイムにサブスクライブし、データをリアルタイムに分析・処理して結果を生成することで、データが第一时间にその価値を発揮できます。
現在、Apache Flink はストリームコンピューティングエンジンからストリーミングとバッチの統合コンピューティング能力も徐々に備えています。ログストリーム、クリックストリーム、IoT データストリームを通じてストリーミング分析・処理を行えると同時に、データベースやファイルシステム内の有限データセットをバッチモードで処理し、迅速に結果を分析できます。Apache Flink は現在、オープンソースコミュニティで非常に人気のあるビッグデータ技術であり、3 年連続で世界で最もアクティブな Apache オープンソースプロジェクトの 1 つです。強力な一貫性コンピューティング能力、大規模なスケーラビリティ、優れた全体パフォーマンスを備え、SQL、Java、Python などの複数言語をサポートし、さまざまなシナリオでのビジネス利用を容易にする豊富な API インターフェースを備えています。現在、Flink は国内外のインターネット企業における主流のリアルタイムビッグデータコンピューティング技術となり、リアルタイムコンピューティング分野の事実上の技術標準となっています。
Alibaba Cloud のリアルタイムコンピューティング Flink 版プロダクトは、Alibaba グループ内で長年にわたり鍛錬と検証を重ねてきた技術とプロダクトの蓄積があります。現在、クラウド上で提供され、さまざまな業界の中小企業向けにクラウドコンピューティングサービスを提供しています。早くも 2016 年、Apache Flink が Apache に寄付されてから 3 年目に、Alibaba は既にリアルタイムコンピューティングプロダクトの大規模利用を開始していました。このプロダクトはまず Alibaba のコア検索レコメンデーションおよび広告ビジネスシナリオで導入されました。このシナリオでは、リアルタイムレコメンデーション、リアルタイムソート、リアルタイム広告など、大量のリアルタイムデータ処理が必要であり、EC 全体のコアビジネスにとって非常に重要で、大きな成果をもたらしました。
プロダクト開発の歩み
2017 年、Flink ベースのリアルタイムコンピューティングプラットフォームプロダクトが Alibaba グループ全体へのサービス提供を開始しました。同年、グループ全体のリアルタイムデータ、中でも最もコアなダブル 11 大型スクリーンのサービスを提供しました。2018 年、プロダクトはクラウド上で正式にリリースされ、グループ内だけでなく、クラウド上の中小企業へのサービス提供も開始しました。これは、リアルタイムコンピューティング Flink プロダクトがパブリッククラウドの形で外部サービスを提供した初めてのケースでもあります。
2019 年初頭、Alibaba は Flink の創業企業である Ververica を買収し、Alibaba の Flink 技術チームであるリアルタイムコンピューティング技術チームとドイツ本社の Flink 創業チームが合流し、世界最強の Flink 技術チームとなり、Apache Flink オープンソースコミュニティ全体の開発と貢献を共同で推進しています。現在、中国の Apache Flink コミュニティには 20 万人以上の開発者が参加しており、Flink は Apache Foundation のビッグデータ分野で最もアクティブなプロジェクトの 1 つとなっています。
昨年、世界の主流クラウドコンピューティング企業およびビッグデータ企業が Flink 技術を採用して独自の Flink プロダクトをリリースしました。たとえば、Hadoop から始まった Cloudera も Flink を完全に統合した CDP/CDH をリリースし、国内のビッグデータ企業も Flink ベースのリアルタイムコンピューティングプロダクトを次々とリリースしています。
リアルタイムコンピューティング Flink 版プロダクトアーキテクチャ
オープンソース版と比較して、Alibaba Cloud のリアルタイムコンピューティングプロダクトアーキテクチャは大幅に改善され、付加価値が加えられています。現在、多くの開発者が独自のリアルタイムコンピューティングプラットフォームを構築する際、自社データセンターやクラウド上の仮想マシンでオープンソースの Apache Flink を使用しています。では、Alibaba Cloud が公式にリリースしたリアルタイムコンピューティング Flink 版プロダクトにはどのような特徴があるのでしょうか。
プロダクトアーキテクチャ
プロダクト全体のアーキテクチャ図によると、最下層は Alibaba Cloud の完全なクラウドネイティブ基盤に基づき、コンテナ化を通じてリアルタイムコンピューティング Flink 版プロダクトのセットが構築されています。すべての Flink コンピューティングタスクは Kubernetes エコシステム上で稼働し、コンテナ化された方式でマルチテナント分離を実現し、セキュリティを確保しています。同時に、フルマネージドサービス形態で、クラウド上で高い SLA 保証付きのフルマネージドサービスを提供し、ユーザーの運用保守の負担を解消しています。また、サービスアーキテクチャにより、ユーザーは各種リソースの割合をより柔軟に判断し、ビジネス量に応じて選択でき、マシン計画の心配が不要です。リアルタイムコンピューティング Flink 版プロダクトは、生まれながらのクラウドネイティブ基盤です。
コアコンピューティングエンジンについては、オープンソースの Apache Flink と比較して、Alibaba Cloud はいくつかのコア機能を最適化しており、これらの最適化は Alibaba 内部ビジネスの鍛錬を経ています。現在、リアルタイムコンピューティング Flink 版プロダクトは、Alibaba グループの約 100 のビジネス部門のリアルタイムデータサービスをサポートしています。大量のビジネス実践を通じて、サポートストレージ、スケジューリング、ネットワーク転送の面でプロダクトは最高の効果に調整されています。
プラグインの面では、プロダクトには数十の強化コネクタが組み込まれており、MySQL、HBase、HDFS、Alibaba Cloud SLS など、すべての主流オープンソースデータストレージに接続でき、自然に統合され、すぐに使えます。開発プラットフォームの面では、エンタープライズグレードのワンストップ開発プラットフォームを提供し、開発と運用保守機能が組み込まれており、自社構築の手間を省き、エンタープライズユーザーの全体的な体験を向上させています。
リアルタイムコンピューティング Flink 版は、SQL、Java、Python などの多言語開発環境をサポートし、開発タスクのライフサイクル全体の管理を提供し、OIDC と RBAC ベースのエンタープライズレベルセキュリティメカニズムをサポートし、Prometheus プロトコルベースのフルリンクモニタリングとアラートを備えています。独自の AutoPilot インテリジェントチューニングシステムを搭載し、リソースチューニングや同時実行数チューニングを含む Flink タスクのパラメータをインテリジェントに調整します。プロダクトは手動調整なしでビジネストラフィックに完全に適応できます(インテリジェントチューニングはリアルタイムコンピューティング Flink 版プロダクトの核心的な優位性です)。
リアルタイムコンピューティング Flink 版とオープンソース Apache Flink の違い
オープンソースプロダクトと比較して、リアルタイムコンピューティング Flink 版には数十のパフォーマンス上の優位性があり、開発、運用保守、コスト、セキュリティの観点から比較されます。
プロダクト比較
開発面では、豊富なデータ接続能力とワンストップの多言語開発環境を備えています。さまざまなビルトイン関数ライブラリを備え、ユーザーのコードデバッグを容易にし、マルチテナント開発、タスクデバッグ、テストシミュレーションも可能です。運用保守面では、フルリンクのモニタリングとアラートをサポートし、ユーザーの利用中に発生するデータ遅延、データ異常、サービス中断に対して自動アラートを発行できます。
インテリジェント運用保守面では、自動インテリジェント診断と最適化をサポートし、ビジネストラフィックに基づいてパフォーマンスチューニング、ジョブチューニング、パラメータチューニング、リソースチューニングを自動的に実行し、問題の診断と最適化を行えます。リソースレベルでは、オープンソースを基盤として、より細かい粒度で洗練されたリソース割り当てを実現し、各ジョブおよび各オペレータを CPU とメモリの粒度で設定でき、リソース利用率を大幅に最適化し、ユーザーのコスト削減、サービス安定性の向上、運用保守障害の確率低減を実現します。原厂の運用保守サービスにより、SLA 99.9% 保証、フルリンクのフォールトトレランスとシステム安定性保証を提供し、ユーザーの心配を完全に解消します。
コスト面では、クラウド上でのコスト最適化により、パフォーマンスを向上させつつユーザーの全体 TCO を削減でき、これもコアパフォーマンスの優位性の 1 つです。
NexMark ベースのストリームコンピューティング標準テストにおいて、リアルタイムコンピューティング Flink 版のプロダクトパフォーマンスはオープンソースの約 3 倍です。Alibaba グループの強力な研究開発チームが内部コア業務シナリオで蓄積した実践最適化により、ユーザーの基本コストを削減でき、コア優位性が際立っています。
リアルタイムコンピューティング Flink 版はクラウドネイティブな弹性スケーリング機能も備えており、ユーザーが合理的にリソースを節約し、リソース利用率を向上させることができます。プロダクト決済タイプは年間および月額決済をサポートし、従量課金もサポートしており、さまざまなニーズに柔軟に対応します。
セキュリティ層では、コンテナ化されたタスク分離によりユーザー体験を向上させ、テナント分離、セキュリティ分離、VPC 分離などの複数の要件をサポートしています。同時に、Alibaba のアカウントシステムと直接連携しており、ユーザーは Alibaba Cloud のアカウントに基づいてプロダクト間のセキュリティをシームレスに制御できます。ロールベースや OIDC などのオープンな身分認証プロトコルもサポートし、ビジネスセキュリティを大幅に向上させています。
全体として、エンタープライズ版はオープンソース版よりも機能と安定性に優れています。運用保守面の優位性に加え、すぐに使える操作性もユーザーにとってより便利です。
プロダクトソリューション
プロダクトソリューション
リアルタイムコンピューティングのストリーミングコンピューティングエンジンとして、Flink は ECS オンラインサービスログ、IoT シナリオのセンサーデータ、その他のリアルタイムデータを含む、さまざまなリアルタイムデータを処理できます。同時に、クラウド上で RDS や PolarDB などのリレーショナルデータベースの binlog 更新をサブスクライブできます。そして、DataHub データバス、SLS ログサービス、オープンソースの Kafka メッセージキューなどを介してリアルタイムデータをサブスクライブし、リアルタイムコンピューティングプロダクトに取り込んでリアルタイムにデータ分析・処理を行います。最終的に、分析結果を MaxCompute、MaxCompute-Hologres のインタラクティブ分析、PAI 機械学習、Elasticsearch などの異なるデータサービスに書き込み、ビジネス要件に応じて最適なデータサービスプロダクトを選択してデータ活用率を向上させます。
Flink の主なアプリケーションシナリオは、各種リアルタイムデータソースからのデータをリアルタイムにサブスクライブ、処理、分析し、得られた結果を他のオンラインストレージに書き込んで、ユーザーが直接活用できるようにすることです。システム全体は高速性、正確なデータ、クラウドネイティブアーキテクチャ、インテリジェンスの特徴を備えた、非常に競争力の高いエンタープライズレベルのプロダクトです。プロダクトは Alibaba Cloud のコンテナサービス ECS などの IaaS システム上で稼働し、Alibaba Cloud の各種システムと自然に連携しており、お客様がより多くのシナリオに適用できます。
プロダクトアプリケーションシナリオ
リアルタイムコンピューティング Flink 版プロダクトをベースに、4 つの主要アプリケーションシナリオをまとめました。ユーザーは必要に応じて、独自のビジネス向けリアルタイムコンピューティングソリューションを簡単に構築できます。
プロダクトアプリケーションシナリオ
1. リアルタイムデータウェアハウス
リアルタイムデータウェアハウスは、主に Web サイトの PV/UV 統計、商品売上統計、トランザクションデータ統計など、さまざまなトランザクションデータシナリオで使用されます。ビジネスのリアルタイムデータソースをサブスクライブし、秒単位でリアルタイムに情報を分析し、最終的に大型スクリーンに表示して意思決定者が利用できるようにすることで、会社のビジネス状況やイベントプロモーションの状況を判断しやすくなります。リアルタイムの業務運営データに基づいて意思決定を行い、真のデータインテリジェンスを実現します。このシナリオの特殊性により、リアルタイムデータは特に重要です。急速に変化するビジネス環境では、直近 1 分間、さらには直近 1 秒間に発生したデータを分析・意思決定する必要があり、リアルタイムコンピューティングがこのシナリオでの最適な選択です。
2. リアルタイムレコメンデーション
リアルタイムレコメンデーションは、主にユーザーの好みに基づいたパーソナライズドレコメンデーションや AI 技術に基づくレコメンデーションを主流のプロダクト形態としています。ショート動画シナリオ、EC ショッピングシナリオ、コンテンツフィードシナリオなどで一般的です。過去のユーザークリックに基づいてユーザーの好みをリアルタイムに判断し、ターゲットを絞ったレコメンデーションを行い、ユーザーのエンゲージメントを高めます。これは非常にリアルタイム性の高いシナリオであり、Flink 技術と AI 技術を組み合わせてリアルタイムレコメンデーションシナリオを運用できます。
3. ETL シナリオ
リアルタイム ETL シナリオはデータ同期操作で一般的であり、データ同期プロセス中にデータの計算・処理が必要です。たとえば、データベース内の異なるテーブル間の同期と変換、異なるデータベース間の同期、データ集約前処理などの操作があります。最終的に、結果はデータウェアハウスやデータレイクに書き込まれてアーカイブと蓄積が行われ、後続の詳細分析に向けた準備作業が行われ、ユーザーが後続のログ分析などの操作を実行しやすくなります。データ同期と処理の全リンクにおいて、Flink ベースのリアルタイムデータ同期と前処理を非常に効率的に行えます。
4. リアルタイムモニタリング
リアルタイムモニタリングは金融またはトレーディング業務シナリオで一般的です。業界の特殊性を考慮し、不正行為に対する商業化された監視が必要です。ユーザーのリアルタイム短期行動に基づいて、不正ユーザーかどうかを判断し、タイムリーに損失を止めます。このシナリオは適時性に対して非常に高い要件があります。異常データ検出を通じて、リアルタイムに異常状況を発見し、損失防止措置を講じることができます。各種システムのメトリクスやログなどの統計指標の収集、指標などの需要シナリオのリアルタイム観察とモニタリングは、すべてリアルタイムコンピューティング Flink 版プロダクトで解決できます。
ビッグデータは 10 年以上にわたり高速で発展を続けており、大規模コンピューティングからよりリアルタイムな処理へと進化しています。
たとえば、Alibaba が主催する独身の日のショッピングフェスティバルでは、イベント全体のリアルタイム取引額と取引高をリアルタイム大型スクリーンに表示し、ミリ秒単位で更新できます。世界中の中国人視聴者が視聴する CCTV 春節聯歓晩会では、大型スクリーンを通じて全国視聴率とオーディエンスのユーザープロファイルをリアルタイムに統計処理しています。また、現在多くの都市で推進されている都市ブレインプロジェクトでは、IoT カメラの情報を通じて各都市の交通、車両、人の流れなどの情報をリアルタイムに把握し、交通監視とガバナンスに活用しています。さらに金融業界では、銀行や証券取引所などの機関のコア業務シナリオにおいて、ビッグデータのリアルタイムコンピューティングパワーによる取引行動のリアルタイムモニタリングと、不正行為検出およびマネーロンダリング対策を行っています。Taobao の EC 取引シナリオ全体では、ユーザーの行動に基づいてリアルタイムにパーソナライズドレコメンデーションが行われます。ユーザーが直近 1 分間または 30 秒間に閲覧した商品に基づき、システムがアルゴリズムに従ってユーザープロファイルを算出し、その後のブラウジングでユーザーが好みそうな関連商品をリアルタイムにレコメンドします。このように、日常生活に関わる多くのシナリオが、リアルタイムコンピューティングによって日夜生産性の向上を推進しています。
リアルタイムコンピューティングには、バックグラウンドに極めて強力なビッグデータコンピューティング能力のセットが必要です。Apache Flink はオープンソースのビッグデータリアルタイムコンピューティング技術として登場しました。設計当初からストリームコンピューティングを起点としており、Hadoop や Spark などの従来のコンピューティングエンジンは本質的にバッチコンピューティングエンジンであり、限られたデータセットに対するデータ処理では処理遅延を保証できませんでした。Apache Flink はストリーミングコンピューティングエンジンとして、リアルタイムデータをリアルタイムにサブスクライブし、データをリアルタイムに分析・処理して結果を生成することで、データが第一时间にその価値を発揮できます。
現在、Apache Flink はストリームコンピューティングエンジンからストリーミングとバッチの統合コンピューティング能力も徐々に備えています。ログストリーム、クリックストリーム、IoT データストリームを通じてストリーミング分析・処理を行えると同時に、データベースやファイルシステム内の有限データセットをバッチモードで処理し、迅速に結果を分析できます。Apache Flink は現在、オープンソースコミュニティで非常に人気のあるビッグデータ技術であり、3 年連続で世界で最もアクティブな Apache オープンソースプロジェクトの 1 つです。強力な一貫性コンピューティング能力、大規模なスケーラビリティ、優れた全体パフォーマンスを備え、SQL、Java、Python などの複数言語をサポートし、さまざまなシナリオでのビジネス利用を容易にする豊富な API インターフェースを備えています。現在、Flink は国内外のインターネット企業における主流のリアルタイムビッグデータコンピューティング技術となり、リアルタイムコンピューティング分野の事実上の技術標準となっています。
Alibaba Cloud のリアルタイムコンピューティング Flink 版プロダクトは、Alibaba グループ内で長年にわたり鍛錬と検証を重ねてきた技術とプロダクトの蓄積があります。現在、クラウド上で提供され、さまざまな業界の中小企業向けにクラウドコンピューティングサービスを提供しています。早くも 2016 年、Apache Flink が Apache に寄付されてから 3 年目に、Alibaba は既にリアルタイムコンピューティングプロダクトの大規模利用を開始していました。このプロダクトはまず Alibaba のコア検索レコメンデーションおよび広告ビジネスシナリオで導入されました。このシナリオでは、リアルタイムレコメンデーション、リアルタイムソート、リアルタイム広告など、大量のリアルタイムデータ処理が必要であり、EC 全体のコアビジネスにとって非常に重要で、大きな成果をもたらしました。
プロダクト開発の歩み
2017 年、Flink ベースのリアルタイムコンピューティングプラットフォームプロダクトが Alibaba グループ全体へのサービス提供を開始しました。同年、グループ全体のリアルタイムデータ、中でも最もコアなダブル 11 大型スクリーンのサービスを提供しました。2018 年、プロダクトはクラウド上で正式にリリースされ、グループ内だけでなく、クラウド上の中小企業へのサービス提供も開始しました。これは、リアルタイムコンピューティング Flink プロダクトがパブリッククラウドの形で外部サービスを提供した初めてのケースでもあります。
2019 年初頭、Alibaba は Flink の創業企業である Ververica を買収し、Alibaba の Flink 技術チームであるリアルタイムコンピューティング技術チームとドイツ本社の Flink 創業チームが合流し、世界最強の Flink 技術チームとなり、Apache Flink オープンソースコミュニティ全体の開発と貢献を共同で推進しています。現在、中国の Apache Flink コミュニティには 20 万人以上の開発者が参加しており、Flink は Apache Foundation のビッグデータ分野で最もアクティブなプロジェクトの 1 つとなっています。
昨年、世界の主流クラウドコンピューティング企業およびビッグデータ企業が Flink 技術を採用して独自の Flink プロダクトをリリースしました。たとえば、Hadoop から始まった Cloudera も Flink を完全に統合した CDP/CDH をリリースし、国内のビッグデータ企業も Flink ベースのリアルタイムコンピューティングプロダクトを次々とリリースしています。
リアルタイムコンピューティング Flink 版プロダクトアーキテクチャ
オープンソース版と比較して、Alibaba Cloud のリアルタイムコンピューティングプロダクトアーキテクチャは大幅に改善され、付加価値が加えられています。現在、多くの開発者が独自のリアルタイムコンピューティングプラットフォームを構築する際、自社データセンターやクラウド上の仮想マシンでオープンソースの Apache Flink を使用しています。では、Alibaba Cloud が公式にリリースしたリアルタイムコンピューティング Flink 版プロダクトにはどのような特徴があるのでしょうか。
プロダクトアーキテクチャ
プロダクト全体のアーキテクチャ図によると、最下層は Alibaba Cloud の完全なクラウドネイティブ基盤に基づき、コンテナ化を通じてリアルタイムコンピューティング Flink 版プロダクトのセットが構築されています。すべての Flink コンピューティングタスクは Kubernetes エコシステム上で稼働し、コンテナ化された方式でマルチテナント分離を実現し、セキュリティを確保しています。同時に、フルマネージドサービス形態で、クラウド上で高い SLA 保証付きのフルマネージドサービスを提供し、ユーザーの運用保守の負担を解消しています。また、サービスアーキテクチャにより、ユーザーは各種リソースの割合をより柔軟に判断し、ビジネス量に応じて選択でき、マシン計画の心配が不要です。リアルタイムコンピューティング Flink 版プロダクトは、生まれながらのクラウドネイティブ基盤です。
コアコンピューティングエンジンについては、オープンソースの Apache Flink と比較して、Alibaba Cloud はいくつかのコア機能を最適化しており、これらの最適化は Alibaba 内部ビジネスの鍛錬を経ています。現在、リアルタイムコンピューティング Flink 版プロダクトは、Alibaba グループの約 100 のビジネス部門のリアルタイムデータサービスをサポートしています。大量のビジネス実践を通じて、サポートストレージ、スケジューリング、ネットワーク転送の面でプロダクトは最高の効果に調整されています。
プラグインの面では、プロダクトには数十の強化コネクタが組み込まれており、MySQL、HBase、HDFS、Alibaba Cloud SLS など、すべての主流オープンソースデータストレージに接続でき、自然に統合され、すぐに使えます。開発プラットフォームの面では、エンタープライズグレードのワンストップ開発プラットフォームを提供し、開発と運用保守機能が組み込まれており、自社構築の手間を省き、エンタープライズユーザーの全体的な体験を向上させています。
リアルタイムコンピューティング Flink 版は、SQL、Java、Python などの多言語開発環境をサポートし、開発タスクのライフサイクル全体の管理を提供し、OIDC と RBAC ベースのエンタープライズレベルセキュリティメカニズムをサポートし、Prometheus プロトコルベースのフルリンクモニタリングとアラートを備えています。独自の AutoPilot インテリジェントチューニングシステムを搭載し、リソースチューニングや同時実行数チューニングを含む Flink タスクのパラメータをインテリジェントに調整します。プロダクトは手動調整なしでビジネストラフィックに完全に適応できます(インテリジェントチューニングはリアルタイムコンピューティング Flink 版プロダクトの核心的な優位性です)。
リアルタイムコンピューティング Flink 版とオープンソース Apache Flink の違い
オープンソースプロダクトと比較して、リアルタイムコンピューティング Flink 版には数十のパフォーマンス上の優位性があり、開発、運用保守、コスト、セキュリティの観点から比較されます。
プロダクト比較
開発面では、豊富なデータ接続能力とワンストップの多言語開発環境を備えています。さまざまなビルトイン関数ライブラリを備え、ユーザーのコードデバッグを容易にし、マルチテナント開発、タスクデバッグ、テストシミュレーションも可能です。運用保守面では、フルリンクのモニタリングとアラートをサポートし、ユーザーの利用中に発生するデータ遅延、データ異常、サービス中断に対して自動アラートを発行できます。
インテリジェント運用保守面では、自動インテリジェント診断と最適化をサポートし、ビジネストラフィックに基づいてパフォーマンスチューニング、ジョブチューニング、パラメータチューニング、リソースチューニングを自動的に実行し、問題の診断と最適化を行えます。リソースレベルでは、オープンソースを基盤として、より細かい粒度で洗練されたリソース割り当てを実現し、各ジョブおよび各オペレータを CPU とメモリの粒度で設定でき、リソース利用率を大幅に最適化し、ユーザーのコスト削減、サービス安定性の向上、運用保守障害の確率低減を実現します。原厂の運用保守サービスにより、SLA 99.9% 保証、フルリンクのフォールトトレランスとシステム安定性保証を提供し、ユーザーの心配を完全に解消します。
コスト面では、クラウド上でのコスト最適化により、パフォーマンスを向上させつつユーザーの全体 TCO を削減でき、これもコアパフォーマンスの優位性の 1 つです。
NexMark ベースのストリームコンピューティング標準テストにおいて、リアルタイムコンピューティング Flink 版のプロダクトパフォーマンスはオープンソースの約 3 倍です。Alibaba グループの強力な研究開発チームが内部コア業務シナリオで蓄積した実践最適化により、ユーザーの基本コストを削減でき、コア優位性が際立っています。
リアルタイムコンピューティング Flink 版はクラウドネイティブな弹性スケーリング機能も備えており、ユーザーが合理的にリソースを節約し、リソース利用率を向上させることができます。プロダクト決済タイプは年間および月額決済をサポートし、従量課金もサポートしており、さまざまなニーズに柔軟に対応します。
セキュリティ層では、コンテナ化されたタスク分離によりユーザー体験を向上させ、テナント分離、セキュリティ分離、VPC 分離などの複数の要件をサポートしています。同時に、Alibaba のアカウントシステムと直接連携しており、ユーザーは Alibaba Cloud のアカウントに基づいてプロダクト間のセキュリティをシームレスに制御できます。ロールベースや OIDC などのオープンな身分認証プロトコルもサポートし、ビジネスセキュリティを大幅に向上させています。
全体として、エンタープライズ版はオープンソース版よりも機能と安定性に優れています。運用保守面の優位性に加え、すぐに使える操作性もユーザーにとってより便利です。
プロダクトソリューション
プロダクトソリューション
リアルタイムコンピューティングのストリーミングコンピューティングエンジンとして、Flink は ECS オンラインサービスログ、IoT シナリオのセンサーデータ、その他のリアルタイムデータを含む、さまざまなリアルタイムデータを処理できます。同時に、クラウド上で RDS や PolarDB などのリレーショナルデータベースの binlog 更新をサブスクライブできます。そして、DataHub データバス、SLS ログサービス、オープンソースの Kafka メッセージキューなどを介してリアルタイムデータをサブスクライブし、リアルタイムコンピューティングプロダクトに取り込んでリアルタイムにデータ分析・処理を行います。最終的に、分析結果を MaxCompute、MaxCompute-Hologres のインタラクティブ分析、PAI 機械学習、Elasticsearch などの異なるデータサービスに書き込み、ビジネス要件に応じて最適なデータサービスプロダクトを選択してデータ活用率を向上させます。
Flink の主なアプリケーションシナリオは、各種リアルタイムデータソースからのデータをリアルタイムにサブスクライブ、処理、分析し、得られた結果を他のオンラインストレージに書き込んで、ユーザーが直接活用できるようにすることです。システム全体は高速性、正確なデータ、クラウドネイティブアーキテクチャ、インテリジェンスの特徴を備えた、非常に競争力の高いエンタープライズレベルのプロダクトです。プロダクトは Alibaba Cloud のコンテナサービス ECS などの IaaS システム上で稼働し、Alibaba Cloud の各種システムと自然に連携しており、お客様がより多くのシナリオに適用できます。
プロダクトアプリケーションシナリオ
リアルタイムコンピューティング Flink 版プロダクトをベースに、4 つの主要アプリケーションシナリオをまとめました。ユーザーは必要に応じて、独自のビジネス向けリアルタイムコンピューティングソリューションを簡単に構築できます。
プロダクトアプリケーションシナリオ
1. リアルタイムデータウェアハウス
リアルタイムデータウェアハウスは、主に Web サイトの PV/UV 統計、商品売上統計、トランザクションデータ統計など、さまざまなトランザクションデータシナリオで使用されます。ビジネスのリアルタイムデータソースをサブスクライブし、秒単位でリアルタイムに情報を分析し、最終的に大型スクリーンに表示して意思決定者が利用できるようにすることで、会社のビジネス状況やイベントプロモーションの状況を判断しやすくなります。リアルタイムの業務運営データに基づいて意思決定を行い、真のデータインテリジェンスを実現します。このシナリオの特殊性により、リアルタイムデータは特に重要です。急速に変化するビジネス環境では、直近 1 分間、さらには直近 1 秒間に発生したデータを分析・意思決定する必要があり、リアルタイムコンピューティングがこのシナリオでの最適な選択です。
2. リアルタイムレコメンデーション
リアルタイムレコメンデーションは、主にユーザーの好みに基づいたパーソナライズドレコメンデーションや AI 技術に基づくレコメンデーションを主流のプロダクト形態としています。ショート動画シナリオ、EC ショッピングシナリオ、コンテンツフィードシナリオなどで一般的です。過去のユーザークリックに基づいてユーザーの好みをリアルタイムに判断し、ターゲットを絞ったレコメンデーションを行い、ユーザーのエンゲージメントを高めます。これは非常にリアルタイム性の高いシナリオであり、Flink 技術と AI 技術を組み合わせてリアルタイムレコメンデーションシナリオを運用できます。
3. ETL シナリオ
リアルタイム ETL シナリオはデータ同期操作で一般的であり、データ同期プロセス中にデータの計算・処理が必要です。たとえば、データベース内の異なるテーブル間の同期と変換、異なるデータベース間の同期、データ集約前処理などの操作があります。最終的に、結果はデータウェアハウスやデータレイクに書き込まれてアーカイブと蓄積が行われ、後続の詳細分析に向けた準備作業が行われ、ユーザーが後続のログ分析などの操作を実行しやすくなります。データ同期と処理の全リンクにおいて、Flink ベースのリアルタイムデータ同期と前処理を非常に効率的に行えます。
4. リアルタイムモニタリング
リアルタイムモニタリングは金融またはトレーディング業務シナリオで一般的です。業界の特殊性を考慮し、不正行為に対する商業化された監視が必要です。ユーザーのリアルタイム短期行動に基づいて、不正ユーザーかどうかを判断し、タイムリーに損失を止めます。このシナリオは適時性に対して非常に高い要件があります。異常データ検出を通じて、リアルタイムに異常状況を発見し、損失防止措置を講じることができます。各種システムのメトリクスやログなどの統計指標の収集、指標などの需要シナリオのリアルタイム観察とモニタリングは、すべてリアルタイムコンピューティング Flink 版プロダクトで解決できます。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
