Annual release of DataWorks full link data governance
Alibaba Cloud の強力なビッグデータ AI 統合プラットフォームの機能を基盤として、DataWorks のエンドツーエンドのフルリンクデータ開発・ガバナンスプラットフォームの新機能をツールレベルからご紹介し、ツールが人に奉仕するという本質に立ち返り、現場のデータ開発者およびビジネス担当者の作業効率を全面的に向上させます。
今年の Cloud Habitat Conference へようこそ。ビッグデータと AI の分野では、マシンのパフォーマンス、AI トレーニングリソースやビッグデータコンピューティングリソースの消費量に注目しがちです。こうした効率向上は認識しやすいものですが、データ効率を全面的に向上させるには、人間の効率とマシンの効率の両方が重要です。Alibaba Cloud の強力なビッグデータ AI 統合プラットフォーム機能を基盤に、DataWorks のエンドツーエンドのフルリンクデータ開発・ガバナンスプラットフォームの新機能をツールレベルからご紹介し、ツールが人に奉仕するという本質に立ち返り、現場のデータ開発者およびビジネス担当者の作業効率を全面的に向上させます。
まず、DataWorks の実績をご紹介します。DataWorks は 1 万社以上の企業顧客にサービスを提供してきました。顧客は工業製造、エネルギー、自動車、金融、小売、官公庁、インターネットなど幅広い業界にわたり、大規模な中央企業、国有企業、フォーチュン 500 企業から創業 1〜2 年の中小企業まで含まれます。プラットフォームの汎用性の観点から、あらゆる業界と企業発展の各段階におけるビッグデータ開発・ガバナンスのニーズに対応できます。同時に、ビッグデータ構築が深い領域に進むにつれ、データガバナンスはますます注目されるテーマとなっています。DataWorks は Alibaba Group 内で長年蓄積されたデータガバナンス経験をプロダクトとして体系化し、現在 Alibaba Cloud 上でクラウドユーザーの 100 万件以上のデータ問題を発見しています。この詳細は後ほどご紹介します。従来のデータ開発分野において、パブリッククラウドで毎日安定的にスケジューリングされるタスク数は 1,000 万件を超え、企業の大規模データ生産を強力に支えています。
これらの実績は、DataWorks が構築するフルリンクデータ開発・ガバナンスプラットフォームに支えられています。DataWorks は 10 年以上にわたり開発を続けてきたプロダクトです。エンタープライズレベルのデータウェアハウスとデータレイクの構築、レイクハウス統合のデータプラットフォームアーキテクチャに対応し、企業のデジタルトランスフォーメーションを加速させてきました。Alibaba が独自開発した ODPS 統合ビッグデータインテリジェントコンピューティングプラットフォーム(MaxCompute / Hologres)や、オープンソースビッグデータコンピューティングプラットフォーム EMR / CDP などのエンジンを基盤に、データウェアハウス、データレイク、レイクハウス統合などのソリューションに対して、統一されたフルリンクビッグデータ開発・ガバナンスプラットフォームサービスを提供しています。今年、DataWorks は EMR の新データレイククラスターに対応し、データの湖への取り込みからモデリング、開発、スケジューリング、ガバナンス、分析サービスまでのフルリンクデータレイク開発・ガバナンスを実現しました。中国情報通信研究院の評価では、フルスコアで 1 位のデータレイクソリューションとして認定されています。
以下では、DataWorks の新機能をデータ開発、データ分析サービス、データガバナンス、プラットフォームのオープン性の 4 つの観点からご紹介します。
標準化、リアルタイム、インテリジェントなデータ開発プラットフォーム
標準化については、データ開発プロセスにおける標準化能力に焦点を当てています。企業がデータウェアハウスやデータセンターを構築する際、そこには多くのビジネス知識が含まれており、従業員一人ひとりの頭に蓄積されている場合があります。人材の流動化やチームの変化に伴い、知識は徐々に失われたり、知識と情報の伝達に長時間を要したりします。エンタープライズレベルのデータプラットフォームが蓄積すべきものは、データそのものだけでなく、データの背後にあるビジネス知識でもあります。DataWorks は昨年データモデリング製品をリリースしました。今年は、フォワードモデリング、リバースモデリング、セマンティックモデリングなどの機能をアップグレードし、データウェアハウスのコールドスタート問題の解決とモデリングの敷居低減に加え、データモデルやデータ指標の経験を業界データモデルテンプレートとして蓄積しました。各業界の経験を統合し、製品化と体系化を通じて、企業のデータ知識と資産をデータプラットフォームに蓄積し、データビジネスの持続可能な発展を実現させます。
リアルタイムについては、技術とコンピューティング能力の発展に伴い、リアルタイムは必須の選択肢となりました。DataWorks は、MySQL、ClickHouse、OceanBase、ApsaraMQ for Kafka などのデータソースから Hologres へのリアルタイム書き込み機能や、MySQL から Object Storage Service (OSS) へのリアルタイムデータレイク取り込み機能を追加しました。従来のオフライン同期とは異なり、DataWorks の Data Integration は増分同期と統合同期を一体化し、データ統合を自動的に完了させて、データ同期処理効率を向上させます。
インテリジェンスについては、ビッグデータシステム全体は非常に複雑であり、データエンジニアが毎日行う作業の多くはデータ開発と運用保守です。インテリジェントな方法でデータエンジニアの開発・運用保守効率をいかに向上させるかを重視しています。DataWorks では、フィールド関連補完、コードエラープロンプト、SQL ロジック可視化などの SQL コーディングのインテリジェントな補完機能を提供し、SQL コーディング効率を 35% 以上向上させています。同時に、運用保守の問題はデータエラーやビジネスアラートなどの深刻な影響を伴うことが多いため、DataWorks は DAG 集約分析を提供し、各サイクルタスクと各サイクルインスタンスのスケジューリング状態(待機中、実行中、実行成功)を視覚的に表示して、問題タスクの上流・下流の運用状況を迅速に確認できます。さらに、依存関係、定期検査、スケジューリングリソース、エンジンリソース、データ品質ルールなどの観点からタスクのフルリンクインテリジェント診断を行い、データエンジニアがさまざまな運用保守問題を迅速に特定して解決できるよう支援します。さらに、DataWorks はベースラインによるタスク分類により、リソース競合時に高い保証レベルを持つコアタスクにスケジューリングおよびコンピューティングリソースを優先的に割り当て、コアタスクのタイムリーかつ安定した出力を確保します。履歴タスクの運用データに基づき、DataWorks はタスクの運用状況をインテリジェントに監視し、問題を事前にアラートします。データエンジニアは運用保守問題に対し、受動的な対応から能動的な予防へと移行しています。データ開発と運用保守の面で多くの機能を蓄積しており、データエンジニアは DataWorks 上でこれまで以上に多くの作業を効率的に行え、ビジネス要件の実現と価値創出により多くの時間を割くことができます。
ローコードで可視化されたデータ分析とサービス
データの処理と生産が完了したら、データを消費・共有・活用してその価値を最大化できます。DataWorks は新バージョンの UI とインタラクティブな SQL データ取得分析ツールをリリースし、データアナリストとビジネス担当者がセルフサービスでデータ取得分析を行えるようにすることで、ETL エンジニアの負担を大幅に軽減しています。さまざまなデータ分析シナリオにおいて、効率的なデータ処理機能を提供しています。クエリ結果は自動的にビジュアルチャートに変換され、ビジネス担当者がデータの概要と傾向を素早く把握でき、各種チャートの作成手間を削減します。二次処理が必要な場合は、スプレッドシート機能でソートやフィルタリングなどの一般的なデータ処理をデータをダウンロードせずにページ上で直接行えます。複雑な処理が必要な場合は、データ分析機能が便利なデータアップロード・ダウンロードとデータ権限制御機能を提供します。
データサービスは、データと上流アプリケーションを接続する重要なリンクです。開発者とデータアナリスト向けに、ローコードでデータ API を構築する一連のツールを提供しています。今年、新しいクエリ高速化サービスをリリースしました。Hologres の強力な機能に基づき、データを他のオンラインデータベースにエクスポートすることなく MaxCompute テーブルのクエリを直接高速化でき、アーキテクチャを簡素化し、データエクスポートによる追加のストレージとコンピューティングコストを大幅に削減します。
能動的かつ継続的なフルリンクデータガバナンス
これまでビッグデータの初期段階を完了させましたが、より良いツールとプラットフォーム、強力な計算エンジンが整備されると、データは急速に蓄積され、プラットフォーム全体のデータコストが急増します。データプラットフォームの次の課題は、いかにガバナンスを行いコストを削減するかです。DataWorks データガバナンスセンターは今年正式に商用リリースされ、2 つの核心的なコンセプトを備えています。
まず、「汚染してからガバナンスする」「開発してからガバナンスする」という後追い型のアプローチを削減する必要があります。DataWorks はデータガバナンスの全プロセスをデータ開発の各ステップに統合し、「SELECT * の禁止」などの確認項目ルールを内蔵しています。これにより、開発者が SQL を実行する際に「SELECT *」を使用すると、リマインドされ運用が禁止されます。「テーブル構造の整合性チェック」などの複雑なルールでは、開発環境と本番環境のテーブル構造が不一致の場合にブロックされ、本番タスク実行時のエラーレポートやデータ品質問題を未然に防ぎます。確認項目により、ソース段階からデータガバナンスの問題を直接防止できます。同時に、データガバナンスの具体的な方法がわからない企業に対しては、プラットフォームが能動的に既存のデータガバナンス問題を特定するよう促します。これらのガバナンス項目は Alibaba Group 内で蓄積されたデータガバナンス経験に基づくもので、データ品質モニタリングの欠如、ライフサイクル設定の未実施、長期間未アクセスのデータ、長時間待機タスクなどを含み、企業が段階的かつ項目ごとに各種問題をガバナンスするようガイドします。前述の通り、DataWorks データガバナンスセンターは現在、クラウドユーザーの 100 万件以上のデータガバナンス問題を発見し、その 60% 以上がすでに解決済みです。
能動的なデータガバナンスにより問題が発見された後、次の課題はデータガバナンスを一時的な取り組みに終わらせず、長期的かつ継続的に運用する方法です。企業のビッグデータチームにとって、データガバナンスは技術的な問題だけでなく、組織とマネジメントの問題でもあります。DataWorks データガバナンスセンターは、データガバナンスのヘルスサブモデルの完全なセットを提供します。このモデルは Alibaba Group 内で蓄積されたもので、R&D、ストレージ、コンピューティング、セキュリティ、品質の 5 つの側面をカバーし、約 100 のスコアリングディメンションを備え、定量的な手段で企業のデータガバナンスの取り組みを評価できます。ヘルススコアを基に、企業のデータガバナンス委員会(データプラットフォームチーム、ビジネスチーム、リスク管理、財務などの連携チーム)が共通の目標を設定できます。たとえば、ヘルススコアを 80 から 90 に引き上げる目標を立て、ビジネス側とプロダクション側からガバナンス最適化を実施するだけでなく、データプラットフォームチームにデータガバナンスのニーズを提出し、ヘルススコアと連携して各種データガバナンスキャンペーン、データガバナンスコンペティション、データガバナンスカレッジなどの長期的な運用を展開できます。組織は計測可能な方法を持ち、各部署や従業員も共通の目標を持つことができます。
能動的なデータガバナンスと継続的なデータガバナンス運用を通じて、DataWorks はデータガバナンスを書類上のルールや規定に留まらせず、実際に運用できるツールプロダクトとして、実際の業務と密接に連携させ、企業のデータガバナンスのポジティブサイクルを実現します。
オープンでスケーラブルなエンタープライズデータプラットフォーム
最後に、エンタープライズレベルのデータプラットフォームとして、内部のビジネスチームと外部パートナーの両方に対して、オープン性とスケーラビリティを維持する必要があります。今年の DataWorks はオープンプラットフォームを全面的にアップグレードし、OpenAPI ベースで OpenEvent、Extensions、Migration Assistant などのオープン機能をリリースしました。現在、DataWorks は 100 以上の API を提供しており、ユーザーは DataWorks のプラットフォーム機能をカスタマイズして呼び出し、社内アプリケーションと DataWorks の統合およびインタラクションを実現できます。OpenEvent は DataWorks のさまざまなステータス変更をメッセージ形式でユーザーに通知し、サブスクライブしてカスタマイズされた対応を行えます。たとえば、OpenEvent を通じてテーブル変更をサブスクライブし、コアテーブルのリアルタイムモニタリングを実現できます。また、承認センターイベントをサブスクライブして、企業の社内承認プロセスと統合し、ユーザー定義のプロセス承認機能を実現できます。Extensions のコアは再定義能力です。DataWorks が提供する機能は各企業の特定の要件を満たさない場合があり、その場合、企業は拡張プラグインを通じて自社に合った機能を定義できます。インターネット企業と伝統業界ではデータガバナンス分野での要件が異なるため、拡張プラグインを通じてカスタマイズされたガバナンス機能を定義できます。たとえば、厳格なコードリリースプロセスを持つ企業では、コードレビュープロセスを追加できます。ユーザーが送信ノードをクリックすると、開発環境に直接送信される代わりに、カスタマイズされたコードレビュープロセスに入り、カスタムレビュープロセスを通過した後に開発環境に送信されます。最後に、Migration Assistant は Oozie、Azkaban、Airflow などのスケジューリングエンジンに加えて、今年は DolphinScheduler のマイグレーション対応も追加し、Migration Assistant のオープンソース化を計画しています。企業はプラットフォーム間、クラウド間で簡単にマイグレーションできます。
データガバナンスの方法は一つではありません。DataWorks は Alibaba Group のデータガバナンスのベストプラクティスを提供するだけでなく、DataWorks オープンプラットフォームを通じて顧客やパートナーに強力なカスタマイズ機能を提供し、各業界がツールプラットフォームを通じてより効率的にデータガバナンスを推進できるようにしています。
今年の Cloud Habitat Conference では、DataWorks とさまざまなビッグデータエンジンを活用したデジタルトランスフォーメーションのベストプラクティスを発表した顧客も多数いました。
AIA Life は Alibaba Cloud を基盤に金融データミドルプラットフォームを構築し、ピーク時に 10 倍のビジネストラフィックに対応し、データ処理効率を 20 倍に向上させ、数百万規模のコンピューティングコストを削減しました。
「The King of Africa」 Voice Connect はグループのインターネット事業を強力に支援し、データガバナンス効率を 2〜3 倍に向上させ、グループの 95% 以上の事業成長を支え、中国企業ブランドをグローバルな新興市場にリードしています。
Nezha Auto はデータガバナンスとデータレイクの能力を継続的に強化し、優れたパフォーマンスとスケーラビリティを備えた安定したビッグデータプラットフォームにより、将来的に 60 万台以上の車両とペタバイト規模のデータ分析をサポートします。
Sanqi Mutual Entertainment は DataOps の概念でデータの価値を引き出し、自動化されたアジャイルで価値志向のデータシステムを構築し、データ取得の難しさ、ビジネス対応の遅さ、限定的なデータ活用シーンなどのデータ消費の課題を解決し、データ駆動型の精緻なオペレーションを実現しています。
データガバナンスは多くの側面を含む大きなトピックです。しかし、効率第一というテーマに立ち返り、ツールが人に奉仕するという本質に回帰しましょう。今年、人間の観点からフルリンクデータガバナンスの新機能をリリースしました。ツールプラットフォームを通じて、企業開発者の非効率な繰り返し作業を削減し、データ人材の作業効率を継続的に向上させ、企業のデータ効率を全面的に改善し、コスト削減と効率化を実現することを目指しています。
今年の Cloud Habitat Conference へようこそ。ビッグデータと AI の分野では、マシンのパフォーマンス、AI トレーニングリソースやビッグデータコンピューティングリソースの消費量に注目しがちです。こうした効率向上は認識しやすいものですが、データ効率を全面的に向上させるには、人間の効率とマシンの効率の両方が重要です。Alibaba Cloud の強力なビッグデータ AI 統合プラットフォーム機能を基盤に、DataWorks のエンドツーエンドのフルリンクデータ開発・ガバナンスプラットフォームの新機能をツールレベルからご紹介し、ツールが人に奉仕するという本質に立ち返り、現場のデータ開発者およびビジネス担当者の作業効率を全面的に向上させます。
まず、DataWorks の実績をご紹介します。DataWorks は 1 万社以上の企業顧客にサービスを提供してきました。顧客は工業製造、エネルギー、自動車、金融、小売、官公庁、インターネットなど幅広い業界にわたり、大規模な中央企業、国有企業、フォーチュン 500 企業から創業 1〜2 年の中小企業まで含まれます。プラットフォームの汎用性の観点から、あらゆる業界と企業発展の各段階におけるビッグデータ開発・ガバナンスのニーズに対応できます。同時に、ビッグデータ構築が深い領域に進むにつれ、データガバナンスはますます注目されるテーマとなっています。DataWorks は Alibaba Group 内で長年蓄積されたデータガバナンス経験をプロダクトとして体系化し、現在 Alibaba Cloud 上でクラウドユーザーの 100 万件以上のデータ問題を発見しています。この詳細は後ほどご紹介します。従来のデータ開発分野において、パブリッククラウドで毎日安定的にスケジューリングされるタスク数は 1,000 万件を超え、企業の大規模データ生産を強力に支えています。
これらの実績は、DataWorks が構築するフルリンクデータ開発・ガバナンスプラットフォームに支えられています。DataWorks は 10 年以上にわたり開発を続けてきたプロダクトです。エンタープライズレベルのデータウェアハウスとデータレイクの構築、レイクハウス統合のデータプラットフォームアーキテクチャに対応し、企業のデジタルトランスフォーメーションを加速させてきました。Alibaba が独自開発した ODPS 統合ビッグデータインテリジェントコンピューティングプラットフォーム(MaxCompute / Hologres)や、オープンソースビッグデータコンピューティングプラットフォーム EMR / CDP などのエンジンを基盤に、データウェアハウス、データレイク、レイクハウス統合などのソリューションに対して、統一されたフルリンクビッグデータ開発・ガバナンスプラットフォームサービスを提供しています。今年、DataWorks は EMR の新データレイククラスターに対応し、データの湖への取り込みからモデリング、開発、スケジューリング、ガバナンス、分析サービスまでのフルリンクデータレイク開発・ガバナンスを実現しました。中国情報通信研究院の評価では、フルスコアで 1 位のデータレイクソリューションとして認定されています。
以下では、DataWorks の新機能をデータ開発、データ分析サービス、データガバナンス、プラットフォームのオープン性の 4 つの観点からご紹介します。
標準化、リアルタイム、インテリジェントなデータ開発プラットフォーム
標準化については、データ開発プロセスにおける標準化能力に焦点を当てています。企業がデータウェアハウスやデータセンターを構築する際、そこには多くのビジネス知識が含まれており、従業員一人ひとりの頭に蓄積されている場合があります。人材の流動化やチームの変化に伴い、知識は徐々に失われたり、知識と情報の伝達に長時間を要したりします。エンタープライズレベルのデータプラットフォームが蓄積すべきものは、データそのものだけでなく、データの背後にあるビジネス知識でもあります。DataWorks は昨年データモデリング製品をリリースしました。今年は、フォワードモデリング、リバースモデリング、セマンティックモデリングなどの機能をアップグレードし、データウェアハウスのコールドスタート問題の解決とモデリングの敷居低減に加え、データモデルやデータ指標の経験を業界データモデルテンプレートとして蓄積しました。各業界の経験を統合し、製品化と体系化を通じて、企業のデータ知識と資産をデータプラットフォームに蓄積し、データビジネスの持続可能な発展を実現させます。
リアルタイムについては、技術とコンピューティング能力の発展に伴い、リアルタイムは必須の選択肢となりました。DataWorks は、MySQL、ClickHouse、OceanBase、ApsaraMQ for Kafka などのデータソースから Hologres へのリアルタイム書き込み機能や、MySQL から Object Storage Service (OSS) へのリアルタイムデータレイク取り込み機能を追加しました。従来のオフライン同期とは異なり、DataWorks の Data Integration は増分同期と統合同期を一体化し、データ統合を自動的に完了させて、データ同期処理効率を向上させます。
インテリジェンスについては、ビッグデータシステム全体は非常に複雑であり、データエンジニアが毎日行う作業の多くはデータ開発と運用保守です。インテリジェントな方法でデータエンジニアの開発・運用保守効率をいかに向上させるかを重視しています。DataWorks では、フィールド関連補完、コードエラープロンプト、SQL ロジック可視化などの SQL コーディングのインテリジェントな補完機能を提供し、SQL コーディング効率を 35% 以上向上させています。同時に、運用保守の問題はデータエラーやビジネスアラートなどの深刻な影響を伴うことが多いため、DataWorks は DAG 集約分析を提供し、各サイクルタスクと各サイクルインスタンスのスケジューリング状態(待機中、実行中、実行成功)を視覚的に表示して、問題タスクの上流・下流の運用状況を迅速に確認できます。さらに、依存関係、定期検査、スケジューリングリソース、エンジンリソース、データ品質ルールなどの観点からタスクのフルリンクインテリジェント診断を行い、データエンジニアがさまざまな運用保守問題を迅速に特定して解決できるよう支援します。さらに、DataWorks はベースラインによるタスク分類により、リソース競合時に高い保証レベルを持つコアタスクにスケジューリングおよびコンピューティングリソースを優先的に割り当て、コアタスクのタイムリーかつ安定した出力を確保します。履歴タスクの運用データに基づき、DataWorks はタスクの運用状況をインテリジェントに監視し、問題を事前にアラートします。データエンジニアは運用保守問題に対し、受動的な対応から能動的な予防へと移行しています。データ開発と運用保守の面で多くの機能を蓄積しており、データエンジニアは DataWorks 上でこれまで以上に多くの作業を効率的に行え、ビジネス要件の実現と価値創出により多くの時間を割くことができます。
ローコードで可視化されたデータ分析とサービス
データの処理と生産が完了したら、データを消費・共有・活用してその価値を最大化できます。DataWorks は新バージョンの UI とインタラクティブな SQL データ取得分析ツールをリリースし、データアナリストとビジネス担当者がセルフサービスでデータ取得分析を行えるようにすることで、ETL エンジニアの負担を大幅に軽減しています。さまざまなデータ分析シナリオにおいて、効率的なデータ処理機能を提供しています。クエリ結果は自動的にビジュアルチャートに変換され、ビジネス担当者がデータの概要と傾向を素早く把握でき、各種チャートの作成手間を削減します。二次処理が必要な場合は、スプレッドシート機能でソートやフィルタリングなどの一般的なデータ処理をデータをダウンロードせずにページ上で直接行えます。複雑な処理が必要な場合は、データ分析機能が便利なデータアップロード・ダウンロードとデータ権限制御機能を提供します。
データサービスは、データと上流アプリケーションを接続する重要なリンクです。開発者とデータアナリスト向けに、ローコードでデータ API を構築する一連のツールを提供しています。今年、新しいクエリ高速化サービスをリリースしました。Hologres の強力な機能に基づき、データを他のオンラインデータベースにエクスポートすることなく MaxCompute テーブルのクエリを直接高速化でき、アーキテクチャを簡素化し、データエクスポートによる追加のストレージとコンピューティングコストを大幅に削減します。
能動的かつ継続的なフルリンクデータガバナンス
これまでビッグデータの初期段階を完了させましたが、より良いツールとプラットフォーム、強力な計算エンジンが整備されると、データは急速に蓄積され、プラットフォーム全体のデータコストが急増します。データプラットフォームの次の課題は、いかにガバナンスを行いコストを削減するかです。DataWorks データガバナンスセンターは今年正式に商用リリースされ、2 つの核心的なコンセプトを備えています。
まず、「汚染してからガバナンスする」「開発してからガバナンスする」という後追い型のアプローチを削減する必要があります。DataWorks はデータガバナンスの全プロセスをデータ開発の各ステップに統合し、「SELECT * の禁止」などの確認項目ルールを内蔵しています。これにより、開発者が SQL を実行する際に「SELECT *」を使用すると、リマインドされ運用が禁止されます。「テーブル構造の整合性チェック」などの複雑なルールでは、開発環境と本番環境のテーブル構造が不一致の場合にブロックされ、本番タスク実行時のエラーレポートやデータ品質問題を未然に防ぎます。確認項目により、ソース段階からデータガバナンスの問題を直接防止できます。同時に、データガバナンスの具体的な方法がわからない企業に対しては、プラットフォームが能動的に既存のデータガバナンス問題を特定するよう促します。これらのガバナンス項目は Alibaba Group 内で蓄積されたデータガバナンス経験に基づくもので、データ品質モニタリングの欠如、ライフサイクル設定の未実施、長期間未アクセスのデータ、長時間待機タスクなどを含み、企業が段階的かつ項目ごとに各種問題をガバナンスするようガイドします。前述の通り、DataWorks データガバナンスセンターは現在、クラウドユーザーの 100 万件以上のデータガバナンス問題を発見し、その 60% 以上がすでに解決済みです。
能動的なデータガバナンスにより問題が発見された後、次の課題はデータガバナンスを一時的な取り組みに終わらせず、長期的かつ継続的に運用する方法です。企業のビッグデータチームにとって、データガバナンスは技術的な問題だけでなく、組織とマネジメントの問題でもあります。DataWorks データガバナンスセンターは、データガバナンスのヘルスサブモデルの完全なセットを提供します。このモデルは Alibaba Group 内で蓄積されたもので、R&D、ストレージ、コンピューティング、セキュリティ、品質の 5 つの側面をカバーし、約 100 のスコアリングディメンションを備え、定量的な手段で企業のデータガバナンスの取り組みを評価できます。ヘルススコアを基に、企業のデータガバナンス委員会(データプラットフォームチーム、ビジネスチーム、リスク管理、財務などの連携チーム)が共通の目標を設定できます。たとえば、ヘルススコアを 80 から 90 に引き上げる目標を立て、ビジネス側とプロダクション側からガバナンス最適化を実施するだけでなく、データプラットフォームチームにデータガバナンスのニーズを提出し、ヘルススコアと連携して各種データガバナンスキャンペーン、データガバナンスコンペティション、データガバナンスカレッジなどの長期的な運用を展開できます。組織は計測可能な方法を持ち、各部署や従業員も共通の目標を持つことができます。
能動的なデータガバナンスと継続的なデータガバナンス運用を通じて、DataWorks はデータガバナンスを書類上のルールや規定に留まらせず、実際に運用できるツールプロダクトとして、実際の業務と密接に連携させ、企業のデータガバナンスのポジティブサイクルを実現します。
オープンでスケーラブルなエンタープライズデータプラットフォーム
最後に、エンタープライズレベルのデータプラットフォームとして、内部のビジネスチームと外部パートナーの両方に対して、オープン性とスケーラビリティを維持する必要があります。今年の DataWorks はオープンプラットフォームを全面的にアップグレードし、OpenAPI ベースで OpenEvent、Extensions、Migration Assistant などのオープン機能をリリースしました。現在、DataWorks は 100 以上の API を提供しており、ユーザーは DataWorks のプラットフォーム機能をカスタマイズして呼び出し、社内アプリケーションと DataWorks の統合およびインタラクションを実現できます。OpenEvent は DataWorks のさまざまなステータス変更をメッセージ形式でユーザーに通知し、サブスクライブしてカスタマイズされた対応を行えます。たとえば、OpenEvent を通じてテーブル変更をサブスクライブし、コアテーブルのリアルタイムモニタリングを実現できます。また、承認センターイベントをサブスクライブして、企業の社内承認プロセスと統合し、ユーザー定義のプロセス承認機能を実現できます。Extensions のコアは再定義能力です。DataWorks が提供する機能は各企業の特定の要件を満たさない場合があり、その場合、企業は拡張プラグインを通じて自社に合った機能を定義できます。インターネット企業と伝統業界ではデータガバナンス分野での要件が異なるため、拡張プラグインを通じてカスタマイズされたガバナンス機能を定義できます。たとえば、厳格なコードリリースプロセスを持つ企業では、コードレビュープロセスを追加できます。ユーザーが送信ノードをクリックすると、開発環境に直接送信される代わりに、カスタマイズされたコードレビュープロセスに入り、カスタムレビュープロセスを通過した後に開発環境に送信されます。最後に、Migration Assistant は Oozie、Azkaban、Airflow などのスケジューリングエンジンに加えて、今年は DolphinScheduler のマイグレーション対応も追加し、Migration Assistant のオープンソース化を計画しています。企業はプラットフォーム間、クラウド間で簡単にマイグレーションできます。
データガバナンスの方法は一つではありません。DataWorks は Alibaba Group のデータガバナンスのベストプラクティスを提供するだけでなく、DataWorks オープンプラットフォームを通じて顧客やパートナーに強力なカスタマイズ機能を提供し、各業界がツールプラットフォームを通じてより効率的にデータガバナンスを推進できるようにしています。
今年の Cloud Habitat Conference では、DataWorks とさまざまなビッグデータエンジンを活用したデジタルトランスフォーメーションのベストプラクティスを発表した顧客も多数いました。
AIA Life は Alibaba Cloud を基盤に金融データミドルプラットフォームを構築し、ピーク時に 10 倍のビジネストラフィックに対応し、データ処理効率を 20 倍に向上させ、数百万規模のコンピューティングコストを削減しました。
「The King of Africa」 Voice Connect はグループのインターネット事業を強力に支援し、データガバナンス効率を 2〜3 倍に向上させ、グループの 95% 以上の事業成長を支え、中国企業ブランドをグローバルな新興市場にリードしています。
Nezha Auto はデータガバナンスとデータレイクの能力を継続的に強化し、優れたパフォーマンスとスケーラビリティを備えた安定したビッグデータプラットフォームにより、将来的に 60 万台以上の車両とペタバイト規模のデータ分析をサポートします。
Sanqi Mutual Entertainment は DataOps の概念でデータの価値を引き出し、自動化されたアジャイルで価値志向のデータシステムを構築し、データ取得の難しさ、ビジネス対応の遅さ、限定的なデータ活用シーンなどのデータ消費の課題を解決し、データ駆動型の精緻なオペレーションを実現しています。
データガバナンスは多くの側面を含む大きなトピックです。しかし、効率第一というテーマに立ち返り、ツールが人に奉仕するという本質に回帰しましょう。今年、人間の観点からフルリンクデータガバナンスの新機能をリリースしました。ツールプラットフォームを通じて、企業開発者の非効率な繰り返し作業を削減し、データ人材の作業効率を継続的に向上させ、企業のデータ効率を全面的に改善し、コスト削減と効率化を実現することを目指しています。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
