How do big data practitioners cope with the challenges brought by new technology trends?

オープンソースビッグデータプロジェクトの先駆者である Hadoop は、その登場から 15 年以上が経過しています。この 10 年間、オープンソースビッグデータの分野は急速に発展し、多様な技術の台頭と変遷を目の当たりにしてきました。

コードホスティングプラットフォームが収集した膨大なデータを処理・可視化することで、オープンソースビッグデータ技術の過去、現在、未来を深く洞察し、企業や開発者によるオープンソースビッグデータ技術の活用、学習、選定、研究開発に有益な指針を提供することを目的として、Open Atomic Open Source Foundation、X-Lab Open Laboratory、Alibaba Open Source Committee が共同で「2022 Open Source Big Data Thermal Report」プロジェクトを立ち上げました。

本レポートは、Hadoop の発展 10 年目にあたる 2015 年以降を対象期間として、関連する公開データを収集して相関分析を行い、オープンソースビッグデータが新たな段階に入ってからの技術トレンドと、オープンソースコミュニティの運営モデルが技術トレンドを推進する役割について研究しています。

102 の最も活発なオープンソースビッグデータプロジェクトを分析した結果、40 か月ごとにオープンソースプロジェクトの注目度は倍増し、技術は 1 世代のアップデートを完了することが判明しました。過去 8 年間で 5 回の大きな技術・人気の遷移があり、多様化、統合、クラウドネイティブへの移行が、現在のオープンソースビッグデータ発展の最も顕著な特徴となっています。

Open Atomic Open Source Foundation の副事務局長である Liu Jingjuan 氏は、本レポートが以下の関係者に役立つことを期待していると述べています。

(1) ビッグデータ技術の研究開発に従事する企業や開発者。レポートを通じてビッグデータ技術の開発動向を把握し、学習の方向性とスキル向上に役立てるとともに、技術の活性度の観点からアプリケーション開発における技術選定の参考とすることができます。

(2) オープンソースプロジェクトへのコード貢献に関心のある開発者。オープンソースビッグデータには多くの細分化領域があり、データセキュリティやデータマネジメントなど、比較的薄弱な分野も存在します。開発者は複数の細分化領域から着手し、これらの分野のより良い発展を支援できます。

(3) オープンソースビッグデータプロジェクトの運営者やメンテナー。優れたプロジェクトの注目度推移から経験と法則を学び取り、より成熟した方法でオープンソースプロジェクトを運営することができます。

ビッグデータの実務者にとって、オープンソースビッグデータプロジェクトの人気の遷移の背後にはどのような技術開発の論理があるのでしょうか。新たな技術トレンドがもたらす課題にどう対応すべきでしょうか。これらの疑問に応えるため、InfoQ は最近、Alibaba Group の副社長であり Alibaba オープンソース委員会委員長兼 Alibaba Cloud コンピューティングプラットフォーム事業部トップの Jia Yangqing 氏と、Apache Flink 中国コミュニティの創始者であり Alibaba オープンソースビッグデータプラットフォームの責任者である Wang Feng 氏 (dontask) に話を聞きました。

ユーザーニーズの多様化が技術の多様化を推進

Hadoop を中核とするオープンソースビッグデータエコシステムは、2015 年以降、多様な技術の並行発展へと移行しました。

一方では、Hadoop エコシステム内の製品イテレーションは安定期に入っています。HDFS などの一部の Hadoop エコシステムプロジェクトは他の新興技術の基盤となり、Flink + Kafka、Spark + HDFS といった一般的なオープンソースビッグデータコンポーネントの組み合わせは、オープンソースエコシステム市場で検証され、比較的成熟して使いやすく、標準的な選択肢として定着しています。

他方では、開発者の関心は「検索と分析」「ストリーム処理」「データビジュアライゼーション」「インタラクティブ分析」「DataOps」「データレイク」という 6 つの主要な技術ホットスポットに集まっています。各ホットスポットは特定のシナリオの問題解決に焦点を当てています。

レポートに示されているホットエリアの人気遷移(大幅な注目度の変動)は、これと符合しています。「データビジュアライゼーション」は 2016 年と 2021 年に、「検索と分析」と「ストリーム処理」は 2019 年に、「インタラクティブ分析」と「DataOps」は 2018 年と 2021 年に、「データレイク」は 2020 年にそれぞれ 2 回の人気遷移を経験しました。

これはビッグデータのアプリケーションシナリオと規模の変化のトレンドとも一致しています。すなわち、上位層のデータビジュアライゼーションアプリケーションの普及から始まり、データ処理技術の高度化を経て、データストレージと管理の構造的進化に至り、最終的にはインフラ機能の向上が上位層のアプリケーション技術のイノベーションを逆方向に牽引するという流れです。

Jia Yangqing は、人気遷移の背後で、技術の発展は螺旋状的なプロセスだと考えています。ユーザー側の要求が技術を前進させた後、システム側もより良いスケーラビリティ、低コスト化、高い柔軟性を実現するために進化する必要があります。システム側が大規模なデータの計算、処理、分析に対応できる状態に達すると、今度はユーザー側やビジネス側でのデータ分析やデータビジュアライゼーションの改善が求められるようになります。たとえば、人気のオープンソースビッグデータビジュアライゼーションツールである Apache Superset の背後にある商用企業 Preset は、最近 BI 分野で新たな取り組みを行っています。

安定期に入った Hadoop エコシステムと比べると、データガバナンス分析、ストリーム処理 + OLAP、データレイクなどの新しいシナリオでは、オープンソースビッグデータコンポーネントは依然として進化の過程にあり、今後もさらなる変化が期待されます。

こうした新興ビッグデータオープンソースコンポーネントがますます複雑化するにつれ、開発者がオープンソースデータプラットフォームを使いこなすことはますます困難になっています。これは、オープンソースコンポーネントを活用してエンタープライズレベルのビッグデータプラットフォームを構築しようとする企業にとって、大きな課題となっています。

まず、大半のビジネスシナリオでは複数のビッグデータコンポーネントを連携させる必要があり、技術チームは同時に多くの異なるビッグデータコンポーネントを習得し、それらをどのように組み合わせるかを理解する必要があります。しかし、中小企業や従来の企業の多くには十分なビッグデータ基礎人材が不足しています。そのため、企業には専門のビッグデータチームによる設計、コンサルティング、指導が必要になる場合があり、オープンソースビッグデータの各コンポーネントを連携させて完全なソリューションを構築できます。

次に、ビジネス規模が拡大すると、ビッグデータプラットフォームに対する安定性、セキュリティ、高可用性の要件も高まり、必然的にプラットフォーム構築の複雑さが増します。たとえば、システムに問題が発生した際に、何が問題なのか、どのように診断、分析、アラートを行い、リアルタイム観測を実現するのか。これらのサポート機能はオープンソースビッグデータコンポーネント自体には備わっていません。これにはオープンソースエコシステム内のツールや製品を活用し、企業が問題をより効果的に発見、特定、解決できるよう支援する必要があります。

Jia Yangqing と Wang Feng は、これらの課題はクラウド上の標準化された製品である程度解決できると考えています。ただし別の観点から見ると、クラウド自体もビッグデータ技術スタックに新たな課題をもたらしています。

クラウドネイティブがもたらす変化と課題

レポートによると、2015 年以降に登場した新規プロジェクトは例外なくクラウドネイティブ指向の技術戦略を採用しています。Plusar、DolphinScheduler、JuiceFS、Celeborn、Arctic などのクラウドネイティブ時代に生まれたオープンソースプロジェクトが次々と登場し、2022 年におけるこれらの新規プロジェクトの注目度割合は 51% に達しています。中でもデータインテグレーション、データストレージ、データ開発と管理の分野では大きなプロジェクト変動があり、新規プロジェクトの注目度割合は 80% を超えています。2020 年以降、Spark、Kafka、Flink などの主流プロジェクトも公式に Kubernetes をサポートするようになりました。

クラウドネイティブの潮流の中で、オープンソースビッグデータ技術スタックは再構築されています。中でもデータインテグレーション分野の再構築が最も急速に進んでいます。

クラウド上での多様なデータ収集ニーズの爆発と下流のデータ分析ロジックの変化に伴い、データインテグレーションは「労働集約型」の ETL ツールから、柔軟で効率的かつ使いやすい「データ処理パイプライン」へと進化しました。Flume や Camel といった従来のデータインテグレーションツールは安定したメンテナンス状態にあり、Sqoop は 2021 年に Apache Foundation からリタイアしました。一方、クラウドネイティブとより緊密に統合された Airbyte、Flink CDC、SeaTunnel、InLong などのプロジェクトが急速に発展しています。

レポートの注目度トレンドから、クラウドネイティブデータインテグレーションは 2018 年に従来のデータインテグレーションを逆転したことがわかります。2019 年以降、この進化は加速し、注目度は年々倍増しています。新たにインキュベートされた多くのプロジェクトの注目度の年平均成長率は 100% を超え、強い成長の勢いを示しています。

過去数年間で、データソースとデータストレージは徐々にクラウドへ移行され、より多様なコンピューティングワークロードもクラウド上で実行されるようになりました。実際、クラウドベースはオープンソースビッグデータの前提条件の多くを変えています。この変化を直接経験した Wang Feng は深く感じ入っています。

10 年以上前、Wang Feng は Hadoop ベースのビッグデータ開発業務に参加していました。当時、彼は比較的若手のエンジニアで、作業のほとんどはローカルマシン上で行われていました。どのモデルを使うか、ディスクはどのくらいのサイズか、ディスクを大きくすべきかメモリを大きくすべきかといったことを考慮する必要がありました。

現在、ビッグデータの基盤は仮想マシン、コンテナ、オブジェクトストレージ、クラウドストレージになりました。すべてのオープンソースプロジェクトは、エラスティックアーキテクチャ、優れた可観測性の確保、Kubernetes などのクラウドネイティブエコシステムとの自然な連携を当初から考慮する必要があります。これらの課題は既にすべての人の潜在意識に根付き、多くのオープンソースプロジェクトの初期段階での期待を変えています。

同時に、クラウド上で稼働するようになると、データアーキテクチャも変化します。たとえば、コンピュートとストレージの分離はビッグデータプラットフォームの標準アーキテクチャとなり、誰もがデフォルトで考慮すべき課題になりました。したがって、どのようなビッグデータコンポーネント(Flink、Hive、Presto など)であっても、データシャッフルを行う際には、ローカルマシンに依存できず、ローカルディスクの存在を前提とできないことを考慮する必要があります。クラウド上のマシンは必ず移行するためです。これには汎用的なシャッフルサービスが作業を支援し、クラウドリソースモデルの変化に適応的にスケジューリングする必要があります。最近、Alibaba はオープンソースプロジェクト Celeborn を Apache Foundation に寄付し、コンピューティングエンジンのデータシャッフル性能向上を支援しています。

技術面では、クラウドは従来のオープンソースビッグデータシステムにより多くの課題をもたらしています。たとえばスケジューリングについて、以前は Hadoop 上でリソース管理とスケジューリングを行うのが一般的でしたが、クラウドに移行した後は誰もが Kubernetes エコシステムを採用し、Kubernetes ベースでオーケストレーションとスケジューリングを行うようになりました。ただし、Kubernetes はオンライン向けスケジューリングサービスとして、大規模データコンピューティングタスクのスケジューリングにボトルネックがあります。Alibaba 自身も Kubernetes に多くの改善を加えています。

さらに、クラウドストレージには多くの利点がある一方で、伝送帯域幅とデータローカリティには課題もあります。JuiceFS や Alluxio などの新興オープンソースプロジェクトはクラウドストレージアクセラレーションの問題を解決するために設計されています。Alibaba Cloud EMR 上のビッグデータストレージアクセラレーションサービス JindoData も同様の取り組みを行っています。Wang Feng は、オープンソースビッグデータシステムはまだ進化中であり、クラウドネイティブと真に統合されるにはまだ道のりがあると述べています。

ビッグデータの実務者はどのように将来に向き合うべきか

テクノロジーイノベーションの実験場として、クラウドネイティブはより柔軟なリソース弾力性と低いストレージ・運用コストをもたらしています。多くの企業がクラウド上でより大胆な試みを行い、新しいものへの挑戦意欲を高め、イノベーション技術やソフトウェアの成功をより容易にしています。Jia Yangqing は、海外の多くの新しいソフトウェアやエンジンが「まずユーザーを集め、その後ユーザーを顧客に転換する」という道筋を辿っていると指摘しています。彼の考えでは、クラウドが優れたリソースとソフトウェアの配信環境を提供していることから、この傾向は今後中国でも広がる可能性があります。

ただし、クラウドは便利なハンマーを与えてくれたにすぎません。使い方を誤れば、自分の足を叩くことにもなりかねません。たとえば、クラウド上ではリソースの取得が容易なため、ユーザーがデータ保存や計算を無駄に行い、リソースを浪費する可能性があります。そのため、ビジネスの観点から見ると、クラウドサービスプロバイダーとユーザーは実際には一体です。クラウドサービスプロバイダーは、大規模なオープンソースデータシステムを基盤として、企業のニーズに応じてより多くのデータガバナンスを行い、ユーザーがクラウドというハンマーを有効活用し、リソースの浪費を防ぐよう支援する必要があります。Jia Yangqing は、クラウドプラットフォームとクラウドリソースをより効果的に活用する方法が企業の関心事となっており、現在はエンタープライズソフトウェアがこの役割を担っているが、今後はより多くのオープンソースツールが登場するだろうと述べています。

データエンジニアリングの将来を楽しむために、Jia Yangqing はビッグデータの実務者が注力すべき 3 つの方向性があると考えています。1 つ目はクラウド、すなわちシステムアーキテクチャの問題をクラウドで解決することです。オフラインとリアルタイムの統合、ビッグデータと AI の統合、ストリームとバッチの統合、レイクハウス統合の 4 つのレベルをカバーします。現在、オープンソースプロジェクトもクローズドソース製品も、より統合された方向へ向かっています。Flink コミュニティの新しいサブプロジェクト TableStore もこの方向への試みであり、最終目標はビッグデータ技術スタックの複雑さをある程度軽減することです。将来的には、計算エンジンはデータガバナンスやデータオーケストレーションツールとさらに統合され、一体化したデータソリューションになる可能性があります。

2 つ目は、上位層のデータアプリケーションがよりシンプルになることです。長期的には、エンドユーザーはすべてのデータを共通の SQL で分析できるようになります。最後に、今後さらなるエコシステムの発展が期待されます。Alibaba Cloud の Flink、EMR、海外の Databricks、Snowflake、BigQuery はいずれもツールプラットフォームに過ぎません。これらのデータプラットフォーム上で、Salesforce に似たより多くの企業がよりリッチな垂直型ソリューションを構築し、最終的により繁栄したデータエコシステムを形成する必要があります。ただし、その前提としてデータプラットフォームの標準化が先行する必要があります。

Wang Feng もデータエコシステム、特にオープンソースビッグデータの将来の発展について楽観的です。現在、欧米の多くのデータ企業はそれぞれに特徴を持ちながらも、互いにシナジーを形成し、健全な競争状態を保っています。Wang Feng は、これが各社の製品の標準化を促進し、ユーザーや顧客に多くのメリットをもたらすと考えています。アプリケーション市場全体から見ると、標準化が形成されれば、すべての関係者が比較的低コストでこのデータエンジニアリングエコシステムにアクセスできるようになり、市場全体のパイを共に大きくすることができます。

急速に発展するデータエンジニアリング分野で、ビッグデータの実務者はどのように将来に向き合うべきでしょうか。将来、職務の役割や責任は変化するのでしょうか。

Jia Yangqing は、システムエンジニア、データエンジニア、データサイエンティストの役割は今後も存続すると考えています。ただし、クラウドが多くのシステム問題を解決したため、ますます多くのエンジニアの役割が上位のビジネス層へ移行していきます。システム構築の基盤的な作業、すなわちシステムエンジニアの役割は、標準化されたサービスを提供するクラウドデータサービスプロバイダーやデータエンジンサービスプロバイダーに集中する可能性があります。その他の企業はビジネス自体に注力し、データサイエンスや上位層のビジネスに人材を投入するようになり、多くのシステムエンジニアを必要としなくなります。これは社会分業の精緻化がもたらす必然的な結果です。

データサイエンティストとデータエンジニアについては、その責任はデータを活用してビジネス価値を実現することにさらに集中していきます。データモデリングやビジネスニーズに応じたデータガバナンスなどの作業が含まれますが、以前のように基盤システムや運用保守の問題を解決する必要はありません。これらの問題はシステムエンジニアとクラウドによって既に解決されているからです。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.