Experts from Alibaba Cloud, Byte and Huake said about O&M
今日の入念な「運用」戦略があってこそ、将来の安定性を維持できます。不久前、Alibaba Cloud は中国コンピュータ産業協会情報ストレージセキュリティ専門委員会と共に、Alibaba Cloud、ByteDance、華中科技大学の専門家を招き、デジタル経済時代におけるストレージシステムの運用保守について議論する場を設けました。
1. レイテンシの低減とシステムパフォーマンスの急激な変動の回避
運用保守の本質は、ネットワーク、サーバー、サービスのライフサイクル全体を通じて、コスト、安定性、効率性の面で許容可能な状態を達成することです。ICT 業界では、運用保守担当者が「運用保守はアプリケーションへの生涯にわたるコミットメントだ」と冗談めかして語ることがよくあります。彼らはデータセンターや企業の IT リソースの管理者であり、警備員であり、消防隊のような存在です。
Alibaba Cloud Intelligence のシニアテクニカルエキスパートであり、オブジェクトストレージの研究開発ディレクターである Luo Qingchao は、この点を深く理解しています。同氏は、Alibaba Cloud の主要顧客からレイテンシジッターの保護を求められた過去を振り返り、クラウドストレージサービスのリクエストで遅延ジッターが激しい場合、アプリケーション全体のパフォーマンスがジェットコースターのように急激に変動すると指摘しました。
クラウド上のリクエストレイテンシには、ネットワーク遅延とストレージレイテンシが含まれます。クラウドサービスのネットワークは非常に複雑で、BGP (ボーダーゲートウェイプロトコル)、静的パブリックネットワーク、データセンター内ネットワークなどを含みます。遅延に影響を与える輻輳ポイントを特定し、適切なスケジューリングを行うことが、輻輳を回避する上で重要です。
ストレージサービスはメディアアクセスの遅延にも対応する必要があります。メカニカルディスクやソリッドステートディスクも複雑なシステムであり、負荷が大きいほどレイテンシは高くなります。特に分散ストレージシステムでは、ウイルス感染のような連鎖的な影響も生じます。遅延ジッターを低減するため、OSS は迅速なモニタリング、正確なアラーム、根本原因分析、最適なスケジューリングを通じて、遅延ジッターを合理的な分散範囲内に制御し、良好な顧客体験を確保しています。
華中科技大学の研究者で博士課程指導教官の Wu Fei は、大学からの参加であるため運用保守担当者からのプレッシャーを直接感じることはないものの、24 時間 365 日のスタンバイ体制の難しさは理解できると笑顔で語りました。これは永久機関に匹敵するものです。現在、クラウドストレージに求められる信頼性は 11 個の 9 です。ソリッドステートディスクと従来のメカニカルディスクは、クラウドストレージにおける最も基本的なデータストレージユニットですが、保守は容易ではありません。前者のストレージメディアはフラッシュメモリで構成されています。原理的に、フラッシュメモリはドアのようなもので、開閉のたびに摩耗していきます。使用過程で劣化は避けられず、徐々に不具合が生じ、やがて障害が発生します。後者は機械のように常に回転し続けていますが、最終的には回転が止まります。何千台ものソリッドステートディスクやハードディスクで構成されるストレージシステムにおいて、これほど高い信頼性を確保するための運用保守担当者のプレッシャーは想像に難くありません。
2. インテリジェント運用保守のトレンドは時代とともに変化
「新インフラを改善するには、まず運用保守を改善せよ」。企業のデジタル化の過程で、運用保守は重要な役割を担っています。
ByteDance のデータベースストレージ技術責任者である Zhang Lei は、運用保守技術はこの 10 年間で飛躍的な発展を遂げたと述べています。従来の手動運用保守から、DevOps を活用した自動運用保守、そして AIOps によるインテリジェント運用保守へと進化してきました。ByteDance のクラウドデータベースクラウドストレージの運用保守システム全体の発展過程も、おおむね三段階に分けられます。
第一段階は 2016 年以前で、データベースとストレージの全体の規模はまだ比較的小さく、チームの運用保守はいわば原始的な状態、つまり基本的には手作業で行われていました。
第二段階は 2017 年から 2021 年です。ビジネス規模が急速に発展し、クラウドストレージシステムは EB レベルに達し、データベースは数千から数万セットに及び、手動運用保守の限界が見え始めました。そのため、運用保守チームは自動化運用保守プラットフォームの構築に転じ、これらのプラットフォームに依存して運用上の課題を解決しました。
第三段階は、2021 年半ばからの AI などの技術を活用した第三世代運用保守システムの構築です。運用保守担当者の知識と経験をビッグデータや機械学習技術と組み合わせ、運用保守システムに統合することで人的リソースを置き換え、より大規模な運用効率の課題を解決します。
これら三段階の発展を通じて、ビジネスシステム全体に二つの大きな能力向上が見られました。一つは、運用保守の文化、組織、能力の向上です。わかりやすく言えば、誰もが暗中模索していた個人レベルの運用保守から、体系的で組織的な専門 SRE チームによる運用保守体制へと進化したことです。もう一つは、運用保守システム自体とサービスの技術体系も進化していることです。たとえば、かつては数十台のサーバーを管理していたものが、現在は数十万台のサーバーを管理するようになり、技術体系が絶えず進化してこれを支えています。つまり、運用保守の文化と組織、そして運用保守の技術体系は、互いに補完し合いながら発展してきたのです。
3. 問題の根本原因を迅速に特定・診断
ビジネスのクラウド移行に伴い、運用保守も徐々に「クラウド化」されています。リソース監視、端末管理と制御、セキュリティサポートなどの運用保守サービスがクラウドアプリケーションに変換され、企業が必要に応じてサブスクライブできるようになっています。
Zhang Lei は、普段からサービスのゴールド指標、特に安定性に関連するものに注目していると述べています。大規模なオンラインサービスでは、安定性が最優先事項だからです。さらに、長期的に依存する技術の進化経路にも注目し、技術やプロダクト形態に大きな変化があった際も運用保守システムが遅れを取らないようにしています。
Luo Qingchao は、サービスプロバイダーとして Alibaba Cloud OSS はサービスのコミットメントである SLA (サービスレベルアグリーメント) と SLO (サービスレベルオブジェクティブ) を満たす必要があると指摘しました。具体的には、OSS の公式ウェブサイトでは可用性の SLA が 99.995% と約束されており、これは業界をリードする水準です。サービスプロバイダーとして、指定された基準に従ってリクエストの成功率を必ず測定し、この指標を確保するためにあらゆる手を尽くします。SLO はより詳細なサービスコミットメントで、たとえば、顧客のリクエストの全体的な帯域幅が Tbps レベルで安定していることや、一部の典型的なリクエストレイテンシが 100ms レベルで大きな変動なく保証されることなどが含まれます。
近く、Alibaba Cloud はオブザーバビリティサービス CloudLens をリリースし、顧客に主流クラウドプロダクトの運用保守知識を提供します。CloudLens は、OSS に対して使用量分析、パフォーマンスモニタリング、セキュリティ分析、データ保護、異常検知、アクセス分析などの機能を提供し、コスト、パフォーマンス、セキュリティ、データ保護、安定性、アクセス分析の六つの観点から顧客の管理能力をサポートします。
Wu Fei は、アプリケーションの急速な発展を支えるため、ストレージ技術も進化し続けていると考えています。従来のディスクアレイから集中型ストレージを経て、現在ではシステム内に数十台から数千台の分散ストレージサーバーが存在する可能性があります。技術的には、数千台のサーバーを確実に稼働させる方法を検討する必要があります。運用保守の観点からは、障害を発生させない、または障害を迅速に検知して迅速な修復、迅速な復旧を実現することが求められます。
近年、AI が急速に発展しています。大学の研究者も AI を活用してシステム障害を事前に予測する研究を行っており、システム障害が発生する前にデータ移行を完了させ、運用保守の負荷を効果的に軽減することを目指しています。
4. 産学研連携による成長コミュニティの構築
運用保守がビジネスシステムに提供するサポートは、Alibaba Cloud のようなサービスプロバイダーの取り組みと、ByteDance のようなプロダクトユーザーの努力から切り離せません。基礎理論技術と最先端技術研究の主体として、大学や研究機関は多くの重要な最先端技術において深い基礎技術の蓄積と豊富な理論研究基盤を有しており、産学研連携のイノベーションは産業発展において注目すべき分野です。
Wu Fei は、このようなパートナーシップを「共成長体」と定義するのが適切だと述べています。これにはイノベーションチェーン、産業チェーン、ユーザーチェーンが含まれます。このような連携があるからこそ、ユーザーと研究開発側が結ばれ、相互の発展が促進されます。わかりやすく言えば、産学研が一体化し、各関係者が共に成長することで、技術の発展と実装を推進するのです。
たとえば、大学がクラウドストレージの信頼性を研究する際に新しいアルゴリズムを提案し、そのアルゴリズムの実装と適用の過程で ByteDance や Alibaba Cloud などの企業と連携して、実際のシステムにアルゴリズムをデプロイすることで産業発展を促進します。
Wu Fei はまた、産学研セクターにおける越境イノベーションが大学の専門家や学者のキャリア開発計画の重要な部分になっていると指摘しました。多くの専門家や学者が、産業界で技術の実装推進に尽力した後、再び学界に戻るという道を選んでいます。これは「学術休職」と呼ばれています。同氏は、今後学界と産業界のさらなる融合が進むと考えています。
Zhang Lei は、産学研の融合は技術の誕生から広範な応用に至るまでの重要な推進力だと考えています。近年、クラウドストレージシステムの一部の技術は確立されてきました。同氏はまず、学界と研究コミュニティがインフラストラクチャ分野でのブレークスルーをもたらすことを期待しています。ストレージメディア、クラウドストレージアーキテクチャ全体、あるいはシステム、運用保守の考え方と方法におけるブレークスルーが、業界に新しい活力をもたらすでしょう。次に、産業界も新技術、新方法、新理念を大胆に試み、適切なシナリオに統合していくべきです。ByteDance のような大企業は技術的なボリューム、サーバー、ストレージの規模が大きく、非常に優れた技術レバレッジ効果があります。一見非常に小さな技術最適化でも、大規模なシナリオでは大きな価値を生み出せます。そのため、各関係者間の相互支援が必要です。
Luo Qingchao は、サービスプロバイダーとしての Alibaba Cloud の共通成長における二つのコアポイントを指摘しました。一つは、共通運用保守機能のためのベースサービスを提供すること、もう一つは顧客、産業界、学界からのインプットと先進的なアイデアを吸収してベースの成長を促進することです。
二人のゲストが言及した産学研の組み合わせについて、Luo Qingchao は共成長体の進化において非常に重要と考えられる二つの段階があると述べています。第一段階では、CCIA のような組織が共通成長のための土壌と生態系を提供します。CCIA がうまく運営されれば、運用保守と技術の共通成長のための強固な基盤を築けます。第二段階では、共成長体が具体的な成果を生み出す必要があります。たとえば、CCIA はコミュニケーションの橋を築き、業界に影響を与える標準的なホワイトペーパーや技術革新のアイデアをインキュベートする組織です。
結び:大学の機能が人材育成、科学研究から社会サービスへと拡張するにつれて、企業、協会、大学の連携はさらに深まり、これは発展の好循環を形成し、ストレージ技術の成果の市場化を促進する上で疑いのないプラスとなります。このプロセスで、ユーザーとベンダーの双方が大きな恩恵を受けるでしょう。
1. レイテンシの低減とシステムパフォーマンスの急激な変動の回避
運用保守の本質は、ネットワーク、サーバー、サービスのライフサイクル全体を通じて、コスト、安定性、効率性の面で許容可能な状態を達成することです。ICT 業界では、運用保守担当者が「運用保守はアプリケーションへの生涯にわたるコミットメントだ」と冗談めかして語ることがよくあります。彼らはデータセンターや企業の IT リソースの管理者であり、警備員であり、消防隊のような存在です。
Alibaba Cloud Intelligence のシニアテクニカルエキスパートであり、オブジェクトストレージの研究開発ディレクターである Luo Qingchao は、この点を深く理解しています。同氏は、Alibaba Cloud の主要顧客からレイテンシジッターの保護を求められた過去を振り返り、クラウドストレージサービスのリクエストで遅延ジッターが激しい場合、アプリケーション全体のパフォーマンスがジェットコースターのように急激に変動すると指摘しました。
クラウド上のリクエストレイテンシには、ネットワーク遅延とストレージレイテンシが含まれます。クラウドサービスのネットワークは非常に複雑で、BGP (ボーダーゲートウェイプロトコル)、静的パブリックネットワーク、データセンター内ネットワークなどを含みます。遅延に影響を与える輻輳ポイントを特定し、適切なスケジューリングを行うことが、輻輳を回避する上で重要です。
ストレージサービスはメディアアクセスの遅延にも対応する必要があります。メカニカルディスクやソリッドステートディスクも複雑なシステムであり、負荷が大きいほどレイテンシは高くなります。特に分散ストレージシステムでは、ウイルス感染のような連鎖的な影響も生じます。遅延ジッターを低減するため、OSS は迅速なモニタリング、正確なアラーム、根本原因分析、最適なスケジューリングを通じて、遅延ジッターを合理的な分散範囲内に制御し、良好な顧客体験を確保しています。
華中科技大学の研究者で博士課程指導教官の Wu Fei は、大学からの参加であるため運用保守担当者からのプレッシャーを直接感じることはないものの、24 時間 365 日のスタンバイ体制の難しさは理解できると笑顔で語りました。これは永久機関に匹敵するものです。現在、クラウドストレージに求められる信頼性は 11 個の 9 です。ソリッドステートディスクと従来のメカニカルディスクは、クラウドストレージにおける最も基本的なデータストレージユニットですが、保守は容易ではありません。前者のストレージメディアはフラッシュメモリで構成されています。原理的に、フラッシュメモリはドアのようなもので、開閉のたびに摩耗していきます。使用過程で劣化は避けられず、徐々に不具合が生じ、やがて障害が発生します。後者は機械のように常に回転し続けていますが、最終的には回転が止まります。何千台ものソリッドステートディスクやハードディスクで構成されるストレージシステムにおいて、これほど高い信頼性を確保するための運用保守担当者のプレッシャーは想像に難くありません。
2. インテリジェント運用保守のトレンドは時代とともに変化
「新インフラを改善するには、まず運用保守を改善せよ」。企業のデジタル化の過程で、運用保守は重要な役割を担っています。
ByteDance のデータベースストレージ技術責任者である Zhang Lei は、運用保守技術はこの 10 年間で飛躍的な発展を遂げたと述べています。従来の手動運用保守から、DevOps を活用した自動運用保守、そして AIOps によるインテリジェント運用保守へと進化してきました。ByteDance のクラウドデータベースクラウドストレージの運用保守システム全体の発展過程も、おおむね三段階に分けられます。
第一段階は 2016 年以前で、データベースとストレージの全体の規模はまだ比較的小さく、チームの運用保守はいわば原始的な状態、つまり基本的には手作業で行われていました。
第二段階は 2017 年から 2021 年です。ビジネス規模が急速に発展し、クラウドストレージシステムは EB レベルに達し、データベースは数千から数万セットに及び、手動運用保守の限界が見え始めました。そのため、運用保守チームは自動化運用保守プラットフォームの構築に転じ、これらのプラットフォームに依存して運用上の課題を解決しました。
第三段階は、2021 年半ばからの AI などの技術を活用した第三世代運用保守システムの構築です。運用保守担当者の知識と経験をビッグデータや機械学習技術と組み合わせ、運用保守システムに統合することで人的リソースを置き換え、より大規模な運用効率の課題を解決します。
これら三段階の発展を通じて、ビジネスシステム全体に二つの大きな能力向上が見られました。一つは、運用保守の文化、組織、能力の向上です。わかりやすく言えば、誰もが暗中模索していた個人レベルの運用保守から、体系的で組織的な専門 SRE チームによる運用保守体制へと進化したことです。もう一つは、運用保守システム自体とサービスの技術体系も進化していることです。たとえば、かつては数十台のサーバーを管理していたものが、現在は数十万台のサーバーを管理するようになり、技術体系が絶えず進化してこれを支えています。つまり、運用保守の文化と組織、そして運用保守の技術体系は、互いに補完し合いながら発展してきたのです。
3. 問題の根本原因を迅速に特定・診断
ビジネスのクラウド移行に伴い、運用保守も徐々に「クラウド化」されています。リソース監視、端末管理と制御、セキュリティサポートなどの運用保守サービスがクラウドアプリケーションに変換され、企業が必要に応じてサブスクライブできるようになっています。
Zhang Lei は、普段からサービスのゴールド指標、特に安定性に関連するものに注目していると述べています。大規模なオンラインサービスでは、安定性が最優先事項だからです。さらに、長期的に依存する技術の進化経路にも注目し、技術やプロダクト形態に大きな変化があった際も運用保守システムが遅れを取らないようにしています。
Luo Qingchao は、サービスプロバイダーとして Alibaba Cloud OSS はサービスのコミットメントである SLA (サービスレベルアグリーメント) と SLO (サービスレベルオブジェクティブ) を満たす必要があると指摘しました。具体的には、OSS の公式ウェブサイトでは可用性の SLA が 99.995% と約束されており、これは業界をリードする水準です。サービスプロバイダーとして、指定された基準に従ってリクエストの成功率を必ず測定し、この指標を確保するためにあらゆる手を尽くします。SLO はより詳細なサービスコミットメントで、たとえば、顧客のリクエストの全体的な帯域幅が Tbps レベルで安定していることや、一部の典型的なリクエストレイテンシが 100ms レベルで大きな変動なく保証されることなどが含まれます。
近く、Alibaba Cloud はオブザーバビリティサービス CloudLens をリリースし、顧客に主流クラウドプロダクトの運用保守知識を提供します。CloudLens は、OSS に対して使用量分析、パフォーマンスモニタリング、セキュリティ分析、データ保護、異常検知、アクセス分析などの機能を提供し、コスト、パフォーマンス、セキュリティ、データ保護、安定性、アクセス分析の六つの観点から顧客の管理能力をサポートします。
Wu Fei は、アプリケーションの急速な発展を支えるため、ストレージ技術も進化し続けていると考えています。従来のディスクアレイから集中型ストレージを経て、現在ではシステム内に数十台から数千台の分散ストレージサーバーが存在する可能性があります。技術的には、数千台のサーバーを確実に稼働させる方法を検討する必要があります。運用保守の観点からは、障害を発生させない、または障害を迅速に検知して迅速な修復、迅速な復旧を実現することが求められます。
近年、AI が急速に発展しています。大学の研究者も AI を活用してシステム障害を事前に予測する研究を行っており、システム障害が発生する前にデータ移行を完了させ、運用保守の負荷を効果的に軽減することを目指しています。
4. 産学研連携による成長コミュニティの構築
運用保守がビジネスシステムに提供するサポートは、Alibaba Cloud のようなサービスプロバイダーの取り組みと、ByteDance のようなプロダクトユーザーの努力から切り離せません。基礎理論技術と最先端技術研究の主体として、大学や研究機関は多くの重要な最先端技術において深い基礎技術の蓄積と豊富な理論研究基盤を有しており、産学研連携のイノベーションは産業発展において注目すべき分野です。
Wu Fei は、このようなパートナーシップを「共成長体」と定義するのが適切だと述べています。これにはイノベーションチェーン、産業チェーン、ユーザーチェーンが含まれます。このような連携があるからこそ、ユーザーと研究開発側が結ばれ、相互の発展が促進されます。わかりやすく言えば、産学研が一体化し、各関係者が共に成長することで、技術の発展と実装を推進するのです。
たとえば、大学がクラウドストレージの信頼性を研究する際に新しいアルゴリズムを提案し、そのアルゴリズムの実装と適用の過程で ByteDance や Alibaba Cloud などの企業と連携して、実際のシステムにアルゴリズムをデプロイすることで産業発展を促進します。
Wu Fei はまた、産学研セクターにおける越境イノベーションが大学の専門家や学者のキャリア開発計画の重要な部分になっていると指摘しました。多くの専門家や学者が、産業界で技術の実装推進に尽力した後、再び学界に戻るという道を選んでいます。これは「学術休職」と呼ばれています。同氏は、今後学界と産業界のさらなる融合が進むと考えています。
Zhang Lei は、産学研の融合は技術の誕生から広範な応用に至るまでの重要な推進力だと考えています。近年、クラウドストレージシステムの一部の技術は確立されてきました。同氏はまず、学界と研究コミュニティがインフラストラクチャ分野でのブレークスルーをもたらすことを期待しています。ストレージメディア、クラウドストレージアーキテクチャ全体、あるいはシステム、運用保守の考え方と方法におけるブレークスルーが、業界に新しい活力をもたらすでしょう。次に、産業界も新技術、新方法、新理念を大胆に試み、適切なシナリオに統合していくべきです。ByteDance のような大企業は技術的なボリューム、サーバー、ストレージの規模が大きく、非常に優れた技術レバレッジ効果があります。一見非常に小さな技術最適化でも、大規模なシナリオでは大きな価値を生み出せます。そのため、各関係者間の相互支援が必要です。
Luo Qingchao は、サービスプロバイダーとしての Alibaba Cloud の共通成長における二つのコアポイントを指摘しました。一つは、共通運用保守機能のためのベースサービスを提供すること、もう一つは顧客、産業界、学界からのインプットと先進的なアイデアを吸収してベースの成長を促進することです。
二人のゲストが言及した産学研の組み合わせについて、Luo Qingchao は共成長体の進化において非常に重要と考えられる二つの段階があると述べています。第一段階では、CCIA のような組織が共通成長のための土壌と生態系を提供します。CCIA がうまく運営されれば、運用保守と技術の共通成長のための強固な基盤を築けます。第二段階では、共成長体が具体的な成果を生み出す必要があります。たとえば、CCIA はコミュニケーションの橋を築き、業界に影響を与える標準的なホワイトペーパーや技術革新のアイデアをインキュベートする組織です。
結び:大学の機能が人材育成、科学研究から社会サービスへと拡張するにつれて、企業、協会、大学の連携はさらに深まり、これは発展の好循環を形成し、ストレージ技術の成果の市場化を促進する上で疑いのないプラスとなります。このプロセスで、ユーザーとベンダーの双方が大きな恩恵を受けるでしょう。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
