System Construction of Cloud Native Digital Safety Production

安全生産に関して、前述の最近の障害事例からわかるように、一般企業だけでなく、安全生産に多額の投資を行っている国内外の大手インターネット企業でもビジネス障害が発生しています。障害発生後、ビジネスの中断や経済的損失だけでなく、世論の影響も大きな課題となります。では、どのようにして安全生産システムを構築できるのでしょうか。これが本日お話しする中心的なテーマです。

Alibaba Group では、10 年以上の探求を経て、一連のプロダクトおよびサービスシステムと、安全生産構築の手法を蓄積してきました。「高可用性と安定性を最優先する」ことを、ビジネスサイドの安全生産課題に対する指導理念としてまとめました。

デジタル安全生産とは

今日、デジタル安全生産についてお話しする際、最初に思い浮かぶのは、安全生産はより伝統的なものかもしれません。たとえば、工場、作業場、炭鉱、建設現場などでは、スローガン、ポスター、関連する概念をよく見かけます。伝統的な安全生産とは、生産・運営活動において、人身傷害や財産損失を引き起こす事故を回避するために、対応する事故防止・管理措置を講じることを指します。

今日お話しするデジタル安全生産は、ビジネスのデジタルトランスフォーメーションとアップグレードと組み合わせ、主に企業の事業継続管理の問題を解決するものです。予期しない事故や災害が発生した場合、企業は合理的なコストとリソースで重要なビジネス活動を保護し、規定時間内の継続的業務の再開を確保し、災害の影響を最小限に抑え、中断の影響を最小限に抑える必要があります。

デジタル安全生産には、以下の特別な要件があります。

• デジタル化による安全生産。ビジネスがオフラインからオンラインに移行した後、ビジネスライフサイクル全体の接点のデジタルトランスフォーメーションを完了します。この時、安全生産の重点もオフラインからオンラインに移行し、安全生産自体の業務にもデジタル化による機能強化が必要となります。

• クラウドネイティブによる安全生産支援。デジタルトランスフォーメーションによりアーキテクチャーのアップグレードがもたらされ、すべてのシステムがクラウド上にあり、先進的なクラウドネイティブおよびマイクロサービスアーキテクチャーを使用して設計されています。安全生産プラットフォームも同期してアップグレードし、クラウドネイティブのプロダクト機能と将来のアーキテクチャーの拡張性にシームレスに適応する必要があります。

• ベストプラクティスの安全生産。安全生産システムの構築は実践による検証が必要です。Alibaba Group 内には、100 名以上のチームが安全生産の構築を探求し、さまざまな業界に非常に適したベストプラクティスのセットを蓄積しており、現在も進化を続けています。

デジタル安全生産構築の内容

前述の議論に基づいて、安全生産を適切に行うために、核心的な内容は事前、事中、事後の 3 部分に分かれます。

• 事前:関連する組織構造の保証、システムプロセス体系、システムアーキテクチャー構築を事前に準備する必要があります。また、関連システムのキャパシティモニタリングや障害モニタリングの能力、SLA に合わせた保護、フロー切り替え、変更管理の能力が必要です。

• 事中:迅速かつ敏捷な連携を実現し、障害の迅速な発見、特定、復旧を達成する必要があります。たとえば、Alibaba では、「独身の日」や大規模障害のシナリオで、通常数百名または数千名のチームと連携する必要があります。この文脈では、まず、一貫性を保証する統一されたメカニズムが必要であり、前述の同僚が言及したフルリンクモニタリング(可観測性)の能力が迅速な発見を確保します。さらに、イベント処理プロセスの自動連携を行う体系的な能力、システムのトレースおよびトポロジー能力による迅速な特定、システムの保護能力、セルラーディザスタリカバリ、マルチアクティブによる真の迅速な障害復旧が必要です。

• 事後:振り返り、根本原因の要約、アクションの定義を行う必要があります。各障害緊急対応完了後、レビューを行い、ランク付けと責任割り当てを行い、システムの改善項目を出力して、アーキテクチャー全体の継続的な反復改善を確保する必要があります。マネージャーにとっては、障害の原因、処理プロセスにおけるチーム連携の効率、チームおよびプロダクトの安定性データ統計を分析し、安全生産管理体系全体が測定可能、評価可能、管理可能であることを確保する必要があります。最後に、可視化の能力を通じて、ビジネス安全生産を指標的かつグローバルに制御できます。

Alibaba Group のベストプラクティス

Alibaba Group グローバルオペレーションコマンドセンター

まず、組織サポートレベルでは、グローバルオペレーションコマンドセンター(GOC)と呼ばれる組織があります。グループ内では、60 を超えるビジネス BU があり、安全生産に関連するすべてのビジネスを GOC に接続し、統一された協調処理を行っています。

次に、モニタリング(可観測性)についてお話ししましたが、これは非常に重要なリンクです。すべての可観測性と手動フィードバック(Taobao カスタマーサービスや Alibaba Cloud カスタマーサービスが収集するフィードバックなど)を統一されたイベントセンターに集約し、体系的なプラットフォームを使用して管理します。

最後に、すべての障害緊急対応は、台湾海峡両岸の 3 か所のコマンドセンターに集約されます。対応する緊急対応担当学生は、緊急連携、障害特定、迅速復旧ツールを使用して、障害緊急対応と迅速復旧処理を実施し、復旧後の改善を行い、メカニズム運用などのさまざまな戦略を通じてグループ全体の安全生産リスクイベントを管理します。

安全生産システムの全体像

安全生産は完全なシステムです。この構造図を活用して、概略を紹介します。グループの安全生産システムは比較的大規模で、全体の作業を小さなモジュールに分割します。

まず、プラットフォームの技術能力によるサポートです。前述の紹介を通じて、安全生産には異なる役割を持つ多くの人々、異なるビジネスシステムからの可観測データが関わることを学びました。安全生産管理には、負荷テスト、障害緊急対応連携、ドリル、特定、フロー切り替え、復旧の能力が必要です。グループには対応するプラットフォームがあり、効果的なサポートを提供しています。

このプラットフォーム上で、障害管理、マルチアクティブ、フルリンク負荷テスト、変更管理などの機能を含む、さまざまな分野のシステム構築が、この大規模プラットフォーム上で統一されたサポートとなっています。安全生産プラットフォームの構築も、安全生産業務のデジタルトランスフォーメーションです。

プラットフォームの最上位には、関連する管理システム、データ運用、技術および文化の構築があります。初期に安全生産に取り組んでいた頃、最大の実感は測定できないことでした。障害発生後、問題がどこにあるのか、誰の問題なのかを特定できませんでした。障害レベル定義、障害分類、安定性分類のメカニズムシステムと運用活動の構築を通じて、安全生産の測定可能、評価可能な業務を実現できました。

次に、プラットフォームとシステムの構築は、関連するドリルと連携して標準化された受け入れを実施し、これらのシステムとプロダクト機能が効果的に実装され、役割を果たすことを確保する必要があります。

安全生産の核心的要素

People & Organization

安全生産の核心は主に 3 部分で構成されています。最初の部分は人員組織構造の構築です。安全生産は企業の最重要プロジェクトであり、すべての安全生産機能を調整できる統一されたトップダウン組織を確立する必要があります。

グループ内には、このような縦の組織構造があります。コマンドセンターは各ビジネス BU と同じレベルの部門であり、その後、各ビジネス BU をサポートする対応する専門役割があります。横断的には、安全生産のシフトリーダー、仲裁委員会などの組織役割があり、システムが効果的に実装されることを確保しています。

System & Process

2 番目の部分は主にメカニズムプロセスに関するものです。グループは 10 年以上の構築を経て、多くのシステムプロセスを蓄積してきました。

• グループ全体の統一された障害レベル定義:緊急対応プロセスにおけるリソーススケジューリングと意思決定の定量的基準を提供します。

• 標準化された緊急対応プロセス:イベント処理を迅速かつ秩序あるものにし、障害スコアと安定性スコアの評価基準を使用して、安全生産の結果を統一的に測定します。

• 障害分類、責任決定、紛争交渉メカニズム:安全生産を確保する長期的なメカニズム。

ツールプラットフォーム

最後の部分はツールです。グループのシステムとプロセスは、紙上や壁に掲げるだけではありません。すべてのメカニズムプロセスは対応するシステムプラットフォームによってサポートされ、システムの能力、ロボット、NLP 技術などを基盤として、これらのメカニズムすべてを毎日の実務や各実装リンクに効果的に実装しています。

障害レベル定義

障害レベルの定義は安全生産システムの運用基盤です。本番環境におけるサービス中断、サービス品質の低下、体験の低下を、理由に関係なく障害として統一的に定義します。これはビジネス視点から定義された障害であることに注意してください。その利点は、ユーザーよりも前に検出でき、従来のモニタリングよりも正確なことです。

次に、下位レベルでは、ミドルウェア、データベース、クラウドプラットフォーム、ネットワーク、サーバーなど、多くのサポートプラットフォームがあります。下位レベルの指標と障害定義は、各ビジネスの特性に応じて定義されます。ただし、全体的な原則は依然としてビジネス影響に基づいています。上から下へ、下位システムのビジネスのみであり、通常は上位システムのビジネス依存となります。

障害レベル定義に基づいて、グループ内には実際に実装する際に多くの種類の障害があります。いくつかの一般的なカテゴリを以下に示します:P シリーズは一般的なレベル定義を表し、D シリーズはデータ品質レベルを表し、S シリーズは重要な顧客への影響度を表し、E シリーズは世論レベルを表し、I シリーズはインフラストラクチャーの関連レベルを表します。

通常、各シリーズに対して 4 つのレベルがあり、4 は一般的な障害を表し、1 は深刻な障害を表します。数字が小さいほど、緊急度と重要度が高くなります。

実際の実装プロセスでは、まずすべてのビジネスを管理範囲に含め、すべてのビジネスの障害レベルを定義する必要があります。障害レベル定義は、開発、テスト、プロダクト、運用保守、ビジネス依存者を含むすべての役割と連携して、レベル定義をレビューし、事前に合意が得られていることを確保する必要があります。障害レベル定義が正式に公開された後、全員がこのレベルに従って投資し、バックエンドリソースをサポートします。障害発生時、レベルに応じて異なる緊急対応プロセスを起動し、対応するリソースを調整して緊急対応に参加できます。

各ビジネスシナリオの障害レベルは、ビジネスの重要性、影響エリア、期間を参照して決定されます。決定された障害レベル定義は構造化され測定可能である必要があり、リンク全体の観測と連携して、自動障害検出を実現する必要があります。

障害が発生すると、可観測指標に基づいてルールを定義し、自動的に障害レベルを計算しようとします。障害基準に達した後、ロボットを通じて自動的に障害通知を送信します。同時に、リンク全体の可観測トポロジー機能とトレース機能を組み合わせて、予備的な特定支援を提供します。

1-5-10 メカニズム

障害レベルの定義により、ビジネスの障害リスクを正確に特定し、タイムリーに発見して処理できます。では、障害処理の効率をどのように測定するのでしょうか。これはデジタル安全生産の最も核心的なメカニズムの 1 つ、1-5-10 メカニズムに関わります。

グループ内では、すべての障害発生後、1 分以内にビジネス障害を発見してアナウンスし、5 分以内に関連人員が対応して初期特定を行い、10 分以内に障害の迅速復旧を完了するという評価目標を設定しました。そして、このような核心的な指導メカニズムに基づいて、下位レベルで安全生産システム全体を構築していきます。

1-5-10 戦略分解

1-5-10 は主に「発見、特定、迅速復旧」の 3 つのリンクに焦点を当てており、アーキテクチャー、開発、運用保守の複数のリンクに関わります。各リンクには独自のビジネスルール、関連メカニズム、および構築が必要な対応システムがあります。

たとえば、「1」の部分は主にリンク全体の観測に関わっており、通常注目しているインテリジェントベースラインやリンク全体のモニタリングも含まれます。これらはこのリンクで行う必要があることです。

次に、5 分間の対応と特定については、通常、テキストメッセージ、電話、DingTalk を含むモバイル方法に基づいてアナウンスを行います。そして、連携ツールがあります。DingTalk ロボットに基づいて連携を行い、NLP ロボット技術を使用してチェックインと緊急対応プロセスの対話を行い、ChatOps を実現します。

特定の面では、可観測システム、プランシステム、変更管理などの能力が必要です。一般的に、プラットフォームで障害が発生すると、まず障害通知を受信し、その後、障害前の関連する変更情報を受信します。システムはこのシナリオに関連するプランをプッシュし、緊急対応担当者は可観測能力に基づいて補助的な特定を達成します。

10 分間の迅速復旧部分については、最大のトリックはユニット単位でフローを切り替えることです。システムのみが障害の影響を判断でき、推定復旧時間が許容できない場合、ユニットマルチアクティブ機能に基づいてユニット単位でフローを切り替え、復旧後に判断できます。さらに、小規模な障害はプランシステムに基づいてローカルで迅速に復旧できます。

最後は関連する運用メカニズムの構築とドリル受け入れです。運用メカニズムも安全の非常に重要な部分であり、関連する安全生産機能の継続的な反復を確保できます。ドリルは障害注入をシミュレートし、オンライン環境を使用してリアルタイムでシステムとプロセスをテストできます。

評価可能な指標

安全生産の大きな課題の 1 つは測定できないことです。通常、どのプロダクトが安定しているのか、どのチームがうまくやっているのか、将来の改善方向がわかりません。前述のプロダクト技術システムの構築に基づいて、多くの運用基準を設計しました。

• 障害スコア:各障害発生後、システムは自動的にスコアを判断します。基本的な計算ロジックは影響エリア、期間、設定ウェイトです。これはプロダクトと緊急対応効率を測定する結果指標です。継続的な運用を通じて、チームの障害クォータ値を設定し、安全生産に関連する将来の目標を設定できます。

• 安定性スコア:エンジニアリング設計、アーキテクチャー、運用保守の 14 の指標で構成されます。設計段階のカバーレビュー、運用段階の可観測カバレッジ、リリースプロセスのグレースケール機能、事後アクション完了率など、各ビジネス開発チームに注目し、体系的に評価指標を生成します。安定性スコアは、安全生産に関連する投入を評価するプロセス指標です。

障害スコアと安定性スコアは基本的に 2 つの核心的な指標であり、チームが安全生産分野で適格かどうかを判断する重要な基準です。さらに、ビジネス可用性、サーキットブレーカー、変更管理など一連のメカニズムがあります。これらのメカニズムはそれぞれのシステムプラットフォームで実行され、自動管理を実現します。

緊急対応プロセス

緊急対応プロセスについては、すべてのイベントを GOC に収集します。イベントアクセスは主に 2 つのタイプがあります。1 つはユーザー側のフィードバックです。これはインテリジェントカスタマーサービスとの連携に基づく手動部分です。もう 1 つの部分は可観測アラームです。グループビジネス BU の数十のモニタリングシステムを接続しています。大量のアラームデータが入ってきた後、収束、抑制、インテリジェントアルゴリズム処理が関わり、バックグラウンドのロボット処理とフィルタリングと組み合わせて、最終的に統一されたプラットフォームに統合されて障害レベルを決定します。イベントまたは障害は DingTalk グループを通じて連携され、通常の非緊急イベントはワークオーダーを通じて処理されます。システム間には対応する連携があります。処理プロセスはナレッジベースを通じて効果的に蓄積され、全体プロセスデータは大画面を通じて統一された可視化で表示されます。

処理プロセスはすべて DingTalk グループ内で完了します。障害通過後、関連人員はグループ内でサインインする必要があり、緊急対応プロセスはグループを通じて統一的に提示されます。重大な障害が発生すると、シニアマネジメントグループにエスカレーションし、より多くの人々と連携します。

メカニズム運用

前述のプロダクト機能と関連する組織構造に加えて、メカニズム運用も安全生産の非常に重要な部分です。多くの運用活動、さまざまな表彰、優れたパフォーマンスを発揮したチームの経験共有、パフォーマンスの悪いチームの要約と改善を行い、安全生産の長期的なメカニズムを確保します。

デジタル安全生産システム構築スキーム

大規模デジタルセキュリティマップ

企業が安全生産構築を行う場合、核心は 2 部分に分かれます:1 つは技術システムの構築、もう 1 つはサービスシステムの構築です。

技術システムについては、統一されたプラットフォームを形成する必要があります。先ほど、ある同僚が企業内には多くのモニタリングシステムがあり、すべてのビジネスがそれらを持っていると言及しました。アプリケーション層、ミドル層、データベース、クラウドプラットフォーム、ネットワークにはそれぞれのシステムがあります。このような分散方法で構築すると、統一された緊急コマンドセンターを形成することは困難です。私たちの提案は、統一されたプラットフォームを構築することで、これには安全生産のためのさまざまな運用機能があり、すべてのシステムのビジネス機能を統合して統一されたコマンドセンターを形成します。

サービス面では、メカニズム文化と組織構造が安全生産の効果的な実装をサポートできるようにする必要があります。

デジタル安全生産プラットフォーム

デジタル安全生産プラットフォームについては、既存の機能を統合するフレームワークを設計しました。可観測性、緊急プラン、ワークオーダー、イベント管理など、さまざまな分野の組み立てを通じて、人とイベントのライフサイクル全体を統一管理するプラットフォームに抽象化します。そして、プラットフォームを通じて対応するビジネスエリアを形成し、さまざまなビジネスシナリオをサポートし、上位レベルでさまざまなビジネスにサービスを提供します。これが統一された安全生産プラットフォームの全体的なアーキテクチャーです。

デジタル安全生産システム構築 - ライフサイクル全体サービス設計

事前

長期計画を行う際、企業は安全生産に関連するプロダクトアーキテクチャーとビジネスアーキテクチャーを明確に設計し、対応するビジネス管理思考を持つ必要があります。

事中

運用プロセスでは、ドリル、負荷テスト、スロットリング、マルチアクティブなど、システムキャパシティ構築を考慮し、リスクを効果的に評価および防止できるようにする必要があります。

ここにケースがあります。これはこの期間中に皆さんが熟悉しているビジネスアプリケーション、疫病予防管理システム(ヘルスコード、プレイスコード、核酸検出など)です。初期段階で、システム全体の負荷測定を実施し、オンラインのキャパシティと水水位を評価します。

評価の結果、オンライン本番システムのキャパシティは 10000 QPS オンラインです。このフローに従ってシステムリソースを準備します。ピークフローが 10000 QPS を超える場合、フロープロテクション機能を設定し、極端なケースでもシステムが崩壊しないことを確保します。

次のレベルでは、システムに SLA の要件が高い場合、システムのデュアルアクティブ機能も構築する必要があります。これは安全生産のための大きな動きです。極端なケースでビジネスシステムが崩壊した際、ビジネスを引き継ぐ対応するデュアルライブ環境があることを確保する必要があります。これらの機能はすべて統一されたプラットフォームで管理する必要があります。

事後

最後の部分は事後の改善です。この部分は実際に緊急対応連携機能の改善、プロダクトアーキテクチャーの改善、管理メカニズム全体の改善など、幅広い側面をカバーしています。改善が期限内に完了したかどうか、導入効果が理想的かどうかは、非常に重要なクローズドループです。対応するサポートを持つプラットフォームが必要です。

デジタル安全生産 - ホログラフィック可観測プラットフォーム

プラットフォームキャパシティ構築については、各重要なリンクを分解していきます。最初は可観測性で、これは先ほどお話しした acos のフルリンクモニタリングです。付け加えるべき点は、可観測性は必ずしも特定のプラットフォームに依存するのではなく、ビジネスサイトのすべてのモニタリング機能を効果的に統合する必要があるということです。acos はプロプライエタリクラウド ARMS アプリケーションモニタリングと互換性があり、ビジネス、ログ、異種モニタリングシステムのアクセス機能を強化します。可視化機能の改善を通じて、迅速な特定を達成できます。

デジタル安全生産 - フルリンク負荷テスト

2 番目の部分はフルリンク負荷テストです。安全生産プロセスで、最も重要な内容の 1 つはプラットフォームの処理能力を理解することです。システムの水水位と究極の耐容量を知る必要があります。こうすることで、実際のビジネスのピークトラフィックが到来した際、明確な考えを持ち、簡単に対応できます。

フルリンク負荷テストは、グループ内のさまざまなプロモーション活動で重要なリンクです。各フルリンク負荷テストは本番システムで実施され、負荷テストからのすべてのデータが真実であることを確保できます。対応するボトルネックとシステム問題はオンライン問題と同じです。ボトルネックを正確に見つけ出し、ビジネスシステム全体の負荷レベルを改善します。

デジタル安全生産 - 「1-5-10」緊急対応連携

この記事では主に 1-5-10 緊急対応連携について紹介します。安全生産システムの実際の構築プロセスでは、まず手動でフィードバックされたイベントとアラームを統合し、ビジネス視点から障害レベルを定義して、1 分以内に障害を迅速に発見し、正確かつタイムリーに通知できるようにする必要があります。

緊急対応プロセスでは、リソースの接続、クロスチームおよびクロスベンダーの人員連携、DevOps 機能と ChatOps 機能の導入など、対応する横断的なサポート機能を持ち、システムが自動的にインターフェースを見つけて迅速な特定を支援できるようにする必要があります。

構築の初期段階では、主に既存の機能に依存して効果的な統合を行います。もちろん、成熟したソリューションはすべて持っていますが、完全にバージョンを変更して最初から始める必要があるわけではありません。一般的に、企業は現在の状況に基づいて行う必要があります。そして、迅速復旧部分には、関連プラン、ディザスタリカバリ、デュアルライブなどの関連ルールと機能があります。1-5-10 は安全生産構築の中で最も簡単に導入でき、最も早く効果が見える部分です。

デジタル安全生産 - フロープロテクション

フロープロテクションの機能については、先ほど一部お話ししました。

実際の環境では、突然のピークトラフィックに対応するために追加のリソースを準備する必要があります。これは実際にはコストと効率の間の妥協です。一部のビジネスはビジネスピークを構築する際に評価されるかもしれません。このピークに基づいて、無制限のコンピューティングリソースやストレージリソースを準備しないかもしれませんが、ビジネスピークが到来した時、システムを停止させることはできません。

したがって、極端なケースでもサービスの可用性を確保し、運用保守操作のための拡張時間を確保するために、システムのスロットリング機能が必要です。一般的に、先ほど紹介したフルリンク負荷テストと連携し、フロープロテクション機能とクラウドネイティブコンテナ化に関連するエラスティシティ機能を通じて、関連トラフィックピークのスムーズな移行を確保し、ビジネス全体の安定性を最大化できます。

デジタル安全生産 - ディザスタリカバリおよびマルチアクティブソリューション

ディザスタリカバリとマルチアクティブは安全生産の究極の戦略です。大規模な障害が発生した際、独立した特定と復旧機能に依存しているだけでは、重要なシステムの SLA を満たせない可能性があります。この時、ビジネスレベルのディザスタリカバリとマルチアクティブを構築する必要があります。

私たちの高レベルのディザスタリカバリ計画では、全体的なアーキテクチャーはモジュール化されており、つまり異なる場所でのマルチアクティブのビジネスレベル計画です。しかし、多くの企業は通常ディザスタリカバリから始めます。データベースの同期、ストレージとレプリケーションを通じて、各アプリケーションが自分の部分を管理し、関連するディザスタリカバリ機能を獲得します。

ディザスタリカバリマルチアクティブシステムには統一的な管理制御プラットフォームがあり、トラフィックアクセス層、ミドルウェア、データベースの協調管理を実装します。これは大きなトラフィックスケジューリングシステムであり、ビジネス障害発生後に単一アプリケーションのトラフィックを自動的にスケジューリングできることを確保できます。単一アプリケーションの関連ビジネストラフィック切り替えは自動的に実行できます。切り替えプロセスプラットフォームは自動的に完了し、アプリケーションの手動調整は不要です。

マルチライブ構築はリソース利用率、切り替え成功率、自動化度で明確な利点があり、企業安全生産構築の究極の目標でもあります。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.