Cloud supercomputing solutions comprehensively help the life science industry benefit and efficiency
01 ライフサイエンス業界の概要
ライフサイエンスは、生命現象を研究し、生命活動の法則と生命の本質を解明する科学です。一般的に、科学研究を支援する企業の業界を科学サービス業界と呼び、ライフサイエンス研究に特化した企業の業界をライフサイエンスサービス業界と呼んでいます。ライフサイエンス技術は、分子遺伝学を中核とする先進的な科学技術であり、ライフサイエンスがまず答えるべき問いは「生命とは何か」ということです。
ライフサイエンスの主な分野は、医学、生物学、銀行業、遺伝学およびその関連分野です。市場において密接に関連する顧客層は、主に病院、研究開発機関、科学研究機関などです。
業界全体の産業チェーンは、上流、中流、下流の 3 つのレベルに分けられます。上流は主に機器製造とソフトウェア研究開発を担っており、競争の中で Murphy と Huadu は比較的有名な上流メーカーです。中流は主にサービスプロバイダーが主導し、下流は医療機関、科学研究施設、製薬会社などのサービス利用者が位置しています。
上流が業界全体の要を握っていることがわかります。中流はライフサイエンスサービスプロバイダーとして、エンドユーザーに対応するサービスを提供し、そこからサービス料を徴収しています。下流はサービスの利用者であり、中流サービスセグメントの市場規模、発展の見通し、ビジネスモデルの特徴を決定づけています。
遺伝子検出技術を例にとると、現在最も普及している遺伝子検出技術は第二世代シーケンシングです。主に血液や唾液から全遺伝子配列を解析・判定し、さまざまな疾患に罹患する可能性を予測するために使用されています。
遺伝子シーケンシング関連の製品と技術は、実験室レベルの研究から臨床応用へと進化してきました。遺伝子シーケンシング技術は、次世代の世界を変える技術と言えます。PCR 法や FISH 技術と比較して、高いスループットと大量のデータ処理という特徴を持っています。遺伝子シーケンシング技術の課題としては、操作が複雑であること、サンプルの DNA 濃度と純度に対する要求が高いこと、そしてデータが膨大で複雑であることが挙げられます。
ゲノミクスの代表的な業務である全ゲノムシーケンシングについて見てみましょう。13 年をかけて進められたヒトゲノムプロジェクト (HGP) は 2003 年に完了し、遺伝子シーケンシング分野全体に革命的な変化をもたらしました。その後、1000 ゲノムプロジェクトや 10K プロジェクトなど、政府資金による多くの大規模シーケンシングプロジェクトも相次いで開始され、遺伝的変異、人類の進化、遺伝性疾患に関する人類の研究と発見を大きく推進しました。
コンピューターサイエンスと情報の分野において、GATK に基づく全ゲノムシーケンシングプロセスは、現代の遺伝子シーケンシングで極めて重要な役割を果たしています。
一般的なゲノムシーケンシング業務では、多数のアプリケーションソフトウェアが存在し、使用方法も多様です。また、多数の直列処理ソフトウェアも使用されています。典型的な全ゲノムシーケンシングプロセスには、主に 2 つの特徴があります。
1 つ目は、実行時間が長いことです。従来のプロセスと汎用コンピューティングリソースでは、ヒトゲノムサンプル 1 つを処理するのに約 1,000 CPU コアが必要です。2 つ目は、データ量が大きいことで、単一サンプルから平均 1 TB の中間データが生成されます。
そのため、クラスターキューイングによる並列処理効率の向上、ヘテロジニアスコンピューティングソリューションによる実行パフォーマンスの高速化、コンテナベースでの異なる業務イメージのデプロイ、ホットデータとコールドデータのバックアップストレージが、コンピューター情報分野における主要な分析テーマとなっています。
02 ライフサイエンス業界の分析
従来のスーパーコンピューティングソリューションは、主にオフラインのスーパーコンピューティングクラスターや自社データセンターによる接続に依存しています。現在、主に 3 つの課題が存在します。
1. 老朽化後のリソース維持が困難であること。ユーザーのリソースが老朽化し、ベンダーサポートが終了すると、リソースの再利用と維持に多大な人的・財政的リソースを投入する必要があります。
2. ビジネスのピーク・オフピーク効果。リソースが限られているため、ピーク期間のジョブキュー待ち時間は長く、オフピーク期間のリソース利用率は低くなります。
既存のクラスターは新しいビジネスや技術革新のニーズを満たせず、スケーラビリティに乏しく、調達サイクルも比較的長期です。
ゲノム解析の継続的な進化とコンピューティング技術の継続的な発展に伴い、従来のゲノムシーケンシング手法では、現在のビジネスの発展要求に対応できなくなっています。
従来の高性能コンピューティング業務プロセスは、主に以下の 3 つの段階に分けられます。業務前の処理、業務中のジョブ投入・スケジューリング・実行、業務後の可視化分析です。
右上部分では、ジョブがスケジューラに投入されます。スケジューラはオフラインマシンのスケジューリングと配布を行い、ジョブ実行の設定と現在のリソース状況に基づいて、計算ジョブに適したリソースを割り当てます。
従来の業界ソリューションには以下の特徴があります。スケーラビリティの欠如、パフォーマンスボトルネック、管理・保守の困難さ、新技術への対応課題です。中でも顕著なのはパフォーマンスボトルネックで、ピーク時のコンピューティングパワー不足とジョブキューの長期化がビジネスに深刻な影響を及ぼしています。
管理・保守面では、投資コストが比較的高く、ソフトウェアの統一管理、セキュリティ保証、運用保守統合ソリューションが不十分です。
03 クラウドスーパーコンピューティングソリューション
Alibaba Cloud の高性能コンピューティング製品である Elastic High Performance Computing (E-HPC) は、主に HPC の業務習慣とクラウドコンピューティングの利点を組み合わせたソフトウェアサービスです。大規模クラスターデプロイと推論、リソースの柔軟な利用、ワークフローのフロント・ツー・バック保証、ジョブスケジューリングと運用管理、マルチクライアントのセキュリティ隔離、パフォーマンス分析とチューニングを提供します。
インフラストラクチャとして、HPC は高性能コンピューティング業務シナリオと信頼性の要求を満たします。コンピューティング、ストレージ、ネットワーク、グラフィックス可視化は、ユーザーの極限性能要求、低レイテンシネットワーク通信、並列ファイルシステムの大規模プッシュに対応しています。
線形拡張の面では、Alibaba Cloud の高性能コンピューティング製品は、ライフサイエンス業界の 30 以上のアプリケーションと連携し、軽量で利便性の高いソリューションを提供しています。信用評価業界については、市場の多くの主流信用評価ソフトウェアと互換性を持ち、ライフサイエンス向けの統一ポータルを提供しています。
Alibaba Cloud は、PaaS レイヤーでクラスターコンピューティングパワー、弾性スケーリング、多段階キャッシュ、ビジネス管理、リソースライフサイクル管理サービスを提供しています。基盤となるのは、Alibaba Cloud プラットフォームのコンピューティングリソースと DPCA 仮想化技術であり、ユーザーは多様なコンピューティングインスタンス仕様を選択できます。
高性能コンピューティング向けパブリッククラウドソリューションは、フルクラウドアクセスを通じてクラウド上に E-HPC を構築し、リソーススケジューリング、ジョブ管理、弾性スケーリングなどの機能を提供します。
高性能コンピューティング向けハイブリッドクラウドソリューションは 2 種類あります。1 つ目は、スケジューリングノードがオンラインとオフラインに配置される構成です。リソース不足時に新しいノードをオンラインで拡張します。適用シナリオはオンプレミス構築をベースとし、クラウドで突発的なビジネスニーズに対応するもので、迅速な需要対応が可能で、いつでもリリースできます。
2 つ目は、スケジューリングノードが E-HPC クラスター内に配置され、既存のオフラインコンピューティングノードも管理する構成です。ローカルコンピュータルーム構築をベースにクラウド構築を主体とします。クラウド下の旧来のインフラを段階的に移行するのに適しています。
ライフサイエンスビッグデータコンピューティングソリューションの CPU メモリは、1:2、1:4、1:8 のインスタンスと高クロック周波数インスタンスを提供しています。上位レイヤーは E-HPC のリソーススケジューリング制御です。
大規模メモリインスタンスパフォーマンス最適化ソリューションでは、Alibaba Cloud のインフラ上に構築された E-HPC が、ユーザーにワンストップのパブリッククラウド HPC サービスを提供し、Alibaba Cloud 製品と相互運用可能な高速、柔軟、安全な技術コンピューティングクラウドプラットフォームを提供します。HPC の自動スケーリングは、MemVerge ノードを自動的に管理し、業務ピーク時に MemVerge ソフトウェア搭載 ECS インスタンスを拡張し、オフピーク時にリリースしてコストを節約します。
HPC ジョブスケジューリングは、MemVerge ソフトウェアを搭載した大規模メモリインスタンスによる計算に基づいています。遺伝子シーケンシングと EDA チップ設計シナリオで、パフォーマンス最適化を実現します。
E-HPC + MemVerge ソフトウェア + ECS i4p インスタンスはワンクリックでインストール・デプロイされ、MemVerge ソフトウェアが ECS 上に自動デプロイされます。これにより、i4p デプロイごとに MemVerge ソフトウェアを手動でデプロイする煩雑さと非効率さを解消します。
創薬 AI ソリューションでは、データ収集、クリーニングとラベリング、モデルトレーニング、モデルデプロイ、推論の 5 つの段階があります。Alibaba Cloud の ECC1G-10G 専用ネットワーク回線がクラウドへのデータ収集の課題を解決します。OSS は大容量のデータストレージ、データ配布・アーカイブをサポートします。NAS/CPFS の並列ファイルストレージは、最大 100 GB/s のスループットと 100 万 IOPS を実現し、複数の I/O モデルと大小ファイルの混合ワークロードをサポートしています。
04 主な特徴とソリューションの優位性
E-HPC の利点は、クラウド上で迅速に HPC クラスターを構築できることです。オンプレミスではネットワーク計画、ソフトウェアの初期化、アカウント処理が必要ですが、クラウド上ではわずか 30 分で HPC クラスターを構築できます。
HPC アプリケーションのパフォーマンスは、階層ごとに分析・最適化されます。Alibaba は、システムとプロセス関数命令、マイクロサービスアーキテクチャ、HPC アプリケーションに基づき、すべてのレベルで最適化分析を提供します。
E-HPC の自動スケーリングはクロスデータセンターに対応しています。クラスターのコンピューティングリソースを異なるデータセンターに配置でき、大規模並列ジョブの要件を満たします。コンピューティングリソースのタイプは、HPC スケジューラーキューに応じて柔軟に設定できます。
全データフローの可視化では、ジョブ実行前に Web ページまたは SSH でコントロールノードにログインします。ジョブ実行中は、パフォーマンス分析とプロセス分析を通じてリアルタイムでリソースの監視と管理が可能です。ジョブ完了後には、Alibaba Cloud のクラウドデスクトップを活用したデータの可視化処理と分析を行えます。
E-HPC の優位性は、豊富なコンピューティングパワーにあり、自動スケーリングがクロスデータセンターに対応し、大規模並列処理の要件を満たすことです。ヘテロジニアスコンピューティングの複数仕様をサポートし、大容量メモリ型や高クロック周波数などの CPU インスタンス仕様にも対応しています。
コスト面では、E-HPC は実際の負荷に応じてコンピューティングノードを動的に作成・削除し、弾力的に課金されます。スケーリング戦略の柔軟な設定、プリエンプティブルインスタンスのサポート、クロスゾーンスケーリングにより、顧客の利用コストを削減します。
運用保守面では、E-HPC は HPC サービスと完全互換で、マルチゾーンのクラスター自動構築に対応しています。ジョブ実行のパフォーマンス分析を提供し、クラスター、インスタンス、プロセスなどの多次元でボトルネックを特定します。新技術イノベーションにおいて、E-HPC は GPU、FPGA、Yitian などの新製品に対応する SaaS、PaaS のエコロジーエンパワーメントを提供します。
豊富なコンピューティングパワー、最適なコスト、最小限の運用保守、そして新技術のエンパワーメント。E-HPC はライフサイエンス業界に全方位的な支援を提供し、包括的なメリットと効率化を真にもたらします。
ライフサイエンスは、生命現象を研究し、生命活動の法則と生命の本質を解明する科学です。一般的に、科学研究を支援する企業の業界を科学サービス業界と呼び、ライフサイエンス研究に特化した企業の業界をライフサイエンスサービス業界と呼んでいます。ライフサイエンス技術は、分子遺伝学を中核とする先進的な科学技術であり、ライフサイエンスがまず答えるべき問いは「生命とは何か」ということです。
ライフサイエンスの主な分野は、医学、生物学、銀行業、遺伝学およびその関連分野です。市場において密接に関連する顧客層は、主に病院、研究開発機関、科学研究機関などです。
業界全体の産業チェーンは、上流、中流、下流の 3 つのレベルに分けられます。上流は主に機器製造とソフトウェア研究開発を担っており、競争の中で Murphy と Huadu は比較的有名な上流メーカーです。中流は主にサービスプロバイダーが主導し、下流は医療機関、科学研究施設、製薬会社などのサービス利用者が位置しています。
上流が業界全体の要を握っていることがわかります。中流はライフサイエンスサービスプロバイダーとして、エンドユーザーに対応するサービスを提供し、そこからサービス料を徴収しています。下流はサービスの利用者であり、中流サービスセグメントの市場規模、発展の見通し、ビジネスモデルの特徴を決定づけています。
遺伝子検出技術を例にとると、現在最も普及している遺伝子検出技術は第二世代シーケンシングです。主に血液や唾液から全遺伝子配列を解析・判定し、さまざまな疾患に罹患する可能性を予測するために使用されています。
遺伝子シーケンシング関連の製品と技術は、実験室レベルの研究から臨床応用へと進化してきました。遺伝子シーケンシング技術は、次世代の世界を変える技術と言えます。PCR 法や FISH 技術と比較して、高いスループットと大量のデータ処理という特徴を持っています。遺伝子シーケンシング技術の課題としては、操作が複雑であること、サンプルの DNA 濃度と純度に対する要求が高いこと、そしてデータが膨大で複雑であることが挙げられます。
ゲノミクスの代表的な業務である全ゲノムシーケンシングについて見てみましょう。13 年をかけて進められたヒトゲノムプロジェクト (HGP) は 2003 年に完了し、遺伝子シーケンシング分野全体に革命的な変化をもたらしました。その後、1000 ゲノムプロジェクトや 10K プロジェクトなど、政府資金による多くの大規模シーケンシングプロジェクトも相次いで開始され、遺伝的変異、人類の進化、遺伝性疾患に関する人類の研究と発見を大きく推進しました。
コンピューターサイエンスと情報の分野において、GATK に基づく全ゲノムシーケンシングプロセスは、現代の遺伝子シーケンシングで極めて重要な役割を果たしています。
一般的なゲノムシーケンシング業務では、多数のアプリケーションソフトウェアが存在し、使用方法も多様です。また、多数の直列処理ソフトウェアも使用されています。典型的な全ゲノムシーケンシングプロセスには、主に 2 つの特徴があります。
1 つ目は、実行時間が長いことです。従来のプロセスと汎用コンピューティングリソースでは、ヒトゲノムサンプル 1 つを処理するのに約 1,000 CPU コアが必要です。2 つ目は、データ量が大きいことで、単一サンプルから平均 1 TB の中間データが生成されます。
そのため、クラスターキューイングによる並列処理効率の向上、ヘテロジニアスコンピューティングソリューションによる実行パフォーマンスの高速化、コンテナベースでの異なる業務イメージのデプロイ、ホットデータとコールドデータのバックアップストレージが、コンピューター情報分野における主要な分析テーマとなっています。
02 ライフサイエンス業界の分析
従来のスーパーコンピューティングソリューションは、主にオフラインのスーパーコンピューティングクラスターや自社データセンターによる接続に依存しています。現在、主に 3 つの課題が存在します。
1. 老朽化後のリソース維持が困難であること。ユーザーのリソースが老朽化し、ベンダーサポートが終了すると、リソースの再利用と維持に多大な人的・財政的リソースを投入する必要があります。
2. ビジネスのピーク・オフピーク効果。リソースが限られているため、ピーク期間のジョブキュー待ち時間は長く、オフピーク期間のリソース利用率は低くなります。
既存のクラスターは新しいビジネスや技術革新のニーズを満たせず、スケーラビリティに乏しく、調達サイクルも比較的長期です。
ゲノム解析の継続的な進化とコンピューティング技術の継続的な発展に伴い、従来のゲノムシーケンシング手法では、現在のビジネスの発展要求に対応できなくなっています。
従来の高性能コンピューティング業務プロセスは、主に以下の 3 つの段階に分けられます。業務前の処理、業務中のジョブ投入・スケジューリング・実行、業務後の可視化分析です。
右上部分では、ジョブがスケジューラに投入されます。スケジューラはオフラインマシンのスケジューリングと配布を行い、ジョブ実行の設定と現在のリソース状況に基づいて、計算ジョブに適したリソースを割り当てます。
従来の業界ソリューションには以下の特徴があります。スケーラビリティの欠如、パフォーマンスボトルネック、管理・保守の困難さ、新技術への対応課題です。中でも顕著なのはパフォーマンスボトルネックで、ピーク時のコンピューティングパワー不足とジョブキューの長期化がビジネスに深刻な影響を及ぼしています。
管理・保守面では、投資コストが比較的高く、ソフトウェアの統一管理、セキュリティ保証、運用保守統合ソリューションが不十分です。
03 クラウドスーパーコンピューティングソリューション
Alibaba Cloud の高性能コンピューティング製品である Elastic High Performance Computing (E-HPC) は、主に HPC の業務習慣とクラウドコンピューティングの利点を組み合わせたソフトウェアサービスです。大規模クラスターデプロイと推論、リソースの柔軟な利用、ワークフローのフロント・ツー・バック保証、ジョブスケジューリングと運用管理、マルチクライアントのセキュリティ隔離、パフォーマンス分析とチューニングを提供します。
インフラストラクチャとして、HPC は高性能コンピューティング業務シナリオと信頼性の要求を満たします。コンピューティング、ストレージ、ネットワーク、グラフィックス可視化は、ユーザーの極限性能要求、低レイテンシネットワーク通信、並列ファイルシステムの大規模プッシュに対応しています。
線形拡張の面では、Alibaba Cloud の高性能コンピューティング製品は、ライフサイエンス業界の 30 以上のアプリケーションと連携し、軽量で利便性の高いソリューションを提供しています。信用評価業界については、市場の多くの主流信用評価ソフトウェアと互換性を持ち、ライフサイエンス向けの統一ポータルを提供しています。
Alibaba Cloud は、PaaS レイヤーでクラスターコンピューティングパワー、弾性スケーリング、多段階キャッシュ、ビジネス管理、リソースライフサイクル管理サービスを提供しています。基盤となるのは、Alibaba Cloud プラットフォームのコンピューティングリソースと DPCA 仮想化技術であり、ユーザーは多様なコンピューティングインスタンス仕様を選択できます。
高性能コンピューティング向けパブリッククラウドソリューションは、フルクラウドアクセスを通じてクラウド上に E-HPC を構築し、リソーススケジューリング、ジョブ管理、弾性スケーリングなどの機能を提供します。
高性能コンピューティング向けハイブリッドクラウドソリューションは 2 種類あります。1 つ目は、スケジューリングノードがオンラインとオフラインに配置される構成です。リソース不足時に新しいノードをオンラインで拡張します。適用シナリオはオンプレミス構築をベースとし、クラウドで突発的なビジネスニーズに対応するもので、迅速な需要対応が可能で、いつでもリリースできます。
2 つ目は、スケジューリングノードが E-HPC クラスター内に配置され、既存のオフラインコンピューティングノードも管理する構成です。ローカルコンピュータルーム構築をベースにクラウド構築を主体とします。クラウド下の旧来のインフラを段階的に移行するのに適しています。
ライフサイエンスビッグデータコンピューティングソリューションの CPU メモリは、1:2、1:4、1:8 のインスタンスと高クロック周波数インスタンスを提供しています。上位レイヤーは E-HPC のリソーススケジューリング制御です。
大規模メモリインスタンスパフォーマンス最適化ソリューションでは、Alibaba Cloud のインフラ上に構築された E-HPC が、ユーザーにワンストップのパブリッククラウド HPC サービスを提供し、Alibaba Cloud 製品と相互運用可能な高速、柔軟、安全な技術コンピューティングクラウドプラットフォームを提供します。HPC の自動スケーリングは、MemVerge ノードを自動的に管理し、業務ピーク時に MemVerge ソフトウェア搭載 ECS インスタンスを拡張し、オフピーク時にリリースしてコストを節約します。
HPC ジョブスケジューリングは、MemVerge ソフトウェアを搭載した大規模メモリインスタンスによる計算に基づいています。遺伝子シーケンシングと EDA チップ設計シナリオで、パフォーマンス最適化を実現します。
E-HPC + MemVerge ソフトウェア + ECS i4p インスタンスはワンクリックでインストール・デプロイされ、MemVerge ソフトウェアが ECS 上に自動デプロイされます。これにより、i4p デプロイごとに MemVerge ソフトウェアを手動でデプロイする煩雑さと非効率さを解消します。
創薬 AI ソリューションでは、データ収集、クリーニングとラベリング、モデルトレーニング、モデルデプロイ、推論の 5 つの段階があります。Alibaba Cloud の ECC1G-10G 専用ネットワーク回線がクラウドへのデータ収集の課題を解決します。OSS は大容量のデータストレージ、データ配布・アーカイブをサポートします。NAS/CPFS の並列ファイルストレージは、最大 100 GB/s のスループットと 100 万 IOPS を実現し、複数の I/O モデルと大小ファイルの混合ワークロードをサポートしています。
04 主な特徴とソリューションの優位性
E-HPC の利点は、クラウド上で迅速に HPC クラスターを構築できることです。オンプレミスではネットワーク計画、ソフトウェアの初期化、アカウント処理が必要ですが、クラウド上ではわずか 30 分で HPC クラスターを構築できます。
HPC アプリケーションのパフォーマンスは、階層ごとに分析・最適化されます。Alibaba は、システムとプロセス関数命令、マイクロサービスアーキテクチャ、HPC アプリケーションに基づき、すべてのレベルで最適化分析を提供します。
E-HPC の自動スケーリングはクロスデータセンターに対応しています。クラスターのコンピューティングリソースを異なるデータセンターに配置でき、大規模並列ジョブの要件を満たします。コンピューティングリソースのタイプは、HPC スケジューラーキューに応じて柔軟に設定できます。
全データフローの可視化では、ジョブ実行前に Web ページまたは SSH でコントロールノードにログインします。ジョブ実行中は、パフォーマンス分析とプロセス分析を通じてリアルタイムでリソースの監視と管理が可能です。ジョブ完了後には、Alibaba Cloud のクラウドデスクトップを活用したデータの可視化処理と分析を行えます。
E-HPC の優位性は、豊富なコンピューティングパワーにあり、自動スケーリングがクロスデータセンターに対応し、大規模並列処理の要件を満たすことです。ヘテロジニアスコンピューティングの複数仕様をサポートし、大容量メモリ型や高クロック周波数などの CPU インスタンス仕様にも対応しています。
コスト面では、E-HPC は実際の負荷に応じてコンピューティングノードを動的に作成・削除し、弾力的に課金されます。スケーリング戦略の柔軟な設定、プリエンプティブルインスタンスのサポート、クロスゾーンスケーリングにより、顧客の利用コストを削減します。
運用保守面では、E-HPC は HPC サービスと完全互換で、マルチゾーンのクラスター自動構築に対応しています。ジョブ実行のパフォーマンス分析を提供し、クラスター、インスタンス、プロセスなどの多次元でボトルネックを特定します。新技術イノベーションにおいて、E-HPC は GPU、FPGA、Yitian などの新製品に対応する SaaS、PaaS のエコロジーエンパワーメントを提供します。
豊富なコンピューティングパワー、最適なコスト、最小限の運用保守、そして新技術のエンパワーメント。E-HPC はライフサイエンス業界に全方位的な支援を提供し、包括的なメリットと効率化を真にもたらします。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
