Why are life science companies migrating to the cloud one after another?

ライフサイエンス業界は今、発展の黄金期を迎えています。医薬品の開発と人々の健康への追求は、ライフサイエンス産業チェーン全体の発展を牽引する新たな推進力へと急速に変化しています。HPC はライフサイエンス研究において非常に重要な役割を果たしています。同時に、ライフサイエンス業界の急速な発展に伴い、業界のクラウド化はすでに避けられない潮流となっています。

クラウドの柔軟性と利便性により、ある業界のクラウドコンピューティングに対する切実な需要は、その急速な発展と密接に関係しています。従来の IT の準備、納入、デプロイメントには長い期間を要し、急成長する業界の急増する IT 需要に対応できません。

本稿では、ライフサイエンス業界の現状と膨大なコンピューティングパワー需要から出発し、インフラレベルでのニーズと課題を示し、クラウド上のハイパフォーマンスコンピューティングがライフサイエンス企業の急速な発展に大きく寄与する理由を解説します。

ライフサイエンスのコンピューティングパワー需要:大規模、高性能、多様なタイプ

現在、ライフサイエンス業界で最も重要な 2 つのシナリオは、コンピュータ支援創薬と遺伝子シーケンシングです。

1. コンピュータ支援による医薬品研究開発

21 世紀に入り、疾患の複雑化に伴い、創薬標的の数は徐々に減少し、新薬研究開発の難易度とコストは大幅に上昇しています。同時に、グローバルな新薬研究開発の成功率も顕著に低下しています。革新的な創薬は製薬企業がコア競争力を構築し、持続的な発展を実現するための鍵であり、医薬品研究開発は高投資、高技术、高リスク、長期間を要するシステムプロジェクトです。製薬企業は AI やビッグデータなどのコンピュータ技術を活用し、医薬品研究開発を支援するようになりました。

医薬品研究開発の全流程

新薬の誕生には通常、ドラッグディスカバリー、前臨床研究、臨床試験、承認の各段階を経て、ようやく上市が承認されます。標的探索や化合物合成などのドラッグディスカバリー段階、および化合物スクリーニングなどの前臨床研究段階では、ハイパフォーマンスコンピューティングの強力なコンピューティングパワーに依存して、研究開発プロセスを加速し、創薬を支援する必要があります。

標的探索プロセスにおけるタンパク質構造予測では、分子動力学とプレーン波に基づくソリューションと、AI for Science を用いたソリューションの両方が存在します。

前者はハイパフォーマンスコンピューティング HPC の代表的なアプリケーションシナリオであり、VASP や Gromacs などの成熟したソフトウェアによるソリューションがあります。計算を通じてシミュレーション結果を得る方式で、この方式ではシミュレーション問題の規模がコンピューティングリソースの数に比例します。

同時に、業界では AlphaFold2 などのソリューションが徐々に登場しています。AI 技術を用いてタンパク質の配列と構造の関係を確立し、既知の配列と構造を継続的に学習してタンパク質構造を予測します。強力なアルゴリズムとコンピューティングパワーの支援により、DeepMind は計算時間を数か月から数時間に短縮しました。ネットワークモデルのパラメータ規模の増大に伴い、コンピューティングパワーへの需要も増大しています。

AI によるタンパク質立体構造の予測

同様に、仮想化合物のスクリーニングにおいて、製薬企業は通常数百万のリガンド分子とタンパク質構造をドッキングする必要があります。各リガンド分子には、ドッキングスコアを取得するためのコンピューティングリソースが必要であり、活性の実験検証に使用できる分子をスクリーニングします。広大なリガンド分子ライブラリを前に、分子とタンパク質構造のドッキングには膨大なコンピューティングパワーが必要です。当然ながら、単一マシンのコンピューティングパワーではこのような大規模な仮想スクリーニングタスクに対応することは困難であり、ハイパフォーマンスコンピューティング HPC クラスターを用いた大規模仮想スクリーニングが非常に重要です。

リード化合物の発見プロセス

標的探索、化合物スクリーニング、化合物合成の各プロセスにおいて、異なる計算モデル、パラメータ、ソフトウェアはそれぞれ異なるコンピューティングリソースを必要とします。特に AI の導入に伴い、多様なリソースの柔軟な割り当てに対してより高い要件が課されています。

2. 遺伝子シーケンシング

遺伝子シーケンシングの業務フローは主に、サンプル操作(シーケンサー)、シーケンシングファイルの生成、遺伝子配列アライメントと結果解析(コンピュータ)、および結果データとレポートの科学研究・医療機関への提供です。中でも遺伝子配列アライメントと解析は非常に時間を要し、バイオインフォマティクス分野の多数の専門ソフトウェアが関係します。コンピューティングリソースのパフォーマンスとスキームの最適化は、バイオインフォマティクス研究開発の効率に極めて重要な役割を果たします。

遺伝子シーケンシングの業務フロー

遺伝子シーケンシングの代表的な WGS(ヒト全ゲノムシーケンシング)プロセスでは、ライブラリインデックス構築、リードマッピング、ソート、重複除去、BQSR 補正、変異検出などの工程が含まれ、方法は多様でプロセスは複雑です。異なるステップは BWA や GATK などの異なるソフトウェアとパラメータに対応し、異なるバイオインフォマティクスソフトウェアは異なる同時処理能力とパフォーマンスを持つ場合があります。異なるフィルタリングタスクはコンピューティングリソースの多様性と規模に異なる影響を与えます。弾力性のあるコンピューティングリソースだけでなく、多様なインスタンス設定も必要です。

第二世代遺伝子シーケンシング WGS プロセス

ライフサイエンスがインフラレベルで直面する課題とチャレンジ

従来、ほとんどのライフサイエンス企業はオフラインで自社 IDC を構築する方式を採用しています。一般的に、ライフサイエンス企業の IT インフラは主に 3 つの大きな課題に直面しています。リソース規模の固定化、長い構築サイクル、ハードウェアリソースの高額な運用保守コストです。以下に示します。

1. リソースの固定化による業務成長とリソース多様性のニーズへの対応困難

1.1 コンピューティングパワーの規模が固定され、業務成長速度に影響

従来の IDC 構築当初、リソース規模は通常明確に計画されるため、クラスター全体のタスクスループットは固定されます。周期的な新薬研究開発やシーケンシング業務において、異なる研究開発サイクルとタスクはリソースに対する要件が異なります。そのため、ピーク時にはリソース待ちによるタスクのキューイングが発生し、オフピーク時にはリソースがアイドル状態になることが一般的で、業務に対応するために柔軟なコンピューティングリソースが必要です。

1.2 リソース割り当てが固定され、リソース多様性のニーズに対応困難

ローカル IDC のコンピューティングリソースは事前に計画され、リソース設定は限定的です。そのため、従来のシーケンシング手法では同じリソースを使用して異なるシーケンシングステップを実行せざるを得ず、割り当てを柔軟に変更できず、大量のコンピューティングリソースの浪費を招いています。前述の通り、必要なコンピューティングリソースは柔軟であるべきです。

1.3 ストレージ容量が固定され、増大するストレージ需要に対応困難

増大するストレージ規模に対し、オフラインストレージ機器の運用保守と調達コストの大きなプレッシャーに直面しながら、効率的で安全、安定的、コスト効率に優れた持続可能なストレージソリューションをいかに獲得するかも、ライフサイエンス企業にとって大きなチャレンジです。

タンパク質構造の研究を例に取ると、タンパク質構造を決定する方法は一般に X 線結晶構造解析、核磁気共鳴、冷凍電子顕微鏡の 3 つがあります。冷凍電子顕微鏡を例に取ると、単一样品の電子顕微鏡データは通常 10 TB で、企業のローカルデータ量は PB レベルに達します。同時に、バイオインフォマティクス研究データには大量の参照ライブラリデータ、サンプルデータ、中間データファイルが含まれます。中でも、単一のヒト全ゲノムシーケンシングの全プロセスデータは最大 1 TB に達します。バイオインフォマティクスデータの周期性と特殊性により、通常のバイオインフォマティクス企業のローカルデータストレージ容量は PB レベルに達します。

2. 長い構築サイクルが業務成長に影響

2.1 納入サイクルが長く、ユーザーの時間的ニーズに対応困難

従来の IDC 構築は一般に、プロジェクト承認、入札、調達、納入のプロセスを経る必要があり、数か月、場合によっては 1 年近くかかることもあります。プロジェクト承認の段階では、後続業務の規模を評価し、リソース構築計画を明確にする必要があります。急速に発展する業務にとって、このような長い構築期間は業務成長のボトルネックとなります。

2.2 ハードウェアリソース選定のイテレーションが遅く、ユーザーの不断にアップグレードされるリソース要件に対応困難

従来の IDC 構築では、企業が最新アーキテクチャのハードウェアリソースを迅速に入手することは困難です。これらのリソースは業務に大幅な高速化をもたらすことができます。

WGS シーケンシングでは、GPU または FPGA ベースの異種アクセラレーションスキームの研究開発において、大量の選定と検証プロセスも存在します。オフライン IDC の構築では、CPU/GPU/FPGA などの製品リリース時期を考慮し、適切なハードウェア仕様を選択するだけでなく、ビジネスアーキテクチャの進化も評価する必要があり、ライフサイエンス企業にとってリソース構築における大きなチャレンジとなります。

3. 高額な運用保守コスト

オフライン IDC の運用保守には大量の人的リソースも必要です。クラスターコンピューティングリソースの管理、コンピューティングタスクのスケジューリング、ユーザー権限管理に加え、コンピューティングリソース自体の安定性、特にハードウェア障害は業務の進捗に深刻な影響を与えます。計算プロセス中にダウンタイムによりタスクが終了した場合、チェックポイントがなければ再計算するしかありません。さらに、オフラインストレージはデータ損失を防ぐためのディザスタリカバリも考慮する必要があります。したがって、コンピューティングリソースの管理、リソースの安定性、データディザスタリカバリなどの作業には専門の運用保守チームが担当する必要があり、コストが増加します。

現在、従来の IDC が提供するインフラにはリソースの制約、長い納入サイクル、リソースの非柔軟性、ハードウェアリソースのイテレーションとアップグレードの遅さ、高額な運用保守コストなどの問題があるため、ますます多くのライフサイエンス企業が、より柔軟で安定的、コスト効率に優れたクラウドハイパフォーマンスコンピューティングソリューションへ移行し、業務の革新的な発展を加速しています。

Alibaba Cloud が提供する EHPC ライフサイエンスシリーズソリューション

Alibaba Cloud は、クラウドハイパフォーマンスコンピューティングが現在の HPC 構築と利用の最適な方法だと考えています。ライフサイエンス業界の関連ニーズに応じて、Alibaba Cloud は世界中のコンピューティングパワーと業界をリードする DPCA アーキテクチャに基づき、ハイパフォーマンスコンピューティングパブリッククラウドソリューション、ハイブリッドクラウドソリューション、大容量メモリインスタンスパフォーマンス最適化ソリューション、コンテナ化ソリューション、製薬向け AI ソリューションなどを提供しています。これらは業界のさまざまなシナリオのニーズをカバーでき、以下の利点を備えています。

(1) 豊富なコンピューティングパワーをオンデマンドで購入:Alibaba Cloud は世界 4 大陸に 27 のパブリッククラウドリージョンと 84 のゾーンを運用しています。クラウド上のオートスケーリング機能はクロスデータセンタースケジューリングをサポートし、大規模並列ジョブの要件を満たすコンピューティングリソースのタイプは、スケジューラーキューに基づき柔軟に設定できます。ヘテロジニアスコンピューティングパワーの複数仕様、大容量メモリタイプ、高クロック周波数などの仕様の CPU インスタンスもサポートしています。

(2) エラスティックスケーリングによるコスト削減と効率向上:Alibaba Cloud Elastic High Performance Computing (E-HPC) プラットフォームは、コンピューティングノードの動的な作成/削除をサポートし、スケーリングポリシーを柔軟に設定でき、実際の負荷に応じた柔軟な課金に対応しています。プリエンプティブルインスタンスの価格は通常料金の 10% まで低く、お客様の利用コストを削減し、運用品質と速度を向上させます。

(3) 最小限の運用保守で企業がコア業務開発に集中可能:HPC ビジネスと完全互換で、クラスターを自動的に構築し、ジョブの運用パフォーマンス分析を提供します。クラスター、インスタンス、プロセスなどのディメンションでホットスポットを特定し、ジョブレポートの可視化出力をサポートします。ユーザー、タスク、キューなどのディメンションで消費の内訳を提供します。

(4) 新技術によるエンパワーメントと迅速な恩恵:IaaS レベルでは、Alibaba Cloud は最新のコンピューティングパワーを継続的にイテレーションしています。SaaS および PaaS レベルでは、数百のサードパーティパートナーが Alibaba Cloud と統合しており、ライフサイエンス企業は関連する技術サービスに迅速にアクセスできます。Alibaba Cloud の豊富なエコシステムとクラウド上で継続的にイテレーションされる技術力により、企業は技術サービスの全流程と最新の技術の恩恵を享受できます。

Alibaba Cloud のハイパフォーマンスコンピューティングは、産業シミュレーション(CAD/CAE)、チップ設計(EDA)、バイオメディカル材料、エネルギー探査、公共サービスなど、多くの業界で広く活用されています。

Shenshi Technology は柔軟な供給とコスト最適化戦略を採用し、プリエンプティブルインスタンスの価格を組み合わせて 30% のコストで大規模リソースの提供を完了しました。同時に、クラウド上の弾力的な E-HPC 自動運用保守機能により、Shenshi Technology の運用保守コストを削減し、クラスター管理効率を向上させました。

ライフサイエンス企業の Shengting Medical は、クラウド移行により従来の IDC クラスターのデータ信頼性、運用保守コスト、効率を最適化し、遺伝子アライメントと解析の効率が 70% 向上しました。Alibaba Cloud のハイパフォーマンスコンピューティングチームは、Slurm のワークフロー依存関係と自動スケーリングを組み合わせることで、無効なコンピューティングリソースの浪費を削減し、運用コストを効果的に低減しています。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.