Construction and Practice of Multivariate Scientific Computing System in Drug R&D Pipeline

01 科学計算が医薬品研究開発のトレンドを牽引

以下の図は 2022 年初頭に Nature Reviews から抜粋したものです。科学計算または人工知能(AI)に駆動された医薬品研究開発プロジェクトの数は、2010 年の 6 件から 2021 年の 158 件へと、11 年間で 28 倍以上に増加したことがわかります。一方で、従来の医薬品研究開発プロジェクトの数は 705 件から 333 件に減少しており、依然として主流の開発手法ではあるものの、下降傾向を示しています。

従来の医薬品研究開発パイプラインでは大量の湿式実験が必要であり、その多くは研究者個人の経験と実験結果に基づく最適化に依存しています。そのため、最適化の道のりは長く、開発コストは高く、サイクルも長期化します。比較すると、計算駆動型の医薬品研究開発パイプラインは乾式・湿式実験を組み合わせたアプローチで、湿式実験の工程を削減します。さらに、多くのデータ駆動型手法は過去またはグローバルな実験データから学習しており、化合物の最適化においてグローバル最適化を目指す傾向があります。その結果、最適化プロセスはより迅速で、コストは低く、反復速度も速くなります。

上記の図は、科学計算/AI に駆動された世界中の 24 社の生物製薬企業の医薬品研究を示しており、そのうち 15 社が既に臨床試験段階に入っています。近い将来、さらに多くの計算駆動型医薬品が上市され、より多くの患者の利益につながるものと期待されています。

02 各段階における医薬品研究開発パイプラインの特徴と課題

革新的な低分子医薬品研究開発機関として、グローバルヘルス医薬品研究開発センターでも、研究開発初期段階のさまざまな課題を解決するために多様な計算手法を活用しています。

医薬品研究開発初期段階の一般的なプロセスは以下の通りです。

段階 1:疾患生物学、すなわち疾患の確立です。疾患は大別すると外因性疾患と内因性疾患に分けられます。外因性疾患とは、外来生物または非生物が人体に侵入することで引き起こされる組織疾患を指し、有害微生物、細菌、ウイルス、マラリア原虫、粉塵などの非生物などが含まれます。内因性疾患とは、ヒトの遺伝子変異または機能障害によって引き起こされる組織疾患を指し、各種腫瘍、心脳血管疾患、慢性疾患、希少疾患などが含まれます。

グローバルヘルス医薬品研究開発センターはグローバルヘルスの公的分野に注力しています。結核、コロナウイルス、マラリア、寄生虫感染症などの外因性感染症だけでなく、EED(環境性腸機能障害)などの腸疾患をはじめとする内因性疾患にも注目しています。

段階 2:標的の確立と検証、すなわち疾患と強く関連するタンパク質またはバイオマーカーの特定です。この段階では多様な異種データが存在し、研究者は疾患のメカニズム、生物学的ネットワークパスウェイにおける疾患の挙動、さらには遺伝子の変異や発現などのマルチオミクス情報を解析する必要があります。

段階 3:タンパク質と相互作用できる分子、すなわちシード化合物の確立、スクリーニング、または設計です。目標は、一方面では分子合成ライブラリから活性を示す可能性のある低分子をスクリーニングし、他方面では新規活性分子を設計することです。この段階では、Chemdiv、Zinc など、10 億件規模に達する大量の物理的または仮想的な化合物データベースのデータを入手できます。しかし、標的タンパク質に活性を示す化合物分子は比較的少なく、特に希少疾患や人類があまり注目してこなかった疾患ではその傾向が顕著です。

段階 4:シード・リード化合物の最適化

段階 5:前臨床候補薬。この 2 つの段階では、化合物と標的タンパク質の相互作用だけでなく、薬物動態、合成プロセス、分布、代謝、毒性などの薬物利用性も総合的に考慮し、さまざまな物性をバランスさせた上で、真に有効かつ安全な医薬品を最適化・設計する必要があります。これは包括的な最適化プロセスであり、大量の ADMET データ収集とモデル学習が不可欠です。同時に、研究開発パイプラインプロジェクトからの少量の実験データも存在します。

03 多元的科学計算システムの構築

疾患の選択から標的確立段階にかけて、データは多様かつ異種混合です。

内因性疾患の場合、通常はマルチオミクス解析を実施します。健常者と患者のメタボロミクス、ゲノミクス、またはプロテオミクス情報を解析することで、疾患と強く関連するハブ遺伝子/タンパク質または重要な遺伝子/タンパク質を標的候補として同定できます。タンパク質配列が得られた後、構造予測モデルを用いて 3D 構造を予測します。構造予測モデルの中でも Alphafold は近年の革新的な深層学習手法であり、従来の機械学習や物理モデリング手法でも候補となる標的構造を得ることができます。

外因性疾患の場合、標的を見つける手法には以下があります。

1. ヒトの免疫メカニズム(融合メカニズムなど)を解析し、ヒトのマルチオミクス情報を研究してヒトの重要標的を特定できます。

2. コロニーのマルチオミクス状況を解析し、重要パスウェイ中のタンパク質を標的候補として決定することもできます。

3. ウイルスなど比較的単純な病原体については、ヒトへの侵入、融合、または転写の過程でそのタンパク質配列を直接取得し、すべての関連タンパク質構造を予測して、生物学者や化学者に提供し、標的を決定できます。

構造生物学では、決定されたタンパク質の実構造を解析し、予測された 3D 構造を検証・較正して、後続段階の解析と予測に活用します。

標的タンパク質を決定した後、次のステップは標的上で分子と結合する可能性のあるポケットを特定することです。結合ポケットとは、分子化合物が相互作用できる結合部位を指します。化合物が標的と相互作用できるか、すなわち潜在的な活性を持つかどうかを判定する主な計算手法は 2 つあります。

1. 分子力学や量子力学などの物理シミュレーション手法を使用する。

2. 機械学習または深層学習手法を使用する。これら 2 つの手法は、既知/仮想生成化合物ライブラリから標的と相互作用する可能性の高い化合物を仮想スクリーニングし、候補化合物として選定するために使用されます。

化合物ライブラリの仮想スクリーニング手法に加え、近年ではポケットの物理化学的物性からエンドツーエンドでシード化合物を直接設計する研究が増えています。これにより、物理シミュレーションや機械学習による仮想スクリーニングの部分をスキップし、AI を用いて潜在的に活性のあるシード化合物を直接生成できます。これは将来の重要な研究方向性の 1 つになると考えています。

候補シード化合物を得た後、生物学的・化学的専門家が湿式実験による検証を実施するか、構造生物学が化合物・標的共結晶構造の解析検証を行い、予測結果と一致するか確認し、次の化合物最適化段階に活用します。

物理シミュレーションと機械学習手法を比較すると、物理シミュレーションは現在多くの製薬企業が一般的に使用している手法です。その利点は、MD ドッキング姿勢推定がより正確であり、FEP+ 親和性予測もより正確であることです。低分子とポケットの結合は 3D モデリングにより直感的に可視化でき、解釈性も高いです。一方で、必要とされる計算能力は非常に高く、柔軟なスーパーコンピューティング能力が求められます。また、物理的仮定に基づいているため適用範囲は狭く、多標的予測やタンパク質アロステリック現象など複雑なメカニズムや、細胞、オルガノイド、ヒト組織レベルなど高次レベルでの化合物物性予測には対応できません。

機械学習手法は主に既知のデータ学習を通じて与えられた数理モデルのパラメータを最適化するため、データ学習で生成されるモデルサイズは固定であり、そのモデルを用いて超大規模化合物ライブラリを迅速にスクリーニングできます。次に、経験的または実験的データに基づいており、物理的仮定に依存しないため、複雑なメカニズムや高次レベルの物性をモデリング・予測できます。一方で、データの品質とデータ空間の分布に大きく依存します。データ量が大きく品質が高ければ、機械学習または深層学習の性能は良好ですが、そうでなければ性能は低下する可能性があります。また、汎化能力も参照可能なデータ空間に大きく制約され、機械学習はブラックボックス手法であるため、研究者がその根拠を確認することは困難です。

100 万個の低分子化合物の仮想スクリーニングを例にすると、物理シミュレーション手法のドッキングでは約 148,600 秒を要するのに対し、深層学習手法では V100 GPU 上でわずか 107 秒で完了し、1,000 倍以上の速度差があります。また、より高精度な分子動力学手法により、化合物と標的タンパク質部位の結合をマシン上でシミュレーションする場合、60,000〜90,000 原子系での 200 ナノ秒のシミュレーションに V100 GPU 上で約 86,400 秒を要します。このことから、物理シミュレーションベースの手法は高い計算能力を必要とすることがわかります。

初期シード化合物の発見・確立プロセスにおいて、研究者が標的に対して取得できる実験データは通常ごくわずかです。これらのデータだけでディープラーニングアルゴリズムのモデルを直接構築すると、機械が参照できる化学空間は非常に限定的となり、学習済みモデルの汎化能力と予測ロバストネスは低くなります。そこで、アクティブラーニング手法を採用し、専門家の知見や一部の物理ベース関数を用いて AI モデルを較正し、学習セットを継続的に拡張します。複数回の反復を経て、モデルを実用段階に投入できます。

さらに、多くの AI モデル自体がブラックボックスモデルであるため、生物学者や化学者がその結果を完全には信頼できない場合があります。そこで、自己注意機構に基づくディープラーニングアルゴリズム「Ligandformer」を開発しました。このモデルは、化合物の物性や活性の予測スコアだけでなく、分子フラグメントの活性/物性への寄与の説明も提供し、研究者の参考情報として活用できます。

シード化合物からリード化合物へ、さらに前臨床候補薬へと至る過程では、シード化合物の一連の最適化と変換が必要です。最適化プロセスにおける計算レベルの一般的なフローは、ビッグデータを用いて異なる物性の事前学習モデルを構築して事前学習済みモデルを取得し、実際の研究開発パイプラインの実験データで事前学習済みモデルをファインチューニングし、ファインチューニング済みモデルを用いてさまざまな修飾リード化合物の構造を大量にスクリーニングします。最後に、さまざまな物性をバランスさせた上で候補薬リストを取得し、生物学者や化学者に参考・選択用として提供し、次の湿式実験による検証に進みます。

上記の図からわかるように、計算プロセスは医薬品研究開発の初期段階全体を貫いています。

04 多元的科学計算システムの E-HPC プラットフォームでの実践

2020 年の COVID-19 流行当初、Alibaba Cloud チームは私たちと協力して COVID-19 と闘うための公共情報プラットフォームを構築し、グローバルな情報源からウイルス研究に関する情報を収集しました。同時に、予測サービスプラットフォームも構築しました。これはスーパーコンピューティングプラットフォーム上に構築された外部サービスであり、研究者が無料で利用できます。現在、このサービスはアップグレード・最適化され、20 以上の内外部共同プロジェクトで広く活用されています。

さらに、世界中の商用・非商用データベースから大量のデータを収集・整理し、研究者がより良い研究を行えるよう支援する可視化構造・物性データ分析ツールを構築しました。

以前の新興化合物探索プロジェクトでは、PubChem の 400,000 化合物ライブラリの化学空間をより良く特性評価・スクリーニングする必要がありました。アクティブラーニング戦略を採用してディープラーニングモデルを学習し、化合物ライブラリをスクリーニングしました。5 回のアクティブラーニング反復を経て、誤差率は 7.98% から 1 万分の 1 未満に低下しました。同時に、専門家の知見に基づき学習データサンプルを継続的に拡張し、追加した学習データサンプルはわずか 1,500 サンプル強です。合計 2,800 サンプル強の学習データは決して大きくはありませんが、機械学習モデルに比較的強力な識別能力を持たせ、400,000 化合物ライブラリの化学空間を識別できるようになりました。

同時に、プロジェクト内の 37 の実験データについて遡及検証を実施しました。初期モデルから第 5 世代モデルにかけて、精度は 75% から 86% に向上しました。

北京協和医学院と共同で希少疾患の研究を行い、内部で独自開発したバイオインフォマティクスネットワーク相互作用アルゴリズムを用いてタンパク質間相互作用ネットワークを較正し直しました。較正したネットワークとバイオインフォマティクスの統計的手法を通じて、ATTR 希少疾患の新薬候補を発見すると同時に、リンパ性白血病の治療薬のドラッグリポジショニングも実現しました。この研究は医学誌に掲載されています。

全体的に見ると、分子力学ベースの手法は主に既知の標的を持つタスクや標的の決定が必要なタスク、すなわち初期の標的确立、シード化合物の確立、シード・リード化合物の最適化段階に適用されます。機械学習/深層学習ベースの手法は、シードリード化合物の確立、シードリード化合物の最適化段階、前臨床候補薬の最適化段階に適用できます。さらに、未知の標的に対応する場面にも適用可能であり、たとえば表現型データのみをデータ駆動でモデリングする場合、医薬品研究開発後期における細胞、組織、オルガノイド、またはヒトレベルの物性予測、薬物利用性解析などが挙げられます。

05 課題と展望

今後、以下の側面について深入研究を進めていきます。

第一に、複雑な治療メカニズムと標的の研究です。たとえば、細菌の薬剤耐性の研究やタンパク質変異の予測などです。

第二に、標的活性部位の変異予測です。たとえば、コロナウイルスは引き続き変異を続けており、変異部位における薬物の有効性を計算と解析で判断できます。

第三に、創薬の分子設計です。ますます多くの研究者がタンパク質標的ポケットに基づく活性分子の生成・設計に注目しており、表現型データに基づくエンドツーエンドの分子化合物の生成・設計も可能です。

では、これらの課題をどのように解決・突破するのでしょうか。まず、データが不可欠です。分子化合物の物理化学的物性データに加え、バイオインフォマティクスネットワークやパスウェイ内のネットワーク情報データなどの横断的なデータを、電子雲密度データなどより低レベルのデータと統合する必要があります。

しかし、巨大で多様かつ異種混合のデータには、異なるレベルとスケールのデータを融合し、データからパターン特徴を抽出して最終タスクを予測できる強力なアルゴリズムが必要です。これらすべてはスーパーコンピューティングプラットフォームなしには実現できず、プラットフォームへの要求は次第に高まっています。より大きなデータ収容・処理能力を持ち、より高速な処理と進化を実現する必要があります。

データ、アルゴリズム、スーパーコンピューティングプラットフォームの連携と、異分野・異業種の専門家の協力により、医薬品研究業界はさらなる大きなブレークスルーを遂げると確信しています。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.