Pain points and direction of AI pharmaceutical industry landing

NIH の 4D マップは、グローバルな医薬品業界におけるゴールドスタンダードだ。低分子を例に取ると、標的認識からリード化合物の発見・最適化、初期探索から開発、そして最終的な臨床試験に至るまで、各ステップには非常に成熟した方法論、実験プラットフォーム、理論的指針、規制基準が備わっている。

しかし、このシステム全体のデジタル化の度合いは非常に低く、医薬品業界は全産業の中でも比較的デジタル化が遅れている分野でもある。

トランスレーショナルメディスンやバイオマーカー関連データ、臨床データ、規制データ、医療保険データ、さらに臨床サンプリングや in vitro サンプリングのシグナルデータは、異なる機関や研究者がそれぞれ取り扱う必要がある。この現状を踏まえると、医薬品業界がシステム内の効率を向上させる方法は 2 つしかない。1 つはシステム全体を再定義すること、もう 1 つは過去のデータからノイズを取り除いてシグナルを見つけ出し、時代遅れの方法論を最先端の方法論に置き換えることだ。

前述の図に創薬スクリーニングのプロセスを示す。最初のステップから最後のステップまでに必要な実験の数が、最終的なシステムの効率を決定する。従来のプロセスでは 20,000 個の分子スクリーニングから 1 個の分子を絞り込むのに対し、ブラインドスクリーニングでは 200 万個の分子を出発点とする必要がある。もし 100 個の分子を出発点とできれば、業界全体の投資と時間消費を 80% 以上節約できる。

前述のスクリーニングプロセスは長年にわたって使用されてきたが、過去 10 年間で投入産出比は年々低下している。そこで、既存のスクリーニングプロセスをどのように突破するか、 AI を活用して効率を向上できないかを検討する必要がある。

厳密に言えば、 AI はツールではない。ツールは人間が使用する必要があるが、 AI は自らを最適化し、人間の助けなしに目標を達成できる。 AI の学問的定義では、人間のように思考し行動する能力を持つことが求められ、最終的にチューリングテストなどの方法で確認される必要がある。

しかし、 AI を医薬品業界に応用する際の最大の課題は、 AI にどのような目標を設定するかだ。たとえば医薬品の課題において、目標は選択性の最適化、 in vivo での全体的な有効性、最終的な適用患者群とすることができる。 AI に十分なデータを与えれば、 AI は自らの方法で目標を実際に達成できる。

したがって、人間は 2 つのことを行う必要がある。まず目標を明確にし、次に AI にどのようなデータとルールを与えるかを明確にすることだ。最後に、 AI が目標の達成を担当する。

人工知能自体が学際的な分野であり、薬学もまた生化学、細胞生物学、生理学などの多次元情報を扱う学問だ。これらの巨大な学問体系をどのように効率的に統合するかが、私たちが現在直面している最大の課題である。

前述の図に示すデータは、医薬品業界のすべての計算に必要なインプットを基本的にカバーしている。 QM (量子力学)、 DFT (密度汎関数理論)、分子力学、分子動力学は純粋な物理学的アプローチである。 DFT と分子力学には実験パラメータによる較正も含まれるが、 QM は入力分子の原子組成のみに依存する。それぞれ異なる正確さで計算を行うが、正確さと精度は全く異なる 2 つの統計パラメータだ。必ずしも最高精度が必要なわけではなく、次のステップをより完全に判断できる十分な正確さが必要なのだ。

しかし、これまでの方法論には多かれ少なかれ制約がある。たとえば、 QM は電子精度で計算を行うが、材料科学や小規模な溶液化学系でのみ計算可能だ。生体分子に拡張するには、さらなる近似を加えて精度の一部を犠牲にする必要があるため、 DFT 法が生まれた。分子動力学法は古典力学と経験的パラメータを借用して量子力学の出力をシミュレーションする手法で、計算規模を単一タンパク質レベルまで拡張できるが、精度は電子レベルから原子レベルに低下する。

しかし、その後タンパク質間相互作用の計算が必要となり、細胞内の 4,200 万個のタンパク質のような高次システムになると、 MD で計算しようとしても世界中のコンピュータを合わせても足りなくなる。人体の生理学的結果を計算するには、原子から出発した場合、4,200 万 × 30 兆回の計算が必要となり、分子レベルから人体を真にマッピングできる。コンピューティングパワーの制約により、分子動力学以降、原子ベースの 3D 構造解析自体の正確さにかかわらず、原子に基づく生体シミュレーションは行き詰まっている。情報科学の参画により、ようやく希望の兆しが見えてきた。

情報科学はシグナルの読み取りに基づいており、2 つの層に分けられる。1 つ目はタンパク質、 DNA 、低分子などの分子的性質のシグナルで、これらはすべてシーケンスであり、ノイズを含まない確定した情報である。もう 1 つはマクロレベルの層で、分子をシステムに組み込むと、電気信号や蛍光シグナルを観測でき、生物学的イベントに関するさまざまな間接的な知見を得られる。

情報科学の手法により、ケモインフォマティクスとバイオインフォマティクスは過去 40 年間で大きな進展を遂げた。以前は単純な統計的手法で微視的レベルから巨視的レベルへのマッピングしかできなかったが、現在ではマルチオミクスによってあらゆる種の DNA を解析し、複数レベルのデータを取得できるようになった。 QM の計算量は約 O(N)⁴ から O(N)⁷ で、N は最大でも電子数百個程度が限界である。分子力学では計算量が O(N)²³ にまで削減され、最大システムは約 100 万原子で、単一のウイルスにほぼ相当する規模だ。しかし、統計や機械学習の予測シナリオでは計算量はほぼ線形に近づき、計算効率が 10⁶ から 10⁷ 倍も向上する。現在ディープラーニングが注目されている根本的な理由は、物理モデルではより大きな生体システムを計算できないため、過去のデータ学習を通じて、そのデータ層を生成するために投じられた計算能力と実験リソースを代替する必要があるからだ。

DNA は静的なものである。 DNA の配列は通常大きく変わらない。しかし生物学は動的で、 RNA 、タンパク質、代謝物の測定値は人々の年齢、食事、身体状態に応じて動的に変化する。さらに、現在の生命プロセスシミュレーションは単一原子の視点からはマイクロ秒レベルまでしか到達できず、酵素反応でもマイクロ秒からミリ秒レベルが限界であるため、実際のプロセスシミュレーションは実現できていない。情報科学の力を借りることで、エンドツーエンドのブラックボックスシミュレーション、すなわち端到端のシミュレーションを実現できる。

物理学者は物理公式と計算複雑性を簡素化し続けており、最小の薬物分子からシステム全体まで、異なる理論的基盤に基づいて物理レベルからのシミュレーションが可能になっている。しかし、それは実験条件の再計算と専用ツール、物理パラダイムの開発をその都度必要とすることを意味し、かなり非効率的な方法だ。私たちは精度調整可能な汎用モデルを求めており、同じモデルであらゆる問題を解決できることを期待している。

ディープラーニングは私たちの最初の試みだ。各次元に十分なデータがあれば、基礎となる物理原理を考慮せずに、ブラックボックスで各次元の問題を予測できる。ディープラーニングは過去の検証でも非常に有効であることが証明されているが、データへの依存度が高すぎるため、まだ完璧とは言えない。

私たちが期待する完璧な方法は、データに依存せずに生物学を根本的に観測できる、汎用的で動的なマルチスケールの数式を見つけることだ。

前述の図に具体的なデータ計算式を示す。従来の方法では、 QM で低分子 1 つを計算するのに GPU 1 台で数時間から数日かかり (具体的なタスクによる)、 FEP は約 1 日、ドッキングは数分だ。機械学習シナリオでは、数千から数百万の分子を CPU 上で計算するのにわずか 1 分しかかからない。

前述の図は Alibaba Cloud でテストしたコンピューティングパワーの一部を示している。 QM で数個のアミノ酸の相互作用を計算するのに約 30 分、 MD で大型膜タンパク質の挙動を 1 ナノ秒あたり予測するのに数時間かかり、マイクロ秒やミリ秒スケールに必要な時間はさらに 10³ 倍または 10⁶ 倍する必要がある。ディープラーニングモデルは既にトレーニング済みで予測時間もより短く、100 万レベルのスクリーニングを 1 時間以内に達成できる。

機械学習は医薬品分野で広く応用されており、タンパク質構造予測、機能予測、遺伝子編集、システム生物学、さらにより生理学的なプロテオミクスに至るまで活用されている。究極のボトルネックは生物ビッグデータの理解とクリーニングにある。

医療分野における AI の発展は、前述の図に示すように主に 4 つの段階に分けられる。現在、完全にデータ駆動型の方法が確立されており、これまで私たちはプロセス全体のデータを統合し、最も効率的な方法を得ることを目指してきた。

では、学問レベルでさらなるブレークスルーが期待される分野はどこだろうか。

私たちが AI を使うのは、単に処理速度を上げたいからではなく、より優れた成果を上げ、人間が突破できない課題を達成したいからだ。 AI が人間を超える点は 2 つある。

まず、休息を必要とせず、数千の AI エージェントが同時に同じ作業を処理できるという、能力のブレークスルーだ。

次に、 AI の世界認識は多次元的であり、人間が 3 次元と時間次元からしか世界を理解できないのに対し、 AI は数千次元や人間には理解できない 1 次元や 0 次元で世界を認識し、より優れた答えを導き出せる。

医薬品分野には興味深い現象がある。2 次元認識と 1 次元認識では全く逆の結果になることがあるのだ。前述の図に示すように、生理指標に影響する重要な因子である PK は、異なる状況下で巨大な対比を示す。人間の視点では非常に似て見えるものでも、 AI は 2 次元以外の次元からより大きな差異を認識できる。

さらに、専門家は一度に 1 つの次元で 1 つの問題しか最適化できないため、1 つのプロジェクトで無限の反復が生じる。 AI の最も代表的な多目的最適化手法を採用すれば、一度に複数次元から複数の最適化を実現できる。過去の実践では、 AI を使って 30 次元で同時にスコアリングと実験を行った場合のヒット率は、人間が考えて実験する場合をはるかに上回ることが検証されており、この分野でも AI は専門家以上の成果を出せると確信している。

新規プロジェクトは通常、表現型スクリーニングから始まり、表現型から潜在的な仮説を直接予測するが、これにはブラックボックスの問題が伴う。これはまさに AI の得意分野だ。過去の画期的な新薬の多くは表現型スクリーニングに属し、フォロワー薬の多くは標的ベーススクリーニングに属している。

AI を使った表現型スクリーニングでは多くの試みが行われてきた。たとえば過去に GHDDI で 3,000 の細胞ベース評価に対して 1 つずつ AI モデルを構築し、遡及的検証と前向き検証の 2 つの大規模検証を実施した。その結果、過去 30 年間のデータのわずか 5% で、実際の細胞ベースの結果にほぼ近づけることが判明した。これはまだ限定的だが、少なくとも数値が伸び続けているという点では良い成果だ。

合成は常に低分子医薬品のボトルネックだった。 Science 誌の関連論文では、 AI がチューリングテストに合格することは、天然物の全合成経路が予測可能であることを意味すると示されている。しかし、合成のボトルネックは合成ルート予測ではなく、反応条件の予測にある。

AlphaFold は大きな注目を集め、画期的な成果とされているが、まず 3 つの問いを確認する必要がある。

まず、医薬品業界は構造情報を本当に必要としているのかという点だ。通常の生物学的発見では、細胞上で直接スクリーニングしたり、タンパク質を基盤としたスクリーニングで直接精製したりできる。既知なのは配列と結合親和性のみで、プロセスシミュレーションは必須ではない。ただし、プロセスシミュレーションの利点はいくつかの重要な部位を修飾できることにある。

次に、従来の相同性モデリングと比較して、既知のテンプレートが存在する場合、 AlphaFold の予測結果の方が優れているという点だ。 AlphaFold のディープアルゴリズムにはマルチシーケンスアライメントが組み込まれており、他のすべての種のタンパク質ファミリーの情報を使って高等生物の情報を予測するが、これは多くのコアドメインで問題を引き起こす。従来の相同性モデリングでは、より類似した種や同じ種の相同プロテオームグループから既知モデル上で直接予測できるため、実際の医薬品開発プロセスでは従来の相同性モデリングの方が信頼性が高い。テンプレートのないタンパク質については、別の方法を採用する必要がある。

最後に、私たちのアプローチは一次構造から生物活性を直接予測し、構造生物学のプロセスを完全にスキップすることで、そのプロセスにおける誤差を回避している。

2013 年、私は 2 か月をかけて 1,024 個の CPU を稼働し、膜タンパク質、リン脂質二重層、低分子を含む約 1 マイクロ秒のシミュレーションを行った。当時、これは世界最大の計算可能な膜タンパク質システムで、数百万の原子を含んでいた。今日のスーパコンピュータで同じハードウェア構成であれば、この時間は 2〜3 日に短縮できるが、これはわずか 30 倍の高速化に過ぎず、動的プロセスを真に体系的に計算することは依然として非常に困難であることを意味している。

そこで、データ駆動型 AI モデルを十分に活用する必要がある。以下のリンクから、この随時更新されるレビューの関連内容を参照できる。ここではデータの制約問題に対する解決策やモデリング方法が提供されている。

生物ビッグデータには多くのノイズが含まれている。ノイズからシグナルを抽出し、クリーンなデータセットを統合することが特に重要だ。業界では方法論、エンジニアリング、アルゴリズムの各レベルで多くの解決策が提供されている。たとえばマルチモーダル法では、1 つのスケールでデータ量が少ない場合、他のスケールからデータを移行できる。マルチタスク法では、ある標的のデータが少ない場合、そのファミリーや類似のポケットを持つデータを見つけて転移学習を行い、データの制約を補う。

最も有用な AI モデルは、強力な汎化能力を持つモデルだ。既知から未知を予測できる必要がある。これが最も意義のある AI であり、根本的に言えば転移学習が最も効果的な方法だ。

標的特異的な予測を行うには、専門家は少量の結果や数件から数十件のデータをフィードバックしてファインチューニングを行うだけでよい。通常、アクティブラーニングを 5 ラウンド実施するだけで期待する結果を得られ、従来のブラインドスクリーニングを大きく上回る。

さらに、データ生成には主に 3 つの方法がある。

まず既存のデータからで、世界中の商用データベースと 100 以上のオープンソースデータベースを収集し、最終的に 95% のデータを排除した。これは歴史の再検証でもある。

次に独自の実験を行ってデータを補完することで、データの化学的・生物学的空間分布を明確にし、最少のデータポイントで最適なモデル性能を追求する必要がある。

3 つ目はアナログデータで、 QM が最も正確に計算できる。まず物理的なボトムサンプリングを行い、最後にこれらのデータを使って既に消費された計算リソースを代替し、再計算の必要をなくす。

現在、 Yuanyi Intelligence の統合ソリューションでは前述の図のような抽象的な表示がある。詳細は公式サイトを参照してほしい。標的配列から出発して、数時間で数十の AI モデルを同時にスコアリングし、10〜20 個の新規分子を同定できる。基本的に 2〜3 ラウンドで 100 分以内に目的の化合物を得られる。

さらにコンピューティングパワーの面では、トレーニング、呼び出し、 GPU 、 CPU 割り当ての面で非常に柔軟なソリューションを実現しており、成熟した自動化プラットフォームとなっている。

今年 6 月、 Yuanyi Intelligence は BIO International Conference で多目的 AI モデルを初めてリリースし、生物学的製剤、化学医薬品、核酸医薬品の自動設計機能を提供し、世界中の多くの CRO 、 CDMO 、製薬企業と緊密に協力している。同社は設立以来、年間 300 万ドルの受注を獲得している。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.