Empowering New Sources of Drug Discovery
01 AI の能力が数多くの業界に浸透するとき
AI は、大規模なライフデータだけでなく科学データも扱える能力をもたらします。その本質は高次元の複雑な関数を表現することにあり、量子力学方程式や分子力学方程式などの科学法則をより良く活用し、物理方程式をより効率的かつ高精度に解いてシミュレーションを行うことができます。たとえば、医薬品や材料の設計プロセス、航空機、ダム、橋梁などの大規模プロジェクトの製造プロセスでは、まず計算シミュレーションを実施し、コンピュータシミュレーション上で問題がないことを確認してから実際の実験や実体設計に移行することができます。
このような新技術のブレークスルーは、ミクロ世界における産業の設計と生産に新たな革新をもたらします。基盤となるパラダイムに支えられた新しいミクロ世界の計算・設計ツールは、医薬品研究開発、材料研究開発、そして多くの産業にさらなる違いをもたらします。
現在の計算生物学、医薬品設計、材料設計、化学設計などのシナリオでは、計算シミュレーションで問題解決が期待されますが、実装は非常に困難です。これらの問題の本質を解くには、微視的粒子間の複雑な多体相互作用を効果的に記述する必要があり、最終的には高次元の複雑な微分方程式を解くことに帰着します。これらの方程式は 100 年以上前から存在するかもしれませんが、次元の呪いを克服する有効な計算ツールやアルゴリズムが不足していました。
次元の呪いとは、既知の方程式を解くために必要な計算量が指数関数的に増加し、入力数に依存することを意味します。たとえば、タンパク質系の入力は数十万から始まり、計算に必要な計算能力の需要指数が入力に依存するため、完全に解くことができないことを意味します。したがって、実際に計算シミュレーションを使用してさらに計算を行う際は、大量の人為的な近似と人為的なモデリングを導入する必要があります。
モデリングプロセスにより、シミュレーションの精度が実際の要件を満たすことが難しくなります。これが長年直面してきた最大の課題です。AI の役割は、電子、分子、原子の相互作用を効果的に表現し、次元の呪いを克服することで、より効率的かつ高精度なシミュレーションを実現し、その精度を実用レベルに高めて実験を真に導くことです。
AI for Industry は、業界の発展を通じて蓄積された膨大なデータで直接モデルをトレーニングし、実践的な課題の解決を目指していますが、データ不足という問題があります。多くの業界のデータには AI の活用を阻害する特性が見られます。たとえば、データサンプルが非常に少ない、ラベルが非常に複雑、情報間の依存関係が非常に複雑といった特徴です。
AI for Science がもたらす機会は、科学データの直接的なフィッティングにとどまりません。科学の発展は、科学原理を物理法則や科学方程式として表現することで進んできました。AI の可能性は、これらの科学原理や物理モデルを学習し、物理方程式を効果的に解くことであり、それを実際の課題解決に応用し、データ不足に起因する多くの問題を克服できる点にあります。バイオ医薬品業界では、価値の高いターゲットや系ほどデータの希少性が高くなります。
したがって、計算シミュレーションは多くの新たな可能性をもたらし、AI はその計算シミュレーションをより高速かつ高精度にします。
02 バイオ医薬品が AI を取り入れ、さらなる可能性を創出
AI の科学アプリケーション、特に医薬品設計分野での能力を活用した新しいツールが徐々に開発されています。医薬品研究開発が必要とするのは、1 つや 2 つの中核的な計算ツールや重要な機能ではなく、包括的なソリューション体制です。同時に、継続的な反復を通じて初めて実用的な業界ソリューションが形成されます。
タンパク質構造予測は創薬研究の一般的な応用分野です。現在、医薬品設計分野では RNA 関連の創薬研究開発など一部の希少なデータが十分ではなく、モデルの効果もまだ十分ではありません。一方でモデルを継続的に改善し、他方で実際のシミュレーションと実験をより良く統合するソリューションも必要です。
Uni-Fold はタンパク質構造予測の全プロセスをトレーニングから予測、製品化まで再現し、いくつかの評価指標でより良い結果を達成しています。さらに、ポリマー、複雑な状況で必要なトレーニングコード、必要なデータと対応するモデルをオープンソースコミュニティに公開し、創薬研究の発展をさらに推進していきたいと考えています。
さらに、立体配座も医薬品設計で注目すべき次元です。AI モデルの全体的な予測結果は非常に優れていますが、一部にまだ不十分な点があり、シミュレーション手法と組み合わせてさらに精緻化する必要があります。シミュレーションが直面する最も一般的な課題は時間スケールです。
タンパク質の大規模な立体配座変化は通常長い時間を要するため、RiD 手法を用いてニューラルネットワークで高次元の集団変数に対応する自由エネルギーを表現し、その自由エネルギーでシミュレーションを加速させます。AI 予測と組み合わせることで、タンパク質の立体配座をさらに精緻化し、より良い構造を得ることができます。
医薬品設計では多くの場合アロステリック効果を考慮する必要があります。AI モデルの予測は立体配座情報を提供してくれますが、アロステリック部位の探索には拡張サンプリングも必要です。たとえば、あるケースではアロステリック部位が左下に位置していますが、従来のシミュレーション手法ではエネルギー障壁が高く、50 ナノ秒のシミュレーション時間の大部分でオルソステリック部位に立体配座が留まっています。しかし AI による拡張サンプリングと組み合わせることで、アロステリック部位を迅速かつ広範囲に探索できます。
実際の創薬研究では、オルソステリック部位に共有結合薬が存在することを確認しました。しかし共有結合薬は反応性が高く、異なるタイプの無関係な部位に転移しやすいため選択性が低い傾向があります。この課題に対して、より適切なアロステリック部位を見つけ、その部位に対する非共有結合薬を設計することで、より強い活性を実現しました。この実装には、AI による構造予測と拡張サンプリングのシミュレーションを効果的に組み合わせる必要があります。
AI モデルとの組み合わせに加え、シミュレーション手法の組み合わせもクライオ電子顕微鏡の構造解析に重要です。たとえば、電子顕微鏡密度マップが与えられた場合、それはタンパク質系の最終的な構造決定に対する電子制約となります。シミュレーションと組み合わせることで、系を密度マップの制約にうまく適合させることができます。Uni-Fold の直接構造予測は構造決定の出発点となり、実験データと組み合わせた制約付き MD によって最も理想的な構造を得ることができます。
構造とターゲットを決定したら、大規模なバーチャルスクリーニングが必要です。ドッキング手法はこの 10 年間多くの分野で頻繁に使用されてきましたが、今日の高性能コンピューティング環境では GPU への移行など最大限の最適化が求められています。GPU の特性を活かしてドッキング立体配座のグローバル探索と局所最適化を行うことで、さらなる調整が可能です。たとえば、グローバル探索パラメータを大きくし、局所最適化をより並列化できます。
GPU 特性に合わせた一連の最適化により、同一精度条件下でのパフォーマンスが大幅に向上しました。100 台の NVIDIA V100 GPU で並列スケジューリングを行う場合、3,800 万分子データベースのマルチレベル分子ドッキングをわずか 11.3 時間で完了できます。
血液脳関門を通過する必要がある疾患などでは比較的小さな分子が要求されます。特定の疾患タイプについては、検証不要な分子の可能性は基本的に列挙してスクリーニングでき、これは究極の計算能力と対応するアルゴリズムの組み合わせがもたらす新たな可能性です。
大規模スクリーニングと活性確認の後、活性を維持しつつ ADME/T などの最適化要件を満たすために薬物の改変が必要です。
Uni-FEP ソリューションは薬物改変前後の結合自由エネルギー変化を定量的に計算でき、現在その計算能力は化学精度の基準に達しているため、分子合成に必要な実験コストと時間コストを大幅に削減できます。
03 AI と計算能力のシナリオが重なり、クラウド化が潮流に
創薬研究開発の各段階で完全なコンピューティングソリューションが確立されています。アプリケーションシナリオの深化に伴い、多くの複雑なシナリオが生じています。シナリオの複雑さはソリューションの最終的な産業化に新たな要件をもたらし、同時に計算能力のインフラも急速に変化しています。基盤となるパフォーマンス特性、パフォーマンス最適化の選択、移行の選択は、大規模需要時のコスト面でも重要な検討事項です。
いくつかのソリューションに基づいて、創薬研究開発分野でパイプラインが形成されており、構造解析から動的解析、創薬、効率的な関係の構築に至る一連のリンクで構成されるコンピューティングソリューションです。そのロジックは非常にシンプルで、主にデータ駆動とシミュレーション駆動に分けられます。
これらのソリューションには高い柔軟性が求められます。高い弾力性を基盤として、異なるスキームはデータ使用に関して非常に異なる要件を持ちます。たとえば、シミュレーションはほとんどの場合高い計算能力を必要とする一方で、クライオ電子顕微鏡のデータは非常に大きいものです。このような柔軟性は、従来のコンピューティングソリューションでは実現が困難でした。したがって、クラウド化は大きな流れです。
ビジネスの深化に伴い、たとえば顧客がシェンシーテクノロジーの創薬研究開発プラットフォームを使用する場合、プライベート化の需要は非常に典型的で大きいものです。Compute Nest ソリューションと組み合わせることで、ユーザーはビジネスに必要なソフトウェアソリューションにより集中でき、プライベート化デプロイはクラウドに任せることができます。
計算能力とデータアルゴリズムの発展が AI を生み出し、AI の段階的な発展に伴い、物理法則を効果的に活用して、より多くの可能性を根本からもたらす必要があります。
AI は、大規模なライフデータだけでなく科学データも扱える能力をもたらします。その本質は高次元の複雑な関数を表現することにあり、量子力学方程式や分子力学方程式などの科学法則をより良く活用し、物理方程式をより効率的かつ高精度に解いてシミュレーションを行うことができます。たとえば、医薬品や材料の設計プロセス、航空機、ダム、橋梁などの大規模プロジェクトの製造プロセスでは、まず計算シミュレーションを実施し、コンピュータシミュレーション上で問題がないことを確認してから実際の実験や実体設計に移行することができます。
このような新技術のブレークスルーは、ミクロ世界における産業の設計と生産に新たな革新をもたらします。基盤となるパラダイムに支えられた新しいミクロ世界の計算・設計ツールは、医薬品研究開発、材料研究開発、そして多くの産業にさらなる違いをもたらします。
現在の計算生物学、医薬品設計、材料設計、化学設計などのシナリオでは、計算シミュレーションで問題解決が期待されますが、実装は非常に困難です。これらの問題の本質を解くには、微視的粒子間の複雑な多体相互作用を効果的に記述する必要があり、最終的には高次元の複雑な微分方程式を解くことに帰着します。これらの方程式は 100 年以上前から存在するかもしれませんが、次元の呪いを克服する有効な計算ツールやアルゴリズムが不足していました。
次元の呪いとは、既知の方程式を解くために必要な計算量が指数関数的に増加し、入力数に依存することを意味します。たとえば、タンパク質系の入力は数十万から始まり、計算に必要な計算能力の需要指数が入力に依存するため、完全に解くことができないことを意味します。したがって、実際に計算シミュレーションを使用してさらに計算を行う際は、大量の人為的な近似と人為的なモデリングを導入する必要があります。
モデリングプロセスにより、シミュレーションの精度が実際の要件を満たすことが難しくなります。これが長年直面してきた最大の課題です。AI の役割は、電子、分子、原子の相互作用を効果的に表現し、次元の呪いを克服することで、より効率的かつ高精度なシミュレーションを実現し、その精度を実用レベルに高めて実験を真に導くことです。
AI for Industry は、業界の発展を通じて蓄積された膨大なデータで直接モデルをトレーニングし、実践的な課題の解決を目指していますが、データ不足という問題があります。多くの業界のデータには AI の活用を阻害する特性が見られます。たとえば、データサンプルが非常に少ない、ラベルが非常に複雑、情報間の依存関係が非常に複雑といった特徴です。
AI for Science がもたらす機会は、科学データの直接的なフィッティングにとどまりません。科学の発展は、科学原理を物理法則や科学方程式として表現することで進んできました。AI の可能性は、これらの科学原理や物理モデルを学習し、物理方程式を効果的に解くことであり、それを実際の課題解決に応用し、データ不足に起因する多くの問題を克服できる点にあります。バイオ医薬品業界では、価値の高いターゲットや系ほどデータの希少性が高くなります。
したがって、計算シミュレーションは多くの新たな可能性をもたらし、AI はその計算シミュレーションをより高速かつ高精度にします。
02 バイオ医薬品が AI を取り入れ、さらなる可能性を創出
AI の科学アプリケーション、特に医薬品設計分野での能力を活用した新しいツールが徐々に開発されています。医薬品研究開発が必要とするのは、1 つや 2 つの中核的な計算ツールや重要な機能ではなく、包括的なソリューション体制です。同時に、継続的な反復を通じて初めて実用的な業界ソリューションが形成されます。
タンパク質構造予測は創薬研究の一般的な応用分野です。現在、医薬品設計分野では RNA 関連の創薬研究開発など一部の希少なデータが十分ではなく、モデルの効果もまだ十分ではありません。一方でモデルを継続的に改善し、他方で実際のシミュレーションと実験をより良く統合するソリューションも必要です。
Uni-Fold はタンパク質構造予測の全プロセスをトレーニングから予測、製品化まで再現し、いくつかの評価指標でより良い結果を達成しています。さらに、ポリマー、複雑な状況で必要なトレーニングコード、必要なデータと対応するモデルをオープンソースコミュニティに公開し、創薬研究の発展をさらに推進していきたいと考えています。
さらに、立体配座も医薬品設計で注目すべき次元です。AI モデルの全体的な予測結果は非常に優れていますが、一部にまだ不十分な点があり、シミュレーション手法と組み合わせてさらに精緻化する必要があります。シミュレーションが直面する最も一般的な課題は時間スケールです。
タンパク質の大規模な立体配座変化は通常長い時間を要するため、RiD 手法を用いてニューラルネットワークで高次元の集団変数に対応する自由エネルギーを表現し、その自由エネルギーでシミュレーションを加速させます。AI 予測と組み合わせることで、タンパク質の立体配座をさらに精緻化し、より良い構造を得ることができます。
医薬品設計では多くの場合アロステリック効果を考慮する必要があります。AI モデルの予測は立体配座情報を提供してくれますが、アロステリック部位の探索には拡張サンプリングも必要です。たとえば、あるケースではアロステリック部位が左下に位置していますが、従来のシミュレーション手法ではエネルギー障壁が高く、50 ナノ秒のシミュレーション時間の大部分でオルソステリック部位に立体配座が留まっています。しかし AI による拡張サンプリングと組み合わせることで、アロステリック部位を迅速かつ広範囲に探索できます。
実際の創薬研究では、オルソステリック部位に共有結合薬が存在することを確認しました。しかし共有結合薬は反応性が高く、異なるタイプの無関係な部位に転移しやすいため選択性が低い傾向があります。この課題に対して、より適切なアロステリック部位を見つけ、その部位に対する非共有結合薬を設計することで、より強い活性を実現しました。この実装には、AI による構造予測と拡張サンプリングのシミュレーションを効果的に組み合わせる必要があります。
AI モデルとの組み合わせに加え、シミュレーション手法の組み合わせもクライオ電子顕微鏡の構造解析に重要です。たとえば、電子顕微鏡密度マップが与えられた場合、それはタンパク質系の最終的な構造決定に対する電子制約となります。シミュレーションと組み合わせることで、系を密度マップの制約にうまく適合させることができます。Uni-Fold の直接構造予測は構造決定の出発点となり、実験データと組み合わせた制約付き MD によって最も理想的な構造を得ることができます。
構造とターゲットを決定したら、大規模なバーチャルスクリーニングが必要です。ドッキング手法はこの 10 年間多くの分野で頻繁に使用されてきましたが、今日の高性能コンピューティング環境では GPU への移行など最大限の最適化が求められています。GPU の特性を活かしてドッキング立体配座のグローバル探索と局所最適化を行うことで、さらなる調整が可能です。たとえば、グローバル探索パラメータを大きくし、局所最適化をより並列化できます。
GPU 特性に合わせた一連の最適化により、同一精度条件下でのパフォーマンスが大幅に向上しました。100 台の NVIDIA V100 GPU で並列スケジューリングを行う場合、3,800 万分子データベースのマルチレベル分子ドッキングをわずか 11.3 時間で完了できます。
血液脳関門を通過する必要がある疾患などでは比較的小さな分子が要求されます。特定の疾患タイプについては、検証不要な分子の可能性は基本的に列挙してスクリーニングでき、これは究極の計算能力と対応するアルゴリズムの組み合わせがもたらす新たな可能性です。
大規模スクリーニングと活性確認の後、活性を維持しつつ ADME/T などの最適化要件を満たすために薬物の改変が必要です。
Uni-FEP ソリューションは薬物改変前後の結合自由エネルギー変化を定量的に計算でき、現在その計算能力は化学精度の基準に達しているため、分子合成に必要な実験コストと時間コストを大幅に削減できます。
03 AI と計算能力のシナリオが重なり、クラウド化が潮流に
創薬研究開発の各段階で完全なコンピューティングソリューションが確立されています。アプリケーションシナリオの深化に伴い、多くの複雑なシナリオが生じています。シナリオの複雑さはソリューションの最終的な産業化に新たな要件をもたらし、同時に計算能力のインフラも急速に変化しています。基盤となるパフォーマンス特性、パフォーマンス最適化の選択、移行の選択は、大規模需要時のコスト面でも重要な検討事項です。
いくつかのソリューションに基づいて、創薬研究開発分野でパイプラインが形成されており、構造解析から動的解析、創薬、効率的な関係の構築に至る一連のリンクで構成されるコンピューティングソリューションです。そのロジックは非常にシンプルで、主にデータ駆動とシミュレーション駆動に分けられます。
これらのソリューションには高い柔軟性が求められます。高い弾力性を基盤として、異なるスキームはデータ使用に関して非常に異なる要件を持ちます。たとえば、シミュレーションはほとんどの場合高い計算能力を必要とする一方で、クライオ電子顕微鏡のデータは非常に大きいものです。このような柔軟性は、従来のコンピューティングソリューションでは実現が困難でした。したがって、クラウド化は大きな流れです。
ビジネスの深化に伴い、たとえば顧客がシェンシーテクノロジーの創薬研究開発プラットフォームを使用する場合、プライベート化の需要は非常に典型的で大きいものです。Compute Nest ソリューションと組み合わせることで、ユーザーはビジネスに必要なソフトウェアソリューションにより集中でき、プライベート化デプロイはクラウドに任せることができます。
計算能力とデータアルゴリズムの発展が AI を生み出し、AI の段階的な発展に伴い、物理法則を効果的に活用して、より多くの可能性を根本からもたらす必要があります。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
