第5章: 遺産: ゲームから科学へ

ボードゲームからノーベル賞へ何が引き継がれ、そして何がまったく解決されなかったのか

📖 Reading Time: 20-25 minutes 📊 Difficulty: Beginner 💻 Code Examples: 0 📝 Exercises: 0

ビデオ講義

このビデオは以下のテキストと同じ内容をカバーしています。お好みの学習形式をお選びください。

🌐 JP | 🇬🇧 EN | Last sync: 2026-08-19

機械学習道場 > AlphaGoからAlphaFoldへ > 第5章

5.1 互いに矛盾して見える2つの軌跡

本シリーズの2つの物語を並べると、正反対に見えます。

AlphaGoは人間の知識を取り除きました。 第2章のシステムは人間の専門家の対局から始まりました。第3章の後継はそれを捨て、手作りの特徴量も、ロールアウト方策も、そして最終的にはゲーム固有の機構そのものも捨てました。引き算のたびにシステムは強くなりました。この物語の弧は 削除 の弧です。事前知識を減らし、自己対局を増やし、より強く打つ。

AlphaFoldはドメインの構造を注入しました。 第4章のシステムは、タンパク質データに向けられた汎用の系列モデルではありません。それはマルチプル配列アラインメント——どの残基が一緒に変異するかという進化の記録——のまわりに構築され、そしてタンパク質の明示的な幾何表現のまわりに構築されています。三次元空間の物理的な対称性が、ネットワークが残基のペアについて推論する仕方の中に配線されています。この物語の弧は 追加 の弧です。構造を増やし、事前知識を増やし、より良く予測する。

もし「事前知識を取り除け」がAlphaGoの教訓なのだとしたら、AlphaFoldは後退ということになります。そうではありません。ですから、教訓の述べ方が間違っていたのです。

以下がその解決であり、本章で最も有用な着想です。

どちらのシステムも事前知識についての話ではありません。どちらも問題の構造についての話——具体的には、安価で信頼できるフィードバック信号がどこから来るのかについての話——です。

囲碁は自分自身を検証できます。対局を終局まで打てば、ルールが誰が勝ったかを厳密に、無償で、望むだけ何度でも教えてくれます。自己対局が機能するのは、フィードバックのループが問題の内側で閉じているからです。事前知識を取り除けたのは、他の何か——ルール——が正解データを無制限の量で供給していたからです。

タンパク質の立体構造は自分自身を検証できません。予測された折りたたみが正しいかどうかをコンピュータに尋ねることはできません。答えられるのは実験だけであり、実験は遅く高価です。しかし自然はすでにその実験を、何十億回も走らせ、結果を書き留めていました。進化がラベル付きデータセットなのです。 折りたたまれる配列が生き残り、接触する残基が相関して変異します。MSAは古い意味での手作り特徴量ではありません。それは、すでに実施済みの膨大な量の検証がモデルへ届くための通り道なのです。

こう見れば、2つのシステムは同じ一手です。どちらも豊富な正解データの源を見つけ出し、そこから飲めるアーキテクチャを構築しました。AlphaGoはそれをルールの中に見つけ、AlphaFoldは進化の記録の中に、そしてCASPがベンチマークへ蓄積してきた数十年分の実験的に解かれた構造の中に見つけました。「事前知識を取り除く」対「事前知識を加える」に見えるものは、実際には「フィードバックがすでに無償だった」対「フィードバックを引き込まねばならなかった」なのです。

ボトルネックは決してアルゴリズムではありませんでした。 それは、システムが正しかったかどうかを告げる安価で信頼できる信号が利用可能かどうかであり、いまもそうなのです。

5.2 議論を定量的にする

上の主張は定性的なので、人工的な探索問題の上でそれを具体的にしましょう。タンパク質もなく、盤面局面もなく、ただ隠された品質スコアをもつ候補の空間と、それを探索する者が利用できる3種類のフィードバックがあるだけです。

以下のあらゆる値は教材用に作ったものです。 どの数値も実在のいかなるシステムにも対応していません。

import numpy as np

# --- 同一の人工的な探索空間の上での、3つのフィードバック体制 -------------
#
# 以下のどれもタンパク質でも盤面局面でも材料でもない。隠された「品質」
# スコアをもつ候補の空間を作り、3種類の異なるフィードバックのもとで
# 探索が何を達成できるかを問う:
#
#   A. 無償で厳密な検証器      -- ゲームの場合(自己対局は自分を採点する)
#   B. 高価で厳密な検証器      -- 実験台の場合(実験は少数しか許されない)
#   C. 安価でノイジーな代理指標 + 少数の厳密な確認 -- AlphaFold型の場合
#
# 要点は3つの「順序」であり、そしてCが代理指標の質にどう依存するかである。

rng = np.random.default_rng(0)

N_CANDIDATES = 20000    # 探索空間の大きさ(作った値)
EXACT_BUDGET = 50       # 実行可能な厳密評価の回数(作った値)

# すべての候補の隠された品質(作った値。標準正規分布)。
truth = rng.normal(0.0, 1.0, size=N_CANDIDATES)
best_possible = truth.max()


def regime_a():
    """検証器が無償: すべてを評価し、最良のものを取る。"""
    return truth.max()


def regime_b(rng):
    """検証器は厳密だが配給制: ランダムに標本を取り、最良のものを取る。"""
    idx = rng.choice(N_CANDIDATES, size=EXACT_BUDGET, replace=False)
    return truth[idx].max()


def regime_c(noise_sd, rng):
    """安価でノイジーな代理指標が全体を順位づけし、厳密な予算が上位を確認する。"""
    proxy = truth + rng.normal(0.0, noise_sd, size=N_CANDIDATES)
    shortlist = np.argsort(proxy)[-EXACT_BUDGET:]      # 代理指標が選んだ上位
    return truth[shortlist].max()                      # 厳密に検証済み


N_TRIALS = 200

a = regime_a()
b = np.mean([regime_b(rng) for _ in range(N_TRIALS)])

print("Search under three feedback regimes (all values invented)")
print(f"  candidates             : {N_CANDIDATES}")
print(f"  exact-evaluation budget: {EXACT_BUDGET}")
print(f"  trials averaged        : {N_TRIALS}")
print()
print(f"{'regime':<38}{'best found':>11}{'% of ceiling':>14}")
print(f"{'A. free exact verifier':<38}{a:>11.3f}{100 * a / best_possible:>13.0f}%")
print(f"{'B. rationed exact verifier':<38}{b:>11.3f}{100 * b / best_possible:>13.0f}%")

for noise_sd in [0.25, 0.5, 1.0, 2.0, 4.0]:
    c = np.mean([regime_c(noise_sd, rng) for _ in range(N_TRIALS)])
    label = f"C. proxy (noise sd = {noise_sd:.2f}) + budget"
    print(f"{label:<38}{c:>11.3f}{100 * c / best_possible:>13.0f}%")

print()
print(f"ceiling (true best in the space) = {best_possible:.3f}")

出力:

Search under three feedback regimes (all values invented)
  candidates             : 20000
  exact-evaluation budget: 50
  trials averaged        : 200

regime                                 best found  % of ceiling
A. free exact verifier                      3.946          100%
B. rationed exact verifier                  2.261           57%
C. proxy (noise sd = 0.25) + budget         3.946          100%
C. proxy (noise sd = 0.50) + budget         3.939          100%
C. proxy (noise sd = 1.00) + budget         3.770           96%
C. proxy (noise sd = 2.00) + budget         3.293           83%
C. proxy (noise sd = 4.00) + budget         2.846           72%

ceiling (true best in the space) = 3.946

結果の読み方。 3つ挙げます。3つ目こそが、本章が冒頭であのように始まった理由です。

本章の残りのすべては、その最後の一文の帰結です。

5.3 AlphaFoldが実際に変えたもの

書かれることが多いのは予測システムのほうです。日々の実務を変えたのは データベース のほうでした。

要求に応じて立体構造が手に入る。 2021年、DeepMindとEMBL-EBIはAlphaFoldタンパク質構造データベースを立ち上げ、予測された構造を広く公開しました。その後、既知のタンパク質配列の非常に大きな標本にわたって、数億の予測構造をカバーするまで拡張されました。実務上の効果はカテゴリーの変化です。予測された立体構造は、プロジェクトであることをやめ、検索(ルックアップ)になりました。以前なら、未解析のタンパク質を抱えた研究者は判断を迫られました——これは数か月の結晶構造解析に、あるいは数年に、値するのか? 以後は、同じ研究者がブラウザを開き、残基ごとの信頼度が付いた三次元モデルから始められます。

その信頼度が付いていることは、聞こえる以上に重要です。モデルは単に座標を出力するのではなく、それらをどれだけ信用してよいかの残基ごとの推定を出力します。適切に使えば、低信頼度の領域はそれ自体が情報です——しばしばモデルが失敗したのではなく、その領域が柔軟あるいは天然変性であることの信号です。不適切に使えば、信頼度は無視され、低信頼度のループが結晶構造であるかのように議論されてしまいます。

創薬: 置き換えではなく、仮説の生成。 これは最も誇張されがちな主張なので、慎重に述べます。予測された立体構造は 仮説を立てる のを助けます。結合ポケットがどこにありそうか、どの残基がそれを縁取っているか、候補分子がそこに収まりうるか、どの変異が界面に位置しそうか。これらは初期段階の本物の加速であり、広く使われています。

予測された立体構造がしてくれないのは、ある分子が結合するかどうか、結合が細胞内で何か有用なことをするかどうか、化合物が吸収されるかどうか、毒性があるかどうか、そしてその標的が正しい標的だったかどうかを告げることです。これらの問いはアッセイ、動物モデル、そして最終的には臨床試験によって答えられるのであり、そのどれも短縮されていません。DeepMindの創薬スピンアウトである Isomorphic Labs が存在するのは、まさに構造予測を医薬品へ変えることが、別個の、長い、そして大部分が実験的な事業だからです。誠実な枠づけは、構造予測はボトルネックを動かしたが、その背後にあるパイプラインを取り除いたわけではない、というものです。

酵素設計とタンパク質設計。 隣接する、そしておそらくより変革的な方向は、矢印を逆向きに走らせます。存在する配列の立体構造を予測するのではなく、指定した立体構造へ折りたたまれる配列を設計するのです。計算タンパク質設計は、自然界に対応物をもたないタンパク質を生み出してきましたし、高速で正確な立体構造予測が利用可能になったことがそれを直接に後押しします——設計された配列は、誰かが合成する前に計算的に確認できるからです。これは5.2節の体制Cを、探索ではなく設計に適用したものです。

2024年のノーベル化学賞 はその両方の半分を評価したのであり、この分割は正しく押さえる価値があります。しばしば誤って報じられるからです。半分は デイビッド・ベイカー に、計算タンパク質設計に対して贈られました。もう半分は デミス・ハサビスとジョン・ジャンパーに共同で、タンパク質立体構造予測に対して贈られました。設計と予測が、同じ問題の2つの面として、ともに評価されたのです。

短い弧です。あるプログラムがボードゲームの打ち方を学び、それから10年と経たないうちに、それが始めた一連の研究がノーベル化学賞を分かち合ったのです。

5.4 材料科学への波及

AlphaFoldが実証したテンプレート——高価な量を安価に予測し、それから絞り込んだリストを検証する ——は生物学に固有のものではありません。それは計算スクリーニング一般のアーキテクチャであり、材料科学はそれを熱心に採用しました。

パターンはどのドメインでも同じように読めます。学習されたモデルが、さもなければ高価な計算か合成を要する物性を推定する。そのモデルが膨大な候補空間を順位づけする。高価な手法は順位の上位にだけ費やされる。DeepMindの無機結晶構造予測に関する GNoME の仕事が最も目立つ例であり、後続の取り組みは同様のパイプラインを自律合成に適用しています。これらの取り組みは 多数の候補構造を発表し、独立の評価は慎重さを促してきました ——とりわけ、発表された候補のうちどれだけが本当に新規で、本当に安定で、本当に有用なのか、既知化合物の変種や、注意深い材料化学者なら数に入れないような登録項目ではないのか、という点についてです。この慎重さはこの仕事の否定ではありません。主張がその分野に出会うときの、通常かつ健全なプロセスです。ここでは件数を一切引用しません。件数こそが、まさに争われているものだからです。

より深い論点は、5.2節がすでに数値で示したものです。材料科学では、検証器は体制Bです。合成と評価は遅く、配給制です。モデルがそれを体制Cへ変換できるのは、代理指標が良い場合だけであり、そして「良い」は下されている具体的な判断に照らして測られます——生成エネルギーをよく予測するモデルが、その化合物が実際に作れるのか、稼働条件を生き延びるのか、手の届く価格なのかについては何も語らない、ということがありうるのです。

AI寺子屋のMI側から来られた方には、接続は直接的です。OERの計算化学 シリーズは、まさにこの構造を1つの具体的なドメインで通しています。物理的に動機づけられた記述子が高価な計算の代わりを務め、火山型の関係がその記述子を順位づけへ変え、最終章は基礎にある近似が何を見られないのかについての容赦なく率直な報告です。触媒設計へのMI応用 は、その上に載るデータ駆動の層——学習された物性モデル、不確かさ、ベイズ最適化、アクティブラーニング——を扱います。どちらかを本章と並べて読めば、共有された骨格は紛れもありません。安価な代理指標、高価な検証器、そして代理指標をどこまで信頼できるかについての議論です。

名指ししておく価値のある非対称性が1つあります。AlphaFoldにはCASPがありました。材料科学には、それに匹敵する権威をもつ単一で数十年来のブラインドなコミュニティ横断ベンチマークが存在しません。その不在は些細な運営上の欠落ではありません——それこそが、この分野の主張を裁定しにくくしている理由であり、AlphaFoldの物語の中で最も真似する価値のある部分なのです。

5.5 誠実な限界: 「解決済み」が意味しないこと

「タンパク質の折りたたみは解決された」という表現は、両方向に実害をもたらしました。門外漢に対して結果を過大に売り、事情を知る人々からの反発を招いたのです。精確な版はもっと狭く、もっと擁護可能です。

「解決済み」はベンチマークについての主張であって、生物学についての主張ではありません。 そのベンチマークとは、単一の配列が与えられたとき、単一の鎖の折りたたまれた構造の座標を予測し、実験構造に対して評価される、というものでした。そのタスクにおいて、性能は実験に匹敵する水準に達しました。生物学はそのタスクではありません。

以下が未解決のまま残っているものです。

動的挙動とコンフォメーション集団。 タンパク質は彫像ではありません。多くは動くことで機能します——開いて閉じ、状態のあいだを移り、ある部位での変化を離れた部位へ伝える。予測された単一の構造は集団の1枚のスナップショットであり、しかも一般には、その分布の記述ではなく進化的な信号と最も整合するスナップショットです。「このタンパク質はどのコンフォメーションを、どの確率で訪れるのか」という問いは、答えられた問いではありませんし、そしてしばしば機能を決めるのはその問いなのです。

複合体と相互作用。 タンパク質は集合体の中で、そして核酸、低分子、イオン、そして互いとの協働の中で働きます。鎖を単独で予測することは、結合したときに何をするかを予測することとは異なる、より易しい問題です。2024年に発表された AlphaFold 3 は、このアプローチを単一鎖を超えて、他の分子クラスとの相互作用を含む複合体へ拡張しています——本物で実質的な適用範囲の拡大です。それでもなお予測であり、ベンチマークされたものであり、本節のあらゆる留保の対象です。その出力は、自信のあるモデル出力一般と同じように扱ってください。すなわち、信頼度の推定が添えられた仮説として。

天然変性領域。 プロテオームのかなりの割合が、単一の安定な折りたたみをそもそも取りません。そして変性は欠陥ではなく機能的です——多くの調節タンパク質やシグナル伝達タンパク質はそうやって働いています。これらの領域について正しい出力は立体構造ではありません。そこで低い信頼度を返すモデルは行儀よく振る舞っています。その領域を確定した形として描画し、それをもとに推論する利用者は、そうではありません。

変異の影響。 「このアミノ酸1つの変化はタンパク質を壊すのか?」は、この分野で臨床的に最も価値ある問いの1つであり、そしてモデルが訓練された問いではありません。立体構造予測はファミリーの進化的記録に大きく駆動されており、1点変異はその記録をほとんど揺るがしません——ですから変異体と野生型の予測は、生物学的な帰結が深刻であってもほとんど同一に見えうるのです。安定性の変化、機能喪失、あるいは病原性の予測は、それ自身の手法、それ自身のベンチマーク、そして相当に控えめな性能をもつ隣接した問題です。

そして入力への依存。 予測の質は、利用可能な進化情報の深さと質に結びついています。まばらにしかサンプルされていないファミリー由来のタンパク質、自然界の近縁をもたない工学的な配列、そして設計されたタンパク質が難しいケースであるのは、まさに、無償の検証を運ぶ通り道が細いからです。

このどれも、達成されたことを貶めるものではありません。それを位置づけるのです。1つのベンチマークが征服され、隣接する大きく重要な問いの一群は征服されなかったのです。

5.6 あなた自身の仕事へ持ち帰れるもの

計算資源、専用アーキテクチャ、組織的リソースを取り払うと、転用可能な習慣が3つ残ります。それらはコストがかからず、そして本シリーズの実質的な中身です。

1. 検証の豊かなループを構築する。 モデルを選ぶ前に、出力が正しいかどうかを何が教えてくれるのか、各確認にいくらかかるのか、いくつ実行できるのかを問うてください。答えが「遅い人間のレビューを、ときどき」であれば、どんなアーキテクチャもそのプロジェクトを救いません——あなたは体制Bで立ち往生しています。フィードバックをより安く、より速く、より自動的にするために費やす労力は、たいてい同じ労力をモデルに費やすより勝ります。厳密な確認が手の届かないところでは、最も価値の高い工学的課題は代理指標を構築し、そのノイズを誠実に測定することです。5.2節が言うとおり、見返りを決めるのはノイズの水準だからです。

2. ドメインの事前知識を、装飾ではなく足場として使う。 AlphaFoldの幾何と対称性の構造は装飾ではありませんでした。それは、答えが三次元空間に存在し、回転させても変わらないという事実を符号化していたのです。良い事前知識は、問題について真であり制約となる何かを表現し、はるかに少ないデータからモデルを学習させます。悪い事前知識は、解についての当て推量にアーキテクチャの衣を着せたものです。判定法は、その事前知識が符号化している世界についての事実を1文で述べられるかどうかです。述べられないなら、それは装飾です。

3. ベンチマークを真剣に受け取り、その限界も真剣に受け取る。 CASPはこの物語の中で過小評価されている登場人物です。ブラインドで、独立に評価され、コミュニティが運営し、定期的な周期で開催され、その答えを競技参加者の誰も知らない標的をもつ——それが、この結果を単に主張されたものではなく 信頼できるもの にした制度です。同等の明快さを望むどんな分野も、同等のインフラを構築しなければなりません。そして同じ規律がもう半分を要求します。そのベンチマークが何を測り、何を測らないのかを率直に述べることです。「このベンチマークでの最高水準」と「解決済み」のあいだの隔たりこそ、過大な主張が住み着く場所だからです。

もう1つ、より居心地の悪い習慣もここに属します。自分の問題のどれが本当に体制Aの問題なのかに気づくこと。 ゲーム、シミュレーション、コンパイルするかしないかのコード、検証器が確認できる定理——これらは安価で厳密なフィードバックをもち、大規模な学習された探索の自然な住処です。現実の問題のほとんどはそうではありません。目の前にあるのがどちらの種類かを早い段階で認識することは、本シリーズのどんな技術よりも価値があります。

5.7 シリーズの結論: 旗色ではなく較正を

最初から線を辿ってみましょう。第1章はゲームを試金石として設定し、なぜ囲碁がチェスを破った手法には落ちないものだったのかを説明しました——全探索を打ち負かす分岐因子と、誰も書き下し方を知らなかった局面評価の問題です。第2章は、AlphaGoが学習された評価とモンテカルロ木探索をどう組み合わせ、ネットワークが探索にどこを見るべきかを告げ、探索がネットワークに何が重要だったかを告げるようにしたのかを示しました。第3章は人間の対局を、次いでゲーム固有の機構を取り除き、システムはより強くなりました。AlphaGo自身は2017年に引退し、同じ年、あるドキュメンタリーがイ・セドル戦を一般の観客の前に置きました。第4章は同じ組織——DeepMind——を、自己対局が不可能な問題へと連れて行き、そして進化がすでに実験を走らせ終えていたことを見出しました。本章は、これらが2つではなく1つの物語であることを論じてきました。

10年足らずのうちに、ボードゲームから始まった一連の研究がノーベル化学賞に寄与しました。これは注目すべき事実であり、率直に述べられるに値します。同時にそれは、本章がその長さを費やして組み立ててきた但し書きにも値します。征服されたのはベンチマークであって、完成したのは科学ではない。創薬パイプラインは、置き換えられたのではなくその入口で加速された。材料科学における類比は有望であり、そして争われている。そして残る問い——動的挙動、複合体、変性、変異体——は脚注ではなく、タンパク質が実際に何をしているのかという実質そのものです。

旗色ではなく較正を。 これらすべてについて簡単に取れる立場が2つあり、そのどちらも怠惰です。一方は、あらゆる発表を、残る問題が形式的なものにすぎないことの証拠として扱います。他方は、あらゆる結果を宣伝として、あらゆる限界を反証として扱います。どちらも、あなたに何かを注意深く読むことを要求しません。

有用な立場のほうは、より難しく、より退屈です。何が実証されたのかを正確に、何が測定されたのかを正確に、その測定が何を省いているのかを正確に、そして自分自身の問題のどれが、その実証を成立させた構造を共有しているのかを正確に、突き止めることです。その習慣は、本シリーズで名指しされたあらゆる個別のシステムより長生きします。結果は乗り越えられていきます——すでにいくつかはそうなっています。それらについて問いを立てる術は、そうはなりません。

🎯 演習問題

  1. 見かけ上の矛盾: 「AlphaGoは事前知識を取り除き、AlphaFoldは事前知識を加えた」がなぜ矛盾ではないのかを、懐疑的な同僚に向けて、自分の言葉で150語以内で説明してください。答えには、それぞれの場合に正解データがどこから来るのかを必ず含めてください。
  2. 代理指標の質: 5.2節のコードを改変し、代理指標が空間の一部でのみ真値と相関する——たとえば真値が中央値未満の候補については正確で、それ以上では純粋なノイズになる——ようにしてください。走らせる前に体制Cに何が起きるかを予測し、それから走らせて、食い違いがあれば説明してください。
  3. 予算か代理指標か: 代理指標のノイズを2.0に固定したまま、EXACT_BUDGET をいくつかの値で走査してください。予算を倍にすることによる利得と、ノイズを半分にすることによる利得を比較してください。どちらがより良い投資ですか。そして答えは出発点に依存しますか。
  4. 体制の監査: 自分の仕事から問題を1つ取り上げてください。厳密な検証器は何か、そのコストはいくらか、(あれば)どんな安価な代理指標が存在するか、その代理指標はどれだけノイジーかを書き出してください。問題をA、B、Cのいずれかに分類し、それを1文字だけ左へ動かすものは何かを述べてください。
  5. 主張を読む: 任意の科学分野における、AI駆動の発見の公開された発表を1つ見つけてください。(a) どの量が予測されたのか、(b) どの量が検証されたのか、(c) 発表された候補数に対して何件が検証されたのか、(d) 独立の第三者が検証の一部でも行ったのか、を特定してください。4つのうち、その発表からは判定できないものがどれかを記録してください。
  6. ベンチマークの問い: CASPがAlphaFoldの結果を信頼できるものにしました。自分の分野の問題について、CASPに相当するものを半ページで設計してください。誰が答えを保持するのか、標的はどう選ばれるのか、応募はどうブラインド化されるのか、そして何があれば結果が無意味になってしまうのかを明示してください。
  7. 「解決済み」が除外するもの: 5.5節の4つの未解決問題それぞれについて、高信頼度で予測された単一の立体構造が研究者を誤った結論へ導いてしまう具体的な生物学的状況を、1文で記述してください。

まとめ

本章は、本シリーズの2つの軌跡の見かけ上の矛盾を解消し、そのうえで達成されたことの周囲に誠実な境界線を引きました。AlphaGoは人間の知識を取り除き、AlphaFoldはドメインの構造を注入しました。そしてどちらも正しかったのです。どちらの物語も本当は事前知識についてのものではないからです。自己対局が機能したのはゲームが自分自身を検証するからであり、AlphaFoldが機能したのは進化がすでに実験を走らせ終えていたからです。共有された原理は、問題の構造によって形作られた探索と学習であり、どちらの場合も律速となる制約は 安価で信頼できるフィードバック信号が利用可能かどうか です。3体制の人工的なシミュレーション が、作った値を使ってこれを定量的にしました。無償で厳密な検証器は天井に届き、同じ予算を闇雲に使えばかろうじてその半分しか回収できず、安価な代理指標はほぼ全部を回収します——そしてその回収は代理指標がノイジーになるにつれて滑らかに減衰する。これが工学上の問題のすべてを1行で表しています。AlphaFoldが実務上変えたもの は、大部分がデータベースでした。AlphaFold DBは2021年にEMBL-EBIとともに立ち上がり、後に数億の予測構造へ拡張され、プロジェクトを検索へと変えました。創薬は、実験の置き換えではなくパイプラインの入口における仮説生成を得ました。Isomorphic Labsの存在がそれを示しています。そして 2024年のノーベル化学賞 は、半分を計算タンパク質設計に対してデイビッド・ベイカーに、もう半分をタンパク質立体構造予測に対してデミス・ハサビスとジョン・ジャンパーに共同で贈りました。このテンプレートは材料科学へ波及し、予測してから検証するスクリーニングとなりました。GNoMEとその後続は多数の候補構造を発表し、独立の評価は慎重さを促しています——本章が件数を一切引用しない理由であり、欠けている部品がより良いモデルではなくCASP級のコミュニティ・ベンチマークである理由です。誠実な限界 は、「解決済み」がベンチマークを記述するのであって生物学を記述するのではない、ということです。動的挙動とコンフォメーション集団、複合体と相互作用(2024年のAlphaFold 3が向かって拡張した領域)、天然変性領域、そして変異の影響はすべて未解決のままであり、予測の質は依然としてどれだけ進化情報が利用できるかに依存します。読者自身の仕事へ持ち帰れるもの は3つの習慣です。検証の豊かなループを構築しフィードバックを安くすることに投資すること、装飾ではなく世界についての言明可能な事実を符号化するドメイン事前知識を使うこと、そしてベンチマークを結果を信頼できるものにするインフラとして扱いつつ、それが何を省いているのかを率直に述べることです。

これで AlphaGoからAlphaFoldへ のシリーズは完結です。10年足らずのうちに、ボードゲームから始まった一連の研究がノーベル化学賞に寄与しました——そしてそれに対する有用な応答は、熱狂でも疑念でもなく、何が実証されたのか、何が測定されたのか、その測定が何を取りこぼしているのか、そして自分自身の問題のどれがそれを成立させた構造を共有しているのかを問う規律です。旗色ではなく較正を。

← 第4章: AlphaFold: タンパク質折りたたみのブレークスルー シリーズトップ →

免責事項