フォーマット・シリーズ
機械学習ポテンシャルとは?DFTとの関係と汎用モデルの限界
- 機械学習ポテンシャル
- MLIP
- マテリアルズインフォマティクス
- 基盤モデル
- DFT
- M3GNet
- MACE-MP
- GNoME
- Materials Project
- MPtrj
- WBM
- 機械学習原子間ポテンシャル
- 普遍ポテンシャル
- 構造緩和
- 凸包
- 事前学習
- 分布シフト
- 回帰指標
- 分類指標
- 汎関数
- ファインチューニング
- LLM
- グラフ
- 分散力
- フォノン
- トリアージ
- リチウム
- 黒鉛
- デコーダ
目次
新しい結晶材料を探す研究者は、候補の構造が安定かどうかを、まず計算で判定する。量子力学の近似計算である DFT(密度汎関数理論)で構造のエネルギーを求め、競合する全配置が作る下側の境界(凸包)の上かそれより下にあれば、つまり凸包までの距離がゼロ以下なら「安定」とみなす。DFT は正確だが遅く、何百万もの候補をふるうには遅すぎる。
そこで、DFT の計算結果を教師にして、原子の並びからエネルギーと各原子に働く力を出すニューラルネットを訓練し、DFT の代わりに使う方法が広がった。このモデルを機械学習原子間ポテンシャル(MLIP)、略して機械学習ポテンシャルと呼ぶ。近年は、周期表の広い範囲を一つのモデルで扱う MLIP を大量の DFT データで事前学習し、大規模言語モデル(LLM)と同じく「基盤モデル」と呼ぶようになった。
本稿は、M3GNet と MACE-MP という二つの普遍ポテンシャルを例に取る。
DFT のデータで事前学習した MLIP は何を学んでおり、その予測に材料探索のどこまでを任せられるのか。
MLIP は DFT の答えを速く近似するモデルであって、現実を学んだモデルではない。 結晶をグラフとして読んでエネルギーと力を予測するので、原子を動かして構造を緩和でき、DFT より桁違いに速い。周期表の広い範囲を一つのモデルで覆う普遍ポテンシャルは、大きな固定データで事前学習して未知へ汎化させる点で LLM と同じ形をしており、分布のずれという同じ問題も抱える。訓練の参照である DFT が現実から外れる系では、DFT との一致をいくら上げてもずれは残り、エネルギー誤差の小さいモデルが安定性の判定でも強いとは限らない。だから速いモデルはふるい分けの道具であり、最後は DFT と実験が確かめる。
参照の計算をよく当てても、参照のずれは残る
※ この節の数値は説明のための仮定で、測定値ではありません。
候補の結晶が二つあり、どちらも参照の計算(DFT)が凸包までの距離を −0.03 eV/原子と出したとする。モデルはどちらについても −0.02 と予測し、参照との差は 0.01 にとどまる。モデルと参照の一致だけを見れば、二つの候補は見分けがつかず、どちらも「安定」に入る。
一つ目の候補では、参照の計算が現実をよく再現しており、現実の距離も −0.03 である。この候補は、モデルでも参照でも現実でも安定である。
二つ目の候補では、参照の計算がこの系で系統的にずれており、安定性を 0.05 eV/原子ほど有利に見積もっていたとする。現実の距離は −0.03 + 0.05 = +0.02 となり、この結晶は凸包の上に出る。モデルの誤差 0.01 をゼロまで縮めても、モデルは参照の −0.03 に近づくだけで、0.05 のずれは残る。
二つの候補からは、二つのことが読める。
- モデルは参照を目標に学ぶので、参照に近づくほど参照のずれも一緒に写し取る。モデルの誤差を縮めても、参照と現実の差は縮まない。
- 凸包までの距離がゼロに近い候補では、参照と現実の小さな差が安定と不安定を入れ替える。判定を確かめるには、参照の外にある、より精密な計算や実験が要る。
結晶は「グラフ」である
DFT の遅さを数字で見ると、Materials Project の実データでは、緩和でのエネルギー変化が最大級だった結晶1つに32コアで15時間かかった例がある1。
ニューラルネットに材料を読ませる、と聞くと難しそうだが、表現は素直だ。結晶をグラフとして扱う。原子をノード、近くにある原子どうしの関係をエッジにする。すると、画像でも文章でもなく「グラフ上の予測問題」になる。
ネットに何を予測させるか。エネルギーと、各原子にかかる力である。
ここが肝心だ。エネルギーだけでなく力(=各原子がどちらへ動きたいか)を出せると、ネットは単なる電卓ではなく、原子を実際に動かして構造を緩和できるようになる。物理では、力はエネルギーの傾き(勾配)を逆向きにしたものである。だからエネルギーの地形を学んだネットは、その地形の傾きから力を読み取り、原子を谷へ転がせる。こうして、DFT を高速に近似する代理(サロゲート)モデル=機械学習原子間ポテンシャル(MLIP) が生まれる。膨大なDFTデータを教師に「DFTならこう答える」を学んだ身代わり、と捉えてよい。速度差は桁違いで、たとえば M3GNet の著者らは SiO₂ 多形のフォノン計算について「秒で終わり、DFT より少なくとも4桁速い」と報告している2。ただし両者は別の手法(凍結フォノンと DFPT)で、厳密な同一条件の比較ではない。
なぜ「緩和」するのか。 候補としてひねり出した結晶は、原子の位置がまだ最適とは限らない。仮置きの配置である。そこで予測した力に沿って原子を少しずつ動かし、最も近いエネルギーの谷(安定なつり合いの配置)まで転がり落とす。これが構造緩和である。ある結晶が安定かどうかを決めるのは、この緩和後のエネルギー(凸包と比べる値)であって、仮置きのままのエネルギーではない。緩和を省くと、たまたま置いた配置のエネルギーを評価しているだけになり、本当の安定性を取り違える。力まで予測できるネットの値打ちは、この緩和を自前で回せる点にある。
「原子のための基盤モデル」はLLMと同じ手口である
2022年以降の本当の転換は、ここからである。
昔は、材料ごと・系ごとに専用のポテンシャルを作っていた3。新しい転換は周期表の広い範囲を1つのネットでカバーする「普遍ポテンシャル」を、巨大なDFTデータで事前学習することである。これは、あなたがLLMで知っている手口そのものである。大きな固定コーパスで事前学習し、未知へ汎化させ、そして分布シフトを心配する。違うのは中身が言語でなく原子だという点だけ。
具体例を挙げる(すべて実在の研究):
- M3GNet(Chen & Ong, 2022, 論文「A Universal Graph Deep Learning Interatomic Potential for the Periodic Table」)。Materials Project が10年かけて積んだ構造緩和データで学習し、3100万個の仮想結晶をふるって約180万個の候補を拾い上げた。さらに、そこから選んだ2000個(全化学からの上位1000個と、金属酸化物の上位1000個)のうち1578個がDFTで安定と確認されたと報告している。しかもその大半は未知の材料で、全化学側の999個は1つも Materials Project に無く、酸化物側579個のうち既知は5個だけだった1。「速いスクリーニング」は既知の再発見ではなく、新規の候補を拾っていた。ただしここでの「安定」の線は、「凸包までの距離がゼロ以下」ではなく 0.001 eV/atom 未満。内訳も全化学 999/1000 に対し酸化物 579/1000 で、当たり方は化学種によってかなり違う1。
- MACE-MP(Batatia ら)。各層が4体までの多体情報を同変な(結晶を回転させても予測が整合的についてくる)特徴量として持ち、その結果メッセージパッシングは2層で足りる普遍ポテンシャルであり、著者らは89元素・約150万構造(MPtrj、約15万結晶ぶんの静的計算と構造最適化軌跡)でこれを学習させている3。
LLM と同じ構造がここにある。固定された参照コーパスで事前学習した基盤モデルがあり、汎化と分布シフトの同じ問いが並ぶ。認識論はLLMと地続きである。分布のずれについては、脳型インターフェース(BCI)のデコーダが近い例になる。直近の少量データで訓練したデコーダは、記録条件が変わると効かなくなる4。MLIP もデコーダも、固定コーパスで学んだ写像を分布のずれた本番に当てる、という一点で通じている。
この論文は最も目を引く結果として、分布外での性能の高さを挙げている。元素置換で作った WBM データセットを、著者らは分布外の試験集合と位置づけている3。応用の例としては、リチウム–黒鉛の電圧曲線がある。Li の割合 x が 0.04 を超える領域で誤差が 0.1 V 未満に収まり、8000件超の系特化DFT計算で訓練した専用モデルと同等の精度を追加学習なしで出した3。希薄側では実験より最大3倍高い電圧を出す、とも原典は断っている。電圧の式でリチウム分率が分母に入るのでわずかなエネルギー差が増幅されること、低濃度ではエントロピーの寄与を見積もる標本が少ないこと、の2つが理由として挙げられている3。
なお、MACE の著者ら自身は「foundational と呼ぶのは、その使われ方のためだ」と限定している。初期探索の道具としては多くの用途に使えるが、特定のシミュレーション課題で定量的に正確な予測を得るには、おそらくファインチューニングが要る、と続けている3。
ただし、罠もLLMと同じ
シリーズを通じた主張に戻る。DFT の答えを完璧に当てるモデルは、シミュレータを学んだのであって、現実を学んだのではない。
機械学習ポテンシャルが学ぶ「正解」は、DFT が計算した値である。だからモデルは、原則として、訓練した参照(DFT)の良さを超える正確さは期待しにくい。厄介なのは、参照そのものが現実から外れている場合である。電子相関の強い系のエネルギーや、汎関数が取りこぼす分散力がそれにあたり5、DFTの再現度をいくら上げてもずれは残る。ずらす手はある。参照をより新しい汎関数へ付け替えれば、Hubbard U や分散力のような系ごとの補正に頼る度合いは減らせる、と原典も見ている5。「モデルがDFTと一致した」は「現実と一致した」ではない。この一段を飛ばすと、速度の数字だけを見て、何を達成したのか見失う。
もう一つ、但し書きがある。回帰指標の良し悪しは、そのまま「使える度」にはならない。同じ「安定性を当てる」というタスクの中でさえ、回帰指標(エネルギー誤差)で強いモデルが、実際に使う分類指標(発見のF1・決定境界付近の偽陽性率)でも強いとは限らない6。ただし、この食い違いが順位表の全体に及ぶわけではない。このベンチマークで最上位を占めたのは普遍ポテンシャルで、最初の1万件でランダム選択の最大6倍の発見加速率を示し、首位のモデルは報告された9つの指標すべてで他を上回っている6。それでも、速いネットはトリアージ(ふるい分け)であって最終判定ではない。最後はやはりDFTが、そして究極的には実験が確かめる。実際、M3GNet の著者らが約180万個の候補プール(すべてモデル側の最も厳しい線 0.001 eV/atom 未満)から一様に1000構造を抜いてDFTに掛けたところ、凸包までの距離がゼロ以下、つまり安定だったのは31%だった1。先に挙げた1578個のほうは、いちばん自信のある先頭2000個を切り出したときの数字である。同じ型の、より大きな例が Google DeepMind の GNoME(Merchant ら, 2023)である。モデルでふるった候補を DFT で計算し直す循環を回し、それまでの凸包より下の構造を220万個見いだし、うち736件は独立に実験で合成済みだったと報告している7。発見どうしで安定を競わせると、更新後の凸包に残るのは38.1万個になり、原典はそれも今後の発見で押し出されうると断っている7。だから「何百万個も『凸包より下』を予測できる」ことと、その「下」が本当に現実の新材料を意味することの間には、まだ一段ある。機械学習ポテンシャルの価値と限界は、その一段をどう扱うかで分かれる。
出典7件
-
Chen, Ong「A universal graph deep learning interatomic potential for the periodic table」Nat. Comput. Sci., 2022. https://www.nature.com/articles/s43588-022-00349-3 — M3GNet でふるった上位2000個中1578個が DFT で安定、一様抽出では31%と報告。 https://arxiv.org/abs/2202.02450 ↩ ↩2 ↩3 ↩4
-
Deringer, Caro, Csányi「Machine Learning Interatomic Potentials as Emerging Tools for Materials Science」Adv. Mater., 2019. https://doi.org/10.1002/adma.201902765 — 桁違いに速いとする総説。秒・4桁の数字は M3GNet 論文 SI のもの。 https://arxiv.org/abs/2202.02450 ↩
-
Batatia ほか「A foundation model for atomistic materials chemistry」J. Chem. Phys., 2025. https://arxiv.org/abs/2401.00096 — MPtrj で学習した MACE-MP-0 の報告。分布外性能を強調しつつ、定量的な精度には微調整が要ると限定する。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Sussillo ほか「Making brain–machine interfaces robust to future neural variability」Nat. Commun., 2016. https://doi.org/10.1038/ncomms13749 — 直近の少量データで訓練したデコーダは記録条件が変わると効かなくなると述べる(非ヒト霊長類で評価)。 ↩
-
Batatia ほか「A foundation model for atomistic materials chemistry」arXiv:2401.00096. https://arxiv.org/abs/2401.00096 — 学習データの DFT は PBE(一部 Hubbard U・分散補正なし)で、新しい汎関数への付け替えで補正への依存が減ると見込む。 ↩ ↩2
-
Riebesell ほか「A framework to evaluate machine learning crystal stability predictions」Nat. Mach. Intell., 2025. https://arxiv.org/abs/2308.14920 — 回帰指標と分類指標のずれを示し、普遍ポテンシャルが最上位と報告する。 ↩ ↩2
-
Merchant ほか「Scaling deep learning for materials discovery」Nature, 2023. https://doi.org/10.1038/s41586-023-06735-9 — DFT で確かめた凸包より下の220万構造、更新後の凸包に残る38.1万、実験で合成済みの736件を報告。 ↩ ↩2
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。