In Silico

フォーマット・シリーズ

機械学習ポテンシャルとは?DFTとの関係と汎用モデルの限界

2026/7/8 (更新: 2026/10/7) シリーズ「凸包」 第2回 / 全3回

  • 機械学習ポテンシャル
  • MLIP
  • マテリアルズインフォマティクス
  • 基盤モデル
  • DFT
  • M3GNet
  • MACE-MP
  • GNoME
  • Materials Project
  • MPtrj
  • WBM
  • 機械学習原子間ポテンシャル
  • 普遍ポテンシャル
  • 構造緩和
  • 凸包
  • 事前学習
  • 分布シフト
  • 回帰指標
  • 分類指標
  • 汎関数
  • ファインチューニング
  • LLM
  • グラフ
  • 分散力
  • フォノン
  • トリアージ
  • リチウム
  • 黒鉛
  • デコーダ
目次
背景・問い・要点
背景

新しい結晶材料を探す研究者は、候補の構造が安定かどうかを、まず計算で判定する。量子力学の近似計算である DFT(密度汎関数理論)で構造のエネルギーを求め、競合する全配置が作る下側の境界(凸包)の上かそれより下にあれば、つまり凸包までの距離がゼロ以下なら「安定」とみなす。DFT は正確だが遅く、何百万もの候補をふるうには遅すぎる。

そこで、DFT の計算結果を教師にして、原子の並びからエネルギーと各原子に働く力を出すニューラルネットを訓練し、DFT の代わりに使う方法が広がった。このモデルを機械学習原子間ポテンシャル(MLIP)、略して機械学習ポテンシャルと呼ぶ。近年は、周期表の広い範囲を一つのモデルで扱う MLIP を大量の DFT データで事前学習し、大規模言語モデル(LLM)と同じく「基盤モデル」と呼ぶようになった。

本稿は、M3GNet と MACE-MP という二つの普遍ポテンシャルを例に取る。

問い

DFT のデータで事前学習した MLIP は何を学んでおり、その予測に材料探索のどこまでを任せられるのか。

要点

MLIP は DFT の答えを速く近似するモデルであって、現実を学んだモデルではない。 結晶をグラフとして読んでエネルギーと力を予測するので、原子を動かして構造を緩和でき、DFT より桁違いに速い。周期表の広い範囲を一つのモデルで覆う普遍ポテンシャルは、大きな固定データで事前学習して未知へ汎化させる点で LLM と同じ形をしており、分布のずれという同じ問題も抱える。訓練の参照である DFT が現実から外れる系では、DFT との一致をいくら上げてもずれは残り、エネルギー誤差の小さいモデルが安定性の判定でも強いとは限らない。だから速いモデルはふるい分けの道具であり、最後は DFT と実験が確かめる。

モデル・例示

参照の計算をよく当てても、参照のずれは残る

※ この節の数値は説明のための仮定で、測定値ではありません。

候補の結晶が二つあり、どちらも参照の計算(DFT)が凸包までの距離を −0.03 eV/原子と出したとする。モデルはどちらについても −0.02 と予測し、参照との差は 0.01 にとどまる。モデルと参照の一致だけを見れば、二つの候補は見分けがつかず、どちらも「安定」に入る。

一つ目の候補では、参照の計算が現実をよく再現しており、現実の距離も −0.03 である。この候補は、モデルでも参照でも現実でも安定である。

二つ目の候補では、参照の計算がこの系で系統的にずれており、安定性を 0.05 eV/原子ほど有利に見積もっていたとする。現実の距離は −0.03 + 0.05 = +0.02 となり、この結晶は凸包の上に出る。モデルの誤差 0.01 をゼロまで縮めても、モデルは参照の −0.03 に近づくだけで、0.05 のずれは残る。

二つの候補からは、二つのことが読める。

  1. モデルは参照を目標に学ぶので、参照に近づくほど参照のずれも一緒に写し取る。モデルの誤差を縮めても、参照と現実の差は縮まない。
  2. 凸包までの距離がゼロに近い候補では、参照と現実の小さな差が安定と不安定を入れ替える。判定を確かめるには、参照の外にある、より精密な計算や実験が要る。

結晶は「グラフ」である

DFT の遅さを数字で見ると、Materials Project の実データでは、緩和でのエネルギー変化が最大級だった結晶1つに32コアで15時間かかった例がある1。

ニューラルネットに材料を読ませる、と聞くと難しそうだが、表現は素直だ。結晶をグラフとして扱う。原子をノード、近くにある原子どうしの関係をエッジにする。すると、画像でも文章でもなく「グラフ上の予測問題」になる。

ネットに何を予測させるか。エネルギーと、各原子にかかる力である。

ここが肝心だ。エネルギーだけでなく力(=各原子がどちらへ動きたいか)を出せると、ネットは単なる電卓ではなく、原子を実際に動かして構造を緩和できるようになる。物理では、力はエネルギーの傾き(勾配)を逆向きにしたものである。だからエネルギーの地形を学んだネットは、その地形の傾きから力を読み取り、原子を谷へ転がせる。こうして、DFT を高速に近似する代理(サロゲート)モデル=機械学習原子間ポテンシャル(MLIP) が生まれる。膨大なDFTデータを教師に「DFTならこう答える」を学んだ身代わり、と捉えてよい。速度差は桁違いで、たとえば M3GNet の著者らは SiO₂ 多形のフォノン計算について「秒で終わり、DFT より少なくとも4桁速い」と報告している2。ただし両者は別の手法(凍結フォノンと DFPT)で、厳密な同一条件の比較ではない。

なぜ「緩和」するのか。 候補としてひねり出した結晶は、原子の位置がまだ最適とは限らない。仮置きの配置である。そこで予測した力に沿って原子を少しずつ動かし、最も近いエネルギーの谷(安定なつり合いの配置)まで転がり落とす。これが構造緩和である。ある結晶が安定かどうかを決めるのは、この緩和後のエネルギー(凸包と比べる値)であって、仮置きのままのエネルギーではない。緩和を省くと、たまたま置いた配置のエネルギーを評価しているだけになり、本当の安定性を取り違える。力まで予測できるネットの値打ちは、この緩和を自前で回せる点にある。

※ 概念図(フロー) DFTを高速に近似する流れ——結晶をグラフとして読み、力まで予測して原子を緩和する ① 結晶構造 周期的な原子配列 → ② グラフ化 原子=ノード 近接ペア=エッジ → ③ GNNが予測 エネルギー E + 力 F 力=−エネルギー勾配 (各原子の動きたい向き) → ④ 構造緩和 力で原子を 安定な谷へ転がす 速度はDFTより数桁速く、ふるい分けに使える。ただし学ぶのは DFT(参照)であって、現実そのものではない。
※ 概念図(フロー)・作図。機械学習原子間ポテンシャル(MLIP)の流れ:結晶を①そのままの構造から②グラフ(原子=ノード・一定距離内の近接ペア=エッジ)へ読み替え、③グラフニューラルネットがエネルギーと力を予測し、④その力で原子を安定な谷へ緩和する。これで DFT を数桁速く近似できる。ただし学ぶのは DFT という参照であって、現実そのものではない。

「原子のための基盤モデル」はLLMと同じ手口である

2022年以降の本当の転換は、ここからである。

昔は、材料ごと・系ごとに専用のポテンシャルを作っていた3。新しい転換は周期表の広い範囲を1つのネットでカバーする「普遍ポテンシャル」を、巨大なDFTデータで事前学習することである。これは、あなたがLLMで知っている手口そのものである。大きな固定コーパスで事前学習し、未知へ汎化させ、そして分布シフトを心配する。違うのは中身が言語でなく原子だという点だけ。

具体例を挙げる(すべて実在の研究):

LLM と同じ構造がここにある。固定された参照コーパスで事前学習した基盤モデルがあり、汎化と分布シフトの同じ問いが並ぶ。認識論はLLMと地続きである。分布のずれについては、脳型インターフェース(BCI)のデコーダが近い例になる。直近の少量データで訓練したデコーダは、記録条件が変わると効かなくなる4。MLIP もデコーダも、固定コーパスで学んだ写像を分布のずれた本番に当てる、という一点で通じている。

この論文は最も目を引く結果として、分布外での性能の高さを挙げている。元素置換で作った WBM データセットを、著者らは分布外の試験集合と位置づけている3。応用の例としては、リチウム–黒鉛の電圧曲線がある。Li の割合 x が 0.04 を超える領域で誤差が 0.1 V 未満に収まり、8000件超の系特化DFT計算で訓練した専用モデルと同等の精度を追加学習なしで出した3。希薄側では実験より最大3倍高い電圧を出す、とも原典は断っている。電圧の式でリチウム分率が分母に入るのでわずかなエネルギー差が増幅されること、低濃度ではエントロピーの寄与を見積もる標本が少ないこと、の2つが理由として挙げられている3。

なお、MACE の著者ら自身は「foundational と呼ぶのは、その使われ方のためだ」と限定している。初期探索の道具としては多くの用途に使えるが、特定のシミュレーション課題で定量的に正確な予測を得るには、おそらくファインチューニングが要る、と続けている3。

ただし、罠もLLMと同じ

シリーズを通じた主張に戻る。DFT の答えを完璧に当てるモデルは、シミュレータを学んだのであって、現実を学んだのではない。

機械学習ポテンシャルが学ぶ「正解」は、DFT が計算した値である。だからモデルは、原則として、訓練した参照(DFT)の良さを超える正確さは期待しにくい。厄介なのは、参照そのものが現実から外れている場合である。電子相関の強い系のエネルギーや、汎関数が取りこぼす分散力がそれにあたり5、DFTの再現度をいくら上げてもずれは残る。ずらす手はある。参照をより新しい汎関数へ付け替えれば、Hubbard U や分散力のような系ごとの補正に頼る度合いは減らせる、と原典も見ている5。「モデルがDFTと一致した」は「現実と一致した」ではない。この一段を飛ばすと、速度の数字だけを見て、何を達成したのか見失う。

もう一つ、但し書きがある。回帰指標の良し悪しは、そのまま「使える度」にはならない。同じ「安定性を当てる」というタスクの中でさえ、回帰指標(エネルギー誤差)で強いモデルが、実際に使う分類指標(発見のF1・決定境界付近の偽陽性率)でも強いとは限らない6。ただし、この食い違いが順位表の全体に及ぶわけではない。このベンチマークで最上位を占めたのは普遍ポテンシャルで、最初の1万件でランダム選択の最大6倍の発見加速率を示し、首位のモデルは報告された9つの指標すべてで他を上回っている6。それでも、速いネットはトリアージ(ふるい分け)であって最終判定ではない。最後はやはりDFTが、そして究極的には実験が確かめる。実際、M3GNet の著者らが約180万個の候補プール(すべてモデル側の最も厳しい線 0.001 eV/atom 未満)から一様に1000構造を抜いてDFTに掛けたところ、凸包までの距離がゼロ以下、つまり安定だったのは31%だった1。先に挙げた1578個のほうは、いちばん自信のある先頭2000個を切り出したときの数字である。同じ型の、より大きな例が Google DeepMind の GNoME(Merchant ら, 2023)である。モデルでふるった候補を DFT で計算し直す循環を回し、それまでの凸包より下の構造を220万個見いだし、うち736件は独立に実験で合成済みだったと報告している7。発見どうしで安定を競わせると、更新後の凸包に残るのは38.1万個になり、原典はそれも今後の発見で押し出されうると断っている7。だから「何百万個も『凸包より下』を予測できる」ことと、その「下」が本当に現実の新材料を意味することの間には、まだ一段ある。機械学習ポテンシャルの価値と限界は、その一段をどう扱うかで分かれる。


出典7件
  1. Chen, Ong「A universal graph deep learning interatomic potential for the periodic table」Nat. Comput. Sci., 2022. https://www.nature.com/articles/s43588-022-00349-3 — M3GNet でふるった上位2000個中1578個が DFT で安定、一様抽出では31%と報告。 https://arxiv.org/abs/2202.02450 ↩ ↩2 ↩3 ↩4

  2. Deringer, Caro, Csányi「Machine Learning Interatomic Potentials as Emerging Tools for Materials Science」Adv. Mater., 2019. https://doi.org/10.1002/adma.201902765 — 桁違いに速いとする総説。秒・4桁の数字は M3GNet 論文 SI のもの。 https://arxiv.org/abs/2202.02450 ↩

  3. Batatia ほか「A foundation model for atomistic materials chemistry」J. Chem. Phys., 2025. https://arxiv.org/abs/2401.00096 — MPtrj で学習した MACE-MP-0 の報告。分布外性能を強調しつつ、定量的な精度には微調整が要ると限定する。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  4. Sussillo ほか「Making brain–machine interfaces robust to future neural variability」Nat. Commun., 2016. https://doi.org/10.1038/ncomms13749 — 直近の少量データで訓練したデコーダは記録条件が変わると効かなくなると述べる(非ヒト霊長類で評価)。 ↩

  5. Batatia ほか「A foundation model for atomistic materials chemistry」arXiv:2401.00096. https://arxiv.org/abs/2401.00096 — 学習データの DFT は PBE(一部 Hubbard U・分散補正なし)で、新しい汎関数への付け替えで補正への依存が減ると見込む。 ↩ ↩2

  6. Riebesell ほか「A framework to evaluate machine learning crystal stability predictions」Nat. Mach. Intell., 2025. https://arxiv.org/abs/2308.14920 — 回帰指標と分類指標のずれを示し、普遍ポテンシャルが最上位と報告する。 ↩ ↩2

  7. Merchant ほか「Scaling deep learning for materials discovery」Nature, 2023. https://doi.org/10.1038/s41586-023-06735-9 — DFT で確かめた凸包より下の220万構造、更新後の凸包に残る38.1万、実験で合成済みの736件を報告。 ↩ ↩2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。