In Silico

フォーマット・シリーズ

GNoMEの220万個の新材料、実験で確かめられたのはいくつか

2026/7/8 (更新: 2026/10/7) シリーズ「凸包」 第3回 / 全3回

  • GNoME
  • 材料探索
  • 材料化学
  • A-Lab
  • Materials Project
  • ICSD
  • Stable Structure
  • Google DeepMind
  • DFT
  • 凸包
  • 安定材料
  • 実験構造
  • 合成可能性
  • 自律実験ラボ
  • 空間群
  • 疑似対称性
  • 構造型
  • 下限
  • 参照値
  • 前駆体
  • 標的
  • 新材料
  • 希土類
  • 回折パターン
  • 動的安定性
  • 競合多形
  • ニューラルネット
  • Cheetham
  • Seshadri
  • MatterGen
目次
背景・問い・要点
背景

新しい無機材料を探す研究者は、候補の結晶構造が安定かどうかを、まず計算で判定する。量子力学の近似計算(DFT)で構造のエネルギーを求め、同じ元素からなる既知の構造が作る下側の境界(凸包)より下に来れば「安定」とみなす。

この計算は一つずつでは重いので、結果をニューラルネットで近似して候補を大量にふるう方法が広がった。ただし「凸包より下」は計算上の基準であり、その構造が実験で結晶として得られるかは、別に確かめなければ分からない。

本稿は、2023年に Google DeepMind が発表した GNoME の数字と、それを二人の材料化学者が精査した論考、2026年に出た計算と実験の隔たりを測る査読前の論文2本、生成モデル MatterGen の合成例をめぐる査読済みの再検討を例に取る。

問い

計算で「安定」と判定された構造の数は、実験で確かめられた新材料の数として、どこまで読めるのか。

要点

計算上の安定の数と、実験で確かめられた数は、別の基準で測った別の数である。 GNoME の220万個は当時の凸包を基準にした予測で、論文が新規材料と呼ぶのは更新後の凸包に残った38万1000個、実験構造との一致が確かめられたのは少なくとも736個である。736 は照合で確かめられた範囲の下限で、一致しなかった残りを否定する数ではない。精査した二人は、無作為に抜いた10件がすべて既知の構造型に当てはまったと報告し、数の読み方と方法の両方に注文をつけた。2026年の査読前の測定では、計算の参照値そのものが実測からずれる例が報告され、実験の構造からのずれは、少なくとも初版の解析では AI の予測に限らず、純粋な DFT データベースにも共通していた。

モデル・例示

基準の凸包を引き直すと「安定」の数が減る

※ この節の数値は説明のための仮定で、測定値ではありません。

元素 A と B だけからなる系で、既知の安定な化合物が A・AB・B の三つだとする。組成を B の割合で 0・0.5・1 と置き、生成エネルギーを 0・−0.40・0 eV/原子とすると、既知の凸包はこの三点を結ぶ折れ線になる。B の割合 1/3 と 2/3 では、凸包の高さはどちらも −0.27 eV/原子である。

ここへ三つの予測が来るとする。A₃B(割合 1/4)が −0.21、A₂B(1/3)が −0.30、AB₂(2/3)が −0.35 eV/原子である。既知の凸包の高さはそれぞれ −0.20・−0.27・−0.27 なので、三つとも既知の凸包より下にあり、既知の基準では三つとも「安定」に数えられる。

次に、予測どうしも競わせて凸包を引き直す。A と A₂B を結ぶ線は割合 1/4 で −0.225 を通り、A₃B の −0.21 はこの線より上に出る。引き直した凸包に残る予測は A₂B と AB₂ の二つで、「安定」の数は三から二へ減る。

さらに、残った二つのうち一つの組成と構造が、実験の記録と一致したとする。もう一つは記録が無いだけで、作れないと分かったわけではない。

凸包を引き直して数えると、二つのことが分かる。

  1. 古い凸包を基準に数えた「安定」の数は、予測どうしを競わせて引き直した凸包の上に残る数以上になる。
  2. 実験の記録との一致は、確かめられた範囲の下限であり、一致しなかった構造について何も否定しない。

桁違いの見出し

2023年、Google DeepMind の研究チームが GNoME を Nature に発表した(Merchant ら「Scaling deep learning for materials discovery」)1。数字は圧倒的だ:

報道は当然沸いた。AIが材料探索を一気に進めた、という調子で。ただ、強い言い方をしたのは報道だけではない。論文の要旨が「stable materials known to humanity」と書いたところを、発表ブログは冒頭で「technologically viable materials known to humanity」と書いている2。人類が知る「安定材料」から、人類が知る「技術的に使える材料」へ。この言い換えは、計算上の安定と技術的に使えることの隔たりをまたいでいる。

ここで一歩立ち止まりたい。この220万という数字は、何に対する数字なのか。

数字は、現実に近い段ほど小さい

「凸包より下」は「DFT が計算した基準面より下」という意味であって、「ビーカーの中で本当に結晶になる」とイコールではない。基準そのものも計算の設定で動き、より精度の高い汎関数で検算すると、試験した四元系の13.2%は凸包の上に出る1。だから、予測から現実の側へ段を降りると、数字は劇的に小さくなる。ただし、どの段も上の段をふるいにかけた残りだとは限らない:

最下段の36には、その手前に A-Lab 自身の絞り込みがある。Materials Project の理論エントリから、放射性・希少・有毒な元素を含むものや、実験で扱いにくい系(硫化物など)、合成データ集と無機物質ハンドブックに組成が載っているものを落として432候補。空気中で安定なものが146、前駆体が手に入るものが57、そのうち作れたのが36である。原典はこれを成功率63%と要約し、選んだ57標的の多くには同じか近い組成の実験報告がある、とも断っている3。各段の条件(既存の資料に載っていないか、空気中で安定か、前駆体が買えるか)は、「計算で安定」と「現実に作れる」のあいだの距離そのものだ。

A-Lab の当初の報告は「58標的のうち41」だったが、訓練データに紛れていた1件を除いて57標的・報告40件となり、回折パターンを人手で見直すと判断が正しいと確認できたのは36件、残る4件は判断不能だった。訂正は、当初の「新規」が科学にとってではなく予測の仕組みにとって新しいという意味だったと説明している3。Leeman らは全件を再検討して新物質は1件も発見されていないと結論し、成功とされた物質の3分の2は予測した秩序構造の既知の組成無秩序版だろうとした3。この経過は、見出しの数字が精査で縮むという、このシリーズの主張そのものの実例である。一方で発表ブログは2026年10月3日時点でも、A-Lab が41を超える新材料の合成に成功したと書いている2。

⚠ 概念図:数値は本文出典に基づく(バー長は対数目盛) 予測 → 現実に近い段ほど、数字は桁で小さい 220万 それまでの研究の基準で安定(当時の凸包より下) 38万 更新後の凸包の上に残った新規材料 736 独立に得られた実験構造と一致(下限) ここから下は別の実験(736 の内訳ではない) 36 A-Lab が57標的から合成
220万と38万は GNoME の計算上の段、736 は ICSD の実験構造との一致が確かめられた数(下限)で、バー長は対数目盛(線形では736が消える)。原典の要旨は736を「安定な構造のうち」の数と書くが、38万の内数とまでは明示していない。最下段の36は別の実験の結果である。これは、A-Lab が別の計算プール(Materials Project)から57標的を採り、そのうち合成できた数である。計算の基準から「現実に作れた」に近づくほど、確かめられた数は桁で少ない。見出しの数字と確かめられた数のこの開きが、このシリーズの主張の中心である。

220万から736へ。見出しの数字と、実験で確かめられた数のあいだには、桁違いの開きがある。 これがこのシリーズの主張の、はっきりした実例である。「凸包より下にある」と「現実に作れて役に立つ新材料である」の間には、深い谷がある。ただし、736 はその谷の深さを測った数ではない。上で見たとおり 736 は下限で、一致しなかった残りは、ICSD との照合で確かめられていないだけだ。

念のため公正に言えば、GNoME のスケーリング自体は本物で、巨大な貢献である。736個の独立検証も立派な数字だ。問題は「達成」ではなく、見出しの数字をそのまま『新材料の数』と読んでしまう読み方の側にある。また、上で見たとおり、その読み方を後押しする書き方も、発表の側にあった。付け加えれば、この谷は論文の外から持ち込まれたものでもない。GNoME 論文自身が結びで、未解決の問題として競合多形・動的安定性と並べて synthesizability(合成可能性)を挙げている1。エネルギーの低さと合成できることのずれは、どちら向きにも出る。ICSDの登録から絞り込んだ約3万相のうち50.5%は、計算上は凸包の上、つまり計算の意味での「安定」の外にある4。同じ研究は、よく調べられてきた二元酸化物でも、観測された相と同じエネルギー帯に未観測の低エネルギーの多形が数多く計算に出ることから、エネルギーが低いことは合成できることの十分条件ではないとも書いている4。

称賛され、そして精査された

だからこそ、この発表は称賛と同時に、専門家の精査を受けた。材料化学の大家 Anthony Cheetham と Ram Seshadri は、Chemistry of Materials 誌(2024)に批判的な論考を発表し5、「凸包より下にある構造の数」と「新規で・信頼でき・役に立つ材料の数」は別物だという点で、この谷を問題にした。二人はもっと直接的に、この仕事が報告しているのは新材料ではなく提案された化合物の一覧であり、機能が実証されていない以上それらはまだ「材料」とは見なせない、と書いている。

二人の批判は、AI/ML という道筋そのものの否定ではない。向いているのは、数の読み方と、方法に足りていないものの両方だ。要旨は「この仕事で採られた方法は有望に見えるが、材料合成と結晶学の専門知識を組み込む必要が明らかに大きい」と結び、本文は希土類14元素とイットリウムの化学的な近さ、ジルコニウムとハフニウムの等価性、多くの登録に残る疑似対称性を、具体的な改善要求として並べている5。

言葉だけの批判でもない。二人は、GNoME が安定とした構造の一覧である Stable Structure データベースの 38万4870 件から無作為に10件を抜き、その10件すべてが ICSD にすでにある構造型に当てはまったと報告している5。10件中9件は空間群が一致せず、多くは予測側の対称性のほうが低かった。二人は、計算が実質 0 K の小さな単位胞で行われ配置のエントロピーを無視するため、予測では原子が完全に規則正しく並び、この低い対称性が来うると説明している5。標本はこの10件であり、データベース全体への外挿ではない。(この 38万4870 は論考が数え上げた登録数で、論文が「更新後の凸包の上」と呼ぶ 38万1000 とは対象が少し違う。)

10件の外側も、二人は数で押さえている。予測側の 38万4870件すべての空間群を数えると、その分布は ICSD のそれと「際立って異なる」という5。最も多いのは Pm(12.7%)、P1(10.2%)、Amm2(6.88%)、Cm(5.17%)の順で、上位4つがいずれも非心対称、合わせて全体の約34%を占める。ICSDでは上位24位に非心対称の空間群が1つしかなく、それも全体の1%である。ICSDで最も多い Pnma と P2₁/c は合わせて約16%を占めるのに対し、Pnma は予測側では16位・1.56%まで落ちる。二人はこの食い違いの主因を、人為的な秩序化に求めている。

論考の終盤は「GNoME と Stable Structure の一覧に、際立って新しい化合物はまだ見つけられていない」であり、そこに「38万4870件の中にはいくつかあるはずだとは考えている」という留保がすぐ続く。同じ段落で二人は、多くの新組成が既知材料のささやかな焼き直しである一方、計算による手法は全体として妥当な組成を出しており、その基盤にある方法は健全だという確信を与える、とも書いている5。

ここで大事なのは、これを「AIの敗北」と片付けないことだ。DeepMind のスケーリング結果と、化学者たちの慎重さは、別々のことについて両方とも正しい。 一方は「DFTという基準で、これだけ多くの候補を高速に拾えた」と言い、もう一方は「その候補が、現実に・新しく・有用に結晶化するかは、また別の測定問題だ」と言っている。この二つを混同しないことが、正確な読み方だ。二人自身も論考の最後に、AI/ML のツールが材料探索で明るい将来を持つことは確信しているが、その約束が果たされるまでにはもっと仕事が要る、と書いている5。そして、それぞれが何について正しいのかを切り分けたのは、ベンチマークではなく、データベースを一件ずつ開いた人間の専門家だった。

計算の提案と参照値は、実験からどこまでずれるか

2026年6月には、計算と実験の隔たりを別々の向きから測った査読前の論文が2本出ている。どちらも GNoME だけを調べたものではないが、計算上の「安定」をどこまで実験の代わりに読めるか、という問いに、提案の側と参照値の側から数字を足している。

Nguyen らの論文(6月29日公開)がまず作ったのは、実験の側の地図である6。ICSD に載る実験構造16万7500件を、構造の似かたを距離とする連続空間に置き、互いに近い構造の一群(族)に分けた。2010年までの構造で地図を作り、それ以降に報告された実験構造を当てると、60.6%が既存の族の内側に入った。計算側の標本を同じ地図に投影すると、初版の解析ではどれもこれより低い。ただし、このずれは AI の予測に固有ではなかった。純粋な DFT データベースである Materials Project の理論構造も同じように実験の構造からずれ、GNoME と Materials Project の理論構造が族の内側に入る率は、試した3つの切り方のどれでも統計的に区別がつかない。2010年なら36.4%と35.8%である6。

もっとも、この比較には後から手が入った。著者らは9月16日、構造を数値で表す特徴量の不具合を直して解析を作り直した改訂版のデータを公開し、初版の数値と混ぜないよう求めている。作り直した図で順位が入れ替わり、実験の分布に最も近い外部の計算集合は GNoME になった。2010年までの地図では、その GNoME とその後の実験構造との差が数ポイントまで縮む6。構造の表し方を別の方式に替えると、GNoME が族の内側に入る割合は実験側を上回りさえする。著者らは、主に使う物差しで GNoME の在籍率が低く出ることを、表現に固有の対比であって素材源の普遍的な順位ではない、と書いている6。測ったのも公開された標本で、GNoME は公開5000件のCIFである。著者らは族の内側という判定を、合成成功の確率には読み替えない、とも書いている6。

構造ではなく組成で比べると、GNoME の公開5000件と重なる簡約組成式は、1980年以降の ICSD に一件も無かった。元素の組合せまで緩めて数えても重なりは3.6%で、96.4%が現代のICSDのそれと重ならない。著者らはこの0を、GNoME が元素数の多い組成に偏るという Cheetham と Seshadri の批判の一面を定量化したものだと読んでいる。ただし、この公開集合は約38万件からの抜粋で、抜き方が完全には記述されていないため、組成の重なりは公開版の性質であって背後のモデルそのものの性質ではない、と断っている6。

もう1本は Vepa の単著(6月19日公開。改訂版 v2 まで含めて読む)で、計算で得た値を「正解」に使うこと自体の危うさを測った7。題材は、機械学習によるナトリウム系正極(Naイオン電池の材料)の電圧のスクリーニングで、閾値も失敗の定義も主要指標も解析の前に固定する事前登録の作法を取っている。実験に照らせたのは監査済みの既知Na正極6件で、予測・データベース参照・実測の三つを突き合わせられたのは、NaCoPO₄という一つの化合物の2つの多形(ABW型とβ型)だけだった。どちらでもMaterials ProjectのPBE+U参照値が実測より約0.54V低く、全体のずれを支配していたのはモデルの誤差ではなく参照側の誤差だった。狙ったNa置換空間の少なくとも70%はすでに論文化済みで、「新規発見」の余地も見た目より狭かった7。Materials Project は、GNoME の220万を数えたときの基準でもある。ただし Vepa が測ったのは電池の電圧の参照値で、凸包の判定に使う生成エネルギーのずれを測ったものではない。

0.54Vという差を、著者は補正量としては差し出していない。留保は二種類ある。まず標本数で、n=2の比較から出た数字は系統誤差の向きと桁を示すもので、確立した補正量ではない。次に測定側の向きだ。実測値は初回充電の平均で、しかも初回可逆性が約11%しかないセルのものだった。速度論的な分極は初回充電の平均を平衡電圧より上へ押し上げるから、0.54Vの一部はDFTの誤差ですらなく実測側の上方バイアスだ、と著者は書く。三つ目の化合物 Na₃V₂(PO₄)₃ を自分で計算し直すと2.90Vで、実測のプラトー約3.4Vより低く、向きは同じだった。一方で同じ計算台帳を校正監査にかけると、Liの基準対4組のうち3組では逆に、実測より約0.41V高く出た7。著者は、GGA+Uの電圧に向けて訓練したモデルが実測への系統的な下振れを引き継ぐという一般化を、遷移金属リン酸塩に限った「推定」の形で書いている。そのうえで、参照によく当てはまるモデルほど、参照のずれを忠実に再現すると指摘する7。著者はこの批判を自分の検証にも当てている。モデルの誤差は事前登録した保守的な指標で1.09Vと、使えない精度とした0.50Vの基準を大きく上回ったので、スクリーン自体を取り下げた。続く校正監査でもずれの標準偏差が自ら定めた0.30Vを超える0.31Vに出たため、自前の計算台帳についても絶対電圧の主張を撤回し、順位づけの主張だけを残した7。

数値のほかに、参照の同一性も崩れていた。人手で組んだ参照集合の草案を機械にかけると、そこに引かれていた Materials Project の識別子のうち6件が誤りだった。うち1件は名前空間の衝突によるもので、電池データベースの識別子が、本来の Na₄Fe₃(PO₄)₂(P₂O₇) ではなく Cr₃O₈ の対を指していた。残る5件は無関係の化合物を指すか、存在しない識別子だった。著者はこれを「どんな精度指標も捉えない種類の誤り」と呼んでいる7。

計算の提案が合成まで届いたとされる例にも、同じ問いが向いている。物性を指定して結晶を生成する拡散モデル MatterGen は、体積弾性率200 GPa を目標に TaCr₂O₆ を生成し、著者らはそれを合成したと報告した8。ただし測ったのはナノインデンテーションによるヤング率で、体積弾性率は DFT 由来のポアソン比で推定した値(最良推定169 GPa)である。Materials Horizons に載った再検討は、合成されたと報告された無秩序相 Ta₁/₃Cr₂/₃O₂ が1971年に報告済みの Ta₁/₂Cr₁/₂O₂ と同形で、その ICSD 登録は MatterGen が新規性の判定に使った参照データセットに入っていたと論じる。公開された回折パターンを組み直すと、組成は Ta₀.₄₃Cr₀.₅₇O₂ になるともした9。同じ再検討は参照データの誤りも挙げる。Materials Project は別のルチル型 Ta–Cr 酸化物 Ta₂CrO₆(mp-21512)を「実験検証済み」と記載しているが、Ta の割合が0.65を超えるとルチル型は単斜晶へ歪むため、この記載は誤りだという9。Vepa が参照集合の同一性で見つけたのと同じ型の失敗が、別のチーム・別の材料系で、査読を通った形で出ている。


出典9件
  1. Merchant, A. ほか「Scaling deep learning for materials discovery」Nature 624, 80–85, 2023. https://www.nature.com/articles/s41586-023-06735-9 — 220万個と38万1000個、ICSD との一致736件(組成の厳密一致ゆえの下限)を報告し、合成可能性を未解決の問題に挙げる。 ↩ ↩2 ↩3 ↩4 ↩5

  2. Google DeepMind「Millions of new materials discovered with deep learning」2023. https://deepmind.google/blog/millions-of-new-materials-discovered-with-deep-learning/ — 発表ブログ。冒頭で論文の「安定材料」を「技術的に使える材料」と言い換え、220万個を「ほぼ800年分の知識」にたとえる。 ↩ ↩2 ↩3 ↩4

  3. Szymanski ほか「An autonomous laboratory for the accelerated synthesis of inorganic materials」Nature 624, 2023. https://www.nature.com/articles/s41586-023-06734-w — 2026年の訂正で「58標的中41」が「57標的中36」に。Leeman ほかは新物質なしとした。 https://doi.org/10.1038/s41586-025-09992-y https://doi.org/10.1103/PRXEnergy.3.011002 ↩ ↩2 ↩3 ↩4

  4. Sun ほか「The thermodynamic scale of inorganic crystalline metastability」Science Advances 2, e1600225, 2016. https://doi.org/10.1126/sciadv.1600225 — ICSD由来の29,902相のうち50.5%が計算上は凸包の上にあるとした。 ↩ ↩2

  5. Cheetham, A. K.; Seshadri, R.「Artificial Intelligence Driving Materials Discovery?」Chemistry of Materials 36(8), 2024. https://pubs.acs.org/doi/10.1021/acs.chemmater.4c00643 — GNoME の一覧の登録を開いて新規性と信頼性を問うた論考。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7

  6. Nguyen ほか「Computed materials proposals depart from the structural memory of experimental discovery」arXiv, 2026. https://arxiv.org/abs/2606.30967 — 6月の初版(査読前)。9月の改訂解析は、初版の数値と混ぜないよう求める。 https://doi.org/10.5281/zenodo.22700590 https://github.com/scattering/crystal-communities-paper ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  7. Vepa「Computational references are not experiments」arXiv, 2026. https://arxiv.org/abs/2606.23725 — 機械学習によるNa正極電圧の予測を、事前登録して実測に当てた検証。本稿は6月29日の改訂版 v2 まで読む。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  8. Zeni ほか「A generative model for inorganic materials design」Nature 639, 624–632, 2025. https://doi.org/10.1038/s41586-025-08628-5 — 物性を条件に結晶を生成する拡散モデル。生成した TaCr₂O₆ を合成し体積弾性率を推定した。 ↩

  9. Juelsholt「Continued challenges in high-throughput materials predictions」Materials Horizons 13, 2026. https://pubs.rsc.org/en/content/articlelanding/2026/mh/d6mh00268d — 合成相は既知物質と同形で参照データに在ったとする査読済みの反論。 ↩ ↩2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。