In Silico

AI協働

機械学習論文の再現性をAIが検証、再現率の分母は一部の論文と主張

2026/8/22 (更新: 2026/10/5)

  • 機械学習論文の再現性
  • 再現性
  • 機械学習
  • AIエージェント
  • SAI
  • ICML 2026
  • PaperBench
  • REPRO-agent
  • OpenReview
  • ラウンドロビン試験
  • 再現率
  • 査読
  • 主張
  • 依存関係
  • 不確かさ解析
  • 熱管理
  • 撹拌
  • 評価表
  • 触媒
  • ロジウム
  • 一酸化炭素
  • 提供終了
  • 人件費
  • 仮説
  • チェックポイント
目次
背景・問い・要点
背景

論文に載った結果を、他人が同じ手順でもう一度出せるか。これは科学の土台になる問いだ。だが確かめる作業には元の研究とほぼ同じ手間がかかる。やり遂げても新しい発見にはならない。だから実際に確かめる人は少ない。

そこで、この手間を機械に任せる発想が出てきた。手順を読み、環境を組み立て、走らせて、出てきた数字を論文の主張と突き合わせる。人手では無理だった規模で確かめられるかもしれない。

ただし、規模が出せるようになると、今度は別のことが問題になる。「再現できた」とは何を指すのか。数字がぴったり一致することか、傾向が同じならよいのか、結論が変わらなければよいのか。基準が揃っていなければ、集計した割合は読む人ごとに違う意味を持ってしまう。費用の話も同じで、いくらかかったかは、何をどこまで回したかとセットでしか読めない。

本稿は、研究レビュー企業 SAI が機械学習の主要会議 ICML 2026 の口頭発表論文で行った再現の試みを例に取り1、実験室で同じ触媒を回したラウンドロビン試験と、再現の定義をめぐる批判を並べる。

問い

機械に再現作業をさせると、何がどこまで分かるのか。集計した割合を、その割合が何を数えたのかまで確かめて読む。

要点

AIエージェントが、論文を機械の速度で再実行し始めた。研究レビュー企業SAIは、ICML 2026 の口頭発表論文をエージェントに検証させ、試した主張の大半が持ちこたえた論文はごく一部だったと見ている1。ただしその割合は、口頭発表の全体を分母にした値ではない。SAI が資源の見積もりで選んだ一部の論文の、しかもエージェントが実際に走らせた主張だけを数えている1。費用の側も同じで、論文の実験を付録まで含めて回し直す推定額は、中央値でも1万ドル近く、最も高いものは200万ドル規模に達する1。同じ時期、実物を扱う実験室でも同じことが起きた。四つの研究室が同じ触媒を回し、答えが揃わなかった2。ただし、この失敗率をそのまま危機の証拠として読むのは早い。「再現できた」の定義が揃っておらず、自動化はその合意の無いまま先に走っている、という批判が同時に出ているからだ3。したがって、自動監査が自己修復に転ぶか、不確かな判定に転ぶかは、まだ決まっていない。決めるのは、再現の定義が独立の監査どうしで比較できる形に揃うかどうかだ。揃える提案はあるが、その提案で実験結果の細部を抽出すると、まだ七割近くで著者の訂正が入るか、抽出が細部を取り逃す3。監査する側も、指摘は各自の作業に照らして検証せよと断っている1。

モデル・例示

同じ論文が、分母の取り方で4割を超えたり下回ったりする

※ この節の数値は説明のための仮定で、測定値ではありません。

検証可能な主張が10個ある1本の論文で、エージェントが5個を試行して走らせ、3個が論文の値を再現したとする。残りの5個は試行していない。

  • 走らせた主張を分母にすると、再現できた割合は3/5で6割になる。この論文は「4割超を再現した論文」に数えられる。
  • 論文の全主張を分母にすると、3/10で3割になる。同じ論文が4割に届かない。

走らせた5個のうち2個は、データを小さくするなど範囲を縮めた走行だったとする。範囲を縮めずに完走した3個だけを分母にし、そのうち2個が再現していれば、割合は2/3で約7割になる。

同じ論文の同じ結果から、3割・6割・7割の三つの数が出た。どれも計算は正しく、違うのは分母の決め方だけだ。二つの再現率を並べて比べられるのは、分母の取り方が同じときに限られる。

エージェントは、168本をレビューし、105本を再実行した

SAI は、AIエージェントに論文をレビューさせる米国の企業だ(SAI Labs, Inc.)。そのエージェントがやったことは手順として素朴だ。論文から著者の中心的な主張(claim)を抜き出す。主張とは、「この手法はこのデータでこの数値を出す」といった、検証可能な単位の言明である。付属のコード・モデル・データを落としてくる。環境を組む。可能なものは実験を回し直す。そして結果を、論文から抜き出した主張の一つひとつと突き合わせる1。

数字はこう並ぶ。対象は ICML 2026 の口頭発表の168本すべてで、口頭発表は同会議の最上位の区分だ。うち、走らせられるコードが付いていたのは104本。SAI が完全な再現を実施したのは105本で、これは104本の内数ではない。SAI は、この集合を初期のリソース見積もりで別に選び、低リソースの論文から順に着手している。その105本のうち、検証可能な主張を5つ以上持っていたのが92本だった1。原典の図によれば、この105本のうち著者の公開コードを走らせたのは67本で、残る38本はコードが無く、SAI が論文から組み直して走らせている1。

そして肝心の再現率は、この92本を分母に取る。さらに論文の内側にも分母がある。原典が数えているのは「エージェントが試行して実際に走らせた主張」に対する割合で、試行しなかった主張は分母から外れている(データセットを小さくするなど範囲を縮めて走ったものは含まれる)。その分母で、4割超を再現できたものが34本、8割超は8本1。168本ではなく92本、しかも論文の全主張ではなく試行できた主張が分母である点は、読み違えると失敗率を過大にも過小にもする。主張の数の下限のほうは、原典自身が動かしている。検証可能な主張を5つ以上から3つ以上、1つ以上へ緩めると対象は92本・96本・101本と増えるが、再現できた主張の割合の中央値は28%・28%・30%でほとんど動かない1。

原典は集計基準も併記している。範囲を縮めずに完走した主張だけで数えると、8割超に届く論文の割合は約1割から2割へ倍になる1。同じ数え方では中央値も28%から42%へ上がり、対象は完走した主張を5つ以上持つ論文に限られて92本から80本へ減る1。原典は同じ段落で、ICML の論文は高価であり自分たちは手持ちの資源に制約されていたとも書いている1。原典自身は、それでも大半が持ちこたえる論文はごく一部だという向きは変わらない、と見ている。

人間の査読者との比較も出ている。比べたのは、168本すべてについての SAI のレビュー報告と、OpenReview から集めた人間の査読である1。差が最も大きかったのはコードと再現性で、SAI は人間の査読者が誰も言及しなかった問題を903件挙げた。逆に、人間だけが挙げて SAI が見落とした指摘は22件だった1。この「最も大きい」が成り立つのは比で見たときで、絶対差なら健全性(SAI だけが1120件、人間だけが157件)のほうが大きい1。原典が出しているのは互いの取りこぼしの差であって、各々の総指摘数ではない(人間側の総数は公表されていない)。二人以上の人間査読者が合意していた指摘の78%を、SAI も自力で挙げている。一方で、新規性の判断と、その研究が文献のどこに位置するかの判定では、人間だけが挙げた指摘が95件、SAI だけが挙げた指摘が55件で、ここは人間が上回った1。

コードと再現性での差については、原典が実例を二つ挙げている。ひとつは、基盤モデルのパラメータの0.77%しか学習しないことを看板にした論文で、実際に公開されたチェックポイントは6.31%を学習しており、これは看板の約8倍にあたる。0.77%が成り立つのは、公開されたものの8分の1の大きさのアダプタでだけだった。もうひとつは、信頼性の表を公開コードのどこにも存在しない判定モデルで採点しており、その数値を計算するものがリポジトリに何も入っていない。原典は「どちらも原稿を読むだけでは見えない」と書いている1。査読の第一次選別にAIを置けるかという既存の論点とは、そもそも作業が違う。こちらは読むのではなく、動かす話だ。

動かないコードと、消えたモデル

再現が失敗した原因のうち大きかったのは二つだ。ひとつは、配布されたままのコードが動かないこと。ファイルが欠けている、記述が足りない、エージェントには直せない形で依存関係が壊れている1。もうひとつは、動いた結果が論文の報告値とずれることだ1。前者は工程の問題で、後者は主張そのものの問題である。同じ「再現できず」に、性質の違う二つが同居している。件数で見ると、原典の図では配布コードが動かないものが58件、数値が論文と合わないものが48件で、三番目のデータが入手できないものも42件と迫っており、105本中101本が少なくとも一つの問題を持っていた1。

そのうえで、もう一つ重い数字がある。4本の論文は、すでに提供終了したモデルに依存している1。この4本は、SAIが再現できなかったのではない。誰にも、もう再現できない。依存先が消えた時点で、その結果は検証可能性を失った。APIの背後にあるモデルを使って書かれた論文では、この形の消失は今後も起こりうる。

再現には、値札がついている

費用の推定を見ると、この話は具体的になる。原典が費用を出しているのは、完全再現を実施した105本についてである。その105本で、論文に載っている実験を付録まで含めて全部回すコストは、中央値で約8,900ドル。10万ドルを超えたものが17本。最も高いものは約220万ドルに迫った1。原典はこれを「トップの機械学習論文を作るのにいくら掛かるか」への答えとして出している。自分たちの走行が覆った主張については実測値、それ以外は原稿と付録を読んで既存の走行から見積もった値だ1。

さらに重要なのは、この見積もりが何を含んでいないかだ。原典は、人件費とその他のインフラ費用を除外していると明記している。そして対象は原稿に提示された作業だけで、その裏にある反復的な試行は数えていない1。つまり実際の値札は、この数字より上にしかならない。原典はどれだけ上かも書いており、別方向の試行錯誤を数えれば「容易に2倍・3倍になりうる」としている1。中央値でも1.8万〜2.7万ドルの側へ動く。なお原典の図2の副題は、この費用にインフラと途中で捨てた走行を含むと書いており、本文の但し書きと食い違う。どちらの範囲かは原典が決めていない1。

ただし、この約8,900ドルは監査の請求書ではない。SAI が監査そのものに払った額は原典に無く、走らせた主張のうちどれだけを範囲を縮めて走らせたかも原典は示していない。それでも負担の問いは立つ。SAI 自身が105本を初期のリソース見積もりで選び、低リソースの論文から順に着手したと書いているからだ1。払うのは会議か、出版社か、資金提供者か、それとも監査を売る企業か。払う主体が決まれば、何を監査するかも決まる。とはいえ、高額な論文が監査の対象から外れたわけではない。費用分布は完全再現した105本そのものの分布で、10万ドル超の17本も最高の約220万ドルもその中にある1。

実験台の上でも、同じことが起きている

計算の外でも同型の問題が観測された。SLAC国立加速器研究所、ペンシルベニア州立大学、スタンフォード大学、UCサンタバーバラの4研究室が、同じロジウム系触媒を回した2。二酸化炭素を一酸化炭素に変える反応で、CO2を燃料に変える最初の一段にあたる。同じ試料と同じ手順を複数の研究室に配り、結果を突き合わせるこの方式を、ラウンドロビン試験という。

結果は揃わなかった。4チームが得た一酸化炭素の量と、望ましくない副生成物であるメタンの量が、研究室ごとにばらついた2。同じ触媒を同じ温度で回しても、12時間後の一酸化炭素生成速度は研究室間で約2.5倍の開きがあった(原典の図2a)2。

食い違いの原因はいくつも見つかった。そのうち最大級の寄与因子のひとつが、意外なほど地味な項目だった。混合物をどれだけ強く振ったか・撹拌したかである4。4研究室でさらに標準化を進めると、結果は揃う方向に動いた4。提言は、反応器の設計・操作手順・実験条件の一貫性を上げること4。

ただし、撹拌を名指ししているのは参加機関の発表であって、査読された論文の要旨ではない。要旨がばらつきの主要な寄与因子のひとつとして挙げているのは熱管理(heat management)である2。撹拌と熱管理の関係については、発表も要旨も述べていない。査読を経た定式化が前面に置いているのは熱の側だ。

この研究が扱ったのは触媒1種・ラウンドロビン1件で、そこから一般則は引けない。ただし、そのばらつきが機械学習に何をするかは、この論文自身が測っている。要旨によれば、同一のバッチと同一の試験プロトコルを使ってもなお、研究室内では明確だった入力(反応温度・Rh 担持量・合成法)と出力(転化率・選択性・COとメタンの生成速度)の関係が、研究室間のばらつきを入れると統計的に有意でなくなった2。著者らの結論は、機械学習モデルの性能指標と入力特徴量の選び方に不確かさ解析を組み込まねばならない、というものだ2。プロトコルに書かれない操作は、そのデータで学習するモデルの入力特徴量に現れない。現れない変数は、関係を消すところまで効きうる。

「再現できない」が指しているもの

最も強い留保は、再現性研究そのものの内側から出ている。外野からではない。

Snelleman らの指摘はこうだ。再現の自動化を試みる研究が続いているが、再現性の定義が人によって違うため、明確な問題設定が欠けている3。何を自動化しているのかの合意が無いまま、自動化が組まれている。原典は、自動再現を目指す独立研究どうしの比較可能性が指標の乱立によって著しく限られているとも述べ、比較可能性の回復を動機に掲げる3。彼らが関連研究で挙げるところでは、PaperBench(Starace ほか)の最良モデルの平均再現スコアが43.4%、社会科学向けの REPRO-agent(Hu ほか)の正解率が36.6%とされている3。ただし PaperBench 自身の論文では、43.4%はコードを実行しない軽量版での値で、実行まで含む本体について要旨が報告する最良のエージェントは21.0%だった5。PaperBench は原著者と協調して手作りした評価表への達成度、REPRO-agent は1から4の再現性スコアを正解と突き合わせた一致率で、測っている量が違う3。Snelleman らの提案は、任意の実証研究を仮説・実験・解釈の三要素として表現し、それを論文から自動抽出することだ。20件の研究で試し、各研究の原著者本人に抽出の質を評価してもらっている3。

結果は、部分的にうまくいった。表現のすべての部分について、著者フィードバックの多数は肯定的だった。ただし、いくつかの研究では要素をすべて捉えきれず、特に実験結果のような具体的な細部の抽出には改善の余地があると報告している3。

内訳はこうだ。20件のうち6件で、仮説の全集合を取り逃している。いずれも一部は正しく取れていて全滅ではない。抽出は、ある研究では9つの仮説のうち7つ、別の研究では2つのうち1つを捉えた。原典はこの失敗をコンテキスト長の要求で説明できるかもしれない、と述べており、その根拠として挙げているのは、いま挙げた2例がいずれもデータセットの残りに比べてトークン数が際立って多いことだ3。解釈の抽出のほうは安定していて、著者が編集したのは24.32%、1文あたりの変更量は平均4.79%だった3。一方で、同じ表の実験結果の抽出は69.63%に著者の訂正が入るか、抽出が捉えきれなかった。誤り件数は1,103件で、実験の評価指標も46.88%が訂正を要した3。原典は、著者アンケートの好意的な評価とこの表とは「いくぶん食い違う」と自ら書いている3。抽出の精度が主張の粒度に届かないなら、その上に載る「再現できた/できない」の判定も揺れうる。長い論文ほど取りこぼすのなら、その揺れは系統的である。

再現しない理由が一種類でないことも、以前から整理されている。Gundersen らのレビューは、誤った結論につながりうる41の設計上の選択を文献から同定し、科学的方法の各段階に沿った枠組みに分類した6。原典が背景として引く通説では、主要な寄与とされるのは方法論上の問題と、アルゴリズムや実装そのものが持ち込む変動を適切に勘定に入れていないことだ6。

同レビューは、実験設計の選択と結論への影響とを結ぶ理論的枠組みが存在しないことを出発点に置き、それを埋めることを自らの目的に据えている6。結論部では、再現性の要因が結論にどう効くかを記述した最初の仕事だと自ら位置づけている6。つまり枠組みが無いのではない。当の論文がそれを与えたと主張していて、その主張はまだ独立の検証を経ていない。

そして Snelleman らの著者に Gundersen が入っている36。再現性の枠組みを与えた側の研究者が、その自動化には問題設定が無いと言っている構図だ。

監査する側も、自分の限界を自認している。SAI 自身は「SAI のレビューはまだベータであり、間違えることがある。だから、その指摘は自分自身の作業に照らして検証してほしい」と但し書きを付けている1。903件という指摘数は、903件の正しい指摘ではない。SAI はまた「低い再現スコアは、その論文が意図的に欺いていることを意味しない」と断り、コードが古びること、専有データが公開できないこと、著者の機械で動いたスクリプトが他所で同じに動かないことを挙げる。ただし「実務上の帰結は同じで、その論文の科学は検証できない」とも続けている1。


出典6件
  1. SAI Labs, Inc.「How much science is verifiable? Results from replicating ICML 2026 oral papers」2026. https://sai.science/blog/how-much-science-is-verifiable — 米国拠点の研究レビュー企業の自社報告で、口頭発表168本をレビューし105本を再実行した。独立の再現は未確認。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31

  2. Selin Bac, Adam S. Hoffman ほか, Nature Catalysis 9, 912–923, 2026. https://www.nature.com/articles/s41929-026-01559-y — 4研究室が同じ Rh/TiO2 触媒を回し、要旨は熱管理を主要な寄与因子のひとつに挙げ、研究室間のばらつきで入出力の関係が有意でなくなったと書く。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7

  3. T. Snelleman, O. E. Gundersen ほか「Automated Reproducibility Has a Problem Statement Problem」arXiv:2601.04226, 2025. https://arxiv.org/abs/2601.04226 — 再現性の定義の不一致で問題設定を欠くと論じた AAAI 2026 RAI ワークショップ論文。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13

  4. SLAC National Accelerator Laboratory「For AI to drive science discoveries, highly reproducible data is key」2026. https://www6.slac.stanford.edu/news/2026-08-03-ai-drive-science-discoveries-highly-reproducible-data-key — 参加機関の発表で、撹拌の強さを最大級の寄与因子のひとつとし、標準化で結果が揃う方向に動いたと書く。 ↩ ↩2 ↩3

  5. Giulio Starace ほか「PaperBench: Evaluating AI’s Ability to Replicate AI Research」arXiv:2504.01848v3, 2025. https://arxiv.org/abs/2504.01848v3 — 要旨の最良エージェントは21.0%で、43.4%はコードを実行しない軽量版 Code-Dev での o1 の値。 ↩

  6. O. E. Gundersen ほか「Sources of Irreproducibility in Machine Learning: A Review」arXiv:2204.07610, 2022. https://arxiv.org/abs/2204.07610 — 41の設計上の選択を分類した査読前のレビューで、最初の包括的枠組みは著者の自己申告。 ↩ ↩2 ↩3 ↩4 ↩5

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。