In Silico

AI・信頼性・評価

GoogleのAI『ERA』、採点できる課題で人間最良を上回る

2026/7/3 (更新: 2026/9/29)

目次
【背景】解析手法の良し悪しは、公開の物差しで採点されているそのコードを書く仕事を、機械に回せないか【問い】機械は人間最良の手法を上回れるのか上回れるとして、それはどんな問いに限った話なのか
※概念図(背景→問い):機械に科学の道具を作らせたら、どこまで効くのか
背景

科学の研究では、データから結論を引き出す手順そのものがソフトウェアとして書かれる。細胞を1個ずつ測ったデータから意味のあるまとまりを取り出すのも、感染症の患者数から数週間先の入院者数を予測するのも、誰かが解析の手順を考えてコードに書く作業から始まる。手順を作る側が変われば、出てくる結論も変わる。

この種の課題には、できあがった手法を比べる仕組みが整っていることが多い。この仕組みは、各手法を同じデータと同じやり方で採点し、成績を公開の表に並べる。誰が「良くなった」と主張するかではなく、共通の点数が優劣を決める。いま誰の手法が最良かは、数字で分かる。一方で、大規模言語モデル(LLM)はソフトウェアのコードをかなり書けるようになった。ならば、解析手法を書く仕事そのものを機械に回せないか。回した結果が本当に良いのかどうかも、その公開の物差しの上でなら確かめられる。

問い

機械が作った科学の道具は、人間が設計した最良の手法を上回れるのか。上回れるとして、それはどんな問いに限った話なのか。

要点

上回れる。ただし、示されたのは「良さ」を点数で採点できる問いでの話であり、その点数に何を選ぶかを決める仕事は人間に残る。 Google が主導して作った ERA(Empirical Research Assistance)は、LLM に科学用のソフトウェアを書かせ、点数が上がるまで自動で改良させ続けるシステムである1。単一細胞データの解析では、ERA は公開リーダーボードで人間最良を上回る手法を40件作った。COVID-19 の入院予測では、CDC(米疾病対策センター)の集団予測と個別モデルの全てを上回るモデルを14件作った1。ただし前者は約7割が既発表手法の組み替えで、後者は3参照日ぶんの評価区間を後ろ向きに検証した数字である。

何をしたのか

ERA(Empirical Research Assistance)の仕組みは単純で強い。ある課題に対して「良さ」を測る品質指標(例:公開ベンチマークのスコア)を与えると、大量の文章で訓練された言語モデル(LLM)が解法のソフトウェアを書き、探索木でその変種を系統的に試し、スコアが上がる方向へ解を育てていく1。人間が手法を一つ設計して論文にする代わりに、機械が指標に対して解法群を最適化する。

成果は二つの領域で具体的だ。単一細胞解析では、既存の公開リーダーボードで、人間の最良手法を上回る新手法を40件作った1。ただし内訳は、既存手法の再結合が29件で最多、基本手法の ERA 実装が6件、Deep Research由来4件、AI co-scientist由来1件である。約7割は「新しい手法の発明」ではなく既発表手法の組み替えだ。最高解(BBKNN の ERA 実装)は数え上げでは基本手法側だが、原典は伸びの一部が ComBat との組み合わせから来たと注記している。効果量も、最良既発表手法(ComBat)比で総合スコア+14%にとどまる。疫学では、COVID-19 入院予測で CDC(米疾病対策センター)の集団予測(アンサンブル)と個別モデルの全てを上回る14モデルを作った1。ただしこちらは単一細胞側と射程が違う。14件が出たのは3参照日ぶん(3参照日 × 4予測地平 × 52管轄)の評価区間についてで、内訳は再結合10・Deep Research 2・AI co-scientist 1、残る1件は他チームの公開手法を複製したベースラインだ。しかも後ろ向き(retrospective)の検証である。著者ら自身、「2025年5月1日時点で入手できるデータをレトロスペクティブな季節全体に使っており、予測日時点で入手できたデータとの潜在的な差は無視している」と断っている1。改訂後の確定値で振り返る評価と、当時の速報値のまま走った予測とを、同じ土俵とは呼べない。なお疫学側の主実験は別にある。同じ後ろ向きの設定で、予測期間ごとに直前6週のデータで ERA を走らせ直してモデルを選び、2024〜25年シーズンを通して週ごとに評価すると、その結果(Google Retrospective)は平均 WIS(加重区間スコア。低いほど良い)26 で CDC アンサンブルの 29 を上回り、参加チームを含む表の首位に立つ1。もっとも、同じ Google Retrospective は、14件を数えた3週間の区間ではアンサンブルに届いていない。それでも、「AIがそれっぽい提案をした」ではなく既存の物差しの上で数値を出したという点は新しい。2026年5月に Nature がオンライン公開した、査読を経た仕事である1。

この「LLM+探索+自動検証」という型は、ERA 単独の現象ではない。ただし次に挙げるのは同じ Google 内の別プロジェクトで、外部からの裏づけではない。しかもその報告は、原文が自ら「ホワイトペーパー」と名乗る査読前のものだ。DeepMind の AlphaEvolve は、検証器つきの進化的探索でコードを反復改良し、4×4 複素行列の積を48回の掛け算で行う手法を見つけた。これはStrassen(1969)以来56年ぶりのこの設定の記録更新である2。あわせて Google のデータセンター運用・チップ設計・AI 訓練の効率も実地で改善したと報告する。採点・検証できる問いを機械に探索させると、人間の最良を実際に数値で超える解が出うる。一方で ERA 論文自身は AlphaEvolve を「精神において近い」としつつ、科学の問題に要るアイデアの探索を持たない点を自分との差として挙げている1。

なぜ効くのか、どこまでか

効く理由と限界は、主に採点できる指標があることから来る。指標がはっきりしていれば、「より良い解法を書く」は探索で解ける最適化問題になり、機械は人間より広く探せる。逆に言えば、課題の設定と「良さ」の定義は人間が与える。ERA は問いを立てるわけでも、物差しを選ぶわけでもない。探索に注ぎ込む研究アイデア(論文の要約や文献検索の結果)も外から与えられ、原典は、専門家水準の結果が出るのはそうした外部のアイデアを探索して取り込んだときだと書いている1。

だから、これは「手法開発という研究職能の中核が、採点関数の最適化に還元された」という話ではない。むしろ、採点関数に落とせる部分、すなわち手法エンジニアリング、モデル選択、パイプラインの作り込みが機械側に寄り、人間の仕事が何を問うか・何を良しとするかへ移る、という再配置だ。同じ方向の動きは他にもある。Nature 級の論文が報告した最高性能(SOTA)に、コーディングエージェントがどこまで届くかを測るベンチマーク(NatureBench)も登場している。もっともそこでは、最強モデルでも公開SOTAを超えられたのは90タスク中17.8%にとどまり、並ぶところまで数えても47.8%で半分に届かない3。ただし両者は与えられた情報の条件が異なる点に注意がいる。NatureBench はウェブ検索を厳格に禁じた条件下の数字で、ERA のほうは単一細胞側の実験で、改良対象に選んだ9手法について論文を Gemini 2.5 Pro に要約させ、プロンプトに入れたのはその要約である。もっとも NatureBench 論文は、失敗がどの層で起きたかも示している。数えている母集団は、10エージェント・900走行のうち、同等(Match-SOTA)に届かなかったか有効なスコアを欠いた側で、全体の67.8%にあたる。手法の層が61.1%(うち手法選択の誤りが45.1%)、実行の層が28.7%(うち計算資源や時間の不足が24.4%)で、課題の理解の層は3.1%・戦略の層は7.0%にとどまる。17.8%という低さを情報の制約だけに帰することはできない。ただしこれは本稿の読みであり、同論文はウェブ検索の禁止を近道の防止として説明しており、低さの原因として論じてはいない。いずれにせよ、「AIが実証研究のソフトを書く」能力を正面から評価する試みは ERA の外側にもある。NatureBench 自身の整理では、論文の再現を測る系統(PaperBench など)と、Kaggle 課題で性能を最適化させる系統(MLE-bench など)が先行し、NatureBench は論文由来の課題で公開SOTA超えを測る位置に自分を置いている3。

「採点できる」ことの裏側

もっとも、指標を上げることと、科学として正しいことは同じではない。機械が物差しを最適化するほど、物差しの穴が結果を汚す危険も増す。Kapoor と Narayanan は、機械学習を用いた科学の広範な再現性の破綻を調べた。データリーク(本来使えない情報の混入)が 17分野・294本の論文に及び、時に結論を丸ごと覆すという4。内戦予測では、複雑なMLが従来手法に勝つと主張した論文がリークのせいで軒並み再現せず、数十年前のロジスティック回帰と実質差が無かった。ERA が競う公開リーダーボードも、この落とし穴と無縁ではない。「採点できる」問いは自動化しやすい反面、その採点自体が抜け道だらけなら、勝ってもそれは指標の穴を突いただけになる。

もう一つは、“正解”の内実だ。ある研究は、Correct Answer, Wrong Mechanism と呼ぶ現象を粒子識別の模擬課題で観測した5。AIエージェントが正しいスコアに達しながら、その根拠づけ(メカニズム)は自分の出したデータと矛盾するという現象である。著者は、シミュレーションに基づく発見という設定では、これらのエージェントは信頼できるコーディング道具ではあっても、開かれた主張を担う科学の共著者としては当てにならないと結論づけている。ただしこれは単著の position paper で、ICML 2026 の AI for Science ワークショップに Spotlight 採択とはいえ non-archival(査読誌・本会議には未収録)、観測された発生率も主要モデルで4/20、追加2モデルの横断調査で3/8である。合わせて28件中7件という規模の話である5。ERA の「人間最良を超えた」も指標の上での勝利であって、その先の一般化と機構の妥当性は別に検証がいる。Correct Answer, Wrong Mechanism の著者も、AI が出した一般化の主張は、別の条件で確かめるまで人間の側が暫定として扱うべきだとしている5。

実務で何が変わるか

採点できる仕事と、採点の型にそもそも落ちない仕事。今回の結果が引くのは、その境目の線だ。


出典5件
  1. “An AI system to help scientists write expert-level empirical software”(Nature, 2026年5月オンライン公開, s41586-026-10658-6)。Google Research と Google DeepMind が MIT・ハーバードなどの研究者と開発した ERA(Empirical Research Assistance)=LLM+探索木で品質指標を最大化する科学ソフトを生成。単一細胞解析で人間最良を上回る新手法を40件(公開リーダーボード)、COVID-19 入院予測で CDC アンサンブルと全個別モデルを上回るモデルを14件。後者は図3eによれば「3参照日 × 4予測地平 × 52管轄」の3週間ぶんの評価区間についての話で、14件の内訳は再結合10・Deep Research 2・AI co-scientist 1・複製ベースライン1。同じ後ろ向き設定で、予測期間ごとに直前6週のデータで ERA が選び直したモデルをシーズン全体で週ごとに評価した結果(Google Retrospective)は平均 WIS 26 で CDC アンサンブルの 29 を上回る(図3a・3b)。なお著者42名の所属は Google Research が最多で、Google DeepMind は6名、大学側も MIT・ハーバードのほか McGill・Caltech を含む。https://www.nature.com/articles/s41586-026-10658-6 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11

  2. Google DeepMind, “AlphaEvolve: A Coding Agent for Scientific and Algorithmic Discovery”(arXiv:2506.13131, 2025年6月公開)。Gemini+進化的探索+自動評価器(検証)で、コード/アルゴリズムを反復改良。4×4 複素行列の積を48回の掛け算で行う手法を発見し、Strassen(1969)以来56年ぶりにこの設定の記録を更新。あわせて Google のデータセンター運用・チップ設計・AI 訓練の効率を実地で改善したと報告。ERA と同じ「LLM+探索+検証」型が、検証できる問いで人間最良を超えることを示す一次報告である。ただし ERA と同じ Google の仕事であり(AlphaEvolve は Google DeepMind、ERA は Google Research が主体)、しかも原文が自ら “In this white paper” と名乗る査読前のホワイトペーパーで、ERA 論文自身が関連研究(ref.14)として引用している。別組織による独立の裏づけではない。https://arxiv.org/abs/2506.13131 ↩

  3. 同じ「AIが実証研究のソフトを書く」能力を測る独立の動きの例として、“NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?”(arXiv:2606.24530。査読前のプレプリントである。v2 で GLM-5.2 と MiniMax-M3 の結果を追加)がある。Nature 系論文の到達点にコーディングエージェントがどこまで届くかを評価するベンチマーク。結果は本記事の主張への反証側でもある。ウェブ検索を厳格に禁じた条件(strict web-search-disabled protocol)で12のエージェント構成を評価し、90タスクで、最強モデル(Claude Opus 4.7)でも公開SOTAを上回れたのは17.8%(効果量 g>0.1 基準)、並んだのを含めても47.8%にとどまり、しかも成功の多くは科学課題を馴染みのある教師あり予測問題へ読み替えたことによる、と論文は述べる。ERA が単一細胞側で改良対象の9手法について論文の要約をプロンプトに与えられていたのとは条件が異なる。https://arxiv.org/abs/2606.24530 ↩ ↩2

  4. Sayash Kapoor, Arvind Narayanan, “Leakage and the reproducibility crisis in machine-learning-based science”(Patterns 4(9):100804, 2023)。機械学習を用いた科学で、データリーク(訓練に使えない情報の混入)が17分野・294本の論文に及び、時に「複雑なMLが従来手法に勝つ」という結論を丸ごと覆すと報告。内戦予測の再現研究では、ML優位を主張した論文がリークのせいで軒並み再現せず、数十年前のロジスティック回帰と実質差が無かった=採点指標を最適化しても、指標に抜け道があれば一般化しない側の一次証拠(査読付き)。なお査読前版(arXiv:2207.07048)は同じ箇所を「errors が17分野・329本に及ぶ」と書いており、本数も母集団の語も査読で変わっている。https://doi.org/10.1016/j.patter.2023.100804 ↩

  5. Steven Young Eulig, “Position: Correct Answer, Wrong Mechanism — When AI Scientists Defend General Claims Their Own Data Contradicts”(arXiv:2606.23175, 2026年6月22日公開)。粒子識別の模擬課題28エピソードで、AIコーディングエージェントが正しいスコアに達しながら根拠づけ(メカニズム)は自分の出力と矛盾する現象(Correct Answer, Wrong Mechanism)を観測(主要20件中4件・クロスモデル8件中3件)。「シミュレーションに基づく発見という設定では、信頼できるコーディング道具ではあるが、開かれた主張を担う科学の共著者としては当てにならない」と結論。単著の position paper で、ICML 2026 の AI for Science ワークショップに Spotlight として採択(ただし non-archival=会議録には未収録)。シミュレーション出力・プロンプト・検証スクリプトは公開されているが、第三者による独立再現は本稿執筆時点で未確認。著者はハーバード大学物理学科・LPPC 所属で、本論文の被引用は本稿執筆時点で0件(OpenAlex)。https://arxiv.org/abs/2606.23175 ↩ ↩2 ↩3

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。