In Silico

AI・信頼性・評価

AI査読の2研究が測る、第一次選別の精度と操作への脆さ

2026/7/7 (更新: 2026/10/4)

  • AI査読
  • 査読
  • LLM
  • AIPR
  • ICLR
  • AUROC
  • 第一次選別
  • 反論
  • 隠しプロンプト
  • GPT-5.4
  • Gemini 2.5
  • GPT 5.1
  • AAAI 2026
  • ICML
  • 権威づけ
  • ハーネス
  • 信頼性
  • 頑健さ
  • Nikkei Asia
  • Web of Science
  • 利益相反
  • 事前登録
  • 標準偏差
  • 文脈汚染
  • トリアージ
目次
背景・問い・要点
背景

研究者が論文を書き上げても、それはそのまま世に出るわけではない。同じ分野の別の研究者が数名、原稿を読み、方法に穴がないか、結論が結果から言えるかを見て、載せてよいか差し戻すかの意見を返す。これが査読である。報酬は出ない。研究者は自分の研究の合間に、他人の原稿を無償で読む。この持ち回りが、何を科学の知見として通すかを決める門になっている。

その査読の引き受け手が、足りなくなってきた。投稿は増え続ける一方で、読める人の数は増えない。締切までに引き受け手が集まらず、集まっても一人あたりの負担が重くなる。負担が重くなれば、一本にかけられる時間は短くなる。学会や学術誌の運営側から見れば、これは「誰に読ませるか」の調達が詰まっている状態である。

そこに、文章を読んで書けるAIが入り始めた。人間の査読者を待つ列の手前に機械を置き、明らかに弱そうな原稿に印を付けて、人がどの原稿から目を通すかの優先順を決める。この工程を第一次の選別と呼ぶ。ただし査読は、通す・落とすを決める門であるだけでなく、通したい側から見れば働きかける相手でもある。弱い原稿を見分けることと、働きかけに揺さぶられないことは、同じ量ではない。

問い

AIによる査読を、どこまで任せてよいのか。弱い原稿を見分ける精度と、揺さぶりへの強さのそれぞれを、2026年に出た独立2研究の測定で確かめる。

要点

任せてよいのは、弱そうな原稿に印を付けて人の再確認へ回す第一次の選別までだ。最終の採否はまだ任せられない。足りないのは賢さではなく、揺さぶりへの強さのほうである。 精度の側では、AIの総合スコアが却下と採択をおおむね切り分け、スコアが最低の五分の一に入った原稿の約9割は、実際の採否も却下だった1。揺さぶりへの強さの側では、証拠を一切足さない自信満々の反論をひとつ置くだけで評点は平均+0.53点上がり、8割超の論文でスコアが上昇した。下がった論文は一本も無い2。この揺れがモデルそのものの傾向から来るのか、防御を足していない素のレフェリー構成から来るのかは、この測定では切り分けられていない(採否そのものの反転も、原典は報告していない)。

モデル・例示

選別の精度と、揺さぶりへの強さは別々に測る

※ この節の数値は説明のための仮定で、測定値ではありません。

投稿を1,000本受け付ける学会を考える。最終的に700本が却下され、300本が採択されるとする。AIが各原稿に0〜100の点を付け、点の低い200本に印を付けて、人がその200本から先に読む。印の付いた200本のうち180本が実際に却下される原稿なら、印の当たる割合は9割である。

同じAIに、著者が新しい根拠を何も足さず「この評価は誤りだ」と一文で反論したとする。反論を受けるたびに点が数点ずつ上がるなら、印の境目の近くにいた原稿は、中身が同じまま印から外れていく。9割という当たりの割合は反論の無い原稿で測った量で、反論でどれだけ点が動くかを教えない。

印の当たり方と反論への動き方を分けて書けば、二点にまとまる。

  1. 選別の精度は、印を付けた原稿のうち本当に弱い原稿が占める割合で測れる。
  2. 揺さぶりへの強さは、同じ原稿に働きかけを加えたときの点の動きで測る。精度が高くても、点が動けば印を付ける原稿は入れ替わる。

科学の査読は、もう回らない

Web of Science は2024年だけで約253万件を収録した2。ある推計では、研究者が2020年の1年間に費やした無償の査読労働は約1億時間にのぼる2。この負荷ギャップを埋める手として、AIが「要約する・事実確認する・体裁を整える」補助から、やがて「読んで・評価して・判定する」レフェリーへと役割を広げつつある。象徴的なのが AAAI 2026 で、人間2名のレビューにAI生成のレビュー1本を並べる運用を導入し、2万3千件を超える投稿の第一次選別に人間・AI混成のスクリーニングを試した2。

AIは「弱い論文を見分ける」なら当たる

任せられる根拠の側から見たのが、Georgantas の研究だ。ただし原典自身が利益相反として開示しているとおり、これは採点システムの開発者本人による検証で、採点のルーブリック・プロンプト・モデル設定は公開されておらず、外部からは出力を通じてしか確かめられない1。提出された原稿を読み、5つの品質次元と加重した総合スコア(0〜100)を返す仕組み AIPR を、ICLR 2026 の投稿300件の公開された採否区分・査読評点に照らして検証した。300件は適格1万3,718件から却下150・ポスター100・口頭50を層化抽出したもので、会場の自然な採択率27.4%とは違う配分だ。採点は入れ子の二段構えで、300件すべては安価な GPT-5.4-mini に、その部分集合100件はフロンティアの GPT-5.4 にかけている。著者は仮説と閾値を採点前に事前登録し、パイプラインを凍結した。これは後出しの調整を大きく封じた設計だ(解析段階での区間推定の置き換えが2件あるが、事前宣言した合否の閾値は動かしていない、と著者は節を立てて開示している)。採否と査読が公開されたのは2026年1月、採点モデルの知識カットオフ(2025年8月)より後であり、結果を暗記していた可能性も会場選定で潰してある。

結果、総合スコアは却下と採択を AUROC 0.82(95%信頼区間 0.78〜0.87)で分離し、区分が上がるほど単調に上がった(300件・mini。フロンティア機の100件では0.87)。しかも著者は「賢さは足りている」と主張する。著者によれば、フロンティア機(GPT-5.4)に一段落のプロンプトを投げるだけでも、同じ100件で作り込んだパイプラインとほぼ同等に弁別できた(AUROC 0.80 対 0.87。差はパイプライン有利だが、事前宣言した基準には届かず p=0.09)1。ではエンジニアリングは何を足すのか。答えは信頼性だった。作り込んだ版はスコアが繰り返しでほとんどブレないのに対し、素のプロンプトは大きく振れた。同一論文内の標準偏差の中央値は 0.7 点 対 2.8 点である。ただしこれは10本の論文を2回ずつ再実行して推定した値で、ブレない値を渡すことで査読者の判断が良くなるかは、原典では測られていない1。つまり、弱い論文を第二の目に回すための第一次トリアージ信号としてなら、AIは既に「当たる」。狙った低い側での数字はさらに直接的で、300件のうちスコア最低の五分の一に絞ると、その帯の89.8%が実際に却下されており(口頭採択はその帯のわずか3.4%)、会場の自然な採択率に直した却下適合率は95.7%だった1。ただし著者は用途を厳密に絞っている。著者は採否の予測も強い論文の順位付けも主張せず、あくまで人間が最終判断を持つことを前提とする1。

この「第一次トリアージなら当たる」という向きに近い結果は、測った量は違うが、より大規模な別の分析にもある。Stanford の Liang らは、GPT-4 が生成した査読フィードバックと人間レビュアーの論点の重なりを測った。Liang らは、重なりが Nature 系で30.85%・ICLR で39.23%であり、人間同士の重なり(28.58%/35.25%)と同水準だと報告した。重なりは弱い論文でこそ大きくなるのも見てとれる。却下された ICLR 論文に限れば、GPT-4と人間の重なりは平均47.09%まで上がり(口頭採択は30.63%、スポットライトは32.12%)、人間同士の重なりも同じ向きに動く(却下論文で43.80%)3。308人の研究者への調査でも、57.4%が「有用/非常に有用」、82.4%が「少なくとも一部の人間レビュアーより有益」と答えている3。ただしこれは回答者が自分の論文への指摘を評価した主観調査で、査読の正しさを測ったものではない3。「賢さ(有用な指摘を出す力)は足りている」という側を、AIPR の開発者とは別のチームが測った研究として本稿が引くのはこの1本である。採点の弁別ではなく指摘の重なりを測っており、その独立再現もまだ確かめられていない3。

だが「賢さ」だけでは門番になれない

もう1本、Wang らの研究は同じAI査読を敵対的に叩いた2。ICLR 2025 の投稿100件(Oral/Spotlight/Poster/Reject 各25件の層化抽出)を使い、Gemini 2.5 と GPT 5.1 の2つのLLMレフェリーに、権威づけ・断定の強さ・反論での追従・文脈汚染の4種類の介入を仕込み、0〜10点の評点がどうズレるかを定量化した。採択側の層が4分の3を占める設計なので、後述の「81%」はこの母集団に対する割合である。測定が示したのは、賢さとは別の弱点である。

Wang らは、こうした評点の揺れを、原稿から著者の身元の手がかりを除いたうえで、素のLLMにそのまま採点させる構成で計測した。反論への追従を抑える設計や、敵対的な埋め込みを探す検出器を足した構成との比較は、この研究では行っていない(採否そのものの反転も報告していない)2。だから「それは実験者がハーネスを作り込めていないだけでは」という反応には、根拠がある。ハーネスとは、採点するモデルそのものではなく、その周りに置く入力の検疫・手続き・防御の構成を指す。ただし Wang ら自身は、反論への迎合をモデルの性向として書き、防御にも、モデルの設計や学習の段階で頑健さを高める手立てと、モデルの周りに検出器や除去の仕組みを置く手立ての両方を挙げている2。頑健さはモデルの賢さから自動では生じず、モデルの側と採点ハーネスの側の両方で作り込む必要がある。同じモデルでも、検疫と手続きを備えたハーネスに載せれば結果は変わりうる。

この研究群の値打ちは「AIは騙されやすい」という驚きではない。査読へのLLM利用は、すでに現実に進んでいる。AAAI 2026 は2万件超で人間・AI混成の一次選別を試行し、レフェリーのLLM利用は ICML 2025 が一律の使用禁止で応じるほど広がった2。ただし趨勢は一律禁止のままではない。ICML 2026 は二本立て方針へ移行し、Policy B では論文理解とレビューの推敲での利用を認めている(判断そのものの委譲は不可)7。しかも隠しプロンプトの埋め込みは、ICML で発表予定だった論文の取り下げ表明にまで至った4。その現実の広がりに、頑健さの作り込みと検証が追いついていない。賢さが足りていても、採点者を包む仕組みが攻撃可能なら門番は務まらない。ここが「テストで高得点」と「現場で信頼できる」の分かれ目だ。もっとも、精度の側も脆さの側も、それぞれ単一チームの単発の報告で、独立再現はまだない。


出典7件
  1. Georgantas「Intelligence Is Not the Bottleneck」arXiv 2026. https://arxiv.org/abs/2606.15887 — AIPR の運営者によるICLR 2026 の300件での自己検証。OpenAlex は著者をローザンヌ大学病院などの研究者と同定し、2026年10月4日時点で査読・被引用の記録は無い。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  2. Wang ほか「When AI reviews science: Can we trust the referee?」The Innovation Informatics, 2026. https://doi.org/10.59717/j.xinn-inform.2026.100030 — ICLR 2025 の投稿100件に2つのLLMレフェリーで4種の介入を当て、評点のずれを測った査読誌論文。https://arxiv.org/abs/2604.23593 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13

  3. Liang ほか「Can large language models provide useful feedback on research papers?」NEJM AI, 2024. https://arxiv.org/abs/2310.01783 — GPT-4 と人間の査読の論点の重なりを測った査読誌論文。却下論文の値は抄録が43.80%、本文が47.09%。 ↩ ↩2 ↩3 ↩4

  4. 「‘Positive review only’: Researchers hide AI prompts in papers」Nikkei Asia, 2025年7月1日. https://asia.nikkei.com/business/technology/artificial-intelligence/positive-review-only-researchers-hide-ai-prompts-in-papers — 14機関の17本に隠し命令があったとする一次報道。ICML で発表予定の1本は取り下げる意向と報じ、完了は報じていない。 ↩ ↩2 ↩3

  5. Lin「Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review」Communications of the ACM, 2026. https://arxiv.org/abs/2507.06185 — 原稿に隠したプロンプトによる査読の操作を4類型に整理した単著の論説。該当論文を18本と数える。 ↩

  6. ICML 2025「Reviewer Instructions」(公式ページ). https://icml.cc/Conferences/2025/ReviewerInstructions — 査読期間を2025年2月13日〜3月13日とし、査読への生成AIの利用を禁じる。 ↩

  7. ICML 2026「Policy for LLM use in reviewing」(公式ページ). https://icml.cc/Conferences/2026/LLM-Policy — 全面禁止の Policy A と、論文の理解とレビューの推敲だけを認める Policy B の二本立て。判断の委譲はどちらでも禁じる。 ↩

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。