AI・信頼性・評価
AIの成果物を任せるには、モデルの外側を設計する
目次
AIに記事の下書きを書かせると、主張には出典がつき、注も整い、一読すると直すところが見当たらない。同じ測定は、引かれた文献がどれも話題に少なくとも広く関連し、93%が一般向けではなく学術的な文献だったとも報告している1。ところが引用元を一本ずつ開いて確かめると、当の文献がそもそも存在しない、ということがある。2023年4月の測定では、GPT-3.5 が生成した参考文献の55%、GPT-4 でも18%が実在しなかった。実在した文献への引用にも、著者名・表題・年・巻号頁といった書誌の実質的な誤りがそれぞれ43%・24%あった(42トピック・84本・636件の参考文献)1。この測定が数えたのは参考文献の実在と書誌の正しさで、本文が「その論文はこう述べている」と書いた内容が当の論文には見当たらない——という型は対象外だ。原典自身、本文中の虚偽の記述を体系的に検出しようとはしていないと断っている。
AIに何かを頼むと、最初に返ってくるものは、たいてい驚くほど整っている。体裁の良い文章、それらしいコード、よどみのない説明。問題はそのあとだ。本当に使おうとした瞬間から、細かい綻びが見えはじめる。事実が一つずれている。前提が黙って入れ替わっている。指示したはずの条件が、いつのまにか抜けている。綻びは例外ではない。2021年に、MITRE Top 25 由来の54シナリオを中心に、SQLインジェクションの言い換え17とVerilogのハードウェア弱点18を加えた計89のシナリオでコードを生成させたところ、1,689本のうち約4割が既知の脆弱性を含んでいたと報告されている2。候補を最上位の一本に絞っても割合はほとんど変わらない(89シナリオ中35本=39.33%)2。もっともらしい出力ほど、渡す前の検査を素通りしやすい。
「作らせる」ことは、もう難しくない。生成側の価値は小さくない。2022年5月から6月、Copilot の一般提供が始まる直前に、Copilot を提供する GitHub と親会社 Microsoft Research の研究者3人に、MIT Sloan の研究者1人を加えた4人が対照実験を行っている(公表は2023年)。Upwork で募集した専門プログラマ95人を無作為に分け、JavaScript で HTTP サーバを実装させる単発の課題で、Copilot を与えられた側が55.8%速く終えたと報告されている(95%信頼区間は21〜89%と広い)3。ただしこれは課題を完遂できた人——両群それぞれ35人——に限った比較で、同じ論文は成功率そのものの差(+7ポイント)は統計的に有意でなかったとも報告している。道具の側にも実例がある。ターミナルで動くコーディング・エージェントのAiderは、各リリースの新規コードのおよそ7割を自分自身に書かせている、と作者が公表している(変更履歴が割合を載せている47版では中央値66%、範囲は0〜93%)——本人の申告で、こちらでコミットを数え直してはいない4。だが速く出てくることと、安心して次へ渡せることは別の話だ。難しいのは、返ってきたものを、その状態にすることのほうだ。手元でとりあえず動くことと、検証なしでそれに頼れると言い切れることのあいだには、はっきりした距離がある。この距離を詰める作業こそ、ここで扱う主題だ。
手がかかるのはモデルの外側——検証と設計
モデルは速く伸びている。AIが五分五分の確率で完遂できるソフトウェアタスクの長さは、2019年以降おおよそ7か月ごとに倍になってきたという計測がある。原典は「2024年以降その傾向は加速したかもしれない」と留保つきで添えており、2024年以降に区切った推定では倍化の周期は約3か月まで縮む5。だが、この、出典の合っていない下書きをまともにするのに要るのは、次に来るより賢いモデルではない。「引用元を実際に開いて、本文の主張と一つずつ照合する」という手間だ。むしろ話は逆で、任せられる範囲が広がるほど、その成果を確かめる負荷はこちら側に積み上がる。書かせる前の段取りと、渡す前の検査。手がかかる場所は、モデルが賢くなっても消えず、たいていこちら側に残る。
この、AIにより大きく頼るための外側の仕組みを、この連載ではハーネスと呼ぶ。登山のハーネスが「落ちないための拘束具」である以上に、「確保されているからこそ、より難しい一手に踏み込める道具」であるのと同じだ。防御が目的ではない。安心して手放せる量を増やすための投資である。
モデルの外側だけを作って配る仕事は、すでに一つの層をなしている。ECC(Everything Claude Code)は自らを「エージェント・ハーネスの性能最適化システム」と名乗る。道具を呼ぶ前と後、そしてエージェントが手を止めようとしたときに発火する50本のフック実装(hooks.json の配線口は21で、うち2口はさらに20本へ振り分けるディスパッチャになっている)と、21のスタック向けの規約(共通層を合わせて122ファイル)とを、コーディング・エージェントに向けて配っている6。規約は常に従うべき指針として置かれ、共通ぶんと自分が使うスタックのぶんだけを選んで入れる。同じ層には、Anthropicの公式プラグイン市場にも載っているsuperpowersのように、作業の進め方を14の技能書・本体だけで合計3,207行(参照文書まで含めると37ファイル・7,054行)の散文として束ねて配るものもある——いずれも v5.1.0 時点の実測だ7。どちらもモデルを一行も学習させない。中身はすべて、モデルに頼む前と、返ってきたあとの話だ。規模も小さくはなく、両者ともGitHubの星は20万台に達している。ただし星が数えているのは注目であって稼働ではない。superpowers については、Anthropicの掲載ページが導入数を1,009,371件と公表している(2026年8月23日時点)7。ECCは公式市場に載っておらず、比べられる導入数がない——npmのパッケージは週間数千件だが、プラグイン経由の導入はそこに計上されない6。ここで数えたいのは利用者の頭数ではなく、モデルを一つも含まない層に、これだけの作り込みが積み上がっているという事実のほうだ。
ハーネスという語が指す範囲は、使う人によって違う。文脈の組み立てまで含めて呼ぶ人もいれば、事後の検査だけを思い浮かべる人もいる。この連載では、二つの側を両方とも数える。ひとつは渡す前の制御——どこまでやれば完了か(DoD)、スコープの外はどこか、前提と文脈を、生成させる前に決めて渡す。出力が生まれる前に形を与える側だ。もうひとつは受け取ったあとの締め——検証し、必要ならやり直す。先に挙げたフックにも、道具の実行前に発火するものと実行後に発火するものが両方ある——粒度は違うが、前で形を与え後ろで締めるという構えは同じだ。検証・レビュー・手順・道具は、その手段にすぎない。返ってきたものを任せられるものにできるかは、たいていこの設計で決まる——そしてハーネスが効くほど、人はAIにより大きく頼れるようになる。
フックと規約は、同じ配布物の中で別々のディレクトリに分かれている。フックはコードで止め、規約は言葉で頼む。縛る力の違うものが、一つの箱の中に同居しているわけだ。この違いに名前をつけ、どの仕事をどちらへ渡すかを決めるところから、次の回が始まる。
宿題を一つ置いておく。速いが間違えるものを、信頼して渡せる成果に変える——この課題は、AIとともに生まれたものだろうか。分業も、レビューも、品質管理も、形の似た問題をずっと扱ってきた。だとすれば要るのは新しい作法ではなく、すでにあるものの翻訳かもしれない。ただし、翻訳では届かない場所もたぶんある。どちらなのかは気分で決められることではないので、連載の最後の回に、見分けるための手順として戻ってくる。
見るべきは、モデルの性能ではなく、このハーネスの作り方だ。速く出させることは、もう出発点にすぎない。学ぶべきは、返ってきたものを検証し、渡す前に設計する——その勘所を自分の手で組めるようになることだ。次に来る賢いモデルを待つのではなく、その組み方を一つずつ身につけることが、AIにより大きく、安心して頼るための足場になる。
出典7件
-
W. H. Walters & E. I. Wilder, “Fabrication and errors in the bibliographic citations generated by ChatGPT,” Scientific Reports, vol. 13, 14045 (2023). 42トピックについて ChatGPT-3.5 と ChatGPT-4 に、米国の大学1年次作文で求められる程度の2000語の文献レビューを書かせ(生成は2023年4月第1週)、84本に現れた636件の参考文献を照合。GPT-3.5 の55%(222件中)、GPT-4 の18%(414件中)が実在しない文献で、実在した文献への引用のうちも GPT-3.5 で43%(101件中)・GPT-4 で24%(340件中)に書誌情報の実質的な誤り(著者名・表題・年・巻号頁・出版社など)があった。測っているのは参考文献の実在と書誌の正しさであって、実在する論文の内容を取り違える型ではない——本文中の誤情報については原典が
we made no systematic attempt to detect false statementsと自ら範囲を切り、明らかに誤った断定が両世代とも出続けている旨をざっと読んだ限りの付記にとどめている。世代で大きく下がるが消えてはいない。ただし測ったのは GPT-3.5 と GPT-4 の2世代で、以降の世代の割合を述べたものではない。もっともらしさと正しさは別で、出力の検証こそが要という裏づけ。 https://doi.org/10.1038/s41598-023-41032-5 ↩ ↩2 -
H. Pearce, B. Ahmad, B. Tan, B. Dolan-Gavitt & R. Karri, “Asleep at the Keyboard? Assessing the Security of GitHub Copilot’s Code Contributions,” IEEE Symposium on Security and Privacy (2022). MITRE Top 25 由来の54シナリオ、CWE-89(SQLインジェクション)のプロンプト変種17、Verilog のハードウェア CWE 18 の計89シナリオから生成された1,689本のうち、約4割が既知の脆弱性を含み(脆弱性が出やすいよう作った課題集合である点は割り引いて読む必要がある)、もっともらしい出力ほど渡す前の検査が要ると示す。原典は最上位候補だけの脆弱率も39.33%と別に集計し、
The security of the top options are particularly important—novice users may have more confidence to accept the 'best' suggestionと述べている。測定は当時のモデルに対するもので、現行世代の割合を述べたものではない。 https://doi.org/10.1109/SP46214.2022.9833571 ↩ ↩2 -
S. Peng, E. Kalliamvakou, P. Cihon & M. Demirer, “The Impact of AI on Developer Productivity: Evidence from GitHub Copilot,” arXiv:2302.06590 (2023). 実験期間は逐語で
The experiment began on May 15, 2022 and ended on June 20, 2022, right before GitHub Copilot became generally available——2023年は公表年であって実施年ではなく、測られているのは一般提供前・Codex 世代の Copilot である。Upwork で募集した専門プログラマ95人を無作為に2群へ分け、JavaScript で HTTP サーバを実装させた単発のグリーンフィールド課題。Copilot 利用群は55.8%高速(95%信頼区間21〜89%)。著者4人のうち3人が Copilot の提供元(Microsoft Research・GitHub Inc.)に所属する、提供元自身による測定である点と、単発のラボ課題である点は割り引いて読む必要がある。なお原典自身が、測ったのは速度だけだと断っている——this study does not examine the effects of AI on code qualityとし、品質は性能とセキュリティの考慮を含み AI の実世界での影響を変えうると付記している。「作らせる」こと自体の価値は大きい、というAIに有利な一次証拠。だからこそ本稿は、価値の重心が「作らせたあと」に移ると論じる。 https://arxiv.org/abs/2302.06590 ↩ -
Aider(オープンソースのターミナル型コーディング・エージェント)公式FAQおよび変更履歴(2026年7月26日参照。2026年8月20日に再取得し、引用箇所と集計値は同一だった)。FAQは「aiderは自分のコードの多くを書いており、通常は各リリースの新規コードの約70%にあたる」と述べる。同じFAQがこの割合の定義も置いていて、git blame 相当でリリースごとの新規行の書き手を数えたもので、ソースコードのファイルの行だけを数え、文書やプロンプトのファイルは含まない。変更履歴には版ごとの実測が47件(46リリースと開発中の main)並び、中央値66%・平均64%、最大93%・最小0%と幅は広い。ただし0%と93%はいずれもパッチリリース(v0.76.1・v0.79.2)で、v0.76.1 は外部の寄稿者による一項目だけの修正版である。節目のリリース43版に限ると範囲は21〜92%、中央値は66%で変わらない。変更履歴には170版の見出しが並ぶが、割合が書かれているのは47版である(9割を超える版が3つある一方、5割を下回る版も8つある。変更履歴の冒頭は「通常70〜80%」と書く)。作者による申告であり、本稿はコミット履歴を数え直していない。生成側が実務の中で相当量を担えているというAIに有利な側だが、版によって大きく振れる点は割り引いて読む必要がある。 https://aider.chat/docs/faq.html https://aider.chat/HISTORY.html ↩
-
T. Kwa, B. West, J. Becker, et al. (METR), “Measuring AI Ability to Complete Long Software Tasks,” arXiv:2503.14499v4(2026年7月10日改訂。初版は2025年3月). 指標は50%-time horizon=成功率50%で完遂できるソフトウェアタスクの長さ(人間専門家換算)であって、確実にこなせる長さではない。それが倍々で伸びている。ただし加速したのは通算の周期ではない——METR の2026年改訂(Time Horizon 1.1, 2026-01-29)でも2019〜2025年通算の倍化周期は195.8日→196.5日とほぼ不変で、METR 自身が「TH1 のトレンドと厳密に同じ倍化時間」と述べている。速い数字が出るのは直近の区間に限った推定のほうで、2023年以降が165.3日→130.8日(約4.3か月)、2024年以降が108.9日→88.6日(約3か月)。区間を書かずに「約7か月から約4.3か月へ」と並べると、分母の違う二つを畳んで加速に見せることになる——生成側の能力が着実に伸びているのはAIに有利な観測だが、その伸び方は区間の但し書きとセットでしか読めない。原典自身も外的妥当性の節で、現実のタスクは自動採点をほとんど持たず、他のエージェントや資源制約や高い信頼性要求を伴うと述べている。そのうえで
Such differences cast doubt on whether the rapid performance improvements seen on this task suite (and other benchmarks) will generalizeと書いている。伸びるほど、検証と受け渡しの設計が追いつくかが問われる。 https://arxiv.org/abs/2503.14499 https://metr.org/blog/2026-1-29-time-horizon-1-1/ ↩ -
affaan-m/ECC(“Everything Claude Code”)のリポジトリ実体とGitHub API(2026年7月27日取得)。数えたのは参照日時点の最新コミット
6a9f075(2026年7月26日)で、scripts/hooks/直下のファイル数、hooks/hooks.jsonの hook エントリ数、rules/配下のファイル数と直下ディレクトリ数を数えた。自らを “The agent harness performance optimization system” と記述する。scripts/hooks/に50本のフック実装(うちhooks/hooks.jsonで実際に配線されているのは21箇所。21口のうち2口はpre-bash-dispatcher.jsとposttooluse-dispatcher.jsで、この2本がそれぞれ10本ずつのフックを自分の中で宣言して振り分ける。50本のうち21口から到達できるのは38本である)、rules/に122ファイル(うち1本は構造を説明するREADME.mdで、規約そのものは121本)を持つ。規約はrules/直下の22ディレクトリに分かれており、うちcommon/は README がLanguage-agnostic principles (always install)と定義する共通層なので、スタック別は21である。README は共通ぶんと実際に使うスタックのぶんだけを選んで導入するよう指示しているので、122すべてを入れるわけではない。hooks/hooks.jsonは発火点として道具の実行前・実行後・エージェントの停止・セッション開始などを定義する。星は233,714、フォークは35,623。一方でnpmに公開されたパッケージの週間ダウンロードは2026年7月18〜24日の週でecc-universalが3,477件、ecc-agentshieldが7,765件だった。ただし週あたりの流量と、開設以来の累計である星の数とを並べても比べたことにならない。リポジトリ開設日の2026年1月18日から2026年8月22日までの累計は、両パッケージ合計で200,645件(ecc-universal69,148件、ecc-agentshield131,497件)である。プラグイン配布経路からの導入はnpmに計上されないため、いずれも稼働数そのものではない(プラグイン配布経路からの導入はnpmに計上されないため、これも稼働数そのものではない)。モデル単体では足りず、外側の作り込みが要ることを示すAIに不利な側。 https://github.com/affaan-m/ECC ↩ ↩2 -
obra/superpowers v5.1.0(2026年5月4日リリース)の配布実体を原文で確認、星とフォークは2026年7月27日にGitHub APIで取得。Anthropicの公式プラグイン市場から導入できる旨は、リポジトリ直下の
README.mdに記載がある。skills/配下の14スキルは SKILL.md 本体だけで合計3,207行、参照文書まで含めると37ファイル・7,054行に及ぶ。星は261,657、フォークは23,364。作者はJesse Vincent。上流の更新は速く、同じ数え方でも2026年8月12日の v6.3.0 では39ファイル・7,539行(SKILL.md 本体は14スキルで3,377行)になる。本文が挙げた行数は v5.1.0 のもので、脚注末尾のリンクも同じ v5.1.0 のツリーを指す。Anthropicの掲載ページ(https://claude.com/plugins/superpowers)はMade by Jesse VincentとInstalls 1009371を表示する(2026年8月23日取得)。生きたページなので値は動く。文書の側だけでこれだけの分量が積み上がること自体が、モデルの外側に仕事が残ることを示すAIに不利な側。 https://github.com/obra/superpowers/tree/v5.1.0 ↩ ↩2
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。