AIエージェント
コーディングベンチマークが飽和し、評価軸は長丁場へ
目次
ソフトウェアには不具合の報告が絶えず届く。「この操作でエラーになる」という報告が上がり、開発者が原因の箇所を探し、直し、テストが通ることを確かめる。この一連の作業をAIに任せられるかを測るために、実際の開発現場に残った報告と、人が書いた修正の記録を集めて試験問題にする、という測り方が定着した。報告文だけをAIに渡し、人と同じようにテストが通る修正を出せたら合格と数える。
この物差しは、どのAIが仕事に使えるかを見るときの共通の基準になった。ところが数年のうちに、最前線のモデルはそろって高い点を取るようになった。全員が上位に集まれば、点数を並べても優劣は見えない。
一方、現場でAIに任せたいのは、必ずしも不具合を一件直す形の仕事ではない。機能を一段進める、設計を作り替えるといった、複数のファイルにまたがって長く続く仕事のほうが多い。本稿ではこの種の仕事を長丁場と呼ぶ。試験問題は短い一件を単位にしているが、任せたい仕事はそれより長い。
短い一件で高い点を取るモデルは、複数のファイルを作り替え続ける長丁場の仕事もこなせるのか。
こなせていない。短い一件なら約73%を解く世代でも、長丁場では最上位のモデルで約25%にとどまる1。 コーディングAIの実力を測る定番の物差し(SWE-bench Verified)では、最前線のモデルは75〜83%の帯に集まるようになった2。高いところに全員が張り付けば、その物差しだけでは上位を見分けにくい。そこで研究側は、1件のバグを直す短い問題ではなく、複数のファイルにまたがって作り替え続ける長丁場を測り始めた。評価の焦点が「1件直せるか」から「長く働き続けられるか」へ移りつつある。
数字:同じ世代で73%と25%
SWE-EVO は、成熟した7つのPython製オープンソースのリリースノートから課題を作った48問のベンチマークだ。1問あたり平均21ファイルに手を入れ、平均874件のテストで正否を判定する。つまり各問は、「1箇所を直す」ではなく「機能を一段進める」規模の仕事である1。
短い問題(SWE-bench Verified)で約73%に届く同世代の最前線(GPT-5.2)に対し、長丁場の SWE-EVO では、モデルを動かす足回り2種(OpenHands / SWE-agent)の平均で最上位の GPT-5.4 でも25.0%しか通らなかった1。著者らは同一モデルでの対応比較も示しており、GPT-5.2 は SWE-bench Verified の 72.80% から SWE-EVO の 22.92% へ約50ポイント落ちる(Verified 側は swebench.com の bash-only 公表値。足回りは同じ mini-SWE-agent だが、推論努力とハーネス版が揃っておらず、同名の公開値は 69.0〜72.8% に散る)。最良同士で並べた冒頭の対比(72.8% 対 25.0%)でも約48ポイントで、どちらの並べ方でも差は縮まらない。著者らはこの落差を「持続的な複数ファイル推論で現行エージェントが苦戦する」ことの表れと位置づけ、○×だけでなく途中までの進捗を拾う「Fix Rate」という指標も導入している1。比較対象の SWE-bench では、正解パッチが触るファイルは平均 1.7、テストは平均 120.8 件だ1。
なぜ短い問題では差がつかなくなったのか
SWE-bench Verified は、実在の課題報告(GitHub の issue)1件に対する修正パッチを当てられるかを測る500問だ。設計として孤立した1件を切り出しているため、最前線のモデルの点数は上限に近づいてきた。加えて、この物差しは足回り(scaffold)に敏感で、モデルを変えず、足回りと推論時の計算の積み方を変えるだけでスコアが数ポイント動く。Anthropic が “high compute” と呼ぶ構成は、複数回の並列試行を可視リグレッションテストで絞り、スコアリングモデルで選ぶ。この構成では、同一の489問サブセット上でスコアが 63.7% から 70.3% へ動いた(Anthropic の自己申告値)2。構成次第で順位が入れ替わるのだから、単体の数字で上位の優劣は語りにくい。なお足回りへの敏感さは長丁場側も同じで、SWE-EVO では glm-4p7 が OpenHands の 4.17% から SWE-agent の 39.58% へ動き、首位のモデルが入れ替わる1。独立の測定も同じ向きを示す。HAL は9モデル×9ベンチマークの 21,730 走行で、推論努力を上げると過半の走行で正答率が下がると報告している3。
なお「飽和」は全員の合意事項ではない。元の SWE-bench の著者らは、8割前後では飽和と呼べず伸びしろはまだ残っているという立場を公にしている4。飽和を疑う理由は、点数の絶対値よりも次に見る汚染のほうにある。
さらに、その高得点自体が実力を過大評価している疑いもある。課題は公開GitHubの実課題に由来するため、モデルが訓練中に答えを見ている可能性がある。ある独立の監査では、SWE-bench Verified の評価が合格と判定した112件のパッチのうち37件(約33%)で、課題報告本文かそのコメント欄に修正そのものが露出しており、不正確・不完全な修正を併せて疑わしいものを除くと解決率は22.4%から10.0%へ落ちた5。ただしこの数字は2024年時点の SWE-agent + GPT-4 という単一構成で測ったものであり、いまの8割前後がそのまま同じ比率で落ちることを意味しない。OpenAI も2026年2月、各社が課題IDだけから正解をほぼ再現できる汚染を主因に、SWE-bench Verified を自社評価から外すと表明した(あわせて、問題ありとして精査した138問の約6割(59.4%)に、テスト設計か問題文の重大な欠陥があるとも指摘している)4。飽和に見える天井の一部は、“解けた”のではなく”覚えていた”のかもしれない。ベンチマークが嘘をつく構図は、コーディングの定番にも及ぶ。
飽和そのものは失敗ではない。むしろ「短い問題はおおむね解けるようになった」という到達点だ。問題は、その数字がもう実務での使い勝手を予言しないことにある。
評価の焦点が動いている
これは一本の論文の主張にとどまらない。SWE-EVO のほかにも、より長く・より難しい仕事を測ろうとする独立の試みが相次いでいる。複数ファイル・長時間の課題に寄せた SWE-bench Pro、コマンドライン上の長丁場作業を測る Terminal-Bench(本稿執筆時点の公式リーダーボードは 4.0)、などだ。測る対象そのものではなく評価の土台を組み直す動き(Holistic Agent Leaderboard)も並行している3。ただしこの SWE-bench Pro については、OpenAI が2026年7月に公開731問を監査して約3割が壊れていると結論し、自らの推奨を撤回している4。しかも Pro は品質問題以前に、その公開731問で最前線モデルの通過率が8か月で 23.3% から 80.3% へ上がっていた4。評価の向きは揃っていても、物差しの作り直しが一度で決まるわけではない。作り手も狙う軸もばらばらな複数のグループが、そろって「孤立した1件」から「持続する仕事」へ物差しを寄せている。
実務で何が変わるか
読み手が最前線の道具を選ぶ側なら、変化は三つに落ちる。
- SWE-bench Verified の一点だけで並べない。 上位は飽和し、足回り次第で順位が動く2。単体の数字は「下限を割っていないか」の確認には使えても、上位モデルの優劣判定には向かなくなった。
- 長丁場の数字を見にいく。 実務での使い勝手に近いのは長丁場側の点数だ。そこでは最上位のモデルでも約25%である。この数字は、まだ人の設計と監督が要るという現在地を示している1。
- どこで転ぶかまで読む。 課題そのものは多ファイル・長い依存だが、原典の故障分析が名指すつまずきの場所はそこではない。強いモデルほど「指示追従」、つまり複雑なリリースノートを解釈しきれないことでつまずく(弱いモデルほど道具の使い方や構文の誤りが増える)1。GPT 系では gpt-5 の故障の6割超がこの型だった。ただし原典自身が探索的な分析だと断っている1。難しさの目安も出ている。原典の難易度分析に入ったどの組でも解けなかった課題は、関連するプルリクエストが平均 14.84 本で、最も易しい群の 1.67 本と比べて約9倍だ(この分析の図の凡例に並ぶのは gpt-5・o3・gpt-4o などで、最上位の gpt-5.4 や glm-4p7 は無い)1。任せる仕事が「一つの指示に多数の変更がぶら下がる」形に近いほど、今の実力との距離は大きくなる。
ただし長丁場ベンチマークはどれも新しく、規模も小さい。SWE-EVO は48問なので、1問解けるだけで 2.08 ポイント動く。しかも48問のうち26問は dvc 1リポジトリ由来で、原典も Limitations で偏りを認めている1。原典は 25.0% の 95% 信頼区間を [14.9, 38.8] と併記し、僅差の順位を読みすぎないよう自ら断っている1。数字は今後動くし、一つの指標を新しい定番として扱うのは早い。確かなのは点数の高低ではなく、測る対象が「1件直せるか」から「長く働き続けられるか」へ移ったという向きのほうだ。
出典5件
-
Tue Le, Minh Vu Thai Pham, Dung Nguyen Manh, Huy Nhat Phan, Nghi D. Q. Bui, “SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios”(arXiv:2512.18470v6, 2026-05-22。v1 は 2025-12-20 で、数値は版により異なる。v1 の要旨の値は GPT-5+OpenHands で 21%/65% である)。48問・平均21ファイル・平均874テスト、7つの成熟Python OSSのリリースノート由来。原典が「最強のモデル」と呼ぶ GPT-5.4 が SWE-EVO で25.00%(OpenHands・SWE-agent とも同値)。⚠ これは表の最高値ではない。Table 2 の SWE-EVO 最高スコアは glm-4p7 + SWE-agent の 39.58% で、原典自身も glm 系が OpenHands より SWE-agent で大きく伸びる足回り依存を指摘している。比較対象の同世代モデル(GPT-5.2)が SWE-bench Verified で72.8%。§4.2 逐語:
One exception is glm-5/glm-4p7, which perform much better with SWE-agent than OpenHands, suggesting scaffold sensitivity in addition to benchmark difficulty./Because SWE-EVO contains 48 curated instances, one resolved instance changes Resolved Rate by 2.08 percentage points. We therefore report uncertainty and avoid over-interpreting close leaderboard gaps./Representative 95% Wilson confidence intervals over task instances are [14.9, 38.8] for 25.00% … so we focus on large performance gaps rather than small ranking differences.故障分析の逐語は §4.3.1For the GPT series, gpt-5 rarely fails due to syntax or tool issues; instead, over 60% of failures come from Instruction Following, suggesting difficulty interpreting complex release notes.である。この6割超は gpt-5 についての値で、最上位の gpt-5.4 の内訳ではない。強いモデル一般への一般化は §5 のAn exploratory failure analysis suggests that stronger models struggle more with instruction following, while weaker ones exhibit tool-use and syntax errors.に拠り、原典自身がexploratoryと断っている。難易度群の逐語は §4.3.2groups instances by empirical difficulty, using the number of model-scaffold combinations that resolve each instance/unresolved-by-all instances average 14.84 PRs, compared with 1.67 for the easiest groupで、群分けに使った組は Figure 6 の凡例(kimi-k2-instruct・glm-4p5・deepseek-r1・qwen3-coder・gpt-oss-120b・gpt-4o・o3・gpt-5-nano・gpt-5-mini・gpt-5)に並ぶ。gpt-5.4 と glm-4p7 はこの凡例に無い(いずれも v6 PDF 本文で確認)。https://arxiv.org/abs/2512.18470v6 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 -
SWE-bench Verified は、実在の GitHub issue 1件に対する修正パッチを当てられるかを測る500問(Epoch AI 自身の測定は、同社インフラで確実に走る484問のサブセットで行われる。ネットワークアクセスを要するテスト等16問を除外)。最前線モデルは高得点帯に集まっている。ただし「8割」を境に見ると、公開盤と Epoch では見え方が違う。swebench.com の Verified 盤 180 行に 80% に届く行は無く、最高は 79.2%(2026年8月時点の公開データを本稿で数え直した)。Epoch AI の 484 問サブセットでは 35 走行のうち 80% 以上が 2 件(最高 83.5%)で、上位10走行が 76.7〜83.5% に入る。同じモデルでも足回り(scaffold)次第でスコアが動く:Anthropic は Claude 3.7 Sonnet について、自社インフラで走る489問という同一サブセット上で、カスタム scaffold ありが70.3%、scaffold なしが63.7%と報告している(差は約6.6ポイント)。これは独立検証ではなくベンダーの自己申告値である。Epoch AI, “SWE-bench Verified” https://epoch.ai/benchmarks/swe-bench-verified/Anthropic, “Claude 3.7 Sonnet and Claude Code” https://www.anthropic.com/news/claude-3-7-sonnet ↩ ↩2 ↩3
-
より長く・難しい仕事へ物差しを寄せる独立の試みの例には、SWE-bench Pro(Scale AI, arXiv:2509.16941。複数ファイル・長時間の課題で、原典の自己記述は
long-horizon tasks that may require hours to days for a professional software engineer to complete, often involving patches across multiple fileshttps://arxiv.org/abs/2509.16941)、Terminal-Bench(2026-09-02 実測で公式リーダーボードは 4.0)(コマンドライン上の長丁場。公式サイト https://www.tbench.ai/ の表記はHosted by Stanford / Harbor / Laude Institute。Epoch AI https://epoch.ai/benchmarks/terminal-bench はリーダーボードをミラー掲載しているだけで、公式が 4.0 に進んだ後も 2.0 のまま=2メジャー遅れ。いずれも 2026-09-02 に両サイトを取得して確認し、2026-09-19 に再確認した)がある。これらとは別の軸で、測る対象ではなく評価の土台を組み直す試みもある。Holistic Agent Leaderboard(arXiv:2510.11977)は、標準化した評価ハーネスと、モデル・スキャフォールド・ベンチマークの三次元分析を掲げ、狙いを「ベンチマークで高得点を取るエージェントから、現実で確実に動くエージェントへ焦点を移すこと」に置く(逐語: shift the focus from agents that ace benchmarks to agents that work reliably in the real world)。推論努力についての実測も同じ論文にあり、逐語はWe validate the harness by conducting 21,730 agent rollouts across 9 models and 9 benchmarks … Our analysis reveals surprising insights, such as higher reasoning effort reducing accuracy in the majority of runs.である。作り手も軸も異なる複数グループが、それぞれの軸で物差しを作り直している。 https://arxiv.org/abs/2510.11977 ↩ ↩2 -
OpenAI(Frontier Evals チーム)は2026年2月、SWE-bench Verified を自社の評価から外すと公表した。主因は、フロンティア各モデルが課題IDだけから正解パッチや問題文をほぼ逐語再現できる汚染。加えて、o3 が64回の独立走行で一貫しては解けなかった138問を精査し、その59.4%にテスト設計か問題文の重大な欠陥があると指摘した(一次の内訳は、テストが狭すぎて機能的に正しい解も落とすもの 35.5%=49問、問題文に書かれていない追加機能をテストが要求するもの 18.8%=26問、その他 5.1%)。この59.4%は Verified 500問全体ではなく、精査対象として切り出した138問に対する比率である点に注意(難問・不良問が濃縮された部分集合である)。二次報道の Latent Space はこれを「6割超」と丸めている。なお元の SWE-bench の著者のひとり Ofir Press は2026年2月13日の X 投稿で、Verified の理論上の天井は少なくとも95%で、実際の天井はそれよりやや低いかもしれないが伸びしろは確かに残ると述べている(逐語
the theoretical SWE-bench Verified ceiling is at least 95%/But we still definitely have room to grow in Verified.)https://x.com/OfirPress/status/2022375703430250706。同日、同じく著者の John Yang もthere's evidence that some room remainsと書いている https://x.com/jyangballin/status/2022367240293949772。Latent Space は Ofir Press の投稿を引いて、著者らは飽和を宣言する天井を87〜95%としていると要約している(数の区間は同記事の表現で、投稿には無い)。当時 OpenAI は代替として SWE-bench Pro を推奨したが、2026年7月8日、その推奨を明示的に撤回している。OpenAI は公開731問を監査し、自動パイプラインで200問(27.4%)、経験のあるソフトウェアエンジニア5名による人手レビューで249問(34.1%)が、過度に厳格なテスト・仕様不足・低カバレッジ等で壊れていると結論した。つまり「代わりの物差し」もまた、同じ理由で短命だった。2月の公表の一次は OpenAI, “Why SWE-bench Verified no longer measures frontier coding capabilities”(2026年2月23日)。一次の直リンクは 403 を返すため、2026年2月24日のアーカイブを示す: http://web.archive.org/web/20260224082405/https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/。二次報道と収録は Latent Space, “The End of SWE-Bench Verified” https://www.latent.space/p/swe-bench-dead、7月の撤回は The Decoder, “OpenAI finds roughly 30 percent of popular AI coding test is broken” https://the-decoder.com/openai-finds-roughly-30-percent-of-popular-ai-coding-test-is-broken/(⚠ 撤回の語と日付は、記事が併記する二次報道では確かめられない。The Decoder の記事にretractに当たる語は無く(「今回は代替を名指ししない」と書くにとどまる)、掲載日もdatePublishedは 2026年7月9日である。確かめられるのは一次発表のほうで、逐語はwe retract our earlier recommendation to adopt SWE-Bench Pro。openai.com への直接取得は 403 で塞がれているが、2026年7月8日のアーカイブが読める: SWE-bench Pro の飽和そのものについても同記事に印字があり、逐語はOn the 731-task public split, frontier models improved from a pass rate of 23.3% to 80.3% in eight months.である。http://web.archive.org/web/20260708213039/https://openai.com/index/separating-signal-from-noise-coding-evaluations/)。 ↩ ↩2 ↩3 ↩4 -
R. Aleithan ほか, “SWE-Bench+: Enhanced Coding Benchmark for LLMs”(arXiv:2410.06992v2, 2024。改題 “SWE-Bench+: Enhanced LLM Coding Benchmark” として ACM AIware ‘26 会議録に掲載, 2026-07-05, DOI 10.1145/3805760.3814924。数値は arXiv v2 による)。SWE-bench Full(2,294問・SWE-Agent+GPT-4 の成功パッチ251件)では、成功パッチの32.67%は「課題報告そのもの、またはそのコメント」に解が示されていた(著者らの言う “solution leakage problem”)、さらに弱い/不十分なテスト(31.08%)を併せて除くと解決率は12.47%→3.97%へ低下。原典は SWE-bench Verified も別に数えており(§2.3・Table 2)、合格112件(22.4%)のうち解の露出は37件(33.04%)、不正確・不完全な修正を併せた疑わしい修正は55.36%で、解決率は22.4%から10.0%へ落ちる。本文が引くのはこの Verified 側の値。公開GitHub由来ゆえの汚染・記憶の問題を定量化した独立監査。https://arxiv.org/abs/2410.06992 ↩
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。