AI・信頼性・評価
自己改善エージェントの上達は本物か:ReasoningBank再評価で反転
- 自己改善
- Webエージェント
- AWM
- ReasoningBank
- WebArena
- VisualWebArena
- SCUBA
- Vanilla-IB
- GPT-5-mini
- 課題順
- 隠れたカリキュラム
- 分散
- シャッフル
- トークン予算
- 仕様不足
- ルーブリック
- Welchのt検定
- ベースライン
- 成功率
- Mind2Web
- WorkArena-L1
- ASI
- MaTTS
- Gemini-2.5-Flash
- Qwen 3.6-27B
目次
同じ作業を繰り返すなら、二度目は一度目より上手であってほしい。研究者はその期待に応える仕組みとして、過去の経験をためて自分を改善するエージェントを提案してきた。だが「経験を積んで上手になった」という主張は、1回の実行で出た数ポイントの改善では確かめられない。設定も課題も変えずに走らせ直すだけで、成功率はそれと同じくらい動くからだ1。経験をためる仕組みを足すと、実行ごとの振れ幅は多くの設定でかえって大きくなる、という報告もある1。
確かめにくさは、もう一つある。練習に使う課題の並び方が、はじめは易しく後半ほど難しくなるように作られていれば、経験を積んでいく側に有利になる。だから、経験からの上達を主張する報告は、何度も繰り返して確かめ、課題の順番を変えても崩れないかを試す必要がある。そこまでやって初めて、上達という言葉に値する。本稿は、記憶を蓄えて自分を改善する二つの手法(AWMとReasoningBank)を、2026年8月のプレプリントが複数回の実行と課題順の入れ替えで再評価した測定を例に取る1。
記憶を蓄えて自分を改善するはずのエージェントの上達は、複数回の試行と課題順の入れ替えという二つの揺さぶりに耐えるのか。
耐えない場合が多い。 原因の少なくとも一部は、これまでの評価が使ってきた課題の並び順そのものにあった。易しい課題から難しい課題へ進む順序が、隠れたカリキュラムとして働いていた。2026年8月18日投稿のプレプリントが、記憶を貯めて次に活かす二つの手法を再評価した1。既定の課題順で伸びを見せたのはReasoningBankだけで、その差も統計的に強いものではなかった。もう一方のAWMは、三つのベンチマークすべてで既定順の時点からベースラインを下回っている。そしてReasoningBankのWebArenaでの伸びも、課題順をランダムに入れ替えると符号が反転して悪化した1。さらに、記憶を持たない素のエージェントでさえ実行のたびに成績がばらついており、記憶ベースの手法を足すと、そのばらつきは多くの設定でむしろ広がった1。独立した別のグループも、使えるトークンの量をそろえて比べると記憶やスキルのモジュールの優位性の多くが消えると報告している2。
記憶なしと記憶つきを3回ずつ走らせ、回ごとと平均で比べる
※ この節の数値は説明のための仮定で、測定値ではありません。
100件の課題を解かせて、成功率を比べる。記憶を持たないエージェントを同じ設定で3回走らせると、成功率は54%・56%・55%で、平均は55%だったとする。記憶をためるエージェントを3回走らせると、58%・53%・57%で、平均は56%だったとする。
1回目どうしを比べると、記憶つきは4ポイント上回る。2回目どうしでは3ポイント下回る。平均の差は1ポイントで、最も良い回と最も悪い回の差は、記憶なしで2ポイント、記憶つきで5ポイントある。
次に、同じ100件を並べ替えて解かせる。記憶を持たないエージェントは課題を一つずつ切り離して解くので、並び順を変えても成功率の期待値は変わらない。記憶をためるエージェントは、前の課題で作った記憶を次の課題へ持ち越す。
数字を並べると、読み取れることが二つある。
- 1回ずつの比較では、どの回を選ぶかで差の符号まで変わる。平均の差は、回ごとの振れ幅と並べて初めて意味を持つ。
- 同じ課題の集合で、並び順を変えただけで回ごとの振れ幅を超えて成功率が動くなら、その差は課題から課題へ持ち越されるもの、つまり記憶から来ている。
記憶を積むエージェントは、元の実験では実際に上達を示した
出発点にあるのは、二つの実在する成果だ。AWM(Agent Workflow Memory)の著者らは、課題を解く手順のまとまりを「ワークフロー」と呼ぶ。AWMはエージェントに過去の経験から再利用可能なワークフローを自分で作らせ、以後の課題でその手順を参照させる3。この仕組みはオフラインでもオンラインでも動く。著者らはAWMを二つのWeb操作ベンチマークにまたがる1,000件超の課題で評価し、ベースラインに対してMind2Webで24.6%、WebArenaで51.1%の相対的な成功率の向上を報告した。WebArenaで解けた課題ではステップ数も減ったとしている。いずれも相対値で、ポイント差ではない。さらに、オンライン版のAWMは、課題やWebサイトが訓練時と異なる方向(分布のずれが広がる方向)への転移で、8.9〜14.0ポイントの絶対的な向上を見せている3。
ReasoningBank は別の設計思想を取る。エージェント自身が「成功した」「失敗した」と自己判断した経験の両方から、汎化しやすい推論の型を蒸留してためていく方式で、これにMaTTS(記憶を使ったテスト時スケーリング)を組み合わせる4。原典が WebArena で報告する上げ幅は、バックボーンとなるモデル3種に対して+8.3・+7.2・+4.6ポイントである。いずれも記憶を持たないエージェントとの差で、相対値ではなく成功率そのものの差である。ただし集計の母数はMapドメインを除いた684課題で、後述する8月の再評価が使う812課題とは揃っていない。最も大きい+8.3はGemini-2.5-Flashでの値で、記憶なしの40.5%が48.8%へ動いた4。Google Research の公式ブログも同じ数字を「スケーリングを使わない ReasoningBank 単体でも記憶を持たないエージェントをWebArenaで8.3%上回った」と紹介している5。AWM は ICML 2025 に、ReasoningBank は ICLR 2026 に、それぞれ採択されている。この時点で、AWM・ReasoningBank どちらの報告も、それぞれの実験条件のもとでは実在する改善を示していた。
2026年8月の再評価では、揺さぶると上達が崩れた
このAWMとReasoningBankを、8月18日投稿のプレプリントが再評価した1。バックボーンをGPT-5-miniに揃え、WebArena・VisualWebArena・SCUBA(企業環境を模した267課題)の三つのベンチマークで、各実験を3回ずつ走らせている。単発の実行に頼らないための最小限の作りだ。WebArenaは、通販サイトやGitLab、掲示板などを模した6ドメイン・812件のWeb操作課題をエージェントに解かせて成功率を測るベンチマークだ。
まず、記憶を足さないベースラインのエージェント自体にばらつきがある。設定によって、実行間の標準偏差は0.30%〜2.77%の幅があり、WebArenaのGitLabドメインでは1.98%、3回の実行のうち最も良い結果と最も悪い結果の差(ベスト・ワースト差)は4.4ポイントに達した。ここに自己改善の仕組みを足すと、ばらつきはむしろ増える方向に動いた。24通りの実験設定のうち17通り(約71%)で分散が拡大し、そのうち11通りは相対で50%以上の増加だった。ベスト・ワースト差はGitLabドメインで7.8ポイント、最も大きいMultisiteドメインでは10.4ポイントまで広がっている。原典が要旨で「同じ実験のベストとワーストの差は最大10パーセントポイントに達しうる」と書くのは、この値のことだ1。ただし分散の拡大はモデルによって違う。原典は付録でWebArenaに別の2モデルを当て、ReasoningBankで分散が広がったのは主実験のGPT-5-miniで12設定中8、別の2モデルでは12設定中7と5にとどまったとして、この2モデルでは拡大の根拠は弱いと書いている。それでも、どのモデルでも実行ごとのばらつき自体は大きいとしている1。1回だけ走らせて「上がった」と結論づけるのは危うい。
次に、課題順を崩す実験である。WebArenaのような評価は、課題を決まった順番で並べて解かせるのが通例だった。この既定の順番のもとでは、ReasoningBank は平均+1.5ポイントの伸びを見せている(伸びたのはReasoningBankだけで、もう一方のAWMは既定順の時点でWebArenaで−0.7、VisualWebArenaで−0.4、SCUBAで−1.7とベースラインを下回っている)。だがこの数字を統計的に検定すると、3回の実行に対する両側のWelchのt検定でp値は0.23で、原典はこの伸びを「統計的に有意ではない」と書いている。付録で同じ比較を6回の実行に増やしてもp値は0.07にとどまり、原典は有意水準5%では実行ごとのばらつきと区別できないとしている。そしてWebArenaで課題の並びをランダムにシャッフルすると、この+1.5ポイントは−4.5ポイントの悪化へと符号が反転した。WebArenaの成功率で見ると、記憶を持たないベースラインの既定順54.8%に対し、一つ目のシャッフル順ではAWMが49.1%・ReasoningBankが49.8%、二つ目ではAWMが49.8%・ReasoningBankが50.7%だった1。ReasoningBankの二つのシャッフル平均は50.25%で、54.8%との差がさきの−4.5ポイントにあたる。+1.5ポイントも−4.5ポイントも、単一の試行ではなく3回の実行を平均した、成功率そのものの差である。
ただし、シャッフルを試したもう一つのベンチマークであるVisualWebArenaでは、ReasoningBankは二つのシャッフル順で56.0%・56.4%と、記憶なしの54.9%を上回ったままだった。原典も、ここではReasoningBankは課題順の影響を受けにくかったと書いている。2手法×2ベンチマーク×2つのシャッフル順の8通りのうち、シャッフルで大きく悪化したのは6通りである1。
再評価のプレプリントは、もう一つの軸も測っている。記憶を一切持たないGPT-5-miniのベースラインは、WebArena 812課題で54.8%を記録した。先行研究がClaude-3.5-SonnetでAWMを走らせたときの記憶つきの成績36.3%(記憶なしは32.7%)を大きく上回る。ReasoningBankの原論文と同じ684課題に揃えても55.3%で、記憶つきの53.9%(同46.7%)と肩を並べる。著者らはこれを「ベースラインが強くなると、これらの手法の伸びは目減りする」とまとめ、結論では「ベースラインが既に強いとき、あるいは課題がランダム順で来るとき、エージェントは自己改善せず、むしろ劣化する」と二つの条件を並べている1。課題順は、二つの条件のうちの一方である。
隠れたカリキュラムと、埋め切れない差
なぜ課題の並び順を変えるだけで、これほど数字が動くのか。著者らの説明は、既定の課題順が結果として易しい課題から難しい課題へ進む暗黙のカリキュラムとして機能していた、というものだ。原典が書いているのは、この並びが自己改善の成功にとって隠れた前提条件になっていること、そして並び自体がベンチマークを作るときに注釈者が易しい課題から始めて徐々に難しくしていった副産物ではないか、という2点である1。ここから素直に読める機序は、エージェントが経験を積みながら記憶をためていくので、最初のほうに易しい課題が並んでいれば記憶が十分育つ前の失敗が少なく済み、後半の難しい課題では育った記憶が効く、というものだ。ただし、この噛み合わせ自体を原典が述べているわけではない。いずれにせよ、並び順そのものが、自己改善が機能しているように見せる方向にあらかじめ傾いていた。
この傾きに対して、著者らは緩和策も試している。ルーブリック(評価基準を明文化したもの)や環境からのフィードバック、プロンプトの修正を加えると、シャッフル後の成績は、一つ目のシャッフル順では49.8%から52.7%(+2.9ポイント)、二つ目では50.7%から51.8%(+1.1ポイント)まで戻った。原典は、全体で見てシャッフルで失われた分のうち取り戻せたのは約31%だとしている。残りの7割近い悪化は埋まらないままで、どちらのシャッフル順でも記憶なしのベースラインには届いていない。著者らは記憶の中身を人手で調べ、分散の拡大とシャッフル後の悪化の潜在的な原因として、記憶を作る段階での仕様不足(underspecification)を挙げている。一つは環境の仕様不足で、ブラウザ操作しかできない環境なのに、その制約が記憶を作るモジュールに渡っておらず、APIを使った解き方を勧める記憶が繰り返し作られ、エージェントはそれを取り出して参照してもいた。もう一つは課題の仕様不足で、曖昧な課題文が誤解や考えすぎを生み、無関係な記憶を作らせていた。残りの悪化について著者らは、緩和策で足した情報では仕様不足の源を捉えきれていないかもしれないとし、まだ特定できていない別の要因が関与している可能性も挙げている1。
再評価のプレプリントは自らの限界も書いている。主論文の検証は、記憶ベースの手法を一つのモデルでWeb操作に当てたものに限られる。著者らは付録で、別の2モデル、企業向けのツール利用ベンチマーク、ファイルに記憶を書く第三の自己改善手法、6回に増やした実行を足し、主な所見が概ね裏づけられたとしている。なお付録のSCUBAの表には、著者らが本文で取り上げていない記憶つきの手法Synapseの行もあり、既定の課題順で記憶なしの29.7%に対し33.2%だった。SCUBAではシャッフルを試しておらず、この行について検定も示されていない1。エージェントの記憶の中身を人手で調べた分析は定性的なもので、対象は全体のうちの一部にとどまる。そして、最近になって提案された新しい記憶管理の技術は、今回の検証には含まれていない。評価は網羅には程遠いとも認めたうえで、著者らは、評価した二つの手法は最小構成で拡張性が高く、採用が広がっているので、見つけた問題は概ね代表的だと考える、と述べるにとどめている1。著者らが最終的に勧めるのは、複数回の実行を前提にした評価プロトコルと、課題順をシャッフルするようなストレステストを標準の手続きに組み込むことである。
別ルートの研究でも、トークン予算を揃えると利得が消えた
この8月のプレプリントは、投稿から日が浅く、単独のグループによる測定で、本会議の査読は経ていない。独立した追試はまだない。ただし、この8月の結論と方法は異なるが方向の合う結論に、別のグループが2ヶ月早く到達している2。
2026年6月に投稿されたこの研究は、AWM・ASI(Agent Skill Induction)・ReasoningBankの三つを「Vanilla-IB」と比較した。Vanilla-IBは記憶もスキルもワークフローも持たない素朴なエージェントで、比較対象と同じトークン予算を持ち、そのぶんやり取りの回数を伸ばせる。モデルはGemini 3 Flash、GPT-5.4-mini、Qwen 3.6-27Bの三種。WebArenaのShopping(187課題)・Reddit(106課題)・Admin(182課題)・GitLab(180課題)の4ドメインに加え、企業のナレッジワーク課題を扱うWorkArena-L1でもQwen 3.6-27Bで同じ問いを検証している。この研究の要旨は「オンラインのWebエージェントは、しばしば基本のactorに記憶・ワークフロー・スキルのモジュールを重ねる。これらのモジュールは性能を改善しうるが、テスト時のトークンも消費する」と書き、その費用がactor自身の推論費用と並べて報告されることはめったにない、と続けている2。
結果として、WebArenaではVanilla-IBが三モデルすべてで、三手法と同等かそれを上回る集計成功率を示し、しかもAWM・ASI・ReasoningBankよりも総トークン消費が少ないことが多かったという。WorkArena-L1では、Vanilla-IBはReasoningBankと同率首位(ともに55.6%)で、AWM・ASIを上回った。ただしトークン消費はAWMのほうが少ない2。
記憶やスキルのモジュールが見せていた優位性の多くは、比較対象の予算を揃えていないことの反映だった、というのがこの研究の含意である。ただし著者ら自身は結論で、これはスキルやワークフローの記憶が無用だという意味ではない、課題の構造が再利用に向いた領域では利得を生みうる、と明記している。彼らの主張は「利得は条件つきであり、予算を揃えた比較の前ではしばしば消える」というところにある2。著者らはまた、WebArenaとWorkArena-L1の課題はほぼ一話完結で長期の記憶をあまり要求せず、記憶を強く要する環境では記憶モジュールの側に振れうる、と限界に書いている2。
この研究にはもう一つ、8月のプレプリントと通じる指摘がある。単発の実行での成功率は、オンラインのWebエージェントにとって重要な性質を隠してしまう、というものだ。課題単位で見ると成績のばらつきは大きく、著者らは実行間のばらつきを標準的な報告指標にすべきだと主張する2。
二つの研究は、同一の主張の重複した検証ではない。一方は課題順をシャッフルするというストレステストで、もう一方はトークン予算を揃えるという比較の公平化で、それぞれ別の脆弱性を突いている。使ったモデルは異なる(8月はGPT-5-mini、6月はGemini 3 Flash・GPT-5.4-mini・Qwen 3.6-27B)。ベンチマークのほうは逆に重なっており、両者ともWebArenaのShopping(187課題)・Reddit(106課題)・Admin(182課題)・GitLab(180課題)を共有している。8月はそこにMap・MultisiteとVisualWebArena・SCUBAを、6月はWorkArena-L1を足した形だ。同じ土俵の上で別々の揺さぶりをかけて、単発の実行・不揃いな比較条件のもとで測った自己改善の利得は、条件を厳しくすると縮むという一点で符合したことになる。これは同一結果の再現ではなく、別の方法による整合だ。
出典5件
-
Ye ほか「On the Fragility of Self-Improving Agents」arXiv:2608.18066, 2026(COLM 2026 併設ワークショップ LLA). https://arxiv.org/abs/2608.18066 — AWMとReasoningBankを3回ずつ再評価し、分散の拡大と、WebArenaで課題順を入れ替えたときの悪化を示す。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16
-
Hajimiri ほか「Are Online Skill and Memory Modules Always Worth Their Tokens?」arXiv:2606.15017(COLM 2026 ワークショップ WAB・LLA). https://arxiv.org/abs/2606.15017 — 予算を揃えた素のエージェントが、WebArenaで3手法と同等以上の成功率。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Wang ほか「Agent Workflow Memory」ICML 2025. https://arxiv.org/abs/2409.07429 — 過去の経験からワークフローを作らせて参照させ、Mind2Webで24.6%・WebArenaで51.1%の相対的な向上を報告する。 ↩ ↩2
-
Ouyang ほか「ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory」ICLR 2026. https://arxiv.org/abs/2509.25140 — 成功と失敗の経験から推論の型を記憶にためる。WebArena(684課題)で記憶なしに対し+8.3・+7.2・+4.6ポイント。 ↩ ↩2
-
Google Research「ReasoningBank: Enabling agents to learn from experience」. https://research.google/blog/reasoningbank-enabling-agents-to-learn-from-experience/ — 記憶なしに対しWebArenaで8.3%上回ったと紹介する。原典の表記はポイント差。 ↩
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。