AIエージェント
長く働くエージェントの文脈管理では『忘れ方』を設計する
目次
AIエージェントに、経費の精算のような何段階もある仕事を任せると、やりとりは一往復では終わらない。ツールを呼び、返ってきた出力を読み、次の手を決める。その繰り返しのぶんだけ、会話とツールの応答が履歴として積み上がる。仕事が長いほど履歴は大きくなる。一方で、モデルに一度に渡せる量にも、かかる費用と待ち時間にも限りがある。だからどこかで、何を残し、何を捨てるかを決めなければならない。それでも単純に考えれば、エージェントは履歴を残せるだけ残した方が賢く振る舞えるはずである。過去の指示も、途中で調べた事実も、全部そこにあるからだ。問題は、後でどの情報が効くかを、捨てる時点では判断できないことである。このため「とりあえず全部渡す」は、最も安全に見える選択でもある。2026年5〜6月に公開された2本のプレプリントが、この前提を測定した。
長く働くエージェントに、履歴をどこまで持たせるのがよいのか。全部持たせるのが最善なのか。捨て方は一つに決められるのか。2本のプレプリントは、これらの点を測定した。
長く働くエージェントの文脈は、履歴を全部渡す既定から、残す量と捨て方を設計する側へ動いている。独立した2本の測定がどちらも、残し方に手を入れた構成(1本目は設計した刈り込み+要約、2本目は学習させた管理役)が、全履歴のままの状態や文脈管理をしない構成を上回ると報告したからだ。ただし、どの捨て方が優勢かは決まっていない。分かれ目は、そのエージェントの素の成績と、仕事の種類である。 1本目の経費処理のベンチマークでは、直近の数件だけを生のまま置き、あふれた分を要約に畳む形が、全履歴を渡したときより完了率で上回り、トークンも実行時間も大きく減った1。2本目は、外部のモデルに捨て方を学習させて文脈管理をしない構成より成績を上げ、どこまで圧縮するのが得かは動かすエージェントの実力で変わることを示した2。代償は、捨てた中に後で要る証拠が混じる危険3と、管理そのものの費用である2。
全部持たせると、かえって弱る
1本目「Less Context, Better Agents」は、Microsoft のチームが自社の Dynamics 365 上で50課題の経費処理ベンチマークを組み、GPT-5 で文脈の持たせ方を比べたものだ1。下の3条件はいずれも、非対話のハーネスで GPT-5 が途中停止するのを防ぐため、gpt-4.1 の利用者モデルを対話相手として同席させた構成である(後述の Sonnet 4.5 側は利用者モデル無しで回している)。結果は次のとおりである(71%→79% の一段は信頼区間がわずかに重なる、と著者らは断っている)。
- 全履歴を保持:完了率 71.0%(約148万トークン・14.6時間)
- 直近5つのツール呼び出しに刈り込み:79.0%(約54万トークン・5.4時間)
- 刈り込み+要約:91.6%(約55万トークン・5.8時間)
履歴を多く持たせても、完了率は上がらなかった。著者らが挙げる問題は、冗長なツール応答による文脈の溢れ、古い状態に基づく誤り、そして推論コストの増大だ1。著者らは機構も測定している。全履歴では古い状態を参照した誤りが非完了の47%(34/73)を占め、刈り込みで11%(6/53)に落ちた。代わりに刈り込み単独では「残高が見えなくなって途中で打ち切る」失敗が2倍(9→18)に増え、要約がそれを6分の1(18→3)に減らしている1。刈り込み+要約の構成は、直近5件のツール呼び出しを生のまま残し、そこから押し出された直近3件だけを1つの要約に畳んで差し込む。この構成だけで、完了率は上がり、トークンと時間は4割前後に下がった。
ただし、この幅をそのまま一般化はできない。同じ論文が Claude Sonnet 4.5 でも回しているが、そちらは文脈工学を何もしない状態ですでに完了率88.0%(GPT-5 は同じ利用者モデル無しの条件で8.0%)で、刈り込みで 92.0%、刈り込み+要約で 94.5% だった。順序は Sonnet でも保たれるが、伸びは +6.5 ポイントにとどまる。しかもトークンが 3,562K→2,235K と減った一方で、実行時間は6.20→11.30時間へ約1.8倍に増えている1。効き幅はモデルで変わるが、「刈り込み+要約が最良」という並びは変わらなかった、と読むのが正確だ1。
なお、著者らが「モデル固有の停止(stalling)挙動を反映している」と書いているのは、利用者モデルを外した条件(8.0%)から全履歴保持(71.0%)への跳ねについてであって、上の 71→79→91.6 についてではない。著者らはその区別のために、この条件を主要な比較から外し、文脈工学の主張は「全履歴→刈り込み→刈り込み+要約」の比較にのみ依拠すると明示している1。
「捨て方」はエージェントの強さで変える
ただし、刈り込みは強くすればよいわけでもない。2本目「AdaCoM」は、外部のLLMに文脈管理そのものを学習させる(強化学習で「何を残し何を畳むか」を訓練)。エージェント側で文脈を制御する方式や、要約のような固定戦略に比べ、Web検索や深いリサーチ系のベンチマークで性能が上がったと著者らは報告する(BrowseComp-Plus の4エージェント平均で、文脈管理なしの ReAct 24.17 に対し 33.60=+39.0%。比較対象で最も強い SumCoM 29.39 に対しては +14.3% にあたる)2。
この研究の中心となる知見は「忠実さと信頼性のトレードオフ」である。地力の高いエージェントは、文脈を忠実に残すほど得をする。逆に地力の低いエージェントは、積極的に圧縮して、扱える範囲に文脈を収めた方が安定する2。固定の要約がつまずくのも、この強い側である。同じ表では、エージェント自身が要約を更新し続ける固定の方式が、4エージェント平均で文脈管理なしを下回り(24.17→22.06)、文脈管理なしの成績が最も高い GLM では 32.56→11.56 に落ちた2。著者らは、固定の要約は生の文脈を多く残すほど得をする GLM や Qwen には向かず、学習させた固定要約でも GLM の成績を下げたと書いている2。つまり、最適な刈り込みの強さは一律ではなく、動かすモデルの強さに合わせて決めるものだ。
刈り込み+要約を候補に置き、強さは素の成績で決める
適した捨て方がエージェントの地力で変わるなら、文脈の持たせ方は一度決めて使い回す設定ではなく、組むたびに決め直す項目になる。
- 全履歴を丸ごと渡さない。 直近のツール呼び出しを生で残し、そこから押し出された直近数件を要約して1メッセージだけ差し込む、という形が、全部盛りより完了率で勝つことがある1。まず「刈り込み+要約」を候補に置き、素の成績が高いエージェントでは文脈管理なしの構成とも並べて測る。要約を足す利点は精度だけではない。run 間のばらつきは刈り込み単独の ±8.2 から ±1.7 に縮み、1割以上を残したまま終わった課題は50件中6件から1件に減る1。なお著者らは、モデル提供元がすでに機能として出している圧縮(compaction)と同じ形の、全履歴を要約する方式(
W=−1)も別条件として測っており、精度はほぼ同じ(91.6%→92.0%)だが、トークンは約11%多い(553K→615K)1。 - 残す基準は「タスクの制約と進捗」。 何を捨てるか迷ったら、目標・制約・ここまでの進捗は残し、役目を終えた中間出力は畳む。AdaCoM が性能を上げた要も、この「制約と進捗を保ちつつ、古い内容を刈る」だった2。
- 圧縮の強さは、そのタスクでの素の成績に合わせる。 素の成績が高いエージェントは文脈を多く残し、低いエージェントは圧縮を強める2。一律の設定を全機種に流用しない。学習させた管理役を別のエージェントへ付け替えた実験でも、素の成績が近いエージェントで学習させた管理役ほどよく効いた2。ただし著者らはこれを一次の目安とし、Web検索と深いリサーチ以外の長い仕事では確かめていないと書いている2。
- コスト減は副産物として大きいが、その大きさはモデルに依存する。 GPT-5 では刈り込み+要約でトークンも時間も4割前後に減ったが、同じ論文の Sonnet 4.5 では同じ構成で、トークンが 3,562K→2,235K に減る一方、時間は 6.20→11.30時間と約1.8倍に増えた1。2本目の著者らも、管理役のモデルを毎ステップ呼ぶぶんトークンと遅延が増え、文脈を書き換えるためKVキャッシュの再利用が効きにくくなると明記しており、これは要約系にも当てはまる2。同じ著者らは、管理役を数ラウンドおきに、または文脈が長さの閾値に近づいたときだけ働かせれば、これらの費用を減らせる可能性も挙げている2。運用費と待ち時間は、自分の構成で測り直す。
ただし「減らすほど良い」と一般化はできない。刈り込みは、答えに必要な証拠まで捨てると逆に失敗する。長い対話履歴への質問応答では、生の履歴を読み返すより「必要な証拠を予算内で残す」方が効く、と報告する研究もある。同論文では要約寄りのベースラインが、証拠の保持率が低い割にF1が高く、同じ予算の比較対象の中では最も強かったが、EMBERとの差はF1で0.125残った3。さらに、60の科学的発見タスクで8種の圧縮法を比べた研究は、どの圧縮も仮説の質を有意には変えず、しかもLLMによる要約はむしろトークンを24〜94%増やしたと報告する4。もっとも、その課題は5〜22手と短く、トークンが減ったのは10手を超える課題で、直近の窓の外のツール出力を伏せるような規則型の圧縮を使った場合だけだった(著者らは、最適な圧縮は分野と課題の長さで変わると書く)4。つまり「刈り込み+要約が効く/安くなる」は経費処理のような手順型タスクでの知見であって(本体のベンチマークが Hotel カテゴリで、Travel と Meals & Gifts に広げても同じ順序が出ている1)、得が出るかは仕事の種類だけでなく長さでも変わる。必要な証拠の粒度が高い質問では、減らし方を誤ると取りこぼす3。
長く働くエージェントで効くのは、より多く覚えさせることでも、やみくもに減らすことでもなく、仕事に合わせて忘れ方を設計することだ。完了率で「減らす方が強い」を示したのは1本目で、2本目が示すのは「捨て方はエージェントの地力次第」だ(いずれも査読前)。上で見たとおり効き方はタスク次第で、万能の設定はない。
出典4件
-
Abhilasha Lodha ほか, “Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents”(arXiv:2606.10209, 2026年6月8日公開)。50課題の経費処理ベンチマーク・GPT-5(3条件とも gpt-4.1 の利用者モデルを同席させた構成)。全履歴保持=完了率71.0%(1,480,996トークン・14.56時間)、直近5ツール呼び出しに刈り込み=79.0%(535,274トークン・5.39時間)、刈り込み+要約=91.6%(553,374トークン・5.79時間)。5回の run にわたる標準偏差はそれぞれ ±4.4/±8.2/±1.7 で、1割以上を残して終わった課題は50件中13件/6件/1件(Table 3・4.4節)。刈り込み+要約の設定は
N=5, W=3=生で残すツール呼び出し5件、押し出された直近3件だけを要約。全履歴要約(W=−1)は別条件として測られており 92.0%・615Kトークン(Table 7)。著者らはこの条件を、提供元の compaction や学習した圧縮器(ACON)の形と位置づけている(the compaction style of)。関連研究の節はprovider platforms now ship native “compaction” and tool-result-clearing featuresと書く。Claude Sonnet 4.5 は利用者モデル無しで回しており、文脈工学なし=88.0%(3,562Kトークン・6.20時間)、刈り込み=92.0%(2,161K・10.70時間)、刈り込み+要約=94.5%(2,235K・11.30時間)(Table 8)。本体の Hotel(71.0→79.0→91.6、Table 2 の再掲)に加え、カテゴリを広げた Travel(n=30)76.0→86.6→95.0、Meals & Gifts(n=32)75.6→89.4→96.1 でも、刈り込み単独を挟んだ3点で同じ順序(4.8節・Table 4)。なお原典本文は途中打ち切りの 9→18 をtriplesと書くが、同論文 Table 5 の実測は2倍である(本稿は Table 5 の値を採った)。https://arxiv.org/abs/2606.10209 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 -
Lu Yi ほか, “Learning Agent-Compatible Context Management for Long-Horizon Tasks”(arXiv:2605.30785, 2026年5月29日公開)。凍結したエージェントの文脈を外部LLMが強化学習で管理する AdaCoM。タスクの制約と進捗を保ちつつ古い内容を刈ることで、エージェント側の文脈制御や要約のような固定戦略に比べ、Web検索・深いリサーチ系ベンチマークの性能を改善したと報告する。BrowseComp-Plus(Web検索)は4エージェント平均で、文脈管理なしの ReAct 24.17 に対し AdaCoM 33.60(+39.0%)、比較対象で最も強い SumCoM 29.39 に対しては +14.3%(Table 1)。同じ表で、エージェント自身が要約を更新する固定の SumAgent は4エージェント平均 22.06 と ReAct を下回った。GLM-4.5-Air では ReAct 32.56 に対し SumAgent 11.56、学習させた固定要約の SumCoM でも 26.44 で、著者らは
even degrades GLMと書く。著者らが構築した MCP-Bench-Wiki(深いリサーチ、2エージェントのみ)では +9.0%/+22.3%。著者らは制約として、管理役のLLMを毎ステップ呼ぶためトークンと遅延が増え、文脈を書き換えるためKVキャッシュの再利用が効きにくくなる(要約系も同じ)と明記している。同じ節で、管理役を数ラウンドおきに、または文脈が長さの閾値に近づいたときだけ呼べば負担を減らせる可能性も挙げている(could substantially reduce the overhead・may reduce the frequency of cache-breaking operations)。「忠実さと信頼性のトレードオフ」=地力の高いエージェントは高忠実な文脈保持が得、低いエージェントは積極的な圧縮で安定する。管理役の付け替え実験(32組)では、素の成績が近いエージェントで学習させた管理役ほどよく効いた。著者らはこれをa useful first-order ruleと呼ぶ。評価はWeb検索と深いリサーチの2系統だけで、コード・身体性・長文執筆のエージェントでは確かめていないとも断っている(We do not evaluate AdaCoM on other long-horizon settings)。https://arxiv.org/abs/2605.30785 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 -
Yilong Li, Suman Banerjee & Tong Che, “EMBER: Efficient Memory via Budgeted Evidence Retention for Long-Horizon Agents”(arXiv:2606.05894, 2026年6月4日公開)。著者らは、長い仕事の記憶は「生履歴をより多く読み返すこと」ではなく「答えに必要な証拠を予算内で残す」ことに依存し、保持した記憶が必要な証拠を取りこぼすと結局は大きな生履歴に戻らざるを得ない、と論じる(retained-evidence 8192トークン比較点で F1 0.3017 vs 最強の非EMBERベースライン 0.1765、差は +0.125・95% CI +0.081〜+0.169)。この 0.1765 は要約寄りのベースライン TierMem-BudgetRaw の値で、著者らはその F1 を、証拠の保持率が低い割に competitive だと書いている。圧縮された要約でも答えの手がかりは運べるからだ、と理由まで書いている。評価は長い対話履歴への質問応答(LongMemEval-RR ほか)と RULER-HotpotQA である。著者らは、配備されたアシスタントではなく統制したベンチマークでの評価だと断っている。刈り込み一辺倒の限界を突く側。査読前。https://arxiv.org/abs/2606.05894 ↩ ↩2 ↩3
-
R. Chintalapati ほか, “Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery”(arXiv:2605.18854, 2026年5月13日公開)。GPT-4o・DiscoveryBench 60課題・6分野(計480評価)で8種の圧縮法を比較。著者らの報告では、どの圧縮も仮説の質を有意には変えず、LLMによる要約はトークンを24〜94%増やした一方、ツール出力のマスクは8.6%の純減だった。課題は5〜22手(
range from 5-22 events)と短く、トークンの純減は10手を超える課題で規則型の圧縮にだけ出た(17〜34%・only on long tasks)。加えて、最適な圧縮はドメインとタスク長で変わる。「刈り込み+要約が普遍的に効く/安くなる」を割り引く側。査読前。https://arxiv.org/abs/2605.18854 ↩ ↩2
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。