AI・信頼性・評価
トークン予算でLLMベンチの点数と伸び幅・天井の推定が動く
- トークン予算
- LLM
- ベンチマーク
- FEval-TTC
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- HealthBench
- TerminalBench
- ARC Prize
- Artificial Analysis
- 推論モデル
- テスト時計算
- 推論時スケーリング
- 文脈圧縮
- リーダーボード
- 再提出
- ハルシネーション
- 順位表
- フロンティアモデル
- 多数決
- 棄権
- スキャフォールド
- ドル費用
- 確証バイアス
- 思考の連鎖
目次
LLM(大規模言語モデル)の優劣は、ふつうベンチマークの点数で比べる。ベンチマークとは、決まった問題集を解かせて採点する測り方だ。ここで問題になるのが推論モデルである。推論モデルは答えを返す前に、途中の考えを長く書き出す。その分量は、モデルごとに決まった値ではない。文字のかたまりをトークンと呼ぶ。本稿では、思考に何トークンまで使ってよいかの上限をトークン予算と呼ぶ。この上限は、測る側が実行のたびに選ぶ設定である。同じモデルでも、思考に使えるトークン数は測る人によって変わる。上限を上げれば時間も費用も増えるので、上限をいくつにするかは運用の判断でもある。ところが順位表は点数だけを載せ、上限の値はたいてい書いていない。読む側はその値を知らないままモデルを比べている。点数でモデルを選ぶなら、その点数がどんな条件で出たのかは、選ぶ判断に直接関わる。
推論に使わせるトークン予算を動かすと、ベンチマークの点数の何が動くのか。その動き方は課題によらず同じなのか。2025〜2026年の測定で確かめる。
推論に使った計算の量か費用を添えて比べる、という方向の仕事が別々のチームから出ている。McFadyen らは能力を推論時計算の関数として報告せよと提言し、Rumiantsev らは推論手法を費用でそろえて比べる手順を公開した。しかし点数を出す側では、一点の点数だけを載せるやり方がまだ多い。McFadyen らの提言の理由は、予算を積めば点数は動くが、その動き方が課題によって違うことだ。したがって予算を変えると、そのモデルがどこまで伸びてどこで頭打ちになるかという見積もりが変わる。どちらが上かという並びがどこまで入れ替わるかは、いまのデータからは決まらない。 McFadyen らは、同じモデルでも推論に使わせるトークン予算を増やすほどベンチの点数が上がり、固定予算での比較は進んだモデルの実力を過小評価しうると報告する1。この過小評価はモデルが進むほど大きくなると著者らは論じており、放置しても縮まない1。提言が点数を出す側まで届いたかは、点数の横に予算が載るようになるかで測れる。Rumiantsev らの評価プロトコルは、それより早く出ていた。このプロトコルは比べる側の手順をそろえ、費用の見積もりまで備える。ただし、このチームの動機は予算の未記載ではなく、性能と費用が時とともに揺れることへの再現性の懸念である2。軸に置いたこの二本は、いずれも本会議の査読を経ていない。 独立再現も本稿執筆時点で未確認である。逆に、長く考えさせるほど正答率が落ちる課題群を作って示した報告もある3。
一つの上限で測ると、伸びている問題集と止まった問題集が同じ点数に並ぶ
※ この節の数値は説明のための仮定で、測定値ではありません。
ある推論モデルを、二つの問題集 X と Y で測るとする。思考に使ってよいトークン数の上限を 1万・10万・100万 の三段に変えて、正答率を測る。
X では、1万で 30%、10万で 42%、100万で 51% になる。Y では、1万で 30%、10万で 31%、100万で 31% になる。
上限 1万で測った一点だけを並べると、X も Y も 30% で、どちらも同じところで止まっているように見える。三段で並べると、X は上限を上げるたびに伸び、100万でもまだ止まっていない。Y は 10万から先がほとんど動かない。
X と Y を上限の三段で並べ比べると、言えることは二つある。
- 一つの上限で出た点数は、モデルの能力だけでなく、その上限の値も映している。
- 止まって見える点数が本当に頭打ちなのかは、上限を変えて測らないと分からない。上限を上げたときの動き方は、問題集ごとに違う。
点数は載るが、思考に使った予算は載らない
モデルを大きくするのとは別に、答えるときに使う計算(テスト時計算, test-time compute)を増やして性能を伸ばす経路がある。本稿が軸に置く二つの報告(McFadyen ら/FEval-TTC)は、いずれもこの経路を前提に置く12。なお、事前学習の規模拡大とテスト時計算が近年の性能向上にそれぞれどれだけ寄与したかを測った出典は、本稿では挙げていない。推論モデルは、最終解答を出す前に長い思考の連鎖を書き、必要なら複数回試して多数決を取る。考える時間(=トークン)を与えるほど、正答率が上がる。これが「推論時スケーリング」の基本だ。
問題は、ベンチマークがふつうこの予算を明示しない点にある。点数を出す側、つまりベンチマークの論文、ラボのシステムカードやモデルカード、主要なリーダーボードは、最終的な正答率を並べる。だが、その裏で各モデルが何トークン費やしたかを、これらはたいてい書かない。McFadyen らが、自分たちの扱ったベンチについて評価設定を記録した61件の出典を調べると、トークン予算は69%(42/61)が未記載だった1。安い一発回答のモデルと、長考と多数決に大量のトークンを注いだモデルが、同じ土俵に載っている。点数の横に費用を載せる順位表もある。ARC Prize は1課題あたりの費用と点数を同じ散布図に載せ、Artificial Analysis は指標の実行費用を各社 API が報告するトークン数から出している4。
予算を積むと、点数は上がる
McFadyen らは、トークン予算・文脈圧縮・解答の再提出という3つの介入を組み合わせた統制設定で測ったと報告する1。ここでいう再提出は、いったん出した解答を提出し直して探索を続ける操作で、モデル自身の判断に任せる条件と、正誤だけの最小限のフィードバックを与える条件がある。対象は最大12のフロンティアモデル。ベンチは、ソフトウェア工学・数学・医学・サイバーセキュリティにまたがる7つの難関ベンチ(FrontierMath、Humanity’s Last Exam、TerminalBench ほか)だ。予算は、公開ベンチの標準値の1〜3桁上まで積んでいる。予算を大きくすると、複数の領域でベンチの点数は大きく改善する。とくに新しい世代のモデルほど、大きな予算で難しい課題を解けるようになり、より確実に解く。広く効いたのはむしろ再提出のほうだ、というのが3つ目の主結果である1。
ただし効き方はベンチで割れる。FrontierMath は 1M→10M(10倍)で +11.7 パーセントポイント、HLE は 64K→5M(約78倍)で +11.9 パーセントポイント伸びた。ここに挙げる伸びはどれも、正誤を毎回知らせる条件と知らせない条件を混ぜた値である。HLE で知らせない条件に限ると +8.3 で、知らせる条件の +15.5 の約半分にとどまる(FrontierMath は +11.4 と +11.9 でほぼ変わらない)。著者らは、正誤を知らせる条件が実態に近いのはコードの実行や形式証明のように外部の検証器が既にある課題で、専門家の自由な推論の課題ではそうでもないと断っている1。一方 SWE-Bench Pro は標準がすでに 16M トークンあり、30M へのほぼ倍増では +0.27 パーセントポイントにとどまる。HealthBench は 16K→10M(約625倍)でも +0.32 点(このベンチだけ独自スケール)しか動かない。どの値もモデルをまたいで平均したもので、モデルごとの振れ幅は効果量と同程度に大きい。FrontierMath は ±11.0、SWE-Bench Pro は ±0.31、HealthBench は ±0.42 である。ただし積み増した倍率が 1.9 倍から 625 倍までばらついているので、この4つを横並びにして「ベンチの性質の差」と読むことはできない。SWE-Bench Pro の伸びが小さいのは、出発点がすでに大きいからだ。加えて FrontierMath はこの研究の部分集合で 12 タスクしかなく、著者らは「ベンチ単位の傾向が個々の問題に左右されやすい」と断っている。伸びの側にも但し書きがあり、用いた手法が意図的に単純である以上、測った伸びは広く再現可能な推論スケーリングが達成しうる下限として読むべきだと著者ら自身が書いている1。もっとも、著者らはこの測定を単一のReAct型スキャフォールドで取っており、ベンチ間の差がスキャフォールド依存でありうると断っている(may therefore be scaffold-dependent rather than task-intrinsic)。より凝った手法なら絶対性能は領域ごとに違う形で動きうるとも書いている(possibly differently across domains)1。
しかも著者らは、伸びなかったことを「そのベンチが本質的に計算量で飽和している証拠ではない」と明示的に断っている1。実際、同じ総計算量を1本の長い試行から10本の短い試行へ配り直すと、HealthBench の伸びが5ベンチ中で最大になる(+0.283)。ただしこの数字は本来の連続スコアではなく、試行の最高得点が全試行の中央値 0.38 を超えたかで二値化した成功率である(1本のとき 0.501、10本で 0.784)。また10本側は、10本のうちどれか1本でも基準を超えれば解けたと数えている。どの1本が当たりかを選ぶ手段が無ければ、この差はそのままは手に入らない。動かなかったのは「予算を積むこと」であって、計算量そのものではない。予算の大きさと同じくらい、その配り方が効く。
ここから、評価にとって厄介な含意が出る。固定した(小さめの)予算で測ると、進んだモデルほど過小評価されうる。新しい世代のモデルは、大きな予算を与えて初めて本領を発揮することがあり、追加の計算を前の世代と同じようには使わない。だから、予算を固定した比較は、モデルが進むほど誤差を含みやすくなる、と著者らは論じる1。点数は、能力そのものではなく、能力と予算の組み合わせを映している。どういう形の関数になるかは、著者らも特定していない。提言は「能力を推論時計算の関数として報告する」ことまでだ1。
だから、「どちらが強いか」は予算を添えて初めて答えられる
含意を突き詰めると、比較の土台が揺らぐ。著者ら自身は順位という語を使わない。彼らが書くのは「予算を固定した比較は、モデルが進むほど誤解を招きやすくなる」(fixed-budget comparisons may become increasingly misleading as models improve)までだ1。そこから先の、ある予算では A が B に勝ち、別の予算では逆転しうるという読みは、本稿の推論だ。論文が測っているのは予算ごとの成功率と、その立ち上がり・傾き・天井であって、モデル同士の順位ではない。論文のデータが示すのは、公開時期との相関である。新しいモデルほど小さい予算のうちから解き始める(解き始めの予算と公開時期の順位相関は全ベンチで負、τ は −0.333〜−0.467)。大きな予算での到達点も、6ベンチ中5本で新しいモデルほど高い(HealthBench だけは τ = +0.067 で相関がない)1。この二つの相関は、予算ごとにモデルの曲線が交差するかどうかまでは示さない。予算しだいで各モデルの伸び幅と「天井」の推定は変わるが、順位がどこまで変わるかは、この相関だけでは判断できない。「どちらのモデルが強いか」という問いは、「いくらの予算で」を添えて初めて答えられる。
だから著者らは、能力を「推論時計算の関数」として報告せよ、プロトコルの選択を明示せよ、そして共有した広い計算レンジ上で、予算を揃えて世代を比べよと提言する1。一点のスコアではなく、予算を横軸にした曲線で見る。そうして初めて、「もう頭打ちのベンチ」と「予算を絞られて低く出ているだけのベンチ」を見分ける手がかりが得られる、という主張である。
費用を揃えて比べる手順は、別のチームが先に出していた
数学・常識推論という別の土俵で近い問題に取り組んだのが、Rumiantsev らの FEval-TTC だ2。対象は13の LLM(大規模言語モデル)。彼らの動機は、テスト時計算の手法を比べるとき、モデルの性能もAPIのドル費用も時間とともに揺れ、過去研究の結論が無効化されうるという再現性の懸念にある。そこで、少数ショットのプロンプトと解答抽出をデータセット横断で標準化し、1問あたりのトークン費用とドル費用を見積もる手順を用意して、条件のそろった比較を可能にすると提案する。
順序は逆で、費用をそろえて測る枠組みは McFadyen ら(2026年6月)より先にある。Rumiantsev らの FEval-TTC は2025年11月の公開だ。ただし FEval-TTC が第一に揃えるのはドル費用で、McFadyen らのようにトークン予算を横軸に取って能力曲線を描くわけではない(同論文で budget の語が出るのは参考文献の書名1件だけで、本文では使っていない。ただし1問あたりのトークン数も提供され、費用モデルはトークン数に比例するので、トークンで揃える比較も作れる)。二つのチームは動機を異にする。McFadyen らの動機は予算による過小評価、Rumiantsev らの動機は性能とAPI費用の経時変動による再現性だ。着いた結論も別々である。McFadyen らは「ベンチのスコアはプロトコル依存である」とし、Rumiantsev らは「統一した費用モデルにより、API 価格の変動から独立に手法どうしを比較できる」とする12。重なるのは問題意識であって結論ではない。
ただし「積めば伸びる」も一枚岩ではない
ここまでは「予算を積むほど点数が上がる」を前提に置いてきた。だが、その前提自体に反例がある。Gema らの Inverse Scaling in Test-Time Compute(14著者, TMLR 2025)は、推論を長くするほど精度が下がる課題群を構築して見せた(著者ら自身は、テスト時計算のスケーリングは有望なままだとも書いている)3。Claude は無関係情報に散漫になり、o 系は逆に散漫には強い代わり問題の枠組みに過適合する。複雑な演繹で焦点を失う崩れ方はどのモデルにも出ており、崩れ方は全部で5種類だという。
別の研究は、外部検索を禁じた(クローズドブックの)知識集約タスクでは、テスト時計算を増やしても精度は一貫して上がらないと測った5。ハルシネーションの増減はモデルの「答えを出す気」で動く、と著者らは書く。問いに挑む数が増えて誤答も増えるモデルもあれば、逆に棄権が増えてハルシネーションは減るが精度は上がらないモデルもあるという。加えて、早い段階の誤りを後から補強する確証バイアスと整合するパターンも観察した、としている。著者らはさらに、テスト時計算は固定モデルの後処理にすぎず正解についての情報を新たに足せない、という情報理論的な説明で「なぜ伸びないのか」のほうを裏づけている。
つまり「固定予算は進んだモデルを過小評価する」は、いつでも成り立つわけではない。予算を積めば伸びるタスクもあれば、積むと崩れるタスクもある。だから正確には、点数は予算の関数であると同時に、その関数は単調増加とは限らない。公平な比較には、予算を揃えるだけでなく、タスクごとに予算‐性能の形そのものを見る必要がある。そして見るべき変数は予算の大きさだけではない。同じ量をどう配るかでも、形は変わる。
実際、同じ論文は「幅(並列に何本も試す)と深さ(1本を長く考えさせる)のどちらが勝つか」が予算で入れ替わることを測っている1。10本に分けたほうが1本より良くなる境目は、HealthBench で約2.3万トークン、HLE で約22万トークンだ。対して FrontierMath では900万〜1000万、SWE-Bench Pro では2300万〜3000万で、1000倍のオーダーで違う。しかも新しい世代ほど並列化の恩恵は小さく、FrontierMath(12タスク)では最新の3モデルが「10本に分けるとかえって下がる」。同じ総計算量でも、どう配るかで勝ち手は変わる。
出典5件
-
McFadyen ほか「How Inference Compute Shapes Frontier LLM Evaluation」arXiv:2606.17930, 2026(査読前). https://arxiv.org/abs/2606.17930 — 最大12モデル・7ベンチで予算を掃引し、伸びはベンチで割れ、固定予算の比較は誤解を招きうると報告。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17
-
Rumiantsev ほか「FEval-TTC: Fair Evaluation Protocol for Test-Time Compute」arXiv:2511.01203, 2025(NeurIPS 2025 併設ワークショップ). https://arxiv.org/abs/2511.01203 — 13のLLMで、1問あたりのトークン・ドル費用を揃える手順。 ↩ ↩2 ↩3 ↩4
-
Gema ほか(14名)「Inverse Scaling in Test-Time Compute」Transactions on Machine Learning Research, 2025. https://arxiv.org/abs/2507.14417 — 推論を長くするほど精度が下がる課題群を作り、崩れ方を5種に分けた(査読付き)。 ↩ ↩2
-
[context] ARC Prize「Leaderboard」. https://arcprize.org/leaderboard — 1課題あたりの費用と点数を散布図に載せる。Artificial Analysis「Intelligence Benchmarking Methodology」は各社APIが報告するトークン数から実行費用を出す。 https://artificialanalysis.ai/methodology/intelligence-benchmarking ↩
-
Zhao ほか「Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet」COLM 2026. https://arxiv.org/abs/2509.06861 — 知識課題では推論の計算を増やしても精度が上がらないと報告。 ↩
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。