AI・信頼性・評価
LLMのモデル移行で何を測り直す?総合点が上がっても後退する項目
- モデル移行
- LLM
- ベンチマーク
- GPT-5.5
- GPT-5.6 Sol
- SuperGPQA
- Omni-MATH
- IFBench
- MMLU-Pro
- tinyBenchmarks
- Reliable Change Index
- Llama
- Qwen
- 総合点
- 項目単位
- 入れ替わり率
- 判定不能
- 並べ替え帰無分布
- 偽発見率
- 貪欲な単発評価
- 指示追従
- 提供元
- 受け入れ試験
- 汎用評価器
- 分布外
- 帰無較正
目次
自分の製品の中核に、よそが運用するモデルを借りて使っている。こちらが持つのは指示文と検証だけで、推論そのものは相手のサーバで動く。安く速く始められる代わりに、動いている当のものを自分の手元に持っていない。
やがて提供元から、古い版の受付を止めるという告知が来る。このとき選べないのは、いままでの版のまま動かし続けることだけである。新しい版を受け入れるか、別の提供元や自前の運用へ乗り換えるか、その機能ごと畳むかという選択肢は残る。ただし乗り換えは行き先が違うだけの移行で、確かめる仕事はむしろ増えるし、畳むのは機能を諦める判断である。だから判断は多くの場合、同じ提供元の新しい版へ移ることに落ち着く。そこで残る選択が、いつ、どれだけ確かめてから移るか、である。
そのとき判断材料として手元にあるのは、たいてい一つの数字、すなわち共通の問題集で新旧を採点し、新しいほうが高かった、という総合点である。提供元もそれを移行の根拠として掲げるし、こちらが社内を説得するときもその数字を使う。だが自分の製品が実際に投げている問い合わせは、その問題集とは別のものである。総合点が上がったという事実は、自分の使い方について何を保証しているのか。そこが空白のまま、期限だけが近づいてくる。
新旧を比べた総合点は移行の根拠としてどこまで使えるのか。足りないとしたら、代わりに何をどれだけ測れば足りるのか。
総合点の差は、改善した項目と後退した項目の差し引きであって、自分の作業が改善側と後退側のどちらに入るかは、その一つの数字からは決まらない。 2026年8月18日のプレプリントは、ある提供元のGPT製品系列で3つの移行を項目単位で測り、調べた移行×ベンチマークの組すべてで、確実に改善した項目と確実に後退した項目が同居したと報告する1。総合点が最も伸びた組にも、確実に後退した項目は残っていた1。まったく別のモデル系列(Llama・Qwen)を別の検定で調べた2026年4月の先行研究も、同じ形を見ている2。ただし動かない側も大きい。どちらの研究でも、項目の過半は版が変わっても確実な変化を示さない12。Cacioliの側では、その大半は版によらず常に正解か常に不正解になる項目である2。動くのは少数派で、総合点が丸ごと覆い隠す少数派である。 代わりに要るのは、自分の製品の項目を新旧それぞれで繰り返し解かせ、項目ごとに通過率を比べることである12。
総合点が5ポイント上がった移行の、中身を数える
※ この節の数値は説明のための仮定で、測定値ではありません。
100問の問題集で旧版と新版を採点し、旧版は70問、新版は75問に正解したとする。総合点は5ポイント上がった。この5ポイントの中身として、次の二つはどちらもありうる。
- 旧版が落としていた5問を新版が解けるようになり、残りの95問は何も変わらない。
- 旧版が落としていた15問を新版が解けるようになる一方で、旧版が解けていた10問を新版が落とす。
総合点はどちらも同じ+5ポイントである。後のほうで落ちた10問が、自分の製品が実際に投げる問い合わせに似ていれば、移行で困るのはその10問だ。総合点からは、二つのどちらが起きたのかを区別できない。
1問を1回ずつ解かせるだけでは、この区別もおぼつかない。正解する確率が6割の問題は、1回だけ採点すれば4割の確率で不正解に見える。旧版と新版で1回ずつ採点した結果が食い違っても、版の違いによるのか、たまたまの揺れなのかは決められない。同じ問題を何度も解かせて正解の割合を比べたとき、初めてその問題が動いたかどうかを言える。
総合点は、改善と後退の差し引きである
XuとWuは、ある提供元のGPT製品系列に絞って、3つの移行を項目単位で測った1。GPT-5.4→GPT-5.5、GPT-5.5→GPT-5.6 Sol、そして版を一つ飛ばすGPT-5.4→GPT-5.6 Solの3辺である。実務で起きるのはこの形である。使っていた版が止まり、提供元が指定した版へ移る。
使ったベンチマークは3つ、合計900項目。SuperGPQAは大学院水準の専門知識を問う多肢選択で500項目、Omni-MATHのhard分割はオリンピック級の数学問題で100項目、IFBenchは「箇条書きにするな」「三文以内で答えよ」といった指示にどれだけ従えるかを検証可能な形で採点する指示追従ベンチで300項目にあたる。知識・推論・書式追従という、業務のプロンプトが実際にまたぐ三方向を薄く覆う構成になっている。
肝心なのは評価方法だ。各項目を、各モデルに対してK=50回、独立した単発の呼び出しで問い合わせる。 1回の正誤ではなく、その項目の通過確率を推定するためである。要求パラメータはモデル識別子以外すべて固定で、推論にかける労力は三つのモデルに共通する段階のmediumに揃え、温度はこれらのモデルでは受け付けられない1。そのうえで項目ごとに、確実に改善/確実に後退/実用上同等/判定不能の4つに分類する。分類はFisherの正確確率検定に、Benjamini–Hochberg法による偽発見率(複数の検定を並べたとき、有意と判定したもののうち誤りが占める割合)の5%制御を移行×ベンチマークの各セル内でかけたうえ、実質的な差として通過確率が20パーセントポイント動いたことを要求する。
結果が下の表である。Δは総合スコアの変化幅(パーセントポイント)、続く二つは項目の割合(%)で、単位が違う。
| 移行 × ベンチマーク | 総合Δ / 確実に改善・確実に後退 |
|---|---|
| 5.4→5.5・SuperGPQA | +2.3pt / 8.2%・5.0% |
| 5.4→5.5・Omni-MATH | +7.3pt / 17.0%・6.0% |
| 5.4→5.5・IFBench | +1.9pt / 11.3%・8.3% |
| 5.5→Sol・SuperGPQA | +1.4pt / 7.6%・4.4% |
| 5.5→Sol・Omni-MATH | −4.1pt / 9.0%・15.0% |
| 5.5→Sol・IFBench | −3.9pt / 6.7%・13.3% |
| 5.4→Sol・SuperGPQA | +3.8pt / 10.8%・4.8% |
| 5.4→Sol・Omni-MATH | +3.2pt / 10.0%・5.0% |
| 5.4→Sol・IFBench | −2.0pt / 10.7%・13.3% |
読み方は二つある。ひとつは、9組のどこにも改善と後退が同居していること。総合点が最も伸びた5.4→5.5のOmni-MATH(+7.3ポイント)でも、確実に後退した項目は6.0%残る。伸びた組で後退割合が最も大きかったのは5.4→5.5のIFBenchの8.3%で、こちらの総合Δは+1.9ポイントである。この二つは別のセルの話であって、7.3ポイント伸びた組に8.3%の後退があったのではない。逆向きも同じで、総合点が4.1ポイント下がった5.5→SolのOmni-MATHでも、9.0%の項目は確実に改善している。総合点の符号は、その組で何も後退していない/何も改善していないことを意味しない。
もうひとつは、確実に後退した項目の割合が4.4%から15.0%の帯に収まっていることだ。一見小さい。だが自分の製品が投げる問い合わせが、たまたまその帯に集中していない保証はどこにもない。総合点は全項目を平均した数字なので、平均の下でどの項目が入れ替わったかは定義上そこに残らない。項目単位の増減は、平均を取る前にしか見えない。
別のモデル系列でも、同じ形が出た
一社の製品系列で見えた形が、その社に固有の事情でないかは別に確かめる必要がある。Cacioliの研究は、著者も対象のモデル系列も別のところで同じ問いを立てている2。臨床心理学で個人の変化が測定誤差を超えたかを判定するために使われる信頼性変化指標(Reliable Change Index)を、モデルの版差に持ち込んだものだ。対象はMMLU-Proの2,000項目、版の組はLlama 3→3.1とQwen 2.5→3の2つで、各項目を各モデルに10回、温度0.7で問い合わせている2。モデルはどれも7〜8B規模で、すべてQ5_K_M形式に量子化して動かしている2。ただしこの二つの研究は完全に独立ではない。XuとWuはCacioliを引用し、自分たちの実験を「反復サンプリングの線をフロンティア商用APIの移行へ延長したもの」だと書いている1。検定はRCIとFisher/BHで別だが、反復サンプリングと1,000回の並べ替え帰無較正という骨格は共通する。それでも、別の著者が別のモデル系列で先に同じ形を見ていたことは、一社に固有の事情ではないことの手がかりにはなる。
結果はまず安定側から読むべきだ。ベンチマーク全体で見ると、確実な変化を示さなかった項目がLlamaで79%、Qwenで72%を占める。 版を上げても、大多数の項目の振る舞いは統計的に区別できるほど動かない。移行のたびに全面的な作り直しが要るという話ではない。ただしこの数字の出どころには但し書きが要る。Cacioliは、この結果が「版によらず決定的に正解または不正解になる床・天井の項目に支配されている」ものだと書いている。7〜8B規模ではMMLU-Proの大半が、自明に正解か、まったく歯が立たないかのどちらかに寄るためである2。79%・72%が主に映しているのは、動きうる項目の安定度ではなく、そもそも動きようのない項目の多さのほうだ。
そのうえで、動いた側の内訳が効いてくる。ここでいう解析可能な項目とは、どちらの版でも通過率がちょうど0か1だった項目、つまり常に不正解か、常に正解かのどちらかだった項目を除いた残りで、分母が全体とは違う。落ちたのはLlamaで1,048項目(52.4%)、Qwenで1,348項目(67.4%)にのぼり、情報が足りずに落ちた項目は原典によれば1件もない。その残りで見ると、Llamaでは34%が改善し28%が悪化、Qwenでは47%が改善し39%が悪化した。改善と悪化はここでも同居する。 ただし原典の帰無較正を通ったのは、Llamaでは改善(321件)と悪化(270件)の両方だが、Qwenでは改善(306件)だけだ。Qwenの悪化にあたる254件は、帰無分布の95パーセンタイルにあたる299件、すなわち版のラベルを入れ替えただけでも生じうる範囲の内側にあると原典は書いている2。悪化側が雑音の上にはっきり立っているのは、2組のうちLlamaの1組である。
全体の79%・72%と、この34%・28%を混ぜて読んではいけない。前者はベンチマーク全体に対する割合、後者は解析可能な部分集合に対する割合である。ただし原典のLlamaの数値は、改善・悪化を321件/270件とする系と、220件/206件とする系に割れている2。全体と部分集合の割合も、Qwenでは算術で閉じるがLlamaでは閉じない。Llamaの内訳を細かい判断の根拠にしないほうがよい。
この研究には、評価方法そのものについての所見もある。貪欲な単発評価とは、温度を下げて1回だけ答えさせ、その正誤を採る、いちばんよく使われるやり方である。これは確実に変化した項目の42%を取り逃がした。逆に、単発が「変化あり」と挙げた項目の25%は、繰り返し測ると確実な変化ではなかった。 この比較は原典がLlamaの対で回したもので、温度0の貪欲データ1,997項目との突き合わせである2。原典はこの結果を、単発評価は雑音による反転を拾いすぎる一方で、本物の確率の変化を拾い損ねる、とまとめ、低コストの代替として1項目3回以上の確率的な抽出を勧めている(この3回は、測定の信頼性を外挿して出した数である)2。項目単位で見ようと決めた時点で、繰り返し回数は削れない部分になる。
変化の向きにも偏りがある。もともと正解率の低かった項目は版を上げると改善しやすく、逆に正解率の高かった項目のほうが劣化しやすい。ただし原典は、この極値での向きの非対称を説明するのは「平均への回帰」だとしている。床に近い項目は上がるしかなく、天井に近い項目は下がるしかない2。版そのものの効果として原典が切り分けているのは、回帰では説明できない分野ごとの反転のほうである。失った領域は系列ごとに違い、Llamaは物理を落とし、Qwenは法律を落としている。原典はこれを利用者の側から書いている。総合点が上がったことを理由にLlama 3.1を選んだ利用者は、物理でLlama 3より悪い性能を経験することになり、Qwen 3を選んだ利用者は法律で悪化を経験する。どちらも総合点からはそれを知りえない2。分野の偏りは検定も支持している(2組ともχ²検定でp < .001)。2系列で共通に解析できた431項目では、確実な変化の相関はほぼゼロだった(r = .11)2。Llamaで確実に変化した項目と、Qwenで変化した項目は、ほとんど重ならない。Cacioliは、総合的な性能値の横に項目の入れ替わり率(churn)を併記せよと勧めている2。
分野によって向きが分かれること自体は、商用APIの側にも見えている。XuとWuの付録はSuperGPQAの分野別に版をまたいだ変化を並べており、5.4→5.5では医学が3.2ポイント下がる一方で工学は3.8ポイント上がり、次の5.5→Solでは医学が6.2ポイント上がって工学はほぼ動かない1。ただしこの層別は検定を伴わない記述であり、振れ幅が最も大きい層は項目数が一桁である(法律6件、軍事学4件)。
「確実に変わった」の敷居は、かなり高い
ここまでの数字を実務に持ち込む前に、何を「変わった」と数えたのかを見ておく必要がある。XuとWuの実質的有意水準はε=0.2、つまりその項目の通過確率が20パーセントポイント動いていなければ、確実な変化として数えない1。50回中25回通っていた項目が35回通るようになる、くらいの幅である。かなり大きい。
これは両側に効く。片側は保守的な方向だ。著者らが報告した4.4〜15.0%という後退割合は、この大きな敷居を越えた項目だけを数えた値なので、後退の量としては下限に近い読み方になる。著者らは統計的な有意性をFisher検定と偽発見率制御で担保し、ラベルを1,000回入れ替えた並べ替え帰無分布に対して較正している。その較正では、9つのセルすべてで確実な変化割合の95パーセンタイルが0.0%だった。真の変化がゼロのとき、この手続きは偽の「確実な変化」を1件も出していない1。
もう片側は、これらの数字が実務上の安全側にならない方向だ。原典自身が、εと試行回数の組み合わせが検出できる変化の大きさを決めており、それより小さい真の変化は「判定不能」の側に残ると書いている。判定不能の割合は上の表では割愛したが、原典の同じ表にある。その割合は7.6%から24.7%まで開き、IFBenchでは3つの辺すべてで20%を超える。つまり「実用上同等」と「判定不能」を足した大きな塊は、変化がないことの証明ではない。20パーセントポイントに届かない後退は、そこに紛れている。ただし原典は敷居をε=0.10まで下げた感度分析も載せており、そこでも後退割合の増分は9つのセルのどこでも最大1.0ポイントにとどまる(この差分は原典の付録の表から読み取れる)1。敷居を下げてもこの塊はほとんど薄くならない。ここで効いているのは敷居の高さではなく、試行回数の側である。
原典が明示する限界はほかに二つある。ひとつはベンチマークの選定で、著者らは調べるモデルがまだ伸びしろを残しているベンチマークを選んでいる。天井に張り付いたベンチマークでは項目単位の変化がそもそも観測できないからだが、その代償として、報告した割合は「情報量のあるベンチマークについての推定値であって、任意のワークロードに対する母集団の比率ではない」と著者自身が書いている。スクリーニングの段階では、広く使われるGPQA Diamond・MMLU-Pro(前節のCacioliの題材)・IFEvalが、少なくとも一つのモデルの正解率が0.1〜0.9に入る項目の割合で7〜27%にとどまり、35%の閾値を下回って外されている1。この4.4〜15.0%を、そのまま自分の業務データの期待値に置き換えることはできない。 ただし著者ら自身は、同じ割合を「自社のワークロード向けの受け入れ試験を設計するときの参照率」としてなら使えると書いている。期待値そのものに据えるのではなく、桁の当たりを付ける参照として扱う、という距離の取り方である。
もうひとつは対象の狭さで、一社の製品系列と公開ベンチマーク3本にとどまる。別系列で同じ形が出たことは前節のCacioliが先に示しているが2、その対象は2系列にとどまる。
公開ベンチマークに限られるという点のほうは、XuとWu自身が引く別の評価が部分的に補っている。ある評価事業者が、凍結した企業ワークフロー711本を新旧それぞれ1タスク5回ずつ走らせ、最終的なデータベース状態だけで採点した3。推論にかける労力を揃えて比べたGPT-5.6は、どの構成もGPT-5.5を下回った。公開のエージェント評価のほうでは、最高設定で走らせた同じGPT-5.6がGPT-5.5に勝ち越しているにもかかわらず、である3。同じ事業者によれば、公開評価での他社のモデル間のばらつきは±9ポイントあり、同じ系列の中の4〜9ポイントの後退はその解像度では見えず、同じタスクを対で比べる設計でしか分からない3。事業者はこの食い違いをモデルの優劣ではなく評価の条件への依存として書くが、新旧は別の期間に集めたもので、その間に提供側の配信が変わった可能性だけは除外できないとも書いている3。
採点の締め方でも数字は動く。IFBenchの最新の移行(5.5→Sol)は、厳格な採点で3.9ポイントの後退だが、緩い採点に切り替えると後退幅は0.04ポイントまで縮む。厳格と緩和の差が、この移行で3.9パーセントポイント開いた1。指示追従を厳格に採点するとは、指示が要求する書式や字数の条件をすべて満たして初めて通過と数えることだ。緩い採点なら、大筋が合っていれば通る。自分の後段が出力を機械で解析しているなら、見るべきは厳格側である。緩い採点の数字だけを見て「ほぼ変わらない」と判断すると、パーサが落ちる形の後退を丸ごと見逃す。原典の応答分類でも、IFBenchの書式失敗は15,000応答あたりGPT-5.5の771件からSolの1,352件へ増えている1。
測り直しの値段は、思ったより低い
ここまでを額面どおりに受け取ると、移行のたびに900項目×50回のような測定を回す話になり、現場では通らない。だが「何を測るか」を分ければ、支払う額は下がる。
総合的な位置づけを知るだけなら、測定は安い。PoloらのtinyBenchmarksは、その点を正面から示した研究だ4。要旨は「MMLUというよく使われる14,000問の多肢選択QAベンチマークについて、あるLLMの性能を正確に推定するには、厳選した100問で評価すれば十分であることを示す」と書いている。著者らはOpen LLM Leaderboard、MMLU、HELM、AlpacaEval 2.0の縮小版を公開し、これらが「元の評価結果を信頼できる形で効率的に再現するのに十分」だと報告している。総合点を出し直すだけなら、ベンチマークによっては桁が二つ落ちる。
ただし、この安さは項目単位の増減には効かない。tinyBenchmarksが安く推定しているのは総合的な水準であって、どの項目が入れ替わったかではない。 縮小版は元の平均を再現するように厳選されており、平均を再現する100問は、後退した項目を見つけるための100問ではない。二つは測っている対象が違う。
安さには精度の限界も付いてくる。原典が報告している推定誤差は、100問で平均約2%である。MMLUを100問で推定したときについては、性能が極端に低い1モデルを除けば誤差は4%を超えなかったとも報告しているが、他のベンチマークについて原典が示すのは平均誤差の曲線までだ4。上の表に並んだ9つの移行のうち7つは、総合Δの絶対値がその4%を下回る。8つめ(4.1ポイント)もほぼ同じ大きさで、明確に外側にあるのは+7.3ポイントの1つだけだ。しかも新旧2つのモデルをそれぞれ推定して差を取るので、誤差は片側だけでは済まない。原典が示しているのは水準の推定精度であって、二つの版の差を判定できるかどうかではない。それでも実務上の意味は小さくない。移行判断のうち「新しい版が桁違いに劣ってはいないか」の部分は既存の安いツールで片づき、追加で買う必要があるのは項目単位の側だけになる。
XuとWuは隣接研究として、移行の前後で正解が不正解に変わる項目(negative flip)を提供元側の訓練で減らす研究と、提供終了を迎えたモデルの置き換え判断をベイズ的な候補比較で支える実運用向けの移行の枠組み(Caseyら)を挙げている1。項目単位の側にも、費用を下げる方向の研究はある。Pacchiardiらは、新しいモデルを100問程度の参照集合で試し、その結果と問題の特徴量から、未見の問題ごとの成否を予測する汎用の評価器(assessor)を訓練する構成を示した5。HELM-Lite(複数の提供元の30モデルの既存結果)と、著者らが編んだKindsOfReasoning(2024年1月時点までのOpenAIの指示調整済み14モデル)で検証している。著者らが報告した結果は、汎用評価器の訓練に使ったのと同じ分布の問題を予測するかぎり、この汎用評価器が、全問題で訓練したモデル固有の評価器に匹敵する性能を出すというものである。原典の結論節の言い方では「わずかに劣るだけ」である。しかも参照問題をランダムに選んでも、著者らが試した高度な選択手法と同等だった。選び方に凝る必要がない、というのは実装側にとって大きい。
ただしPacchiardiら自身が断る限界がそのまま効いてくる。分布外の問題に対しては、全体として性能が落ちる。 原典はそこで止めていない。分布外では試したどの手法も明確には勝たず、項目単位の予測可能性そのものが総じて低いと書き、著者らは自分たちの仕事の意義を「LLMの内在的な予測可能性の低さへの注意喚起」だとまで述べている5。公開ベンチマークで訓練した評価器を、その訓練問題と分布の異なる自社の問い合わせに当てる場合は、分布外での予測にあたる。本稿が公開ベンチマークの総合点で判断できないと言うのは、総合点が項目の増減を映さないうえに、自社の問い合わせがその分布から外れているからでもある。参照集合の予測を自社データに外挿する構成は、tinyBenchmarksとPacchiardiらのどちらも支持していない領域に入る。
そもそもPacchiardiらの構成は、参照集合さえ自社データから取れば回せるものではない。原典の手順は三段である。(1) 既に評価済みの複数のLLMについて項目単位の結果を集め、そこから参照集合を切り出す、(2) その上で汎用評価器を訓練する、(3) 新しいモデルを参照集合で試して当てはめる5。自社データでこれを回すには、自社の項目を複数のモデル版で先に一通り評価しておかなければならない。それはこの節が下げようとしている費用そのものだ。原典が「あるLLMファミリーの全版についての項目単位の結果としては、知る限り初の公開だ」と書いているのは、その一式がそう簡単には揃わないことの裏返しでもある。
一方で、項目単位の側には削れないものが残る。XuとWuは、K=50の記録から1項目1回ぶんを無作為に抜いて新旧を比べ直してもいる。確実に変化した457件のうち、単発でも同じ向きに反転して見えたのは207件で、232件は単発では変化なしに見えた1。逆に単発で反転した396件のうち171件は、50回で測ると確実な変化ではなかった1。1回対1回の比較は、原典の判定手順ではそもそも有意に届かない1。総合的な水準の確認は既に安いが、省けないのは、自分の項目を、繰り返して、新旧の対で測ることのほうである。
出典5件
-
Xu, Wu「What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations」arXiv, 2026. https://arxiv.org/abs/2608.17719 — 査読前。GPTの3移行・900項目×50回で、全9組に改善と後退が同居。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18
-
J.-P. Cacioli「Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation」arXiv, 2026. https://arxiv.org/abs/2604.27405 — 査読前。信頼性変化指標を版差に当て、MMLU-Pro 2,000項目を各10回測った。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17
-
Toloka AI「GPT-5.6 got smarter. Then it kept acting.」ブログ, 2026. https://toloka.ai/blog/gpt-5.6-got-smarter-then-it-kept-acting/ — 査読を経ない事業者の評価。企業ワークフロー711本で、労力を揃えたGPT-5.6の全構成がGPT-5.5を下回った。 ↩ ↩2 ↩3 ↩4
-
F. Maia Polo ほか「tinyBenchmarks: evaluating LLMs with fewer examples」ICML, 2024. https://arxiv.org/abs/2402.14992 — 厳選100問で総合的な水準を平均誤差約2%で推定する。項目の入れ替わりは測らない。 ↩ ↩2
-
Pacchiardi ほか「100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances」KDD 2024 ワークショップ. https://arxiv.org/abs/2409.03563 — 少数問で成否を予測。分布外で劣化。 ↩ ↩2 ↩3
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。