AI・信頼性・評価
ロボット評価は試行10回、40ポイント差でも区別できない
目次
ロボットが実機で物をつかみ、運び、置く作業について、論文は結果を「何回試して何回成功したか」で報告する。手法を変えたら成功率が上がった、と論文が書いていれば、読む側は改良が効いたと受け取る。数字が並んでいるので、確かめようがないとも感じる。
ところが実機の試行は、シミュレーションと違って一回ごとに手間がかかる。物を並べ直し、機械を戻し、壊れれば直す。だから試行の回数は少なくなる。少ない回数から出た割合は、見た目の印象よりも大きく揺れる。硬貨を数回投げて表が多く出たからといって、その硬貨が偏っているとは言えないのと同じことだ。
改良が効いたのか、たまたまそう出ただけなのかを、論文が報告した割合だけから区別するのは難しい。だが区別するための計算そのものは、紙の上でできるほど簡単である。必要なのは新しい統計の知識ではなく、その割合が何回の試行から出たのかを確かめる習慣のほうだ。
論文が報告した成功率のうち、どこまでが改良の効果で、どこからが偶然の揺れなのか。本稿は、読者が自分で検算できる形で確かめる。
実機ロボットの論文は、課題ごとの成功率を10回前後の試行で報告する(本稿が挙げた例は9〜15回で、条件あたり50ロールアウトを回した1本だけが例外だ)。試行が10回だと、40ポイントの改善でも差の95%区間が0をまたぐことがある。Gemini Robotics-ER が実機で報告した 3/10 → 7/10 がその例である1。ただし、それは境目に近い例である。同じ差を試行数だけ20回へ置き直せば、成功回数のどの内訳でも0を除外する。これは論文が報告した実験ではなく、本稿が紙の上で置き直した計算である。また、試行数を増やすだけでは足りない。共有評価基盤の運用者は、同じモデル・同じ課題でも成功率が大きく振れると書き、試行数ではなく初期状態の統制という別の一手を足している2。
出典について。 本稿が引く11本のうち、査読付きの会議か論文誌に載ったのは6本である。Snyder らは Robotics: Science and Systems XXI に、Lynnerup らは CoRL 2019 に、Johns は CoRL 2021 に載っている。RoboArena は CoRL 2025(PMLR 305)に、TRI の作業は Science Robotics(2026年4月)に載った。「20〜30試行」の出所を追った Badithela らの論文は、ICRA 2026 が採択し、著者らが2026年6月に本会議で発表した。Gemini Robotics・RoboChallenge・LingBot-VLA の3本は、2026年9月13日時点で Crossref と OpenAlex に掲載版の記録が無い arXiv のプレプリントである。Kress-Gazit らの実施指針と、Badithela らの脚注で挙げる PhAIL・FailBench、順位表の照合に挙げた DM0・Qwen-RobotManip も、2026年9月22日時点で同様である。Norton & Flynn は ICRA 2024 のワークショップ発表である。本稿は、その査読の有無を確認できていない。∴ 本稿が検算に使った数値(Gemini Robotics)と運用者の証言(RoboChallenge)は査読前の資料から取り、対照に置いた最も厳密な作業(TRI)は査読誌に載っている。
1行でできる検算
必要なのは、成功回数と試行回数だけだ。ふたつの成功率を比べるとき、見るべきはそれぞれの区間が重なるかではなく、差の区間が0を含むかである。前者で判定するのは誤りで、実際に食い違う。
Gemini Robotics 論文の実機 Table 6(Gemini Robotics-ER、バナナの受け渡し、N=10)で見てみる。ゼロショットが 3/10=30%、文脈内学習が 7/10=70%。差は +40ポイントで、見出しに書ける大きさだ。だが差の95%区間は [−2.9, +67.2] で、0をまたぐ。Fisher の p は 0.179。10回のうち何回成功したかという情報は、40ポイントの差を支えるには足りない。
同じ表の拭き取り課題(N=9、44% → 67%)も同じで、+22.2ポイントに対し区間は [−20.3, +55.5](p = 0.637)。
ただし表の3課題目は逆だ。 ドレス折りたたみ(N=9、0% → 56%)は差が +55.6ポイントあり、区間 [+14.0, +81.1](p = 0.029)で0を除外する。試行数が同じでも、効果量が十分大きければ立つ。 問題は「N が小さいと何も言えない」ことではなく、N が小さいほど、言えるようになるまでに必要な差が大きくなることだ。
しかもこのドレス折りたたみは、個別の区間は [26.7, 81.1] と [0.0, 29.9] でわずかに重なるのに、差の区間は0を除外する。「区間が重なっているから差はない」と読むと、この結果を取りこぼす。見るべきは差の区間のほうだ。
試行数が10から20に増えると、何が変わるか
まず、ほかを全部止めて試行数だけを動かすとどうなるかを見る。上の 3/10 対 7/10 と同じ30%対70%を、試行20回に置き直せばいい。6/20 対 14/20 なら、差の95%区間は [+9.0, +61.9]、Fisher の p = 0.026 で0を除外する。20回で40ポイント差になる内訳はほかにもあるが(0/20 対 8/20 から 12/20 対 20/20 まで)、そのどれもが0を除外する。区間の下限が最も0に近いのが上の 6/20 対 14/20 だ。これは論文が報告した実験ではなく、同じ差を試行数だけ変えて置き直した計算である(区間とpの出し方は実機の例と同じ1)。効く分かれ目は、10と20のあいだにある。
実際の論文にも、近い対比が載っている。同じ論文のシミュレーション側に、実機と同じバナナ受け渡し、同じ Gemini Robotics-ER、同じゼロショット対文脈内学習の比較があり、成功率は 54% 対 96%(N=50)である。差は +42ポイントで実機の +40ポイントとほぼ同じなのに、区間は [+25.9, +55.9]、p < 0.001 で0を大きく離れる1。ただし、ここで変わったのは試行数だけではない。 実機からシミュへ評価環境そのものが移り、成功率の水準も 30%→54%・70%→96% と上がっている。区間の幅は試行数だけでなく水準にも依存し、96% は天井際で締まる側だ(脚注のとおり、シミュ側は初期条件をランダム化した設定でもある1)。試行数の効果を分離した実験としては読めない。読めるのは、同じ大きさの差が N=10 では0をまたぎ N=50 では大きく離れる、という対比までである。試行数だけを動かした比較が要るなら、上の N=20 の置き直しのほうがそれにあたる。
必要な検定を実際にやっている論文は少ない
本稿は一次論文12本を調べた。そのうち必要な検定を回していたのは1本である。それは Toyota Research Institute の Large Behavior Model の作業で、条件あたり50ロールアウト、盲検A/B、多重比較補正まで揃えている3。
多くはそうではない。Gemini Robotics は、上の表とは別の節(旗艦モデルの評価)について「A/Bテストと統計解析を伴う厳密な実機実験」と述べ、付録で対応のあるt検定に言及する。だが全文を通して p値の数値表記は0件、信頼区間の報告も0件である1。significant は11箇所あるが、検定の出力を伴うものは1つも無い。旗艦モデルの主結果図(図16)のキャプションからして significantly outperforms the baselines と結ぶだけで、20課題の棒グラフに誤差棒は付いていない。検定手法を宣言していることと、その出力を報告していることは別である。
2026年の実機リリースにも、N=15 を「統計的な頑健性のため」と説明して区間を報告しない例がある。初期条件のランダム化も評価環境の固定も明記しているので、足りないのは統制ではなく推論のほうだ4。なお、試行数を減らす手法を設計している側も、実行可能な試行数が10や50に制約されること自体は前提として認めている5。なお、後続の論文が引く「20〜30試行」という数はこの論文には無く、著者を三名共有する次の論文が書いた数である(2026年の2本がそれを写し、うち1本はこの論文の言葉として引用符つきで引いている)6。
試行を増やすだけでは足りず、運用者はもう一手を足している
ここまでの算術は、素直に読めば「もっと回せ」という処方になる。現場の運用者は、それだけでは足りないと言っている。
実機を集中運用してオンラインで評価を提供する RoboChallenge の報告は、評価手順の節の冒頭で even with the same set of props, task and model, the measured success rate can change even from 0% to 100% or vice versa と書く。さらに Even with a sufficient number of runs, the recorded success rate varies considerably と述べる2。
試行を十分に重ねても残るこのばらつきの原因として、原典はテスターによる初期配置の違いを挙げる。物体の初期配置には「うまくいきやすい一角」があり、3群のテスターのうち「適応的テスター」=モデルの著者自身が、それを見つけて意図的に使っていた。原典は図4のキャプションで exploited this for maximal performance. This biased the test. と書いている2。ただし3群のテスターを比べた実験そのもの(図3)は2課題・各群1点であり、原典は試行回数を図にもキャプションにも書いていない。本稿が読者に勧めている探し方を、この図は満たしていない。図4のほうは適応的テスターが選んだ箱の位置を成否で色分けして描いており、数えると10個で、成功を示す緑は3個である。図3でこのテスターがフライドポテトの課題に出した30%と数は合うが、原典は同じ試行だとは書いていない。証言としては重いが、量としては小さい。それでも、評価する側が結果に利害を持つとき、ばらつきは偶然ではなく方向を持つ。
そして原典はこの問題を投げ出していない。同じ節は controlled tester という手順を導入している。この手順は、参照エピソードの初期フレームをテスターのプレビュー画面に重ね、実際の配置がそれに一致するまで調整させる。そのうえで the initial state of the scene and objects is largely fixed across the evaluation of different models と結ぶ2。足したのは試行数ではなく、初期状態の統制である。
現場が実際に採っている代替
では、現場は何をしているか。絶対的な成功率をそのまま主張するのをやめて、測る対象のほうを動かす動きがある。水準を主張したまま、実機の少なさを別の手段で補う試みもある。
- 水準ではなく順位で比べる。 分散評価の RoboArena は、7大学にまたがる7つの方策を612件の対比較で並べ、そのつど同じ課題で残りの5方策も走らせて採点し、全7方策ぶん(計 4,284 ロールアウト=612×7)から作った基準順位と突き合わせている7。別立ての実験ではなく、1回のセッションで7方策すべてを回した結果である。順序をつける用途には妥当だ。ただしこの論文が示している不確かさは、順位が収束していく様子を描いた図7の帯までで、方策どうしの差については区間もp値も報告していない。
- 測る量を二値から連続量へ広げる。 成功か失敗かの0/1ではなく、課題のどこまで進んだかを0〜1で採る部分進捗スコアを併せて報告する。Gemini Robotics・RoboChallenge・LingBot-VLA は成功率と並べてこれを載せており124、RoboArena が基準順位を作るのに集計したのも各方策の部分進捗スコアである7。
- シミュレーションで実機の少なさを補う。 Badithela らは、少数の実機評価とそれと対にしたシミュレーション評価で大規模なシミュレーションの偏りを補正し、平均成功率に信頼区間を付ける枠組みを出している6。同程度の区間を得るのに省けた実機評価の手間は20〜25%余りで、試行を桁で減らすものではない6。
一次資料が支えているのは「100件ほどの対比較を集めれば順位は安定する」までだ。RoboArena は RoboArena converges to high-quality rankings within just 100 pairwise comparisons と報告している7。一方で「同じ規模で絶対的な成功率を区別できる」を支える資料は、本稿が当たった範囲には無かった。この順位の収束結果からは、水準の区別に要る試行数は判断できない。 なお、数える単位は対比較とロールアウトで違う。対比較1件はロールアウト2回にあたる。RoboChallenge の課題別順位表のセルは run 1本の値で、同じ提出が同じ課題を複数回走らせていれば、その中から選ばれた1本の値である。論文が基線として引いた値と現在の表示は、同じ提出名でも一致するとは限らない。本稿が当たった範囲では、この順位表の値を引く6本のうち、引いた時点を書いているのは2本にとどまる8。
欠けているのは統計の知識ではない
最後に、この調査で一番再利用が効く観察を置く。実機評価のやり方を問い直す論文は、2019年から繰り返し書かれている。まず、実機での再現性と有意差検定の欠如を指摘した Lynnerup ら(2019)9と、評価指標を機械学習からの借り物だと批判した Johns(2021)10がある。続いて、反復・再現・追試の枠組みを提案した Norton & Flynn(2024)11、成功率だけの報告と試行数・統計解析の欠落を指摘し、盲検A/Bを含む実施指針を出した Kress-Gazit ら(2024)12、そして本稿が挙げた TRI(2025)3 である。ただしこれらは同じことを言っているのではない。Johns の処方は時間効率であって統計的検出力ではなく、系譜を一本に束ねるのは正確ではない。
確かめられるのは、もっと限定的で、そのぶん硬い事実のほうだ。RoboChallenge・RoboArena・LingBot-VLA の3本は、参考文献に TRI の2025年の作業を挙げていない(各PDFの参考文献を検索して0件)3274。これは出た順の帰結ではない。3本とも、2025年7月の TRI の公開より後の版がある。一方、同じ時期の Badithela らは、この作業を厳密な統計的評価の手法で比べた研究として参考文献に挙げている6。この作業の方法論は、TRI 自身が2024年の実施指針に帰しており(盲検・初期条件の統制・一様事前分布の Bayes 解析)、指針のほうは RoboArena が評価条件の統制の文脈で、Badithela らが実施指針の一覧として引いている1276。RoboChallenge と LingBot-VLA は、指針も挙げていない24。
つまり不足しているのは統計の知識ではなく、評価方法論が隣接する作業へ届き、蓄積していく経路のほうかもしれない。TRI の作業を参考文献に挙げる例と挙げない例が、同じ時期に並んでいる。ただし「同じ主張が周期的に再発見されている」と言い切るには、上の5本それぞれの参照関係を突き合わせる必要がある。本稿が突き合わせたのは、2024年の指針が Snyder ら・Badithela ら・TRI の2025年の作業に引かれ、Badithela らが TRI の作業も直接引いている範囲までである126。
実務で何を見るか
- 試行数を先に探す。 成功率の隣に N が書かれていなければ、その差は読めない。表のキャプションか付録にあることが多い。
- 差の区間で判断する。 それぞれの区間が重なるかどうかではなく、差の区間が0を含むかを見る。重なっていても差が立つ場合がある。
- 「厳密な統計解析」の宣言と、その出力を分けて読む。 検定名が書いてあることと、p値や区間が報告されていることは別である。
- 順位の主張と水準の主張を分ける。 「Aのほうが良い」と「Aは何%できる」は別の主張で、前者を支える試行数が後者も支えるとは限らない。
- 試行数だけでは買えないものがある。 誰がどう設置して評価したかが揃っていなければ、試行を増やしても同じ数字にはならない。
数字の隣に試行数が無いとき、読者にできることは多くない。だが試行数さえ書いてあれば、その差が偶然の揺れで説明できるかどうかは、その場で確かめられる。
出典12件
-
Gemini Robotics Team, “Gemini Robotics: Bringing AI into the Physical World”(arXiv:2503.20020, 2025年)。実機 Table 6 のキャプションは
Reported rates are the average over 10 trials for banana handover and 9 for fold dress and wiping.、シミュレーション Table 5 はReported numbers are the average success rate over 50 trials with random initial conditions.。本文はAll empirical evidence presented in this section is based on rigorous real-world robot experiments, with A/B testing and statistical analysisと述べ、付録はThis allows us to use a pairwise t-test to more robustly evaluate improvements over baselines.と記す。ただし全文でt-testはこの1箇所のみで、p値の数値表記も信頼区間の報告も0件。§3.2 の主結果図(図16)はGemini Robotics significantly outperforms the baselines.と結ぶが、20課題×3手法の棒グラフに誤差棒は無く、図21・図23も同じである(誤差棒は抽出したテキストに写らないので、図そのものを見て確かめた)。付録は二値の判定に連続指標を併記しており、Each evaluation is marked either success or failure (0 for failure, 1 for full completion). Furthermore, we also use a continuous metric, progress score, between 0 and 1, reflecting the proportion of the task completed.と記す。本稿が挙げた区間とp値は、論文が報告した成功回数と試行数から本稿が計算したもの(Newcombe 法の差の95%区間および Fisher 正確検定の両側p)。ただし N=20 の 6/20 対 14/20 だけは報告値ではなく、同じ30%対70%を試行20回に置き直した仮想の内訳に同じ方法を当てた計算である(20回で40ポイント差になる13通りの内訳をすべて計算すると、区間の下限が最も0に近いのがこの内訳で [+9.0, +61.9]、p = 0.026)。 https://arxiv.org/abs/2503.20020 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 -
Yakefu, Xie ほか(Dexmal + Hugging Face), “RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies”(arXiv:2510.17950, 2025年)。評価手順の節で
One of the major obstacles in real machine testing is the dramatic variation of the test results from run to run. In our experience, even with the same set of props, task and model, the measured success rate can change even from 0% to 100% or vice versa.と述べ、続けてEven with a sufficient number of runs, the recorded success rate varies considerably. The adaptive testers get better results.と報告する。物体配置の「うまくいきやすい一角」(there is a particular favorable set of object positions in which the task is more likely to succeed)を図で示している。同じ節は解決策まで書いており、参照エピソードの初期フレームを重ねて配置を合わせるcontrolled testerを導入してthe initial state of the scene and objects is largely fixed across the evaluation of different modelsと結ぶ。指標も二値だけではなく、We measured the end-to-end task-level success rate and a score that measures the partial progress of the tasksと述べて2列を並べる。∴ 原典の論旨は「ばらつきが大きいから手が無い」ではなく「ばらつきが大きいから初期状態を統制した」である。 https://arxiv.org/abs/2510.17950 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 -
TRI LBM Team, “A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation”(Science Robotics 11(113), eaea6201, 2026年4月15日。DOI 10.1126/scirobotics.aea6201。arXiv:2507.05331)。条件あたり50ロールアウト、盲検A/B、多重比較補正を実施し、周辺信頼区間の重なりで差を判定するのは誤りだと明示する(本稿の記述は arXiv 版に当てたもので、掲載版の本文は照合していない)。本稿が調べた一次論文12本のうち、必要な検定を実行していた唯一の例。 https://doi.org/10.1126/scirobotics.aea6201 https://arxiv.org/abs/2507.05331 ↩ ↩2 ↩3
-
LingBot-VLA, “A Pragmatic VLA Foundation Model”(arXiv:2601.18692, 2026年)。実機評価で N=15 を統計的頑健性の根拠として挙げる(
Each model undergoes 15 trials per task-robot pair for statistical robustness.)が、信頼区間は報告していない。ただし統制のほうは明記しており、同じ節がrandomized object positions and orientations・Evaluation environments are kept constantと述べ、記録を rosbag 形式で公開するとも書く。指標もProgress Score (PS): measures partial task completionを成功率と併記する。本稿の論点(試行数の宣言と統計的推論の実行は別)が2026年の一次資料にも当てはまる例。 https://arxiv.org/abs/2601.18692 ↩ ↩2 ↩3 ↩4 -
Snyder, Hancock, Badithela ほか(Toyota Research Institute + Princeton), “Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping”(Robotics: Science and Systems XXI, 2025年。DOI 10.15607/RSS.2025.XXI.077。arXiv:2503.10966)。問題設定として
policy comparison is fundamentally constrained by a small feasible sample size (e.g., 10 or 50) due to significant human effort and limited inference throughput of policiesと述べる。試行数を減らす側の論文であり、it reduces the number of evaluation trials by up to 32% as compared to state-of-the-art baselines, while preserving the probabilistic correctnessと報告する。ただし「最大32%」は既存の逐次手法に対する上乗せであって、固定バッチに対する削減ではない。∴ この手法固有の上積みは桁の削減ではない。 なお著者自身は要旨でour method is strongest in the most challenging comparison instances (requiring the most evaluation trials)と述べており、難しい事例ほど有利だと主張している。近接した方策どうしでは棄権する設計であることも著者自身が述べている。またOn the progressively harder cases the number of required samples increased 5-10 times over the easiestとあり、必要試行数そのものが課題の難度で5〜10倍動く。 https://arxiv.org/abs/2503.10966 ↩ -
Badithela, Snyder, Zha, Mikhail, O’Kelly, Dixit, Majumdar, “Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators”(arXiv:2510.04354v1, 2025年10月5日公開。ICRA 2026 に採択され、2026年6月4日に本会議で発表〈Paper ThI2I.206〉。併設ワークショップ Real2Sim2Real にも採択されている。2026年9月22日時点で Crossref に会議録の記録は無い)。Snyder らの逐次検定の論文5と著者を三名(Badithela・Snyder・Majumdar)共有する後続論文で、§2 に
researchers typically compare policy performance using only 20-30 real-world trials. However, such small sample sizes are insufficient to draw statistically significant conclusions in policy comparisons [9]と書き、[9] に Snyder らの論文(arXiv:2503.10966)を挙げる。同じ段落は続けてa recent study compares generalist large behavior models to single-task policy counterpart using rigorous statistical evaluation methods, incorporating A/B real-world testingと書き、TRI の LBM 論文(arXiv:2507.05331)を [3] に挙げる。要旨は枠組みをa small number of paired real and simulation evaluations are used to rectify bias in large-scale simulation・confidence intervals on mean policy performanceと述べ、効果をsaves over 20 − 25% of hardware evaluation effort to achieve similar bounds on policy performanceと報告する。なお序論はreport empirical success rates of policies evaluated on a small number (e.g., 20-40) of trialsと書いており、§2 の20-30とは幅が違う。ただし Snyder らの本文に20-30という数は無く(arXiv の v1〜v4 と RSS 掲載版のいずれにも)、在るのは(e.g., 10 or 50)と(e.g., 10–60)である。この数はその後 2 本に写された。PhAIL(Arkhangelskiy, arXiv:2605.29710v1, 2026年5月28日公開)はSTEP [27] concurs: “20–30 real-world trials are insufficient for statistically significant conclusions.”と、引用符つきで Snyder らの言葉として引く(Snyder らの本文に 0 件)。FailBench(Navasardyan, Danielyan, Davtyan, arXiv:2609.03611v1, 2026年9月3日公開)はpolicies typically compared on 20 to 30 real-world trials, too few to separate them with statistical confidence (Badithela et al., 2025)と、Badithela らを出典に引く。∴ 「20〜30試行」は根元の論文の数ではなく後続論文の数であり、それを Snyder らの言葉として引くのは誤引用である。PhAIL と FailBench は 2026年9月22日時点で Crossref・OpenAlex・OpenReview に掲載版の記録が無い arXiv のプレプリントである。https://arxiv.org/abs/2510.04354 / ICRA 2026 プログラム: https://ras.papercept.net/conferences/conferences/ICRA26/program/ICRA26_ContentListWeb_5.html#thi2i_206 / PhAIL: https://arxiv.org/abs/2605.29710 / FailBench: https://arxiv.org/abs/2609.03611 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 -
Atreya, Pertsch, Lee ほか, “RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies”(Proceedings of the 9th Conference on Robot Learning, PMLR 305:336-364, 2025年。CoRL 2025 の掲載版。arXiv:2506.18123)。7大学にまたがる7つの汎用方策を612件の対比較で評価する。基準順位は
asking evaluators to score the remaining five policies after each A/B evaluation on the same taskで作られ、In total, we use 4284 evaluations to compute this oracle ranking(=612×7)。集計しているのは二値の成否ではなく部分進捗スコアで、図5右のキャプションは"Oracle" policy ranking, aggregated from progress scores of 4284 evaluation rollouts.と書く。1回の対比較は2方策をback-to-backで走らせるので、612件=1,224ロールアウト、残る5方策ぶんを合わせて全体が4284 policy rolloutsになる。別立ての実験ではなく、同じセッションの中で7方策すべてを回した結果である。順位づけの用途を支える最も強い資料だが、示されている不確かさは図7までである。Rank correlation as a function of number of evaluation episodesと題した2枚のパネルは、両曲線に陰影帯を添えて描いている(帯が何のばらつきを表すかは、キャプションにも本文にも書かれていない)。方策どうしの差についての信頼区間・p値は、本文・表・付録のいずれにも無い(confidence interval・error bar・standard error・p値の数値表記はすべて0件)。∴ 順位の妥当性を支える資料であって、水準の区別可能性を支える資料ではない。なお初版は2025年6月で TRI の公開(同年7月)より早いが、2025年11月の改訂版でも TRI への参照は無い。 https://proceedings.mlr.press/v305/atreya25a.html https://arxiv.org/abs/2506.18123 ↩ ↩2 ↩3 ↩4 ↩5 -
本稿の分析(2026年9月22日断面)。RoboChallenge の課題別順位表は
api/v1/leaderboard/leaderboard_task_all.jsonが課題×提出ごとに成功率とスコアを1セルずつ返し、run 一覧api/v1/runs/runs_list.jsonが同じ提出・同じ課題の run を時刻つきで返す。run が2本以上ある441セルのうち、表示が最新の run と一致するのは423、スコア最良の run と一致するのは262(両方に一致するセルを含む)、どちらとも一致しないのは8である。Qwen-RobotManip の技術報告(Qwen Team, arXiv:2606.17846v2, 2026年)は Table 14 に GR00T-MULTI の平均成功率を15.33と載せるが、同じ表示名の30セルを平均すると13.33で、30課題のうち7課題の値が違う。順位表の値を引く6本のうち、引いた時点を書いているのは、DM0(DM0 Team, Dexmal + StepFun, arXiv:2602.14974v1, 2026年)が Table 1 にThe data is reported before 20260210と、GigaBrain-0.5M*(arXiv:2602.12099v2, 2026年)がranks first on the leaderboard as of February 9, 2026と書く2本で、A1(arXiv:2604.05672v3)・StarVLA-α(arXiv:2604.11757v2)・PACE(arXiv:2606.00537v2)・Qwen-RobotManip は書いていない。 https://robochallenge.ai/api/v1/leaderboard/leaderboard_task_all.json / Qwen-RobotManip: https://arxiv.org/abs/2606.17846 / DM0: https://arxiv.org/abs/2602.14974 / GigaBrain-0.5M*: https://arxiv.org/abs/2602.12099 ↩ -
N. A. Lynnerup, L. Nolling, R. Hasle & J. Hallam, “A Survey on Reproducibility by Evaluating Deep Reinforcement Learning Algorithms on Real-World Robots”(Proceedings of the Conference on Robot Learning, PMLR 100:466-489, 2020年。CoRL 2019 の掲載版。arXiv:1909.03772)。先行研究を引いて有意差検定の欠如が誤解を招く報告を生むと述べ、試行数については自身の言葉で
In general, the more trials, the easier it will be to support the conclusions with the proper statisticsと書く。ただし実機では反復自体が高くつくことも認めており、処方は全ハイパーパラメータの構成ファイル化とブートストラップ法。 https://proceedings.mlr.press/v100/lynnerup20a.html https://arxiv.org/abs/1909.03772 ↩ -
E. Johns, “Back to Reality for Imitation Learning”(Proceedings of the 5th Conference on Robot Learning, PMLR 164:1764-1768, 2022年。CoRL 2021 Blue Sky track の掲載版。arXiv:2111.12867)。ロボット学習の評価指標は機械学習から借用したもので実世界のコストを測っていない、と論じる。ただし本論文の処方は時間効率であって統計的検出力ではない。本稿はこれを「統計の話の起源」としては扱わない。 https://proceedings.mlr.press/v164/johns22a.html https://arxiv.org/abs/2111.12867 ↩
-
A. Norton & B. Flynn(NERVE Center, University of Massachusetts Lowell), “Towards Using Multiple Iterated, Reproduced, and Replicated Experiments with Robots (MIRRER) for Evaluation and Benchmarking”(arXiv:2408.04736, 2024年。ICRA 2024 WOSRA ワークショップ)。反復・再現・追試を区別して積み上げる枠組みを提案する。 https://arxiv.org/abs/2408.04736 ↩
-
H. Kress-Gazit, K. Hashimoto, N. Kuppuswamy, P. Shah, P. Horgan, G. Richardson, S. Feng & B. Burchfiel(Cornell University + Toyota Research Institute), “Robot Learning as an Empirical Science: Best Practices for Policy Evaluation”(arXiv:2409.09491v2, 2024年9月20日。2026年9月22日時点で Crossref・OpenAlex・OpenReview に掲載版の記録が無い)。要旨は
the dominant metric used in the literature, especially for physical experiments, is "success rate"と述べ、it is common for papers to report this number with little to no information regarding the number of runs, the initial conditions, and the success criteriaと続けて、統計解析についてもlittle to no statistical analysis of the findingsと書く。実施指針にはA/B testing, i.e., interleaving policy rollouts when comparing different policies in a way that is blind to the evaluatorを挙げ、§4.2 はProviding a point estimate for success and performance metrics can be misleadingと記す。例として83.3% (15/18) and 64.7% (11/17)の2方策を比べ、even when we cannot draw conclusions regarding which policy is more successful, a detailed evaluation can lead to research insightsと結ぶ。TRI の LBM 論文3は参考文献 [52] としてこの指針を引き、the evaluators did not know which policy was being tested (blind testing), policy ordering was randomizedの手順とwe use a uniform prior over the Bernoulli parameter as suggested by [52]の解析をそこに帰している。Snyder ら5はPolicy comparison forms the foundation of robot learning as "an empirical science" [28]と、RoboArena7は評価条件の統制の文脈で [59] として、Badithela ら6はA comprehensive list of best practices for rigorously evaluating robot policies is detailed in [1]と引く。 https://arxiv.org/abs/2409.09491 ↩ ↩2 ↩3
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。