Physical AI
生成世界モデルの物理一貫性を独立ベンチ3本で診断する
- 世界モデル
- Physical AI
- 動画生成
- WRBench
- CRONOS
- PhyGround
- Ctrl-World
- Cosmos
- Wan
- π0.5
- Veo-3.1
- 物理法則
- 視点
- 剛体
- 方策
- シミュレータ
- 人手評価
- 指示追従
- 順位付け
- DROID
- Unreal Engine
- Diffusion Policy
- プレプリント
目次
Physical AI は、ロボットや自律運転のように、現実の物体を相手に動くAIを指す。この領域では、その動かし方(方策)が良いか悪いかは、動かしてみるまで分からない。とはいえ実機を動かせる回数も場所も少ないので、開発者は物理エンジンで組んだシミュレータを実機の外に用意し、そこで方策を学ばせたり試したりしてきた。ただしシミュレータに現実を入れるには、物体の形も、材質も、光の反射も、人が一つずつ作って並べなければならない。シミュレータには人が作った分しか無い。そのため、雑然とした台所や倉庫のような現場を再現するには手間が掛かり、再現できなかった部分が多いほど、シミュレータの中での成績は当てにならなくなる。そこで、この組み立てを丸ごと省く案が出てきた。人の手で場面を作る代わりに、映像を生成するモデルに場所ごと描かせる案である。こうしたモデルを世界モデルと呼ぶ。本稿は、2026年前半に公開された独立ベンチ3本(WRBench・CRONOS・PhyGround)と、世界モデルを方策の訓練と評価に使った2本(Ctrl-World・Interactive World Simulator)を例に取る。
モデルが生成した「世界」は、どこまで物理に接地しているか。Physical AI の訓練と評価を、その世界にどこまで任せられるか。本稿は2026年前半の測定で確かめる。
任せられる層は、方策の訓練と順位付けという粗い層に定まりつつある。その上の精密な物理は穴のまま残り、モデルを大きくしただけでは埋まらなかった。 粗い層まで使えることは、別々のチームの2本が報告した。一方は、各タスクの実機データで作った世界モデルの中で集めた映像だけで学ばせた方策が、実機で集めたデータで学ばせた方策と並んだと報告している1。もう一方は、実機を一度も動かさずに方策の優劣を順位付けできたと報告している2。足りない側を測った3本は、別々の入口から測り、同じ向きの結果を出した。各ベンチの報告では、カメラの外では時間が止まり、視線を戻すとそこから動き出す3。視点を差し替えるだけで予測がぶれ、因果ではなく見かけの相関を拾っている疑いが残る4。PhyGround の著者らは、画質ではなく物理法則の側から採点する軸を作って人手で採点し直し、8つのモデルはどれも総合 3.3/5 に届かなかったと報告している5。大きさの効き方は、測る軸で向きが割れた。同じ系列のモデルを大きくすると、見ていない間の状態の保持は下がり3、全指標を同時に満たす割合も落ちた4。一方、PhyGround の人手評価では、Cosmos でも Wan2.2 でも大きい側が小さい側を物理の採点で上回っている5。CRONOS の著者らは、大きさだけでは物理の一貫性は保証されないと書き、自分たちの観測は1系統・1刻みだと断っている4。
世界モデルの中の成績は、順位が実機と揃っても値はずれる
※ この節の数値は説明のための仮定で、測定値ではありません。
二つの方策を、ある操作課題で比べる場合を考える。実機で試すと、一方の成功率は0.8、もう一方は0.3である。同じ二つを世界モデルの中で試すと、0.5と0.1になる。世界モデルは両方を低めに出すが、どちらが上かという順位は実機と同じである。
次に、実機での成功率が0.55と0.50の二つを比べる場合を考える。世界モデルが途中の衝突を実機と違う形で描き、片方だけを多く失敗させると、世界モデルの中では0.20と0.25になりうる。差が小さいと、世界モデルのずれだけで順位が入れ替わる。
世界モデルの中の成績から言えるのは、差が大きいときの順位までである。成功率の値そのものと、差の小さい比較は、実機で確かめる必要がある。
「世界モデル」は何を約束したのか
生成動画モデルの進歩で、数秒の映像なら本物と見分けるのが難しくなった。ここから、その映像が物理的に正しいなら、現実の代わりに使えるという期待が生まれる。ロボットを実機で動かす前に、モデルが作る「世界」の中で行動を試し、安く大量に学ばせる。これが世界モデル(world model)をシミュレータとして使う構想だ。
だが「シミュレータ」を名乗るには、見た目の良さだけでは足りない。広い世界を長時間まるごと任せる用途では、見ていない間も世界は進み、視点が変わっても同じ物理を返し、物理法則を破らないという三つが問われる。2026年前半、複数の独立チームがこの三つを別々のやり方で突いた。三つ目のチームは「その破れを測れているか」という評価の側の問題から入り、物理専用の評価の枠組みを作って測り直した。物理の遵守を測るベンチは VideoPhy・Physics-IQ・WorldModelBench など先にもあり、この枠組みはそれらを先行研究として検討したうえでのものだ5。そこでもモデル側の不足が出た。以下は各チームがそれぞれのベンチで得たと報告する結果であり、まだ査読前・独立再現前のプレプリントだ。しかも三本とも、その穴を示すために作者自身が設計したベンチで測っている。穴を探すよう作られたベンチが穴を見つけること自体は、驚くにあたらない。別々の入口から同じ向きを指した一致は単発の主張より重く扱えるが、「世界モデルは物理を学べない」と一般化できる段階ではない。その上で読むと、報告はどれも現状のモデル、あるいはその測り方に厳しい。
見ていない間、世界が進まない
もっとも構造的な指摘は、Lu らの WRBench から来た3。彼らは23のモデルが生む9,600本の動画を、四つの制御方式にわたって調べたという。問うたのは単純な問いである。カメラが対象から離れ、また戻ってきたとき、その間に起きるはずの変化は進んでいるか。ただしこの「戻りテスト」を採点できたのは、対象が判定可能な形で視野に戻った 2,073本(全体の21.6%)に限られる。裏を返せば残る約8割は、この問い自体が成立しなかった行である。原論文の支持条件は「いったん隠れる」「視野に戻る」「判別できる形で戻る」の三つ揃いで、欠けた大半はカメラが対象を画面に入れ続けたために隠れて戻る場面が生まれなかったほうだ。著者らは図の見出しで Camera motion governs access, not correctness(カメラの動きが決めるのは、正しさではなく検査が成立するかだ)と書いている。∴ この8割を「モデルが戻せなかった」と読むと、測れなかったことを無能さとして数えてしまう。原論文は「戻れない」と「戻ったが状態が古い」も別の失敗として分けており、片方の分母をもう片方に使うことを表で明示的に禁じている3。
彼らの答えは「進んでいない」だった。戻りテストが成立したその2,073本では、モデルは見ていない場所の出来事を凍結していた、と著者らは報告する。原論文が冒頭に挙げる場面では、寝室の床からベッドへ跳び乗るはずの猫が、カメラが戻ってもまだ床にいることがある。視線を外した間の変化が止まり、戻ると中断した状態のまま再開するのである。もっとも著者らによれば、この失敗は物の位置の移動よりも、畳む・倒すのようにその場で状態が変わる事象に集中する3。研究者はこれを、世界を捉える「持続的な状態の核(persistent state core)」の欠如と呼ぶ。彼らの言い方を借りれば、モデルが持っているのは世界ではなく、追尾ショットだ3。
著者らが強調するのは、この欠陥が画質を上げても、制御を精密にしても、幾何の事前知識を足しても、パラメータを増やしても消えなかった点だ。それどころか同系列の Wan 2.1 を 1.3B から 14B へスケールさせると、対象が判定可能な形で戻ってくる率のほうは 13.8% から 18.2% へ上がるのに、再観測時の状態一致は 0.66 から 0.62 へ下がったという3。スケールで買えるのは検査が成立する回数であって、見ていない間に起きたことの保持ではない。著者らはここから「通常の動画教師ありのスケーリングでは世界状態の進行は得られない、設計で入れるしかない」と結論する。彼らの診断では、どのアーキテクチャも「シーンがどこにあったか」を再描画するための記憶は持つが、隠れている間に何が変わったかを記録する仕組みを持たない。未観測の帰結を教える公開の学習信号も存在しない、とも指摘している。もっとも、これが作者と利害を共有しない第三者に再現されるかは、まだ確かめられていない。少なくともこの診断が届く範囲では、世界を「保つ」仕組みが働いていない。
視点を変えると揺れ、大きくしても直らない
別の角度から同じ穴を突いたのが、Begiristain らの CRONOS だ4。測ったのは重みが公開された4系統(Cosmos2.5・CogVideoX1.5・MAGI-1・Wan2.2)で、Veo・Sora・Kling のような商用クローズド系は評価対象外にしたと著者らは明記し、それが現行のモデル地形のカバレッジを制限すると自ら断っている4。もっとも著者らは同じ一文で、それでもベンチは飽和にはほど遠く、最良のモデルでも成功率は22%にとどまると付け足している4。彼らは、同じ物理イベント(衝突・落下・遮蔽の3種、全構成で675本)を保ったまま、視点・背景・物体の見た目・物体のカテゴリだけを差し替え、予測がどう変わるかを測った。ただし遮蔽だけは視認構造を保つために視点を固定しており(遮蔽は675本中75本)、以下の視点の話は落下と衝突を対象とする。フォトリアルな Unreal Engine で作った高精細な映像で、条件を一つずつ動かす介入実験である。ただし著者ら自身は、合成映像であることを制限の筆頭に挙げ、この結果は「制御された物理予測についての診断的証拠であって、実写での性能を直接推定するものではない」と読み方まで限定している4。
物理が同じなら、予測も安定していなければならない。ところが彼らの報告では、どの介入でも予測の質が揺れ、とりわけ視点と物体のカテゴリを変えたときに大きく揺れた4。物体を変えれば質量が、背景を変えれば場面の形が変わるので、その分の揺れはある程度当然だと著者らは断っている。物体も場面も物理も同じまま残る視点の変更で、大半のモデルの揺れが最も大きかった。著者らはこれを、モデルが落下の因果構造を学んだのではなく、視点をまたいで通用しない見た目の統計を手掛かりにしている兆候と解釈する4。彼らの読みでは、モデルは表面の相関を物理の理解と取り違えている。
絶対水準も低い。剛体の基本的な物理を含む短いクリップを、全ての評価指標を同時に満たす形で生成できた割合は、最良のモデルでも22%、大半のモデルは15%未満だったという4。しかも Cosmos2.5 を 2B から 14B へ上げると、この成功率は(V2V 設定で)0.22 から 0.14 へ落ちた。これは WRBench が Wan で見たのと同じ向きである(ただし著者らは「単一のモデル系統・単一のスケール刻みの観測だ」と自ら留保している)4。別チームが別のモデル系列で同じ向きを見たという点は、三本の重なりの中でもっとも鋭い。
物理を採点する枠組みを作っても、どのモデルも届かない
ではなぜ、こうした破れが見過ごされうるのか。Lin らの PhyGround は、まず評価の側の問題を突く5。彼らが挙げるのは、動画生成の定番指標が物理法則の破れを検出するようには設計されていないという点だ。定番指標とは、FVD のように分布の近さを測るもの、SSIM や PSNR のように画素レベルの忠実度を測るもの、CLIP のように意味的な整合を測るものを指す。見た目が良ければ高得点が出るので、物理の誤りは数字に現れにくい、という主張である。
PhyGround は、力学・流体・光学にまたがる13の物理法則の分類に沿って、物理そのものを採点する枠組みを提案する。しかも汎用の大規模モデルを審判にするのではなく、物理に特化した審判を用意した。ずれの測り方は原論文が式で定めていて、人間の注釈者による評価平均からの隔たり(審判の平均と人間の平均の差の絶対値を人間の平均で割り、各次元・各法則でマクロ平均したうえ、一般次元と物理を等重みで合成した総合値)である。それが汎用モデル(Gemini-3.1-Pro)を審判にした場合は 16.6%(同じ表の別の汎用審判 Claude Opus 4.7 でも 13.1%)、物理に特化した審判(PhyJudge-9B)では 3.3% だった5。人間の判断に寄せるには物理に特化した審判が要る、というのが彼らの主張だ。そしてその採点軸で8モデル・2,000本を人手評価すると「どのモデルも総合 3.3/5(66%)を超えない」。最上位の Wan2.2-27B-A14B と Veo-3.1 が並んで 3.28、以下 3.10・2.91・2.69・2.63 と続き、剛体力学の領域でもこの水準に届いたモデルは無い5。ただし原典は同じ節で「総合値だけを読むのは不完全だ」と自ら断ってもいる。この総合値も一般次元と物理の等重み合成であり、物理の側は注釈単位で加重されるため剛体が 876 件中 693 件を占める——原典の付録は法則を等重みにすると総合が最大 0.099 動く一方で順位は安定だと報告している(逐語 rankings remain stable up to a one-position shift)5。領域別に8モデルを横断した平均は剛体 2.79・流体 3.08・光学 3.24、光学に限れば 3.3 を超えるモデルが4つある(最高は Veo-3.1 の 3.69)5。届いていないのは総合と、とりわけ剛体の側だ。指標の不備を指摘した論文が、自ら作った採点軸でモデル側の不足まで測っている。
大きくして指標が下がった観測は、Wan では WRBench が同じ系列内で比べられた2組(2.1 の 1.3B→14B で再観測時の状態一致 0.657→0.621、密なパラメータ増ではない 2.2 の 5B→A14B で 0.664→0.649)3、Cosmos では CRONOS の1組だけである。後者について CRONOS の著者らは、単一のモデル系統・単一のスケール刻みの観測だと自ら留保している4。PhyGround の人手評価では逆に、同じ系列の大きい側が総合点(Cosmos 2B 2.58→14B 2.91、Wan2.2 5B 2.63→A14B 3.28)でも剛体の領域点でも上だった5。
粗い層なら、訓練と順位付けに既に届く
公平を期すと、生成世界モデルが Physical AI ですでに実用の役に立つ側の報告も、否定側とは別のチームから出ている。ロボット操作向けの制御可能な世界モデル Ctrl-World は、実機ロールアウト無しで方策(ロボットの動かし方)の優劣を精度よく順位付けしたと報告する。さらに”想像”の中で成功軌跡を生成して微調整することで、見慣れない物体や新しい指示を含む下流タスクで、汎用ロボット方策 π0.5 の成功率が平均 38.7%から83.4%へ、差にして 44.7ポイント上がったという2。ただしこの 44.7 を、原論文は本文では成功率の改善と書き、同じ図のキャプションでは「指示追従」の改善と書いている2。そして、評価の方法を作ったのが測られる側と同じチームだという点は、否定側に当てたのと同じだけこちらにも当たる。世界モデルも、評価プロトコルも、改善対象の方策も著者らの自陣にあり、Ctrl-World の著者4名のうち2名(第2著者と最終著者)は、改善対象である π0.5 の論文の共著者でもあるからだ。
別チームの Interactive World Simulator は、世界モデルの中だけで集めた専門家データで訓練した方策が、同量・同一の初期配置・同一の収集プロトコルで集めた実データの方策と同等に働いたと報告する1。この世界モデルは、各タスクについて約600エピソード(1人で約6時間)集めた実機のプレイデータで訓練した、既定解像度 128×128 の軽量なモデルである。比べた方策の教材は、生成データ側も実データ側も1タスク100エピソードだった1。比較は Diffusion Policy・ACT・π0・π0.5 の4種の方策で行われた。DP は生成データ100%で 87.9%・実データ100%で 90.3%、ACT は 76.2% 対 73.6% とほぼ並ぶ一方、π0.5 は実データを増やすほど伸びる傾向を示す(73.1%→88.8%)。原典は全体としては「同等」とまとめている。
ここに矛盾はない。しかもその境界は、肯定側の著者ら自身が引いている。Ctrl-World の報告によれば、方策の高次の指示追従は世界モデルの中と実機とで強く相関する一方、衝突・物体の滑り・回転といった精密な物理の再現には乖離があり、世界モデルは実機の成功率をむしろ低めに見積もるという2。彼らが自陣の限界として挙げた精密な相互作用と長い地平線は、否定側3本が測った対象とちょうど重なる。もっとも同じ著者らは、こうした限界は基盤の動画モデルが物理的に正確になるにつれ縮みうるとも見込んでいる2。現時点では、穴は抽象度の層と地平線に依存する。机上の操作を「どの指示に従うか」の水準で、短い区間を測る分には世界モデルは既に使えるが、「衝突がどう解決するか」の水準や長い地平線の推論ではまだ実機の代わりにならない。どちらの報告も、そう並べて読むのが正確だ。ただし並べる両側は同じモデルではない。肯定側の2本が使ったのは、実機のロボットデータで訓練した操作向けのモデル(Ctrl-World は DROID で、Interactive World Simulator は各タスクのプレイデータで)で、否定側3本が測った汎用の動画生成モデルそのものではない12。
肯定側の2本はどちらも、シミュレータ内の成績が実機と強く相関する一方で系統的にずれると報告している。Interactive World Simulator は4タスク中3タスクで実機より高く出て1、Ctrl-World は実機より低く出る2。同じ課題の中でも、ずれの幅は抽象度の層で大きく変わる。Ctrl-World の付録表の「ラップトップを閉じる」では、π0.5 の指示追従が実機 0.80 対 世界モデル 0.70 で差は 0.10 にとどまるのに、成功率は実機 0.70 対 世界モデル 0.05 まで開く。両者が共通して見込むのは、一方の方策が他方を大きく上回るならその優劣は実機でも保たれるだろうという相対比較の妥当性である。
出典5件
-
Yixuan Wang ほか「Interactive World Simulator for Robot Policy Training and Evaluation」RSS 2026 Workshop R-WM. https://arxiv.org/abs/2603.08546 — タスクごとの実機データで作った世界モデルの生成データで学んだ方策が、実データと同等。 ↩ ↩2 ↩3 ↩4 ↩5
-
Yanjiang Guo ほか「Ctrl-World: A Controllable Generative World Model for Robot Manipulation」ICLR 2026. https://arxiv.org/abs/2510.10125 — 操作向け世界モデル。実機なしで方策を順位付けし、π0.5 の成功率を38.7%→83.4%へ。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Jinpeng Lu ほか「Current World Models Lack a Persistent State Core」arXiv, 2026. https://arxiv.org/abs/2606.20545 — 23モデル・9,600本の診断ベンチ WRBench。視野に戻った2,073本では、見ていない間の変化が進まないと報告(査読前)。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
-
León Begiristain ほか「CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models」arXiv, 2026. https://arxiv.org/abs/2605.23699 — 合成映像675本で視点などを差し替え、公開4系統を評価。最良でも成功率22%(査読前)。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
Juyi Lin ほか「PhyGround: Benchmarking Physical Reasoning in Generative World Models」arXiv, 2026. https://arxiv.org/abs/2605.10806 — 13の物理法則で採点する枠組み。8モデル・2,000本の人手評価で総合3.3/5を超えたモデルは無い(査読前)。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。