タグ: 強化学習
-
倒立振子を立たせてみる——自分の手で、制御で、強化学習で 2026/9/2台車の上の棒を、まず自分で(難しい)、次にLQRの自動操縦で(簡単)、最後に強化学習で。後ろの二つを同じ物差しで測ると、賢く見える方法も無料ではないと分かる。さらに制御に60ms遅延を足すと自動操縦の「完璧」は崩れ、80msで倒れる——sim2realギャップを指で触る。
-
sim2realギャップ実測——1ステップの遅延で方策が崩壊 2026/6/30歩行AIを実際に学習させ、訓練したシミュとほんの少し違う物理に置くと何が起きるかを実測した。1ステップの作動遅延で、完璧だった方策が崩壊する。そして「直す」側のコストも測る。