タグ: 制御
-
倒立振子を自分の手で、制御で、強化学習で立たせてみる 2026/9/2台車の上の棒を、まず自分で(難しい)、次にLQRの自動操縦で(簡単)、最後に強化学習で。後ろの二つを同じ物差しで測ると、賢く見える方法も無料ではないと分かる。さらに制御に60ms遅延を足すと自動操縦の「完璧」は崩れ、80msで倒れる。sim2realギャップを指で触る。
-
制御理論はRLが再発明する半分を先に解いていた 2026/6/27深層RLが「発見」する安定性・最適性・頑健性の多くは、制御理論が数十年前に保証付きで解いていた。RLは保証なしで、桁違いのサンプルで再発明する——ただしモデルが無い領域では本当に勝つ。