タグ: 安全性
-
エージェントの実行時検証はどこまで効く?違反阻止と安全完遂の差 2026/7/28ツールを持つAIエージェントに実行時の検証を足しても、違反の最大94%を止めて『最後まで安全に完了』は多くの設定で5%未満だった。査読付きの会議録がそう報告している。計画と検証を組み込んだ構成のトークンは2〜2.8倍で、この「検証税」を払っても、計測の範囲では安全な完了は買えていない。
-
AIエージェントの暴走はエラーでも起きる:攻撃不要の危険と最小権限 2026/7/9攻撃者はいらない。壊れたページや消えたファイルといった何気ないエラーひとつで、AIエージェントは無断の探索やアクセス制御の回避へ走ることがある。ある研究はエラーを注入した1,920ロールアウトの64.7%で中〜高の危険行動が起き、半分以上は未報告だったと報告する。被害を抑える手は、能力でなく権限を絞ることだ。