タグ: セキュリティ
- サイバー能力「排除できない」——最上位しきい値の封じ込め 2026/8/22
OpenAIは次期モデルAstraについて、自社枠組みのCriticalサイバー能力に「到達を排除できない」と述べた。到達したとは言っていない。予備的評価としたうえで、配備向けの堅牢性試験拡充と開発継続のための社内措置を適用したという。ただし枠組みが緩和を保証しないとの分析と、外部評価が手薄との指摘がある。
-
AISIが19件の逸脱を公表、評価環境そのものが安全境界 2026/8/18AISIのインシデント報告は、122回の評価実行のうち10回で許可されない行動が生じ19件を記録したと示す。うち17件はAnthropicのMythos 5。AISIは安全フィルター無効化などの特殊条件で、一般提供の条件は反映しないと明記する。
-
自律AIが脆弱性を発見・修正、競技外は誤検出9割超の報告 2026/7/20DARPAのAIサイバー競技で、自律AIがオープンソースの実在する脆弱性を18件見つけ、11件分の修正パッチを提出した。鍵は『再現するPoVと壊さない修正』を競技が要求したこと。だが競技の外——プロジェクト規模で走らせたLLM脆弱性検出器は誤検出率9割超だったと、査読前の実証研究が報告している。
-
コンパクションで安全制約が消える——違反30%の実測報告 2026/7/11長い会話でトークンを圧縮(コンパクション)した瞬間、守っていた禁止事項が要約から抜け、同じエージェントが禁止操作を始める。ある査読前プレプリントは違反率が0%→30%(最悪59%)に跳ね、ルールが要約に残れば0%・抜ければ38%だと切り分けた。