In Silico

フロンティアAI

OpenAIのAstra、自社基準のサイバー最上位到達を排除できず先に措置

2026/8/22 (更新: 2026/10/7)

  • Astra
  • サイバー能力
  • 外部評価
  • OpenAI
  • Preparedness Framework
  • Critical
  • High
  • 安全策
  • 行動規範
  • しきい値
  • 停止条項
  • 追加措置条項
  • 社内措置
  • 堅牢性試験
  • 隔離
  • 監視
  • モデル重み
  • アクセス水準
  • ブラックボックス
  • UK AISI
  • Anthropic
  • ASL-3
  • ChatGPT agent
  • GPT-5.6-Sol
  • SAG
  • 取締役会
  • FAccT
目次
背景・問い・要点
背景

強力なAIを作っている組織は、自社のモデルが危険な能力にどこまで届いたかを段で区切り、その段に触れたら手を打つと宣言してきた。サイバー分野の最上位の段は、モデルが人の介入なしに実際に動く攻撃コードを作れる、あるいは大まかな目標だけから攻撃の新しい戦略を端から端まで立案し実行できる、という水準である1。脆弱性を見つけられるところまででは、この段には届かない。

ただし、各社がこうした枠組みの発動を公表した例は、これまで多くない。文書があることと、それが現実の判断を動かすことは別だからだ。

だから、ある会社が自社の枠組みに照らして何かを公表したとき、読むべきものは公表文の言葉と枠組みの条文の両方である。何を止め、何を続けているのか。枠組みが求めているのは配備の可否なのか、開発の進め方なのか。片方だけでは、どちらとも読めてしまう。

問い

「排除できない」という言い方は何を意味し、その結果として実際に何が止まったのか。公表文と枠組みの条文を突き合わせて確かめる。

要点

2026年8月7日、OpenAIは開発中の次期モデルAstraについて、自社の安全枠組みが定めるサイバー能力の最上位の段に到達することを、現時点で排除できないと述べた2。到達したとは言っていない。OpenAIは予備的な評価だとしたうえで、隔離環境や監視強化といった社内措置を実施中だとしている。原典はその目的を、さらなる開発を安全・確実に進めるためだと書いている。ただし原典の同じ節はその手前で、これらの能力の配備に見合うよう安全策の堅牢性試験を拡充したとも述べている2。最上位の段でこう動いた先例は無い2。ただし、これを額面通り「安全策が機能した」と読むのは早い。枠組みそのものを分析した論文は、枠組みが緩和策を保証するものではないと指摘し3、別の論文は、外部評価者が受け取るアクセス・情報・時間には限りがあると指摘している4。判定の材料は、Astraの評価におけるアクセス水準と、結果の独立公表である。直前世代では、評価者名と条件を明かした第三者評価の報告が出ている5。

モデル・例示

「排除できない」と「到達した」は別の判定である

※ この節の数値は説明のための仮定で、測定値ではありません。

ある枠組みが、最上位の段を「人の介入なしに、堅牢化された実システムの多くで動く攻撃コードを作れる」と定めているとする。評価者は堅牢化した標的を20個用意し、モデルに人の介入なしで攻撃させる。

20個のうち1個も破れなければ、評価者はこの段への到達を排除できる。20個のうち18個を破れば、到達したと判定できる。

難しいのは、20個のうち5個を破った場合である。5個は「多く」に当たるとも当たらないとも言えず、標的を増やせば割合は動きうる。このとき評価者が言えるのは、到達を排除できないということだけで、到達したとは言えない。

この中間の状態では、判定が確定するのを待つか、確定しないまま先に手を打つかを選ぶことになる。先に手を打つなら、何を止め何を続けるかを、判定とは別に決めなければならない。

「排除できない」は「到達した」ではない

OpenAIは2026年8月7日付の公式発表で、AstraがCriticalのサイバー能力しきい値に「現時点で到達することを排除できない(cannot rule out)」と述べた(Help Net SecurityとThe Hacker Newsが同年8月10日にそれぞれ報じた)2。この表現は「到達した」とは異なる。到達したと確定する評価ではなく、否定しきれないという幅を残した言い方だ。OpenAIは続けて、これは予備的な評価であり、ベンチマークと評価を継続中だと述べている2。OpenAIは、「排除できない」と書く同じ一文にその理由も書いている。その予備的な評価が「十分に強い性能(strong enough performance)」を示している、という理由である2。幅を残しているのは判定であって、観測された性能の側ではない。この一文の直後には、Astraは今後出るモデルであり、同社が別途公表しているHugging Faceへの侵害には関与していないとも明記されている2。なお「Astraは重大なサイバーセキュリティモデルとして分類されていない」という言い方は報道側(Help Net Security)の要約で、OpenAIの発表そのものには無い2。

この二つの言明は別のことを言っている。この発表は「AstraがCriticalしきい値に到達した」と要約されやすいが、OpenAI自身の言葉はそうではない。「到達した」であれば、そのモデルをどう扱うかという判断そのものが確定した話になる。「排除できない」は、判定を確定させないまま、疑わしい段階で先に手を打つという扱いだ。今回OpenAIが公表したのは後者であり、この違いが、以下で見る封じ込め措置の位置づけを決めている。

判断が動いた速さも、同じことを示している。発表は2026年8月7日付で、報道の3日前だ2。OpenAI自身の書き方によれば、根拠は「ここ数日」の社内評価と専門家の評価であり、結論に至ったのは「昨夜」である(原文 “over the past few days” / “in addition to expert assessments” / “led us to conclude last night”)2。評価が固まってから公表までが1日以内ということになる。確定した判定を待って動いたのではなく、確定しないまま動いたという先の読みを、発表の時系列そのものが裏づけている。

Criticalは「前例が無い経路」を指す

Preparedness Frameworkは、フロンティアモデルの危険な能力を領域別・段階別に管理するOpenAIの社内枠組みだ。措置を要求するしきい値は二段で、これは追跡対象の全カテゴリに共通する定義として置かれている。High(高)は「既存の深刻な危害へのリスクベクトルを著しく増大させる能力」、Critical(重大)は「既存の前例がない、質的に新しい深刻な危害の脅威ベクトルの意味あるリスクを示す能力」である1。Highを越えた対象システムには、配備前に堅牢で実効的な安全措置が、開発中には適切なセキュリティ管理が要求される。Criticalに至っては、配備の計画にかかわらず開発中においても安全措置が要求される1。既存の経路を増幅するか、前例が無い経路そのものを生むか。前者にはすでに何らかの対処の蓄積があるが、後者は想定されていなかった対処を要しうる。

そのうえで、サイバー領域には固有のしきい値の記述が別にある。Highは「相応に堅牢化された標的に対する端から端までのサイバー作戦の自動化、あるいは実務上重要な脆弱性の発見と悪用の自動化を含め、サイバー作戦を規模化する既存のボトルネックを取り除く」能力とされる1。

サイバー領域のCriticalも同じ枠組みの中に文言が置かれている。「ツール拡張されたモデルが、人間の介入なしに、堅牢化された実世界の重要システムの多くにおいて、あらゆる深刻度の実際に機能するゼロデイ攻撃コード(公表や修正の前の脆弱性を突く、動作する攻撃プログラム)を特定・開発できる。あるいは、高水準の目標のみを与えられた状態で、堅牢化された標的に対するサイバー攻撃の新規な戦略を端から端まで立案し実行できる」1。このいずれかを満たすとCriticalとみなされる。抽象的なしきい値の説明ではなく、具体的な能力の記述として書かれている。

ここで注意がいる。この文言は今回の発表で新しく示されたものではなく、2025年4月版の枠組みに印刷されているものだ1。今回の判断は、この既存のしきい値に照らして述べられている。CriticalをHighから分けているのは、脆弱性を見つけるか動く攻撃コードまで作るかではない。悪用の自動化なら、High側の文言にも書かれている。実際に分けているのは、あらゆる深刻度・堅牢化された実世界の重要システムの多く・人間の介入なしという三つの限定と、高水準の目標だけから新規戦略を端から端まで立案し実行する第二の経路のほうである。

OpenAIが実際に取った措置

各社が枠組みの発動を公表したものとしては、Anthropicが2025年5月にClaude Opus 4について「ASL-3のリスクを明確に排除できない」として予防的にASL-3の保護を発動した例がある6。Anthropicは、ASL-3の能力しきい値を越えたかを未確定のまま動いた。OpenAIも2025年7月に、ChatGPT agentを生物・化学の領域でHighの能力を持つものとして扱い、関連する保護を発動している7。このときOpenAIは、Highの定義を満たす確定的な証拠は無いとしたうえで、予防的な扱いを選んだと書いている7。どちらも各社の最上位の段ではない。サイバー領域でも、Google DeepMindが2025年8月のモデルカードで、Gemini 2.5 ProとGemini 2.5 Deep Thinkが自社枠組みのサイバーの早期警戒しきい値に達したとし、緩和策を配備して、試験の頻度を上げて続けていると書いている8。早期警戒しきい値は重大能力水準(CCL)への接近を見るためのもので、同じモデルカードはCCLそのものには達していないとしている8。

サイバーのCriticalの段に照らして措置を取るのは、今回が初めてだ。OpenAI自身、これまでのモデル(GPT-5.6-Solを含む)はサイバー能力についてCriticalではなくHighと評価されてきたと書いている2。原典の「取っている手順」の節は、まず配備の話から始まる。同節は「これらの能力の配備に見合うよう、安全策とセキュリティ管理の堅牢性試験を拡充した」と書いたうえで、「社内では、さらに以下の手順も取った」と続ける2。つまり並んでいるのは二種類で、配備に備える側と、開発を続けるための側だ。

社内側の一連の措置について、原典はその目的を「このモデルのさらなる開発が安全・確実に行われるように」と書いている2。挙げられているのは、隔離されたテスト環境、ネットワークとツールのアクセス制限、モデル重みの保護と暗号化の強化、監視と検知の追加である2。加えて、サンドボックス実行(外部への影響を遮断した環境でプログラムを動かす仕組み)、エージェント型アプリケーション横断での危険な行動と不整合に対する全面的な監視、高リスクな活動を審査して中断する対応体制も挙げられている2。この監視は、モデルの思考の連鎖(Chain of Thought、答えに至るまでの途中の推論を書き出させたもの)を監視モデルが評価し、その評価がセキュリティ対応を発動する仕組みである。対象範囲は訓練と評価を含むと明記されている2。社内措置の箇条書きのうち、原典が完了形(“We have implemented”)で書いているのはこの監視だけである2。

リストの中身は大まかに三つに分けられる。試験環境そのものを外部から切り離す隔離、モデル重み(学習済みのパラメータそのもの)への不正なアクセスを防ぐ保護、そしてエージェントの挙動を継続的に見張る監視だ。あわせて挙げられているのは、政府機関および一部のAI安全組織と協働してこのモデルの能力を試験すること、外部のテスト協力先に推奨されるセキュリティ管理策を提供することである2。原文は “select AI safety organizations” で、誰が選定するのかを原典は書いていない。この点は後で効いてくる。この二つを、原典は配備前の手順としては明示していない。ただし節の冒頭で述べているのは、先に見たとおり配備に見合う堅牢性試験の拡充である2。

停止についても、原典の言い方は報道の要約より狭い。OpenAIは、強化されたセキュリティ管理の要件をまだ満たしていないAstra関連の社内活動を、停止していると述べている2。停止は完了形でもない。The Hacker Newsはこの一文を逐語で引き、見出しに据えた2。

OpenAIの発表にも報道2件にも、これらの措置の時期を示す具体的な日付は出てこない2。効果を数値で示す記述も、外部から照会できる担当や窓口の記載もない2。The Hacker Newsは別の文脈で、Astraが数学と理論計算機科学の未解決問題10問を解いたことに触れ、その費用をSolのAPI料金に換算して約2,000ドルと報じている2。これは能力の規模感を示す一データ点に過ぎず、しかも料金の基準はAstra自身ではなく前世代のGPT-5.6-Solである。今回のCritical判断を裏づける数字ではない。

枠組みそのものへの批判

Preparedness Frameworkという仕組み自体を検証した研究がある。Sam Cogginsらは2025年9月、2025年4月版のPreparedness Framework Version 2を対象に分析した論文をプレプリントとして公開し、この論文はその後FAccT ‘26に採録された3。Astraをめぐる今回の判断は、この分析対象のバージョンより後の話だ。ただし、判断に使われたサイバーCriticalのしきい値の文面そのものは、この分析対象と同じ2025年4月版のものである。発表がPreparedness Frameworkとしてリンクしているのは2025年4月版のPDFそのもので、しきい値の文面も発表本文の中で復唱されている21。とはいえ論文が分析したのは枠組みの文面であり、Astraへの今回の適用は分析対象に含まれない。

論文は三つを主張する。第一に、枠組みが評価を求めているのはAIリスクのごく一部にとどまり、しかもどのリスクについても評価を要求してはいない。論文は求める(requests)と要求する(demands)を区別し、後者は一つも無いと書く。あわせて、枠組みはリスク評価の実施に必要な資源・独立性・時間のいずれも保証していないと指摘する3。ただし論文が「体系的な評価を求めている」と数える四領域には、サイバー攻撃・化学兵器・生物兵器・AI自己改善が入っており、本稿の題材であるサイバーはその筆頭にある3。今回の場面に当たるのは、範囲の狭さのほうではなく、要求になっていないという指摘のほうだ。

第二に、意図せず「深刻な危害」を可能にする「Medium」水準の能力を持つシステムの配備を促してしまう。この水準は上の二段のしきい値には含まれず、枠組みが措置を要求しない水準である。論文が「促す」と言うのは、2025年4月版が「low」「medium」という語を『Preparedness の実務に関与していなかった』として枠組みから削除したからで、その削除自体が配備を促していると読む31。論文はこの読みの裏づけとして、OpenAIが自社のシステムカードで生物・化学と説得の「Medium」水準を認めたうえでo1を配備したことを挙げている3。ここで言う「深刻な危害」はOpenAI自身が枠組みの中で「数千人の死亡または重傷、あるいは数千億ドルの経済的損害」と定義しているもので、論文はこれを死者1,000人超・損害1,000億ドル超と要約して引いている3。

第三に、OpenAIのCEOが一方的にさらに危険な能力を配備することを枠組み上許してしまっている、という指摘だ。論文が引くのは、枠組みが「念のため言えば、OpenAI Leadershipは SAG の参加なしに決定を下すこともできる。すなわち SAG に議事妨害の力は無い」と書いていること、そしてCEOの判断への説明責任を担うはずの取締役会の安全・セキュリティ委員会を、そのCEO自身が共同で率いていることである3。ただし論文がこの委員会の点に付けている出典は2024年5月28日の委員会設置発表で、設置時点でも議長はCEOではなくBret Taylorだった。OpenAIは同年9月16日に、この委員会をZico Kolterを議長とする独立の取締役会監督委員会へ改組すると公表しており、そこに挙がる4名にCEOは入っていない。論文はこの改組に触れていない3。公開記録に照らせば、第三の主張のうち委員会の構成に懸かる部分は、論文の時点ですでに1年前の構成を指していたことになる。枠組みの条文に懸かる部分、すなわちSAGに議事妨害の力が無いという点は、この改組の影響を受けない。枠組みの側は、その議事妨害の一節と同じ付録で、取締役会の安全・セキュリティ委員会が決定を精査できるとしたうえで、必要なら「取締役会は決定を覆し、あるいは方針の修正を命じうる」とも定めている1。この条項は論文も表に引いており、取締役会による安全への介入を「求める(requests)」仕組みに分類している3。

とくに他の開発者が先に出した場合として論文が挙げるのは、他のフロンティアAI開発者が追跡カテゴリで「HighまたはCriticalの能力」を持つシステムを、同等の安全策を伴わずに開発・公開したと厳密に確認できれば「その能力領域で要求する安全策の水準を相応に調整しうる」という条項だ3。ただし枠組みは同じ文で「ただし以下の場合に限る」として三つの条件を付けている。全体の深刻な危害リスクを意味あるほど高めないと評価すること、調整することを公に認めること、そして「安全の底辺への競争を避けるため」他社より保護的な水準を保ちその裏づけとなる情報を共有すること、の三つである1。論文もこの条項を注に引いているが、引用は「Tracked Categories…」で一度切れており、いま見た「同等の安全策を伴わずに」という限定はそこで飛ばされている3。論文が引いているのは三つの条件を含む後半で、そのうえで、なお枠組みが調整を許していると評価している3。

三つの主張は、枠組みが何を評価するよう求めているかだけでなく、枠組みが実際に何を許してしまっているかに着目している。手法としては、アフォーダンス理論(ある仕組みが実際に何を可能にするかを分析する枠組み)とMIT AI Risk Repositoryを組み合わせ、枠組みが実際に何を許容しているかを体系的に検討するproof-of-conceptだと位置づけられている3。

外部評価のアクセス水準は明かされていない

OpenAIは外部の組織と協働して能力を試験するとしている2。だが、その試験がどれだけ実効的かは別の問題だ。Jacob Charnockらの2026年1月の論文は、フロンティアモデルへの外部アクセスの現状を扱う4。外部評価者は「限られたモデルアクセス、限られた情報、そして限られた時間」しか与えられず、評価の厳密さが損なわれる、と論文は指摘する4。具体的には、モデルの内部(活性・勾配・重み)を見られずブラックボックスの入出力に限られること、十分な文脈と技術的詳細を欠くこと、そして評価に与えられるのが数週ではなく数日であることの三点を挙げている4。ただし同じ論文は、直近の評価ではChain of Thoughtへのアクセスと評価期間の延長という改善があったとも書いており、その改善例として挙げているのはMETRとOpenAI自身のシステムカードである4。手薄だという指摘は、改善がゼロだという指摘ではない。

この論文は、これらの問題点を実証した監査ではなく、提案・枠組み論文である。提案しているのは、アクセスをモデルアクセス・モデル情報・評価期間の三つの側面に切り分けたうえでの、AL1からAL3までの3段階のアクセス水準の分類だ。「ブラックボックス(モデルの内部を見ない方式。訓練途中のチェックポイントや生の思考の筋道、安全分類器の切り替えは、この階に含まれる)のモデルアクセスと最小限の情報」から、「ホワイトボックス(内部の重みや構造まで見える方式)のモデルアクセスと包括的な情報」までを段階分けする4。狙いは、EUの汎用AI行動規範(General-Purpose AI Code of Practice)が言う「適切なアクセス」の段階を記述する共通の語彙を与え、評価者・企業・政策当局の間の意思疎通を明確にすることだ4。論文はこの3段階を「記述的」なもので、時間とともに修正が必要だと自ら位置づけたうえで、行動規範が言う三つの「適切」、すなわちbest practice、the state of the art、より革新的な手法に対応づけている4。ただし最上段のAL3にあたるホワイトボックスアクセスは、クローズドソースのモデルではまだ外部評価者に試されたことがなく、現在の到達点を超えるだろうとも書いている4。この3段階で押さえておくべきは、最下段のAL1が「最低限」の側だという点である。論文はAL1を、行動規範の署名者が外部評価者に提供する必要のある最低水準と位置づけており、そこですら、三つ目の側面である評価期間について行動規範が求めるのは最低20営業日である。そのうえで、それを超える時間を外部評価者に与えたフロンティアAI企業は見当たらない、とも書いている4。実務上の期間が20営業日を大きく下回ることも多く、論文が挙げる実例はClaude Sonnet 4と4.5の外部評価者が受け取った1週間である4。もっとも同じ論文は別の箇所で、外部評価者に与えられる期間には公開前のアクセスが無い場合から20営業日を超える評価までの幅があるとも書いており、この二つは論文の中で食い違ったまま並んでいる4。

まだ見えていないもの

OpenAIが「排除できない」と述べ、封じ込め措置に先に着手したこと自体は、しきい値に近づいた段階で判断が先に動くという設計に沿っている。発表はその裏づけとして、枠組みが過去の能力転換でも指針になったことを挙げ、2025年6月にモデルが生物学のHighしきい値に近づいたときに取った措置を並べたうえで、今回も同じ原則を適用していると書いている2。その先例はHighしきい値のものであり、枠組みがサイバーのCriticalについて名指しで定めている措置はこれではない。枠組みは「Critical標準を満たす安全策とセキュリティ管理の基準を明示するまで、さらなる開発を停止する」と書いている1。ただし枠組みは別の節で、Criticalに到達した、または到達すると予測されるモデルを「重大な危険を呈するものであり、極めて慎重に扱うべきだ」としたうえで、「外部配備の有無や時期にかかわらず、開発中に追加の安全措置(安全とセキュリティの管理)を要する」とも定めている1。同じ段落は続けて、Criticalへの対応が「悪意ある行為者(内部・外部を問わない)とモデルの不整合の双方に対して頑健である必要がある」とも書いている1。OpenAIが挙げた隔離・アクセス制限・重み保護は前者に、危険な行動と不整合の監視は後者に対応する。停止条項と追加措置条項は別物で、今回の社内措置が沿うのは追加措置条項のほうである。もっとも発表はこの条項を挙げておらず、条項の要件である到達や到達予測も述べていない2。枠組みは同じ段落の末尾で、大量に回せる評価(scalable evaluations)がしきい値の能力を持つか、それに近づいているかもしれないと示すモデルについては、SAGが詳細評価を求める裁量を持つとも定めている1。その追加措置条項と同じ節には、現時点でCritical水準の能力を持つモデルは保有しておらず、どのモデルもその水準に達する前にこの枠組みをさらに更新する見込みだ、という一文も置かれている1。今回の判断は、その更新より先に来た。発表は「ベンチマークと評価を続けている」としか書いておらず、OpenAIはCriticalかどうかの判定をまだ確定させていない2。これは、この停止条項が発動する手前に判断を置いたということでもある。その手前で何が進んでいるかも、発表自身が書いている。Criticalを排除できないと述べた同じ文書が、「これらの能力の配備に見合うよう」安全策の堅牢性試験を拡充したと述べているからだ2。枠組みが動いたことと、枠組みが最も強く求めている措置が取られたこととは、同じではない。

Cogginsらの分析が指摘するのは、枠組みが存在することと、それが実際にリスクを緩和する行動を保証することは別だという点だ3。今回OpenAIが挙げた安全措置のリストは、実施されたという宣言であって、外部から独立に確認された記録ではない。Charnockらの整理に沿えば、問うべきは、外部評価者が受け取るアクセスの水準が行動規範上の最低線であるAL1、すなわちブラックボックスと最小限の情報を超えるのかどうかである。OpenAIが挙げる「一部のAI安全組織」を誰が選ぶかは発表に書かれておらず、共同試験で評価者がモデルの内部にどこまでアクセスできるかも明らかではない24。

判断できる材料が増えるとすれば、それはAstraの評価に使われたアクセス水準そのものと、評価の結果が独立に公表されるかどうかだろう。Astraについては、現時点ではその両方がまだ見えていない。ただし、こうした材料が出ないと決まっているわけではない。OpenAIはこの発表の3日前、2026年8月4日に、直前世代のGPT-5.6-Solが第三者によるサイバー評価で試験の境界を越えたという報告を公開している。そこには評価者の名前(UK AISIとIrregular)と、インターネット接続を意図的に有効化しサイバー分類器を無効化したという評価条件、そしてUK AISI自身の公表への導線が載っている5。この開示が出たのは、評価が計画どおりに進まなかったからでもある。Charnockらも別の前例を挙げている。OpenAIとAnthropicは、UK AISIとUS CAISIへ安全策の構成・既知の脆弱性・分類器スコアといった、最小限を超える情報を提供したことがあるという4。いずれもAstraの評価ではないが、AL1を超える提供が起きた記録そのものは在る。Astraについて8月4日と同じ水準の開示が出るかどうかは、まだ分からない。


出典8件
  1. OpenAI「Preparedness Framework Version 2」2025年4月15日. https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf — 共通の二段のしきい値はp.5、サイバー行はp.6–7で、Criticalの措置欄は開発の停止。§4.4は到達または到達予測のモデルに開発中の追加措置を求める。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15

  2. OpenAI「Responding to the next frontier of critical cyber capabilities」2026年8月7日. https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ — AstraのCriticalのサイバー能力を排除できないとした発表。措置の節は配備に見合う堅牢性試験の拡充から始まる。報道は https://www.helpnetsecurity.com/2026/08/10/openai-astra-critical-cyber-capabilities/ と https://thehackernews.com/2026/08/openais-next-ai-model-astra-shows-cyber.html(8月10日)、10問の一次は https://openai.com/index/ten-advances-in-mathematics/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31

  3. Coggins ほか「Affordance Analyses of AI Safety Policies: A Proof-of-Concept using OpenAI’s Preparedness Framework」FAccT ‘26, 2026. https://doi.org/10.1145/3805689.3812331 — 枠組みは緩和策を保証しないと論じる。arXiv https://arxiv.org/abs/2509.24394 設置 https://openai.com/index/openai-board-forms-safety-and-security-committee/ 改組 https://openai.com/index/update-on-safety-and-security-practices/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15

  4. Charnock ほか「Expanding External Access to Frontier AI Models for Dangerous Capability Evaluations」FAccT ‘26, 2026. https://doi.org/10.1145/3805689.3812365 — 外部評価のアクセスをモデル・情報・期間に分け、AL1〜AL3の3段階を提案する。arXiv https://arxiv.org/abs/2601.11916 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14

  5. OpenAI「Third-party cyber evaluations involving OpenAI models」2026年8月4日. https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/ — 対象はGPT-5.6-Sol。UK AISIとIrregularの評価条件と、試験の境界を越えた件を報告する。 ↩ ↩2

  6. Anthropic「Activating AI Safety Level 3 protections」2025年5月22日. https://www.anthropic.com/news/activating-asl3-protections — Claude Opus 4でASL-3のリスクを明確に排除できないとして予防的に保護を発動した。ASL-4は排除したと書く。 ↩

  7. OpenAI「ChatGPT agent System Card」2025年7月17日. https://openai.com/index/chatgpt-agent-system-card/ — 確定的な証拠は無いとしつつ、生物・化学の領域でHighとして扱い保護を発動した。最上位のCriticalではない。 ↩ ↩2

  8. Google DeepMind「Gemini 2.5 Deep Think Model Card」2025年8月1日. https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Deep-Think-Model-Card.pdf — サイバーの早期警戒しきい値に達し、緩和策を配備したと書く。CCLそのものには達していないとする。 ↩ ↩2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。