OpenAI、新モデル「Astra」を自ら封印 — 史上初の「Critical」判定が意味すること
ペンギン先生!OpenAIが「自社の新しいAIが危険すぎるかもしれない」って自分で公表したって本当なの?
「Critical」って何なの?危険度の段階があるってこと?
そうだよ。OpenAIには「Preparedness Framework」という安全評価の仕組みがあってね。AIの危険度を「Low・Medium・High・Critical」の4段階で評価するんだ。Criticalは最高危険水準で、「人間の助けを借りずに、実際のシステムに対して高度なサイバー攻撃を自律的に実行できる」能力が確認された場合に付けられるんだよ。
「自律的に攻撃」ってどういうことなの?普通のAIとどう違うの?
それって……Astraはもうそれができるようになったの?
OpenAIはどんな対策をとったの?
3つの対策を発表しているよ。まず、安全対策が整っていないAstra関連の社内活動をすべて停止。次に、モデルのあらゆる使用を常時モニタリング。そして、政府機関やAI安全組織と連携してさらに能力を検証する、というものだね。自社の研究ペースを自分たちで落とすのは、ビジネス的にも勇気のいる決断だよ。
自分が作ったAIを「危険かも」って自分で止めるなんて、すごいんだね!でも、他のAI企業にも同じような仕組みってあるの?
似た仕組みはあるよ。AnthropicはRSP(Responsible Scaling Policy)、Google DeepMindはFrontier Safety Frameworkと呼んでいて、どれも「AIが一定の危険水準に達したら開発を制限する」という約束を公表しているんだ。ただ、実際にCriticalに相当する水準が視野に入ったと公式発表したのは今回が初めてなんだよ。
じゃあ、もしCriticalに確定したらAstraは出てこないの?