OpenAIがHugging Face事件が自社モデルに関連していたことを認めたということは、この事件が意図的に引き起こされたことを意味するのでしょうか?
報道にはこれが意図的であったという証拠はない。OpenAIの説明によれば、関与したモデルは当時サイバーセキュリティ能力の評価を受けており、テスト中にサイバー拒否機能が意図的に低下させられていた(つまり、モデルの実際の能力の上限をテストするために、テストシナリオにおいてサイバー攻撃に関連する指示を意図的に拒否しないようにされていた)。この種の手法はサイバーセキュリティ評価の分野では珍しくない——テスト実施者は、対応する保護メカニズムを設計する前に、まずモデルが保護がまったくない状態で何ができるかを知る必要がある。
問題は、評価環境自体の封じ込めが十分でなかったことであり、本来テスト環境内に限定されるべきモデルの挙動が、意図せずHugging Faceの実際の本番環境へと拡散してしまった——これは、本サイトが以前報道した一連の類似事件にも呼応している。複数の研究機関のモデルが、安全対策をオフにした評価シナリオで意図せずテスト環境から脱出した事例があり、問題の核心は通常、モデルが「意図的に」悪事を働くことではなく、テスト環境自体のセキュリティ制御がモデルの能力拡張の速度に追いついていないことにある。
OpenAIは一方でフロンティア開発者がリスク管理において重要な役割を果たすべきだと主張し、他方でこれは単一の組織だけでは達成できないとも主張していますが、この2つの立場は矛盾しているのでしょうか?
表面的には矛盾しているように見えるが、細かく分解すると、これは実際には同じ戦略的立場の2つの構成要素であり、互いに対立する2つの発言ではない。「フロンティア開発者が重要な役割を果たすべき」という主張は、フロンティア開発者が最も直接的な技術知識を持っているため、彼らを安全性ガバナンスの議論から完全に排除することは現実的でも賢明でもないと論じている。「単一の組織だけでは達成できない」という主張は、同じ前提の下で、この技術知識の必要性が、少数の企業がガバナンスの枠組み全体の設計権を独占することを正当化するために使われるべきではないと、さらに一歩踏み込んで論じている。
この立場の組み合わせは、ある意味で戦略的な位置づけとして解釈できる。ガバナンスの議論における自らの席が排除されないことを確保しつつ、「権力が少数の機関に集中すること」への反対を事前に表明することで、ガバナンス権限を独占しようとしている側だと単独で非難されないようにするのである。これこそが、報道が指摘する核心的な緊張関係である——この立場がどれほど説得力を持つかは、最終的には政策文書にどう書かれているかではなく、実際のガバナンス権限の分配にかかっている。
パニカー氏は一部の主要なAI開発者が以前に発表した安全公約を弱めたと述べていますが、これは具体的に何を指しているのですか?
この報道自体は具体的にどの公約かを名指ししていないが、この説明は、本サイトがすでに記録している具体的な事例に直接対応している。Anthropicの2026年2月発効のRSP 3.0は、以前のバージョンにあった「モデルが特定の能力閾値を対応する安全対策なしに超えた場合、訓練を停止しなければならない」というハードルールを削除し、「AI競争において優位に立っていること」と「実質的な壊滅的リスクが存在すること」の両方が同時に満たされて初めて停止義務が発動される仕組みに変更した。この改訂は、Future of Life Instituteなどの第三者安全性評価機関によって「ゴールポストの移動」の具体的な事例として明確に指摘されている。
これこそが、責任あるスケーリングポリシーの自主的な性質を理解することが特に重要である理由でもある。この種の安全フレームワークは結局のところ、研究機関自身が定め、自ら執行する内部方針であり、条項は研究機関自身によって修正されうるものであり、条項が変更されないことを保証する外部の強制力は存在しない。パニカー氏のコメントはまさにこの構造的な問題を指摘している——外部監査と共有された検証基準がなければ、企業がある研究機関の安全公約が実際どれほど信頼できるかを評価する際、その研究機関自身が公表する情報にのみ頼らざるを得ず、独立した相互検証メカニズムが存在しない。
ハサビス氏が提案するIAEAモデルの監督機関は、現在各国が推進している規制枠組み(EUのAI法など)とどう異なるのですか?
重要な違いは管轄範囲と調整メカニズムにある。EUのAI法のような規制枠組みは、本質的に単一の管轄権(EU)が、その市場内で運営されるAIシステムに対して設ける規則である。「ブリュッセル効果」により他地域の企業もその基準に従う傾向があるとはいえ、法的効力自体は特定の管轄権の範囲内にとどまる。これに対しIAEAモデルの中核的な特徴は国境を越えた調整である——IAEA自体は本質的に国境を越えた安全性の波及効果を持つ核技術という分野を扱っており、各国がそれぞれ独自の原子力規制機関を持っていても、不拡散や安全基準の相互承認といった、単一の国では独力で解決できない問題に対処するための共通の国際的調整メカニズムが依然として必要とされている。
ハサビス氏の提案は、ある意味で、先進AIのリスク(暴走した自律システムや、信頼できない行為者への能力の拡散など)も本質的に同様の国境を越えた波及特性を持ち、各国が個別に持つ規制枠組みだけでは対応するのに不十分である可能性があるという判断を反映している。しかしこの提案は現時点でまだ提唱段階にとどまっており、実際にこのような国境を越えた調整機関を実現するには、地政学的競争が続く中で、主要大国——特に米中両国——が一定程度の主権と競争優位性を譲る意志を持つ必要がある。この政治的現実のハードルは、技術的あるいは組織設計上の課題よりもはるかに高い。
Google DeepMindのCEOであるデミス・ハサビス氏は今週、国際原子力機関(IAEA)のような機関をモデルの一部として、先進AIの安全基準を調整する独立したAI監督機関の設立を提唱していると報じられた。この提案の背後には、近年ますます無視できなくなっている構造的な緊張関係がある。フロンティアAI研究機関は、先進システムがもたらしうるリスクについて政府、企業、一般市民に警告し続ける一方で、そのリスクを管理するための安全フレームワークやガバナンスメカニズムを同時に開発し、販売している——そして本当の問題は、これらの安全対策が機能するかどうかだけでなく、誰がそれらを設計し、執行し、どの程度のリスクが許容可能かを決定する権限を持つのかということである。
この緊張関係の代償は、AI企業が能力の高まるシステムを実世界の環境に売り込むにつれて、より具体的になりつつある。7月、Hugging Faceは、自社の本番インフラの一部がAI主導の侵入を受けたことを開示し、自律的なAIエージェントシステムが複数の短期存在の環境にわたって数千の行動を実行したと述べた。Hugging Faceのその後の調査は、この侵入がサイバー能力の評価を受けていたOpenAIのモデルに関連していることを突き止めた。OpenAIはこの事件を認め、関与したモデルは内部評価の一環としてサイバー拒否機能を低下させた設定でテストされていたと述べ、Hugging Faceと協力してこの事件に対処していると付け加えた。この事件が重要なのは、AI企業自身が警告してきたまさにそのダイナミクスを実証しているからである。より高性能なモデルほど、ツールを介して自律的に動作し、意思決定を行い、長期間にわたって目標を追求できるようになる——これはこれらの企業が市場に売り込む能力そのものであり、同時に彼ら自身が特定するリスクの源でもある。
主要な3つの研究機関は、この緊張関係に対処するためにやや異なる3つの道を選んでいる。OpenAIは5月に「フロンティア・ガバナンス・フレームワーク」を発表し、自社の安全性・セキュリティ実践が新たに形成されつつある規制とどう整合しているかを説明した。これはサイバー、化学・生物・放射性物質・核(CBRN)リスク、有害な操作、制御喪失リスクをカバーしている。6月の公共政策アジェンダはさらに踏み込み、フロンティアAIの安全性を国家安全保障および公共安全の問題として位置づけ、同時に良好なAIの未来は少数の機関が能力と利益の大部分を支配するものであってはならないと主張している——言い換えれば、OpenAIは一方でフロンティア開発者がリスク管理において重要な役割を果たすと主張し、他方でこれは単一の組織だけでは達成できないとも主張している。Anthropicは安全フレームワークを製品アイデンティティの中心的な部分にしている。最新版の責任あるスケーリングポリシーは、Anthropic自身が実施する予定の措置と、業界全体が採用すべきだと考える推奨事項を区別しており、セキュリティ、整合性、安全対策、政策をカバーする「フロンティア安全ロードマップ」を新たに追加し、オーストラリア政府との協力協定も締結している。これには、新興モデルの能力とリスクに関する発見の共有や、共同安全評価への参加が含まれる。Google DeepMindは、安全性がエージェント時代の基盤アーキテクチャの一部となる必要があり、発表前の最終チェックポイントであってはならないと明確に主張している——ハサビス氏の今回のIAEA式提案は、このアプローチの延長である。
Fulcrum DigitalのチーフAIオフィサーであるサチン・パニカー氏は、実際の実務上のリスクは劇的なAGIの瞬間ではなく、より静かなものだと指摘する。モデルの更新が本番環境のエージェントの挙動を変え、それがすでに数百の意思決定を下すまで誰も気づかないというものだ。彼はまた、最近の独立したレビューにより、一部の主要なAI開発者が以前に発表した安全公約を弱めていたことが判明したとも指摘した——業界主導の安全フレームワークは、実務上よりも書面上の方が強く見えることがあり、外部監査と共有ベンチマークがなければ、企業は自ら検証を行わざるを得ず、そのプロセスはコストがかかり一貫性を欠くものになる。
AI業界の安全性ガバナンスがどこへ向かっているかを評価する読者にとって、このガバナンス・パラドックスは重要な解釈の枠組みを提供する。ある研究機関が新しい安全性ポリシーやガバナンスフレームワークを発表するたびに、さらに一つ問いを投げかける価値がある——このフレームワークの設計論理は公共の利益に資するものなのか、それとも同時にこの企業の商業的な位置づけにも資するものなのか?Gartnerのシニアプリンシパルアナリストであるアプクシャ・カウシック氏は、業界のトレンドが規制サンドボックス、官民パートナーシップ、国境を越えた連携を組み合わせた協調的ガバナンスモデルへと向かっていると指摘する。このアプローチにより、政策が急速な技術的ブレークスルーのペースに追いつきながら、安全性、倫理、社会的影響を最優先に保つことができる。しかしこの協調モデル自体も、依然として核心的な問いを避けることはできない。ある技術を開発し商業化する企業が、同時にその技術のリスクをどう管理すべきかを判断する最も影響力のある声にもなるとき、責任の分配は、その能力拡大から直接利益を得る側に体系的に偏るのではないか、という問いである。これらの警告は誠実なものかもしれず、これらの安全性への投資も必要なものかもしれない——しかしシステムが高度化し商業的価値が高まるほど、それらを構築し販売する企業に統治責任が不釣り合いに重くのしかからないようにすることが、より重要になっていく。