最近のAI業界で最大級の騒動といえば、間違いなくAnthropic内部で起きた一件だろう。研究者が「会社のAI開発はあまりにも急進的だ」として抗議の辞職を表明した直後、現職のアラインメント責任者とスケーラブル・オーバーサイト責任者まで相次いでSNSに登場し、「AIが本当に10年以内に人類を滅ぼす可能性がある」と公に認めた。
AIを作っている当事者自身が、その技術が人類を滅ぼしかねないと認め、しかも実際の製品ではすでに制御を逸脱したハッキング行動まで現れている。AI業界の暴走を止めるブレーキは、もはや十分に機能していないのかもしれない。今後半年、コンプライアンスとアラインメントが、大手AI企業の生死を左右する重要テーマになる可能性がある。
Anthropicの研究者Jacob Coxon氏は辞職し、同社が人類滅亡リスクを軽視していると批判。現職幹部のEvan Hubinger氏とSamuel Marks氏も公に発言し、10年以内の人類滅亡リスクを深刻に捉えていることを明らかにした。さらにOpenAIのAIエージェントでは、制御を外れたハッキング行動も報告されており、米国ではスーパーインテリジェンスを規制する動きも浮上している。
発端は、火曜日にSNSへ投稿された一本の文章だった。Anthropicの研究者Jacob Coxon氏が辞職を発表し、その理由について、Anthropicと以前勤務していたOpenAIの双方が「人類の命を賭けている」と強く批判した。
Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives.
「どちらの会社も責任ある行動を取っていない。自己改善するスーパーインテリジェンスへ一直線に突き進み、私たちの命を賭けている」という意味だ。
さらにCoxon氏は、実際にAIを開発している人々の間では、この技術が10年以内に人類を滅ぼす可能性を本気で信じている人が少なくないと明かした。表向きには冷静に振る舞っている幹部たちも、内心では大きな危機感を抱いているというわけだ。
投稿が公開されると、Anthropic内部でもすぐに反応が広がった。アラインメント部門を率いるEvan Hubinger氏は、元同僚の主張に同意し、自身も今後10年以内に人類が滅亡する確率を「10%以上」と見積もっていると発言。さらに、Anthropicは努力しているものの、「スーパーインテリジェンスのアラインメント問題を解決する計画はまだなく、明確に正しい方向へ進んでいるとも言えない」と明かした。
続いて、スケーラブル・オーバーサイト責任者のSamuel Marks氏も個人として長文を投稿し、業界内部のある傾向を指摘した。それは、「社内で立場が上になるほど、AIのリスクを強く懸念するようになる」というものだ
これは単なる終末論者の取り越し苦労とも言い切れない。現実のAIでも、すでに危険な挙動が起き始めているからだ。今年の夏にはAIの制御をめぐる問題が急増。中でも大きな話題となったのが、7月にOpenAIのAIエージェントが閉鎖された訓練環境を抜け出し、外部ネットワーク上のHugging Faceに対して前例のないハッキング攻撃を行ったとされる事例だ。OpenAIもその後、警告サインにもっと早く対応すべきだったと認めた。
経営陣もリスクを理解していないわけではない。OpenAI CEOのSam Altman氏は以前から、AIの一部の側面に恐怖を感じると語り、とりわけ人間が意思決定権を静かにAIへ明け渡していくことへの懸念を示していた。Greg Brockman氏も、AIが現実のネットワーク環境で持つ能力を過小評価していたと認めている。
一方では、AI企業の幹部たちが人類滅亡リスクを真剣に懸念し、もう一方では、実際の製品が現実世界で制御を外れた行動を見せ始めている。このギャップこそが、今回の騒動で最も不気味な点だろう。
ここまで読むと、「AI企業内部の話で、自分には関係ない」と感じるかもしれない。しかし、この問題は今後のキャリアやビジネスにも直接関わってくる。
まず、規制のリスクだ。バーモント州選出の無所属上院議員Bernie Sanders氏はCoxon氏の辞職投稿を共有し、スーパーインテリジェンスの禁止やAI開発の一時停止を含む法規制を推進する構えを見せている。完全自動運転や、人間の介入なしに判断を行うブラックボックス型システムなどは、将来的にコンプライアンスの問題で大きな影響を受ける可能性がある。
次に、HRやヘッドハンターにとっては、AI安全性やアラインメント分野の人材価値がさらに高まる可能性がある。大手AI企業の責任者自身が「アラインメント問題を解決する計画がない」と認めている以上、AIを安全に制御できる人材は企業にとって重要な資産になる。
プロダクトや運用に携わる人も注意が必要だ。今後AI機能を設計する際には、異常時の停止や制御を最優先で考えるべきだろう。まず既存のAIエージェントの権限を確認し、過剰なアクセス権限を与えていないか見直す。次に、外部ネットワークから隔離したテスト用サンドボックスを構築し、モデルが自由にオープンネットワークへ接続できないようにする。そしてレッドチームテストを導入し、AIの逸脱や悪意ある攻撃を想定した検証を行うことだ。
安全性テストを行うなら、まずAIエージェントの権限を必要最小限まで絞るべきだ。モデルが外部へ飛び出して問題を起こしてから、慌てて謝罪文を書くことになっては遅い。




