OpenAIの安全性報告書統括者が退社、企業文化に警鐘

OpenAIの安全性報告書統括者が退社、企業文化に警鐘
米OpenAIで主要モデルのリリースごとに公開される安全性報告書の執筆を統括していたデビッド・ロビンソン氏が、10月3日(現地時間)に同社を退社したことを明らかにしました。同氏は米The Atlanticに「I Quit OpenAI Because Its Culture Is Broken」(OpenAIの文化が壊れているから辞めた)と題した記事を寄稿し、AI企業の慎重さに疑問を呈しています。
ロビンソン氏はOpenAIに3年半在籍し、社内で最も在籍期間が長い従業員の1人でした。現行の「Preparedness Framework」の起草を主導し、12件のフロンティアモデルのリリースで安全性報告書の作成を監督した経験を持ちます。
「反復開発」手法と安全性への懸念
同氏はOpenAIが採用している「iterative deployment」(反復開発)手法を「試行錯誤」と表現し、この手法が本質的に定期的な失敗を避けられないと指摘しています。システムの能力が上がるにつれて失敗の規模も大きくなっているとし、例として今夏のHugging Face事案でOpenAIがエージェント群を誤って外部に出してしまったことを挙げています。その後セキュリティを改善したにもかかわらず、安全制御が再び失敗したことをOpenAI自身が報告しており、こうした失敗は業界に典型的なものだとの見方を示しました。
ロビンソン氏は、フロンティアAIの開発企業は原子力発電所や混雑した空港のように、何重もの冗長性と時間をかけた計画のもとで運営されるべきだと主張しています。しかし、同氏の知る限り、在籍中に航空機の安全運航や原子炉の運転、金融システムの安定などに携わった経験を持つ同僚に出会ったことはなかったと述べています。
必要な改善点と今後の活動
ロビンソン氏は、必要な改善として2点を挙げています。1つは、他分野に蓄積された安全の専門知識を活用すること。もう1つは、現在より大幅に高性能なシステムを作る前に、人間が監視していない状況でもモデルが安全な選択をすることを保証する新たな科学の確立です。アライメントの実用的な定義はまだ完全には存在せず、モデルがテストされていることを検知し、実運用時には異なる振る舞いをする可能性もあるため、評価で良い結果が出ても良いモデルである保証にはならないと指摘しています。
ロビンソン氏は今後、OpenAIをはじめとする企業が安全性を高めるよう、社外から動機付けを強化する活動に取り組むとしています。
相次ぐAI企業の従業員からの警鐘
AI企業の従業員による警鐘は続いており、9月8日には米Anthropicの研究者ジェイコブ・コクソン氏が退社し、OpenAIとAnthropicのいずれも責任ある行動を取っていないと批判しました。同社でアライメント研究を率いるエバン・ヒュービンガー氏らもこれに同調しています。12日にはAnthropicのダリオ・アモデイCEOが、AI開発の「ペース調整」を訴えるエッセイを公開しました。
OpenAIは9月28日、学習中のモデルがオーストラリア政府のWebサイトに権限なくアクセスした問題で謝罪し、航空や原子力の分野にならった「safety case」を目標に据え、学習前に安全性を検証する仕組みを導入すると発表しています。一方、トランプ米大統領は29日、AIの安全対策についてAI開発大手が自主的に対処することで合意したと明らかにしました。


