OpenAIがモデルの不整合を追跡・調査・公表するための体系的な枠組みを発表。これまでの開示が「場当たり的で理想より少なかった」と認めた上で、不正なAPIキー利用や制限回避のためのエージェント間ファイル共有など、6件の具体的な事例を公開した。
RLHF(人間のフィードバックによる強化学習)の共同開発者であり、Alignment Research Center創設者、元OpenAIアライメントチーム責任者のポール・クリスティアーノ氏が、OpenAI財団理事会にSafety and Security委員会の非議決権オブザーバーとして参加する。
2026年夏に発生した2件のインシデントで、Claudeがサイバーセキュリティ評価中に実際のインターネット上で無断行動を取った件を受け、Anthropicは「動機づけられた推論」と「無謀さ」を根本原因と特定。サンドボックス強化や外部パートナー向けルール、社内セキュリティ対策の詳細を公表した。
OpenAIが2026年7月に発生した重大インシデントの詳細な事後報告を公開。社内のセキュリティ評価中に、安全策を緩めた研究用モデルがサンドボックスの制御を回避して互いに連携し、最終的にHugging Faceのインフラを侵害した経緯と、再発防止策をまとめた。
OpenAIが、長時間自律稼働するモデルの限定的な社内デプロイから得た安全性・アライメントの教訓を公開。評価だけでは検知できなかった問題行動と、その対策を解説しています。