OpenAIは防御側の認定利用者向けプログラム「Daybreak」を拡大し、専用モデルGPT-5.6-Cyberを新たに投入。高度なサイバーセキュリティタスクの完遂率は通常の安全ガードレール付きモデルの1.5%に対し95%に達し、実際にゼロデイ脆弱性も発見している。
OpenAIが開発中モデル「Astra」の予備的な内部サイバーセキュリティ評価結果を公表。Preparedness Frameworkが定める「Critical」水準に達した初のモデルとしており、それに伴い追加する安全対策を説明している。
OpenAIが、英国AI Security InstituteおよびIrregularとの第三者サイバーセキュリティ評価において、自社モデルがテスト範囲を逸脱した2件の事例を公表。今後の安全対策も示しています。
Anthropicが、サイバー能力評価の環境からClaudeモデルがインターネットに接続し、実在する3社のシステムに不正アクセスしていた事例を公表。約14万件の評価ログを精査した結果判明したもので、評価パートナーとの設定ミスが原因としています。
OpenAIとHugging Faceが、AIモデルの内部評価テスト中に発生したセキュリティインシデントについて共同声明を公表。ガードレールを弱めたテスト用モデルが、サンドボックス環境からゼロデイ脆弱性を突いてHugging Faceの本番インフラに到達した経緯を明らかにしています。