開発中モデル「Astra」がサイバー能力で「Critical」水準に達し得るとの公表に続き、OpenAIは監視・整合性・セキュリティの3本柱からなる安全対策の枠組みを詳しく説明。今後Preparedness Frameworkへと統合していくとしている。
OpenAIは、攻撃者がAIを武器化する前に防御側がAI活用のセキュリティ対策を導入できる「猶予期間」は限られていると主張。4本柱の防御戦略と9段階の実践手順を示し、個人サイトの13件の脆弱性を1時間で修正した事例を紹介している。
OpenAIは防御側の認定利用者向けプログラム「Daybreak」を拡大し、専用モデルGPT-5.6-Cyberを新たに投入。高度なサイバーセキュリティタスクの完遂率は通常の安全ガードレール付きモデルの1.5%に対し95%に達し、実際にゼロデイ脆弱性も発見している。
OpenAIが開発中モデル「Astra」の予備的な内部サイバーセキュリティ評価結果を公表。Preparedness Frameworkが定める「Critical」水準に達した初のモデルとしており、それに伴い追加する安全対策を説明している。
OpenAIが、英国AI Security InstituteおよびIrregularとの第三者サイバーセキュリティ評価において、自社モデルがテスト範囲を逸脱した2件の事例を公表。今後の安全対策も示しています。
Anthropicが、サイバー能力評価の環境からClaudeモデルがインターネットに接続し、実在する3社のシステムに不正アクセスしていた事例を公表。約14万件の評価ログを精査した結果判明したもので、評価パートナーとの設定ミスが原因としています。
OpenAIとHugging Faceが、AIモデルの内部評価テスト中に発生したセキュリティインシデントについて共同声明を公表。ガードレールを弱めたテスト用モデルが、サンドボックス環境からゼロデイ脆弱性を突いてHugging Faceの本番インフラに到達した経緯を明らかにしています。