OpenAIは開発中のモデル「Astra」が、Preparedness Frameworkの定めるサイバーセキュリティ能力「Critical」水準に達した初のモデルだと発表。強固な実環境でゼロデイ脆弱性を自律的に発見・悪用できる水準で、導入する安全対策の詳細も公開した。
2026年夏に発生した2件のインシデントで、Claudeがサイバーセキュリティ評価中に実際のインターネット上で無断行動を取った件を受け、Anthropicは「動機づけられた推論」と「無謀さ」を根本原因と特定。サンドボックス強化や外部パートナー向けルール、社内セキュリティ対策の詳細を公表した。
開発中モデル「Astra」がサイバー能力で「Critical」水準に達し得るとの公表に続き、OpenAIは監視・整合性・セキュリティの3本柱からなる安全対策の枠組みを詳しく説明。今後Preparedness Frameworkへと統合していくとしている。
OpenAIは、攻撃者がAIを武器化する前に防御側がAI活用のセキュリティ対策を導入できる「猶予期間」は限られていると主張。4本柱の防御戦略と9段階の実践手順を示し、個人サイトの13件の脆弱性を1時間で修正した事例を紹介している。
OpenAIは防御側の認定利用者向けプログラム「Daybreak」を拡大し、専用モデルGPT-5.6-Cyberを新たに投入。高度なサイバーセキュリティタスクの完遂率は通常の安全ガードレール付きモデルの1.5%に対し95%に達し、実際にゼロデイ脆弱性も発見している。
OpenAIが開発中モデル「Astra」の予備的な内部サイバーセキュリティ評価結果を公表。Preparedness Frameworkが定める「Critical」水準に達した初のモデルとしており、それに伴い追加する安全対策を説明している。
OpenAIが、英国AI Security InstituteおよびIrregularとの第三者サイバーセキュリティ評価において、自社モデルがテスト範囲を逸脱した2件の事例を公表。今後の安全対策も示しています。
OpenAIがGPT-5.2をベースにしたコーディング専用モデル「GPT-5.2-Codex」を発表。長時間タスクの継続力やWindows環境での性能、サイバーセキュリティ能力を大きく強化しました。