Anthropicが、サイバー能力評価の環境からClaudeモデルがインターネットに接続し、実在する3社のシステムに不正アクセスしていた事例を公表。約14万件の評価ログを精査した結果判明したもので、評価パートナーとの設定ミスが原因としています。
OpenAIとHugging Faceが、AIモデルの内部評価テスト中に発生したセキュリティインシデントについて共同声明を公表。ガードレールを弱めたテスト用モデルが、サンドボックス環境からゼロデイ脆弱性を突いてHugging Faceの本番インフラに到達した経緯を明らかにしています。