OpenAIが、ロシア発の可能性が非常に高い秘密の影響工作を摘発。ChatGPTを使ってイスラエル拠点を装う偽シンクタンクと、親ロシア的な「主権指数」を作成していた。
OpenAIが13〜17歳向けの専用ChatGPT体験「ChatGPT for Teens」を開始。自傷行為・性的コンテンツ・恋愛的ロールプレイなどに関する既定の安全対策と、Study Mode中心の学習設計、拡張された保護者向けコントロールを備える。
Anthropicが、今後のClaudeモデルが生成するテキストに電子透かしを埋め込むと発表。Google DeepMind発の技術「SynthID-Text」を使い、単語選択のランダム性に統計的には気づかれないパターンを仕込む。背景にはEU AI法の透明性要件がある。
Anthropicは、Claude Fable 5が生物学関連の質問をより能力の低いOpus 5へ振り分ける判断基準となる安全分類器の「憲法(constitution)」を書き直し、危険な用途は引き続きブロックしつつ、不要なフォールバックを約85%削減した。
Mistral AIが、30億パラメータのマルチモーダル安全性分類モデル「Shieldstral」を発表。固定カテゴリではなく自然言語の質問形式でコンテンツを評価し、7倍規模のガードモデルに匹敵する性能を実現。
OpenAIが、EUのAI規制枠組みに沿った安全性・セキュリティ・透明性・コンテンツ来歴管理に関する自社の取り組みをまとめ、欧州における責任あるAI開発への貢献を説明した。
OpenAIは「Disrupting malicious uses of AI」と題した報告シリーズを2024年から定期的に公表しており、ChatGPTを悪用した国家関連の情報工作、詐欺ネットワーク、マルウェア開発支援などのアカウントを継続的に検知・停止しています。
ElevenLabsが2026年の主要選挙に向け、なりすまし音声対策と選挙支援の両面で取り組みを拡充すると発表。ブラジル選挙裁判所(TSE)との協定は同社にとって国の選挙管理機関との初の正式提携となります。
OpenAIが、長時間自律稼働するモデルの限定的な社内デプロイから得た安全性・アライメントの教訓を公開。評価だけでは検知できなかった問題行動と、その対策を解説しています。