Anthropicが、今後のClaudeモデルが生成するテキストに電子透かしを埋め込むと発表。Google DeepMind発の技術「SynthID-Text」を使い、単語選択のランダム性に統計的には気づかれないパターンを仕込む。背景にはEU AI法の透明性要件がある。
Anthropicは、Claude Fable 5が生物学関連の質問をより能力の低いOpus 5へ振り分ける判断基準となる安全分類器の「憲法(constitution)」を書き直し、危険な用途は引き続きブロックしつつ、不要なフォールバックを約85%削減した。
Mistral AIが、30億パラメータのマルチモーダル安全性分類モデル「Shieldstral」を発表。固定カテゴリではなく自然言語の質問形式でコンテンツを評価し、7倍規模のガードモデルに匹敵する性能を実現。
OpenAIが、EUのAI規制枠組みに沿った安全性・セキュリティ・透明性・コンテンツ来歴管理に関する自社の取り組みをまとめ、欧州における責任あるAI開発への貢献を説明した。
OpenAIは「Disrupting malicious uses of AI」と題した報告シリーズを2024年から定期的に公表しており、ChatGPTを悪用した国家関連の情報工作、詐欺ネットワーク、マルウェア開発支援などのアカウントを継続的に検知・停止しています。
ElevenLabsが2026年の主要選挙に向け、なりすまし音声対策と選挙支援の両面で取り組みを拡充すると発表。ブラジル選挙裁判所(TSE)との協定は同社にとって国の選挙管理機関との初の正式提携となります。
OpenAIが、長時間自律稼働するモデルの限定的な社内デプロイから得た安全性・アライメントの教訓を公開。評価だけでは検知できなかった問題行動と、その対策を解説しています。
OpenAIが、ティーンエイジャーがChatGPTを安全に使えるようにするための年齢に応じた保護機能や学習支援機能、保護者向けのペアレンタルコントロールについてまとめた記事を公開しました。
OpenAIのChris Lehane氏(チーフ・グローバル渉外責任者)が、州法と連邦法を組み合わせた「逆邦制」によるAIガバナンス構想を提言する記事を公開。カリフォルニアなど主要州の安全法制を土台に、連邦レベルでの整合を図るべきだと主張しています。