対象サービス: ChatGPT Claude DeepSeek Gemini Grok Llama Mistral Qwen
Googleが6週間で3世代目となる「Gemini 3.8 Flash」と、承認された防御担当者のみが利用できる特化版「Gemini 3.8 Flash Cyber」を発表。Google Cloudのテストでは重大な脆弱性を2時間足らずで発見し、商用ツール比でパッチの正確性が2.6倍という結果を示した。
AlibabaのQwenチームは、コーディングとマルチツールエージェントタスクの後段学習を強化した最新スナップショット「Qwen3.8-Max-0902」を公開し、CodeArena WebDevランキングで首位を獲得しました。
Googleの新プログラム「Fairwind」は、「Gemini 3.8 Flash Cyber」と自動修正ツール「CodeMender」を組み合わせ、防御側がエージェント規模で脆弱性を発見・検証・修正できるようにする。数週間かかっていた対応を数分に短縮し、約650のパートナーに限定した早期アクセスとして提供開始。
OpenAIが医療機関向けデータコネクターを開始。認証を受けた臨床医は、予約メモ・検査結果・処方薬といったEpic電子カルテの情報をChatGPTに取り込めるほか、ClinicalTrials.govやPubMedなどをカバーする「Healthcare Public Data」プラグインも提供する。
OpenAIは開発中のモデル「Astra」が、Preparedness Frameworkの定めるサイバーセキュリティ能力「Critical」水準に達した初のモデルだと発表。強固な実環境でゼロデイ脆弱性を自律的に発見・悪用できる水準で、導入する安全対策の詳細も公開した。
Anthropicが「Enterprise Frontier Safeguards」を発表。顧客はClaudeとのやり取りログを自社のクラウド環境・自社の暗号鍵で保管しながら、複数セッションにまたがる高度な悪用も検知する完全自動の安全性監視を利用できる。ARC加盟の9行すべてを含む100社超と共同開発。
Googleが「Gemini 3.7 Flash」「3.6 Flash」「3.5 Flash-Lite」に、モデル自身が何を・どの速度で・どのモダリティで見るかを判断する「エージェント的動画理解」を導入。トークン消費を最大88%、コストを最大66%削減しつつ、精度も最大7%向上させた。
xAIはLatchBioによるGrok 4.6の独立バイオセキュリティ評価結果を公表。危険な依頼を偽装した要求への拒否と、正当な生物学研究の遂行を両立できた唯一のモデルとされた。
Anthropicが「Claude Fable 5.1」を一般提供開始。エージェント的コーディングと科学研究で大幅な性能向上を実現。技術的には同一だが、より緩和された安全対策の下で認証済みのサイバーセキュリティ・生命科学研究者に限定提供される「Mythos 5.1」も同時発表。