Perplexityは2026年9月30日、単一の「正解パッセージ」だけでなく、回答を裏付ける根拠も併せて検索できるよう訓練された90億パラメータの埋め込みモデル「pplx-embed-v2-context-9b-preview」と、その能力を評価する新ベンチマーク「Context-bench」を発表した。
OpenAIが、22か国80名超の有資格メンタルヘルス専門家と共同開発したベンチマーク「MentalHealthBench」をオープンソース公開。19言語をカバーし、4種類のユーザー像・3段階の緊急度にわたって、安全性・状況確認・ユーザーの主体性維持などを評価する。
xAIの最新モデルがリリース当日からCursorに導入。xAIが公表したベンチマークにはCursorBench 4.0のスコアも含まれ、長時間コーディング・ナレッジワーク向けの性能をアピールしている。
Sakana AIは2026年9月11日、最小コストでフロンティア級の出力を目指す「Fugu Max」と、複雑な推論・コーディング向けに最大性能を追求する「Fugu Ultra v2」という2つの新しいオーケストレーションモデルをリリースした。
AlibabaのQwenチームがTaobao・Tmallと共同で、18の最先端モデルにネットショップを365日間運営させて評価するベンチマーク「E-Commerce Bench」をオープンソース公開。単発タスクの達成度ではなく、利益・交渉力・不正回避・長期学習を多角的に採点する。
Perplexityが、複数ターンの会話から個人情報を検出する13言語対応ベンチマーク「PII-TRACE」と、端末外への送信前に検知する軽量モデル「PII-Tracer」(0.6B)を発表した。
Googleが、コーディングとエージェント用途で「これまでで最も賢いワークホースモデル」と位置づける新モデル「Gemini 3.7 Flash」を発表。前モデルGemini 3.6 Flashからわずか3週間での投入ながら、各種ベンチマークで大幅なスコア向上を達成し、導入価格は半額に引き下げられた。
OpenAIが技術解説記事を公開。GPT-5.6のAPI設定を二つ変更するだけで、ARC-AGI-3ベンチマークのスコアが13.3%から38.3%に上昇し、出力トークン数も6分の1に削減できたことを明らかにした。
Devin開発元のCognitionが、自社のコード品質評価ベンチマークを改訂した「FrontierCode 1.1」を公開。採点基準の緩和やネット利用の適正化に加え、Sonnet 5とFable 5の最新スコアも公開しました。