対象サービス: ChatGPT Claude DeepSeek Gemini Grok Llama Mistral Qwen
Google DeepMindが、ロボット向けの身体性推論(Embodied Reasoning)モデル「Gemini Robotics ER 2」を発表。動画から作業の進捗を読み取る能力や、異なるロボット同士が連携して作業を分担する機能を備え、Gemini APIなどから利用できる。
Alibabaの通義研究院(Tongyi Lab)が新しい音声認識(ASR)モデル「Qwen-Audio-3.0-ASR」シリーズをAPI提供開始。ストリーミング向けとファイル文字起こし向けを用意し、中国語方言7大方言区・20以上の訛りと30言語をカバーします。
Googleが自律型タスク実行機能「Gemini Spark」に「Chrome自動操作」機能を追加。ログイン済みアカウントや保存済みパスワードを使い、賃貸物件の内覧予約やフライト検索などの作業を代行する。
GoogleがmacOS版Geminiアプリを更新し、Fnキーを長押しするだけでデスクトップ上のどのウインドウでも自然な音声操作ができるようになった。文字起こしや文章のリライト、要約、画像生成までを声だけで行える。
xAIが音声モデル「Grok Voice Think Fast 2.0」を発表。文字起こし精度や雑音耐性、応答速度が前バージョンから大きく向上し、8月5日には既存利用者も自動移行します。
OpenAIが学術研究者向けプログラムを発表。今夏に研究者1万人からスタートし、2027年までに10万人へ拡大する。ChatGPTやCodexの最新モデルを無償提供し、生命科学向けスキルや研究者向けコネクタも用意する。
OpenAIが次世代モデル「GPT-5.6」を発表。最上位のSol、汎用のTerra、軽量のLunaという3段階構成で、性能とコスト効率を同時に引き上げた。CodexやChatGPT Workなどエージェント的な用途を念頭に設計されている。
OpenAIが技術解説記事を公開。GPT-5.6のAPI設定を二つ変更するだけで、ARC-AGI-3ベンチマークのスコアが13.3%から38.3%に上昇し、出力トークン数も6分の1に削減できたことを明らかにした。
OpenAIが公開したフィールドレポートで、研究者がCodexやClaude Codeなどのコーディングエージェントを使い、ゲノム解析ツールなど科学計算プロジェクト8件を近代化した事例を紹介。専門家による検証の重要性も指摘した。