対象サービス: ChatGPT Claude DeepSeek Gemini Grok Llama Mistral Qwen
AlibabaがMoE構成の大規模モデル「Qwen2.5-Max」を発表。DeepSeek-V3を複数のベンチマークで上回るとし、GPT-4o級の性能を主張しました。
DeepSeekが推論特化モデルR1をMITライセンスで公開。OpenAI o1に匹敵する性能を低コストで実現したとして、公開1週間後にはNVIDIA株が急落するなど世界のテック株に衝撃を与えました。
DeepSeekが6710億パラメータのMoEモデルDeepSeek-V3をオープンソース公開。学習コストが約558万ドルと格安だったと主張し、GPT-4oやLlama 3.1 405Bに匹敵する性能を示しました。
Googleが「Gemini 2.0」を発表し、第1弾として「Gemini 2.0 Flash」を実験公開。ネイティブな画像・音声出力とツール利用能力を備え、1.5 Proを上回る性能を2倍の速度で実現した。
Anthropicが、Claudeが人間のようにパソコン画面を見てカーソル操作・クリック・入力を行う「computer use」機能をAPIベータで公開。同時に強化版Claude 3.5 SonnetとClaude 3.5 Haikuも発表しました。
Alibaba CloudがApsara Conferenceで「Qwen2.5」シリーズを発表。汎用・コード・数学特化を含む100種類超のモデルを公開し、「史上最大級のオープンソースリリース」とうたいました。
OpenAIが応答前にじっくり思考する新系統モデル「o1-preview」「o1-mini」を発表。国際数学オリンピック相当の問題でGPT-4oを大きく上回る精度を記録しました。
Mistral AIが画像と文章の両方を扱える初のマルチモーダルモデル「Pixtral 12B」をオープンウェイトで公開。任意の枚数・サイズの画像を処理できる点が特徴です。
xAIがGrok-2をベータ発表。チャット・コーディング・推論で前世代から大きく性能を伸ばし、視覚理解機能やX(旧Twitter)のリアルタイム情報連携も強化されました。