DeepSeek ニュース 2023/11/29 AI判定 重要度:中

DeepSeek、初の大規模言語モデル「DeepSeek LLM 67B」をオープンソース公開

#DeepSeek#AI史

中国のAIスタートアップDeepSeekが、初の大規模言語モデル「DeepSeek LLM」をオープンソースで公開しました。7Bと67Bの2サイズで、それぞれBase版・Chat版を用意。英語と中国語を含む2兆トークンのデータセットでゼロから学習したモデルで、当時DeepSeekが「オープンソースLLMの新たなフロンティア」と位置づけた最初の主要プロダクトです。

詳細

  • モデル規模: 67Bパラメータのモデルを、英語・中国語混合の2兆トークンで一から学習
  • 提供形態: 7B/67BのBase版・Chat版をいずれも研究コミュニティ向けにオープンソース公開
  • 性能主張: 推論・コーディング・数学・中国語理解などの分野でLlama 2 70B Baseを上回るとする自社ベンチマーク結果を発表
  • 対比較: 67B Chatモデルはベンチマーク上GPT-3.5を上回る性能を示したと説明

その後

このDeepSeek LLMの公開が、後にDeepSeek-V2・V3、そして2025年1月に世界のAI市場を揺るがしたDeepSeek-R1へと続くシリーズの出発点になりました。低コストで高性能なオープンソースモデルを次々に公開するというDeepSeekの基本方針は、この最初のモデルからすでに一貫しています。