ChatGPT ニュース 2026/08/25 AI判定 重要度:高

OpenAI初の自社推論チップ「Jalapeño」、最大4.1倍の性能向上を実証

#OpenAI#Jalapeño#推論チップ#ハードウェア#AIインフラ

OpenAIは、AIモデルの推論(サービング)専用に自社設計した初のチップ「Jalapeño」について、実測ベースの初期性能結果を公表した。3種類のオープンウェイトモデルファミリーで商用比較システムと比較したところ、ワットあたりスループットで最大1.9倍、遅延に敏感な対話的ワークロードでは最大4.1倍の性能を記録。OpenAIがサードパーティ製アクセラレータへの依存を脱し、自社推論用シリコンの構築へと本格的に舵を切ったことを示す、これまでで最も明確なシグナルとなった。

詳細

  • Jalapeñoとは: Jalapeñoは、OpenAIが初めて自社設計した推論専用チップである。トレーニング用チップとは異なり、学習済みモデルをサービング時に効率よく動かすことに特化して設計されている。OpenAIはこれを、複数世代にわたるチッププラットフォームの第1世代と位置づけており、第2世代は既に開発の深い段階にあり、第3世代も構想が固まりつつあるという。製造パートナーや詳細なアーキテクチャについては今回の発表で明らかにされていない
  • 意義: 推論用シリコンを自社で保有することで、OpenAIは電力効率・遅延・ドルあたりのスループットといったモデル提供の経済性を直接コントロールできるようになる。また、ChatGPTやCodexのトラフィック拡大に伴いOpenAIの計算資源利用の中で存在感を増す推論ワークロードについて、GPUサプライヤーへの依存を減らす独自のハードウェア路線を確立することにもなる
  • ベンチマークの構成: OpenAIは、パラメータ規模の異なる3つのオープンウェイトモデル ― GPT-OSS 120B、DeepSeek R1(670B)、Kimi K2.5(1T) ― を用いて、Jalapeñoと商用比較システムを比較した
  • 効率面の結果: 検証した各モデルにおいて、Jalapeñoはピークスループット時でワットあたり1.5〜1.9倍のAI処理量を実現し、エンドツーエンドの遅延は比較システムに対して1.7〜3.6倍低かった。最も規模の大きいKimi K2.5では、ワットあたりのピーク性能が約1.5倍、エンドツーエンドの遅延が約3.4倍低いという結果になった
  • モデル別の内訳: GPT-OSS 120Bではピークの混合スループットが1kWあたり約1.9倍、遅延は約1.7倍低下。DeepSeek R1では1kWあたり約1.7倍のピークスループット、遅延は約3.6倍低下。Kimi K2.5では1kWあたり約1.5倍のピークスループット、遅延は約3.4倍低下した
  • 対話的ワークロード: 応答性の高いチャットやエージェント的な用途で特に重要となる、遅延に敏感なワークロードでは、比較システムに対して2.1〜4.1倍高い性能を記録した
  • 消費電力: Jalapeñoの定格は最大700ワットだが、実際のテストでは持続的な消費電力は550ワット以下にとどまっており、定格上限に対して余裕があることを示唆している
  • 展開スケジュール: OpenAIは、2026年末までに自社の計算基盤内でJalapeñoの展開を開始する計画だとしている。第2世代チップは既に開発が大きく進んでおり、第3世代も初期段階の計画が進行中である

その後

  • 今回の発表は、OpenAIが自社推論用シリコンについて、シミュレーションではなく実測に基づく性能データを公表した初の事例とみられる。これまでにも、OpenAIがハードウェアパートナーと共同でカスタムチップを開発しているとの報道はあった
  • 展開はまず、より広い提供に先立ちOpenAI自身のインフラ内部で始まる見込みで、Jalapeñoを外部に販売・ライセンス供与する計画は現時点で示されていない
  • 詳細なベンチマークはOpenAIの公式発表(https://openai.com/index/jalapeno-first-results)を参照