OpenAIは、初のカスタム推論チップ「Jalapeño」の初期テスト結果を公開した。GPT‑OSS 120B、DeepSeek R1、Kimi K2.5 1Tで、比較システムより高い性能/ワットと低いエンドツーエンド遅延を示したとしている。
生成AIの競争軸は、モデル単体の性能から、安く速く安定して推論を提供するインフラ全体へ広がっている。特にAIエージェントは複数ステップを連続実行するため、1回ごとの遅延が業務体験に直結する。
初期結果で示された数字
OpenAIによると、Jalapeñoは3つの公開モデルで、ピークスループット時に1.5〜1.9倍高いAI作業量/ワット、1.7〜3.6倍低いエンドツーエンド遅延を示した。高度にインタラクティブなワークロードでは2.1〜4.1倍高い性能を示したという。
対象モデル | GPT‑OSS 120B、DeepSeek R1、Kimi K2.5 1T |
|---|---|
性能/ワット | 比較システム比で1.5〜1.9倍 |
遅延 | 1.7〜3.6倍低いエンドツーエンド遅延 |
対話型用途 | 2.1〜4.1倍高い性能 |
定格 | 700W、テスト時の持続消費電力は550W以下と説明 |
なぜ推論チップが重要なのか
AIサービスのコストは、学習だけでなく日々の推論で大きく積み上がる。顧客対応、コーディング支援、社内エージェントのような用途では、低遅延かつ安定した推論が品質そのものになる。OpenAIは、モデル、製品、サービングソフトウェア、チップ、メモリ、ネットワークを一体で設計する「フルスタック」の強みを強調している。
興味深いのは、チップ開発にもAIを使っている点だ。OpenAIは、初期設計からテープアウトまで9カ月で進める過程でAIが設計・検証ループを短縮し、一部のGPT‑OSS向けブロックではAI生成実装が人間専門家の実装より1.5〜1.8倍速かったと説明している。
日本企業への示唆
日本企業が直接チップを選ぶ場面は限られるが、推論基盤の進化はAPI料金、応答速度、エージェントの実用範囲に影響する。問い合わせ対応や業務自動化で「遅いから使われない」という課題がある企業ほど、モデル性能だけでなく、遅延、同時実行、データ保護、コスト上限を評価軸に入れるべきだ。
ただし、公開された数字はOpenAIの初期テスト結果であり、実サービスでの価格や提供時期、他社クラウドとの比較は今後の確認が必要だ。調達側はベンダー発表を鵜呑みにせず、自社ワークロードでのレイテンシと総コストを測る姿勢が欠かせない。
参考:OpenAI公式発表

.png&w=384&q=75)