OpenAI×Broadcom「Jalapeño(ハラペーニョ)」とは|初の自社設計AI推論チップの実測ベンチマークとスペックを徹底解説

この記事のポイント
OpenAI初の自社設計AI推論チップ「Jalapeño(ハラペーニョ)」を解説。Hot Chips 2026で公開された実測ベンチマーク(電力あたり1.5〜1.9倍、遅延1.7〜3.6倍低減)、フルスペック、「Nvidia比50%安」の真偽、2027年の展開時期、日本企業への影響を公式情報と報道に切り分けて整理します。
Jalapeño(ハラペーニョ)とは、OpenAIが半導体大手Broadcom(ブロードコム)と共同開発した、OpenAI初の自社設計AI推論チップです。 ChatGPTやAPIなど「学習済みモデルをユーザーに届ける処理(推論)」だけに用途を絞ったカスタムASICで、2026年6月24日に発表され、2026年8月25日のHot Chips 2026で初の実測ベンチマークとフルスペックが公開されました。
その結果、NVIDIAのBlackwell世代ラック(GB200/GB300 NVL72)に対してピークスループット時の電力あたり性能で1.5〜1.9倍、エンドツーエンド遅延で1.7〜3.6倍の低減、対話型ワークロードでは2.1〜4.1倍という数字が示されました。ただしこれらはすべてOpenAIが提供したデータであり、完全な第三者検証ではありません。この記事ではその線引きを丁寧に行いながら整理します。
この記事でわかること
- Jalapeño(ハラペーニョ)とは何か、なぜ「推論専用」なのか
- Hot Chips 2026で公開された実測ベンチマークの中身と、その正しい読み方
- 13.4PFLOPS/HBM4 216GB/700Wというフルスペックと、ラック構成
- 誤読が多い「kWあたり54〜104倍」という数字の条件
- 「Nvidia比50%安」「開発9ヶ月」がどこまで公式なのか
- 2026年末〜2027年の展開スケジュールと、現時点の制約
- 日本企業・日本の読者にとって結局何が変わるのか
こんな方に向けた記事です:AI半導体のニュースを正確に理解したい方、OpenAI/NVIDIA/Broadcomの動向を経営判断の材料にしたい方、生成AIの推論コストやAPI価格の行方が気になる開発者・IT担当者の方。
Jalapeñoとは:2026年8月時点の要点を一枚の表で

Jalapeñoは「OpenAIが自分たちのAIを動かすために、自分たちで設計した推論専用チップ」です。市販されず、個人や他社が単体で買うことはできません。
項目 | 内容 |
|---|---|
名称 | Jalapeño(ハラペーニョ)/OpenAIは「Intelligence Processor」とも表現 |
種別 | LLM推論(インファレンス)特化のカスタムASIC |
開発体制 | OpenAI(設計)× Broadcom(実装・量産・ネットワーク)/製造はTSMC/ラック統合はCelestica |
プロセス | コンピュートダイ TSMC N3P + I/Oチップレット N3E(Hot Chips公表) |
演算性能 | 13.4 PFLOPS(MXFP4/4bit精度) |
メモリ | HBM4 216GB(6スタック構成とされる)/帯域 15.4 TB/s |
消費電力 | 700W(コンピュートダイ) |
発表 | 2026年6月24日発表 → 2026年8月25日 Hot Chips 2026でベンチマーク公開 |
用途 | ChatGPT・Codex・API・将来のエージェント製品などの推論処理 |
展開 | 2026年末に「ごく少量」から開始、本格的なランプアップは2027年 |
外販 | なし(OpenAIの自社インフラ専用) |
最も重要なのは「推論専用」という点です。 Jalapeñoはモデルを"学習"させるチップではありません。完成済みのモデルをユーザーの入力に応じて高速に動かすことに振り切っており、大規模な学習(プリトレーニング)には引き続きNVIDIA等のGPUが使われます。
OpenAIはJalapeñoを「複数世代にわたるロードマップの第1世代」と位置づけており、Gen 2は開発が深く進行中、Gen 3も設計に着手済みと公表しています。
Hot Chips 2026で公開された実測ベンチマーク:何がわかったのか

出典: NVIDIA公式サイト(GB200 NVL72製品ページ)
2026年8月25日、シリコンバレーで開催された半導体カンファレンス「Hot Chips 2026」で、OpenAIのハードウェア責任者Richard Ho氏がJalapeñoの初のベンチマーク結果を公表しました。これが2026年6月の発表時点から最も大きく変わった部分です。
使われたベンチマークとテスト条件
計測に使われたのはInferenceXという推論ベンチマークです。単発の演算性能(FLOPS)ではなく、「AIリクエストが完了するまでのエンドツーエンド」を測る点が特徴で、実運用に近い指標とされています。
項目 | 内容 |
|---|---|
ベンチマーク | InferenceX(SemiAnalysisが公開する推論ベンチマーク) |
テストモデル | GPT-OSS 120B/DeepSeek R1 670B/Kimi K2.5 1T(いずれもオープンウェイト) |
比較対象 | NVIDIA GB200 NVL72(2024年)・GB300 NVL72(2025年)ラック |
テスト条件 | コンテキスト8k/出力1k(いわゆる「8k1k」) |
使用シリコン | A0ステッピング(初期版)。改良版のB0は製造中 |
主要な結果
指標 | 結果 |
|---|---|
ピークスループット時の電力あたり性能 | 1.5〜1.9倍 |
エンドツーエンド遅延 | 1.7〜3.6倍 低減 |
対話型(低遅延)ワークロード | 2.1〜4.1倍 高速 |
1ユーザーあたりトークン生成速度(同時実行数1) | GPT-OSS 120Bで約1,400 tok/s/DeepSeek R1 670Bで700 tok/s超 |
消費電力 | Jalapeño 700W vs 比較対象NVIDIAフラッグシップ 1,400W |
読者が押さえるべき主指標は「電力あたり1.5〜1.9倍」「遅延1.7〜3.6倍低減」の2つです。 700Wのチップが1,400WのGPUを上回ったという構図が、この発表のインパクトの中心にあります。
さらに、改良版のB0シリコンが現在製造工程に入っており、電力あたり性能が約25%改善する見込みとSemiAnalysisは報じています(こちらは二次情報)。
「kWあたり54〜104倍」という数字の正しい読み方
報道の一部で見かける「54〜104倍」という強烈な数字がありますが、これは総合性能の比較ではありません。 誤読が非常に多い箇所なので、条件を明示します。
- この数字は「Jalapeñoと同じデコード速度(=同じ応答の速さ)を出せる動作点にGPU側をそろえたとき」の、kWあたりトークン数の比です
- GPUはその超低遅延領域では効率が急激に落ちるため、倍率が跳ね上がります
- 内訳はGPT-OSS 120Bで約53.7倍、DeepSeek R1では100倍超とされます
つまり「Jalapeñoは総合的にGPUの50〜100倍速い」という意味ではありません。「極端に低い遅延を要求される領域では、GPUが苦手なぶん差が開く」という読み方が正確です。日本語記事の多くがこの条件を落として引用しているため、注意してください。
NVIDIA Vera Rubin・AMD Heliosとの比較は「割れている」
次世代機との比較については、報道が一致していません。
- SemiAnalysisは「JalapeñoのSTP(単一トークン予測)が、Vera RubinのMTP(マルチトークン予測)を電力あたり性能で上回る」としています。ただしこれはRubin実機との同条件テストではなく、NVIDIA公表値との突き合わせです
- 一方でBigGoなどは「Vera RubinやAMD MI455Xとの直接比較は行われていない」と報じています
- SemiAnalysis自身も「Blackwellとの比較はやや不完全でフェアではない。より適切な競合はRubin」と書いています
- AMD Heliosとの関係では「演算性能は1.46〜2倍あるが、メモリ帯域はJalapeñoの85%にとどまる」とされます(The Register)
現時点で「Rubinにも勝った」と断定できる根拠はありません。 この点はメディアによって表現が割れており、続報を待つのが妥当です。
数字の信頼度を3段階で色分けする
この記事で最も注意深く扱いたいのが、数字の出所です。話題の数値は「OpenAI公式」「OpenAI提供+一部を第三者が対面検証」「二次報道・推定」が混ざっています。
数字・スペック | 信頼度 | 扱い方 |
|---|---|---|
13.4 PFLOPS(MXFP4)/メモリ帯域15.4TB/s/TDP 700W | ① Hot Chipsでの公表 | 公式発表として扱える |
プロセス(コンピュートダイN3P+I/OチップレットN3E) | ① Hot Chipsでの公表 | 公式発表として扱える |
電力あたり1.5〜1.9倍/遅延1.7〜3.6倍/対話型2.1〜4.1倍 | ② OpenAI提供データ。SemiAnalysisがラボで実行を対面確認 | 「OpenAIの計測」と明示して扱う |
kWあたり54〜104倍 | ② 同上。ただし特殊な比較条件 | 条件付きでのみ有効 |
HBM4 216GB=「6スタック×12段」 | ③ 一部推定(The Registerが "assumed" と明記) | 構成は推定を含む |
Samsung製HBM4/ピン速度10Gbps | ③ 二次(SemiAnalysis) | 公式確認は取れていない |
「Nvidia GPU比で推論コスト約50%安」 | ③ Broadcom CEO発言・二次報道 | OpenAI公式発表文には含まれない |
Microsoftが初期生産分の約40%を購入 | ③ 二次報道 | 未確認 |
ラック名(Vindaloo/Katsu/Chana/Teacup) | ③ 二次(SemiAnalysis) | 公式資料での裏取り未了 |
特に重要なのが②の位置づけです。 SemiAnalysisは「InferenceXの実行をラボで対面確認したが、フルスイートを自分たちで回したわけではない」と明記しています。つまり「完全な第三者検証で証明された」わけではなく、「メーカー提供の数値を、独立した第三者が一部立ち会って確認した」という段階です。
フルスペック:チップ単体とラック構成

チップ単体
項目 | 内容 |
|---|---|
種別 | LLM推論専用ASIC |
プロセス | コンピュートダイ TSMC N3P + I/Oチップレット N3E |
パッケージ | レチクルサイズ級の大型コンピュートダイ+I/Oチップレット、CoWoS |
演算性能 | 13.4 PFLOPS(MXFP4/4bit) |
メモリ | HBM4 216GB(6スタック) |
メモリ帯域 | 15.4 TB/s |
オンチップメモリ | 大容量SRAMキャッシュ(KVキャッシュをローカル保持するため) |
TDP | 700W |
インターコネクト | 800G SerDes ×32レーン(ローカル24=600GB/s、グローバル8=200GB/s)/ホストはPCIe Gen5 |
ステッピング | A0でベンチ実施。B0は製造中(電力あたり性能約25%改善見込み) |
ラック/システム構成
項目 | 内容 |
|---|---|
1ラックあたり | Jalapeño ASIC 128基(トレイ16枚×8チップ) |
ラック演算性能 | 1.7 EFLOPS(4bit精度) |
ラックHBM総量 | 27.5 TB HBM4、合計帯域は約2ペタバイト/秒 |
ホストCPU | AMD EPYC Turin級のCPUトレイ16枚 |
スイッチ | スイッチトレイ8枚(ローカルドメイン6+グローバルドメイン2) |
スケールアップ規模 | 最大2,048 ASIC/16ラック |
消費電力 | ASICラック130kW+ホストラック(実運用31kW)=2ラックで約160kW |
ネットワーク | Broadcom Tomahawk系ネットワークシリコン |
ちなみに、ラックやトレイのコードネームがJalapeño/Vindaloo/Katsu/Chana/Teacupと、すべてスパイス・カレー由来で統一されているのがOpenAIハードウェアチームの遊び心です(こちらはSemiAnalysis報)。
なぜ速いのか:「データ移動を減らす」という設計思想
Jalapeñoの設計思想は「計算を速くする」より「データを動かさない」ことにあります。
LLM推論の最大のボトルネックは、演算回路とチップ外メモリの間でデータを往復させる部分にあります。特に会話が長くなるほど「KVキャッシュ」と呼ばれる中間状態が膨らみ、メモリとの通信量が爆発的に増えます。Jalapeñoはここに手を入れました。
- モデルの状態とKVキャッシュを、できる限りチップ上(ローカル)に保持する
- 大容量のオンチップSRAMと、HBM4による15.4TB/sの帯域を組み合わせる
- 推論のフェーズごとに、演算・メモリ・ネットワークの最適な組み合わせを起動する
推論には性質の異なる2つのフェーズがあります。
フェーズ | 何をしているか | ボトルネック |
|---|---|---|
プリフィル | 入力プロンプト全体を一気に読み込んで内部状態を作る | 演算性能に効く |
デコード | 1トークンずつ答えを生成していく | メモリ帯域・遅延に効く |
汎用GPUはこの両方を同じハードウェアで無理なくこなす代わりに、どちらにも最適化しきれません。Jalapeñoは「デコード側の遅延」に強く振ったことで、対話型ワークロードで2.1〜4.1倍という差がついた、というのが数字の背景です。AIエージェントのように何十回もモデルを呼び出す処理では、この遅延差が積み上がります。
ソフトウェアスタック:本当の差別化はここにある

Jalapeñoで見落とされがちなのが、チップ以上にソフトウェアが差別化要因になっている点です。
レイヤー | 名称 | 役割 |
|---|---|---|
カーネル記述言語 | Gluon | OpenAIのTritonをベースに、低レベル抽象を露出させた自社製カーネル言語 |
推論サービングエンジン | Teacup | 社内製の推論サービング基盤 |
シミュレータ | chilisim | 実機との誤差5%以内でチップ挙動を再現 |
さらに注目すべきは、AI(社内版Codex)をチップ設計そのものに投入した点です。
- SIMD部の面積を8%、行列演算エンジンの面積を10%削減
- DeepSeekのMLA実装では「Codexが書いたカーネルが、OpenAIのカーネルチームの介入なしで動作した」(SemiAnalysis)
- 立ち上げ期には8日間でTP8からTP32へ拡張し、単一システムからフルラック規模まで動作させた
AIが半導体設計の生産性そのものを押し上げている実例として、この部分は業界的な意味が大きい領域です。半導体設計におけるAI活用の全体像は半導体業界のAI活用事例でも整理しています。
「CUDAの堀」への含意
SemiAnalysisはこの点を踏まえ、「OpenAIがこれだけ速く新しいモデルを自社シリコン上で立ち上げられるなら、CUDAの堀は潜在的に死んでいる」と踏み込んだ評価をしています。
ただしこれは事実ではなくSemiAnalysisの見解です。論拠は、Gluon/Triton系のスタックがCUDAに依存せずに成立し、DeepSeek R1やKimi K2.5といった他社モデルまで短期間で動かせたという実績にあります。NVIDIAの競争優位はハードウェアだけでなくCUDAというソフトウェア資産にあるとされてきたため、この観点は今後の焦点になりそうです。
一方で、実際に大規模な移行が起きるかは、Jalapeño以外の陣営が同じことをできるかにかかっています。現時点では「OpenAIという極めて特殊なプレイヤーが自社ワークロード専用にやってのけた」段階である点は押さえておくべきでしょう。
「Nvidia比50%安」は本当か:2026年8月時点でも公式未確認
「Nvidia GPU比で推論コストが約50%安い」という数字は、2026年8月時点でもOpenAIの公式発表文には含まれていません。 出所はBroadcom CEOの発言と、それを引用した二次報道です。
ただし、Hot Chipsで公開された数字を使えば、コスト面の妥当性はある程度推測できます。
観点 | 内容 |
|---|---|
電力あたり性能 | 1.5〜1.9倍(=同じ仕事を約53〜67%の電力で処理できる計算) |
TDP | 700W vs 比較対象1,400W |
調達コスト | カスタムASICはGPUのようなブランドプレミアムが乗らない構造 |
一方の逆風 | HBM4・CoWoSは高価。開発費の償却も必要 |
電力コストだけを見れば「半減」は非現実的な数字ではありません。 ただしデータセンターの総所有コストには、チップ調達費・パッケージ費・ソフトウェア開発費・運用の複雑さが含まれます。単純に「Jalapeñoにすれば推論費が半分」という理解は行き過ぎです。
なお、OpenAIは「NVIDIAや他のサードパーティからのアクセラレータ購入は継続する」と明言しており、全面置き換えではありません。NVIDIAとの関係の深さは、オハイオのデータセンターに対するNVIDIAによる最大1,050億ドルの債務保証という異例のスキームからも読み取れます。
開発期間は「9ヶ月」か「16ヶ月」か
報道で数字が割れている論点です。どちらかが誤りというより、定義が違うというのが答えです。
出所 | 数字 | 定義 |
|---|---|---|
OpenAI公式・The Register | 約9ヶ月 | 設計着手(inception)→ テープアウト |
SemiAnalysis | 約16ヶ月 | プログラム開始(2024年半ば・チーム採用開始)→ CoWoSテープアウト(2025年11月) |
共通する事実は次の通りです。
- プログラム開始:2024年半ば
- テープアウト(設計データが完成し製造に回せる状態):2025年11月
- A0シリコンの立ち上げ開始からHot Chipsまで:約3ヶ月
どちらの数え方でも、先端ASICとしては極めて速いという結論は変わりません。一般的にこの規模のASICは設計だけで2〜3年かかることも珍しくないためです。OpenAIは高速化の要因として、自社AIモデルを設計・最適化プロセスに投入したことを挙げています。
ただし「9ヶ月で完成して即量産」ではない点には注意が必要です。テープアウト後にシリコンの立ち上げ・検証・量産準備が続き、本格展開はさらに先になります。
展開スケジュール:2026年末は「ごく少量」

出典: Broadcom 公式サイト
6月時点では「2026年末に初期導入」と報じられていましたが、Hot Chipsでの説明を経てトーンダウンしています。
時期 | 内容 |
|---|---|
2024年半ば | プログラム開始・チーム組成 |
2025年10月13日 | OpenAI×Broadcom、10GW規模のカスタムAIアクセラレータ提携を発表 |
2025年11月 | CoWoSテープアウト |
2026年6月24日 | Jalapeño発表 |
2026年8月25日 | Hot Chips 2026で初ベンチマーク公開 |
2026年末 | 自社コンピュート基盤へごく少量(very small volumes)を初期導入 |
2027年 | 段階的にランプアップ。出荷の大半は2027年末に集中する見込み |
2029年まで | OpenAI設計シリコンを累計10GW規模で展開(提携の到達目標) |
Richard Ho氏自身が「2026年末はごく少量」と述べており、SemiAnalysisも「2027年を通じて段階的にランプアップし、出荷の大半は2027年末に集中する」と報じています。
ここが競合との重要な差です。 NVIDIAのVera Rubinはすでに顧客への出荷が始まっているのに対し、Jalapeñoはまだエンジニアリングサンプル段階を出ていません(the-decoder)。ベンチマークで示された優位は、本格展開の時点でも維持されているとは限りません。Richard Ho氏自身「本格展開の頃には競合が大きく前進している可能性がある」と認めています。
展開先はMicrosoft Azureなどのデータセンターパートナー、およびneocloud(ネオクラウド)事業者とされています。
OpenAIのチップ戦略全体マップ:Jalapeñoは「置き換え」ではなく「一角」

出典: AMD 公式サイト
JalapeñoはNVIDIAを全面的に置き換えるものではありません。OpenAIは複数のサプライヤーと並行して提携しており、Jalapeñoはそのポートフォリオの一角です。
パートナー | 規模・内容 | 位置づけ |
|---|---|---|
Broadcom(+TSMC) | 10GW規模の自社設計シリコン(Jalapeño)/2029年まで | 推論を内製化しコスト・依存度を下げる軸 |
NVIDIA | 10GW規模の提携。オハイオDCには最大1,050億ドルの債務保証 | 学習・汎用用途の主力。引き続き中核 |
AMD | 6GW規模の提携 | GPU調達の多様化 |
AWS | 戦略パートナーシップ(Trainium 2GW契約、Bedrock配信) | クラウド・チップ両面での分散 |
OpenAIの狙いは「NVIDIA依存を減らしつつ、最も量が多い推論処理を自前で最適化する」ことにあります。 クラウド調達の多様化という同じ文脈の動きはOpenAI×AWS戦略パートナーシップでも整理しています。
業界全体では「自社シリコン内製」が標準に
Jalapeñoは突然変異ではなく、大手AI事業者が揃って進めている流れの延長線上にあります。
事業者 | 自社推論/学習チップ |
|---|---|
TPU(次世代v8はBroadcom/MediaTek分業で開発中) | |
Amazon | Trainium/Inferentia |
Microsoft | Maia |
Meta | MTIA |
Anthropic | Samsungと独自AIチップを協議(報道段階) |
OpenAI | Jalapeño |
同じくBroadcomとの分業で設計されている次世代TPUについてはTPU v8 Sunfish/Zebrafishの解説を、推論専用ASICのより極端なアプローチについてはAMDによるTaalas買収(モデルの重みを半導体に焼き込む方式)をあわせて読むと、この潮流の広がりが見えてきます。GoogleとAnthropicのTPU大型契約も同じ構図で、Google×Anthropicの5GW TPU提携が参考になります。
なお、Forbes JAPANは投資家視点で「カスタムチップに自社名を刻む企業と、そこから持続的利益を得る企業は同じでないことが多い」として、構造的な受益者はBroadcomではないかという見立てを示しています。設計支援から量産パートナーシップまでを押さえるBroadcomは、GoogleのTPUにもOpenAIのJalapeñoにも関わっているためです。
NVIDIAへの影響:脅威か、共存か

出典: NVIDIA Newsroom
短期的にNVIDIAの主力事業がすぐ揺らぐわけではありません。学習用途や汎用AI計算では依然としてGPUが中核であり、OpenAI自身も10GW規模のNVIDIA提携を維持しています。
一方で中長期の論点は次の3つに整理できます。
論点 | 内容 | 現時点の評価 |
|---|---|---|
推論市場の分散 | 推論は量が多く、専用ASIC化の経済合理性が高い | 業界全体で進行中。構造的な変化 |
CUDAの堀 | Gluon/Triton系スタックでCUDA非依存が成立し得ることを実証 | SemiAnalysisの見解。実証は限定的 |
実装スピード | エンジニアリングサンプル段階のJalapeño vs 出荷済みのRubin | 現時点ではNVIDIAが先行 |
Jalapeño発表はNVIDIAのFY2027 Q2決算の直前というタイミングで行われ、発表前の時点でNVIDIA株は7営業日連続で下落したと報じられています(2022年9月以来の長さ)。市場の関心が「GPU一極集中の持続性」に向かっていることの表れといえます。
ただし、AIインフラの需要そのものは拡大が続いており、GPU側の受注もAnthropicによる大型のNVIDIA Vera Rubin調達のような形で積み上がっています。「NVIDIA不要」ではなく「NVIDIA一辺倒からの脱却とコスト最適化」という理解が実態に近いでしょう。
Jalapeñoの制約:正直に押さえておくべき9つのこと
好意的な報道が多い一方で、無視できない制約があります。むしろここを理解しているかどうかで、ニュースの読み方の精度が変わります。
- 推論専用。学習には使えない。 大規模学習は引き続きGPU。ゲーミングや汎用計算にも非対応
- 外部販売なし。 日本企業が「Jalapeñoを買う/借りる」ことは現時点でできない
- まだエンジニアリングサンプル段階。 量産・本番展開はこれから。競合のRubinはすでに顧客出荷開始済み
- ベンチマーク数値はすべてOpenAI提供。 SemiAnalysisはラボで実行を対面確認したが、フルスイートを自ら回してはいない
- テスト条件が限定的。 コンテキスト8k/出力1kという比較的軽い条件で、本番の複雑さを代表しない
- マルチターン・長コンテキストのテスト(AgentX)は未実施。 エージェント用途での実力は未検証
- 投機的デコーディング/マルチトークン予測を使っていない。 競合の一部はこれを使うため、純粋なハードウェア同士の比較になっていない
- テストモデルが競合の公表ベンチより小さい。 NVIDIA/AMDはより大きなモデルで結果を公表しているが、Jalapeñoでは未テスト
- ソフトウェアが未成熟。 SemiAnalysis自身が「今後さらに最適化余地がある」=裏を返せば現時点は発展途上
加えて、Hot Chipsで披露された「Codexが書いたコードでDoomを36FPS動作」といったデモは、あくまで会場向けの余興であり、チップの性能指標ではない点も付記しておきます。
日本企業・日本の読者にとって何が変わるのか

Jalapeñoは日本で買える製品ではありません。それでも、次の4つの経路で日本の読者・企業に関係します。
観点 | 想定される影響 | 時期感 |
|---|---|---|
OpenAI APIの価格・提供量 | 推論単価が下がれば、API価格の引き下げ・レート制限緩和・高速モデルの提供拡大の余地が広がる | 2027年以降。2026年末は少量展開のため即効性なし |
AIエージェントの実用性 | Jalapeñoが最も強いのが対話型・低遅延領域。マルチステップのエージェントは遅延がUXとコストに直結する | 中期。エージェント導入の採算ラインが変わりうる |
HBM4・先端パッケージのサプライチェーン | HBM4と2.5D/2.3D先端パッケージの需要増。この工程には日本の装置・材料企業が多く関与している | 構造的・進行中 |
データセンターと電力 | 1ラック約160kW級。国内のAIデータセンター立地と電力確保の議論に直結する | 構造的 |
実務担当者が「今」やるべきこと
現時点で何かを変える必要はありません。 ただし、次の3点を前提に置いた計画にしておくと後で困りません。
- 推論単価は中期的に下がる方向である前提で、AI活用の投資回収を試算しておく。逆に「今の単価が5年続く」前提の計画は保守的すぎる可能性がある
- エージェント型の業務自動化は、遅延コストが下がることで採算が改善する余地がある。 現時点で「レスポンスが遅くて実用にならない」と判断した用途は、2027年以降に再評価する価値がある
- 電力を含めたインフラコストの議論が国内でも本格化する。データセンター立地や電力調達については電力・ガス・水道業界のAI活用も参考になる
なお、同じ「推論コスト問題」に対して、専用ASICではなくアーキテクチャ側で解こうとするアプローチもあります。GPU使用量そのものを削減する富士通PHOTONはその代表例で、Jalapeñoとの対比で読むと解決アプローチの多様さが理解しやすくなります。ローカル環境での推論という別解についてはNVIDIA RTX Sparkの解説も参考になるでしょう。
なお、HBM4関連や先端パッケージ工程に関わる日本企業については、事実として「関与している領域が多い」と述べるにとどめます。個別の投資判断は各自の責任で行ってください。
こんな人におすすめ/あまり関係ない人
追いかける価値がある人 | あまり関係しない人 |
|---|---|
OpenAI APIを使ったサービスを開発・運営している人(原価構造が変わる) | 個人でChatGPTを使うだけで、料金や仕様に関心がない人 |
AI半導体・OpenAI/NVIDIA/Broadcomの構造変化を読みたい人 | 短期の株価材料だけを探していて、中長期の構造に興味がない人 |
推論コストを前提に事業計画を立てる企業のIT・経営層 | 自社でAIを導入する予定が当面ない人 |
AIエージェントの実用化タイミングを見極めたい人 | 遅延やコストが問題にならない小規模用途のみを扱う人 |
半導体サプライチェーン(製造・素材・装置)に関わる人 | ハードウェアの話題そのものに関心がない人 |
要点は「OpenAIのAPIやインフラに依存する立場の人」「AIインフラの構造変化を読みたい人」には重要なニュースだということです。逆に、ChatGPTを使うだけのライトユーザーが今すぐ行動を変える必要はありません。
よくある質問(FAQ)
Q. Jalapeñoは買えますか?
A. いいえ。外販されないOpenAIの自社インフラ専用チップです。個人や他社が単体で購入・レンタルすることはできません。クラウド経由で「Jalapeño上で動くモデル」を使う形になる可能性はありますが、現時点でその提供形態は公表されていません。
Q. ベンチマークの結果は信頼できますか?
A. 「メーカー提供の数値を、独立系の分析機関が一部立ち会って確認した」段階です。SemiAnalysisはラボでInferenceXの実行を対面確認したものの、フルスイートを自ら回したわけではないと明記しています。完全な第三者検証ではない点を踏まえて読むのが適切です。
Q. 「GPUの100倍速い」という記事を見ましたが本当ですか?
A. その数字は「Jalapeñoと同じ超低遅延の動作点にGPUをそろえたときの、kWあたりトークン数」という特殊な条件での比較です。総合性能の比較ではありません。実質的な主指標は電力あたり1.5〜1.9倍、遅延1.7〜3.6倍低減です。
Q. 「Nvidia比50%安」は確定情報ですか?
A. いいえ。Broadcom CEOの発言や二次報道に由来する数字で、OpenAIの公式発表文には含まれていません。2026年8月時点でも公式確認は取れていません。
Q. 開発期間は9ヶ月ですか、16ヶ月ですか?
A. 定義の違いです。「設計着手→テープアウト」で数えると約9ヶ月(OpenAI公式)、「プログラム開始(2024年半ば)→テープアウト(2025年11月)」で数えると約16ヶ月(SemiAnalysis)となります。どちらにせよ先端ASICとしては異例の速さです。
Q. JalapeñoでChatGPTの学習も行うのですか?
A. いいえ。推論(学習済みモデルの実行)に特化しており、学習には引き続きNVIDIA等のGPUが使われます。
Q. いつから本格的に使われますか?
A. 2026年末に「ごく少量」から導入が始まり、2027年を通じて段階的に拡大、出荷の大半は2027年末に集中する見込みとされています。2029年までに累計10GW規模の展開が提携上の目標です。
Q. これでNVIDIAは不要になりますか?
A. いいえ。OpenAIはNVIDIA(10GW)・AMD(6GW)とも並行して提携しており、Jalapeñoはマルチサプライヤ戦略の一角です。OpenAI自身も「サードパーティからのアクセラレータ購入は継続する」と明言しています。
Q. なぜ「ハラペーニョ」という名前なのですか?
A. OpenAIが付けた名称で、公式には「Intelligence Processor」とも表現されています。関連するトレイやスイッチにもカレー・スパイス由来のコードネームが付けられています。名称の由来そのものについて公式の詳しい説明は確認できていません。
まとめ:数字は強いが、勝負はこれから
Jalapeño(ハラペーニョ)は、OpenAIが推論コストとNVIDIA依存を下げるために投じた初の自社設計AI推論チップです。2026年8月のHot Chipsで公開された実測値は、電力あたり性能1.5〜1.9倍、エンドツーエンド遅延1.7〜3.6倍低減、対話型ワークロードで2.1〜4.1倍という強い内容でした。700Wのチップが1,400WのGPUを上回ったという構図は、専用ASICの経済合理性を裏づけるものです。
一方で、これらはすべてOpenAI提供のデータであり、テスト条件も8k1kという限定的なものです。エージェント用途の検証は未実施、シリコンはまだエンジニアリングサンプル段階、本格出荷は2027年末に集中する見込みで、その頃には競合も前進しているとRichard Ho氏自身が認めています。
日本の読者・企業にとっての実務的な結論は明快です。今すぐ変わることはないが、推論単価は中期的に下がる方向に進むという前提で計画を立てておくこと。特にAIエージェント型の業務自動化は、遅延コストの低下によって採算ラインが変わる可能性があります。「レスポンスが遅くて見送った」用途は、2027年以降に再評価する価値があります。
Gen 2は開発が深く進行中、Gen 3も設計に着手済みとされており、この領域の更新は続きます。公式発表と二次報道を切り分けながら、続報を追っていくのが賢明です。
このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します
業務を1つ送るこの記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

Meta Muse Charmとは?キーホルダー型AIエージェント端末の機能・発売時期・価格・Meta Connect 2026発表まとめ【2026年9月】
2026/09/27

Cognition(Devin)$25B評価額・$1B調達を完全解説|ARR $492M・月50%成長・Mercedes/NASA/Goldman Sachs採用からSeries E $48Bまで【2026年9月更新】
2026/05/28

Claudeが新しい酵素システム「ART」を発見|CRISPR似の反復配列とは?AI創薬・生命科学研究への影響【2026年9月】
2026/09/27

GitHub MCP Server(github-mcp-server)使い方ガイド【2026年9月最新】|Claude CodeにGitHub直接アクセスを与える完全解説
2026/04/24

Grok 4.7とは?SpaceXAI最新モデルの性能・API料金・Grok 4.6との違い・使い方【2026年9月】
2026/09/27

Google AI Overviews 専門家アドバイス機能とは|Reddit・フォーラム引用・Subscribed表示・SEO影響とオプトアウトを解説【2026年9月最新】
2026/05/23

