NVIDIA、推論専用チップ「Groq 3 LPX」が量産開始 — Gemma 4 31B で毎秒3,400トークン
NVIDIA が米国時間 8/24 の Hot Chips で、推論専用アクセラレータ「NVIDIA Groq 3 LPX」の量産開始を発表した。昨年12月に約200億ドルで買収した Groq の資産をベースにした製品で、トークンを1つずつ吐き出すデコード段だけを速くすることに振り切っている。Vera Rubin NVL72 の構成に組み込む形で提供され、最初の採用先は AI クラウドの Nebius。
キーポイント
- オープンモデル Gemma 4 31B・コンテキスト10万トークンで毎秒3,400出力トークン(計測は Artificial Analysis)
- NVIDIA の主張で応答性は競合プラットフォームの約4倍。エージェントのコーディングタスクが「数時間ではなく数分」で終わる水準
- Vera Rubin NVL72 を推論ワークロード向けに拡張する位置づけ。7種のチップと5種のラックで構成(BlueField-4 DPU・Vera CPU ラック・Spectrum-6 SPX Ethernet ほか)
- 買収額は約200億ドル(2025年12月)。Tom's Hardware によると製造は Samsung、ダイ上に 500MB の SRAM を載せてメモリ帯域のボトルネックを回避する設計
- 最初の採用は AI クラウドの Nebius。Nebius Token Factory へ統合し年内オンライン。Groq 自身の推論クラウドも早期導入を予定
- Jensen Huang「Vera Rubin はエージェンティック AI の時代に向けたワークロード最適化構成。LPX が超高速なトークン生成で性能フロンティアを押し上げる」