AI推論チップ企業のd-Matrixは、次世代Raptor XPUをNVIDIAのAIインフラ基盤へ接続するため、NVIDIA NVLink Fusionを採用すると発表しました。NVIDIAのMGXラック設計、Spectrum-Xネットワーク、Vera CPU、BlueField DPUなどと組み合わせ、推論特化プロセッサをAIファクトリー規模で展開しやすくします。
生成AIのコスト構造では、学習よりも日々の推論需要が急速に重くなっています。低遅延・省電力な推論チップを、既存データセンター基盤へどう安全に組み込むかが次の競争点です。
NVLink Fusionが解く課題
カスタムXPUを作るだけでは、大規模サービスには使えません。ラック設計、電力、冷却、ネットワーク、ソフトウェア、サプライチェーンをそろえ、既存GPU基盤と一緒に運用できる必要があります。NVIDIAは、NVLink FusionによってCPUやXPUをNVIDIAスタックに低遅延・高帯域で接続できると説明しています。
d-Matrixは、Raptor XPUをNVLinkのスケールアップ領域に接続し、Vera Rubin NVL72のようなGPUシステムとも分散推論で連携できる構成を想定しています。
構成要素 | 役割 |
|---|---|
d-Matrix Raptor XPU | 超低遅延推論向けの専用プロセッサ |
NVIDIA NVLink Fusion | XPU/CPUをNVIDIA基盤へ接続する高速インターコネクト |
MGXラック | 電力・冷却・筐体設計を含む標準化された展開基盤 |
Spectrum-X / ConnectX / BlueField | AIファクトリーのネットワークとデータ処理を支える |
AIインフラは「混在運用」へ向かう
NVIDIAは、自社GPUだけでなく、GroqなどのXPUやCPUを含めたファンジブルなAIファクトリー構想を示しています。背景には、モデルや用途によって最適なチップが異なる現実があります。大規模モデルの学習、長文推論、音声、画像、リアルタイム検索、エージェント実行では、求められる遅延、メモリ、電力効率が違います。
日本のデータセンター事業者やクラウド利用企業にとっては、GPU不足だけでなく、推論コストをどう抑えるかが重要になります。専用チップを導入しても、運用基盤が分断されれば管理コストが増えるため、標準ラックやネットワークとの統合性が選定ポイントになります。
導入時の注意点
専用XPUは魅力的ですが、対応モデル、コンパイラ、監視、障害切り分け、既存MLOpsとの接続を確認する必要があります。性能比較では、ピーク値だけでなく、実運用のトークン毎コスト、消費電力、ラック密度、保守体制を見るべきです。
AIインフラ投資は長期固定費になりやすいため、単一ベンダー最適ではなく、複数チップを混在運用できる設計がリスク分散につながります。
参考:NVIDIA公式ブログ / d-Matrix発表

.png&w=384&q=75)