d-Matrix、NVIDIA NVLink Fusionを採用──推論特化XPUをAIファクトリーへ接続

d-Matrix、NVIDIA NVLink Fusionを採用──推論特化XPUをAIファクトリーへ接続

AI推論チップ企業のd-Matrixは、次世代Raptor XPUをNVIDIAのAIインフラ基盤へ接続するため、NVIDIA NVLink Fusionを採用すると発表しました。NVIDIAのMGXラック設計、Spectrum-Xネットワーク、Vera CPU、BlueField DPUなどと組み合わせ、推論特化プロセッサをAIファクトリー規模で展開しやすくします。

生成AIのコスト構造では、学習よりも日々の推論需要が急速に重くなっています。低遅延・省電力な推論チップを、既存データセンター基盤へどう安全に組み込むかが次の競争点です。

NVLink Fusionが解く課題

カスタムXPUを作るだけでは、大規模サービスには使えません。ラック設計、電力、冷却、ネットワーク、ソフトウェア、サプライチェーンをそろえ、既存GPU基盤と一緒に運用できる必要があります。NVIDIAは、NVLink FusionによってCPUやXPUをNVIDIAスタックに低遅延・高帯域で接続できると説明しています。

d-Matrixは、Raptor XPUをNVLinkのスケールアップ領域に接続し、Vera Rubin NVL72のようなGPUシステムとも分散推論で連携できる構成を想定しています。

構成要素

役割

d-Matrix Raptor XPU

超低遅延推論向けの専用プロセッサ

NVIDIA NVLink Fusion

XPU/CPUをNVIDIA基盤へ接続する高速インターコネクト

MGXラック

電力・冷却・筐体設計を含む標準化された展開基盤

Spectrum-X / ConnectX / BlueField

AIファクトリーのネットワークとデータ処理を支える

AIインフラは「混在運用」へ向かう

NVIDIAは、自社GPUだけでなく、GroqなどのXPUやCPUを含めたファンジブルなAIファクトリー構想を示しています。背景には、モデルや用途によって最適なチップが異なる現実があります。大規模モデルの学習、長文推論、音声、画像、リアルタイム検索、エージェント実行では、求められる遅延、メモリ、電力効率が違います。

日本のデータセンター事業者やクラウド利用企業にとっては、GPU不足だけでなく、推論コストをどう抑えるかが重要になります。専用チップを導入しても、運用基盤が分断されれば管理コストが増えるため、標準ラックやネットワークとの統合性が選定ポイントになります。

導入時の注意点

専用XPUは魅力的ですが、対応モデル、コンパイラ、監視、障害切り分け、既存MLOpsとの接続を確認する必要があります。性能比較では、ピーク値だけでなく、実運用のトークン毎コスト、消費電力、ラック密度、保守体制を見るべきです。

AIインフラ投資は長期固定費になりやすいため、単一ベンダー最適ではなく、複数チップを混在運用できる設計がリスク分散につながります。

参考:NVIDIA公式ブログ / d-Matrix発表

この記事に携わった人
Mynto編集部
Mynto.aiの編集部です。
関連記事
お問い合わせ各種

課題解決のためのお役立ち資料ダウンロードや、
サービスのお問い合わせが可能です。
お気軽にご相談ください。