핵심 내용
AI inference 반도체 스타트업 d‑Matrix가 차세대 Raptor XPU에 NVIDIA의 NVLink Fusion을 채택한다고 9월 10일 발표했습니다. NVIDIA의 NVLink scale-up network, Spectrum‑X, MGX rack architecture와 연결해 Raptor를 NVIDIA GPU 시스템과 같은 AI factory 안에서 운용할 수 있게 합니다. blogs.nvidia.com, reuters.com
d‑Matrix는 특히 chatbot·coding agent·voice agent처럼 낮은 latency가 중요한 inference를 목표로 하는 가속기 회사입니다. Raptor 설계는 2026년 말까지 마무리되고 통합 시스템은 2027년 출시를 목표로 합니다. reuters.com
NVIDIA 설명에 따르면 NVLink Fusion을 이용하면 third-party XPU도 NVIDIA의 CPU·DPU·NIC·Spectrum-X networking·MGX rack·냉각·전력 ecosystem을 그대로 활용할 수 있습니다. NVIDIA는 NVLink 6 기준 XPU 간 off-the-shelf Ethernet보다 낮은 latency와 높은 packet rate를 강조하고 있습니다. 해당 성능 수치는 NVIDIA 측 자료입니다. blogs.nvidia.com
배경
NVIDIA가 custom AI chip 붐에 대응하는 방법이 점점 분명해지고 있습니다.
과거 전략:
NVIDIA GPU를 사라.
현재 전략:
다른 XPU를 만들어도 NVIDIA rack 안에서 돌려라.
MediaTek, Marvell, AWS에 이어 d‑Matrix까지 같은 ecosystem으로 들어오고 있습니다. blogs.nvidia.com
산업·시장 영향
향후 NVIDIA의 moat가 CUDA + GPU에서:
NVLink + Networking + MGX + Power/Cooling + Supply chain
으로 확장될 수 있습니다.
경쟁 ASIC이 NVIDIA GPU의 일부 inference workload를 빼앗더라도 그 칩이 NVLink를 통해 연결된다면 NVIDIA는 데이터센터 architecture 계층에서는 계속 수익을 얻을 수 있습니다.
실무 시사점
AI infra를 장기 설계할 때 앞으로는 accelerator와 rack infrastructure를 분리해서 생각할 필요가 있습니다.
Compute
GPU / TPU / XPU
↓
Shared Fabric
Network / Memory / Rack
모델 workload에 따라 accelerator는 바뀌어도 network와 deployment architecture는 유지되는 구조가 점점 중요해집니다.