핵심 내용
NVIDIA는 10월 2일 DGX Spark의 64GB unified-memory 구성을 공개했다. 새 SKU는 기존 128GB 모델과 같은 GB10 Grace Blackwell Superchip, DGX OS, NVIDIA AI software stack을 사용하며 10월 23일부터 Acer, ASUS, Dell, Gigabyte, HP, MSI를 통해 4,999달러부터 판매될 예정이다. NVIDIA Blog
NVIDIA는 64GB 한 대에서 최대 1,000억 파라미터 모델을 로컬에서 실행할 수 있다고 설명한다. 두 대를 ConnectX-7과 QSFP 케이블로 연결하면 메모리를 128GB로 pool해 최대 2,000억 파라미터 모델을 대상으로 사용할 수 있다. 회사의 Qwen 3.8 27B 테스트에서는 두 대 구성에서 한 대 대비 최대 1.7배 성능을 보였다고 밝혔다. NVIDIA Blog
새 NVIDIA Sync Cluster Assistant는 연결된 장치를 자동 감지하고 설정을 검사한 뒤 ConnectX-7 네트워크와 workload routing을 구성한다. NVIDIA는 월말에 Sync Model Launcher도 제공해 Qwen3.8 27B와 OpenCode 같은 개발환경을 클릭 몇 번으로 실행할 수 있게 할 계획이다. NVIDIA Blog
배경
open-weight 모델 품질이 올라가면서 개인·소규모 팀도 클라우드 대신 로컬에서 코딩 Agent, RAG, 문서분석을 돌리려는 수요가 늘고 있다. 다만 큰 모델을 단일 워크스테이션의 VRAM에 넣기 어렵다는 문제가 있어 unified memory와 간단한 multi-node 구성이 중요해지고 있다. NVIDIA Blog
산업·시장에 미치는 영향
로컬 AI 장비 시장이 고가 단일 workstation에서 작은 장비를 필요에 따라 묶는 scale-out 구조로 넓어질 수 있다. 동시에 NVIDIA는 DGX Spark에서 CUDA, Ollama, vLLM, PyTorch, Agent Toolkit을 통합하면서 로컬 AI에서도 자사 software stack을 표준으로 만들려 하고 있다. NVIDIA Blog
실무에서 바로 활용할 수 있는 시사점
로컬 Agent 장비를 검토할 때 모델 파라미터 수만 보지 말고 quantization, context 길이, KV cache, 동시 Agent 수를 포함한 실제 peak memory를 측정해야 한다. 두 노드를 묶었을 때도 memory pool이 자동으로 모든 workload의 2배 성능을 의미하지 않으므로 자신의 모델에서 tokens/s와 interconnect overhead를 직접 테스트해야 한다.
출처
NVIDIA — DGX Spark 64GB Gives Developers More Ways to Build and Scale Local AI