핵심 내용
DeepSeek와 Huawei는 Huawei의 Ascend AI 가속기에서 고성능 AI 연산을 개발하기 위한 오픈소스 소프트웨어를 확대했다. Reuters는 DeepSeek가 Huawei와 협력해 Ascend용 programming infrastructure를 공개하며 Nvidia CUDA 생태계 의존을 줄이려 하고 있다고 보도했다.
원본 GitHub를 확인하면 DeepSeek는 9월 30일 DeepGEMM-Ascend를 처음 공개했고, Ascend 950 계열에서 near-peak hardware performance를 목표로 하는 matrix multiplication kernel library라고 설명한다. TileLang 프로젝트도 같은 날 Ascend 950 backend 공식 지원을 추가해 native code generation, automatic scheduling, synchronization, SIMD/SIMT vector programming 등을 제공한다고 밝혔다.
TileLang은 CUDA만 대체하는 Huawei 전용 언어가 아니라 GPU·CPU·NPU kernel 개발을 위한 multi-backend DSL이다. 이번 업데이트의 의미는 중국 AI 개발자들이 Ascend에서 GEMM, FlashAttention 같은 고성능 커널을 더 높은 수준의 Pythonic 문법으로 작성할 수 있는 경로가 넓어졌다는 데 있다.
배경
Nvidia의 경쟁력은 GPU 성능뿐 아니라 CUDA, cuDNN, NCCL 등 오랜 기간 축적된 개발도구와 라이브러리에 있다. 대체 가속기가 충분한 연산성능을 제공하더라도 모델과 커널을 쉽게 port하고 최적화할 수 없다면 실제 채택은 어렵다.
Huawei는 Ascend 950과 SuperPoD·SuperCluster를 확대하면서 CANN·PTO ISA·Ascend C 등 소프트웨어 계층도 개방하고 있다.
산업·시장에 미치는 영향
중국 AI 반도체 경쟁의 핵심이 칩 자체에서 compiler·kernel·communication library까지 포함하는 full software stack으로 이동하고 있다. Ascend가 Nvidia를 즉시 대체한다는 의미는 아니지만, 모델 개발사가 직접 최적화 도구를 오픈소스로 제공하면 전환비용을 낮출 수 있다.
장기적으로 CUDA에 집중돼 있던 개발자의 고성능 kernel code가 TileLang 같은 multi-backend abstraction으로 이동하면 Nvidia 외 가속기의 진입장벽도 일부 낮아질 수 있다.
실무에서 바로 활용할 수 있는 시사점
다중 가속기를 고려하는 팀이라면 model framework 호환 여부만 확인하지 말고 custom kernel, collective communication, profiler, compiler error tooling까지 POC해야 한다. CUDA custom op가 많은 모델은 porting 비용이 크므로 TileLang·Triton과 같은 상위 kernel DSL로 핵심 연산을 추상화하면 장기적인 vendor portability에 도움이 될 수 있다.
출처
Reuters — DeepSeek partners with Huawei to develop chip programming tools, reducing reliance on Nvidia
GitHub — deepseek-ai/DeepGEMM-Ascend
GitHub — tile-ai/tilelang
Huawei — Advances Agentic Computing for SuperPoDs and SuperClusters