딥시크, 화웨이 어센드용 오픈소스 도구로 쿠다 장벽 겨냥…엔비디아 성능 비교는 빠졌다

작성일

딥시크, 화웨이와 어센드용 오픈소스 툴 공개…칩 128개 슈퍼노드 최적화
엔비디아용 도구와 1:1 대응 설계, 쿠다 의존 낮추는 소프트웨어 승부수

무엇이 공개됐나: 라이브러리 2종과 틸랭 네이티브 지원 — 내용 이해를 돕는 AI 이미지
무엇이 공개됐나: 라이브러리 2종과 틸랭 네이티브 지원 — 내용 이해를 돕는 AI 이미지

중국 AI 기업 딥시크(DeepSeek)가 화웨이와 함께 만든 오픈소스 프로그래밍 도구를 공개했다. 화웨이의 AI 칩 어센드(Ascend)를 겨냥한 소프트웨어 묶음으로, 엔비디아의 쿠다(CUDA) 생태계 의존도를 낮추려는 시도다. 로이터 보도에 따르면 공개일은 9월 30일(현지시각)이고, 연산·칩 간 통신 라이브러리와 고수준 프로그래밍 언어 틸랭(TileLang)의 어센드 지원이 담겼다.

딥시크는 공식 위챗 계정을 통해 이 사실을 알렸다. 개발 과정에서 화웨이가 전폭적으로 지원했다고 밝혔다. 칩 성능 못지않게 소프트웨어가 승부를 가른다는 업계 통념을 정면으로 겨냥한 발표다.

무엇이 공개됐나: 라이브러리 2종과 틸랭 네이티브 지원

톰스하드웨어(Tom's Hardware)에 따르면 이번 공개에는 AI 연산용과 칩 간 통신용 오픈소스 라이브러리가 포함됐다. 먼저 딥GEMM-어센드(DeepGEMM-Ascend)는 딥시크 모델에 쓰이는 행렬 곱셈 등 연산을 맡는다. BF16·FP8·FP4 연산을 지원하며 기존 딥GEMM 라이브러리와 같은 프로그래밍 인터페이스를 쓴다. 개발자가 익숙한 API를 그대로 유지한 채 어센드로 옮겨 갈 수 있다는 뜻이다.

딥EP-어센드는 학습과 추론 과정의 통신을 담당한다. 전문가혼합(MoE·여러 전문가 모델 중 일부만 골라 쓰는 구조) 모델에서 데이터를 각 전문가에게 보내고 결과를 다시 합치는 역할이다. 두 라이브러리 모두 어센드 950 하드웨어에서 개발하고 테스트했다.

핵심 축은 틸랭이다. 최적화된 커널(GPU·AI 칩에서 실제 연산을 수행하는 작은 프로그램)을 짜기 위한 고수준 언어다. 딥시크는 틸랭이 쿠다보다 “더 단순한 프로그래밍 모델”을 제공해 개발 효율을 높이고 코드를 단순하게 만든다고 설명했다. 업데이트에는 어센드 950 네이티브 지원이 추가됐다. 코드 생성, 자동 스케줄링, 동기화 기능이 포함된다.

도구 전체는 화웨이의 기존 소프트웨어 플랫폼 CANN 위에 올라선다. CANN은 어센드 칩에서 AI 워크로드를 돌리기 위한 기반 인프라다. 틸랭은 이전에도 엔비디아 등 다른 하드웨어를 지원했고 어센드용 어댑터도 있었지만, 이번에 어센드 950에 대한 공식 지원이 들어갔다.

엔비디아용 도구와 1:1 대응…이식 부담 줄이는 설계 — AI로 생성한 자료 이미지
엔비디아용 도구와 1:1 대응…이식 부담 줄이는 설계 — AI로 생성한 자료 이미지

엔비디아용 도구와 1:1 대응…이식 부담 줄이는 설계

금융 매체 빅고 파이낸스는 구성품을 더 구체적으로 전했다. 딥시크가 공개한 묶음에는 행렬 연산용 딥GEMM, 기기 간 통신용 딥EP, 벡터 연산과 메모리 접근용 타일커널스, 긴 문맥 처리용 플래시MLA, 데이터 선별용 딥셀렉트가 포함됐다. 이 매체는 이 소식이 항저우에 본사를 둔 회사의 위챗 공지를 통해 나왔다고 전했다.

눈에 띄는 대목은 설계 방침이다. 딥시크는 오픈소스 구성 요소가 이전에 엔비디아 하드웨어용으로 만든 도구와 일대일로 대응한다고 밝혔다. 하위 구현을 자동으로 고르고 상위 인터페이스를 맞춰, 서로 다른 하드웨어 플랫폼 사이에서 중복 개발 부담을 크게 줄일 수 있다는 설명이다. 엔비디아에서 어센드로 넘어갈 때 코드를 새로 쓰는 마찰을 없애겠다는 취지다.

딥시크는 발표문에서 이렇게 밝혔다. “새로운 세대의 독립적이고 자주적인 GPU 소프트웨어 생태계를 구축하려면 가장 먼저 보편적이고 프로그래밍하기 쉬우면서도 하드웨어의 성능 한계까지 끌어낼 수 있는 고수준 언어를 확립해야 한다. 틸랭은 바로 그 요구를 충족하기 위해 만들어졌다.” 또 다른 보도에 인용된 표현으로는 “좋은 일을 하려면 먼저 올바른 도구가 있어야 한다”는 문구도 있었다. 중동 IT 매체 타하울테크는 이 도구들이 무료로 내려받을 수 있다고 전했다.

어센드 950 128개 슈퍼노드…일부 테스트는 성능 한계 근접

두 회사는 어센드 950 칩 128개를 묶은 ‘슈퍼노드’ 시스템에서 연산과 통신을 함께 최적화했다. 대규모 AI 워크로드를 여러 가속기에서 돌리려면 각 칩 내부 계산을 효율적으로 처리해야 한다. 칩 사이에서 데이터가 충분히 빠르게 오가야 프로세서가 놀지 않는다. 이번 라이브러리 2종은 각각 이 두 요구에 대응한다.

빅고 파이낸스는 딥시크가 이 시스템의 일부 테스트 케이스가 하드웨어 성능 한계에 근접했다고 밝혔다고 전했다. 엔비디아 대비 성능 비교 자료도 공개되지 않았다.

화웨이와의 협업은 이번이 처음이 아니다. 딥시크 V4 모델은 4월에 프리뷰 형태로 나왔고 어센드 칩을 지원했다. 화웨이는 어센드 950 슈퍼노드가 V4 모델을 완전히 지원하며, 경량 모델 V4-플래시 학습 일부에 자사 칩이 쓰였다고 밝혔다. 시장조사업체 세미애널리시스는 앞선 딥시크 V4 분석에서 화웨이의 CANN이 출시 첫날 이 모델을 지원한 소프트웨어 스택으로는 쿠다 외에 유일했다고 짚었다.

틸랭의 이력과 쿠다라는 높은 벽

The Decoder에 따르면 틸랭은 원래 베이징대 연구진이 개발한 오픈소스 언어다. 딥시크는 이를 약 1년간 사용해 왔다. 처음에는 구형 엔비디아 칩에서 테스트했다. 뉴욕타임스는 틸랭이 현재 딥시크의 범용인공지능 연구 핵심 도구라고 보도했다고 The Decoder는 전했다.

엔비디아의 강점은 칩 설계만이 아니다. The Decoder는 전 세계 약 400만 명으로 추정되는 쿠다 개발자 생태계가 AMD 같은 경쟁사도 넘지 못한 ‘해자’라고 짚었다. 반면 빅고 파이낸스는 엔비디아가 쿠다와 관련 도구 사용 개발자를 750만 명 이상으로 집계한다고 전했다. 집계 기준에 따라 수치가 엇갈린다. 두 매체 모두 이 생태계가 20년 가까이 쌓인 자산이자 경쟁 장벽이라는 점은 같다.

이 매체는 중국 AI 업계의 소프트웨어 과제도 지적했다. 뉴욕타임스를 인용해 즈푸의 Z.ai와 문샷AI 같은 중국 모델 개발사가 자국 칩 업체보다 빠르게 움직여 왔다고 전했다. 국산 칩이 성능을 제대로 내려면 이를 뒷받침할 소프트웨어가 필요하다는 얘기다.

화웨이 로드맵과 변수: 쿠다 해자는 얼마나 남았나

화웨이는 딥시크 발표 약 2주 전에 차세대 AI 프로세서와 슈퍼노드 시스템을 공개했다. 이 시스템이 내년에 대규모 모델 학습에 널리 쓰일 것으로 기대한다고 밝혔다. 빅고 파이낸스에 따르면 그보다 한 주 앞서 화웨이는 어센드 960DT 칩을 2027년 1분기에 출하하겠다고 밝혔다. 기존 일정보다 3개 분기 앞당긴 것이다. 화웨이는 2029년까지 이어지는 칩 로드맵도 제시했다.

회장 에릭 쉬는 어센드가 중국 AI 칩 시장 점유율에서 엔비디아를 앞선다고 주장했지만 수치는 내놓지 않았다. The Decoder는 화웨이가 자국 수요조차 감당하기 어려워 해외 칩 판매를 줄일 계획이라고 전했다. 쉬 회장은 미국의 수출 통제를 언급하며, 다른 나라가 중국에 칩을 팔 의향이 있느냐에 미래가 달린 상황은 받아들일 수 없다고 말했다고 한다.

배경에는 미국 수출 통제가 있다. 빅고 파이낸스에 따르면 통제 탓에 중국 기업이 엔비디아 최상위 프로세서를 확보하기 어려워졌다. 엔비디아도 최근 분기 보고서에서 중국 데이터센터 컴퓨팅 시장에 없는 상황이 경쟁사들이 “전 세계에서 우리에게 도전할 더 큰 개발자·고객 생태계”를 구축하도록 도왔다고 인정했다.

다만 쿠다의 해자가 실제로 얼마나 약해졌는지는 아직 갈린다. The Decoder에 따르면 세미애널리시스는 오픈AI의 추론 칩 ‘할라페뇨(Jalapeño)’를 테스트한 뒤 쿠다 해자가 “잠재적으로 죽었다”고 평가했다. 오픈AI가 새 모델을 자체 하드웨어에서 매우 빠르게 구동했기 때문이다. 다만 테스트는 입력 약 8,000토큰, 출력 1,000토큰이라는 비교적 최적화하기 쉬운 시나리오에 한정됐다. 멀티스텝 에이전트 작업을 재는 에이전트X 벤치마크는 아직 돌리지 못했고, 이 분야에서는 지난 8월 엔비디아가 크게 앞서 있었다. 화웨이 칩은 이 비교에 포함되지 않았다.

미국 전략국제문제연구소의 그레고리 앨런은 2025년 4월 의회에서 딥시크의 기술력과 오픈소스 커뮤니티가 화웨이 CANN 생태계를 개선하는 데 도움이 될 수 있다고 증언했다. 쿠다에서 워크로드를 옮기는 데는 수년이 걸릴 것이라고도 했다. 빅고 파이낸스는 이번 발표로 그 이전 작업이 계획 단계에서 실행 단계로 넘어가고 있다고 평가했다. 틸랭이 여러 플랫폼을 지원하는 만큼 엔비디아 GPU 사용자에게도 여전히 쓸모가 있다는 점도 톰스하드웨어는 짚었다.