DeepSeek mở TileLang cho chip Huawei: nhắm vào 4 triệu dev CUDA



DeepSeek vừa công bố mở mã toàn bộ bộ công cụ lập trình mà họ xây cùng Huawei cho dòng chip Ascend, với trọng tâm là một ngôn ngữ mới tên TileLang. Đây không phải một bản driver hay một SDK thông thường — nó là câu trả lời trực tiếp cho câu hỏi vì sao chip Huawei nhiều năm qua có thể chạy nhưng chưa bao giờ được dùng hết sức.

Điều đáng chú ý nhất trong thông báo này nằm ở chỗ ngược lại với mọi tin chip trước đó: lần này phần mềm mới là nhân vật chính, còn phần cứng chỉ là bối cảnh.

CUDA thắng không phải vì chip tốt hơn

Cách kể phổ biến về cuộc đua chip AI là so sánh thông số: xung nhịp, băng thông bộ nhớ, hiệu năng mỗi watt. Cách kể đó không giải thích vì sao AMD có phần cứng ngang ngửa trên giấy tờ mà vẫn không lấy được chỗ.

Vấn đề nằm ở chỗ khác. Theo ước tính được dẫn trong bài viết của The Decoder, khoảng bốn triệu lập trình viên trên toàn thế giới đang xây dựng phần mềm trên CUDA của Nvidia. Con số này là ước tính của bên thứ ba, không phải số liệu Nvidia công bố — nhưng ngay cả khi có sai lệch vài phần trăm thì bậc độ vẫn là điều quyết định: một hãng chip mới không thể đòi lập trình viên ngồi viết lại toàn bộ mã nguồn chỉ để thử một con chip mới.

Hệ quả là thứ đáng gọi là "hào mỹng phần mềm" của Nvidia hiệm khi bị chọn thắng khi phần cứng ngang bằng. Người đánh giá đồng nghiệp của bất kỳ chip thay thế nào cũng bắt đầu từ câu hỏi giống nhau: tôi đã có bao nhiêu người viết code cho con chip này?

Rào cản đang dịch chuyển

Điều DeepSeek nói trong thông báo cũng là quan điểm của phần lớn người trong ngành: muốn dựng một hệ sinh thái phần mềm độc lập cho chip AI, bước đầu tiên không phải là viết trình biên dịch tối ưu, mà là có một ngôn ngữ thống nhất — dễ viết, nhưng vẫn khai thác hết hiệu năng phần cứng.

Đây chính là lập luận mà Huawei cần nhất. Theo New York Times, các hãng làm mô hình Trung Quốc như Z.ai và Moonshot AI đang đi nhanh hơn cả nhà sản xuất chip trong nước. Huawei muốn thu hẹp khoảng cách đó, nên chọn đối tác là một công ty biết dùng chip tốt.

TileLang là gì và DeepSeek dùng nó thế nào

TileLang là ngôn ngữ lập trình mã nguồn mở cho chip AI, ban đầu do các nhà nghiên cứu tại Đại học Bắc Kinh phát triển. DeepSeek nói họ đã dùng nó khoảng một năm, và nay nó là công cụ chính trong công việc hướng tới trí tuệ nhân tạo tổng quát của họ.

Hai chi tiết trong cách kể của DeepSeek đáng chú ý vì chúng cho thấy đây không phải một dự án nghiên cứu bị đẩy ra cổng:

  • DeepSeek thử nghiệm TileLang trên chính chip Nvidia thế hệ cũ trước khi đưa nó sang Ascend. Nghĩa là ngôn ngữ này được kiểm chứng khả năng chạy trên phần cứng bên thứ ba, chứ không phải viết riêng cho một họ chip để khoe.
  • Hai bên cũng tối ưu hóa một "supernode" — cụm 128 chip Ascend 950. Với quy mô đó, phần mềm phải nối được nhiều chip thành một hệ thống, chứ không chỉ tăng tốc một chip đơn lẻ.

Huawei được DeepSeek mô tả là "hỗ trợ toàn diện" cho dự án.

Bảng so sánh ba tầng phần mềm

CUDA (NVIDIA) CANN (Huawei) TileLang (DeepSeek + Đại học Bắc Kinh)
Ai duy trì NVIDIA Huawei DeepSeek, gốc Đại học Bắc Kinh
Ngôn ngữ lập trình Hệ sinh thái của NVIDIA, phổ biến nhất là CUDA C/C++ Hệ stack phần mềm CANN, dùng chung một ngôn ngữ gốc cho cả CPU lẫn chip tăng tốc Một ngôn ngữ riêng, thiết kế riêng cho tile trên chip AI
Tình trạng mã nguồn mở Nguồn đưa bài không nói là mở toàn bộ; CUDA Toolkit có phần mở, phần đóng Nguồn đưa bài không nói rõ giấy phép Được DeepSeek công bố mở, kèm thư viện tính toán và thư viện chuyển dữ liệu giữa các chip
Quy mô đã dùng thật Khoảng bốn triệu lập trình viên (ước tính) Chưa có số liệu công khai trong các nguồn đưa bài Khoảng một năm tại DeepSeek, là công cụ chính cho dự án AGI
Điểm mạnh được nêu Độ ổn định, hệ sinh thái khổng lồ, nhiều thư viện sẵn có Hỗ trợ mô hình ngay ngày đầu, theo đánh giá của SemiAnalysis về DeepSeek V4 Mô hình lập trình đơn giản hơn CUDA theo DeepSeek, vẫn lấy hết hiệu năng phần cứng
Điểm chưa rõ Không có Chưa có số liệu về số người dùng và độ phủ thư viện Chưa có benchmark công khai nào so TileLang với CUDA được đưa vào các nguồn này

Điểm cần nhấn mạnh ở dòng cuối: không có bất kỳ con số benchmark TileLang so với CUDA nào trong những nguồn này. Tuyên bố "đơn giản hơn CUDA" là đánh giá của chính DeepSeek, không kèm phép đo kèm theo. Hãy đọc nó như một tuyên bố lợi ích, chưa phải một kết quả đã kiểm chứng.

Moat của CUDA: hai kết luận trái chiều trong cùng tuần

Bối cảnh quan trọng cho bản tin này là hãng nghiên cứu SemiAnalysis vừa đưa ra hai đánh giá nghe như trái nhau.

Sau khi thử chip suy luận Jalapeño của OpenAI, SemiAnalysis gọi moat của CUDA là "có khả năng đã chết", lý do là OpenAI đưa được mô hình mới lên phần cứng tự chế của họ rất nhanh. Jalapeño vượt qua Blackwell của Nvidia về hiệu năng mỗi watt ở phần lớn các kịch bản được thử. Và có một chi tiết đáng nói: chính các mô hình của OpenAI đã tham gia thiết kế con chip này — trong khi những mô hình đó lại đang chạy trên GPU Nvidia.

Nhưng chính SemiAnalysis cũng nói thẳng giới hạn của phép thử: họ mới chỉ chạy các kịch bản tương đối dễ tối ưu, khoảng 8.000 token đầu vào và 1.000 token đầu ra, và chưa chạy AgentX — bộ đo khả năng xử lý tác vụ nhiều bước.

Và AgentX chính là nơi tháng tám SemiAnalysis đánh giá Nvidia vẫn dẫn xa. Với bộ phần mềm hiện tại của AMD, Nvidia vẫn rẻ hơn tính theo mỗi token kể cả khi AMD cho không phần cứng. Các tác giả không xem lợi thế bền của Nvidia nằm ở silicon, mà ở phần mềm nối nhiều chip thành một hệ thống.

Hai kết luận đó không mâu thuẫn — chúng đang nói về hai bài toán khác nhau. Chạy một mô hình đã có sẵn thì CUDA đang thua. Chạy hàng trăm tác vụ agent nhiều bước thì hàng dòng phần mềm vẫn là thứ giữ Nvidia ở đó. Đây chính là lý do TileLang là một dự án phần mềm, không phải một lời tuyên bố cạnh tranh chip.

Cụm 128 chip Ascend 950 nói lên điều gì

Hai tuần trước thông báo của DeepSeek, Huawei giới thiệu bộ xử lý và hệ supernode mới, nói chúng sẽ được dùng rộng rãi để huấn luyện mô hình trong năm sau. Các nguồn đưa bài không cho biết cụ thể cấu hình từng cụm, cũng không nêu mức giá, không nêu số lượng cụm sẽ lắp đặt.

Phần đáng chú ý nhất nằm ở một tuyên bố khác của Huawei: công ty không theo kịp nhu cầu trong nước, nên có kế hoạch bán ra nước ngoài ít chip hơn. Chủ tịch luân phiên Eric Xu còn nói thẳng công ty không thể chấp nhận một tương lai phụ thuộc vào việc người khác có bán chip cho Trung Quốc hay không.

Câu đó nghe như về địa chính trị, nhưng lại là một phát biểu về kinh tế học phần mềm: nếu nhu cầu trong nước đã vượt xa khả năng cung cấp, thì giá trị lớn nhất của lượt hàng tiếp theo nằm ở chất lượng phần mềm đi kèm, chứ không phải số lượng chip.

Ở Việt Nam: cứ dùng NVIDIA, nhưng vài điều nên biết

Nói thẳng phần này vì đây là chỗ dễ bị bài viết công nghệ nói quá.

Chưa dùng được. TileLang là mã nguồn mở nghĩa là bạn có thể tải về đọc code, không phải là bạn có Ascend để chạy. Máy tính xách tay và card đồ hoạ bán ở Việt Nam gần như toàn bộ là Nvidia hoặc AMD, chưa có con chip Ascend nào trên sàn hàng. Người dùng phổ thông không cần động vào chuyện này.

Không có tài liệu tiếng Việt. TileLang là ngôn ngữ lập trình, tài liệu bằng tiếng Anh. Nhưng đây cũng không phải rào cản thực tế: rào cản thật là bạn có nền tảng để dùng nó hay không, không phải ngôn ngữ tài liệu.

Chi phí thật nằm ở đâu. Nếu đến ngày Huawei chuyển sang bán rộng, giá một node huấn luyện Ascend ở Việt Nam chắc chắn không rẻ. Doanh nghiệp nhỏ và cá nhân gần như chắc chắn vẫn dùng đường OpenAI, Anthropic, Gemini — mua token hoặc thuê API. Nếu chi phí tính bằng USD, bạn vẫn cần thẻ quốc tế. Việc dùng được tiếng Việt ở đầu vào và đầu ra thì không phải vấn đề: đó là chuyện của lớp prompt và của từ vựng, và cách xử lý của mô hình tiếng Việt hiện tại đã ổn định ở mức dùng được, kể cả ở những việc như dịch tài liệu dài hay ôn tập ngôn ngữ.

Điều đáng để theo dõi trong 6 tháng tới, không phải TileLang, mà là câu hỏi này: liệu số lượng bài viết kỹ thuật thật viết bằng CANN có tăng không. Khi một hệ sinh thái phần mềm thực sự trưởng thành, dấu hiệu không nằm ở bài công bố hào nhoáng mà nằm ở khối lượng hướng dẫn, recipe và lỗi kinh niên đã được viết ra. Hiện tại con số đó chưa có.

Ba câu hỏi bài viết này chưa trả lời

Bản tin được công bố trên kênh WeChat chính thức của DeepSeek và được Reuters đưa, với chi tiết về 128 chip Ascend 950 từ New York Times. Nhưng vài chi tiết quan trọng không xuất hiện ở đâu cả:

  1. TileLang chạy nhanh hơn CUDA bao nhiêu? Không có. DeepSeek chỉ nói mô hình lập trình đơn giản hơn. Khi nào có con số hiệu năng thật trên cùng một bài toán, hãy coi đó là mốc đáng ghi nhận.
  2. Bao nhiêu người bên ngoài DeepSeek đã dùng TileLang? Chưa có. Ngôn ngữ mới mở mã hôm nay thì chưa ai có lý do để chuyển sang.
  3. Ascend có đủ sức chạy AgentX không? Chưa có. Chip Huawei không nằm trong phép so sánh AgentX mà SemiAnalysis thực hiện. Việc CANN hỗ trợ DeepSeek V4 ngay ngày đầu là tín hiệu tốt, nhưng chỉ về khả năng chạy được, không nói gì về tác vụ agent nhiều bước — chính là điểm SemiAnalysis nói Nvidia vẫn thắng mạnh.

Cũng nên nói thêm một chi tiết về cách đọc tin: bốn triệu lập trình viên CUDA là con số ước tính, không phải thống kê chính thức. Và việc DeepSeek chọn đối tác là Huawei trong khi đang chạy mô hình của mình trên GPU Nvidia là điều hoàn toàn hợp lý — ai cũng muốn phần mềm tốt hơn để chạy trên phần cứng của đối thủ.

Nguồn tham khảo

  • The Decoder — China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chips: https://the-decoder.com/chinas-ai-industry-closes-ranks-as-deepseek-ships-open-source-software-for-huaweis-ascend-chips/
  • Reuters — DeepSeek partners with Huawei to develop chip programming tools: https://www.reuters.com/world/asia-pacific/deepseek-partners-with-huawei-develop-chip-programming-tools-reducing-reliance-2026-09-30/
  • The New York Times — DeepSeek and Huawei chip push: https://www.nytimes.com/2026/09/30/business/china-ai-deepseek-huawei.html
  • SemiAnalysis — OpenAI Jalapeño better than Nvidia: https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
  • SemiAnalysis — AgentX: InferenceXv3, does CUDA moat: https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
  • The Decoder — DeepSeek plans the largest known Huawei chip cluster with 160,000 processors: https://the-decoder.com/deepseek-plans-the-largest-known-huawei-chip-cluster-with-160000-processors-in-inner-mongolia/