Ascend 960DT ra mắt sớm, nhắm thẳng vào nhu cầu AI nội địa

Tại hội nghị Connect thường niên, Huawei đã công bố thế hệ bộ tăng tốc AI mới mang tên Ascend 960DT, một dòng NPU (Neural Processing Unit – bộ xử lý chuyên dụng cho tác vụ trí tuệ nhân tạo) được kỳ vọng sẽ trở thành lựa chọn hàng đầu cho các nhà phát triển AI tại Trung Quốc. Đáng chú ý, mẫu chip này được cho là sẽ xuất hiện từ quý I/2027, sớm hơn khoảng ba quý so với kế hoạch trước đó. Tên gọi “DT” được cho là viết tắt của decode/training, tức tối ưu cho cả giai đoạn giải mã đầu ra lẫn huấn luyện mô hình.

Hiệu năng tăng gấp đôi, dùng bộ nhớ riêng thay vì phụ thuộc công nghệ phương Tây

Theo thông tin Huawei đưa ra, Ascend 960DT có thể trang bị tối đa 288 GB bộ nhớ HiZQ, được cho là công nghệ bộ nhớ tự phát triển của hãng nhằm thay thế HBM (High Bandwidth Memory – bộ nhớ băng thông cao thường dùng trên GPU AI cao cấp). Về sức mạnh tính toán, chip đạt tối đa 4 petaFLOPS ở FP4 và khoảng một nửa mức đó ở FP8. PetaFLOPS là đơn vị đo hiệu năng tính toán cực lớn, tương đương một triệu tỷ phép tính dấu chấm động mỗi giây; còn FP4 và FP8 là các định dạng số thực độ chính xác thấp, rất quan trọng trong AI hiện đại vì giúp tăng tốc xử lý và tiết kiệm điện năng. So với dòng Ascend 950 ra mắt đầu năm nay, 960DT được cho là tăng gấp đôi cả hiệu năng lẫn dung lượng bộ nhớ.

So với Nvidia và AMD, Huawei vẫn thua về sức mạnh thô nhưng có lợi thế thị trường

Nếu đặt cạnh các GPU AI hàng đầu của Mỹ, Ascend 960DT vẫn chưa thể bắt kịp. Mẫu chip này được đánh giá có dung lượng bộ nhớ và băng thông tương đương dòng Nvidia B300 ra mắt năm ngoái, nhưng hiệu năng tính toán FP8 chỉ bằng khoảng một nửa và FP4 chỉ bằng khoảng một phần ba. Khoảng cách còn lớn hơn khi so với Nvidia Rubin hay AMD MI455X, những sản phẩm mới hứa hẹn sức mạnh và băng thông vượt trội. Chẳng hạn, Rubin được cho là đạt 35 đến 50 petaFLOPS ở FP4, đi kèm 288 GB HBM4 và băng thông 22 TB/s. Tuy nhiên, vấn đề quan trọng là các chip tối tân này không được bán tự do tại Trung Quốc, khiến Ascend 960DT nổi lên như một phương án nội địa khả thi hơn nhiều.

Cuộc đua AI không còn là chuyện của một con chip đơn lẻ

Trong thực tế, các mô hình AI hiện đại hiếm khi được huấn luyện hay vận hành chỉ trên một GPU hoặc NPU. Yếu tố quyết định ngày càng nằm ở khả năng mở rộng hệ thống, tức scale-up và scale-out. Scale-up là mở rộng số lượng bộ tăng tốc trong cùng một miền tính toán chặt chẽ, còn scale-out là kết nối nhiều cụm máy lớn hơn với nhau để xử lý khối lượng công việc khổng lồ. Nvidia và AMD hiện đã có các hệ thống dạng rack-scale, tức nền tảng tính toán ở cấp độ nguyên tủ máy chủ, chứa tới 72 GPU trong một rack và có thể mở rộng lên 576 GPU nhờ kết nối quang học tốc độ cao.

Huawei đặt cược vào NPO để mở rộng tới 4.096 chip

Với dòng Ascend 960, Huawei cũng theo đuổi chiến lược mở rộng quy mô lớn bằng công nghệ NPO (Near Packaged Optics – quang học tích hợp gần chip xử lý). Đây là cách đưa kết nối quang tốc độ cao lại gần bộ xử lý hơn để giảm điện năng, tiết kiệm không gian và tăng độ ổn định. Huawei cho biết kiến trúc mới cho phép mở rộng miền tính toán lên tới 4.096 chip, đạt tổng hiệu năng tối đa khoảng 16 exaFLOPS FP4; exaFLOPS là cấp độ còn cao hơn petaFLOPS, tương đương một tỷ tỷ phép tính mỗi giây. Đây là cách tiếp cận tương tự triết lý “lấy số lượng bù mật độ tính toán” từng thấy ở các TPU Pod của Google, tức cụm bộ xử lý AI chuyên dụng được ghép nối ở quy mô rất lớn.

Hi-One NPO giúp giảm điện, giảm lỗi và tăng thời gian hoạt động

Theo Huawei, NPO giúp giải quyết một điểm yếu lớn trong các thiết kế cũ: mô-đun quang cắm rời vừa tốn điện, vừa chiếm chỗ, lại dễ hỏng. Hãng nói rằng họ đã thay thế 48.000 mô-đun quang 800 Gbps bằng khoảng 5.500 đơn vị Hi-One NPO. Gbps là gigabit mỗi giây, đơn vị đo tốc độ truyền dữ liệu trong mạng. Sự thay đổi này được cho là giúp giảm 550 kilowatt điện tiêu thụ và cắt một nửa tỷ lệ lỗi, đồng thời đưa mức uptime – tức thời gian hệ thống hoạt động liên tục không gián đoạn – lên 99,8%. Với các trung tâm dữ liệu AI, đây là chỉ số đặc biệt quan trọng vì chỉ một mắt xích mạng gặp sự cố cũng có thể làm chậm hoặc gián đoạn toàn bộ quá trình huấn luyện.

Ascend 960PR: biến thể mới tối ưu cho suy luận mô hình ngôn ngữ lớn

Bên cạnh 960DT, Huawei còn chuẩn bị tung ra Ascend 960PR vào quý III/2027. Nếu DT thiên về bộ nhớ và băng thông, thì PR được tối ưu cho sức mạnh tính toán độ chính xác thấp. Tên “PR” được cho là viết tắt của prefill và recommenders. Trong đó, prefill là giai đoạn đầu của suy luận LLM (Large Language Model – mô hình ngôn ngữ lớn), khi hệ thống xử lý toàn bộ câu lệnh đầu vào; còn recommender là các tác vụ gợi ý nội dung, sản phẩm hoặc quảng cáo. Ascend 960PR được cho là đạt tới 8 petaFLOPS FP4, đi kèm 192 GB bộ nhớ HiBL và băng thông 2,4 TB/s.

Kiến trúc dị thể: chia việc giữa 960PR và 960DT để tăng tốc AI

Huawei thiết kế 960PR để hoạt động song song với 960DT trong một kiến trúc dị thể, hay heterogeneous architecture – tức hệ thống dùng nhiều loại chip khác nhau, mỗi loại đảm nhiệm phần việc phù hợp nhất. Cụ thể, 960PR sẽ xử lý prefill, giai đoạn cần rất nhiều năng lực tính toán, còn 960DT phụ trách decode, tức bước sinh ra từng token đầu ra. Token có thể hiểu là đơn vị văn bản nhỏ mà mô hình AI dùng để tạo câu trả lời. Decode thường đòi hỏi bộ nhớ lớn và băng thông cao hơn. Cách phân chia này đã được chứng minh là hiệu quả trên nhiều nền tảng AI tiên tiến, dù Huawei hiện vẫn chưa có bộ tăng tốc giải mã chuyên biệt dùng nhiều SRAM – loại bộ nhớ siêu nhanh thường được ưa chuộng cho các tác vụ độ trễ thấp.

Tham vọng lớn hơn: siêu cụm nửa triệu đến một triệu NPU

Không dừng ở cấp độ chip, Huawei còn vạch ra tham vọng xây dựng các cụm tính toán khổng lồ. Tại Connect, hãng cho biết đã mở rộng thành công superpod TaiShan dựa trên Ascend 950 lên 4.096 bộ tăng tốc. Superpod có thể hiểu là siêu cụm máy chủ AI được tích hợp và tối ưu như một hệ thống thống nhất. Huawei nói rằng với topology mạng Clos hai tầng, bốn mặt phẳng – một kiểu kiến trúc mạng trung tâm dữ liệu giúp tăng băng thông và giảm nghẽn – họ có thể sớm hỗ trợ cụm tới 512.000 NPU. Xa hơn, nếu chuyển sang topology multi-rail, tức dùng nhiều tuyến kết nối song song để tăng thông lượng và độ dự phòng, hãng tin rằng các siêu cụm một triệu NPU là điều khả thi, dù hiện tại đây mới chủ yếu là cấu hình mang tính lý thuyết.

Lộ trình 2028-2029 cho thấy Huawei muốn bám đuổi dài hạn

Huawei cũng hé lộ hai thế hệ Ascend tiếp theo. Dòng Ascend 970 dự kiến xuất hiện vào năm 2028 với hiệu năng tối đa 3,6 petaFLOPS FP8 hoặc 14 petaFLOPS FP4. Điều này cho thấy hãng đang dồn thêm diện tích khuôn chip, hay die area, cho các định dạng tính toán độ chính xác thấp – xu hướng cũng đang được Nvidia và AMD theo đuổi để phục vụ AI tạo sinh. Dung lượng bộ nhớ dự kiến vẫn ở mức 288 GB, nhưng băng thông có thể tăng lên 14,4 TB/s, rất hữu ích cho suy luận AI. Đến năm 2029, Huawei kỳ vọng tiếp tục nhân đôi hiệu năng lên 7,2 petaFLOPS FP8 và 28 petaFLOPS FP4, đồng thời nâng bộ nhớ lên 384 GB và băng thông lên 38,4 TB/s. Dù vậy, trong ngành bán dẫn, lộ trình ba năm luôn có thể thay đổi mạnh theo năng lực sản xuất, nhu cầu thị trường và các biến động địa chính trị.

Cơ hội thật sự của Huawei nằm ở khoảng trống mà lệnh hạn chế để lại

Điểm đáng chú ý nhất trong câu chuyện Ascend 960 không chỉ là thông số kỹ thuật, mà là bối cảnh thị trường. Khi các GPU AI cao cấp từ Mỹ bị hạn chế tiếp cận Trung Quốc, các công ty nội địa buộc phải tìm kiếm lựa chọn thay thế. Trước đây, một số nhà phát triển mô hình như DeepSeek được cho là từng gặp khó khăn khi dùng NPU đời cũ của Huawei để huấn luyện và phải quay lại với GPU Nvidia. Nếu Ascend 960DT và 960PR thực sự cải thiện được hiệu năng, độ ổn định và khả năng mở rộng như Huawei tuyên bố, hãng có thể không cần vượt Nvidia trên toàn cầu mà vẫn trở thành nhà cung cấp chiến lược quan trọng nhất cho hệ sinh thái AI Trung Quốc.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT