d-Matrix bắt tay Nvidia, đưa NVLink Fusion và thiết kế rack MGX vào nền tảng suy luận AI thế hệ mới View Larger Image d-Matrix gia nhập làn sóng đối tác tin vào hệ sinh thái kết nối của NvidiaStartup hạ tầng AI d-Matrix vừa công bố sẽ tích hợp NVLink Fusion của Nvidia vào các dòng chip tương lai, trong đó có bộ tăng tốc Raptor sắp ra mắt. NVLink Fusion là công nghệ kết nối chip-tới-chip tốc độ cao, cho phép nhiều bộ xử lý hoạt động như một hệ thống thống nhất với độ trễ thấp và băng thông lớn hơn đáng kể so với các chuẩn kết nối thông thường. Cùng với đó, d-Matrix cũng áp dụng thiết kế rack tham chiếu MGX của Nvidia — một bộ khung phần cứng chuẩn hóa giúp các hãng triển khai máy chủ AI nhanh hơn, dễ mở rộng hơn và tương thích tốt với hạ tầng Nvidia sẵn có. Động thái này đưa d-Matrix vào nhóm các công ty như Qualcomm, Arm, Marvell, Amazon, Fujitsu và MediaTek đang chọn đi theo quỹ đạo công nghệ do Nvidia dẫn dắt. Mục tiêu: mở rộng cụm suy luận AI mà không phải tự giải bài toán hạ tầng quá phức tạpViệc chấp nhận NVLink giúp d-Matrix tránh được một trong những thách thức lớn nhất của thiết kế chip AI: mở rộng kiến trúc lên các cụm tính toán lớn mà vẫn duy trì hiệu năng ổn định. Thay vì phải tự xây dựng toàn bộ mạng kết nối nội bộ giữa các chip, hãng có thể dựa vào NVLink và vải chuyển mạch NVSwitch của Nvidia. NVSwitch là lớp chuyển mạch chuyên dụng giúp nhiều chip giao tiếp theo mô hình all-to-all, tức mọi bộ xử lý đều có thể trao đổi dữ liệu trực tiếp với nhau ở tốc độ cao. Nhờ đó, khách hàng của d-Matrix có thể triển khai hệ thống trên cùng loại rack và cấu trúc mạng quen thuộc vốn đã dùng cho nền tảng Nvidia, giảm độ phức tạp khi đưa vào trung tâm dữ liệu. Hệ thống NVL144 của d-Matrix hứa hẹn quy mô lớn với 144 bộ tăng tốc RaptorTheo kế hoạch, đến cuối năm sau d-Matrix sẽ cung cấp các hệ thống chứa tối đa 144 bộ tăng tốc Raptor, tất cả được nối trong một fabric NVLink duy nhất. Trong ngữ cảnh hạ tầng AI, fabric là lớp kết nối tốc độ cao liên kết nhiều chip hoặc nhiều máy chủ thành một không gian tính toán chung. Tại hội nghị Hot Chips gần đây, công ty cho biết mỗi card Raptor sẽ có 32 GB DRAM xếp chồng 3D. DRAM 3D-stacked là loại bộ nhớ được xếp nhiều lớp theo chiều dọc để tăng mật độ và rút ngắn khoảng cách truyền dữ liệu, từ đó nâng mạnh băng thông. d-Matrix nói cấu hình này có thể đạt 100 TB/giây băng thông bộ nhớ, tức lượng dữ liệu mà bộ nhớ có thể cấp cho bộ xử lý trong một giây, cao hơn khoảng 4,5 lần so với GPU Rubin của Nvidia. Phiên bản XPU trong rack có thể nhỏ hơn, nhưng vẫn sở hữu thông số rất đáng gờmCác chi tiết ban đầu cho thấy bộ xử lý dùng trong rack NVL144 có thể là một biến thể nhỏ hơn của card Raptor từng được giới thiệu. Mỗi XPU — thuật ngữ chỉ bộ xử lý tăng tốc tổng quát, có thể bao trùm GPU, NPU hoặc các kiến trúc chuyên dụng khác — được cho là có khoảng 16 GB bộ nhớ 3D-DRAM và đạt khoảng 50 TB/giây băng thông bộ nhớ. Dù thấp hơn bản card đầy đủ, con số này vẫn rất cao theo tiêu chuẩn hiện nay. Với 144 XPU trong một rack, hệ thống có thể đạt tổng dung lượng bộ nhớ khoảng 2,3 TB, đủ để phục vụ các mô hình AI vượt mốc 4 nghìn tỷ tham số nếu chạy ở độ chính xác 4-bit. Độ chính xác 4-bit là kỹ thuật nén biểu diễn số học để giảm dung lượng bộ nhớ và tăng tốc suy luận, đổi lại cần phần mềm và phần cứng được tối ưu tốt để giữ chất lượng mô hình. Điểm khác biệt của d-Matrix nằm ở triết lý tính toán trong bộ nhớd-Matrix đang theo đuổi hướng tiếp cận gọi là in-memory compute, hay tính toán trong bộ nhớ. Thay vì đặt logic xử lý tách biệt hoàn toàn khỏi bộ nhớ như thiết kế truyền thống, hãng gắn lớp logic tính toán lên trên chồng DRAM. Cách làm này tạo ra nền tảng có dung lượng bộ nhớ tương đối tốt nhưng vẫn giữ băng thông ở mức gần với SRAM — loại bộ nhớ cực nhanh thường dùng làm bộ đệm, nhưng rất đắt và tốn diện tích silicon. So với HBM, tức High Bandwidth Memory, một chuẩn bộ nhớ băng thông cao phổ biến trên GPU AI cao cấp, hướng tiếp cận của d-Matrix nhắm tới sự cân bằng tốt hơn giữa dung lượng và tốc độ truy cập dữ liệu. Băng thông bộ nhớ đang là nút thắt của suy luận AITrong suy luận AI, đặc biệt ở giai đoạn sinh token liên tục cho mô hình ngôn ngữ lớn, băng thông bộ nhớ thường là giới hạn quan trọng nhất. Token là đơn vị dữ liệu văn bản nhỏ mà mô hình tạo ra từng bước để hình thành câu trả lời hoàn chỉnh. Nếu bộ nhớ không thể cấp dữ liệu đủ nhanh, bộ xử lý sẽ phải chờ, kéo theo độ trễ tăng và thông lượng giảm. Đây cũng là lý do các hãng chip ngày càng đầu tư mạnh vào kiến trúc ưu tiên dòng dữ liệu. Bài toán không chỉ là có bao nhiêu năng lực tính toán, mà còn là dữ liệu có thể được đưa tới khối tính toán nhanh đến mức nào. Raptor được định vị như lựa chọn tiết kiệm chip hơn so với các kiến trúc thiên về SRAMBài toán này từng khiến nhiều công ty theo đuổi các thiết kế cực đoan dựa nhiều vào SRAM. SRAM là bộ nhớ siêu nhanh, nhưng nhược điểm là chiếm diện tích lớn và khó mở rộng dung lượng. Theo các số liệu được nhắc lại trong ngành, kiến trúc của Groq có thể đạt tới 150 TB/giây trên mỗi chip, nhưng chỉ chứa được khoảng 500 MB SRAM trên một die. Die là phần khuôn silicon thực tế chứa mạch xử lý. d-Matrix cho rằng Raptor có thể mang lại một phần đáng kể mức băng thông đó nhưng với dung lượng cao hơn tới 64 lần, nhờ vậy giảm mạnh số lượng chip cần dùng cho mỗi mô hình. Với mô hình cỡ 1 nghìn tỷ tham số, phương án của d-Matrix có thể chỉ cần khoảng 64 chip, hoặc 32 chip nếu chạy ở 4-bit, thay vì hơn 2.000 bộ xử lý trong một số kiến trúc khác ở độ chính xác 8-bit. Phù hợp cho cấu hình tính toán dị thể giữa GPU và chip suy luận chuyên dụngGiống nhiều nền tảng tăng tốc AI hiện đại, chip của d-Matrix không nhất thiết phải hoạt động độc lập. Chúng có thể được đưa vào cấu hình tính toán dị thể, tức hệ thống dùng nhiều loại bộ xử lý khác nhau cho các tác vụ riêng biệt. Trong suy luận mô hình ngôn ngữ, GPU có thể đảm nhiệm giai đoạn prefill — bước xử lý prompt ban đầu với khối lượng tính toán lớn — còn chip Raptor sẽ phụ trách decode, tức giai đoạn sinh token liên tiếp vốn phụ thuộc nặng vào băng thông bộ nhớ. Cách phân vai này cho phép doanh nghiệp tối ưu chi phí và hiệu năng thay vì dùng một loại chip cho mọi công việc. Nvidia không chỉ bán GPU, mà đang bán cả khu vườn khép kín của hạ tầng AIThỏa thuận với d-Matrix cho thấy chiến lược của Nvidia đã vượt xa việc bán GPU đơn lẻ. Ngoài NVLink Fusion, d-Matrix dự kiến còn kết hợp bộ tăng tốc của mình với CPU Vera, thiết bị chuyển mạch NVSwitch, NIC BlueField và ConnectX, cùng dòng mạng Ethernet SpectrumX của Nvidia. NIC, viết tắt của Network Interface Card, là card giao tiếp mạng giúp máy chủ kết nối với hạ tầng truyền dữ liệu tốc độ cao. Điều này đồng nghĩa Nvidia vẫn có thể thu lợi lớn ngay cả khi khách hàng không mua GPU của hãng. Thực tế, nhiều nhà thiết kế chip dường như sẵn sàng chấp nhận mô hình này để tránh phải tự phát triển mạng scale-up và kiến trúc rack riêng — những phần cực kỳ tốn kém và phức tạp trong trung tâm dữ liệu AI. Cuộc chơi cấp phép IP và đầu tư chiến lược của Nvidia đang ngày càng rõ nétViệc ngày càng nhiều công ty như MediaTek, Marvell, Qualcomm, Arm, Fujitsu và AWS tham gia dùng NVLink Fusion cho thấy Nvidia đang biến công nghệ kết nối thành một chuẩn de facto trong AI doanh nghiệp. IP ở đây là intellectual property, tức tài sản trí tuệ thiết kế chip hoặc khối công nghệ được cấp phép sử dụng. Đáng chú ý, Nvidia không ngần ngại chi hàng tỷ USD để lôi kéo đối tác vào hệ sinh thái của mình. Trước đó, hãng đã đầu tư 3,5 tỷ USD vào MediaTek và 2 tỷ USD vào Marvell trong các thỏa thuận liên quan. Chưa rõ d-Matrix có nhận được ưu đãi tài chính tương tự hay không, nhưng xu hướng chung đã rất rõ: Nvidia đang xây dựng một hệ sinh thái hạ tầng AI khép kín, nơi giá trị không chỉ nằm ở con chip, mà còn ở toàn bộ mạng kết nối, thiết kế rack, phần mềm và khả năng triển khai quy mô lớn. Mini PC – Máy Tính Công Nghiệp IPC AI PC – Máy tính AI Intel F1A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details AI PC – Máy tính AI Intel F2A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details Máy All In One cho văn phòng – PC Gaming – INTEL i5 12450H 8 lõi 12 luồng 15.500.000₫ Thêm vào giỏ hàng Details Máy all in one giá rẻ – PC Gaming – INTEL I5 10500H 6 lõi 12 luồng 13.700.000₫ Thêm vào giỏ hàng Details Máy tính AI – AI PC | Intel I9-12900H + Nvidia RTX3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính AI AMD AM18 | Ryzen 7 8845HS + Radeon 780M 14.500.000₫ Thêm vào giỏ hàng Details Máy tính AI PC M1A | Intel I9-13900H + Nvidia RTX-3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính All In One Optori G40 Pro – PC Gaming – INTEL i5 12450H 14.500.000₫ Thêm vào giỏ hàng Details Màn hình cảm ứng HMI – Panel PC Giải pháp HMI Panel PC chống cháy nổ cho nhà máy sản xuất hiện đại | HazardView HV-17EX-T Details Khi nào cần dùng Panel PC chống cháy nổ thay cho Panel PC công nghiệp thông thường? | HazardView HV-17EX Details Màn hình cảm ứng HMI – Touch Panel PC BE-PX09 15.6 Inch 19.950.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp – Fanless Mini PC Công Nghiệp B8000 10.900.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp màn hình cảm ứng – Touch Panel HMI QY-P8156 15.6 Inch Details So sánh máy tính công nghiệp chống cháy nổ và máy tính công nghiệp tiêu chuẩn | HazardView HV-238EX Details Xu hướng ứng dụng màn hình HMI chống cháy nổ trong nhà máy thông minh | HazardView HV-19EX-R Details Danh mục máy quét mã vạchDÒNG MÁY CÓ DÂYDÒNG MÁY KHÔNG DÂYDÒNG MÁY KIỂM KHO PDADÒNG MÁY FITMOUNT admin2026-09-10T21:17:21+07:00 Related Posts Chính phủ Anh từng bác đề xuất buộc NATS bồi hoàn cho hãng bay trước khi sự cố CNTT khiến 2.000 chuyến bị hủy Chính phủ Anh từng bác đề xuất buộc NATS bồi hoàn cho hãng bay trước khi sự cố CNTT khiến 2.000 chuyến bị hủy Tháng 9 10th, 2026 Framework hoàn tiền cho khách mua laptop vì giá RAM hạ nhiệt sau cú sốc tăng gấp đôi Framework hoàn tiền cho khách mua laptop vì giá RAM hạ nhiệt sau cú sốc tăng gấp đôi Tháng 9 10th, 2026 Apple ra mắt iPhone Duo giá 2.000 USD: điện thoại gập kiểu mới hay canh bạc tiếp theo của Táo khuyết? Apple ra mắt iPhone Duo giá 2.000 USD: điện thoại gập kiểu mới hay canh bạc tiếp theo của Táo khuyết? Tháng 9 10th, 2026 OpenAI bắt tay Samsung để gia cố chuỗi cung ứng chip AI, giảm phụ thuộc vào TSMC và nguồn HBM khan hiếm OpenAI bắt tay Samsung để gia cố chuỗi cung ứng chip AI, giảm phụ thuộc vào TSMC và nguồn HBM khan hiếm Tháng 9 10th, 2026 Google rót ít nhất 13 tỷ euro vào Phần Lan, ký thỏa thuận điện hạt nhân 22 năm để mở rộng hạ tầng số Google rót ít nhất 13 tỷ euro vào Phần Lan, ký thỏa thuận điện hạt nhân 22 năm để mở rộng hạ tầng số Tháng 9 10th, 2026