Meta chọn con đường khác khi tự phát triển chip AI

Trong khi nhiều công ty công nghệ thường bắt đầu chip AI tự thiết kế từ mảng suy luận, hay còn gọi là inference — giai đoạn mô hình đã được huấn luyện xong và chỉ cần tạo câu trả lời hoặc dự đoán — Meta lại đi theo hướng táo bạo hơn. Bộ xử lý mới mang tên MTIA 400, viết tắt của Meta Training and Inference Accelerator, được thiết kế chủ yếu cho việc huấn luyện các mô hình ngôn ngữ lớn, tức LLM (Large Language Model), nhưng đồng thời vẫn đảm nhận một nhiệm vụ rất thực dụng: vận hành hệ thống gợi ý quảng cáo, nguồn doanh thu cốt lõi của tập đoàn mẹ Facebook.

Một con chip, hai khối lượng công việc hoàn toàn khác nhau

Điểm đặc biệt của MTIA 400 nằm ở chỗ nó phải phục vụ hai kiểu tác vụ có nhu cầu phần cứng gần như trái ngược. Huấn luyện LLM là công việc ngốn năng lực tính toán khổng lồ, thường cần hàng chục nghìn đến hàng trăm nghìn bộ tăng tốc AI hoạt động song song để rút ngắn thời gian đào tạo mô hình. Ngược lại, hệ thống quảng cáo của Meta dựa nhiều vào DLRM, viết tắt của Deep Learning Recommender Model — mô hình học sâu chuyên dùng để đề xuất nội dung hoặc quảng cáo phù hợp. DLRM lại thiên về băng thông bộ nhớ hơn là sức mạnh tính toán thuần túy, nghĩa là chip phải đọc và xử lý lượng dữ liệu lớn từ bộ nhớ rất nhanh. Vì vậy, việc kết hợp huấn luyện AI tạo sinh và suy luận cho hệ gợi ý quảng cáo trên cùng một chip là lựa chọn khá hiếm thấy.

MTIA 400 được xây dựng theo kiến trúc đa khuôn dị thể

Về mặt kỹ thuật, MTIA 400 sử dụng kiến trúc heterogeneous multi-die, tức kiến trúc đa khuôn dị thể. Hiểu đơn giản, thay vì tạo toàn bộ chip trên một đế silicon khổng lồ, Meta chia nó thành nhiều khuôn chip nhỏ hơn, mỗi phần đảm nhiệm một vai trò riêng. Gói chip này gồm hai khuôn tính toán, hai khuôn vào/ra I/O và một khuôn SoC. SoC, hay System-on-Chip, là thành phần điều phối kết nối với máy chủ và phân bổ công việc. Cách tiếp cận này ngày càng phổ biến trong ngành bán dẫn vì giúp tăng hiệu suất, cải thiện tỷ lệ sản xuất thành công và dễ mở rộng thiết kế hơn so với chip nguyên khối truyền thống.

Dấu ấn Broadcom và tiến trình 3nm

Thiết kế của MTIA 400 được cho là chịu ảnh hưởng rõ rệt từ công nghệ XPU của Broadcom. XPU là khái niệm chỉ các bộ xử lý chuyên dụng tăng tốc cho từng loại tác vụ, thay vì cố gắng làm mọi thứ như CPU hay GPU đa dụng. Bên trong MTIA 400, các chiplet tính toán — chiplet là các mảnh chip chức năng nhỏ ghép lại thành một bộ xử lý lớn — được sản xuất trên tiến trình 3nm, nhiều khả năng bởi TSMC. Mỗi khuôn tính toán có lưới 6×8 phần tử xử lý, và tổng cộng hai khuôn cho khả năng đạt 12 petaFLOPS ở định dạng MXFP4 tại xung nhịp 1,7 GHz. PetaFLOPS là đơn vị đo hiệu năng tính toán, tương đương hàng triệu tỷ phép tính dấu chấm động mỗi giây; còn MXFP4 là định dạng số độ chính xác thấp, phù hợp để tăng tốc các tác vụ AI hiện đại.

Nhanh hơn Blackwell ở một số điểm, nhưng chưa thể thay thế Nvidia hay AMD

Theo các thông số được Meta công bố, MTIA 400 có thể nhanh hơn khoảng 20% so với dòng Blackwell cao cấp của Nvidia ở một số mức độ chính xác thường dùng trong huấn luyện mô hình, trong khi tiêu thụ điện năng ở mức tương đương. Tuy nhiên, lợi thế này không kéo dài khi so với thế hệ mới hơn. Bộ tăng tốc của Meta vẫn chậm hơn khoảng 3 đến 3,3 lần so với Rubin của Nvidia và Instinct MI455X của AMD. Điều đó cho thấy MTIA 400 là bước tiến đáng kể trong nỗ lực tự chủ phần cứng của Meta, nhưng hiện tại vẫn chưa đủ để thay thế hoàn toàn GPU thương mại cao cấp vốn đang thống trị việc huấn luyện và suy luận AI quy mô lớn.

Bộ nhớ HBM3e là điểm mạnh, nhưng vẫn chưa đủ cho suy luận LLM tối ưu

MTIA 400 được trang bị tám chồng bộ nhớ HBM3e dung lượng 36 GB mỗi chồng, cho tổng dung lượng 288 GB và băng thông khoảng 9,2 TB/s. HBM, hay High Bandwidth Memory, là bộ nhớ băng thông cao được xếp chồng theo chiều dọc để tăng tốc độ truyền dữ liệu giữa bộ nhớ và bộ xử lý. HBM3e là một trong những chuẩn bộ nhớ nhanh nhất hiện nay cho AI. Dù vậy, con số 9,2 TB/s vẫn thấp hơn nhiều so với các GPU AI thế hệ mới nhất của Nvidia và AMD. Đây có thể là lý do Meta định vị MTIA 400 như một chip thiên về huấn luyện hơn là tối ưu cho suy luận LLM, bởi các mô hình ngôn ngữ lớn thường rất nhạy với băng thông bộ nhớ khi phục vụ người dùng theo thời gian thực.

Kết nối tốc độ cao để mở rộng theo cụm

Ngoài năng lực tính toán, MTIA 400 còn có hai chiplet I/O cung cấp băng thông giao tiếp chip-to-chip lên tới 1,2 TB/s thông qua RDMA. RDMA, viết tắt của Remote Direct Memory Access, là công nghệ cho phép truyền dữ liệu trực tiếp giữa bộ nhớ của các máy hoặc thiết bị mà không cần CPU can thiệp nhiều, từ đó giảm độ trễ và tăng hiệu quả cho các cụm AI lớn. Meta chưa công bố rõ công nghệ truyền dẫn nền tảng, nhưng với sự hiện diện của Broadcom, Ethernet tốc độ cao được xem là ứng viên hợp lý.

Thiết kế rack gợi nhớ Nvidia NVL72 và AMD Helios

Ở cấp độ hệ thống, MTIA 400 cũng đi theo xu hướng tương tự các siêu rack AI hiện đại. Mỗi compute blade — có thể hiểu là một phiến máy chủ tính toán trong rack — chứa bốn bộ tăng tốc MTIA 400, kết nối qua switch PCIe với một CPU x86 và một NIC scale-out. PCIe là chuẩn kết nối tốc độ cao giữa các linh kiện trong máy chủ, còn NIC là card mạng giúp các node giao tiếp với nhau trong cụm. Một rack hoàn chỉnh có 18 compute blade và 8 switch blade, tổng cộng 72 bộ tăng tốc trong một miền tính toán thống nhất. Cách bố trí này khiến nhiều người liên tưởng ngay đến NVL72 của Nvidia hoặc các hệ thống Helios của AMD.

Meta hướng tới cụm hàng nghìn bộ tăng tốc

Meta chưa tiết lộ quy mô tối đa mà MTIA 400 có thể mở rộng, nhưng tài liệu của hãng cho biết hệ thống được thiết kế để scale tới nhiều nghìn bộ tăng tốc. Trong ngữ cảnh AI, scale nghĩa là khả năng mở rộng từ một máy đơn lẻ lên cả cụm khổng lồ mà vẫn duy trì hiệu quả huấn luyện. Chỉ riêng ở cấp rack, MTIA 400 đã được xem là đủ sức cạnh tranh trong các tác vụ huấn luyện với những hệ thống dựa trên GB200 hoặc GB300 của Nvidia. Tuy nhiên, lợi thế thực tế còn phụ thuộc vào phần mềm, trình biên dịch, thư viện tối ưu và khả năng khai thác cụm ở quy mô lớn — những yếu tố mà Nvidia hiện vẫn dẫn trước nhờ hệ sinh thái CUDA lâu năm.

MTIA 450 và MTIA 500 đã lộ diện trên lộ trình tiếp theo

Meta không dừng lại ở MTIA 400. Công ty đã hé lộ MTIA 450, phiên bản tối ưu cho suy luận, dự kiến tăng gấp đôi băng thông bộ nhớ, nhiều khả năng bằng cách chuyển từ HBM3e sang HBM4. HBM4 là thế hệ bộ nhớ băng thông cao tiếp theo, hứa hẹn tốc độ truyền dữ liệu vượt trội cho các mô hình AI lớn. Xa hơn, MTIA 500 dự kiến ra mắt trong năm 2027 sẽ tiếp tục tăng thêm 50% băng thông bộ nhớ và gấp đôi số chiplet tính toán. Nếu đúng như lộ trình này, Meta đang từng bước xây dựng một dòng chip AI nội bộ đủ sức phục vụ cả huấn luyện lẫn suy luận ở quy mô trung tâm dữ liệu.

Tham vọng tự chủ AI của Meta ngày càng rõ ràng

Điều MTIA 400 cho thấy không chỉ là một con chip mới, mà là chiến lược dài hạn của Meta trong việc giảm phụ thuộc vào Nvidia và AMD ở mảng hạ tầng AI. Dù hiện tại chip nội bộ của công ty chưa thể thay thế hoàn toàn GPU hàng đầu trên thị trường, việc Meta dám thiết kế một bộ tăng tốc “hai tính cách” — vừa huấn luyện mô hình ngôn ngữ lớn, vừa phục vụ hệ thống quảng cáo dựa trên AI — cho thấy hãng đang tìm cách tối ưu chi phí tính toán theo nhu cầu riêng. Trong bối cảnh chi tiêu cho AI ngày càng tăng và cuộc đua xây dựng siêu trí tuệ nhân tạo nóng lên, đây có thể là một bước đi chiến lược quan trọng hơn nhiều so với những gì các bảng thông số ban đầu thể hiện.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT