AMD đưa Instinct lên bàn làm việc của giới nghiên cứu AI

AMD vừa giới thiệu Threadripper Halo tại IFA 2026, một mẫu workstation AI cục bộ (local AI workstation, tức hệ thống chạy mô hình ngay tại chỗ thay vì phụ thuộc hoàn toàn vào đám mây) được thiết kế cho các nhà nghiên cứu có ngân sách rất lớn. Đây cũng là lần đầu tiên các bộ tăng tốc Instinct của AMD xuất hiện trong dạng máy trạm, thay vì chỉ hiện diện trong máy chủ hay cụm tính toán trung tâm dữ liệu.

Cấu hình khủng: CPU 96 nhân, RAM tới 2 TB và bộ nhớ hợp nhất 2,6 TB

Trái tim của hệ thống là vi xử lý Threadripper PRO 9995WX 96 nhân, đi kèm tối đa 2 TB DDR5. DDR5 là chuẩn bộ nhớ hệ thống thế hệ mới, có tốc độ cao hơn DDR4 và phù hợp cho các khối lượng công việc nặng. AMD cho biết tổng dung lượng bộ nhớ của toàn hệ thống có thể đạt 2,6 TB khi cộng cả RAM và bộ nhớ trên GPU, mở ra khả năng xử lý các mô hình AI cực lớn ngay trên máy cá nhân chuyên dụng.

Tối đa 4 GPU Instinct MI350P, nhưng máy trưng bày mới chỉ gắn 2 card

Theo AMD, Threadripper Halo có thể được trang bị tối đa 4 GPU Instinct MI350P giao tiếp qua PCIe. PCIe là chuẩn kết nối tốc độ cao giữa CPU và các linh kiện mở rộng như card đồ họa hay SSD. Tuy nhiên, các hệ thống được AMD mang tới IFA chỉ cho thấy cấu hình 2 GPU, một chi tiết cho thấy bài toán điện năng và tản nhiệt có thể là rào cản thực tế với bản đầy đủ 4 card.

MI350P là gì và vì sao HBM3e lại quan trọng?

MI350P, ra mắt từ tháng 5, về bản chất là biến thể dạng PCIe của dòng tăng tốc MI350X. Mỗi card sở hữu 144 GB HBM3e, một loại bộ nhớ băng thông cao thế hệ mới được xếp chồng 3D để đạt tốc độ truyền dữ liệu vượt trội so với VRAM truyền thống. Trên mỗi MI350P, HBM3e cung cấp băng thông bộ nhớ lên tới 4 TB/s. Băng thông bộ nhớ là tốc độ dữ liệu có thể di chuyển giữa bộ nhớ và bộ xử lý; với AI, đây là yếu tố then chốt vì mô hình ngôn ngữ lớn thường bị giới hạn bởi tốc độ truy xuất dữ liệu hơn là chỉ bởi sức mạnh tính toán thuần túy.

Hiệu năng AI hướng tới mô hình hàng nghìn tỷ tham số

Mỗi MI350P còn được AMD công bố đạt tối đa 4,6 petaFLOPS ở FP4. PetaFLOPS là đơn vị đo hiệu năng tính toán, tương đương hàng triệu tỷ phép tính dấu chấm động mỗi giây. FP4 là định dạng số thực 4-bit, thường được dùng trong suy luận AI để giảm dung lượng mô hình và tăng tốc độ xử lý. Khi lắp đủ 4 GPU, Threadripper Halo có thể đạt 576 GB HBM3e và tổng băng thông bộ nhớ 16 TB/s, đủ để chạy hoàn toàn trong bộ nhớ GPU các mô hình vượt mốc 1 nghìn tỷ tham số ở độ chính xác 4-bit.

Không chỉ chạy trong VRAM, hệ thống còn có thể mở rộng sang RAM để gánh mô hình lớn hơn

AMD cho rằng nếu chuyển một phần mô hình sang bộ nhớ hệ thống, Threadripper Halo có thể xử lý cả những mô hình mã nguồn mở hoặc open weights rất lớn như Kimi K3 của Moonshot.AI với 2,8 nghìn tỷ tham số. Open weights nghĩa là nhà phát triển công bố trọng số đã huấn luyện của mô hình, cho phép người dùng tải về để chạy hoặc tinh chỉnh cục bộ. Điều này đặc biệt hấp dẫn với giới nghiên cứu cần kiểm soát dữ liệu, độ trễ thấp và không muốn gửi khối lượng công việc nhạy cảm lên đám mây.

Bài toán điện năng: mạnh đến mức ổ cắm thông thường có thể không đủ

Điểm đánh đổi lớn nhất của Threadripper Halo là điện năng tiêu thụ. MI350P có cấu hình công suất tối đa 600 W, dù nhiều khả năng AMD sẽ vận hành card trong hệ thống này ở mức 450 W để thực tế hơn. Dù vậy, một cấu hình 4 GPU vẫn có thể đẩy mức tiêu thụ điện lên ngưỡng rất cao, đủ để gây áp lực lên ổ điện dân dụng tiêu chuẩn tại Bắc Mỹ. Điều đó đồng nghĩa một số khách hàng có thể phải nâng cấp đường điện hoặc dùng mạch 20 amp nếu muốn khai thác cấu hình tối đa.

Giá dự kiến từ 100.000 đến 150.000 USD, nhắm thẳng phân khúc siêu cao cấp

AMD chưa công bố giá chính thức, nhưng giới quan sát ước tính hệ thống sẽ nằm trong khoảng 100.000 đến 150.000 USD tùy cấu hình. Đây rõ ràng không phải sản phẩm dành cho người dùng phổ thông hay doanh nghiệp nhỏ, mà hướng đến các phòng thí nghiệm, tổ chức nghiên cứu và nhóm phát triển AI cần một nền tảng on-prem. On-prem, hay on-premises, là mô hình triển khai hạ tầng ngay trong nội bộ tổ chức thay vì thuê dịch vụ từ nhà cung cấp đám mây.

Đối đầu Nvidia DGX Station bằng lợi thế bộ nhớ

Threadripper Halo được định vị như đối thủ trực tiếp của Nvidia DGX Station, mẫu workstation AI cao cấp công bố tại GTC 2025. DGX Station dùng GPU B300 252 GB, CPU Grace 72 nhân và 496 GB LPDDR5x. LPDDR5x là biến thể bộ nhớ tiết kiệm điện nhưng vẫn có băng thông cao, thường thấy trong các hệ thống tối ưu điện năng. Theo AMD, hệ thống mới của hãng có thể cung cấp tổng dung lượng bộ nhớ lớn hơn tới 3,4 lần và băng thông bộ nhớ gấp hơn 2 lần so với DGX Station, qua đó tạo lợi thế trong suy luận LLM.

LLM inference là gì và đâu là giới hạn thực tế?

LLM inference là quá trình chạy mô hình ngôn ngữ lớn để tạo ra đầu ra, chẳng hạn trả lời câu hỏi, tóm tắt văn bản hay sinh mã. Đây khác với huấn luyện, vốn đòi hỏi tài nguyên lớn hơn nhiều. Dù thông số bộ nhớ của AMD rất ấn tượng, hiệu quả thực tế còn phụ thuộc vào cách mô hình được chia tải giữa nhiều GPU. Một kỹ thuật phổ biến là tensor parallelism, tức chia các phép toán ma trận lớn của mô hình ra nhiều GPU cùng xử lý. Nếu dữ liệu trao đổi giữa các GPU hoặc giữa GPU và CPU bị nghẽn qua bus PCIe, lợi thế phần cứng có thể không được khai thác trọn vẹn.

Thời điểm bán ra và ý nghĩa với thị trường AI cục bộ

AMD cho biết Threadripper Halo sẽ lên kệ vào năm sau. Sự xuất hiện của mẫu máy này cho thấy thị trường AI cục bộ đang bước sang giai đoạn mới: thay vì chỉ dựa vào máy chủ đám mây, các tổ chức sẵn sàng chi mạnh để đặt ngay trên bàn làm việc một hệ thống đủ sức chạy các mô hình frontier-class, tức nhóm mô hình tiên tiến nhất ở tuyến đầu công nghệ. Nếu AMD thực sự giao được hiệu năng như hứa hẹn, Threadripper Halo có thể trở thành lựa chọn đáng chú ý cho những ai muốn kiểm soát hoàn toàn hạ tầng AI của mình.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT