Liên minh mới nhắm thẳng vào bài toán suy luận AI

AMD vừa công bố hợp tác với Cerebras Systems nhằm xây dựng một nền tảng tính toán “disaggregated compute” — tức mô hình tách rời các khối xử lý để mỗi loại phần cứng đảm nhận phần việc phù hợp nhất. Trong cấu hình này, GPU Instinct của AMD sẽ xử lý các tác vụ tính toán nặng, còn bộ tăng tốc AI của Cerebras sẽ gánh phần tạo token cần băng thông bộ nhớ cực cao. Mục tiêu là giảm độ trễ xuống mức rất thấp cho các ứng dụng AI dạng tác tử, hay còn gọi là “agentic workloads” — những hệ thống AI có thể tự lập kế hoạch, gọi công cụ và phản hồi theo nhiều bước thay vì chỉ trả lời một câu lệnh đơn lẻ.

Vì sao GPU mạnh nhưng chưa đủ cho suy luận

GPU từ lâu đã là lựa chọn hàng đầu cho huấn luyện mô hình AI nhờ khả năng xử lý song song cực lớn. Tuy nhiên, ở giai đoạn suy luận, tức lúc mô hình đã được triển khai để tạo phản hồi thực tế cho người dùng, bài toán lại nghiêng nhiều về tốc độ truy cập bộ nhớ và khả năng xuất token liên tục. “Token” có thể hiểu là các đơn vị văn bản nhỏ mà mô hình sinh ra từng bước, ví dụ một từ, một phần của từ hoặc ký tự. Nếu tốc độ tạo token thấp, trải nghiệm chatbot hay trợ lý AI sẽ bị chậm, thiếu tự nhiên. Đây chính là khoảng trống mà AMD muốn lấp bằng cách kết hợp GPU với kiến trúc bộ nhớ siêu nhanh của Cerebras.

Cerebras mang gì đến bàn đàm phán

Điểm nổi bật của Cerebras nằm ở Wafer Scale Engine, viết tắt là WSE — một loại chip AI khổng lồ được chế tạo trên quy mô gần như cả tấm wafer bán dẫn thay vì cắt nhỏ thành nhiều chip riêng lẻ như thông thường. Thiết kế này cho phép tích hợp lượng lớn SRAM ngay trên chip. SRAM là một loại bộ nhớ rất nhanh, thường đắt hơn nhưng có độ trễ thấp hơn đáng kể so với các công nghệ bộ nhớ khác. Nhờ đó, Cerebras không phụ thuộc vào HBM4, tức bộ nhớ băng thông cao thế hệ mới thường dùng trong các hệ thống AI cao cấp, mà vẫn đạt tốc độ suy luận rất mạnh. Theo thông tin được chia sẻ, nền tảng của hãng có thể vượt mốc 2.000 token mỗi giây trong nhiều tác vụ.

Cách AMD và Cerebras phân chia công việc

Theo mô hình hợp tác mới, các bước xử lý prompt nặng về tính toán sẽ chạy trên GPU Instinct của AMD. “Prompt processing” có thể hiểu là giai đoạn mô hình đọc, phân tích và thiết lập ngữ cảnh từ yêu cầu đầu vào. Sau đó, quá trình sinh token — vốn tiêu tốn nhiều băng thông bộ nhớ — sẽ được chuyển sang bộ tăng tốc WSE của Cerebras. Cách chia việc này nhằm tối ưu cả hiệu năng lẫn chi phí điện năng. Hai công ty chưa công bố số liệu chi tiết, nhưng cho biết hiệu quả tính theo số token tạo ra trên mỗi watt điện có thể tăng tới 5 lần.

Đòn đáp trả gián tiếp với Nvidia và Groq

Thỏa thuận mới cũng được xem là động thái cạnh tranh trực diện với hệ sinh thái AI của Nvidia. Trước đó, Nvidia đã chi khoảng 20 tỷ USD để thâu tóm đội ngũ Groq, qua đó bổ sung công nghệ LPU, viết tắt của Language Processing Unit — bộ xử lý chuyên biệt cho các tác vụ ngôn ngữ. Về vai trò, bộ tăng tốc của Cerebras đang nhắm tới cùng một lớp bài toán mà Groq 3 LPU hướng đến: tăng tốc suy luận với độ trễ thấp. Tuy nhiên, Cerebras cho rằng cách tiếp cận của họ hiệu quả hơn về mật độ bộ nhớ tốc độ cao, đặc biệt khi phục vụ các mô hình cực lớn.

Lợi thế khi chạy mô hình nghìn tỷ tham số

Một chi tiết đáng chú ý là với các mô hình cỡ nghìn tỷ tham số — “tham số” là các giá trị số nội bộ quyết định cách mô hình học và phản hồi — nhu cầu bộ nhớ tăng vọt. Bài viết dẫn ví dụ một mô hình như Kimi K2.5 có thể đòi hỏi tới khoảng 2.000 LPU Groq phía Nvidia để cung cấp đủ SRAM phục vụ suy luận. Trong khi đó, liên minh AMD-Cerebras cho rằng họ chỉ cần vài chục bộ tăng tốc để xử lý lớp công việc tương tự. Nếu con số này được chứng minh trong triển khai thực tế, đây sẽ là lợi thế rất lớn về mật độ hạ tầng, điện năng và chi phí vận hành trung tâm dữ liệu.

Helios và chiến lược hệ sinh thái mở của AMD

AMD cho biết giải pháp kết hợp này sẽ hoạt động cùng hệ thống rack Helios của hãng. “Rack” là tủ máy chủ tiêu chuẩn trong trung tâm dữ liệu, nơi các cụm phần cứng được lắp ghép thành một hệ thống hoàn chỉnh. Helios được AMD định vị như nền tảng hạ tầng AI có thể cạnh tranh với các hệ rack tích hợp của Nvidia. CEO Lisa Su cũng nhấn mạnh chiến lược “hệ sinh thái mở”, nghĩa là AMD không tự giới hạn vào một kiến trúc duy nhất mà sẵn sàng hợp tác với nhiều công ty sở hữu công nghệ tăng tốc chuyên dụng cho từng loại khối lượng công việc.

Xu hướng mới: phân rã khối lượng công việc AI

Thông điệp quan trọng hơn cả từ thương vụ này là xu hướng “workload disaggregation”, tức phân rã khối lượng công việc để giao cho đúng phần cứng chuyên trách. Thay vì ép một loại chip làm tất cả, ngành AI đang tiến dần tới mô hình kết hợp nhiều bộ xử lý: GPU cho tính toán song song, bộ tăng tốc SRAM cho sinh token, và có thể thêm các lớp bộ nhớ hoặc mạng tốc độ cao cho từng nhu cầu riêng. Đây là cách các nhà cung cấp cố gắng phá thế thống trị của Nvidia bằng kiến trúc linh hoạt hơn, nhất là khi chi phí triển khai AI quy mô lớn ngày càng cao.

Khi nào thị trường có thể tiếp cận

Theo kế hoạch, giải pháp chung của AMD và Cerebras sẽ xuất hiện trên Cerebras Cloud vào cuối năm nay. “Cloud” ở đây là dịch vụ điện toán đám mây, cho phép doanh nghiệp thuê năng lực xử lý AI từ xa thay vì phải tự mua và vận hành toàn bộ phần cứng. Dù chưa rõ mức giá hay cấu hình thương mại cụ thể, màn bắt tay này cho thấy thị trường hạ tầng AI đang bước sang giai đoạn mới: không chỉ chạy đua về số lượng GPU, mà còn cạnh tranh bằng cách phối hợp nhiều kiến trúc chip để tối ưu suy luận, độ trễ và hiệu suất năng lượng.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT