OpenAI tiến thêm một bước vào cuộc đua phần cứng AI

Tại hội nghị bán dẫn Hot Chips diễn ra ở Stanford, OpenAI đã công bố cái nhìn chi tiết nhất từ trước đến nay về Jalapeño, bộ tăng tốc AI tùy biến mới được phát triển cùng Broadcom. Đây là dòng chip “custom silicon” đầu tiên của OpenAI — tức chip được thiết kế riêng cho nhu cầu nội bộ thay vì dùng phần cứng đại trà — và được hãng mô tả là sản phẩm “AI thiết kế cho AI”, vì chính các mô hình trí tuệ nhân tạo cũng tham gia vào quá trình tối ưu kiến trúc chip. Theo OpenAI, Jalapeño sẽ bắt đầu được triển khai hạn chế vào cuối năm nay trước khi bước vào sản xuất quy mô lớn trong năm 2027.

Không thay thế GPU, nhưng nhắm thẳng vào bài toán suy luận

Điểm quan trọng là Jalapeño không nhằm thay thế hoàn toàn GPU của Nvidia hay AMD. GPU, viết tắt của Graphics Processing Unit, vốn là bộ xử lý đồ họa nhưng nay được dùng rộng rãi cho AI nhờ khả năng lập trình linh hoạt và xử lý song song mạnh. OpenAI vẫn cần GPU cho giai đoạn huấn luyện mô hình, nơi khối lượng tính toán khổng lồ và yêu cầu thay đổi liên tục khiến phần cứng đa dụng vẫn chiếm ưu thế. Tuy nhiên, Jalapeño được tối ưu cho “inference” — tức giai đoạn mô hình đã được huấn luyện xong và bắt đầu tạo câu trả lời cho người dùng. Đây là mảng đang tăng trưởng cực nhanh vì mọi chatbot, trợ lý AI hay công cụ tạo nội dung đều phải chạy suy luận ở quy mô lớn.

Băng thông bộ nhớ mới là yếu tố quyết định

Trong AI suy luận, sức mạnh tính toán rất quan trọng, nhưng băng thông bộ nhớ thường còn quan trọng hơn. Băng thông bộ nhớ là tốc độ dữ liệu có thể được đọc từ hoặc ghi vào bộ nhớ; nếu chip tính nhanh nhưng dữ liệu đến chậm, hiệu năng thực tế sẽ bị nghẽn. OpenAI cho biết Jalapeño được thiết kế để giải quyết chính nút thắt này. Theo các kết quả thử nghiệm ban đầu trên bộ benchmark SemiAnalysis InferenceX, hệ thống dùng Jalapeño đạt lượng công việc AI cao hơn từ 1,5 đến 1,9 lần ở mức thông lượng cực đại, đồng thời giảm độ trễ đầu-cuối từ 1,7 đến 3,6 lần so với các đối thủ. “Độ trễ đầu-cuối” là thời gian tổng cộng từ lúc người dùng gửi yêu cầu đến khi nhận được phản hồi hoàn chỉnh, một chỉ số đặc biệt quan trọng với các ứng dụng AI thời gian thực.

Tăng tốc mạnh ở phân khúc suy luận siêu độ trễ thấp

OpenAI còn nhấn mạnh Jalapeño đặc biệt nổi bật ở mảng “ultra-low-latency inference”, tức suy luận với độ trễ cực thấp, nơi hạ tầng AI phải phản hồi gần như tức thì. Theo hãng, chip mới cho tốc độ nhanh hơn từ 2,1 đến 4,1 lần trong kịch bản này. Đây là phân khúc đang được các nhà cung cấp hạ tầng AI đặc biệt quan tâm vì nó ảnh hưởng trực tiếp đến trải nghiệm của chatbot hội thoại, tác nhân AI thời gian thực và các ứng dụng cần phản hồi theo từng token — token là đơn vị văn bản nhỏ mà mô hình AI xử lý và sinh ra từng bước.

Một rack 128 chip, 1,7 exaFLOPS và gần 2 petabyte/giây băng thông

Ở cấp độ hệ thống, OpenAI đi theo xu hướng “rack-scale architecture”, tức thiết kế cả một tủ máy chủ như một siêu hệ thống AI thống nhất thay vì chỉ tập trung vào từng con chip riêng lẻ. Mỗi rack Jalapeño chứa 128 bộ tăng tốc AI, cung cấp tổng cộng 1,7 exaFLOPS năng lực tính toán 4-bit. ExaFLOPS là đơn vị đo hiệu năng ở mức một tỷ tỷ phép tính dấu chấm động mỗi giây, còn 4-bit là định dạng số có độ chính xác thấp hơn nhưng rất phù hợp cho suy luận AI vì giúp tăng tốc và giảm điện năng. Hệ thống này còn tích hợp 27,5 TB HBM4 và đạt gần 2 petabyte mỗi giây băng thông bộ nhớ. HBM4, hay High Bandwidth Memory thế hệ 4, là loại bộ nhớ xếp chồng tốc độ cực cao được đặt rất gần chip xử lý để giảm độ trễ và tăng tốc truyền dữ liệu.

So với Nvidia và AMD, Jalapeño chọn lợi thế khác biệt

Nếu so với các rack GPU mới nhất từ Nvidia và AMD, OpenAI thừa nhận đối thủ vẫn có tổng sức mạnh tính toán cao hơn, từ khoảng 1,46 đến 2 lần, và có thể nhỉnh hơn nhẹ về dung lượng bộ nhớ. Tuy nhiên, Jalapeño lại được cho là vượt trội ở băng thông bộ nhớ, yếu tố sống còn trong suy luận mô hình lớn. Theo bài toán mà OpenAI đặt ra, đây có thể là lợi thế đủ lớn để giúp hệ thống mới đạt hiệu quả thực tế cao hơn trong nhiều tác vụ. Công ty chưa công bố mức tiêu thụ điện năng toàn hệ thống, nhưng dự đoán mỗi rack Jalapeño có thể chỉ dùng khoảng 40 đến 60% điện năng so với các hệ thống GPU cạnh tranh. Nếu con số này được xác nhận, đây sẽ là điểm hấp dẫn lớn trong bối cảnh chi phí vận hành trung tâm dữ liệu AI ngày càng leo thang.

Mỗi chip có 216 GB HBM4 và 13,4 petaFLOPS

Ở cấp độ từng bộ tăng tốc, mỗi chip Jalapeño được cho là đạt 13,4 petaFLOPS ở chuẩn MXFP4 và đi kèm 216 GB HBM4 với băng thông 15,4 TB/giây. PetaFLOPS là mức một triệu tỷ phép tính mỗi giây, còn MXFP4 là một định dạng số tối ưu cho AI, cho phép xử lý nhanh hơn với chi phí bộ nhớ thấp hơn so với độ chính xác truyền thống. Dung lượng bộ nhớ lớn trên từng chip đặc biệt hữu ích khi chạy các mô hình ngôn ngữ lớn, vì càng nhiều tham số và trạng thái được giữ gần bộ xử lý thì hệ thống càng ít phải di chuyển dữ liệu qua lại — một nguyên nhân phổ biến gây chậm và tốn điện.

SRAM lớn và KV cache nội bộ giúp giảm di chuyển dữ liệu

Một trong những điểm kỹ thuật đáng chú ý nhất là Jalapeño dường như có bộ nhớ đệm SRAM rất lớn. SRAM, hay Static Random-Access Memory, là loại bộ nhớ cực nhanh nhưng đắt và chiếm diện tích chip hơn DRAM, nên thường chỉ dùng làm cache để giữ dữ liệu quan trọng ở sát bộ xử lý. OpenAI cho biết họ thiết kế chip để giữ lại càng nhiều trạng thái mô hình càng tốt ngay trên chip, bao gồm cả “KV cache”. KV cache, viết tắt của key-value cache, là vùng nhớ lưu lại ngữ cảnh trung gian khi mô hình tạo câu trả lời từng token một; nhờ đó mô hình không phải tính lại toàn bộ chuỗi đầu vào mỗi lần sinh thêm từ mới. Cách làm này giúp giảm lượng dữ liệu phải di chuyển giữa bộ nhớ, bộ xử lý và mạng kết nối, từ đó cải thiện cả tốc độ lẫn hiệu suất năng lượng.

Tối ưu cả hai giai đoạn prefill và decode

Không giống một số kiến trúc chỉ mạnh ở một kiểu tác vụ, OpenAI nói Jalapeño được tối ưu cho cả hai pha chính của suy luận. Pha “prefill” là lúc hệ thống đọc và xử lý toàn bộ prompt ban đầu của người dùng; đây là giai đoạn nặng về tính toán. Pha “decode” là lúc mô hình sinh phản hồi từng token; giai đoạn này lại phụ thuộc rất nhiều vào băng thông bộ nhớ và khả năng truy cập nhanh vào trạng thái mô hình. Theo OpenAI, nhiều hệ thống có thể rất mạnh ở một pha nhưng đánh mất lợi thế ở pha còn lại do phải chờ dữ liệu hoặc chuyển trạng thái mô hình giữa các tài nguyên khác nhau. Jalapeño được xây dựng để tránh chính sự mất cân bằng đó.

AI tham gia thiết kế chip, rút ngắn thời gian xuống còn 9 tháng

Một chi tiết gây chú ý là OpenAI đã dùng chính các mô hình AI của mình để hỗ trợ thiết kế, kiến trúc và tối ưu hóa Jalapeño cho tác vụ suy luận. Hãng cho biết điều này đã giúp rút ngắn thời gian từ ý tưởng ban đầu đến “tape-out” xuống chỉ còn 9 tháng. Tape-out là cột mốc khi bản thiết kế bán dẫn hoàn tất và sẵn sàng gửi tới nhà máy chế tạo chip để sản xuất. OpenAI cũng dùng AI để tối ưu các “inference-serving engine” — tức phần mềm điều phối việc phục vụ yêu cầu suy luận — và viết các “kernel” tùy biến, là những đoạn mã mức thấp được tinh chỉnh để tận dụng tối đa phần cứng. Dù vậy, việc dùng AI để hỗ trợ phát triển chip không còn là điều quá mới mẻ, bởi cả AMD lẫn Nvidia cũng đã theo đuổi hướng đi tương tự trong nội bộ.

Lợi thế thật sự sẽ chỉ rõ khi bước vào triển khai quy mô lớn

Dù các con số ban đầu rất ấn tượng, vẫn cần thận trọng với mọi tuyên bố hiệu năng trước khi hệ thống được triển khai rộng rãi. So sánh của OpenAI hiện chủ yếu đặt cạnh các rack Nvidia GB200 NVL72 và GB300 NVL72, trong khi thị trường năm 2027 sẽ còn có thêm nhiều đối thủ mới như Rubin của Nvidia hay MI455X của AMD. Ngoài ra, OpenAI cũng loại trừ kỹ thuật “speculative decoding” khỏi phép so sánh. Đây là phương pháp dùng một mô hình nhỏ để dự đoán trước đầu ra của mô hình lớn nhằm tăng tốc suy luận. Việc loại bỏ kỹ thuật này giúp so sánh phần cứng “sạch” hơn, nhưng trong thực tế, khách hàng thường quan tâm đến hiệu năng của cả nền tảng tổng thể chứ không chỉ riêng con chip.

Jalapeño có thể là phát súng mở màn cho tham vọng silicon của OpenAI

Tự phát triển chip cho thấy OpenAI đang muốn kiểm soát sâu hơn chuỗi giá trị AI, từ mô hình, phần mềm đến hạ tầng phần cứng. Đây là bước đi có thể giúp công ty giảm phụ thuộc vào các nhà cung cấp GPU lớn, tối ưu chi phí dài hạn và tạo ra lợi thế riêng trong vận hành dịch vụ AI ở quy mô cực lớn. Tuy nhiên, xây dựng một nền tảng có thể mở rộng tới hàng trăm nghìn bộ tăng tốc không hề đơn giản. Khả năng lập trình, hệ sinh thái phần mềm và độ ổn định khi triển khai thực tế vẫn là những lĩnh vực mà Nvidia và AMD đang có nhiều kinh nghiệm hơn. Dẫu vậy, nếu Jalapeño thực sự mang lại hiệu năng suy luận cao hơn với điện năng thấp hơn như OpenAI khẳng định, cuộc đua phần cứng AI từ năm 2027 có thể sẽ bước sang một giai đoạn hoàn toàn mới.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT