Nvidia đưa báo giới vào phòng lab để nhấn mạnh: hạ tầng AI là thứ rất “vật lý”

Nvidia vừa tổ chức một buổi giới thiệu kín về hạ tầng AI, nơi hãng muốn truyền đi thông điệp rằng trí tuệ nhân tạo không chỉ là phần mềm hay mô hình trừu tượng, mà còn là những khối phần cứng khổng lồ, tiêu thụ điện, cần làm mát và vận hành trong các trung tâm dữ liệu thực sự. Theo Ian Buck, lãnh đạo mảng hyperscale và HPC của Nvidia, “hạ tầng là thứ có thể chạm vào, nhìn thấy và chính nó giúp AI hoạt động”. HPC, viết tắt của High Performance Computing, là điện toán hiệu năng cao – loại hệ thống chuyên xử lý các tác vụ tính toán cực nặng như mô phỏng, huấn luyện AI hay khoa học dữ liệu quy mô lớn. Trong chuyến tham quan, phóng viên được đưa tới một phòng lab vận hành như một trung tâm dữ liệu thu nhỏ tại Sunnyvale, California, nơi Nvidia thử nghiệm và trình diễn các hệ thống AI thế hệ mới.

Vera Rubin là gì và vì sao Nvidia đặt cược lớn vào nền tảng này?

Tâm điểm của sự kiện là Vera Rubin, nền tảng trung tâm dữ liệu AI mà Nvidia lần đầu công bố từ Computex 2024 và tiếp tục hé lộ chi tiết tại CES đầu năm nay. Đây là một kiến trúc phần cứng tích hợp nhiều thành phần: CPU Vera, GPU Rubin, bộ chuyển mạch NVLink 6, card mạng ConnectX-9, DPU BlueField-4 và switch Ethernet Spectrum-6. CPU là bộ xử lý trung tâm chịu trách nhiệm điều phối, xử lý dữ liệu và quản lý hệ thống; GPU là bộ xử lý đồ họa nhưng hiện đóng vai trò cốt lõi trong huấn luyện và suy luận AI; còn DPU, hay Data Processing Unit, là bộ xử lý chuyên biệt cho các tác vụ mạng, lưu trữ và bảo mật nhằm giảm tải cho CPU. Nvidia cho rằng chỉ khi các thành phần này được thiết kế đồng bộ, trung tâm dữ liệu mới có thể vận hành như một “AI Factory” – tức “nhà máy AI”, nơi đầu vào là điện năng và phần cứng, còn đầu ra là các token phục vụ chatbot, trợ lý AI và hệ thống suy luận.

Lắp ráp nhanh gấp hàng chục lần, giảm mạnh can thiệp thủ công

Một trong những điểm Nvidia nhấn mạnh là khả năng triển khai phần cứng nhanh hơn rất nhiều so với thế hệ cũ. Theo Andrew Bell, Phó chủ tịch cấp cao phụ trách kỹ thuật phần cứng, khay tính toán của hệ thống Vera Rubin NVL72 có thể được lắp ráp tự động chỉ trong khoảng một phút. Trong khi đó, khay tính toán của thế hệ GB200 trước đây thường mất tới 90 phút để hoàn thiện. NVL72 là cấu hình máy chủ AI dạng rack, tức dạng tủ tiêu chuẩn trong trung tâm dữ liệu, được tối ưu để nhồi nhiều bộ tăng tốc tính toán vào cùng một hệ thống. Việc rút ngắn thời gian lắp ráp không chỉ giúp tăng tốc triển khai mà còn giảm chi phí nhân công, giảm lỗi thủ công và tạo lợi thế khi các công ty đang chạy đua mở rộng công suất AI.

Mục tiêu lớn nhất: tạo ra nhiều token hơn trên mỗi watt điện

Thông điệp kinh doanh cốt lõi của Nvidia lần này xoay quanh một khái niệm khá mới với nhiều người: “tokens per watt”, tức số token tạo ra trên mỗi watt điện tiêu thụ. Token là đơn vị văn bản nhỏ mà mô hình AI xử lý và sinh ra – có thể là một phần của từ, một từ hoặc ký tự, tùy hệ thống. Trong bối cảnh chatbot và mô hình ngôn ngữ lớn kiếm tiền bằng số lượng yêu cầu xử lý, token gần như trở thành “đơn vị doanh thu” của AI. Nvidia cho biết Vera Rubin có thể mang lại hiệu quả gấp 10 lần về token trên mỗi watt so với GB200 NVL72 trong kết quả ban đầu trên DeepSeek-R1 thông qua CoreWeave, một nhà cung cấp hạ tầng đám mây chuyên cho AI. Nói cách khác, nếu một trung tâm dữ liệu bị giới hạn bởi điện năng – điều đang ngày càng phổ biến – thì hệ thống nào tạo ra nhiều token hơn với cùng mức điện sẽ có khả năng sinh lợi tốt hơn.

AI agent đang thay đổi cách thiết kế hạ tầng

Nvidia cho rằng làn sóng AI agent, tức các tác nhân AI có khả năng tự thực hiện nhiều bước suy luận và hành động thay người dùng, đang đòi hỏi cách xây dựng hạ tầng khác trước. Khác với chatbot truyền thống chỉ trả lời từng câu hỏi đơn lẻ, AI agent cần suy luận liên tục, phản hồi với độ trễ thấp và giữ được ngữ cảnh dài qua nhiều vòng xử lý. Độ trễ thấp, hay latency thấp, nghĩa là hệ thống phản hồi nhanh với ít thời gian chờ. Nvidia cũng nhắc tới “decoding throughput” – tốc độ giải mã đầu ra của mô hình – và “key-value cache”, bộ nhớ đệm lưu trạng thái nội bộ của mô hình để tăng tốc suy luận trong các phiên làm việc dài. Theo hãng, các agent hoạt động tốt nhất khi toàn bộ trung tâm dữ liệu được thiết kế như một khối thống nhất, nơi tài nguyên tính toán, mạng và lưu trữ liên kết chặt chẽ thay vì vận hành rời rạc.

CPU Vera không chạy theo số nhân, mà tập trung tăng tốc lõi xử lý

Dù GPU vẫn là ngôi sao trong thế giới AI, Nvidia cho rằng CPU vẫn đóng vai trò không thể thay thế trong xử lý dữ liệu, điều phối tác vụ, mạng và lưu trữ. Với Vera, hãng chọn hướng đi không đơn thuần là tăng số lượng nhân xử lý, mà cải thiện hiệu năng của từng lõi. Nvidia tuyên bố CPU Vera với kiến trúc Olympus Core có thể tăng tốc các tác vụ agent gấp đôi, cung cấp băng thông giữa các lõi cao gấp ba và giảm độ trễ tới 40% nhờ bộ nhớ LPDDR5X. LPDDR5X là chuẩn bộ nhớ tiết kiệm điện, thường thấy trên thiết bị di động cao cấp nhưng ngày càng được điều chỉnh để phục vụ các hệ thống cần hiệu năng cao trên mỗi watt. Cách tiếp cận này phản ánh niềm tin của Nvidia rằng với AI agent, tốc độ xử lý và phối hợp giữa các thành phần quan trọng hơn việc chỉ cộng thêm nhiều lõi CPU.

“Nhà máy AI” thực chất là mô hình kinh doanh bán token

Phía sau lớp vỏ kỹ thuật, Nvidia đang mô tả một logic kinh doanh rất rõ: trung tâm dữ liệu AI ngày nay vận hành như nhà máy sản xuất token. Ian Buck nói rằng phần lớn các “AI Factory” đều bị giới hạn bởi điện năng, vì vậy chỉ số quan trọng nhất là hiệu năng trên mỗi watt trong một trung tâm dữ liệu có mức điện cố định. Doanh thu không còn chỉ đến từ việc cho thuê máy chủ theo giờ, mà từ việc tạo ra càng nhiều token có lợi nhuận càng tốt trong cùng một khoảng thời gian. Đây là lý do Nvidia liên tục nói về inference – tức suy luận, giai đoạn mô hình đã được huấn luyện và đang phục vụ người dùng thực tế – thay vì chỉ nói về training, tức huấn luyện mô hình. Khi thị trường AI dần trưởng thành, giá trị thương mại ngày càng nằm ở việc phục vụ khối lượng truy vấn khổng lồ với chi phí thấp.

Tuy nhiên, bài toán lợi nhuận token không hề đơn giản

Dù Nvidia rất lạc quan, thực tế kinh tế của “token business” vẫn còn nhiều dấu hỏi. Khi ngày càng có nhiều phần cứng mạnh hơn được tung ra và nhiều nhà cung cấp AI cạnh tranh nhau, nguồn cung token tăng lên sẽ tạo áp lực giảm giá. Điều đó có nghĩa là ngay cả khi trung tâm dữ liệu tạo ra được nhiều token hơn, doanh thu trên mỗi token có thể giảm. Kỳ vọng của Nvidia và các phòng thí nghiệm AI hàng đầu là nhu cầu sẽ tăng đủ mạnh khi giá rẻ hơn, từ đó vẫn giữ được biên lợi nhuận để bù lại khoản đầu tư khổng lồ vào xây dựng trung tâm dữ liệu mới. Tuy nhiên, thị trường chưa chắc đã đi theo kịch bản đẹp này, nhất là khi đã xuất hiện thông tin một số doanh nghiệp bắt đầu áp trần ngân sách token cho nhân viên, cho thấy không phải tổ chức nào cũng thấy hiệu quả năng suất rõ rệt từ AI.

Nvidia nói AI đã giúp lập trình viên làm việc hiệu quả gấp nhiều lần

Trong phần trình bày, Ian Buck còn đưa ra một phép tính mang tính minh họa để cho rằng AI đang thúc đẩy mạnh năng suất lập trình. Ông viện dẫn sự gia tăng số lượng code commit trên GitHub – tức số lần lập trình viên đẩy thay đổi mã nguồn lên kho lưu trữ – và cho rằng lực lượng 30 đến 40 triệu nhà phát triển phần mềm trên toàn cầu có thể đang tạo ra giá trị lớn hơn nhiều nhờ công cụ AI. Dù đây chưa phải một tuyên bố có thể kiểm chứng đầy đủ, Nvidia cho biết nội bộ hãng đã chứng kiến số lượng check-in mã nguồn và năng suất phát triển tăng gấp ba nhờ AI coding tools, tức các công cụ hỗ trợ viết mã bằng trí tuệ nhân tạo.

Không chỉ viết phần mềm, AI agent còn được Nvidia dùng để phát triển chip

Điểm đáng chú ý là Nvidia khẳng định họ không chỉ dùng AI cho lập trình phần mềm, mà còn áp dụng AI agent trong quy trình phát triển chip. Theo Ian Buck, gần như toàn bộ quy trình phát triển phần mềm tại Nvidia đều có agent tham gia, và cơ sở dữ liệu lỗi chip của hãng cũng được các agent theo dõi, rà soát thường xuyên. Điều này cho thấy một xu hướng mới trong ngành bán dẫn: AI không chỉ là sản phẩm được bán ra, mà còn trở thành công cụ để thiết kế chính những con chip phục vụ AI. Nếu xu hướng này tiếp tục, các công ty như Nvidia có thể tạo ra vòng lặp tăng tốc, nơi AI giúp làm ra phần cứng tốt hơn, còn phần cứng tốt hơn lại giúp AI mạnh hơn.

Đằng sau hào quang công nghệ vẫn là tranh cãi về điện, nước và môi trường

Tuy vậy, sự bùng nổ hạ tầng AI không diễn ra trong chân không. Các trung tâm dữ liệu ngày càng vấp phải chỉ trích vì tiêu thụ điện và nước ở quy mô lớn, đặc biệt khi các mô hình AI đòi hỏi cụm máy chủ dày đặc và hệ thống làm mát mạnh. Chỉ một ngày sau sự kiện của Nvidia, các nhà hoạt động tại Hà Lan đã tấn công bằng bóng chứa hóa chất vào một trung tâm dữ liệu phục vụ tải công việc của Microsoft để phản đối các vấn đề khí hậu và chính trị. Điều đó phản ánh mặt trái của cuộc đua AI: càng nhiều “nhà máy token” mọc lên, áp lực xã hội đối với tài nguyên và môi trường càng lớn. Nvidia rõ ràng muốn nhấn mạnh hiệu suất điện năng của Vera Rubin như một phần câu trả lời, nhưng tranh cãi về tác động thực tế của AI đối với cộng đồng xung quanh các trung tâm dữ liệu sẽ chưa sớm biến mất.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT