Khi cụm AI phình to, mạng kết nối trở thành nút thắt mới

Nếu 72 GPU trong một rack từng được xem là cực kỳ dày đặc, thì các thiết kế AI thế hệ tiếp theo từ Nvidia và nhiều hãng khác đang hướng tới quy mô hàng trăm, thậm chí hàng nghìn bộ gia tốc trong một hệ thống lớn duy nhất. “Bộ gia tốc” ở đây là các chip chuyên xử lý tác vụ AI như GPU, TPU hay các kiến trúc tương tự. Tuy nhiên, để biến quy mô này thành hiện thực, bài toán không chỉ nằm ở sức mạnh tính toán mà còn ở cách các chip giao tiếp với nhau. Chính vì thế, giới đầu tư đang đổ tiền mạnh vào công nghệ quang học mạng, từ startup photonics đến các nhà sản xuất thiết bị quang và sợi quang lâu năm. Photonics, hay quang tử học, là lĩnh vực dùng ánh sáng thay cho tín hiệu điện để truyền dữ liệu nhanh hơn và tiết kiệm năng lượng hơn trong hạ tầng mạng hiện đại.

Nvidia tăng tốc đầu tư vào chuyển mạch mạch quang

Sau khi rót tổng cộng 6 tỷ USD vào Coherent, Lumentum và Marvell hồi tháng 3 để thúc đẩy công nghệ quang học, Nvidia tiếp tục tham gia vòng đầu tư 125 triệu USD cho iPronics cùng Maverick Silicon và Light Street Capital. Trọng tâm lần này là OCS, viết tắt của Optical Circuit Switching, tức chuyển mạch mạch quang. Khác với switch Ethernet hay InfiniBand truyền thống vốn chuyển từng gói dữ liệu, OCS không “đọc” và định tuyến packet. Thay vào đó, nó tạo ra các đường kết nối quang vật lý trực tiếp giữa hai điểm, khá giống bảng tổng đài điện thoại ngày xưa, chỉ khác là mọi thứ được tự động hóa ở tốc độ cực cao.

OCS hoạt động như thế nào và vì sao nó khác switch mạng thông thường

Một switch mạng phổ biến dùng chip ASIC, tức vi mạch chuyên dụng, như Broadcom Tomahawk hay Marvell Teralynx để xử lý và chuyển tiếp packet theo thời gian thực. OCS thì khác: thiết bị này tái cấu hình đường đi của ánh sáng, kết nối trực tiếp các cổng quang với nhau. Trong các hệ thống đời cũ, việc tái cấu hình thường dựa trên MEMS, tức hệ vi cơ điện tử, nơi các gương siêu nhỏ di chuyển để đổi hướng tia sáng. Một số thiết kế khác dùng LCD hoặc cơ cấu áp điện. Cách làm này hiệu quả, nhưng thời gian tái cấu hình thường ở mức khoảng 100 mili giây, chưa đủ nhanh cho nhiều kịch bản AI linh hoạt. Ngoài ra, thiết bị OCS hiện nay cũng khá cồng kềnh do cơ chế vận hành và mật độ đầu nối quang còn hạn chế.

Google đã dùng OCS trong cụm TPU từ nhiều năm trước

Dù chưa phổ biến trong các cụm GPU hiện đại, OCS không phải khái niệm mới. Google đã triển khai công nghệ này từ lâu trong các cụm TPU, tức Tensor Processing Unit, dòng chip AI do hãng tự phát triển. Các “TPU pod” của Google truyền thống sử dụng topology 2D hoặc 3D torus. Topology là cách sắp xếp và nối mạng giữa các chip; còn torus có thể hiểu như một dạng lưới khép kín, nơi mỗi bộ gia tốc liên lạc với các nút lân cận trong một cấu trúc mắt lưới lớn. Ưu điểm là có thể mở rộng miền tính toán rất lớn mà không phụ thuộc hoàn toàn vào switch packet có số lượng cổng hữu hạn, còn gọi là radix. Đổi lại, mô hình này kém linh hoạt hơn: khi cần thêm, bớt hoặc thay thế chip lỗi, mạng phải được cấu hình lại. Đây chính là vai trò của OCS trong hạ tầng TPU của Google, cho phép thay đổi kích thước pod theo nhu cầu hoặc gần như “hot-swap” bộ gia tốc bị hỏng mà không phải thiết kế lại toàn bộ hệ thống.

iPronics muốn loại bỏ bộ phận chuyển động để tăng tốc OCS

iPronics cho biết họ đang phát triển thế hệ OCS thứ hai bằng silicon photonics, tức quang tử silicon. Đây là công nghệ tích hợp các thành phần xử lý ánh sáng trực tiếp trên nền silicon, tương tự cách ngành bán dẫn tích hợp mạch điện lên chip. Điểm đáng chú ý là thiết kế này không có bộ phận chuyển động, thay vì dựa vào MEMS hay LCD như trước. Theo công ty, điều đó giúp rút thời gian tái cấu hình xuống dưới 1 mili giây. Mức trễ sub-ms này đặc biệt quan trọng vì nó mở ra khả năng thay đổi topology ngay trong lúc khối lượng công việc AI đang chạy, bằng cách che giấu độ trễ trong các chu kỳ tính toán. Nói cách khác, mạng có thể linh hoạt hơn mà không làm gián đoạn đáng kể tiến trình huấn luyện hay suy luận.

Mật độ cổng quang cao hơn có thể thay đổi cách xây cụm AI

Không chỉ nhanh hơn, iPronics còn nhắm tới mật độ kết nối cao hơn đáng kể. Chip iPronics One hiện hỗ trợ 32 cổng, và công ty đang phát triển các phiên bản 72 cổng và 144 cổng. Nhờ được xây dựng bằng silicon photonics, các chip này có thể đóng gói trong không gian nhỏ hơn nhiều. iPronics tin rằng bằng cách dùng cấu trúc multi-chip, tức ghép nhiều khuôn chip trong cùng một hệ thống, cùng đầu nối mật độ cao, họ có thể nhồi tới 720 cặp cổng trong chỉ 1U rack. 1U là đơn vị chiều cao tiêu chuẩn trong tủ rack máy chủ. Để so sánh, các hệ thống OCS radix cao hiện nay như thiết bị 300 cổng của Coherent thường cần tới 8U hoặc hơn. Radix ở đây chỉ số lượng cổng mà một switch có thể phục vụ.

OCS không thay thế hoàn toàn mạng packet, nhưng có thể bổ sung đúng chỗ

Ngay cả khi đạt độ trễ dưới mili giây, OCS vẫn phù hợp nhất với môi trường mà các đường đi mạng không thay đổi liên tục. Điều này khác với triết lý của nhiều hệ thống AI rack-scale hiện đại như Nvidia NVL72 hay AMD Helios, vốn ưu tiên kết nối all-to-all một bước nhảy. All-to-all nghĩa là mọi chip có thể nói chuyện trực tiếp với mọi chip khác qua số hop tối thiểu; còn hop là số lần dữ liệu phải đi qua một nút trung gian. Trong NVL72, Nvidia dùng 18 chip NVLink Switch để biến 72 GPU thành một miền tính toán gần như thống nhất. NVLink là giao tiếp tốc độ cao độc quyền của Nvidia dành cho kết nối GPU. Dù vậy, OCS và mạng chuyển mạch packet không loại trừ lẫn nhau. Một mô hình lai hoàn toàn khả thi là dùng kết nối đồng hoặc switch truyền thống trong nội bộ rack, rồi dùng OCS để ghép nối giữa các rack theo dạng lưới quang linh hoạt hơn.

Cụm LPU khổng lồ có thể là mảnh đất màu mỡ cho OCS

Bài toán hấp dẫn hơn có thể nằm ở các cụm LPU cỡ rất lớn mà Nvidia đang thúc đẩy. Theo bài viết nguồn, với mỗi mô hình AI cỡ một nghìn tỷ tham số, Nvidia cần tới 8 rack LPX với tổng hơn 2.000 bộ gia tốc. “Tham số” là các giá trị số mà mô hình AI học được trong quá trình huấn luyện; số lượng càng lớn thì mô hình càng đòi hỏi hạ tầng tính toán và mạng khổng lồ. Các hệ thống này thường dùng pipeline parallelism, tức song song dạng đường ống, nơi dữ liệu được xử lý tuần tự qua nhiều chip hoặc nhiều giai đoạn thay vì mọi chip cùng làm một việc giống nhau. Mô hình này khá phù hợp với topology dạng mesh do OCS điều phối, đồng thời giúp việc thay đổi kích thước cụm để phục vụ các mô hình khác nhau trở nên dễ dàng hơn, đặc biệt với các nhà cung cấp hạ tầng AI mới nổi như neocloud.

Không chỉ switch, đầu nối sợi quang cũng phải dày đặc hơn

Khi số lượng bộ gia tốc tăng vọt, thách thức không chỉ là chuyển mạch mà còn là cách kéo và kết thúc hàng chục nghìn sợi quang trong một rack. Đây là lý do startup Mixx Technologies vừa giới thiệu đầu nối SxC mới, được thiết kế để gom mật độ sợi quang rất cao. Theo công ty, mỗi đầu nối SxC mang 64 sợi quang, trong khi chuẩn MPO phổ biến hiện nay thường dừng ở khoảng 8 đến 24 sợi. MPO là chuẩn đầu nối quang đa sợi được dùng nhiều trong trung tâm dữ liệu. Mixx ước tính với SxC, một rack OCP có thể chứa 384 cổng 64 sợi trong 1U. OCP là Open Compute Project, bộ tiêu chuẩn phần cứng mở được nhiều nhà vận hành trung tâm dữ liệu lớn sử dụng. Nếu ghép với SerDes 400 Gbps, tổng băng thông có thể đạt 614 TB/s. SerDes là viết tắt của serializer/deserializer, khối mạch dùng để chuyển đổi dữ liệu song song và nối tiếp cho truyền dẫn tốc độ cao.

Một “tổng đài điện thoại” mới cho kỷ nguyên AI quy mô siêu lớn

Điều đáng chú ý là tương lai của mạng AI có thể không chỉ dựa vào những switch packet ngày càng lớn, mà còn quay lại một ý tưởng rất cũ: thiết lập đường kết nối trực tiếp giữa các điểm, giống tổng đài điện thoại truyền thống. Khác biệt nằm ở chỗ phiên bản mới vận hành bằng ánh sáng, tích hợp trên silicon, tái cấu hình trong chưa đầy một mili giây và có mật độ cổng đủ cao để phục vụ các siêu cụm AI. Nếu các tuyên bố của iPronics và các công ty liên quan trở thành hiện thực, OCS có thể trở thành lớp hạ tầng chiến lược giúp các cụm AI quy mô hàng nghìn chip vận hành linh hoạt hơn, rẻ hơn và dễ mở rộng hơn trong những năm tới.

Danh mục máy quét mã vạch

Máy quét mã vạch - Quét mã Qr - Quét mã vạch sản phẩm.

DÒNG MÁY CÓ DÂY

máy quét mã vạch không dây

DÒNG MÁY KHÔNG DÂY

DÒNG MÁY KIỂM KHO PDA

DÒNG MÁY FITMOUNT