Không có thông báo nào

NVIDIA có module quang 400Gbps nhỏ gọn cho hạ tầng AI, chạy tới 500 mét

NVIDIA đang cung cấp module quang MMS1X00-N5400, một transceiver 400Gbps sử dụng chuẩn QSFP112 và kết nối quang single-mode ở bước sóng 1310 nm. Đây là một thành phần mạng được thiết kế cho các hệ thống AI tốc độ cao, nơi băng thông giữa GPU, NIC và switch ngày càng trở thành yếu tố quan trọng. ServeTheHome mới đây đã thử nghiệm module này trong phòng lab để kết nối hai hệ thống NVIDIA GB300 AI Station với switch NVIDIA Spectrum-X. Module nhanh chóng thiết lập liên kết 400GbE thông qua NIC ConnectX-8, cho thấy thiết kế này phù hợp với các hệ thống AI có yêu cầu kết nối rất cao.

QSFP112 đưa 400Gbps vào một module nhỏ hơn

MMS1X00-N5400 sử dụng form factor QSFP112, với bốn lane điện và quang tốc độ 112G-class. Theo tài liệu NVIDIA, phiên bản MMS1X00-NS400 tương ứng sử dụng 4 kênh 100G-PAM4, laser EML 1310 nm và đầu nối MPO-12/APC. Thiết kế DR4 cho phép truyền dữ liệu tối đa 500 mét trên cáp single-mode. Điểm khác biệt của QSFP112 nằm ở việc module chỉ cần bốn lane để đạt 400Gbps. Trong khi đó, các module QSFP56-DD 400Gbps sử dụng tám lane 56G-class. Vì vậy, QSFP112 có thể đạt cùng tốc độ với thiết kế gọn hơn và không cần thêm gearbox cho đường truyền DR4 400Gbps trong những hệ thống tương thích. Đầu nối quang của module là MPO-12, nhưng thiết kế 4×100G chỉ sử dụng tám trong tổng số 12 sợi quang của đầu nối. NVIDIA sử dụng đầu nối APC dành cho single-mode, với phần vỏ và màu sắc được thiết kế để tránh nhầm lẫn với cáp UPC. Một chi tiết khá thú vị nằm ở khả năng tản nhiệt. Module có phần heatsink nhô ra bên ngoài cage thay vì hoàn toàn nằm bên trong. NVIDIA cho biết phiên bản chính thức có mức tiêu thụ tối đa khoảng 9,5 W, trong khi ServeTheHome ghi nhận module được hệ thống báo mức tối đa khoảng 10 W khi thử nghiệm thực tế.

400GbE trở thành kết nối quan trọng cho hệ thống AI

ServeTheHome thử nghiệm MMS1X00-N5400 trên NVIDIA GB300 AI Station với NIC ConnectX-8 và ghi nhận liên kết 400Gbps được thiết lập gần như ngay lập tức. Trong quá trình sử dụng, nhiệt độ module nằm ở khoảng giữa 40°C, thấp hơn đáng kể so với giới hạn vận hành. NVIDIA cũng xác nhận dòng transceiver MMS1X00-NS400 hỗ trợ đồng thời Ethernet và InfiniBand, với firmware tự động lựa chọn giao thức dựa trên thiết bị switch được kết nối. Module có thể được sử dụng với ConnectX-7 hoặc BlueField-3 và các hệ thống mạng tương thích. Đây là điều ngày càng quan trọng khi các hệ thống AI chuyển sang mô hình phân tán. GPU không còn chỉ giao tiếp với bộ nhớ cục bộ mà phải liên tục trao đổi dữ liệu với GPU khác, CPU, storage và các node trong cùng cluster. Khi số lượng GPU tăng lên, tốc độ và độ trễ của mạng có thể ảnh hưởng trực tiếp tới hiệu quả sử dụng tài nguyên tính toán. NVIDIA hiện cũng đã liệt kê MMS1X00-NS400 trong danh sách thiết bị được hỗ trợ cho ConnectX-8 và ConnectX-9, với cấu hình QSFP112 400GbE, MPO và single-mode 1310 nm, phạm vi lên tới 500 m.

Từ 400Gbps đến mạng AI quy mô lớn

Điểm đáng chú ý của MMS1X00-N5400 không nằm ở việc 400Gbps là một con số mới, mà ở cách NVIDIA đang đưa tốc độ này vào những thiết bị ngày càng nhỏ gọn và phù hợp với hệ thống AI mật độ cao. Trong phòng lab của ServeTheHome, module này có thể được dùng để kết nối trực tiếp hai GB300 AI Station hoặc nối hệ thống với switch thông qua hạ tầng cáp quang. So với DAC, transceiver quang có chi phí cao hơn nhưng đổi lại cung cấp khoảng cách truyền xa hơn và linh hoạt hơn trong việc bố trí các node AI. Đặc biệt, NVIDIA nhấn mạnh khả năng hoạt động trong môi trường trung tâm dữ liệu. Đây là yếu tố quan trọng khi các hệ thống AI sử dụng ngày càng nhiều GPU và chuyển sang làm mát bằng chất lỏng, khiến việc duy trì nhiệt độ ổn định cho các module quang ở phía nóng của rack trở nên khó khăn hơn. Về lâu dài, những module như MMS1X00-N5400 sẽ trở thành một phần không thể tách rời của hạ tầng AI: GPU càng mạnh thì mạng càng phải nhanh. Khi các nền tảng AI tiến từ 400GbE lên 800GbE và cao hơn, transceiver, switch và NIC sẽ ngày càng đóng vai trò quan trọng trong việc đảm bảo hàng chục hoặc hàng trăm GPU có thể hoạt động như một hệ thống tính toán thống nhất.

Nguồn: servethehome
Cộng đồng: