M5 Ultra đánh bại DGX Spark trong bài kiểm tra local AI
Phần đáng chú ý nhất trong bài review nằm ở benchmark AI. Tom’s Hardware sử dụng Qwen 3.8-27B-Q4_K_M, một mô hình dense có mức độ phụ thuộc khá lớn vào băng thông bộ nhớ.
Kết quả cho thấy M5 Ultra có tốc độ xử lý prompt cao hơn Nvidia DGX Spark. Đáng chú ý hơn, tốc độ sinh token của M5 Ultra gần gấp bốn lần DGX Spark trong các bài kiểm tra được thực hiện. So với Mac Studio M4 Max, tốc độ cũng tăng khoảng gấp đôi.
Điều này rất quan trọng bởi hai loại workload của LLM thường có đặc điểm khác nhau. Khi hệ thống tiếp nhận một prompt dài, giai đoạn prompt processing/prefill có thể tận dụng khả năng tính toán song song rất mạnh.
Sau đó, trong quá trình decode, mô hình phải liên tục sinh từng token tiếp theo. Đây là giai đoạn thường bị giới hạn bởi khả năng truy xuất dữ liệu từ bộ nhớ. Với băng thông 1,2 TB/s cùng dung lượng Unified Memory lớn, M5 Ultra có điều kiện khá thuận lợi cho kiểu workload này.