![]()
CXL 3.0: Kết nối bộ nhớ chia sẻ CPU–GPU–FPGA trong data center AI
CXL (Compute Express Link) là giao thức interconnection mở chuẩn, cho phép CPU, GPU, FPGA, accelerator và thiết bị lưu trữ kết nối trực tiếp với bộ nhớ chia sẻ (shared memory), tương tự như một “c-bus” trong data center. Phiên bản CXL 3.0 (phát hành năm 2022) hỗ trợ tốc độ lên đến 512 GT/s (256 GB/s theo chiều), là nền tảng cho kiến trúc bộ nhớ chuyên biệt (disaggregated) trong trung tâm xử lý AI hiện đại.

Điểm sống đác tỉnh của CXL: Bộ nhớ được chia sẻ chứ không phải sao chép
Truyền thống, CPU phải truy cập bộ nhớ (RAM) gắn trên bo mạch của chính nó. Khi GPU cần dữ liệu, CPU phải sao chép dữ liệu từ RAM của CPU sang RAM của GPU qua PCIe — tốn thời gian và bộ nhớ trung gian. CXL Memory Semantics chỉnh chỉnh điều này bằng cách:
- CXL.io: Kiểu truyền tải (transport) căn bản dựa trên PCIe, dùng cho discovery, configuration, và truyền traditional I/O.
- CXL.cache: Cho phép thiết bị (ví dụ: GPU) cache dữ liệu từ bộ nhớ của thiết bị khác — truy cập memory pool xa mà không sao chép.
- CXL.mem: Cho phép CPU truy cập trực tiếp bộ nhớ (memory) do thiết bị khác sở hữu — hỗ trợ memory pooling và memory expansion.
Qua CXL.mem, một GPU có thể mở rộng memory pool lên tới hàng trăm GB mà không cần lắp thêm RAM trên board — quan trọng cho mo hình LLM 70B–700B cần 100GB+ VRAM.
CXL 3.0 hỗ trợ Memory Pooling và SwitchFabric toàn cục
CXL 3.0 giới thiệu memory pooling mạnh mẽ — gom bộ nhớ từ nhiều nguồn thành một pool logic khổng lồ, và switch fabric hỗ trợ định tuyến đa dạng (multi-root complex). Điều này cho phép:

- Tốc độ cao: 512 GT/s (đôi, 256 GB/s), gấp 4x PCIe 5.0, 2x CXL 2.0.
- Memory pooling: Tạo memory pool chung cho nhiều CPU/Accelerator, tối ưu utilization.
- Switch fabric: Kết nối 256 thiết bị trong một fabric, hỗ trợ topology tiểu cảnh (mesh, torus, fat tree).
- Coherent fabric: Duy trì coherence nhất quán (MESI) qua toàn bộ fabric — CPU luôn thấy cập nhật mới nhất từ GPU/FPGA cache.
- Pausing < 2 μs latency: Nhỏ hơn 10x so với network RDMA hiện tại.
So sánh với CXL 2.0 (hỗ trợ switch nhưng giới hạn 8 thiết bị, 256 GT/s): CXL 3.0 cải thiện 2x tốc độ, hỗ trợ memory pooling chuyên biệt, và switch linh hoạt để mở rộng data center AI.
Thị trường và ứng dụng thực tế
| Vendor | Chipset CXL | Ứng dụng | Thời gian |
|---|---|---|---|
| Intel | Thunderbolt SoC (Bronco) | Xeon + GPU AI memory expansion | 2024 |
| AMD | Genoa/Granite Rapids | EPYC + MI300 co-packaged memory | 2024 |
| NVIDIA | GH200/Blackwell | NVLink-CXL, memory-side cache | 2024–2025 |
| Broadcom | Switch PPU (Tomahawk) | CXL switching fabric cho rack | 2025 |
| Marvell | Indium CXL 3.0 | SmartNIC + memory expansion | 2025 |
Kiến trúc data center CXL-native: Disaggregated là tương lai
Khi CXL 3.0 + PCIe 6.0 được áp dụng trong data center AI, kiến trúc “disaggregated” trở thành khả thi:
- Pull GPU pods ra khỏi server: GPU (ví dụ: NVIDIA B200, H200) rack riêng, mỗi GPU truy cập shared memory pool qua CXL.
- Pull memory pool: Bộ nhớ DRAM (100TB+) dạng pool, CPU/GPU/FPGA cùng chia sẻ, tránh over-provisioning.
- Pull storage: CXL.storage (CXL.io) kết nối SSD trực tiếp vào memory address space — truy cận như truy cập RAM.
- Tỷ lệ hoá lại: Server không còn gán GPU/RAM cố định — scale CPU pool riêng, GPU pool riêng, memory pool riêng.
Microsoft Azure đã triển khai CXL memory expansion trên Azure HBv5-series (hơn 6TB RAM qua CXL), giảm chi phí 20% so với cấu hình truyền thống. Intel dự kiến CXL 3.0 server racks xuất hiện rộng rãi vào 2025.
Thách thức và triển vọng CXL 3.2
CXL 3.2 (phát hành 2024) thêm hỗ trợ multicast, broadcast, và atomic operations — tối ưu cho workload ML parameter broadcast. Tương lai CXL 3.3/4.0 hướng tới 1.024 GT/s và hỗ trợ memory semantics trong switching — dẫn đường cho data center zetta-scale.
Kết luận
CXL 3.0 đại diện cho sự chuyển đổi căn bản trong kiến trúc server: từ “everything attached to one CPU” sang shared memory fabric toàn cục. Đối với trung tâm AI đang tích lũy GPU hàng trăm, CXL là chìa khóa để phá vỡ g triền nghẽn bộ nhớ RAM truyền thống và xây dựng data center thực sự mềm (disaggregated) — nền tảng cho LLM hàng ngàn tỷ tham số trong năm 2026–2027.
Nguồn: CXL Consortium | CXL 3.0 Specification | Intel CXL 3.0 Overview
