
NVIDIA Blackwell là kiến trúc chip AI thế hệ mới nhất, được giới thiệu tại GTC 2024, đánh dấu bước nhảy 30 lần hiệu năng so với thế hệ Hopper H100. Với GPU B200, NVLink Switch thế hệ mới và phần cứng transformer engine, Blackwell là nền tảng cho training và inference mô hình AI lớn nhất thế giới, đồng thời định nghĩa lại thị trường chip AI trị giá 100 tỷ USD.
Tại sao Blackwell quan trọng với thị trường AI?
Mô hình AI lớn nhất (GPT-4, Claude 4, Llama 4) yêu cầu hàng chục nghìn GPU để training. Chi phí điện năng và phần cứng trở thành nút thắt lớn nhất. Blackwell giải quyết bằng cách giảm 25 lần chi phí cho mỗi token so với thế hệ Hopper, giúp doanh nghiệp nhỏ cũng có thể training mô hình 100B+ params.
Theo NVIDIA, GPU B200 chứa 208 tỷ transistors — nhiều nhất lịch sử bán dẫn.

Cấu trúc kỹ thuật GPU Blackwell B200
- Transistors: 208 tỷ (die đơn-sized, được ghép thành module)
- CUDA cores: 16.384 cores cho compute.
- Tensor cores: 528 thế hệ 5, hỗ trợ FP4.
- VRAM: 192 GB HBM3e, băng thông 8 TB/s.
- Điện năng: 1.000W TDP, hiệu năng/watt gấp 3 lần Hopper.
- Kết nối: NVLink 5.0, 1.8 TB/s mỗi link, 8 links per GPU.
Điểm mới nhất: hỗ trợ FP4 tính toán trực tiếp. Với 192 GB VRAM, B200 chứa đủ tham số 400B params models mà không cần phân mảnh GPU, giảm latency đáng kể cho inference.

NVLink Switch và DGX GB200
Để kết nối 72 GPU Blackwell, NVIDIA phát triển NVLink Switch thế hệ mới với dung sai tín hiệu cực thấp. DGX GB200 NVL72 là hệ thống rack chứa 36 CPU Grace và 72 GPU B200, tổng VRAM 13 TB, băng thông liên kết 130 TB/s. Chi phí mỗi rack khoảng 2-3 triệu USD, nhưng hiệu năng tương đương 500+ GPU H100 cũ.
Hệ thống này được Amazon AWS, Google Cloud và Microsoft Azure đặt hàng trước hàng nghìn rack, dự kiến giao hàng Q3 2025.
Blackwell vs AMD MI350X vs Intel Gaudi 3
| Chip | VRAM | TDP | Hỗ trợ FP4 | Giá ước tính |
|---|---|---|---|---|
| NVIDIA B200 | 192 GB HBM3e | 1.000W | Có | ~30.000 USD |
| AMD MI350X | 288 GB HBM3e | 750W | Có | ~25.000 USD |
| Intel Gaudi 3 | 128 GB HBM2e | 900W | Không | ~15.000 USD |
AMD MI350X là đối thủ thực sự duy nhất: VRAM lớn hơn, watt thấp hơn, nhưng ecosystem phần mềm (CUDA vs ROCm) vẫn là rào cản lớn.
Ảnh hưởng đến thị trường chip AI toàn cầu
NVIDIA chiếm hơn 90% thị phần chip AI training. Blackwell không chỉ tăng hiệu năng, mà còn tạo “vendor lock-in” qua phần mềm CUDA — ngôn ngữ lập trình GPU mà mọi framework AI đều dùng. Theo Reuters, doanh thu Q1 2025 của NVIDIA đạt 44 tỷ USD, tăng 260% so với năm trước.

Triển vọng cho người dùng cuối
Với chi phí/token giảm 25 lần, Blackwell sẽ mang AI inference đến smartphone và laptop. NVIDIA cho biết AI assistant trên điện thoại sẽ chạy offline hoàn toàn trong 2-3 năm tới. Đồng thời, training mô hình cá nhân sẽ khả thi cho startup nhỏ với ngân sách 50.000 USD thay vì hàng triệu USD như hiện tại.
Blackwell không chỉ là nâng cấp phần cứng — nó thay đổi cách thế giới tiếp cận AI, từ độc quyền Big Tech đến phổ cập cho mọi người.
