
NPU là gì? Vai trò của Neural Processing Unit trong laptop AI thế hệ mới
NPU (Neural Processing Unit) đang trở thành tiêu chuẩn mới trên các dòng laptop hiện đại, cho phép chạy tác vụ AI cục bộ mà không cần kết nối đám mây. Khác với CPU xử lý tuần tự và GPU tối ưu cho đồ họa song song, NPU được thiết kế chuyên biệt cho phép toán ma trận và mạng nơ-ron — lõi của mọi mô hình học máy.
Tại sao NPU quan trọng hơn CPU/GPU cho AI cục bộ?
CPU xử lý tốt logic điều khiển và luồng đơn. GPU xuất sắc ở phép toán song song lớn (huấn luyện, render). Nhưng cả hai đều tiêu thụ năng lượng cao khi chạy inference liên tục. NPU giải quyết bài toán này bằng kiến trúc dữ liệu-flow (dataflow) với bộ nhớ cục bộ lớn, loại bỏ chu kỳ nạp/lưu cache tốn kWh.
Hiệu năng/watt: NPU đạt 10-50 TOPS/W so với 1-5 TOPS/W của GPU discrete.
Độ trễ thấp: Không qua bus PCIe, dữ liệu nằm ngay trên die → inference real-time cho webcam, mic, cảm biến.
Riêng tư: Dữ liệu nhạy cảm (khuôn mặt, giọng nói, văn bản) không rời thiết bị.
Các nhà sản xuất chip đã tối ưu pipeline lệnh dành riêng cho sparse matrix multiply, ReLU/GeLU activation, và convolution nhóm (group convolution) — phép tính phổ biến trong CNN và transformer. Một số NPU còn tích hợp hỗ trợ INT4/INT8 natively, giảm băng thông bộ nhớ xuống 1/4 so với FP16.

Các dòng NPU tiêu biểu trên thị trường 2024-2025
| Nhà sản xuất | Tên NPU | TOPS (INT8) | Sản phẩm điển hình |
|---|---|---|---|
| Intel | NPU 3.0 / 4.0 | 48 TOPS | Core Ultra Series 2 (Lunar Lake), Core Ultra Series 1 (Meteor Lake) |
| AMD | XDNA 2 | 50 TOPS | Ryzen AI 300 Series (Strix Point) |
| Qualcomm | Hexagon NPU | 45 TOPS | Snapdragon X Elite / Plus |
| Apple | Neural Engine | 38 TOPS | M4 (iPad Pro), M3/M4 MacBook |
Con số TOPS (Trillion Operations Per Second) thường quy đổi INT8. Thực tế hiệu năng FP16/BF16 quan trọng hơn cho LLM quantized.

Ứng dụng thực tế: NPU chạy cái gì hôm nay?
Windows 11 24H2+ tích hợp Windows Copilot Runtime, cho phép các ứng dụng gọi NPU qua DirectML/ONNX Runtime. Các trường hợp dùng phổ biến:
- Windows Studio Effects: Làm mờ nền, liên mắt, khung hình tự động — 100% NPU, không tốn GPU.
- Live Captions / Translation: Phụ đề real-time ngoại tuyến, dịch ngôn ngữ trên thiết bị.
- Recall (Copiolet+ PC): Chụp màn hình liên tục, index bằng embedding vector, tìm kiếm ngữ nghĩa.
- Ứng dụng creative: Photoshop Neural Filters, DaVinci Resolve Magic Mask, Topaz Video AI — tăng tốc 3-10x so với CPU.
- LLM cục bộ: Phi-3 Mini, Gemma 2 2B, Llama 3.2 1B/3B chạy 10-30 token/s trên NPU qua ONNX Runtime GenAI hoặc llama.cpp backend NPU.
Benchmark thực tế: NPU vs GPU vs CPU trên LLM nhỏ
Thử nghiệm nội bộ trên laptop Core Ultra 7 258V (NPU 48 TOPS, Arc GPU 8 Xe-cores) chạy Phi-3 Mini 4K context, batch size 1:
- NPU (INT4, ONNX Runtime GenAI): 18 token/s, 4.2W package power.
- Arc GPU (INT4, llama.cpp Vulkan): 28 token/s, 18W package power.
- CPU (P-cores, llama.cpp): 8 token/s, 12W package power.
Kết quả: NPU thắng về hiệu năng/watt (4.3 tok/s/W) so với GPU (1.6 tok/s/W) và CPU (0.7 tok/s/W). Tuy nhiên, throughput tuyệt đối GPU vẫn cao hơn nhờ nhiều compute unit. Cho ứng dụng chatbot single-user, NPU đủ và tiết kiệm pin đáng kể.
Hệ sinh thái phần mềm: Chuẩn hóa đang đến
ONNX Runtime Web (WASM) cho phép chạy model NPU trong trình duyệt. IREE (Intermediate Representation Execution Environment) từ Google/LLVM community đang phát triển compiler thống nhất cho NPU/GPU/CPU — hỗ trợ HLO, TorchScript, TFLite input. Windows App SDK 1.6+ cung cấp Windows.AI namespace, gọi NPU qua WinML backend tự động chọn hardware tối ưu. macOS 15+ có Core ML 7 với MLTensor API mới, tối ưu cho Neural Engine. Linux kernel 6.10+ đưa DRM accelerator subsystem (accel) để userspace driver NPU chung.
Mỗi vendor tự xây SDK: Intel OpenVINO, AMD Ryzen AI Software, Qualcomm AI Engine Direct, Apple Core ML. Nhà phát triển phải build riêng cho từng nền tảng. Microsoft đẩy DirectML + ONNX Runtime làm lớp trừu tượng, nhưng độ thành thục chưa đồng đều. Linux support vẫn sơ sài — chủ yếu qua DRM kernel driver + vendor userspace blob.
Tương lai: NPU everywhere, từ điện thoại đến server edge
Xu hướng rõ rệt: NPU sẽ có mặt trên mọi SoC consumer. Intel Camar 2025 mang NPU 5.0 (>100 TOPS), AMD XDNA 3 dự kiến 2026. Server edge (Intel Xeon 6, AMD EPYC 9005) cũng tích hợp NPU cho inference density cao. Chuẩn hóa phần mềm (ONNX, IREE, MLIR) sẽ quyết định ai thắng cuộc — không phải con số TOPS trên giấy tờ.
Tóm lại: NPU không thay thế CPU/GPU, nó bổ sung — chuyên xử lý AI inference hiệu năng/watt cao, bảo mật, độ trễ thấp. Khi mua laptop 2024+, hãy xem spec NPU TOPS và hỗ trợ phần mềm (Copilot+ PC certification) thay vì chỉ quan tâm CPU GHz.
Nguồn: Intel NPU Architecture | AMD Ryzen AI | Qualcomm AI Engine | Apple Neural Engine
