
SGLang là gì?
SGLang là framework serving engine dành cho LLM và multimodal models, được phát triển dưới dự án LMSYS. Framework này tập trung vào throughput cực cao và độ trễ thấp — phù hợp triển khai mô hình ngôn ngữ lớn ở quy mô từ single GPU đến cluster hàng chục nghìn GPU. Điểm nổi bật của SGLang là khả năng phục vụ hàng trăm ngàn GPU trên toàn cầu, xử lý hàng nghìn tỷ token mỗi ngày trong môi trường production của nhiều công ty lớn như xAI, NVIDIA, AMD, Google Cloud, AWS và Azure.
Khác với vLLM hay TensorRT-LLM, SGLang nhấn mạnh vào kernel-level optimizations: RadixAttention prefix caching, zero-overhead CPU scheduler, paged attention, speculative decoding (DFlash/Spec V2) và disaggregation giữa prefill/decode. Những kỹ thuật này giúp tăng throughput 3–25x tùy hardware. Framework còn cung cấp một runtime thống nhất với router, scheduler và nhiều chế độ parallel — giúp người vận hành chỉ cần một công cụ cho cả thử nghiệm và production.
Kiến trúc nền tảng
SGLang chia thành các thành phần chính hoạt động phối hợp trong một pipeline serving hoàn chỉnh:
- RadixAttention: prefix caching giảm tính toán lặp lại khi nhiều request chia sẻ prompt prefix giống nhau. Đóng góp 5x throughput theo benchmark chính thức. Với workload agentic — nơi nhiều request dùng chung system prompt và lịch sử hội thoại — hiệu quả prefix caching còn rõ rệt hơn.
- Zero-overhead CPU scheduler: giảm overhead CPU khi phân phối batch, tránh bottleneck host-side. Scheduler chạy gần như không tốn chi phí nên GPU không bao giờ phải chờ CPU xử lý xong.
- PagedAttention: quản lý KV cache giống paging trong OS, giảm fragmentation bộ nhớ GPU.
- Prefill-Decode disaggregation (PD): tách prefill và decode sang phần cứng riêng, cải thiện resource utilization lên đến 3.8x prefill và 4.8x decode trên NVIDIA GB200.
- Speculative decoding: sử dụng draft model để dự đoán token trước, xác nhận song song bằng target model — giảm số lần truy cập memory và tăng tốc sinh token đáng kể. SGLang có hai biến thể mới là DFlash và Spec V2.
- Continuous batching: chèn request mới vào batch đang chạy thay vì chờ batch cũ kết thúc, nhờ đó giữ GPU luôn bận rộn.

Hiệu năng trên hardware khác nhau
SGLang hỗ trợ đa nền tảng hardware: NVIDIA GB200/B300/H100/A100, AMD MI300/MI355, Intel Xeon CPU, Google TPU, Ascend NPU của Huawei. Đây là ưu thế so với TensorRT-LLM chủ yếu NVIDIA-only. Với hạ tầng đa vendor, SGLang tránh được bài toán vendor lock-in — bạn có thể chạy cùng một mã nguồn trên cluster NVIDIA hay AMD mà không cần viết lại inference code.
Con số ấn tượng: GLM5.2 NVFP4 đạt 500 TPS cho agentic workloads trong vòng 2 tuần triển khai trên GB200. GB300 NVL72 đạt 25x throughput improvement. DeepSeek MLA được tăng tốc 7x ngay từ phiên bản v0.3. Hơn 400.000 GPU trên toàn cầu chạy SGLang mỗi ngày, và framework được dùng làm rollout backend cho reinforcement learning của nhiều công ty frontier AI.
Đáng chú ý, SGLang liên tục ra mắt tính năng mới: release v0.5.18 (tháng 8/2026) góp 710 pull request từ 212 contributor, hỗ trợ các model Muse Glimmer, Intern-S2-Mobius, SANA-Video và cơ chế overlapped checkpoint staging giúp Qwen3-32B khởi động nhanh hơn 8.6–11.7%. Tháng 6/2026 thêm day-0 support cho Nemotron 3 Ultra/Super và Higgs Audio v3 TTS.
Hỗ trợ mô hình đa dạng
SGLang hỗ trợ ngày phát hành chính thức (day-0 support) cho các mô hình mới: Llama, Qwen2/Qwen3, DeepSeek V2/V3/V4, Kimi K3, GLM, Gemma, Mistral, Nemotron. Ngoài LLM còn hỗ trợ embedding models, reward models và diffusion models như WAN series, Qwen-Image.
Cấu trúc project khuyến nghị dùng SGLang với GitHub repository: runtime engine + router + scheduler. Tích hợp đơn giản với Hugging Face models và OpenAI API compatibility layer — nghĩa là hầu hết ứng dụng viết cho OpenAI API đều có thể trỏ sang SGLang mà không đổi code.

Cài đặt và sử dụng cơ bản
Bắt đầu nhanh với pip:
pip install sglang[all]
# khởi động server với mô hình Qwen
python -m sglang.launch_server
--model-path Qwen/Qwen2.5-7B-Instruct
--port 30000
# gọi API theo chuẩn OpenAI
curl http://localhost:30000/v1/chat/completions
-H "Content-Type: application/json"
-d '{"model":"Qwen2.5-7B-Instruct",
"messages":[{"role":"user","content":"Xin chào!"}]}'
SGLang còn hỗ trợ structured output qua constrained decoding với finite state machine — ép model sinh đúng JSON schema hoặc regex. Tính năng này hữu ích cho các ứng dụng agent cần output chuẩn để parse tự động, tốc độ sinh JSON nhanh gấp 3 lần so với cách thông thường.
Khi nào dùng SGLang?
Nên dùng SGLang khi cần throughput cực cao (hơn 1.000 TPS), hoặc triển khai trên AMD/Intel/TPU, hoặc khi cần structured output generation với JSON schema hoặc constrained decoding. Framework cũng phù hợp khi cần multi-LoRA batching — phục vụ nhiều mô hình tinh chỉnh LoRA trong một batch duy nhất, giúp tiết kiệm bộ nhớ đáng kể khi vận hành hàng chục variant model.
Đối với dịch vụ đơn giản dưới 100 concurrent users, FastAPI + vLLM basic mode vẫn đủ. SGLang phát huy ưu thế khi scale lên hoặc khi hardware không phải NVIDIA. Nếu bạn đang vận hành inference service lớn hoặc xây dựng sản phẩm AI agent với yêu cầu độ trễ thấp, SGLang là lựa chọn đáng cân nhắc hàng đầu hiện nay.
So sánh nhanh với vLLM và TensorRT-LLM
| Tính năng | SGLang | vLLM | TensorRT-LLM |
|---|---|---|---|
| Prefix caching | RadixAttention | Có | Có |
| Speculative decoding | DFlash + Spec V2 | Cơ bản | Lookahead decoding |
| Non-NVIDIA GPU | AMD, TPU, Ascend | Hạn chế | Không |
| Structured output | FSM constrained | Logit bias | Có |
| Quantization | FP4/FP8/INT4/AWQ/GPTQ | FP8/INT4/AWQ/GPTQ | FP8/INT4/FP16 |
| Multi-LoRA batching | Có | Mới thêm | Không |
| Diffusion model | Có (SGLang Diffusion) | Không | Không |
Tổng kết
SGLang đang trở thành một trong những serving engine hàng đầu cho LLM inference trong ecosystem open source. Nếu bạn cần throughput cao, hardware đa dạng và khả năng scale lớn, SGLang xứng đáng nằm trong shortlist. Bắt đầu với tài liệu chính thức.
