SGLang là gì?

SGLang là gì?

SGLang là framework serving engine dành cho LLM và multimodal models, được phát triển dưới dự án LMSYS. Framework này tập trung vào throughput cực cao và độ trễ thấp — phù hợp triển khai mô hình ngôn ngữ lớn ở quy mô từ single GPU đến cluster hàng chục nghìn GPU. Điểm nổi bật của SGLang là khả năng phục vụ hàng trăm ngàn GPU trên toàn cầu, xử lý hàng nghìn tỷ token mỗi ngày trong môi trường production của nhiều công ty lớn như xAI, NVIDIA, AMD, Google Cloud, AWS và Azure.

Khác với vLLM hay TensorRT-LLM, SGLang nhấn mạnh vào kernel-level optimizations: RadixAttention prefix caching, zero-overhead CPU scheduler, paged attention, speculative decoding (DFlash/Spec V2) và disaggregation giữa prefill/decode. Những kỹ thuật này giúp tăng throughput 3–25x tùy hardware. Framework còn cung cấp một runtime thống nhất với router, scheduler và nhiều chế độ parallel — giúp người vận hành chỉ cần một công cụ cho cả thử nghiệm và production.

Kiến trúc nền tảng

SGLang chia thành các thành phần chính hoạt động phối hợp trong một pipeline serving hoàn chỉnh:

  • RadixAttention: prefix caching giảm tính toán lặp lại khi nhiều request chia sẻ prompt prefix giống nhau. Đóng góp 5x throughput theo benchmark chính thức. Với workload agentic — nơi nhiều request dùng chung system prompt và lịch sử hội thoại — hiệu quả prefix caching còn rõ rệt hơn.
  • Zero-overhead CPU scheduler: giảm overhead CPU khi phân phối batch, tránh bottleneck host-side. Scheduler chạy gần như không tốn chi phí nên GPU không bao giờ phải chờ CPU xử lý xong.
  • PagedAttention: quản lý KV cache giống paging trong OS, giảm fragmentation bộ nhớ GPU.
  • Prefill-Decode disaggregation (PD): tách prefill và decode sang phần cứng riêng, cải thiện resource utilization lên đến 3.8x prefill và 4.8x decode trên NVIDIA GB200.
  • Speculative decoding: sử dụng draft model để dự đoán token trước, xác nhận song song bằng target model — giảm số lần truy cập memory và tăng tốc sinh token đáng kể. SGLang có hai biến thể mới là DFlash và Spec V2.
  • Continuous batching: chèn request mới vào batch đang chạy thay vì chờ batch cũ kết thúc, nhờ đó giữ GPU luôn bận rộn.

Hệ thống server GPU hiệu năng cao phục vụ mô hình AI trong trung tâm dữ liệu

Hiệu năng trên hardware khác nhau

SGLang hỗ trợ đa nền tảng hardware: NVIDIA GB200/B300/H100/A100, AMD MI300/MI355, Intel Xeon CPU, Google TPU, Ascend NPU của Huawei. Đây là ưu thế so với TensorRT-LLM chủ yếu NVIDIA-only. Với hạ tầng đa vendor, SGLang tránh được bài toán vendor lock-in — bạn có thể chạy cùng một mã nguồn trên cluster NVIDIA hay AMD mà không cần viết lại inference code.

Con số ấn tượng: GLM5.2 NVFP4 đạt 500 TPS cho agentic workloads trong vòng 2 tuần triển khai trên GB200. GB300 NVL72 đạt 25x throughput improvement. DeepSeek MLA được tăng tốc 7x ngay từ phiên bản v0.3. Hơn 400.000 GPU trên toàn cầu chạy SGLang mỗi ngày, và framework được dùng làm rollout backend cho reinforcement learning của nhiều công ty frontier AI.

Đáng chú ý, SGLang liên tục ra mắt tính năng mới: release v0.5.18 (tháng 8/2026) góp 710 pull request từ 212 contributor, hỗ trợ các model Muse Glimmer, Intern-S2-Mobius, SANA-Video và cơ chế overlapped checkpoint staging giúp Qwen3-32B khởi động nhanh hơn 8.6–11.7%. Tháng 6/2026 thêm day-0 support cho Nemotron 3 Ultra/Super và Higgs Audio v3 TTS.

Hỗ trợ mô hình đa dạng

SGLang hỗ trợ ngày phát hành chính thức (day-0 support) cho các mô hình mới: Llama, Qwen2/Qwen3, DeepSeek V2/V3/V4, Kimi K3, GLM, Gemma, Mistral, Nemotron. Ngoài LLM còn hỗ trợ embedding models, reward models và diffusion models như WAN series, Qwen-Image.

Cấu trúc project khuyến nghị dùng SGLang với GitHub repository: runtime engine + router + scheduler. Tích hợp đơn giản với Hugging Face models và OpenAI API compatibility layer — nghĩa là hầu hết ứng dụng viết cho OpenAI API đều có thể trỏ sang SGLang mà không đổi code.

Trung tâm dữ liệu với dây cáp mạng và rack server lớn

Cài đặt và sử dụng cơ bản

Bắt đầu nhanh với pip:

pip install sglang[all]

# khởi động server với mô hình Qwen
python -m sglang.launch_server 
  --model-path Qwen/Qwen2.5-7B-Instruct 
  --port 30000

# gọi API theo chuẩn OpenAI
curl http://localhost:30000/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model":"Qwen2.5-7B-Instruct",
       "messages":[{"role":"user","content":"Xin chào!"}]}'

SGLang còn hỗ trợ structured output qua constrained decoding với finite state machine — ép model sinh đúng JSON schema hoặc regex. Tính năng này hữu ích cho các ứng dụng agent cần output chuẩn để parse tự động, tốc độ sinh JSON nhanh gấp 3 lần so với cách thông thường.

Khi nào dùng SGLang?

Nên dùng SGLang khi cần throughput cực cao (hơn 1.000 TPS), hoặc triển khai trên AMD/Intel/TPU, hoặc khi cần structured output generation với JSON schema hoặc constrained decoding. Framework cũng phù hợp khi cần multi-LoRA batching — phục vụ nhiều mô hình tinh chỉnh LoRA trong một batch duy nhất, giúp tiết kiệm bộ nhớ đáng kể khi vận hành hàng chục variant model.

Đối với dịch vụ đơn giản dưới 100 concurrent users, FastAPI + vLLM basic mode vẫn đủ. SGLang phát huy ưu thế khi scale lên hoặc khi hardware không phải NVIDIA. Nếu bạn đang vận hành inference service lớn hoặc xây dựng sản phẩm AI agent với yêu cầu độ trễ thấp, SGLang là lựa chọn đáng cân nhắc hàng đầu hiện nay.

So sánh nhanh với vLLM và TensorRT-LLM

Tính năng SGLang vLLM TensorRT-LLM
Prefix caching RadixAttention
Speculative decoding DFlash + Spec V2 Cơ bản Lookahead decoding
Non-NVIDIA GPU AMD, TPU, Ascend Hạn chế Không
Structured output FSM constrained Logit bias
Quantization FP4/FP8/INT4/AWQ/GPTQ FP8/INT4/AWQ/GPTQ FP8/INT4/FP16
Multi-LoRA batching Mới thêm Không
Diffusion model Có (SGLang Diffusion) Không Không

Tổng kết

SGLang đang trở thành một trong những serving engine hàng đầu cho LLM inference trong ecosystem open source. Nếu bạn cần throughput cao, hardware đa dạng và khả năng scale lớn, SGLang xứng đáng nằm trong shortlist. Bắt đầu với tài liệu chính thức.

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

LangGraph: Framework AI Agent trạng thái dựa trên đồ thị

LangGraph là gì? LangGraph là framework mã nguồn mở do LangChain AI phát triển, chuyên dụng để xây dựng các AI Agent có trạng thái phức tạp. Khác với các…

Xem thêm

LLM Inference Optimization: vLLM, TGI, llama.cpp, TensorRT-LLM so sánh chi tiết

LLM Inference Optimization: vLLM, TGI, llama.cpp, TensorRT-LLM so sánh chi tiết Sau khi huấn luyện xong LLM, phần tốn kém nhất là inference — chạy mô hình để sinh văn…

Xem thêm

Prompt Engineering Cơ Bản: Kỹ thuật tối ưu prompt cho LLM hiệu quả

Prompt Engineering Cơ Bản: Kỹ thuật tối ưu prompt cho LLM hiệu quả Prompt engineering là nghệ thuật viết hướng dẫn (prompt) để large language model (LLM) trả về kết…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất