
Giới thiệu về Small Language Models (SLMs)
Small Language Models (SLMs) đang trở thành xu hướng mới trong lĩnh vực AI cho thiết bị biên (Edge AI) với kích thước nhỏ hơn 10 tỷ tham số nhưng vẫn duy hiệu suất cao. Ba mô hình hàng đầu hiện nay là Microsoft Phi-3.5-mini, Google Gemma 2 2B và Alibaba Qwen2.5 3B.
Phi-3.5-mini: Tối ưu cho Windows và mobile
Phi-3.5-mini với 3.8 tỷ tham số được huấn luyện trên 3.4 trillion token, hỗ trợ ngữ cảnh dài 128K token. Mô hình này đặc biệt mạnh trong các tác vụ reasoning và code generation, đạt điểm 69 trên MMLU và 8.3 trên GSM8K. Ưu điểm nổi bật là tích hợp sâu với hệ sinh thái Microsoft qua ONNX Runtime và DirectML, cho phép chạy hiệu quả trên thiết bị Windows và Snapdragon.

Gemma 2 2B: Mở nguồn và linh hoạt
Gemma 2 2B của Google có 2 tỷ tham số, được phát hành dưới giấy phép mở nguồn cho phép sử dụng thương mại. Huấn luyện trên 2 trillion token với kiến trúc mới gồm các kỹ thuật như sliding window attention và group-query evaluation. Điểm mạnh của Gemma 2 là hiệu suất tốt trên các benchmark đa ngôn ngữ và khả năng quantization aggressively xuống 2-bit mà không mất quá nhiều độ chính xác.
Qwen2.5 3B: Cực suoi về đa ngôn ngữ và code
Qwen2.5 3B từ Alibaba Cloud là thành viên mới nhất trong họ Qwen, được huấn luyện trên 7 trillion token bao gồm 100+ ngôn ngữ và lượng lớn dữ liệu code. Mô hình này nổi bật với khả năng hiểu và tạo code tốt hơn so với các đối thủ cùng kích thước, đạt điểm 72.6 trên HumanEval. Qwen2.5 cũng có phiên bản được tối ưu đặc biệt cho việc chạy trên NPU qua Qualcomm AI Engine Direct.

So sánh hiệu suất thực tế trên thiết bị biên
Trong môi trường thực tế trên Raspberry Pi 5 (8GB RAM):
- Phi-3.5-mini (4-bit quantization): Tốc độ 8.2 token/giây, RAM Usage 2.1GB
- Gemma 2 2B (4-bit): Tốc độ 9.1 token/giây, RAM Usage 1.8GB
- Qwen2.5 3B (4-bit): Tốc độ 7.5 token/giây, RAM Usage 2.3GB
Đối với nhiệm vụ tạo phản hồi chat ngắn (dưới 100 token), Gemma 2 2B nhanh nhất nhờ kích thước nhỏ nhất, nhưng Qwen2.5 cho ra câu trả lời chất lượng tốt hơn cho các câu hỏi liên quan đến lập trình.
Kết luận: Chọn SLM phù hợp với use case
Đối với ứng dụng cần tích hợp sâu trong hệ sinh thái Microsoft hoặc xử lý tài liệu dài, Phi-3.5-mini là lựa chọn tốt. Gemma 2 2B phù hợp với những trường hợp cần mô hình thực sự mở nguồn và khả năng quantization cực cao. Qwen2.5 3B là lựa chọn lý tưởng cho nhà phát triển cần hỗ trợ code và đa ngôn ngữ mạnh. Tất cả ba mô hình này đều có thể chạy trên thiết bị biên hiện đại như smartphones cao cấp hoặc single-board computer mà không cần GPU rời.
Tài liệu tham khảo: Phi-3.5-mini trên HuggingFace, Gemma 2 trên HuggingFace, Qwen2.5 trên HuggingFace.
