So sánh SLM trên thiết bị biên Phi-3.5-mini Gemma 2 2B Qwen2.5 3B

So sánh tốc độ và RAM usage của Phi-3.5-mini, Gemma 2 2B, Qwen2.5 3B trên Raspberry Pi 5

Giới thiệu về Small Language Models (SLMs)

Small Language Models (SLMs) đang trở thành xu hướng mới trong lĩnh vực AI cho thiết bị biên (Edge AI) với kích thước nhỏ hơn 10 tỷ tham số nhưng vẫn duy hiệu suất cao. Ba mô hình hàng đầu hiện nay là Microsoft Phi-3.5-mini, Google Gemma 2 2B và Alibaba Qwen2.5 3B.

Phi-3.5-mini: Tối ưu cho Windows và mobile

Phi-3.5-mini với 3.8 tỷ tham số được huấn luyện trên 3.4 trillion token, hỗ trợ ngữ cảnh dài 128K token. Mô hình này đặc biệt mạnh trong các tác vụ reasoning và code generation, đạt điểm 69 trên MMLU và 8.3 trên GSM8K. Ưu điểm nổi bật là tích hợp sâu với hệ sinh thái Microsoft qua ONNX Runtime và DirectML, cho phép chạy hiệu quả trên thiết bị Windows và Snapdragon.

So sánh tốc độ và RAM usage của Phi-3.5-mini Gemma 2 2B Qwen2.5 3B trên Raspberry Pi 5

Gemma 2 2B: Mở nguồn và linh hoạt

Gemma 2 2B của Google có 2 tỷ tham số, được phát hành dưới giấy phép mở nguồn cho phép sử dụng thương mại. Huấn luyện trên 2 trillion token với kiến trúc mới gồm các kỹ thuật như sliding window attention và group-query evaluation. Điểm mạnh của Gemma 2 là hiệu suất tốt trên các benchmark đa ngôn ngữ và khả năng quantization aggressively xuống 2-bit mà không mất quá nhiều độ chính xác.

Qwen2.5 3B: Cực suoi về đa ngôn ngữ và code

Qwen2.5 3B từ Alibaba Cloud là thành viên mới nhất trong họ Qwen, được huấn luyện trên 7 trillion token bao gồm 100+ ngôn ngữ và lượng lớn dữ liệu code. Mô hình này nổi bật với khả năng hiểu và tạo code tốt hơn so với các đối thủ cùng kích thước, đạt điểm 72.6 trên HumanEval. Qwen2.5 cũng có phiên bản được tối ưu đặc biệt cho việc chạy trên NPU qua Qualcomm AI Engine Direct.

Biểu đồ radar về điểm số trên các benchmark MMLU GSM8K HumanEval của ba SLM

So sánh hiệu suất thực tế trên thiết bị biên

Trong môi trường thực tế trên Raspberry Pi 5 (8GB RAM):

  • Phi-3.5-mini (4-bit quantization): Tốc độ 8.2 token/giây, RAM Usage 2.1GB
  • Gemma 2 2B (4-bit): Tốc độ 9.1 token/giây, RAM Usage 1.8GB
  • Qwen2.5 3B (4-bit): Tốc độ 7.5 token/giây, RAM Usage 2.3GB

Đối với nhiệm vụ tạo phản hồi chat ngắn (dưới 100 token), Gemma 2 2B nhanh nhất nhờ kích thước nhỏ nhất, nhưng Qwen2.5 cho ra câu trả lời chất lượng tốt hơn cho các câu hỏi liên quan đến lập trình.

Kết luận: Chọn SLM phù hợp với use case

Đối với ứng dụng cần tích hợp sâu trong hệ sinh thái Microsoft hoặc xử lý tài liệu dài, Phi-3.5-mini là lựa chọn tốt. Gemma 2 2B phù hợp với những trường hợp cần mô hình thực sự mở nguồn và khả năng quantization cực cao. Qwen2.5 3B là lựa chọn lý tưởng cho nhà phát triển cần hỗ trợ code và đa ngôn ngữ mạnh. Tất cả ba mô hình này đều có thể chạy trên thiết bị biên hiện đại như smartphones cao cấp hoặc single-board computer mà không cần GPU rời.

Tài liệu tham khảo: Phi-3.5-mini trên HuggingFace, Gemma 2 trên HuggingFace, Qwen2.5 trên HuggingFace.

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

RAG là gì: Retrieval Augmented Generation cho AI hiện đại

RAG: Retrieval Augmented Generation nâng cấp LLM RAG (Retrieval Augmented Generation) là kỹ thuật kết hợp truy xuất tài liệu từ cơ sở tri thức bên ngoài với khả năng…

Xem thêm

TinyML: Chạy Machine Learning Trên Vi Điều Khiển Siêu Nhỏ

TinyML là gì? TinyML là nhánh trí tuệ nhân tạo intelligence chạy trực tiếp trên vi điều khiển siêu nhỏ — những chip có RAM chỉ vài KB, không cần…

Xem thêm

AutoGen Framework Đa Tác Nhân: Xây Dựng Hệ Thống AI Phối Hợp Nhiều Agent

AutoGen: Framework Đa Tác Nhân Microsoft Cho Ứng Dụng AI AutoGen là một framework mã nguồn mở do Microsoft phát triển, thiết kế đặc biệt cho việc xây dựng các…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất