
Meta vừa phát hành Llama 3.2, phiên bản mới nhất trong dòng mô hình ngôn ngữ lớn mã nguồn mở, mang đến khả năng multimodal thực sự cho các mô hình nhẹ 1B và 3B, cùng hai phiên bản vision 11B và 90B. Đây là bước tiến quan trọng khiến AI cục bộ trên thiết bị di động và edge trở nên khả thi hơn bao giờ hết.

Llama 3.2 là gì?
Llama 3.2 là bộ mô hình ngôn ngữ lớn (LLM) mới nhất từ Meta, ra mắt tháng 9/2024. Khác với Llama 3.1 chỉ tập trung vào text, Llama 3.2 giới thiệu khả năng hiểu hình ảnh (vision) và các mô hình nhỏ gọn (lightweight) được tối ưu cho chạy trên thiết bị (on-device).
Bộ mô hình gồm 4 phiên bản chính:
- Llama 3.2 1B: Mô hình text-only 1 tỷ tham số, chạy được trên điện thoại
- Llama 3.2 3B: Mô hình text-only 3 tỷ tham số, cân bằng tốc độ/khả năng
- Llama 3.2 11B Vision: Mô hình multimodal 11 tỷ tham số, hiểu hình ảnh + văn bản
- Llama 3.2 90B Vision: Mô hình multimodal 90 tỷ tham số, hiệu năng cao nhất
Kiến trúc và cải tiến kỹ thuật
Adapter vision tích hợp
Meta sử dụng cách tiếp cận vision adapter — gắn một image encoder (dựa trên SigLIP) vào Llama 3.1 thông qua cross-attention layers. Cách này bảo toàn khả năng text của mô hình gốc mà không cần train lại toàn bộ.
Quy trình train vision adapter diễn ra trong 2 giai đoạn:
- Pre-training: Train adapter trên cặp image-text lớn (định nghĩa khái niệm visual)
- Alignment: Fine-tune end-to-end trên dữ liệu instruction-following đa phương thức
Pruning và knowledge distillation cho mô hình nhỏ
Các phiên bản 1B và 3B được tạo ra bằng structured pruning (cắt tỉa có cấu trúc) từ Llama 3.1 8B, sau đó áp dụng knowledge distillation (chuyển giao tri thức) từ mô hình lớn hơn làm teacher. Kết quả: giữ được ~95% hiệu năng trên các benchmark text trong khi giảm 4-8x kích thước.

Hiệu năng thực tế
| Mô hình | MMLU | GSM8K | HumanEval | Kích thước (GGUF Q4_K_M) |
|---|---|---|---|---|
| Llama 3.2 1B | 49.3% | 45.2% | 28.7% | ~800 MB |
| Llama 3.2 3B | 63.1% | 68.9% | 42.3% | ~2.0 GB |
| Llama 3.2 11B Vision | 73.4% | 82.1% | 58.7% | ~7.2 GB |
| Llama 3.2 90B Vision | 84.2% | 91.5% | 71.8% | ~52 GB |
Với quantization GGUF Q4_K_M, Llama 3.2 3B chỉ chiếm ~2GB RAM, chạy được trên hầu hết smartphone hiện nay (iPhone 15 Pro, Galaxy S24, Pixel 8) với tốc độ 20-30 token/giây qua llama.cpp hoặc MLX.
Ứng dụng thực tế
AI agent cục bộ trên điện thoại
Llama 3.2 1B/3B cho phép chạy Ollama, llama.cpp, hoặc MLX hoàn toàn offline trên thiết bị. Điều này mở ra khả năng:
- Chatbot cá nhân không gửi dữ liệu ra cloud
- Tóm tắt email, tin nhắn, tài liệu local
- Code completion offline trong IDE di động
- Phân tích hình ảnh riêng tư (chụp màn hình, ảnh chụp màn hình)
Vision model nhẹ cho edge computing
Phiên bản 11B Vision cân bằng giữa hiệu năng và tài nguyên, phù hợp cho:
- Robot/hệ thống nhúng cần hiểu hình ảnh real-time
- Ứng dụng AR/VR xử lý scene understanding
- Kiểm soát chất lượng tự động trên dây chuyền sản xuất
Cách chạy Llama 3.2 cục bộ
Với Ollama (dễ nhất)
# Cài đặt Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Chạy Llama 3.2 3B
ollama run llama3.2:3b
# Chạy Llama 3.2 11B Vision
ollama run llama3.2:11b-vision
Với llama.cpp (tối ưu hiệu năng)
# Build llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make GGML_METAL=1
# Tải model GGUF từ Hugging Face
wget https://huggingface.co/bartowski/Llama-3.2-3B-Instruct-GGUF/resolve/main/Llama-3.2-3B-Instruct-Q4_K_M.gguf
# Chạy server
./llama-server -m Llama-3.2-3B-Instruct-Q4_K_M.gguf -c 8192 -ngl 99
Với MLX (tối ưu Apple Silicon)
pip install mlx-lm
python -c "
from mlx_lm import load, generate
model, tokenizer = load('mlx-community/Llama-3.2-3B-Instruct-4bit')
print(generate(model, tokenizer, prompt='Xin chào, Llama 3.2!'))
"
So sánh với đối thủ
| Mô hình | Loại | Kích thước | Multimodal | License |
|---|---|---|---|---|
| Llama 3.2 3B | Text | 3B | Không | Llama 3.2 Community License |
| Gemma 2 2B | Text | 2B | Không | Gemma License |
| Phi-3.5 Mini | Text | 3.8B | Không | MIT |
| Qwen 2.5 3B | Text | 3B | Không | Apache 2.0 |
| Llama 3.2 11B Vision | Multimodal | 11B | Có | Llama 3.2 Community License |
| Qwen 2.5-VL 7B | Multimodal | 7B | Có | Apache 2.0 |
Ưu thế của Llama 3.2: hệ sinh thái tooling thành숙 (llama.cpp, Ollama, MLX, vLLM, TGI), license cho phép thương mại (với một số hạn chế cho >700M user), và hiệu năng vision cạnh tranh so với Qwen 2.5-VL.
Hạn chế và lưu ý
- License Llama 3.2 Community: Yêu cầu chấp nhận điều khoản Meta, hạn chế sử dụng cho dịch vụ cạnh tranh trực tiếp với Meta
- Kiến thức cutoff: Dữ liệu train đến tháng 12/2023, thiếu thông tin mới nhất
- Vision 11B/90B: Chưa hỗ trợ video, chỉ hình ảnh tĩnh
- Mô hình 1B: Hiệu năng reasoning yếu, chỉ phù hợp task đơn giản (classification, extraction)
Kết luận
Llama 3.2 đánh dấu bước ngoặt khiến AI multimodal chạy local trên thiết bị tiêu dùng trở thành hiện thực. Với 3B text model chỉ 2GB và 11B vision model 7GB, developer có thể xây dựng ứng dụng AI riêng tư, phản hồi nhanh, không phụ thuộc cloud. Hệ sinh thái tooling sẵn có (Ollama, llama.cpp, MLX) làm cho việc triển khai trở nên đơn giản chưa từng có.
Nếu bạn đang tìm mô hình AI nhẹ cho ứng dụng mobile, edge device, hoặc cần vision model chạy offline — Llama 3.2 là lựa chọn hàng đầu hiện nay.
Nguồn: Meta AI Blog – Llama 3.2 Announcement, Hugging Face Llama 3.2 Collection
