
Ollama là công cụ chạy mô hình ngôn ngữ lớn (LLM) trực tiếp trên máy tính cá nhân, hoàn toàn miễn phí, không cần GPU đắt tiền hay kết nối internet. Bài viết hướng dẫn cài đặt, các mô hình phổ biến, tối ưu hiệu năng và so sánh với các giải pháp cloud.
Ollama là gì? Tại sao lại phổ biến?
Ollama là framework open-source đóng gói các mô hình LLM (Llama, Mistral, Gemma, Qwen) thành file binary đơn lẻ, quản lý phụ thuộc tự động. Chạy trên CPU, Apple Silicon M-series, NVIDIA GPU và AMD GPU. Kết quả: bạn tải mô hình 7B params trong 2 phút, chat offline hoàn toàn.
Theo trang chủ Ollama, dự án có hơn 100.000 sao trên GitHub, được sử dụng bởi hàng triệu developer toàn cầu.

Cài đặt Ollama trên Windows, macOS, Linux
Linux/macOS: chạy lệnh curl -fsSL https://ollama.com/install.sh | sh. Windows: tải file .exe từ trang chủ. Sau khi cài, kiểm tra ollama --version và chạy mô hình đầu tiên: ollama run llama3.
Yêu cầu phần cứng tối thiểu: 8GB RAM cho mô hình 7B, 16GB cho 13B, 32GB cho 33B. Apple Silicon chia sẻ RAM GPU nên hiệu năng tốt hơn so với x86 cùng cấu hình.
Các mô hình LLM phổ biến trên Ollama
| Mô hình | Params | Kích thước | Điểm mạnh |
|---|---|---|---|
| Llama 3.1 | 8B, 70B | 4.7GB – 40GB | Logic, code, đa ngôn ngữ |
| Mistral 7B / Nemo 12B | 7B, 12B | 4.1GB – 7.1GB | Tốc độ, tiếng Pháp, code |
| Gemma 2 | 2B, 9B, 27B | 1.6GB – 16GB | Nhẹ, Google tối ưu |
| Qwen 2.5 | 0.5B – 72B | 0.4GB – 43GB | Tiếng Việt, tiếng Trung tốt |
| Phi-3 Mini | 3.8B | 2.3GB | Siêu nhẹ, Microsoft |
Chạy mô hình tiếng Việt tốt nhất hiện nay: ollama run qwen2.5:7b hoặc ollama run qwen2.5:14b nếu RAM cho phép.

Tối ưu hiệu năng Ollama
- Quantization: Dùng GGUF 4-bit (q4_K_M) giảm 50% RAM, mất <5% chất lượng.
- GPU offload: Thêm
--gpu-layers 99chuyển toàn bộ trọng số lên VRAM (NVIDIA/AMD). - Context window: Mặc định 4K, tăng bằng
ollama run llama3 --num_ctx 8192. - Flash attention: Tự động bật trên GPU hỗ trợ, giảm 30% bộ nhớ context.
Ollama vs LM Studio vs vLLM vs llama.cpp
LM Studio có giao diện đồ họa, phù hợp người mới. vLLM tối ưu throughput cao cho server production. llama.cpp là lõi bên dưới Ollama. Ollama cân bằng giữa dễ dùng (CLI đơn giản) và hiệu năng (tự động dùng GPU khi có).
Ứng dụng thực tế: RAG local, code assistant, chatbot offline
Kết hợp Ollama với LangChain hoặc ollama-python để xây RAG local: nhúng tài liệu bằng nomic-embed-text, truy vấn LLM offline. Không dữ liệu ra khỏi máy, tuân thủ GDPR, HIPAA.
Ví dụ code assistant: ollama run codellama:7b kết hợp VS Code extension Continue, gợi ý code hoàn toàn cục bộ.
Hạn chế cần biết
Mô hình nhỏ (<8B) thường ảo giác nhiều, logic yếu. Cần 16GB+ RAM cho chất lượng tin cậy. Không cập nhật kiến thức tự động — phải pull mô hình mới thủ công. Không hỗ trợ function calling chuẩn OpenAI (đang phát triển).
Tóm lại: Ollama là cách nhanh nhất, miễn phí, an toàn nhất để chạy LLM cục bộ. Phù hợp cho developer, researcher, doanh nghiệp cần dữ liệu riêng tư. Bắt đầu hôm nay bằng ollama run qwen2.5:7b.
