
Ollama là công cụ mã nguồn mở giúp chạy AI local trên máy tính cá nhân mà không cần phụ thuộc vào cloud. Với hơn 177.000 sao trên GitHub và kho model phong phú, Ollama đang trở thành lựa chọn hàng đầu cho những ai muốn trải nghiệm AI hoàn toàn riêng tư và miễn phí.
Ollama là gì và tại sao nên dùng?
Ollama là một nền tảng mã nguồn mở dựa trên llama.cpp, cho phép bạn tải về và chạy các mô hình ngôn ngữ lớn (LLM) ngay trên máy tính cá nhân. Tất cả dữ liệu xử lý đều diễn ra cục bộ, không gửi lên server nào, đảm bảo quyền riêng tư tuyệt đối.
Phiên bản hiện tại là Ollama v0.32.6 (tháng 8/2026), hỗ trợ hơn 100 model từ các nhà phát triển lớn nhất trong ngành AI. Với một câu lệnh đơn giản, bạn có thể chạy Gemma 4 của Google, DeepSeek-R1, Qwen 3 của Alibaba hay Llama 3.1 của Meta.
Cài đặt Ollama trên mọi nền tảng
Ollama hỗ trợ macOS, Windows, Linux và Docker. Quá trình cài đặt cực kỳ đơn giản:
Linux / macOS
Chỉ cần một dòng lệnh:
curl -fsSL https://ollama.com/install.sh | sh
Windows
PowerShell hoặc tải installer trực tiếp từ ollama.com/download.
Chạy model đầu tiên
Sau khi cài đặt xong, chỉ cần nhập:
ollama run gemma4
Ollama sẽ tự động tải model về lần đầu và bắt đầu phiên chat ngay lập tức. Kích thước model từ 1GB (Gemma 4 e2b) đến hàng chục GB, tùy cấu hình phần cứng của bạn.
Yêu cầu phần cứng
Yêu cầu RAM/VRAM phụ thuộc vào kích thước model bạn muốn chạy:
- Model 1B-3B: 2-4 GB RAM — chạy mượt trên laptop văn phòng
- Model 7B: 4-8 GB RAM — phù hợp PC phổ thông
- Model 14B: 8-16 GB RAM — cần máy cấu hình khá
- Model 70B+: 32-64 GB RAM — cần workstation hoặc dùng quantization
Về card đồ họa, Ollama hỗ trợ tự động offload GPU trên:
- NVIDIA: Compute capability 5.0+, driver 550+
- AMD Radeon: Hỗ trợ qua ROCm
- Apple Silicon: Tự động sử dụng Metal (M1/M2/M3/M4)
- CPU-only: Fallback trên mọi CPU x86_64/ARM64
Các model AI phổ biến trên Ollama
| Model | Nhà phát triển | Kích thước | Đặc điểm |
|---|---|---|---|
| Gemma 4 | e2b đến 31b | Vision, thinking, audio — model mới nhất | |
| Llama 3.1 | Meta | 8B đến 405B | Tool calling, đa kích thước |
| DeepSeek-R1 | DeepSeek | 1.5B đến 671B | Tư duy phản hồi (thinking), lý luận mạnh |
| Qwen 3.5 | Alibaba | 0.8B đến 122B | Vision, tools, thinking — model mới nhất của Qwen |
| Mistral | Mistral AI | 7B | Nhẹ, nhanh, hỗ trợ tool calling |
| Phi-4 | Microsoft | 14B | Tối ưu cho tác vụ suy luận |
| LLaVA | Community | 7B đến 34B | Vision — phân tích hình ảnh |
Tính năng nổi bật của Ollama
REST API tương thích OpenAI
Ollama chạy server local tại localhost:11434 với API tương thích định dạng OpenAI. Bạn có thể tích hợp Ollama vào bất kỳ ứng dụng nào đang dùng OpenAI API bằng cách đổi base URL.
SDK Python và JavaScript
- Python:
pip install ollama - JavaScript:
npm i ollama
Cả hai SDK đều hỗ trợ streaming, vision, structured output và tool calling.
Modelfile tùy chỉnh
Bạn có thể tạo Modelfile để tùy chỉnh system prompt, temperatura, top-p và các tham số khác cho từng model, sau đó build bằng lệnh ollama create.
Tích hợp đa nền tảng
Ollama tích hợp trực tiếp với nhiều công cụ phát triển phổ biến:
- Claude Code — dùng Ollama làm backend code assistant
- Codex CLI — hỗ trợ model local
- GitHub Copilot, OpenCode, OpenClaw (WhatsApp/Telegram/Slack bot)
- Hơn 100 ứng dụng cộng đồng tích hợp sẵn
Cách dùng Ollama cho lập trình viên
Với lập trình viên, Ollama mang lại giá trị lớn khi chạy local LLM làm trợ lý code:
- Code completion: Dùng model code-specialized như Qwen 2.5-Coder (32B) hoặc DeepSeek-Coder
- Code review: Gửi đoạn code và yêu cầu model phân tích lỗi tiềm ẩn
- Document generation: Tự động tạo docstring, README, comment cho codebase
- Test generation: Tạo unit test dựa trên hàm được viết
Đặc biệt, với Qwen 2.5-Coder (hơn 20 triệu lượt tải), bạn có thể chạy trợ lý code hoàn toàn offline, không cần subscription ChatGPT hay GitHub Copilot.
Ollama vs các giải pháp cloud
| Tiêu chí | Ollama Local | ChatGPT/Gemini Cloud |
|---|---|---|
| Chi phí | Miễn phí vĩnh viễn | Free tier hạn chế, Pro $20/tháng |
| Quyền riêng tư | 100% dữ liệu ở local | Dữ liệu gửi lên server |
| Hiệu suất | Phụ thuộc phần cứng cá nhân | Nhanh, ổn định trên cloud |
| Model mới nhất | Cập nhật nhanh, 100+ model | Riêng biệt theo nền tảng |
| Kết nối internet | Không cần | Bắt buộc |
| Đa model | Chạy nhiều model đồng thời | Mỗi plan một model |
Ollama là giải pháp lý tưởng cho ai muốn trải nghiệm AI free, riêng tư và linh hoạt. Dù không thể cạnh tranh với cloud về hiệu suất trên model lớn, khả năng chạy offline và tổng chi phí bằng không khiến Ollama trở thành lựa chọn hấp dẫn cho cả người dùng cá nhân và doanh nghiệp nhỏ.
Tham khảo:
