
Ollama: Chạy LLM Trên Local Không Cần Internet
Ollama là công cụ mã nguồn mở cho phép chạy các mô hình ngôn ngữ lớn (LLM) trực tiếp trên máy tính cá nhân mà không cần kết nối internet. Với Ollama, developer có thể sử dụng các mô hình như Llama 3, Gemma, Qwen, DeepSeek ngay trên máy của mình, đảm bảo quyền riêng tư dữ liệu và giảm chi phí vận hành.


Ollama Là Gì?
Ollama là một application nhẹ, chạy trên macOS, Linux và Windows. Nó đóng gói mô hình LLM dưới dạng Docker-like images, cho phép người dùng tải về và chạy chỉ bằng một lệnh đơn giản. Ollama tự động xử lý việc quản lý VRAM, tải model từ HuggingFace, và phục vụ inference qua API REST tại http://localhost:11434.
Dự án Ollama được tạo ra để giải quyết vấn đề lớn nhất khi chạy LLM local: cài đặt phức tạp. Trước Ollama, developer phải tự cài dựng llama.cpp, cấu hình CUDA hoặc Metal, quản lý định dạng model. Ollama đơn giản hóa tất cả thành một trải nghiệm tương tự Docker: ollama run modelname là xong.
Cài Đặt Ollama
- macOS: Tải từ ollama.com/download hoặc cài qua Homebrew:
brew install ollama - Linux:
curl -fsSL https://ollama.com/install.sh | sh - Windows: Tải installer từ trang chủ, cài đặt như phần mềm thông thường
- Docker:
docker run -d -p 11434:11434 ollama/ollama
Sau khi cài đặt, Ollama tự động khởi chạy server ở chế độ nền. Kiểm tra bằng lệnh ollama --version để xác nhận.
Các Mô Hình Phổ Biến
| Mô hình | Tham số | Mục đích |
|---|---|---|
| Llama 3.1 | 8B / 70B / 405B | Đa năng, mạnh mẽ, hỗ trợ tiếng Việt tốt |
| Gemma 2 | 2B / 9B / 27B | Nhẹ, hiệu quả, phù hợp cho laptop cá nhân |
| Qwen 2.5 | 7B / 14B / 72B | Đa ngôn ngữ, coding mạnh |
| DeepSeek | V3 / R1 | Reasoning, coding, math chuyên sâu |
| Mistral | 7B / 8x7B | Nhanh, chất lượng cao, mã nguồn mở |
Cách tải mô hình:
ollama pull llama3.1
ollama pull qwen2.5:14b

Sử Dụng Ollama
Sau khi cài đặt, chạy mô hình rất đơn giản:
ollama pull llama3.1— Tải mô hình vềollama run llama3.1— Chạy mô hình trong interactive chat, trò chuyện trực tiếpollama serve— Khởi chạy API server tại localhost:11434 để tích hợp với ứng dụngollama list— Liệt kê các mô hình đã tải vềollama rm modelname— Xóa mô hình khỏi máy
Tích Hợp Với Coding Agent
Ollama hỗ trợ nhiều coding agent và IDE phổ biến như Claude Code, Cursor, Codex, và Hermes Agent. Chỉ cần đặt OLLAMA_BASE_URL=http://localhost:11434, các agent sẽ dùng LLM local thay vì gọi API đám mây.
Điều này đặc biệt quan trọng khi xử lý dữ liệu nhạy cảm: codebase riêng, tài liệu nội bộ, hoặc thông tin cá nhân không bao giờ rời khỏi máy tính của bạn.
Ưu Điểm Khi Chạy Local
- Bảo mật: Dữ liệu không rời khỏi máy, không gửi cho bên thứ ba
- Miễn phí: Không trả phí API mỗi request, không giới hạn token
- Tùy chỉnh: Chọn bất kỳ mô hình open-source nào, tinh chỉnh theo nhu cầu riêng
- Ổn định: Không phụ thuộc vào uptime hay rate limit của nhà cung cấp
- Privateness: Hỗ trợ các tác vụ RAG, trích xuất thông tin từ tài liệu nội bộ
Yêu Cầu Phần Cứng
Hiệu suất phụ thuộc vào VRAM GPU. Quy tắc ước tính: 1B tham số ≈ 2GB VRAM (quantized Q4). Mac Apple Silicon (M1/M2/M3/M4) với unified memory hoạt động tốt nhờ Metal, cho phép chạy mô hình lớn hơn trên laptop. CPU cũng hỗ trợ nhưng chậm hơn đáng kể, phù hợp cho thử nghiệm.
| Cấu hình | Mô hình phù hợp | Tốc độ ước tính |
|---|---|---|
| 8GB VRAM | 7B model (Q4) | ~10-20 token/s |
| 16GB VRAM | 13B model (Q4) | ~20-40 token/s |
| 24GB+ VRAM | 30B+ model (Q4) | ~40-80 token/s |
Kết Luận
Ollama democratizes AI bằng cách cho phép bất kỳ ai cũng có thể chạy LLM trên máy cá nhân. Dù bạn là developer muốn giữ dữ liệu riêng, researcher thử nghiệm mô hình, hay hobbyist khám phá AI, Ollama là điểm xuất phát lý tưởng. Community đóng góp hàng trăm mô hình, tài liệu hướng dẫn chi tiết, và các tích hợp phong phú.
So Sánh Ollama Với Các Giải Pháp Khác
Ngoài Ollama, có một số giải pháp khác để chạy LLM local như LM Studio, GPT4All, và Jan. Mỗi công cụ có ưu nhược điểm riêng. LM Studio có giao đồ họa đẹp hơn nhưng tải model chậm hơn. GPT4All đơn giản nhưng hỗ trợ ít model. Jan đang phát triển nhanh nhưng chưa ổn định. Ollama nổi bật nhờ cộng đồng lớn, tài liệu phong phú, và API REST chuẩn để tích hợp dễ dàng.
So sánh hiệu suất: Ollama với Metal trên Apple Silicon thường nhanh hơn GPT4All 20-30% nhờ tối ưu tốt hơn. Khi cần tích hợp vào ứng dụng, Ollama API rõ ràng hơn vì hỗ trợ format OpenAI-compatible, giúp chuyển đổi từ API đám mây sang local một cách dễ dàng.
Xem thêm GitHub repository và tài liệu chính thức để biết thêm chi tiết.
