

Trong thời đại AI bùng nổ, phần lớn developer phải phụ thuộc vào API đám mây để sử dụng mô hình ngôn ngữ lớn (LLM). Điều này đồng nghĩa với chi phí API tăng theo usage, dữ liệu rời khỏi máy tính cá nhân, và không có kiểm soát hoàn toàn về quyền riêng tư. Ollama ra đời như một giải pháp thay đổi cuộc chơi.
Ollama Là Gì?
Ollama là phần mềm mã nguồn mở, miễn phí, cho phép người dùng tải và chạy các mô hình AI (LLM) trực tiếp trên máy tính cá nhân mà không cần kết nối internet sau khi tải model về. Ollama biến việc chạy AI local thành đơn giản như chạy một ứng dụng thông thường — chỉ cần một lệnh duy nhất.
- Tốc độ nhanh: tận dụng GPU cục bộ (local), xử lý inference trực tiếp trên phần cứng của bạn, không qua trung gian
- Riêng tư tuyệt đối: dữ liệu không rời khỏi máy tính, lý tưởng cho thông tin nhạy cảm, tài liệu nội bộ
- Đa dạng model: hỗ trợ hàng trăm mô hình từ cộng đồng — Llama 3, Mistral, Gemma, Phi-3, Qwen, DeepSeek và nhiều hơn nữa
- Cài đặt dễ dàng: một lệnh cài đặt trên macOS, Linux, Windows — không cần cấu hình phức tạp
- API OpenAI-compatible: tương thích với mọi tool đã hỗ trợ OpenAI API chỉ bằng đổi endpoint
Ollama đã trở thành công cụ không thể thiếu cho hàng triệu developer trên toàn cầu. Theo trang chủ chính thức, Ollama được tin cậy bởi hơn 9 triệu developer và tích hợp sẵn với Claude Code, Codex, OpenCode, Hermes Agent, OpenClaw, VS Code và nhiều công cụ khác.
Yêu Cầu Phần Cứng
Trước khi cài đặt, hãy kiểm tra phần cứng của bạn:
| Model | RAM tối thiểu | VRAM (GPU) | Tốc độ |
|---|---|---|---|
| Phi-3 Mini (3.8B) | 8GB RAM | Không bắt buộc | Nhanh trên CPU |
| Llama 3 8B | 16GB RAM | 8GB VRAM | Khá với GPU |
| Mistral 7B | 16GB RAM | 8GB VRAM | Khá với GPU |
| Gemma 2 9B | 16GB RAM | 8GB VRAM | Khá với GPU |
| Llama 3 70B | 64GB+ RAM | 40GB+ VRAM | Chậm trên CPU, cần server |
Với máy tính cá nhân thông thường (16GB RAM, GPU 8GB), bạn có thể chạy thoải mái các model 7-9B parameters. Đây là mức đủ cho hầu hết các tác vụ: chatbot, code generation, tóm tắt văn bản, phân tích tài liệu.

Cài Đặt Ollama Trên Các Hệ Điều Hành
Trên macOS, dùng Homebrew: brew install ollama. Sau đó khởi động service: brew services start ollama. Trên Linux, tải binary từ GitHub release trang chủ. Windows dùng installer từ trang web. Sau khi cài đặt, Ollama tự động chạy ở chế độ background, lắng nghe tại cổng 11434.
Cách Sử Dụng Cơ Bản
Để chạy model đầu tiên, gõ lệnh:
ollama run llama3— tải và chạy Llama 3 8B, model đa năng mạnh mẽollama run mistral— chạy Mistral 7B, hiệu quả cho nhiều tác vụollama run phi3— chạy Phi-3 Mini, nhẹ cho máy cấu hình thấpollama run deepseek-r1— chạy DeepSeek R1, model suy luận (reasoning)
Lần chạy đầu tiên, Ollama tự động tải model về cache (~4-8GB tùy model). Sau đó, chạy offline mà không cần internet. Ollama lưu trữ model tại ~/.ollama/models trên Linux/macOS.
Tích Hợp Với IDE Và AI Agent
Đây là điểm mạnh nhất của Ollama — API tương thích hoàn toàn với OpenAI. Ollama cung cấp API endpoint tại http://localhost:11434/v1. Chỉ cần đặt biến môi trường: export OPENAI_BASE_URL=http://localhost:11434/v1. Sau đó mọi tool hỗ trợ OpenAI API sẽ hoạt động ngay.
- Claude Code: đặt biến
ANTHROPIC_BASE_URLvàANTHROPIC_API_KEY(bất kỳ giá trị nào) để route qua Ollama - VS Code: cài extension “Continue”, chọn Ollama làm provider, chọn model đã tải
- LangChain, LlamaIndex: đổi OpenAI endpoint thành localhost
- Cursor: đặt
OPENAI_BASE_URLvà key bất kỳ - OpenCode: hỗ trợ Ollama mặc định

Quản Lý Model
Ollama cung cấp các lệnh quản lý model tiện lợi:
ollama list— xem danh sách model đã tải vềollama show llama3— xem thông tin chi tiết modelollama rm phi3— xóa model khỏi cacheollama pull gemma2— tải model mà không chạyollama cp llama3 my-model— sao chép model
Nên xóa các model không dùng để giải phóng dung lượng. Model 7B chiếm ~4-5GB cache.
Sử Dụng Advanced
Ollama hỗ trợ nhiều tùy chọn nâng cao qua Modelfile:
- System prompt: tùy chỉnh behavior của model qua file cấu hình
- Parameters: điều chỉnh temperature, top_p, num_predict, context size
- Embedding: tạo vector embedding từ văn bản cho RAG (Retrieval Augmented Generation)
- Serving: chạy Ollama làm API server cho nhiều client cùng lúc
Tạo Modelfile đơn giản:
FROM llama3
SYSTEM "Bạn là trợ lý AI chuyên về lập trình Vietnamese"
PARAMETER temperature 0.3
Rồi chạy: ollama create my-assistant -f Modelfile.
Kết Luận
Ollama là lựa chọn hàng đầu cho developer muốn chạy AI local mà không phụ thuộc vào API đám mây. Với chi phí bằng không, quyền riêng tư tuyệt đối, và khả năng tích hợp rộng rãi, Ollama xứng đáng là tool không thể thiếu trong workflow hiện đại. Kết hợp với Hermes Agent, OpenClaw, hay bất kỳ coding agent nào, Ollama cho phép bạn có trợ lý AI riêng hoạt động hoàn toàn offline. Xem tài liệu chi tiết tại ollama.com/docs và tải về tại ollama.com/download.
