Hướng Dẫn Sử Dụng Ollama Để Chạy AI Local Trên Máy Tính

giao diện Ollama chạy model AI trên terminal máy tính

Trong thời đại AI bùng nổ, phần lớn developer phải phụ thuộc vào API đám mây để sử dụng mô hình ngôn ngữ lớn (LLM). Điều này đồng nghĩa với chi phí API tăng theo usage, dữ liệu rời khỏi máy tính cá nhân, và không có kiểm soát hoàn toàn về quyền riêng tư. Ollama ra đời như một giải pháp thay đổi cuộc chơi.

Ollama Là Gì?

Ollama là phần mềm mã nguồn mở, miễn phí, cho phép người dùng tải và chạy các mô hình AI (LLM) trực tiếp trên máy tính cá nhân mà không cần kết nối internet sau khi tải model về. Ollama biến việc chạy AI local thành đơn giản như chạy một ứng dụng thông thường — chỉ cần một lệnh duy nhất.

  • Tốc độ nhanh: tận dụng GPU cục bộ (local), xử lý inference trực tiếp trên phần cứng của bạn, không qua trung gian
  • Riêng tư tuyệt đối: dữ liệu không rời khỏi máy tính, lý tưởng cho thông tin nhạy cảm, tài liệu nội bộ
  • Đa dạng model: hỗ trợ hàng trăm mô hình từ cộng đồng — Llama 3, Mistral, Gemma, Phi-3, Qwen, DeepSeek và nhiều hơn nữa
  • Cài đặt dễ dàng: một lệnh cài đặt trên macOS, Linux, Windows — không cần cấu hình phức tạp
  • API OpenAI-compatible: tương thích với mọi tool đã hỗ trợ OpenAI API chỉ bằng đổi endpoint

Ollama đã trở thành công cụ không thể thiếu cho hàng triệu developer trên toàn cầu. Theo trang chủ chính thức, Ollama được tin cậy bởi hơn 9 triệu developer và tích hợp sẵn với Claude Code, Codex, OpenCode, Hermes Agent, OpenClaw, VS Code và nhiều công cụ khác.

Yêu Cầu Phần Cứng

Trước khi cài đặt, hãy kiểm tra phần cứng của bạn:

Model RAM tối thiểu VRAM (GPU) Tốc độ
Phi-3 Mini (3.8B) 8GB RAM Không bắt buộc Nhanh trên CPU
Llama 3 8B 16GB RAM 8GB VRAM Khá với GPU
Mistral 7B 16GB RAM 8GB VRAM Khá với GPU
Gemma 2 9B 16GB RAM 8GB VRAM Khá với GPU
Llama 3 70B 64GB+ RAM 40GB+ VRAM Chậm trên CPU, cần server

Với máy tính cá nhân thông thường (16GB RAM, GPU 8GB), bạn có thể chạy thoải mái các model 7-9B parameters. Đây là mức đủ cho hầu hết các tác vụ: chatbot, code generation, tóm tắt văn bản, phân tích tài liệu.

sơ đồ cấu hình phần cứng cho các model AI theo size

Cài Đặt Ollama Trên Các Hệ Điều Hành

Trên macOS, dùng Homebrew: brew install ollama. Sau đó khởi động service: brew services start ollama. Trên Linux, tải binary từ GitHub release trang chủ. Windows dùng installer từ trang web. Sau khi cài đặt, Ollama tự động chạy ở chế độ background, lắng nghe tại cổng 11434.

Cách Sử Dụng Cơ Bản

Để chạy model đầu tiên, gõ lệnh:

  • ollama run llama3 — tải và chạy Llama 3 8B, model đa năng mạnh mẽ
  • ollama run mistral — chạy Mistral 7B, hiệu quả cho nhiều tác vụ
  • ollama run phi3 — chạy Phi-3 Mini, nhẹ cho máy cấu hình thấp
  • ollama run deepseek-r1 — chạy DeepSeek R1, model suy luận (reasoning)

Lần chạy đầu tiên, Ollama tự động tải model về cache (~4-8GB tùy model). Sau đó, chạy offline mà không cần internet. Ollama lưu trữ model tại ~/.ollama/models trên Linux/macOS.

Tích Hợp Với IDE Và AI Agent

Đây là điểm mạnh nhất của Ollama — API tương thích hoàn toàn với OpenAI. Ollama cung cấp API endpoint tại http://localhost:11434/v1. Chỉ cần đặt biến môi trường: export OPENAI_BASE_URL=http://localhost:11434/v1. Sau đó mọi tool hỗ trợ OpenAI API sẽ hoạt động ngay.

  • Claude Code: đặt biến ANTHROPIC_BASE_URLANTHROPIC_API_KEY (bất kỳ giá trị nào) để route qua Ollama
  • VS Code: cài extension “Continue”, chọn Ollama làm provider, chọn model đã tải
  • LangChain, LlamaIndex: đổi OpenAI endpoint thành localhost
  • Cursor: đặt OPENAI_BASE_URL và key bất kỳ
  • OpenCode: hỗ trợ Ollama mặc định
sơ đồ kiến trúc Ollama tích hợp với IDE và các AI agent

Quản Lý Model

Ollama cung cấp các lệnh quản lý model tiện lợi:

  • ollama list — xem danh sách model đã tải về
  • ollama show llama3 — xem thông tin chi tiết model
  • ollama rm phi3 — xóa model khỏi cache
  • ollama pull gemma2 — tải model mà không chạy
  • ollama cp llama3 my-model — sao chép model

Nên xóa các model không dùng để giải phóng dung lượng. Model 7B chiếm ~4-5GB cache.

Sử Dụng Advanced

Ollama hỗ trợ nhiều tùy chọn nâng cao qua Modelfile:

  • System prompt: tùy chỉnh behavior của model qua file cấu hình
  • Parameters: điều chỉnh temperature, top_p, num_predict, context size
  • Embedding: tạo vector embedding từ văn bản cho RAG (Retrieval Augmented Generation)
  • Serving: chạy Ollama làm API server cho nhiều client cùng lúc

Tạo Modelfile đơn giản:

FROM llama3
SYSTEM "Bạn là trợ lý AI chuyên về lập trình Vietnamese"
PARAMETER temperature 0.3

Rồi chạy: ollama create my-assistant -f Modelfile.

Kết Luận

Ollama là lựa chọn hàng đầu cho developer muốn chạy AI local mà không phụ thuộc vào API đám mây. Với chi phí bằng không, quyền riêng tư tuyệt đối, và khả năng tích hợp rộng rãi, Ollama xứng đáng là tool không thể thiếu trong workflow hiện đại. Kết hợp với Hermes Agent, OpenClaw, hay bất kỳ coding agent nào, Ollama cho phép bạn có trợ lý AI riêng hoạt động hoàn toàn offline. Xem tài liệu chi tiết tại ollama.com/docs và tải về tại ollama.com/download.

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

Claude Code: Hướng dẫn tích hợp AI coding vào workflow developer

Claude Code: Hướng dẫn tích hợp AI coding vào workflow developer Claude Code là AI coding agent mới nhất từ Anthropic, được thiết kế để làm việc cùng developers qua…

Xem thêm

MiniMax API: Hướng Dẫn Sử Dụng Mô Hình AI Miễn Phí Cho Developer

MiniMax API: Hướng Dẫn Sử Dụng Mô Hình AI Miễn Phí Cho Developer MiniMax là công ty AI Trung Quốc đang phát triển các mô hình ngôn ngữ lớn cạnh…

Xem thêm

xAI Grok 3 – Mô Hình AI Hội Thoại Thông Minh Từ Elon Musk

xAI Grok 3 – Mô Hình AI Hội Thoại Thông Minh Từ Elon Musk xAI do Elon Musk thành lập đã gây chấn động giới công nghệ với Grok —…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất