Ollama: Chạy LLM Local Miễn Phí Với Dòng Lệnh Đơn Giản

Ollama là công cụ mã nguồn mở giúp chạy các mô hình ngôn ngữ lớn (LLM) trên máy local một cách đơn giản, không cần cấu hình server hay GPU cluster phức tạp. Với Ollama, bạn có thể chạy Llama 3, Mistral, Gemma, Phi-3, và hàng trăm mô hình khác chỉ với một dòng lệnh, hoàn toàn miễn phí và riêng tư.

Terminal showing Ollama pulling a model and starting a local inference session

Vì sao chạy LLM local?

Chạy LLM qua API của OpenAI, Anthropic, hoặc Google có nhiều ưu điểm nhưng cũng gây ra vấn đề lớn: chi phí_API liên tục tăng, dữ liệu gửi lên server nước ngoài, phụ thuộc internet, và giới hạn token per request. Ollama giải quyết mọi vấn đề này bằng cách đưa toàn bộ inference về máy local.

  • Bảo mật dữ liệu: Không có thông tin nào rời khỏi máy. Phù hợp cho doanh nghiệp xử lý dữ liệu nhạy cảm, y tế, tài chính.
  • Không giới hạn token: Gọi LLM bao nhiêu lần tùy ý, không lo quota hay bill surprise.
  • Hoạt động offline: Chạy được cả khi không có internet, lý tưởng cho du lịch hoặc vùng xa.
  • Chấp nhận được: Với GPU RTX 3060 12GB hoặc Apple M1 16GB, mô hình 7B parameters chạy ổn định ở 15-25 tokens/giây.

Cài đặt Ollama

Quá trình cài đặt cực kỳ đơn giản trên mọi nền tảng:

Hệ điều hành Lệnh cài đặt
macOS brew install ollama hoặc tải từ ollama.com/download
Linux curl -fsSL https://ollama.com/install.sh | sh
Windows Tải installer từ ollama.com/download

Sau cài đặt, chạy lệnh test:

$ ollama --version
ollama version 0.6.x

# Kéo và chạy mô hình lần đầu
$ ollama run llama3.1:8b
>>> Xin chào, bạn có thể giúp tôi viết code Python không?
Ollama web interface showing running models and resource usage on local machine

Các mô hình phổ biến trên Ollama

Ollama hỗ trợ hàng trăm mô hình từ nhiều nhà phát triển. Dưới đây là những lựa chọn tốt nhất theo mục đích sử dụng:

Mô hình Kích thước RAM yêu cầu Điểm mạnh
llama3.1:8b 4.7 GB 8 GB Cân bằng tốc độ-chất lượng, hỗ trợ 128K context
mistral:7b 4.1 GB 8 GB Coding, instruction following, GPQA
gemma2:9b 5.4 GB 10 GB Google research, multilingual, reasoning
phi3:mini 2.2 GB 4 GB Nhẹ nhất, chạy được trên laptop 4GB RAM
qwen2.5:7b 4.4 GB 8 GB Multilingual, coding, toán học
codellama:13b 7.4 GB 12 GB Code generation chuyên biệt

Mô hình(lớn hơn) thường cho kết quả tốt hơn, nhưng cần nhiều RAM/VRAM hơn. Quy tắc đơn giản: RAM khả dụng (GB) × 2 ≈ kích thước mô hình tối đa (GB).

Sử dụng API endpoint

Ollama chạy server local ở localhost:11434, tương thích OpenAI API format. Bạn có thể dùng nó với bất kỳ tool nào hỗ trợ OpenAI API:

# REST API trực tiếp
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Giải thích về Docker container",
  "stream": false
}'

# Chat API (tương thích OpenAI format)
curl http://localhost:11434/v1/chat/completions -d '{
  "model": "llama3.1:8b",
  "messages": [{"role": "user", "content": "Hello"}]
}'

Với Python, dùng thư viện openai hoặc requests:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # không cần key thực
)

response = client.chat.completions.create(
    model="llama3.1:8b",
    messages=[{"role": "user", "content": "Viết hàm Python sort"}]
)
print(response.choices[0].message.content)

Tích hợp với IDE và công cụ phát triển

Ollama tích hợp tốt với nhiều công cụ phổ biến:

  • Continue (VS Code/JetBrains extension): Gợi ý code bằng LLM local, tương tự GitHub Copilot nhưng hoàn toàn miễn phí.
  • LM Studio: Giao diện desktop đẹp, drag-and-drop model, built-in chat UI, hỗ trợ RAG.
  • Open WebUI: Chat interface giống ChatGPT nhưng chạy trên máy local qua Docker.
  • Cursor IDE: Hỗ trợ kết nối Ollama backend cho AI coding suggestions.
  • Obsidian + Smart Connections: Tích hợp LLM local vào hệ thống ghi chú.

Thực hành: Xây dựng chatbot local với Python

Ví dụ đơn giản tạo một chatbot chạy hoàn toàn offline:

import requests

API_URL = "http://localhost:11434/api/chat"

def chat_with_local_llm(messages, model="llama3.1:8b"):
    response = requests.post(API_URL, json={
        "model": model,
        "messages": messages,
        "stream": False
    })
    return response.json()["message"]["content"]

# Vòng lặp chat
history = []
print("Chatbot local (gõ 'exit' để thoát)")
while True:
    user_input = input("Bạn: ")
    if user_input.lower() == "exit":
        break
    history.append({"role": "user", "content": user_input})
    reply = chat_with_local_llm(history)
    history.append({"role": "assistant", "content": reply})
    print(f"Bot: {reply}")

Tối ưu hiệu suất trên máy yếu

Nếu máy chỉ có 8GB RAM hoặc không có GPU NVIDIA:

  • Chọn mô hình nhỏ: phi3:mini (2.2GB), qwen2.5:3b (2GB) chạy mượt trên laptop 8GB.
  • Sử dụng(quantization): Mô hình Q4_K_M (4-bit) nhỏ hơn 50% so với F16 nhưng chất lượng giảm không đáng kể.
  • macOS Apple Silicon: Metal API hỗ trợ inference tự động, M1 Pro/Max chạy 14B models ổn định.
  • Linux AMD: Ollama hỗ trợ ROCm cho GPU AMD, nhưng cần cài đặt driver đúng phiên bản.

Kết luận

Ollama làm cho AI local trở nên dễ tiếp cận hơn bao giờ hết. Chỉ cần một máy tính phổ thông, bạn đã có thể chạy mô hình AI mạnh mẽ cho coding, viết content, phân tích dữ liệu — hoàn toàn miễn phí và bảo mật. Bắt đầu với ollama run llama3.1:8b, sau đó khám phá các mô hình khác phù hợp nhu cầu.

Tham khảo thêm: Ollama Model Library | Ollama GitHub Repository | Open WebUI Documentation

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

LoRA Fine-Tuning: Cách Tinh Chỉnh LLM Với Chi Phí Thấp

LoRA (Low-Rank Adaptation) đã trở thành kỹ thuật chuẩn để tinh chỉnh mô hình ngôn ngữ lớn (LLM) với chi phí phần cứng thấp hơn đáng kể so với fine-tuning…

Xem thêm

AI Function Calling: Kỹ Thuật Để LLM Sử Dụng Công Cụ

AI Function Calling: Kỹ Thuật Để LLM Sử Dụng Công Cụ Thực Tế Function calling (gọi hàm) là kỹ thuật cho phép mô hình ngôn ngữ lớn (LLM) tương tác…

Xem thêm

Mistral Large 3 — Mô Hình AI Mã Nguồn Mở 675B Tham Số

Mistral Large 3 — Mô Hình AI Mã Nguồn Mở 675B Tham Số Mistral AI đã phát hành Mistral Large 3 vào tháng 12/2025 — mô hình lớn nhất và…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất