
Cách Chạy Mô Hình Ngôn Ngữ Lớn Cục Bộ Trên Linux Với Ollama

Trong thời đại trí tuệ nhân tạo sinh (Generative AI), việc chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên máy tính cá nhân ngày càng trở nên phổ biến. Thay vì phụ thuộc vào các dịch vụ đám mây, người dùng có thể tự vận hành mô hình ngay trên hệ thống Linux của mình. Ollama là một trong những công cụ hàng đầu cho phép thực hiện điều này một cách dễ dàng và hiệu quả. Bài viết dưới đây sẽ hướng dẫn bạn cách cài đặt và sử dụng Ollama trên Linux, từ cơ bản đến nâng cao.
Ollama Là Gì?
Ollama là phần mềm mã nguồn mở cho phép người dùng tải về và chạy các mô hình LLM ngay trên máy tính cá nhân. Phần mềm này hoạt động như một lớp trừu tượng hóa, đóng gói toàn bộ các dependency cần thiết như llama.cpp, và cung cấp một giao diện dòng lệnh (CLI) đơn giản để tương tác với mô hình. Ollama hỗ trợ nhiều mô hình khác nhau bao gồm Llama, Gemma, Phi, Mistral, và nhiều mô hình chuyên dụng khác.
Đặc điểm nổi bật
- Chạy cục bộ hoàn toàn: Mọi dữ liệu và xử lý đều diễn ra trên máy của bạn, đảm bảo quyền riêng tư tối đa. Không cần gửi dữ liệu nhạy cảm đến máy chủ bên ngoài.
- Cài đặt nhanh chóng: Chỉ với một lệnh duy nhất trên terminal, Ollama có thể được cài đặt trên hầu hết các bản phân phối Linux.
- Hệ sinh thái mô hình phong phú: Ollama duy trì một thư viện mô hình sẵn có tại kho mô hình chính thức, bao gồm cả các mô hình mã nguồn mở mới nhất.
- Tích hợp linh hoạt: Ollama tương thích với nhiều tác nhân AI (AI Agent) phổ biến như Claude Code, OpenClaw, Hermes Agent, Codex, Copilot CLI, giúp mở rộng khả năng sử dụng.
- REST API chuẩn: Ollama cung cấp API tương thích với OpenAI, cho phép bạn thay thế dễ dàng các lời gọi API đám mây bằng lời gọi cục bộ.
Cài Đặt Ollama Trên Linux
Để bắt đầu, bạn cần tải và cài đặt Ollama trên hệ thống. Quy trình được thiết kế tối giản cho người dùng Linux.

Cài đặt bằng trình quản lý gói
Trên các bản phân phối phổ biến như Ubuntu, Fedora, hay Arch Linux, Ollama có thể được cài đặt trực tiếp từ kho phần mềm chính thức hoặc sử dụng script cài đặt tự động. Lệnh phổ biến nhất là:
curl -fsSL https://ollama.com/install.sh | sh
Lệnh này sẽ tự động tải về, giải nén và thêm Ollama vào PATH hệ thống. Sau khi cài đặt xong, bạn có thể kiểm tra phiên bản bằng lệnh ollama --version.
Cài đặt thủ công
Đối với các máy chủ không có kết nối Internet hoặc muốn kiểm soát chi tiết hơn, bạn có thể tải gói .deb, .rpm hoặc binary trực tiếp từ trang chủ Ollama. Sau khi giải nén, đảm bảo binary nằm trong thư mục thuộc PATH (ví dụ: /usr/local/bin/).
Sử Dụng Ollama Để Chạy LLM
Sau khi cài đặt, việc vận hành một mô hình trở nên vô cùng đơn giản. Ollama quản lý toàn bộ vòng đời của mô hình, từ tải về, lưu trữ trong bộ nhớ đệm cho đến giải phóng khi không cần thiết.
Chạy mô hình từ dòng lệnh
Để bắt đầu trò chuyện với một mô hình, chỉ cần gõ:
ollama run llama3
Lệnh này sẽ tự động tải mô hình Llama 3 nếu chưa có trên máy, sau đó khởi tạo phiên chat. Người dùng có thể nhập các câu hỏi trực tiếp từ terminal. Ngoài ra, bạn cũng có thể chạy mô hình ở chế độ background hoặc sử dụng các tùy chọn như --num-thread để tối ưu hóa hiệu suất dựa trên số nhân CPU.
REST API và lập trình
Ollama lắng nghe trên cổng 11434 theo mặc định, cho phép các ứng dụng giao tiếp thông qua REST API. Ví dụ, để gửi một câu hỏi đến mô hình, bạn có thể dùng lệnh curl:
curl http://localhost:11434/api/chat -d '{"model": "llama3", "messages": [{"role": "user", "content": "Xin chào"}], "stream": false}'
Ngoài ra, Ollama còn cung cấp các thư viện chính thức cho Python (pip install ollama) và JavaScript (npm i ollama), giúp lập trình viên tích hợp LLM vào ứng dụng một cách nhanh chóng.
Tích Hợp Với Các Agent AI
Một trong những điểm mạnh của Ollama là khả năng kết nối với các tác nhân AI hiện đại. Nhờ kiến trúc mở, Ollama đóng vai trò như bộ não cục bộ cho các hệ thống tự động hóa thông minh.
- Claude Code: Có thể được cấu hình để sử dụng Ollama làm backend, giúp các tác vụ lập trình chạy hoàn toàn ngoại tuyến.
- OpenClaw: Biến Ollama thành trợ lý AI cá nhân, hoạt động trên nhiều nền tảng nhắn tin như WhatsApp, Telegram, Slack.
- Hermes Agent: Agent đa năng, tận dụng Ollama để thực hiện các nhiệm vụ phức tạp mà không cần kết nối internet.
- Codex và Copilot CLI: Các trợ lý lập trình này đều hỗ trợ Ollama để đưa ra gợi ý mã nguồn ngay trên máy tính cá nhân.
Kết Luận
Ollama là công cụ không thể thiếu đối với bất kỳ ai muốn khám phá trí tuệ nhân tạo một cách độc lập và bảo mật trên hệ điều hành Linux. Với giao diện đơn giản, khả năng tích hợp đa dạng và hiệu suất mạnh mẽ, Ollama xứng đáng là lựa chọn hàng đầu để chạy các mô hình LLM cục bộ. Dù bạn là nhà phát triển, người đam mê công nghệ hay một chuyên gia phân tích dữ liệu, Ollama đều cung cấp nền tảng vững chắc để khai thác sức mạnh của AI ngay tại nhà.
Tài liệu tham khảo:
