
RAG và Fine-tuning là gì?
Khi triển khai LLM cho doanh nghiệp, hai hướng tiếp cận phổ biến nhất là Retrieval-Augmented Generation (RAG) và Fine-tuning. Cả hai đều giúp mô hình phù hợp hơn với use case cụ thể, nhưng cơ chế và chi phí hoàn toàn khác nhau.
RAG kết hợp retriever tìm kiếm tài liệu thời gian thực với generator sinh văn bản. Fine-tuning cập nhật trọng số mô hình trên dataset riêng để học pattern mới. Hiểu đúng bản chất giúp bạn chọn đúng công cụ, tiết kiệm hàng nghìn USD cloud.

Khi nào dùng RAG
- Knowledge thay đổi thường xuyên: báo cáo tài chính, chính sách nội bộ, ticket hỗ trợ khách hàng cần cập nhật liên tục.
- Traceability bắt buộc: câu trả lời phải trỏ về nguồn tài liệu gốc — đặc biệt quan trọng trong y tế, pháp lý, compliance.
- Cold start nhanh: có ngay tri thức mới mà không cần train lại mô hình, chỉ cần vectorize document mới.
- Budget thấp: không tốn chi phí GPU cluster, chỉ cần embed model + vector DB.
Ví dụ thực tế: công ty bán lẻ cần chatbot trả lời chính sách đổi trả đang thay đổi hàng tuần → RAG nắm tài liệu mới nhất, không cần fine-tune lại.

Khi nào dùng Fine-tuning
- Style/tone riêng: giọng văn thương hiệu, format JSON output nhất quán, xử lý ngôn ngữ chuyên ngành (bác sĩ, luật sư, kỹ sư).
- Latency thấp: không muốn thêm bước retrieval, cần phản hồi nhanh nhất có thể.
- Dữ liệu ổn định: knowledge ít thay đổi, có dataset chất lượng cao đánh dấu sẵn.
- Edge/local: triển khai offline trên thiết bị nhỏ, không gọi API retrieval.
So sánh chi phí và độ phức tạp
| Tiêu chí | RAG | Fine-tuning |
|---|---|---|
| Cloud chi phí | Thấp (chỉ embedding) | Cao (GPU cluster train + infer) |
| Latency | Cao hơn (retrieve + generate) | Thấp nhất |
| Cập nhật knowledge | Real-time (vector DB) | Train lại từ đầu |
| Traceability | Native (citation) | Không có sẵn |
| Complexity | Trung bình | Cao |
Chiến lược kết hợp: RAG + Fine-tuning
Trong thực tế doanh nghiệp, hai hướng không loại trừ nhau. Fine-tuning dạy mô hình ngôn ngữ chuyên ngành và format output mong muốn; RAG cung cấp dữ liệu mới nhất có nguồn gốc.
Kết hợp tối ưu nhất là fine-tune base model để hiểu domain + RAG layer để cập nhật facts thay đổi. Một số framework hỗ trợ retrieval-augmented fine-tuning (RAFT) để mô hình học cách sử dụng context từ retrieval.
Quy tắc vàng: nếu đổi 3 tháng một lần knowledge base → RAG là đủ. Nếu cần format cứng hoặc style riêng → fine-tuning. Nếu cần cả hai → kết hợp theo thứ tự retriever → generator.
Nguồn: Anthropic – Building Effective Agents, Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al.)
