![]()
DeepSeek-R1: Mô hình lập luận nguồn mở thách thức o1 của OpenAI
DeepSeek-R1 là mô hình ngôn ngữ lớn (LLM) đầu tiên đạt hiệu suất ngang ngửa o1 của OpenAI trong các bài toán lập luận phức tạp, đồng thời được phát hành dưới giấy phép MIT nguồn mở hoàn toàn. Phát hành tháng 1/2025 bởi công ty AI Trung Quốc DeepSeek, mô hình này đánh dấu bước ngoặt: lần đầu tiên cộng đồng mã nguồn mở tiếp cận được khả năng “chain-of-thought” (chuỗi suy nghĩ) cấp độ SOTA mà không phụ thuộc API đóng.

Kiến trúc Mixture-of-Experts (MoE) 671B tham số
DeepSeek-R1 sử dụng kiến trúc Mixture-of-Experts (MoE) với tổng cộng 671 tỷ tham số, trong đó chỉ 37 tỷ tham số được kích hoạt (activated) cho mỗi token đầu vào. Cơ chế định tuyến (routing) chọn động các chuyên gia (experts) phù hợp nhất cho từng tác vụ, giúp tối ưu hóa chi phí tính toán mà vẫn duy trì hiệu suất cao.
Khác với mô hình dense truyền thống (như GPT-4 hay Llama 3.1 405B), MoE cho phép mở rộng quy mô tham số lớn hơn gấp nhiều lần mà không tăng tuyến tính chi phí inference. DeepSeek-R1 được huấn luyện trên 14.8 nghìn tỷ token (14.8T tokens) dữ liệu đa ngôn ngữ, với trọng tâm tiếng Anh và tiếng Trung.
Quy trình huấn luyện 2 giai đoạn: R1-Zero → R1
Điểm đột phá phương pháp luận của DeepSeek là quy trình huấn luyện 2 giai đoạn:
- DeepSeek-R1-Zero: Huấn luyện thuần túy bằng reinforcement learning (RL) từ mô hình cơ sở DeepSeek-V3-Base, không sử dụng dữ liệu supervised fine-tuning (SFT) ban đầu. Mô hình tự học lập luận thông qua phần thưởng (reward) dựa trên độ chính xác kết quả. Kết quả: R1-Zero đạt 71.0% trên AIME 2024, 73.3% trên MATH-500 — vượt o1-preview.
- DeepSeek-R1: Khắc phục nhược điểm của R1-Zero (đầu ra lặp từ, trộn ngôn ngữ, khó đọc) bằng cách thêm giai đoạn “cold-start” SFT với dữ liệu chain-of-thought chất lượng cao, tiếp theo là RL đa giai đoạn (reasoning + general alignment). R1 đạt 79.8% AIME 2024, 97.3% MATH-500, 49.2% Codeforces rating.

Hiệu suất benchmark: Vượt trội các mô hình đóng
| Benchmark | DeepSeek-R1 | OpenAI o1 | Claude 3.5 Sonnet |
|---|---|---|---|
| AIME 2024 | 79.8% | 79.2% | 16.0% |
| MATH-500 | 97.3% | 96.4% | 78.3% |
| Codeforces (rating) | 2029 (49.2%) | 1978 (46.1%) | — |
| GPQA Diamond | 71.5% | 75.7% | 65.0% |
| MMLU | 90.8% | 91.8% | 88.7% |
DeepSeek-R1 vượt o1 trên hầu hết các benchmark toán học, lập trình và lập luận khoa học, chỉ thua nhẹ trên GPQA (khoa học chung). Điều này chứng minh RL thuần túy có thể đạt SOTA mà không cần SFT quy mô lớn.
Chi phí huấn luyện và inference cực thấp
Theo báo cáo kỹ thuật, DeepSeek-R1 được huấn luyện trên cụm 2.048 GPU H800 trong khoảng 2.788 nghìn giờ GPU — ưu đãi hơn rất nhiều so với GPT-4 (ước tính 25.000+ GPU A100/H100). Chi phí ước tính chỉ ~$5,5 triệu so với hàng chục/hàng trăm triệu USD của các mô hình đóng.
Về inference, DeepSeek cung cấp API với giá $0,14/1M token input và $2,19/1M token output — rẻ hơn 27-30 lần so với o1 ($15/$60). Mô hình cũng có thể chạy local trên GPU tiêu dùng (quantized 4-bit ~400GB VRAM cho 671B, hoặc phiên bản distilled nhỏ hơn 1.5B-70B).
Tác động đến hệ sinh thái AI nguồn mở
DeepSeek-R1 thay đổi trò chơi cho AI nguồn mở bằng 3 yếu tố:
- Minh bạch phương pháp: Công bố chi tiết quy trình RL, prompt, reward model — cho phép tái hiện và cải tiến.
- Phân phối mô hình distilled: Phát hành 6 phiên bản distilled (1.5B, 7B, 8B, 14B, 32B, 70B) từ Qwen và Llama, cho phép chạy trên phần cứng phổ thông.
- Giấy phép MIT: Cho phép sử dụng thương mại, chỉnh sửa, phân phối tự do — khác với Llama (giấy phép tùy chỉnh hạn chế dùng cho đối thủ).
Các nhà nghiên cứu đã nhanh chóng xây dựng biến thể: Open-R1 (Hugging Face tái hiện từ đầu), DeepSeek-R1-Distill-Qwen-32B chạy được trên 24GB VRAM, và nhiều fine-tune chuyên biệt cho tiếng Việt, y tế, pháp lý.

Hạn chế và thách thức
Mặc dù ấn tượng, DeepSeek-R1 vẫn có nhược điểm:
- Tốc độ suy luận chậm: Chain-of-thought dài (thường 3.000-8.000 token/trao đổi) làm tăng latency 5-10x so với mô hình non-reasoning.
- An toàn nội dung: Là mô hình nguồn mở, không có guardrail tích hợp — nhà triển khai phải tự xây dựng hệ thống kiểm soát.
- Tiên đề địa chính trị: Dữ liệu huấn luyện có thiên hướng tiếng Trung, một số chủ đề nhạy cảm bị từ chối trả lời (tuân thủ quy định Trung Quốc).
- Yêu cầu phần cứng lớn: Phiên bản đầy đủ 671B cần ~1.3TB VRAM (BF16) hoặc ~400GB (INT4) — chỉ phù hợp cụm GPU enterprise.
Kết luận
DeepSeek-R1 chứng minh reinforcement learning thuần túy có thể tạo ra mô hình lập luận cấp độ SOTA với chi phí thấp hơn đời trước một rạng ngòi. Với giấy phép MIT, kiến trúc MoE hiệu quả, và hệ sinh thái distilled đang phát triển mạnh, R1 đang thúc đẩy “bình dân hóa” khả năng reasoning AI — đưa sức mạnh o1 xuống tầm tay các lập trình viên, nhà nghiên cứu và doanh nghiệp vừa và nhỏ trên toàn cầu.
Nguồn: DeepSeek-R1 Technical Report | Hugging Face Model Card | arXiv:2401.02958
