DeepSeek là gì? Mô hình AI mã nguồn mở thách thức GPT-4

DeepSeek là công ty trí tuệ nhân tạo Trung Quốc gây chấn động toàn cầu khi phát hành mô hình suy luận R1 miễn phí với hiệu năng ngang bằng các đối thủ Mỹ. Trong bài viết này, chúng ta sẽ tìm hiểu DeepSeek là gì, các mô hình nổi bật và cách sử dụng.

DeepSeek là gì?

DeepSeek (tên đầy đủ: Hangzhou DeepSeek Artificial Intelligence Basic Technology Research) là công ty AI được thành lập vào ngày 17 tháng 7 năm 2023 tại Hàng Châu, Trung Quốc. Công ty là công ty con tách ra từ quỹ đầu cơ định lượng High-Flyer do Lương Văn Phong (Liang Wenfeng) sáng lập vào năm 2015.

Logo màu tím của DeepSeek trên nền trắng

Điểm đặc biệt của DeepSeek là chiến lược mã nguồn mở. Trong khi OpenAI, Google giữ bí mật mô hình của mình, DeepSeek công bố trọng số mô hình (model weights) hoàn toàn miễn phí theo giấy phép MIT, cho phép bất kỳ ai tải về, sửa đổi và sử dụng cho mục đích thương mại.

Các mô hình nổi bật của DeepSeek

DeepSeek-V3 – Mô hình nền tảng

Ra mắt tháng 12 năm 2024, DeepSeek-V3 là mô hình nền tảng với kiến trúc MoE (Mixture-of-Experts): tổng cộng 671 tỷ tham số nhưng chỉ kích hoạt 37 tỷ tham số cho mỗi token. Mô hình được huấn luyện trên 14,8 nghìn tỷ token với chi phí khoảng 5,6 triệu USD – con số cực thấp so với hàng trăm triệu USD mà các đối thủ chi ra.

V3 đạt hiệu năng ngang bằng GPT-4oClaude 3.5 Sonnet trên nhiều benchmark, vượt qua Llama 3.1 của Meta. Đặc biệt, toàn bộ quá trình huấn luyện diễn ra trên chip Nvidia H800 – phiên bản yếu hơn H100 bị hạn chế xuất khẩu sang Trung Quốc.

DeepSeek-R1 – Mô hình suy luận

Ra mắt tháng 1 năm 2025, DeepSeek-R1 là mô hình suy luận (reasoning) gây chấn động toàn ngành AI. Đây là nghiên cứu mở đầu tiên chứng minh khả năng suy luận có thể được huấn luyện thuần túy bằng học tăng cường (reinforcement learning) thông qua kỹ thuật GRPO, không cần bước giám sát trước đó.

Dòng dữ liệu kỹ thuật số kiểu Matrix trên nền đen

Trên benchmark toán học MATH-500, R1 đạt 97,3% vượt cả GPT-4o (74,6%) và o1 của OpenAI (96,4%). Trên nền tảng lập trình thi đấu Codeforces, R1 đạt rating 2029 – cao hơn cả OpenAI o1 (2061 là của o1-1217, R1 đạt 2029). Các phiên bản cô đọng (distilled) 1,5B đến 70B tham số cũng được phát hành, cho phép chạy ngay cả trên máy tính cá nhân.

DeepSeek-V4 – Thế hệ mới nhất

Tháng 4 năm 2026, DeepSeek phát hành thế hệ V4 với hai phiên bản: V4-Flash (284 tỷ tham số) và V4-Pro (1,6 nghìn tỷ tham số). V4 hỗ trợ ngữ cảnh lên tới 1 triệu token, gấp nhiều lần so với 128K của V3. Kiến trúc mới gồm Hyper Connections, Constrained Sparse Attention và bộ tối ưu Muon giúp giảm chi phí tính toán đáng kể.

Tác động đến ngành AI

Sự ra mắt của DeepSeek-R1 vào tháng 1 năm 2025 được ví như “khoảnh khắc Sputnik” của ngành AI Trung Quốc. Thị trường chứng khoán Mỹ phản ứng mạnh: cổ phiếu Nvidia mất tới 600 tỷ USD giá trị vốn hóa trong một phiên – mức sụt giảm lớn nhất của một công ty trong lịch sử thị trường chứng khoán Mỹ.

Về mặt học thuật, bài báo DeepSeek-R1 được đăng trên tạp chí Nature (tập 645, năm 2025) – hiếm có đối với một nghiên cứu AI ứng dụng. Báo cáo huấn luyện với chi phí 5,6 triệu USD đã làm dấy lên cuộc tranh luận về việc liệu các công ty Mỹ có đang chi tiêu quá mức cho hạ tầng AI hay không.

Cách sử dụng DeepSeek

Dùng miễn phí qua web

Bạn có thể dùng DeepSeek miễn phí ngay tại chat.deepseek.com. Giao diện tương tự ChatGPT, hỗ trợ tiếng Việt, đính kèm file và tìm kiếm web.

Gọi API cho ứng dụng

DeepSeek cung cấp API tương thích OpenAI với địa chỉ https://api.deepseek.com. Các mô hình chính: deepseek-v4-flash, deepseek-v4-pro, deepseek-reasoner. Giá hiện tại rất rẻ: 0,14 USD cho 1 triệu token đầu vào của V4-Flash.

Chạy local với Ollama

Các phiên bản cô đọng của R1 có thể chạy ngay trên máy tính cá nhân qua Ollama:

ollama run deepseek-r1:1.5b
ollama run deepseek-r1:7b
ollama run deepseek-r1:32b

Bạn cũng có thể tải trọng số đầy đủ từ Hugging Face – DeepSeek-R1 là một trong những mô hình được tải nhiều nhất trên nền tảng này với hơn 8,5 triệu lượt tải.

Rủi ro và tranh cãi

  • Lo ngại bảo mật: Nhiều chính phủ (Mỹ, Australia) cấm dùng DeepSeek trong hệ thống công quyền
  • Tranh cãi dữ liệu: Anthropic cáo buộc DeepSeek dùng hàng nghìn tài khoản giả để trích xuất dữ liệu huấn luyện từ Claude
  • Chi phí tăng: DeepSeek thông báo sẽ tăng giá API đáng kể trong thời gian tới

Tham khảo thêm:

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

Deep Learning là gì? Hướng dẫn học sâu cho người mới

Deep Learning hay học sâu là một nhánh con của machine learning, sử dụng mạng nơ-ron nhiều lớp để học từ dữ liệu. Khác với machine learning truyền thống yêu…

Xem thêm

AI trong ngân hàng: ứng dụng thực tế và xu hướng mới

Trí tuệ nhân tạo (AI) đang thay đổi ngành ngân hàng ở quy mô chưa từng thấy: từ chatbot phục vụ khách hàng, phát hiện gian lận đến chấm điểm…

Xem thêm
Lawyer writing legal documents and contracts

AI trong ngành luật: Ứng dụng và tác động thực tế

AI trong ngành luật đang thay đổi cách luật sư làm việc Trí tuệ nhân tạo (AI) đang trở thành công cụ không thể thiếu trong ngành luật toàn cầu….

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất