
Diffusion Language Model: Cơ Chế Sinh Ngôn Ngữ Đột Phá Bỏ Autoregressive

Diffusion Language Model là phương thức sinh văn bản mới, sử dụng cơ chế diffusion tương tự các mô hình tạo ảnh để thay thế autoregressive truyền thống. Thay vì dự đoán token theo thứ tự từng cái một như LLM thông thường, diffusion language model bắt đầu từ văn bản nhiễu ngẫu nhiên rồi dần “làm sạch” để tạo ra câu hoàn chỉnh.
Đây không chỉ là một thí nghiệm thú vị — dLLM (Đại học Stanford) và Mercury của Inception Labs đã chứng minh diffusion model có thể generate văn bản nhanh hơn 10 lần so với LLM autoregressive cùng kích thước. Bài viết phân tích kiến trúc hoạt động, ưu nhược điểm, và vị trí của diffusion trong tương lai AI.
Tại Sao Cần Một Paradigm Mới?
Mô hình autoregressive (GPT, Claude, Gemini) dự đoán token tiếp theo dựa trên toàn bộ token trước đó. Mỗi lần suy luận chỉ tạo ra 1 token duy nhất, nên thời gian sinh văn bản tỷ lệ thuận với độ dài output.
Cơ chế này có ba bất lợi chính:
- Tốc độ giới hạn: Output length N token cần N forward passes — mỗi pass chờ token trước hoàn thành
- Khó parallelize: Không thể sinh nhiều token đồng thời vì token thứ i phụ thuộc token thứ i-1
- Mode collapse: Mô hình dễ rơi vào lặp lại pattern quen thuộc, thiếu đa dạng khi generate dài

Diffusion Hoạt Động Thế Nào?
Forward process (thêm nhiễu): Mô hình nhận input văn bản, thêm Gaussian noise dần dần qua T bước. Ở bước cuối, văn bản biến thành nhiễu hoàn toàn — không còn thông tin nào.
Reverse process (xóa nhiễu): Mô hình học cách đảo ngược quá trình trên. Bắt đầu từ nhiễu ngẫu nhiên, dần loại bỏ noise qua các bước denoising, cuối cùng tạo ra văn bản có nghĩa.
Khác với diffusion dùng trong ảnh (operates trên continuous pixel values), diffusion language model làm việc trên discrete tokens. Có ba cách chính để xử lý sự khác biệt này:
- Absorbing state diffusion: Tokens có thể ở một trong hai trạng thái — token gốc hoặc “mask”. Quá trình forward chuyển token sang trạng thái mask ngẫu nhiên. Reverse process dự đoán token gốc tại vị trí đã mask.
- Gaussian diffusion trên embedding: Chuyển tokens thành vectors liên tục, thêm Gaussian noise, rồi reverse. Cuối cùng map vector về nearest token trong vocab.
- Uniform diffusion: Forward process dùng uniform distribution thay Gaussian. Đơn giản hơn, phù hợp discrete data.
Các Dự Án Đang Phát Triển

dLLM (Diffusion LLM)
dLLM là dự án mã nguồn mở với hơn 2.600 stars trên GitHub, phát triển bởi nhóm nghiên cứu từ Đại học Stanford. Mô hình dùng absorbing state diffusion với parallel decoding, cho phép tất cả tokens được generate đồng thời.
LLaDA (Large Language Diffusion Architectures)
LLaDA giới thiệu mask prediction làm cơ chế chính. Mô hình nhận text với một phần tokens bị mask, dự đoán giá trị cho tất cả vị trí đã mask cùng lúc. Việc này lặp lại qua nhiều bước, tokens dần được hoàn thiện.
Mercury của Inception Labs
Mercury là commercial diffusion LLM đầu tiên, tập trung vào tốc độ inference. Mercury 2 được claim nhanh hơn 10x so với GPT-4o trên cùng GPU, đặc biệt xuất sắc với output dài. API đã mở public beta.
Streaming-dLLM
Streaming-dLLM giải quyết vấn đề streaming output — cho phép generated text xuất ra real-time thay vì phải chờ toàn bộ quá trình denoising hoàn thành. Điều này đưa diffusion closer với trải nghiệm chatbot thực tế.
So Sánh: Autoregressive vs Diffusion
| Tiêu chí | Autoregressive | Diffusion |
|---|---|---|
| Cơ chế | Predict next token | Denoise from noise |
| Parallelism | Sequential (1 token/lần) | Parallel (nhiều token/lần) |
| Tốc độ output ngắn | Nhanh (ít forward passes) | Có thể chậm hơn (denoising overhead) |
| Tốc độ output dài | Chậm (N tokens = N passes) | Nhanh (parallel decoding) |
| Đa dạng output | Thấp hơn (mode collapse) | Cao hơn (exploration tốt hơn) |
| In-context learning | Xuất sắc (đã được chứng minh) | Đang phát triển, chưa bằng |
| Ecosystem | Rất trưởng thành | Mới bắt đầu |
Trường Hợp Sử Dụng Tiềm Năng
Diffusion language model không thay thế autoregressive ở mọi tác vụ, nhưng có lợi thế ở một số tình huống cụ thể:
- Code generation: Code có cấu trúc rõ ràng, việc mask prediction hoạt động tốt — Open-dLLM đã chứng minh điều này trên code completion.
- Text revision/editing: Thay vì generate từ đầu, diffusion có thể refine bản draft hiện có bằng cách mask và regenerate các phần cần sửa.
- Output dài: Khi cần 10.000+ tokens, parallel decoding giúp giảm latency đáng kể.
- Machine translation: Target sentence có thể generate parallel, phù hợp diffusion approach.
Hạn Chế Hiện Tại
Mặc dù đầy hứa hẹn, diffusion language model vẫn có giới hạn:
- Chưa thực sự tốt ở reasoning chain: Complex multi-step reasoning cần theo dõi context rất chặt — autoregressive làm tốt hơn hiện tại.
- Cần nhiều bước denoising: Số steps ảnh hưởng trực tiếp đến quality — quá ít steps sẽ chất lượng kém, quá nhiều thì chậm.
- Ecosystem immature: Chưa có tooling, quantization, fine-tuning ecosystem phong phú như autoregressive.
- Hiểu ngữ cảnh giới hạn: In-context learning và instruction following chưa bằng GPT/Claude.
Hướng Phát Triển Tương Lai
Convergence giữa autoregressive và diffusion đang diễn ra. Một số hướng nghiên cứu đang kết hợp cả hai paradigm: dùng autoregressive cho planning phase và diffusion cho generation phase. DeepSeek-R1 cũng đang khám phá ý tưởng sử dụng diffusion cho reasoning.
Với tốc độ phát triển hiện tại, diffusion language model có thể trở thành alternative chính cho autoregressive trong vòng 2-3 năm tới, đặc biệt khi:
- GPU-memory bandwidth tiếp tục tăng, giúp parallel decoding chạy nhanh hơn
- Quantization methods cho diffusion model được phát triển đầy đủ
- Commercial products như Mercury đạt được chất lượng sánh ngang GPT-4
Kết Luận
Diffusion language model là paradigm shift quan trọng nhất trong AI text generation kể từ khi Transformer ra đời. Không phải thay thế hoàn toàn autoregressive mà là bổ sung một phương thức mới, đặc biệt mạnh ở tốc độ và đa dạng output. Theo dõi sự phát triển của dLLM, Mercury, và các dự án mã nguồn mở khác để nắm bắt cơ hội ứng dụng sớm.
