Diffusion model là gì? Cách AI tạo ảnh từ văn bản

Diffusion model là gì mà lại trở thành công nghệ nền tảng của hàng loạt công cụ tạo ảnh AI như Stable Diffusion, DALL·E hay Midjourney? Đây là lớp mô hình sinh dữ liệu (generative model) hoạt động theo nguyên lý thêm nhiễu rồi học cách khử nhiễu, giúp máy tính tạo ra hình ảnh, video và âm thanh mới từ mô tả văn bản.

Trong bài viết này, chúng ta sẽ tìm hiểu cách hoạt động của diffusion model, lịch sử phát triển từ giấy tờ nghiên cứu đến các sản phẩm thương mại, so sánh với GAN và những ứng dụng thực tế đang thay đổi ngành sáng tạo nội dung.

Diffusion model là gì?

Diffusion model là một lớp mô hình học máy sinh dữ liệu bằng cách mô phỏng quá trình khuếch tán vật lý. Ý tưởng cốt lõi: bắt đầu từ một bức ảnh sạch, ta thêm nhiễu Gaussian dần dần qua nhiều bước cho đến khi ảnh trở thành nhiễu thuần túy. Mô hình học cách đảo ngược quá trình đó, tức là từ nhiễu ngẫu nhiên khôi phục lại hình ảnh có ý nghĩa. Khi quá trình đảo ngược được điều khiển bằng một điều kiện như câu mô tả văn bản, mô hình có thể tạo ra hình ảnh mới chưa từng tồn tại.

Điểm khác biệt lớn so với các phương pháp cũ là chất lượng và độ đa dạng. Diffusion model tạo ảnh sắc nét hơn, ít lỗi hình học hơn và dễ kiểm soát hơn, nhờ đó nhanh chóng vượt qua GAN để trở thành tiêu chuẩn mới trong lĩnh vực tạo ảnh.

Cách hoạt động của diffusion model

Quá trình huấn luyện gồm hai giai đoạn đối xứng. Giai đoạn forward diffusion: mỗi bước thêm một lượng nhiễu Gaussian nhỏ theo lịch trình định sẵn, sau T bước ảnh gốc biến thành nhiễu thuần túy, không còn nhận diện được nội dung ban đầu. Giai đoạn này mang tính tất định và không cần học. Giai đoạn reverse diffusion: một mạng nơ-ron, thường là kiến trúc UNet hoặc Transformer, học cách dự đoán lượng nhiễu đã được thêm vào mỗi bước. Khi sinh ảnh, mô hình bắt đầu từ nhiễu ngẫu nhiên rồi lặp lại chu trình đoán nhiễu và trừ nhiễu cho đến khi thu được hình ảnh sạch hoàn chỉnh.

Mạng nơ-ron sâu biểu diễn quá trình khuếch tán thêm nhiễu và khử nhiễu trong diffusion model

Một điểm quan trọng là số bước khử nhiễu. Mô hình DDPM gốc cần từ 50 đến 1000 bước lặp để tạo một ảnh, khiến tốc độ sinh ảnh khá chậm. Các kỹ thuật sau này như sampling nhanh, distillation hay flow matching đã giảm số bước xuống còn vài chục, thậm chí vài bước, giúp các công cụ tạo ảnh phản hồi gần như tức thời.

Latent diffusion: bí quyết của Stable Diffusion

Một cải tiến quan trọng là latent diffusion, được giới thiệu trong bài báo Latent Diffusion Models của Rombach và cộng sự. Thay vì hoạt động trực tiếp trên không gian pixel vốn rất tốn tài nguyên, ảnh được mã hóa qua một autoencoder về không gian tiềm ẩn (latent space) nhỏ hơn nhiều, sau đó diffusion model hoạt động trên không gian này. Kết quả là giảm đáng kể chi phí tính toán và bộ nhớ, cho phép chạy trên GPU tầm trung. Đây chính là nền tảng của Stable Diffusion, mô hình mã nguồn mở do Stability AI phát hành tháng 8 năm 2022, thay đổi hoàn toàn cục diện ngành tạo ảnh AI.

Stable Diffusion v1.4 có khoảng 860 triệu tham số ở nhánh UNet, tạo ảnh 512×512 pixel. Phiên bản SDXL ra mắt năm 2023 lớn gấp ba lần với khoảng 2,6 tỷ tham số UNet, sử dụng hai bộ mã hóa văn bản và tạo ảnh 1024×1024, chất lượng cạnh tranh được với các mô hình đóng nguồn. Năm 2024, Black Forest Labs phát hành FLUX.1 với 12 tỷ tham số, dùng kiến trúc transformer song song và kỹ thuật flow matching, tiếp tục nâng chất lượng lên một tầm mới.

Lịch sử phát triển và các cột mốc chính

Ý tưởng diffusion model xuất hiện từ năm 2015 trong bài báo Deep Unsupervised Learning using Nonequilibrium Thermodynamics của Sohl-Dickstein, lấy cảm hứng từ nhiệt động lực học. Tuy nhiên phải đến năm 2020, bài báo Denoising Diffusion Probabilistic Models (DDPM) của Jonathan Ho và cộng sự mới chứng minh được hiệu quả thực tế với điểm Inception Score 9.46 và FID 3.17 trên tập CIFAR-10, mở ra kỷ nguyên mới.

Tiếp theo là chuỗi cột mốc: năm 2021 OpenAI công bố DALL·E và bài báo Diffusion Models Beat GANs on Image Synthesis của Dhariwal và Nichol khẳng định diffusion vượt trội GAN về chất lượng. Năm 2022, latent diffusion ra đời cùng Stable Diffusion mã nguồn mở, biến công nghệ này thành công cụ đại chúng. Năm 2023 chứng kiến SDXL và Diffusion Transformers (DiT) thay thế UNet bằng kiến trúc transformer. Năm 2024, OpenAI giới thiệu Sora tạo video từ văn bản, Runway phát hành Gen-3 Alpha, còn Google DeepMind phát triển Imagen và Veo cho cả ảnh lẫn video.

Hình ảnh kỹ thuật số được tạo bởi mô hình khuếch tán từ nhiễu ngẫu nhiên

So sánh diffusion model với GAN

Trước khi diffusion lên ngôi, GAN là lựa chọn hàng đầu cho bài toán tạo ảnh. Tuy nhiên diffusion model chiếm ưu thế ở nhiều khía cạnh quan trọng:

Tiêu chí Diffusion model GAN
Chất lượng ảnh Cao hơn, chi tiết hơn Tốt nhưng dễ sụp đổ mode (mode collapse)
Độ ổn định huấn luyện Ổn định, dự đoán nhiễu đơn giản Khó cân bằng trò chơi min-max, gradient biến mất
Tốc độ sinh ảnh Chậm hơn do nhiều bước lặp Nhanh, chỉ một lần truyền tới
Độ đa dạng Đa dạng mẫu tốt Rủi ro mode collapse
Điều kiện hóa Dễ gắn điều kiện văn bản, hướng dẫn Khó hơn

Bài báo năm 2021 của OpenAI xác nhận diffusion model đạt FID tốt hơn GAN trên ImageNet 256×256. Đổi lại, tốc độ sinh ảnh của diffusion chậm hơn, nhưng với kỹ thuật sampling nhanh hiện đại, khoảng cách này ngày càng thu hẹp.

Ứng dụng của diffusion model ngoài tạo ảnh

Ngoài hình ảnh tĩnh, diffusion model đang lan tỏa sang nhiều lĩnh vực. Trong tạo video, Sora của OpenAI dùng diffusion trên các patch không gian-thời gian để tạo video dài tới một phút ở độ phân giải cao, được kỳ vọng trở thành mô phỏng thế giới (world simulator). Runway Gen-3 Alpha tập trung vào kiểm soát chuyển động theo thời gian cho cả text-to-video lẫn image-to-video. Stability AI cũng có Stable Video Diffusion cho video mã nguồn mở.

Trong âm thanh, AudioLDM tạo nhạc và hiệu ứng âm thanh từ văn bản bằng latent diffusion, còn Stable Audio 2.5 của Stability AI phục vụ sản xuất nhạc chuyên nghiệp. Trong không gian 3D, các mô hình như Stable Fast 3D tái dựng mô hình 3D từ ảnh chụp, mở đường cho ứng dụng game và thực tế ảo.

Diffusion model tại Việt Nam

Nhờ Stable Diffusion và FLUX đều có trọng số mở, cộng đồng phát triển Việt Nam có thể tinh chỉnh mô hình trên dữ liệu bản địa như áo dài, phong cảnh, kiến trúc cổ mà không cần huấn luyện từ đầu. Nhiều nhóm trên Facebook và Discord sử dụng ComfyUI và WebUI để tạo ảnh, trong khi các công ty như FPT AI và Viettel AI tích hợp generative AI vào sản phẩm nội bộ. Đây là cơ hội lớn cho các nhà phát triển Việt khai thác nền tảng mã nguồn mở này.

Kết luận

Diffusion model đã định hình lại toàn bộ lĩnh vực tạo nội dung bằng AI, từ ảnh tĩnh đến video và âm thanh. Nguyên lý thêm nhiễu rồi khử nhiễu tưởng chừng đơn giản nhưng mang lại chất lượng vượt trội và khả năng kiểm soát linh hoạt. Với tốc độ phát triển hiện tại, diffusion model sẽ tiếp tục là xương sống của các công cụ sáng tạo trong nhiều năm tới, và các nhà phát triển Việt Nam hoàn toàn có thể tham gia vào làn sóng này.

Tham khảo thêm

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

AI Agent là gì? Cách hoạt động và framework phổ biến

AI Agent là gì? AI Agent (tác nhân AI) là hệ thống AI có khả năng tự chủ thực hiện tác vụ: lập kế hoạch, gọi công cụ, đọc kết…

Xem thêm

AI du lịch là gì? Ứng dụng thay đổi cách bạn đi chơi

AI du lịch đang thay đổi cách hàng triệu người lên kế hoạch cho chuyến đi. Từ việc tìm điểm đến, so sánh giá vé đến xây dựng lịch trình…

Xem thêm

AI trong y tế: Chẩn đoán hình ảnh thay đổi ngành y

AI trong y tế đang thay đổi cách bác sĩ chẩn đoán bệnh, đặc biệt là trong lĩnh vực chẩn đoán hình ảnh. Các mô hình trí tuệ nhân tạo…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất