Diffusion model là gì: Cơ chế sinh ảnh bằng khử nhiễu từng bước

Diffusion model là họ mô hình trí tuệ nhân tạt tạo ra hình ảnh, âm thanh hoặc văn bản bằng cách bắt đầu từ nhiễu ngẫu nhiên rồi lặp đi lặp lại điều nhiễu. Nhờ cách tiếp cận đảo ngược quá trình làm mờ, các hệ thống như Stable Diffusion hay DALL-E tạo được hình ảnh chất lượng cao mà không cần mạng thần kinh phải nhớ toàn bộ phân phối dữ liệu thật.

Diffusion model hoạt động như thế nào

Ý tưởng gốc đến từ vật lý nhiệt động. Mỗi bức ảnh được xem là một điểm trong không gian của tất cả các ảnh có thể có. Tập hợp các ảnh tự nhiên tạo thành một đám mây dữ liệu, và quá trình khuếch tán liên tục thêm nhiễu Gaussian vào từng điểm sẽ khiến đám mây đó loãng dần cho tới khi nó trở nên không phân biệt được với phân phối nhiễu thuần túy.

Vì vậy, mô hình học cách đi ngược lại quá trình này. Nó nhận một ảnh đã nhiễu và dự đoán ảnh gốc trông sẽ như thế nào, từ đó loại bỏ một phần nhiễu. Lặp lại hàng trăm bước, ảnh dần sắc nét trở lại. Phần mô hình đảm nhiệm việc loại nhiễu thường được gọi là backbone, và phần lớn các công trình hiện nay dùng kiến trúc U-Net hoặc Transformer cho lớp này.

Sơ đồ nhiều bước khử nhiễu: từ ảnh nhiễu ngẫu nhiên qua từng bước tiến trình nghịch đến ảnh rõ nét

Tiến trình thuần và tiến trình nghịch

Mô hình khuếch tán xác suất, hay DDPM, được giới thiệu vào năm 2020, đưa cách trên vào một khung hình thức chặt chẽ dựa trên suy luận biến thiên. Tiến trình thuần lấy ảnh gốc rồi liên tục trộn nhiễu theo một lịch trình cố định gồm T bước. Ở mỗi bước, hệ số giữ lại phần tín hiệu và hệ số nhân với nhiễu được chọn sao cho tổng phương sai luôn bằng một. Hệ quả là biến thể cuối cùng có phân phối gần với nhiễu Gaussian đơn vị.

Tiến trình nghịch là phần cần học: một mạng nơ-ron nhận ảnh nhiễu ở bước t cùng thông tin về bước đó, rồi xuất ra ảnh nhiễu ở bước t trừ một. Nhờ vậy, quá trình suy luận có thể bắt đầu từ bất kỳ điểm nào trong đám mây nhiễu. Có những cách lấy mẫu tốn hàng nghìn bước, cũng có cách rút xuống còn vài chục bước mà chất lượng gần như không đổi.

Sơ đồ tiến trình thuần: ảnh gốc bị thêm nhiễu dần theo từng bước của quá trình khuếch tán

Ứng dụng thực tế ngoài ảnh

Ban đầu, khuếch tán được xem là kỹ thuật xử lý ảnh: khử nhiễu, tô màu vùng bị che, nâng độ phân giải. Ngày nay nó xuất hiện trong sinh văn bản, tạo âm thanh và cả trong học tăng cường. Mô hình sinh ảnh phổ biến thường ghép diffusion với bộ mã hóa văn bản và các lớp chú ý chéo, nhờ đó câu lệnh của người dùng mới trở thành điều kiện để tạo ảnh.

So sánh nhanh các hướng sinh ảnh

Phương pháp Cơ chế chính Điểm mạnh Điểm yếu
GAN Hai mạng đối kháng Sinh nhanh Huấn luyện không ổn định, dễ vỡ cấu trúc
Diffusion Khử nhiễu từng bước Chất lượng cao, dễ kiểm soát Chậm hơn khi lấy mẫu
Flow matching Học đường đi của dữ liệu Ít bước lấy mẫu hơn Yêu cầu huấn luyện lớn hơn

Điều kiện cần biết trước khi dùng

  • Cần GPU tương đối mạnh nếu tự huấn luyện, vì mỗi vòng lặp phải chạy cả tiến trình thuần lẫn tiến trình nghịch.
  • Số bước lấy mẫu quyết định trực tiếp tới tốc độ và độ mịn của kết quả, nên tăng bước không phải lúc nào cũng tốt.
  • Mô hình được huấn luyện trên tập ảnh có nhãn nên thường tái tạo được bố cục, màu sắc và cả phong cách của dữ liệu gốc.
  • Bản quyền dữ liệu huấn luyện vẫn là câu hỏi mở khi dùng thương mại, cần kiểm tra giấy phép của từng nguồn ảnh.

Kiến thức nền tảng về mô hình sinh ảnh nằm ở bài Knowledge Distillation là gì: Nén mô hình AI thông minh, bài viết giải thích cách rút gọn mô hình lớn xuống kích thước nhỏ hơn mà vẫn giữ chất lượng dự đoán. Bạn cũng nên đọc bài tổng quan về diffusion model trên Wikipedia để có định nghĩa học thuật đầy đủ kèm công thức gốc.

Kết luận

Diffusion model đổi cách chúng ta nhìn về bài toán sinh nội dung: thay vì ghi nhớ phân phối dữ liệu, mô hình học cách hoàn tác một quá trình phá hủy thông tin. Chính nhờ tính ổn định đó, kỹ thuật này nhanh chóng trở thành nền tảng cho phần lớn công cụ tạo ảnh phổ biến hiện nay, và các hướng tối ưu về tốc độ lấy mẫu vẫn là nơi các nhóm nghiên cứu đang tập trung cải tiến.

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

Model Context Protocol: Chuẩn kết nối AI với công cụ bên ngoài

Model Context Protocol (MCP) là gì? MCP là chuẩn mở, do Anthropic đưa ra, giúp kết nối một trợ lý AI (ví dụ như Claude Desktop) với các nguồn dữ…

Xem thêm

Whisper là gì: Mô hình nhận dạng giọng nói mã nguồn mở để dùng

Whisper là gì? Đây là mô hình nhận dạng giọng nói mã nguồn mở do OpenAI giới thiệu, nổi tiếng nhờ độ chính xác cao, hỗ trợ đa ngôn ngữ…

Xem thêm

LlamaIndex là gì: Framework RAG kết nối dữ liệu nội bộ với LLM

LlamaIndex là framework mã nguồn mở viết bằng Python (và TypeScript) giúp kết nối dữ liệu riêng tư của doanh nghiệp với các mô hình ngôn ngữ lớn. Nếu bạn…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất