
Stable Diffusion 3: Tạo Ảnh AI Từ Mô Tả Văn Bản
Stable Diffusion 3 là mô hình sinh ảnh mã nguồn mở (open-source) từ Stability AI, sử dụng Diffusion Transformer (DiT) architecture để tạo ảnh chất lượng cao từ mô tả văn bản. Bài viết hướng dẫn chi tiết cách sử dụng và các kỹ thuật nâng cao.
Stable Diffusion 3 Là Gì?
Stable Diffusion là thế hệ thứ 3 của dòng Stable Diffusion, cải tiến đáng kể về chất lượng ảnh, khả năng tuân thủ prompt, và rendering text trong ảnh. Mô hình sử dụng kiến trúc DiT (Diffusion Transformer) thay vì U-Net truyền thống, giúp mở rộng quy mô hiệu quả hơn.
Stability AI công bố SD3 vào năm 2024, với các phiên bản từ 2 tỷ tham số (Medium) đến 8 tỷ tham số (Large). Mô hình được huấn luyện trên dataset lớn với cả image-text pairs và caption dữ liệu chất lượng cao.
Một cải tiến quan trọng là MMDiT (Multimodal Diffusion Transformer), xử lý đồng thời cả image patches và text tokens, giúp mô hình hiểu prompt tốt hơn các phiên bản trước.

Các Phiên Bản Mô Hình
Stability AI cung cấp nhiều phiên bản SD3:
- SD3 Medium: 2 tỷ tham số, cân bằng chất lượng và tốc độ. Chạy được trên GPU 12GB.
- SD3 Large: 8 tỷ tham số, chất lượng cao hơn đáng kể. Yêu cầu GPU 24GB+.
- SD3.5 Large: Cải tiến prompt alignment, realism, và khả năng render text. Ra mắt năm 2024.
- SD3.5 Lite: Phiên bản nhẹ hơn, phù hợp cho deployment trên edge devices.
Cách Tạo Ảnh Với SD3
Có nhiều cách để chạy SD3, từ API nhanh đến tự host hoàn toàn:
Via API
Nhiều dịch vụ cung cấp API cho SD3, bao gồm Stability AI API và các bên thứ ba:
curl -X POST https://stablediffusionapi.com/api/v4/dreambooth
-H "Content-Type: application/json"
-d '{"key":"YOUR_API_KEY","model_id":"sd3.5","prompt":"a sunset over mountains","width":"1024","height":"1024","num_inference_steps":"30"}'
Via ComfyUI Local
ComfyUI là giao diện dựa trên node, hỗ trợ SD3 natively và cho phép tạo workflow tùy chỉnh:
- Cài đặt:
git clone https://github.com/comfyanonymous/ComfyUI - Download checkpoint SD3 từ Hugging Face
- Load checkpoint vào workflow
- Cấu hình sampler, steps, CFG scale theo ý muốn
Via Diffusers Library
Hugging Face Diffusers là thư viện Python phổ biến nhất:
from diffusers import StableDiffusion3Pipeline
pipe = StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large")
image = pipe("a futuristic cityscape").images[0]

Prompt Engineering Cho SD3
SD3 hiểu prompt tốt hơn các phiên bản trước, nhưng prompt engineering vẫn quan trọng:
| Kỹ thuật | Ví dụ |
|---|---|
| Mô tả chi tiết | “golden retriever wearing sunglasses on beach, photorealistic, 8k” |
| Chỉ định phong cách | “in the style of Studio Ghibli, watercolor, anime” |
| Negative prompt | “blurry, low quality, watermark, deformed hands” |
| Trọng số từ khóa | “(red hair:1.3), (blue eyes:1.2)” để nhấn mạnh đặc điểm |
Ngay cả thế, SD3 có thể tạo ra nhiều phong cách khác nhau từ cùng một prompt, tùy thuộc vào sampler và seed được chọn. Việc thử nghiệm với nhiều seed khác nhau là cách tốt nhất để tìm kết quả mong muốn.
ControlNet Và LoRA
SD3 hỗ trợ ControlNet để kiểm soát bố cục ảnh, và LoRA (Low-Rank Adaptation) để tùy chỉnh:
- ControlNet: Canny edge detection, depth map, pose skeleton để kiểm soát bố cục và tư thế nhân vật.
- LoRA: Tinh chỉnh mô hình với vài ảnh (fine-tune lightweight), phù hợp để tạo phong cách riêng hoặc nhân vật nhất quán.
Vì model LoRA nhỏ hơn mô hình gốc, chỉ cần 10-100 ảnh để tùy chỉnh thay vì hàng triệu. Di chuyển LoRA giữa các mô hình SD3 rất dễ dàng.
Kết Luận
Stable Diffusion 3 mở ra khả năng tạo ảnh chất lượng cao cho mọi người. Với kiến trúc DiT, prompt alignment cải tiến, và hệ sinh thái công cụ phong phú từ API, ComfyUI đến Diffusers, SD3 là lựa chọn hàng đầu cho creative AI. Bắt đầu với API hoặc tự host qua ComfyUI.
