

Stable Diffusion 3 là mô hình text-to-image thế hệ mới nhất từ Stability AI, cải thiện đáng kể chất lượng ảnh và khả năng tuân thủ prompt. Hướng dẫn này giúp bạn bắt đầu từ cài đặt đến kỹ thuật nâng cao, bao gồm cả troubleshooting các lỗi thường gặp.
Stable Diffusion 3 Là Gì?
Stable Diffusion 3 (SD3) là mô hình AI tạo ảnh ra mắt 2024, cải tiến từ SDXL và SD 2.1 với kiến trúc hoàn toàn mới. Stability AI gọi đây là bước nhảy vọt lớn nhất trong dòng Stable Diffusion:
- Diffusion Transformer (DiT): Thay thế U-Net, xử lý prompt hiệu quả hơn. DiT nắm bắt ngữ nghĩa prompt tốt hơn U-Net nhờ attention mechanism.
- Mamba architecture: Hỗ trợ ảnh độ phân giải cao, chi tiết hơn. State space model xử lý long-range dependencies tốt hơn transformer thuần.
- Multimodal: Hỗ trợ cả text-to-image và image-to-image trong cùng một mô hình, cho phép linh hoạt hơn trong workflow.
- 8 tỷ tham số: Mô hình lớn nhất trong dòng Stable Diffusion, vượt qua SDXL (3.5 tỷ) và SD 2.1 (860 triệu).
- Flow matching: Kỹ thuật training mới thay thế denoising, hội tụ nhanh hơn và chất lượng cao hơn.

Cài Đặt Và Chạy SD3
Có 2 cách chính để chạy Stable Diffusion 3:
1. Qua ComfyUI (Khuyến nghị)
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
# Tải SD3.5 checkpoint vào models/checkpoints/
python main.py -- comfy
Cần VRAM tối thiểu 8GB cho SD3.5 Medium. Có thể dùng low VRAM mode để chạy trên 6GB bằng cách thêm –lowvram.
2. Qua Hugging Face
Dùng API miễn phí qua Hugging Face Spaces. Không cần cài đặt, phù hợp người mới bắt đầu. API hỗ trợ cả text-to-image và image-to-image.
Cấu Hình Phần Cứng
| Yêu cầu | Tối thiểu | Khuyến nghị |
|---|---|---|
| GPU VRAM | 8 GB | 12-24 GB |
| RAM | 16 GB | 32 GB |
| Storage | 50 GB SSD | 100+ GB NVMe |
| CPU | 4 cores | 8+ cores |
Với VRAM dưới 8GB, dùng ComfyUI với low VRAM mode hoặc Google Colab Pro ($10/tháng, V100 16GB). Mac người dùng Apple Silicon M1/M2/M3 cũng chạy được qua ComfyUI với Metal backend.
Kỹ Thuật Tạo Ảnh Nâng Cao
Prompt Engineering
SD3 hiểu prompt tiếng Anh tự nhiên tốt hơn hẳn các phiên bản trước. Cấu trúc prompt hiệu quả:
- Chủ thể: Mô tả chính xác đối tượng chính.
- Phong cách: Photorealistic, digital art, oil painting, anime, watercolor.
- Ánh sáng: Cinematic lighting, golden hour, studio lighting, volumetric light.
- Chất lượng: 8k, highly detailed, sharp focus, masterpiece.
- Composition: Rule of thirds, close-up, wide shot, bird’s eye view.
Ví dụ prompt: A young woman in traditional Vietnamese ao dai standing in a bamboo forest, golden hour lighting, photorealistic, highly detailed, 8k, shot on Canon EOS R5
ControlNet Trong SD3
ControlNet cho phép kiểm soát bố cục ảnh qua nhiều chế độ, rất hữu ích khi cần kết quả cụ thể:
- Canny Edge: Giữ đường nét từ ảnh tham chiếu, phù hợp khi muốn giữ hình dạng.
- Depth: Kiểm soát độ sâu cảnh, tạo hiệu ứng parallax 3D.
- Pose: Giữ tư thế người mẫu từ ảnh reference, hữu ích cho character design.
- IP-Adapter: Chuyển phong cách từ ảnh tham chiếu sang ảnh mới.
So Sánh SD3 vs SDXL vs Flux
| Model | Chất lượng | Tốc độ | VRAM cần | Chi phí |
|---|---|---|---|---|
| SD3.5 Medium | 8/10 | Nhanh | 8GB | Miễn phí |
| SDXL | 7/10 | Nhanh | 6GB | Miễn phí |
| Flux.1 Dev | 9/10 | Trung bình | 12GB | Phần lớn thương mại |
Troubleshooting Thường Gặp
- Out of Memory: Dùng –lowvram hoặc tải checkpoint vào RAM thay vì VRAM. Giảm batch size.
- Ảnh mờ, thiếu chi tiết: Tăng steps lên 40-50, dùng CFG scale 7-9. Upscale sau khi tạo.
- Prompt không tuân thủ: SD3 nhạy với cấu trúc prompt. Viết rõ ràng, đặt chủ thể lên đầu.
- Hands/chân sai: Đây là vấn đề chung của AI image gen. Dùng inpainting để sửa cục bộ.
Workflow Khuyên Dùng
Workflow phổ biến nhất cho SD3 trong ComfyUI: Img2Img → ControlNet (Canny/Depth) → Inpainting → Upscale (4x-UltraSharp). ComfyUI cho phép nối chuỗi các node linh hoạt. Lưu workflow đã test làm template để tái sử dụng nhanh. Xem thêm ComfyUI Documentation.
