LTX-Video: Mô hình video AI mã nguồn mở chạy trên GPU cá nhân

Màn hình laptop hiển thị code LTX-Video

LTX-Video là gì?

LTX-Video là một mô hình tạo video AI mã nguồn mở dựa trên kiến trúc Diffusion Transformer (DiT), phát triển bởi Lightricks — công ty Israel nổi tiếng với các ứng dụng chỉnh sửa ảnh như Facetune. Đây là mô hình video AI đầu tiên tích hợp khả năng tạo đồng thời cả âm thanh và video trong một mô hình duy nhất.

Với giấy phép Apache 2.0 cho mã nguồn, LTX-Video cho phép người dùng chạy local trên GPU cá nhân mà không cần phụ thuộc vào dịch vụ trả phí như Sora hay Runway. Mô hình hỗ trợ text-to-video, image-to-video và video-to-video với khả năng tạo video lên đến 60 giây.

Mô hình AI neural network tạo video từ văn bản

Kiến trúc kỹ thuật

Video-VAE đột phá

Điểm nổi bật nhất của LTX-Video nằm ở Video-VAE (Variational Autoencoder) với tỷ lệ nén 1:192 — gấp đôi so với các đối thủ như Sora (~1:96). VAE thực hiện downsampling không gian-thời gian 1:32 mỗi token với 128 kênh latent. Giải pháp mới mẻ này giúp giảm đáng kể chi phí tính toán trong quá trình denoising.

VAE decoder thực hiện bước denoising cuối cùng đồng thời chuyển đổi latents sang pixels theo cách tiếp cận toàn diện. Thư viện Reconstruction GAN được sử dụng làm hàm mất mát mới cho discriminator, cải thiện chất lượng tái tạo.

Text Encoder

Phiên bản gốc sử dụng T5-XXL từ PixArt-alpha làm text encoder. Phiên bản mới nhất LTX-2.5 nâng cấp lên Gemma 4 12B được fine-tune đặc biệt cho LTX, kết hợp cùng Llama 3.2 3B để nâng cao prompt enhancement.

Positional Embeddings

RoPE (Rotary Positional Embeddings) với tọa độ phân số chuẩn hóa giúp cải thiện tính nhất quán không gian và thời gian trong video đầu ra.

Giao diện terminal cài đặt LTX-Video

Hiệu suất ấn tượng

LTX-Video nổi bật với tốc độ tạo video vượt trội:

  • 2B model: Tạo 121 khung hình (5 giây) tại 512×768 chỉ trong 2 giây trên NVIDIA H100 — nhanh hơn thời gian xem thực tế
  • 13B distilled: Video HD trong 10 giây trên H100, preview độ phân giải thấp trong 3 giây
  • 2B FP8: Tạo video 720×480×121 dưới 1 phút trên RTX 4060 (8GB VRAM)
  • LTX-2: Chi phí compute thấp hơn 50% so với các mô hình đối thủ
Model Parameters VRAM tối thiểu Ghi chú
LTXV-2B distilled 2B ~4-8 GB (FP8) Nhanh, phù hợp GPU phổ thông
LTXV-13B dev 13B ~24-40 GB Chất lượng cao nhất
LTX-2.5 22B 22B ~40-80 GB Mới nhất, chất lượng sản xuất
LTX-2.5 distilled 22B ~24-40 GB Nhanh hơn, chất lượng sản xuất
Mô hình AI neural network tạo video từ văn bản

So sánh với đối thủ

Tính năng LTX-Video Sora Runway Gen-3 Kling
Mã nguồn mở Không Không Không
Chạy local Không Không Không
Giá Miễn phí (chi phí GPU) 200 USD/tháng Theo credit Theo credit
Âm thanh + Video Có (LTX-2+) Không Không
Phân giải tối đa 4K 1080p 1080p 1080p
Thời lượng tối đa 60 giây 20 giây 10 giây 10 giây
LoRA fine-tuning Không Không Không

LTX-Video là mô hình video AI mã nguồn mở duy nhất có chất lượng sản xuất, chạy được trên GPU phổ thông và hỗ trợ tùy biến đầy đủ qua LoRA/IC-LoRA. Không có đối thủ nào khác (Sora, Runway, Kling, Pika) vừa open-source vừa self-hostable.

Các phiên bản và tính năng

LTX-Video đã phát triển nhanh chóng qua nhiều phiên bản:

  • v0.9.0 — Ra mắt ban đầu với text-to-video và image-to-video
  • v0.9.6 — Mô hình 2B distilled với tốc độ nhanh gấp 15 lần
  • v0.9.8 — Hỗ trợ video lên đến 60 giây, cải thiện hiểu prompt
  • LTX-2 — Tích hợp tạo âm thanh đồng thời với video
  • LTX-2.5 — Phiên bản mới nhất với 22B transformer, Gemma 4 12B text encoder

Các tính năng nổi bật bao gồm multi-keyframe conditioning, video extension (tiến và lùi), HDR output (EXR export), và video retaking (tạo lại các khoảng thời gian cụ thể).

Hệ sinh thái và hỗ trợ cộng đồng

LTX-Video sở hữu cộng đồng phát triển sôi động với hơn 10.900 GitHub stars và gần 500.000 lượt tải từ HuggingFace. Các công cụ cộng đồng bao gồm:

Hỗ trợ phần cứng đa dạng: NVIDIA (CUDA), Apple Silicon (MPS), và AMD (ROCm). Yêu cầu Python 3.10.5+, CUDA 12.2+, PyTorch >= 2.1.2.

Giấy phép sử dụng

Mã nguồn áp dụng Apache License 2.0 cho tất cả phiên bản. Tuy nhiên, model weights từ v0.9.5 trở đi sử dụng Open RAIL-M License — giấy phép thương mại miễn phí nhưng có giới hạn: cấm deepfake, cấm PII, bắt buộc công bố nội dung AI-generated.

Với LTX-2 và LTX-2.5, Lightricks sử dụng custom LTX Community License Agreement — tương tự về tinh thần nhưng cập nhật các điều khoản phù hợp với phiên bản mới.

Hướng dẫn cài đặt nhanh

Bắt đầu với LTX-Video không phức tạp:

# Clone repository
git clone https://github.com/Lightricks/LTX-Video.git
cd LTX-Video

# Cài đặt dependencies
pip install -r requirements.txt

# Tải model weights
huggingface-cli download Lightricks/LTX-Video 
  --local-dir ./checkpoints

Sau khi cài đặt, bạn có thể tạo video đầu tiên chỉ với vài dòng Python. Với GPU 8GB VRAM (RTX 4060 trở lên), mô hình 2B distilled là lựa chọn tối ưu cho người mới bắt đầu.

Kết luận

LTX-Video đang định nghĩa lại thị trường tạo video AI bằng cách đưa công nghệ trước đây chỉ có ở các dịch vụ trả phí lên GPU cá nhân. Với tốc độ nhanh nhất phân khúc, giấy phép mở, và cộng đồng sôi động, đây là lựa chọn hàng đầu cho developer muốn tích hợp AI video generation vào ứng dụng của mình.

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

So sánh tốc độ và RAM usage của Phi-3.5-mini, Gemma 2 2B, Qwen2.5 3B trên Raspberry Pi 5

So sánh SLM trên thiết bị biên Phi-3.5-mini Gemma 2 2B Qwen2.5 3B

Giới thiệu về Small Language Models (SLMs) Small Language Models (SLMs) đang trở thành xu hướng mới trong lĩnh vực AI cho thiết bị biên (Edge AI) với kích thước…

Xem thêm

RAG là gì: Retrieval Augmented Generation cho AI hiện đại

RAG: Retrieval Augmented Generation nâng cấp LLM RAG (Retrieval Augmented Generation) là kỹ thuật kết hợp truy xuất tài liệu từ cơ sở tri thức bên ngoài với khả năng…

Xem thêm

TinyML: Chạy Machine Learning Trên Vi Điều Khiển Siêu Nhỏ

TinyML là gì? TinyML là nhánh trí tuệ nhân tạo intelligence chạy trực tiếp trên vi điều khiển siêu nhỏ — những chip có RAM chỉ vài KB, không cần…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất