
Meta chính thức phát hành Llama 4 vào tháng 4 năm 2025, đưa ra hai phiên bản Llama 4 Scout và Llama 4 Maverick. Đây là lần đầu tiên Meta triển khai kiến trúc Mixture-of-Experts (MoE) trong dòng Llama, mở đường cho khả năng đa modal gốc (native multimodal) xử lý văn bản, hình ảnh và video trong cùng một mô hình. Với cửa sổ ngữ cảnh lên tới 10 triệu token, Llama 4 định vị cạnh tranh trực tiếp với GPT-4o của OpenAI và Gemini 2.0 của Google.

Kiến trúc Mixture-of-Experts và đa modal gốc
Khác với Llama 3 sử dụng kiến trúc dense truyền thống, Llama 4 áp dụng MoE với 17 tỷ tham số hoạt động (active params) trên tổng số 109 tỷ (Scout) và 400 tỷ (Maverick). Chỉ một phần nhỏ các expert được kích hoạt cho mỗi token, giúp giảm chi phí suy luận đáng kể so với mô hình dense cùng quy mô. Đa modal gốc (native multimodal) nghĩa là mô hình được huấn luyện đồng thời trên văn bản, hình ảnh và video từ đầu, thay vì gắn thêm encoder riêng như cách làm trước đây.
Cửa sổ ngữ cảnh 10 triệu token của Llama 4 Scout là lớn nhất hiện nay trong các mô hình mở, tương đương khoảng 7,5 triệu từ tiếng Anh. Điều này cho phép xử lý toàn bộ codebase lớn, tài liệu pháp lý dài, hoặc nhiều video cùng lúc trong một lần gọi API. Maverick trade-off cửa sổ ngữ cảnh 1 triệu token để đạt hiệu suất cao hơn trên các benchmark reasoning và coding.
Hiệu suất benchmark so với GPT-4o
Trên LMSYS Chatbot Arena, Llama 4 Maverick đạt xếp hạng Elo 1417, cận kề GPT-4o (1420) và vượt Gemini 2.0 Flash (1395). Trên MMLU-Pro (đánh giá reasoning phức tạp), Maverick đạt 84.5% so với 85.1% của GPT-4o. Trên HumanEval (coding), Maverick đạt 88.2% pass@1, GPT-4o đạt 90.2%. Khoảng cách đã thu hẹp đáng kể so với thế hệ Llama 3.1 405B chỉ đạt 80.5% MMLU-Pro.
- MMLU-Pro: Maverick 84.5% vs GPT-4o 85.1%
- GPQA Diamond (khoa học): Maverick 58.7% vs GPT-4o 61.2%
- HumanEval (coding): Maverick 88.2% vs GPT-4o 90.2%
- MathVista (toán đa modal): Maverick 68.4% vs GPT-4o 71.8%
- MMMU (đa modal đại học): Maverick 65.1% vs GPT-4o 69.3%
Điểm mạnh nổi bật của Llama 4 là hiệu suất chi phí (price/performance). Chi phí suy luận trên llama.cpp hoặc vLLM chỉ khoảng 1/10 đến 1/20 so với GPT-4o API, tùy cấu hình phần cứng. Điều này làm cho Llama 4 trở thành lựa chọn hấp dẫn cho triển khai on-premise hoặc private cloud.

Ứng dụng thực tế và triển khai
Llama 4 Scout phù hợp cho RAG (Retrieval-Augmented Generation) quy mô lớn nhờ cửa sổ 10M token, cho phép nạp toàn bộ knowledge base vào context mà không cần chunking phức tạp. Maverick phù hợp cho coding assistant, agent tự động hóa, và tác vụ reasoning đa bước. Cả hai hỗ trợ tool calling chuẩn OpenAI format, tương thích với langchain, llama-index, và các framework agent hiện có.
Để chạy Llava 4 Scout 17B active locally, cần tối thiểu 2× H100 80GB hoặc 4× A100 80GB cho inference FP8. Quantization GGUF 4-bit giảm VRAM xuống ~60GB, chạy được trên 1× H100 hoặc 2× A100 40GB. Model weights trên Hugging Face có sẵn dưới giấy phép Llama 4 Community License cho phép sử dụng thương mại với một số hạn chế về quy mô người dùng (dưới 700 triệu MAU).
Meta cũng phát hành Llama Stack — bộ SDK và API chuẩn hóa để triển khai Llama 4 trên mọi hạ tầng từ laptop đến Kubernetes cluster. Stack bao gồm safety guardrails, synthetic data generation, và evaluation harness tích hợp.
Hạn chế và cân nhắc
Mặc dù tiến bộ lớn, Llama 4 vẫn có những hạn chế cần lưu ý:
Hạn chế hiện tại của Llama 4
- Hiệu suất tiếng Việt và các ngôn ngữ tài nguyên thấp chưa bằng GPT-4o do dữ liệu huấn luyện lệch về tiếng Anh
- Safety alignment chưa khớp hoàn toàn với yêu cầu enterprise strict — cần fine-tune thêm cho production
- Video understanding chỉ hỗ trợ đến 30 giây/clip, không xử lý video dài như Gemini 2.0
- Giấy phép Community License có điều khoản “Acceptable Use Policy” hạn chế một số ứng dụng quân sự, y tế critical
Đối với team kỹ thuật Việt Nam, Llama 4 Scout 17B là điểm khởi đầu tốt cho PoC RAG nội bộ trước khi scale. Maverick 400B phù hợp hơn cho sản phẩm customer-facing cần reasoning cao. Cần benchmark thực tế trên dữ liệu domain riêng vì benchmark công khai thường thiên về tiếng Anh và tác vụ học thuật.

Kết luận
Meta Llama 4 là bước ngoặt quan trọng đưa open-weight multimodal model ngang ngửa với closed-source top-tier. Kiến trúc MoE kết hợp cửa sổ ngữ cảnh khổng lồ tạo ra lợi thế chi phí – hiệu suất hấp dẫn cho triển khai private. Tuy nhiên, khoảng cách về đa ngôn ngữ, safety alignment, và video understanding vẫn còn tồn tại so với GPT-4o. Các tổ chức nên đánh giá PoC trên workload thực tế trước khi cam kết triển khai sản xuất.
Tham khảo thêm: Meta AI Blog phát hành Llama 4 | LMSYS Chatbot Arena Leaderboard
