
Mixture of Experts (MoE) là kỹ thuật tiên tiến trong thiết kế mô hình ngôn ngữ lớn (LLM) cho phép tăng khả năng mà không tương ứng tăng chi phí tính toán tuyến tính. Thay vì kích hoạt toàn bộ mô hình cho mỗi đầu vào, MoE chỉ kích hoạt một phần nhỏ các “expert networks” chuyên dụng, từ đó đạt được hiệu suất tương đương với mô hình dày nhưng với chi phí suy luận gần như mô hình thưa.

Kiến trúc Mixture of Experts
Trong một lớp MoE tiêu chuẩn, chúng ta có:
- Các Expert Networks: Thông thường là 8-64 mạng neural nhỏ (Feed-forward networks) được huấn luyện để chuyên môn về các vùng khác nhau của không gian đầu vào.
- Gating Network (Router): Một mạng neural nhỏ quyết định những chuyên gia nào nên được kích hoạt cho một token đầu vào cụ thể, thường chỉ chọn top-2 experts.
- Capacity Factor: Giới hạn số token mỗi expert có thể xử lý để đảm bảo load balancing.
Khi một token đi qua lớp MoE:
- Gating network tính toán trọng số cho mỗi expert
- Chọn top-k experts (thường k=2) có trọng số cao nhất
- Token được xử lý bởi các expert này và kết quả được kết hợp theo trọng số
- Các expert khác không được kích hoạt → tiết kiệm tính toán
Lợi ích của MoE
1. Hiệu suất mở rộng mà không tăng chi phí suy luận
Một MoE model với 64 expert và kích hoạt 2 experts mỗi token có hiệu suất tương đương với một mô hình dense 2x lớn hơn, nhưng chi phí suy luận chỉ tăng khoảng 1.2-1.5x thay vì 2x.

2. Huấn luyện hiệu quả hơn
Mặc dù mỗi token chỉ nhìn thấy một phần expert, nhưng trong toàn bộ batch, tất cả experts đều được huấn luyện, cho phép mở rộng quy mô huấn luyện mà không cần tăng bộ nhớ GPU từng thiết bị tương xứng.
3. Linh hoạt trong triển khai
Các expert có thể được phân tán trên nhiều thiết bị, cho phép triển khai mô hình cực lớn trên cụm heterogeneous hardware.
Ứng dụng thực tế
Các công ty hàng đầu đang áp dụng MoE:
- Mixtral 8x7B/8x22B: Mistral AI’s mô hình mở nguồn với 8 experts, kích hoạt 2 mỗi token.
- Groq’s Mixtral: Tối ưu hóa MoE trên LPU để đạt throughput cao.
- Microsoft’s Phi-3-MoE: Kết hợp MoE với chất lượng dữ liệu tốt để đạt hiệu suất xuất sắc với kích thước vừa.
- Google’s Switch Transformer: Một trong những người tiên phong áp dụng MoE cho T5 với tỷ lệ kích hoạt 1 expert/token.
Thách thức phát triển
Mặc dù có lợi ích, MoE còn mặt hạn chế:
- Load imbalance: Một số expert có thể bị quá tải trong khi những expert khác không hoạt động.
- Routing instability: Gating network có thể thay đổi chuyên môn hóa experts trong quá trình huấn luyện.
- Memory overhead: Cần lưu trữ tất cả experts ngay cả khi không được kích hoạt.
