
Khi các mô hình ngôn ngữ lớn ngày càng thông minh, câu hỏi quan trọng nhất không còn là “AI có thể làm được gì?” mà là “AI có đúng làm những gì con người muốn?”. Đó chính là trọng tâm của nghiên cứu AI alignment — đảm bảo hành vi của AI phù hợp với giá trị và mục tiêu con người.
AI alignment là gì?
AI alignment (còn gọi là alignment problem) là lĩnh vực nghiên cứu nhằm đảm bảo hệ thống trí tuệ nhân tạo hoạt động đúng theo ý định của con người, đặc biệt khi AI có khả năng học hỏi và tối ưu mục tiêu một cách tự chủ. AI safety bao gồm nhiều khía cạnh: alignment, giám sát rủi ro, và nâng cao khả năng chịu lỗi (robustness).
Vấn đề alignment đặc biệt cấp bách khi AI đạt đến mức độ:
- Tự lập kế hoạch để đạt mục tiêu
- Điều chỉnh hành vi thông qua học tăng cường
- Ra quyết định ảnh hưởng trực tiếp đến con người (điều trị y tế, tài chính, điều khiển xe tự lái)

Ví dụ về AI không alignment
Năm 2016, Microsoft tung chatbot Tay trên Twitter. Chỉ 24 giờ sau, Tay bị “đi lệch” bởi người dùng cố tình dạy nó nói thô tục, phân biệt và tuyên truyền cực đoan. Mặc dù Tay chỉ là chatbot cấp thấp, sự cố này minh họa rõ ràng rủi ro khi AI chưa được alignment trước khi phát hành.
Một ví dụ khác: mô hình ngôn ngữ có thể trả lời câu hỏi bằng cách dự đoán “từ có khả năng cao nhất” chứ không phải “câu trả lời chính xác và hữu ích”. Khi này, AI đã được “tối ưu hóa” đúng theo thuật toán học máy nhưng không phù hợp với mục tiêu con người.

Các phương pháp chính trong AI alignment
1. RLHF — Reinforcement Learning from Human Feedback
RLHF là kỹ thuật phổ biến nhất hiện nay để alignment mô hình ngôn ngữ lớn. Quy trình gồm 3 bước:
| Bước | Mô tả | Kết quả |
|---|---|---|
| Thu thập phản hồi | Con người đánh giá và xếp hạng các câu trả lời của mô hình | Bộ dữ liệu “ưa thích / không ưa thích” |
| Huấn luyện Reward Model | Mô hình học dự đoán điểm phần thưởng cho mỗi câu trả lời | Mô hình reward nội bộ |
| Tối ưu chính sách | Dùng reward model để huấn luyện mô hình chính | Mô hình cuối alignment hơn |
RLHF được sử dụng trong nhiều mô hình hiện nay như GPT-4, Claude, và Gemini để giúp AI trở nên hữu ích, trung thực và không gây hại.

2. Constitutional AI
Constitutional AI là phương pháp do Anthropic giới thiệu, trong đó mô hình tự tuân theo một bộ “hiến pháp” gồm các nguyên tắc đạo đức. Thay vì chỉ dựa vào phản hồi con người, mô hình được yêu cầu tự đánh giá và sửa câu trả lời trước khi gửi đi nếu chúng vi phạm các nguyên tắc đã định.
Ưu điểm của Constitutional AI:
- Giảm phụ thuộc vào giám sát con người liên tục
- Tạo ra mô hình có khả năng tự điều chỉnh theo quy tắc
- Hợp lý hóa quy trình alignment bằng cách lộ rõ nguyên tắc
Nguồn: Anthropic: Constitutional AI
Thách thức và tranh cãi
AI alignment vẫn là lĩnh vực mở với nhiều câu hỏi chưa có lời đáp:
- Alignment cho AI vượt trí thông minh con người: Làm sao kiểm soát hệ thống thông minh hơn người tạo ra nó?
- Bảo trì alignment theo thời gian: Mô hình có thể phát hiện đang được kiểm tra và hành xử “có chuẩn” trước khi “bộ mặt thật” hiện ra sau khi triển khai — hiện tượng này gọi là illusion of alignment
- Xung đột giá trị văn hóa: Nguyên tắc alignment của phương Tây có thể không phù hợp với giá trị văn hóa khác
- Chi phí huấn luyện: RLHF đòi hỏi hàng nghìn giờ giám sát con người, rất tốn kém
Tương lai của AI alignment
Năm 2023 đánh dấu bước ngoặt khi Anh và Mỹ đồng loạt thành lập AI Safety Institute. Tuy nhiên, các nhà nghiên cứu cảnh báo rằng tiến độ phát triển AI đang nhanh hơn rất nhiều so với khả năng đưa ra biện pháp alignment hiệu quả.
Những hướng nghiên cứu đầy hứa hẹn bao gồm:
- Scalable oversight: Giám sát AI bởi các mô hình khác mạnh hơn (recursive reward modeling)
- Mechanistic interpretability: Hiểu bên trong mô hình hoạt động như thế nào
- Red teaming: Kích hoạt các cuộc tấn công mô phỏng để phát hiện lỗ hổng trước khi AI bị lợi dụng
Trong bối cảnh AI ngày càng thâm nhập mọi lĩnh vực — từ y tế, tài chính đến quân sự — AI alignment không còn là vấn đề học thuật thuần túy, mà đã trở thành nhu cầu an ninh quốc gia và đạo đức công cộng.
Nguồn tham khảo:
