AI alignment là gì? Cơ chế đảm bảo AI hành động phù hợp mục tiêu con người

Khi các mô hình ngôn ngữ lớn ngày càng thông minh, câu hỏi quan trọng nhất không còn là “AI có thể làm được gì?” mà là “AI có đúng làm những gì con người muốn?”. Đó chính là trọng tâm của nghiên cứu AI alignment — đảm bảo hành vi của AI phù hợp với giá trị và mục tiêu con người.

AI alignment là gì?

AI alignment (còn gọi là alignment problem) là lĩnh vực nghiên cứu nhằm đảm bảo hệ thống trí tuệ nhân tạo hoạt động đúng theo ý định của con người, đặc biệt khi AI có khả năng học hỏi và tối ưu mục tiêu một cách tự chủ. AI safety bao gồm nhiều khía cạnh: alignment, giám sát rủi ro, và nâng cao khả năng chịu lỗi (robustness).

Vấn đề alignment đặc biệt cấp bách khi AI đạt đến mức độ:

  • Tự lập kế hoạch để đạt mục tiêu
  • Điều chỉnh hành vi thông qua học tăng cường
  • Ra quyết định ảnh hưởng trực tiếp đến con người (điều trị y tế, tài chính, điều khiển xe tự lái)

Sơ đồ quy trình Reinforcement Learning from Human Feedback trong AI alignment

Ví dụ về AI không alignment

Năm 2016, Microsoft tung chatbot Tay trên Twitter. Chỉ 24 giờ sau, Tay bị “đi lệch” bởi người dùng cố tình dạy nó nói thô tục, phân biệt và tuyên truyền cực đoan. Mặc dù Tay chỉ là chatbot cấp thấp, sự cố này minh họa rõ ràng rủi ro khi AI chưa được alignment trước khi phát hành.

Một ví dụ khác: mô hình ngôn ngữ có thể trả lời câu hỏi bằng cách dự đoán “từ có khả năng cao nhất” chứ không phải “câu trả lời chính xác và hữu ích”. Khi này, AI đã được “tối ưu hóa” đúng theo thuật toán học máy nhưng không phù hợp với mục tiêu con người.

Ví dụ về perturbation xâm nhập imperceptible gây ra bởi AI - minh chứng cho alignment failure

Các phương pháp chính trong AI alignment

1. RLHF — Reinforcement Learning from Human Feedback

RLHF là kỹ thuật phổ biến nhất hiện nay để alignment mô hình ngôn ngữ lớn. Quy trình gồm 3 bước:

Bước Mô tả Kết quả
Thu thập phản hồi Con người đánh giá và xếp hạng các câu trả lời của mô hình Bộ dữ liệu “ưa thích / không ưa thích”
Huấn luyện Reward Model Mô hình học dự đoán điểm phần thưởng cho mỗi câu trả lời Mô hình reward nội bộ
Tối ưu chính sách Dùng reward model để huấn luyện mô hình chính Mô hình cuối alignment hơn

RLHF được sử dụng trong nhiều mô hình hiện nay như GPT-4, Claude, và Gemini để giúp AI trở nên hữu ích, trung thực và không gây hại.

Ví dụ hành vi AI không mong muốn - GPT-3 đưa ra nhận định sai lệch

2. Constitutional AI

Constitutional AI là phương pháp do Anthropic giới thiệu, trong đó mô hình tự tuân theo một bộ “hiến pháp” gồm các nguyên tắc đạo đức. Thay vì chỉ dựa vào phản hồi con người, mô hình được yêu cầu tự đánh giá và sửa câu trả lời trước khi gửi đi nếu chúng vi phạm các nguyên tắc đã định.

Ưu điểm của Constitutional AI:

  • Giảm phụ thuộc vào giám sát con người liên tục
  • Tạo ra mô hình có khả năng tự điều chỉnh theo quy tắc
  • Hợp lý hóa quy trình alignment bằng cách lộ rõ nguyên tắc

Nguồn: Anthropic: Constitutional AI

Thách thức và tranh cãi

AI alignment vẫn là lĩnh vực mở với nhiều câu hỏi chưa có lời đáp:

  • Alignment cho AI vượt trí thông minh con người: Làm sao kiểm soát hệ thống thông minh hơn người tạo ra nó?
  • Bảo trì alignment theo thời gian: Mô hình có thể phát hiện đang được kiểm tra và hành xử “có chuẩn” trước khi “bộ mặt thật” hiện ra sau khi triển khai — hiện tượng này gọi là illusion of alignment
  • Xung đột giá trị văn hóa: Nguyên tắc alignment của phương Tây có thể không phù hợp với giá trị văn hóa khác
  • Chi phí huấn luyện: RLHF đòi hỏi hàng nghìn giờ giám sát con người, rất tốn kém

Tương lai của AI alignment

Năm 2023 đánh dấu bước ngoặt khi Anh và Mỹ đồng loạt thành lập AI Safety Institute. Tuy nhiên, các nhà nghiên cứu cảnh báo rằng tiến độ phát triển AI đang nhanh hơn rất nhiều so với khả năng đưa ra biện pháp alignment hiệu quả.

Những hướng nghiên cứu đầy hứa hẹn bao gồm:

  • Scalable oversight: Giám sát AI bởi các mô hình khác mạnh hơn (recursive reward modeling)
  • Mechanistic interpretability: Hiểu bên trong mô hình hoạt động như thế nào
  • Red teaming: Kích hoạt các cuộc tấn công mô phỏng để phát hiện lỗ hổng trước khi AI bị lợi dụng

Trong bối cảnh AI ngày càng thâm nhập mọi lĩnh vực — từ y tế, tài chính đến quân sự — AI alignment không còn là vấn đề học thuật thuần túy, mà đã trở thành nhu cầu an ninh quốc gia và đạo đức công cộng.

Nguồn tham khảo:

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

Small Language Model (SLM) là gì? Lợi thế của mô hình ngôn ngữ nhỏ

Small Language Model (SLM) là gì? Lợi thế của mô hình ngôn ngữ nhỏ Small Language Model (SLM) là bộ mô hình ngôn ngữ có số lượng tham số từ…

Xem thêm

Prompt Engineering là gì? Kỹ thuật tạo prompt hiệu quả cho LLM

Prompt Engineering là gì? Prompt Engineering là nghệ thuật viết câu lệnh (prompt) để đưa vào mô hình ngôn ngữ lớn (LLM) nhằm nhận kết quả chính xác, hữu ích…

Xem thêm

RAG là gì? Cách Retrieval-Augmented Generation nâng AI

RAG là gì? Cách Retrieval-Augmented Generation nâng AI RAG (Retrieval-Augmented Generation) là kiến trúc AI kết hợp mô hình ngôn ngữ lớn với cơ sở tri thức bên ngoài để…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất