
AlphaFold là gì: AI dự đoán cấu trúc 3D của protein như thế nào
AlphaFold là hệ thống trí tuệ nhân tạo do DeepMind phát triển, dự đoán cấu trúc ba chiều của một protein chỉ từ chuỗi amino acid của nó. Đưa vào chuỗi ký tự, nhận về cấu trúc không gian gấp xoắn hoàn chỉnh, không cần thí nghiệm tinh thể X-ray hay NMR. Đây là bước tiến lớn nhất của AI ứng dụng vào sinh học trong hai thập kỷ qua.
Bài viết này giải thích AlphaFold 2 dự đoán cấu trúc protein bằng cách nào, vì sao nó thắng thảo khổng lồ tại CASP14, cơ sở dữ liệu hơn 200 triệu cấu trúc mở ra, và giới hạn thực tế khi áp dụng vào nghiên cứu và dược phẩm.

AlphaFold giải bài toán 50 năm của sinh học
Protein là chuỗi amino acid gấp xoắn thành một hình khối cụ thể, và chính hình khối đó quyết định protein làm gì trong tế bào. Trước AlphaFold, cách xác định cấu trúc 3D chủ yếu dựa vào tinh thể X-ray và kỹ thuật NMR, mỗi cách tốn nhiều tháng cho mỗi cấu trúc và không áp dụng được cho mọi protein, đặc biệt protein nằm trong màng tế bào. Trong khi đó, các cơ sở dữ liệu chứa hàng chục triệu chuỗi amino acid đã biết, nghĩa là lượng dữ liệu trình tự áp đảo hẳn lượng dữ liệu cấu trúc.
Ý tưởng cốt lõi của AlphaFold: thay vì mô phỏng vật lý gấp xoắn (cực kỳ tốn kém tính toán), dùng mạng nơ-ron học quy luật gấp xoắn từ dữ liệu cấu trúc đã biết. AlphaFold 1 ra mắt năm 2018 và đã chiến thắng CASP13, chứng minh hướng tiếp cận khả thi. AlphaFold 2 tiếp tục đẩy xa hơn nữa khi thắng CASP14 với khoảng cách áp đảo lớn.
| Phiên bản | Năm | Đối tượng dự đoán | Điểm mấu chốt |
|---|---|---|---|
| AlphaFold 1 | 2018 | Monomer, mạng không tự chú ý | Thắng CASP13, thấy được cấu trúc mà không cần khoảng cách hình học đầu vào |
| AlphaFold 2 | 2020 | Monomer, có tự chú ý và biến đổi tam giác | GDT_TS trung vị 92.4 tại CASP14, vượt hệ thống thứ hai khoảng 3 lần |
| AlphaFold 3 | 2024 | Phức hợp protein với DNA, RNA, phân tử nhỏ và ion | Dùng Pairformer kết hợp mô hình khuếch tán, chính xác hơn hẳn công cụ chuyên dụng cho phức hợp |
Quy mô huấn luyện của AlphaFold 2 cũng cho thấy đây không phải bài toán nhỏ. Mô hình dùng 128 lõi TPU v3, huấn luyện trên khoảng 170 nghìn cấu trúc trong CSDL Protein Structure Bank (PDB), với tổng số mẫu khoảng 10 triệu. Dữ liệu mục tiêu rộng hơn nữa: Big Fantastic Database chứa khoảng 66 triệu họ protein và 2.2 tỉ chuỗi, số liệu được AlphaFold 3 công bố.

Cơ chế bên trong khối Evoformer
Kiến trúc AlphaFold 2 đặt trọng tâm vào khối Evoformer, sự kết hợp giữa cơ chế tự chú ý và biến đổi tam giác trên biểu diễn cặp. Mô hình xử lý đồng thời hai luồng thông tin song song:
- Luồng chuỗi nhiều dãy (MSA): đối chiếu chuỗi protein với hàng nghìn chuỗi trùng đoạn của các loài khác. Những vị trí amino acid được bảo toàn qua tiến hoá thường nằm sát nhau trong không gian, cung cấp tín hiệu mạnh cho cấu trúc.
- Luồng biểu diễn cặp (pair representation): ma trận mô tả quan hệ giữa mọi cặp nút phân tử trong protein, tức là toàn bộ ràng buộc khoảng cách mà mô hình đang suy luận.
Biến đổi tam giác là mảnh ghép đặc trưng của AlphaFold 2. Với mỗi bộ ba nút tạo thành tam giác, mô hình dùng thông tin của cặp đã biết để cập nhật trạng thái của cặp thứ ba, lặp lại nhiều vòng. Nhờ đó khoảng cách giữa hai nút không bị xác định trực tiếp vẫn được ràng buộc gián tiếp qua các nút trung gian. Càng nhiều vòng lặp cập nhật, cấu trúc ước lượng càng ổn định và bớt phụ thuộc vào điểm khởi tạo ngẫu nhiên.
Chi phí suy luận cũng đã đủ dùng cho nghiên cứu thường quy. Theo bài báo Nature năm 2021, một mô hình đơn cho protein 384 axit amin mất khoảng 9.2 phút trên GPU V100; với protein dài 2.500 axit amin thì con số này lên tới khoảng 18 giờ. Đây chính là lý do các phòng thí nghiệm chuyển từ chờ kết quả thí nghiệm sang dùng AlphaFold để chọn mẫu thí nghiệm đáng chạy.

CASP14 và giải Nobel Hoá học
CASP là giải đấu sinh học cấu trúc, nơi các nhóm phải dự đoán cấu trúc protein mà không có thí nghiệm trước đó. Tại CASP14, AlphaFold 2 đạt điểm GDT_TS trung vị 92.4 trên 92/97 mục tiêu, với sai số RMSD_95 dưới 1 angstrom. Trong khi đó hệ thống đứng thứ hai chỉ đạt khoảng một phần ba mức chính xác đó. Bảng xếp hạng z-score của kỳ thi cũng cho thấy nhóm của AlphaFold 2 dẫn rõ rệt các nhóm còn lại.
Kết quả này cùng với phần đóng góp cho thiết kế protein tính toán đã đưa Demis Hassabis và John Jumper (DeepMind) cùng David Baker (Đại học Washington) vào giải Nobel Hoá học. Bài báo mô tả AlphaFold 2 trên Nature cũng là một trong những bài được trích dẫn nhiều nhất trong lịch sử bài báo khoa học.
Cơ sở dữ liệu AlphaFold DB
Ngay sau khi công bố CASP14, nhóm DeepMind và Viện Nghiên cứu Tin sinh học châu Âu (EMBL-EBI) tung ra AlphaFold Protein Structure Database vào tháng 7 năm 2021. Các phiên bản sau đó mở rộng dần quy mô, lên trên 260 triệu cấu trúc dự đoán, gần như bao phủ toàn bộ protein đã biết trình tự. Theo ước tính của DeepMind, hơn 3 triệu nhà nghiên cứu từ hơn 190 quốc gia đã sử dụng cơ sở dữ liệu này, và khoảng 30% số bài báo trích dẫn AlphaFold liên quan đến nghiên cứu bệnh.
Đối với người nghiên cứu, ý nghĩa thực tế rất lớn: thay vì chờ nhiều tuần để có dữ liệu cấu trúc, nhóm có thể tải bản dự đoán về, đặt giả thuyết về vị trí của một phân tử nhỏ, rồi thiết kế thí nghiệm kiểm chứng đúng chỗ đó. AlphaFold 3 còn cung cấp dịch vụ dự đoán trực tuyến miễn phí cho mục đích phi thương mại.
Giới hạn và lỗi thường gặp khi dùng AlphaFold
AlphaFold không phải công cụ hoàn hảo, và hiểu rõ giới hạn giúp tránh kết luận sai. Danh sách lỗi phổ biến:
- Phức hợp sinh học: AlphaFold 2 dự đoán cấu trúc của một chuỗi đơn, chưa mô tả tốt cách nhiều chuỗi tương tác với nhau. Phải dùng AlphaFold 3 hoặc công cụ chuyên dụng cho bài toán này.
- Vùng rối loạn (disordered): các đoạn không có cấu trúc cố định sẽ cho độ tin cậy thấp, và điểm tin cậy (pLDDT) phản ánh điều đó.
- Protein đồng dạng thấp: với chuỗi không có protein bản sao tương tự trong dữ liệu, độ chính xác giảm rõ rệt, vì mô hình dựa nhiều vào mối quan hệ tiến hoá.
- Một cấu trúc tĩnh duy nhất: mô hình trả về một cấu trúc đại diện, không phải phân phối nhiều trạng thái mà protein thực sự có.
- Dữ liệu mô phỏng gây nhiễu: các cấu trúc không tự nhiên có thể bị mô hình xếp hạng cao nhầm, nên kết quả dự đoán vẫn cần kiểm chứng thực nghiệm.
Kết luận
AlphaFold đã thay đổi cách các nhà sinh học tiếp cận cấu trúc protein: từ thí nghiệm kéo dài nhiều tháng sang dự đoán tính toán trong vài phút. Công cụ này không thay thế thí nghiệm, nhưng nó lọc và định hướng nghiên cứu, tiết kiệm thời gian và chi phí cho phòng thí nghiệm, đồng thời mở ra khả năng nghiên cứu những protein trước đây không có dữ liệu cấu trúc. Hướng phát triển tiếp theo là mở rộng sang phức hợp nhiều phân tử và mô phỏng chuyển động của protein trong thời gian.
