Transformer là gì? Kiến trúc nền tảng của mọi mô hình AI

Transformer là gì? Đây là kiến trúc mạng nơ-ron sâu được giới thiệu trong bài báo khoa học Attention Is All You Need của nhóm nghiên cứu Google Brain vào năm 2017, hiện là nền tảng của hầu hết các mô hình AI hiện đại. Từ BERT, GPT đến ChatGPT, mọi mô hình ngôn ngữ lớn đều dựa trên kiến trúc Transformer, biến nó thành phát minh quan trọng nhất của trí tuệ nhân tạo trong thập kỷ qua.

Transformer ra đời như thế nào?

Bài báo Attention Is All You Need do Vaswani và 7 đồng tác giả công bố tháng 6/2017 đã giới thiệu một kiến trúc hoàn toàn mới dựa trên cơ chế attention, không còn dùng mạng hồi quy (RNN) hay mạng tích chập (CNN) như các mô hình trước đó. Kết quả ngay lập tức vượt trội: mô hình Transformer đạt điểm BLEU 28.4 khi dịch Anh sang Đức trên bộ dữ liệu WMT 2014, cao hơn 2 điểm so với kỷ lục cũ, và đạt 41.8 điểm khi dịch Anh sang Pháp.

Điểm mạnh lớn nhất của Transformer là khả năng xử lý song song toàn bộ chuỗi dữ liệu, trong khi RNN phải xử lý tuần tự từng từ một. Nhờ vậy, mô hình cơ bản chỉ cần 12 giờ huấn luyện trên 8 GPU, còn bản lớn hơn mất khoảng 3,5 ngày, một con số rất ấn tượng so với các mô hình ngôn ngữ đương thời.

Cơ chế Self-Attention và Q, K, V

Trái tim của Transformer là cơ chế tự chú ý (self-attention). Mỗi token trong câu được biến đổi thành ba vector gọi là Query, Key và Value thông qua ba ma trận trọng số khác nhau. Query của một từ sẽ được so sánh với Key của tất cả các từ khác để tính mức độ liên quan, sau đó dùng trọng số này để tổng hợp các Value tương ứng.

Công thức được viết là softmax(QK^T / sqrt(dk)) nhân với V, trong đó phép chia cho căn bậc hai của chiều Key giúp ổn định gradient. Nhờ cơ chế này, mô hình có thể xác định từ nào quan trọng với từ nào trong toàn bộ câu, bất kể khoảng cách giữa chúng xa đến đâu, giải quyết triệt để vấn đề mất gradient khi xử lý chuỗi dài của RNN.

Multi-Head Attention: nhiều góc nhìn cùng lúc

Thay vì chỉ thực hiện attention một lần, Transformer chạy song song 8 lần với các phép chiếu khác nhau, gọi là 8 đầu attention (attention heads). Mỗi đầu học một kiểu quan hệ riêng, chẳng hạn một đầu chú ý đến quan hệ cú pháp, đầu khác chú ý đến quan hệ ngữ nghĩa, sau đó các kết quả được nối lại và chiếu qua một ma trận tổng hợp. Điều này cho phép mô hình khai thác thông tin từ nhiều không gian biểu diễn khác nhau cùng lúc.

Sơ đồ khối multi-head attention trong Transformer minh họa luồng Query, Key, Value qua 8 đầu attention

Kích thước embedding của mô hình là 512 chiều, và toàn bộ kiến trúc gồm 6 lớp encoder xếp chồng và 6 lớp decoder. Mỗi lớp encoder gồm một khối multi-head self-attention theo sau là mạng feed-forward, còn decoder có thêm khối cross-attention để lấy thông tin từ encoder và cơ chế masked self-attention để không nhìn thấy các từ phía trước khi dự đoán.

Positional Encoding: giúp mô hình hiểu thứ tự từ

Vì xử lý song song toàn bộ câu, Transformer không có khái niệm thứ tự từ như RNN. Để giải quyết, bài báo đề xuất thêm positional encoding dạng sóng sin vào vector embedding của mỗi token. Mỗi vị trí trong câu nhận một tín hiệu riêng biệt theo tần số khác nhau, giúp mô hình phân biệt được thứ tự và khoảng cách tương đối giữa các từ.

Sơ đồ kiến trúc tổng thể Transformer gồm khối encoder và decoder với các lớp multi-head attention và feed-forward

Từ Transformer đến BERT, GPT và ChatGPT

Năm 2018, kiến trúc Transformer tách thành hai nhánh phát triển: mô hình encoder-only gọi là BERT của Google, học cách hiểu ngôn ngữ hai chiều và thống trị các bài toán hiểu ngôn ngữ; mô hình decoder-only gọi là GPT của OpenAI, học sinh văn bản tự động hồi quy. Nhánh GPT phát triển mạnh hơn qua GPT-2, GPT-3 và đỉnh cao là ChatGPT ra mắt cuối năm 2022, thực chất là phiên bản tinh chỉnh của GPT-3.5.

Mọi mô hình ngôn ngữ lớn hiện nay như GPT-4, Claude, Gemini hay DeepSeek đều kế thừa cấu trúc Transformer với các cải tiến về quy mô, dữ liệu và kỹ thuật huấn luyện. Kiến trúc này cũng lan sang xử lý hình ảnh với Vision Transformer, tạo video và nhiều lĩnh vực khác.

Hạn chế của Transformer

Hạn chế lớn nhất của Transformer là chi phí tính toán tăng theo bình phương độ dài chuỗi đầu vào, ký hiệu O(n^2), vì mỗi cặp token đều phải tính attention. Điều này khiến việc xử lý ngữ cảnh rất dài trở nên tốn kém, và là động lực cho các nghiên cứu về attention tuyến tính, cửa sổ trượt hay các kiến trúc mới như Mamba nhằm giảm chi phí này.

Tham khảo thêm

Tôi là một lập trình viên IOS. Code chính là IOS nhưng thỉnnh thoảng vẫn đá sang Android hoặc web. Mặc dù không quá thông thạo nhưng tôi sẽ chia sẻ những kiến thức mà mình đã tìm hiểu, áp dụng qua.

Bài viết liên quan

Chatbot là gì? Cách hoạt động và ứng dụng thực tế

Chatbot là gì? Đó là chương trình phần mềm mô phỏng hội thoại với con người qua văn bản hoặc giọng nói, giúp doanh nghiệp trả lời khách hàng tự…

Xem thêm

AI tạo video là gì? Top công cụ text-to-video tốt nhất

AI tạo video là gì? AI tạo video (text-to-video) là công nghệ dùng mô hình trí tuệ nhân tạo tạo ra video từ câu lệnh văn bản. Người dùng gõ…

Xem thêm

AI trong y tế: Chẩn đoán bệnh và phát hiện ung thư bằng AI

AI trong y tế: Chẩn đoán bệnh và phát hiện ung thư AI trong y tế đang thay đổi cách các bác sĩ chẩn đoán và điều trị bệnh. Từ…

Xem thêm
0 0 đánh giá
Article Rating
Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất