
Transformer là gì? Đây là kiến trúc mạng nơ-ron sâu được giới thiệu trong bài báo khoa học Attention Is All You Need của nhóm nghiên cứu Google Brain vào năm 2017, hiện là nền tảng của hầu hết các mô hình AI hiện đại. Từ BERT, GPT đến ChatGPT, mọi mô hình ngôn ngữ lớn đều dựa trên kiến trúc Transformer, biến nó thành phát minh quan trọng nhất của trí tuệ nhân tạo trong thập kỷ qua.
Transformer ra đời như thế nào?
Bài báo Attention Is All You Need do Vaswani và 7 đồng tác giả công bố tháng 6/2017 đã giới thiệu một kiến trúc hoàn toàn mới dựa trên cơ chế attention, không còn dùng mạng hồi quy (RNN) hay mạng tích chập (CNN) như các mô hình trước đó. Kết quả ngay lập tức vượt trội: mô hình Transformer đạt điểm BLEU 28.4 khi dịch Anh sang Đức trên bộ dữ liệu WMT 2014, cao hơn 2 điểm so với kỷ lục cũ, và đạt 41.8 điểm khi dịch Anh sang Pháp.
Điểm mạnh lớn nhất của Transformer là khả năng xử lý song song toàn bộ chuỗi dữ liệu, trong khi RNN phải xử lý tuần tự từng từ một. Nhờ vậy, mô hình cơ bản chỉ cần 12 giờ huấn luyện trên 8 GPU, còn bản lớn hơn mất khoảng 3,5 ngày, một con số rất ấn tượng so với các mô hình ngôn ngữ đương thời.
Cơ chế Self-Attention và Q, K, V
Trái tim của Transformer là cơ chế tự chú ý (self-attention). Mỗi token trong câu được biến đổi thành ba vector gọi là Query, Key và Value thông qua ba ma trận trọng số khác nhau. Query của một từ sẽ được so sánh với Key của tất cả các từ khác để tính mức độ liên quan, sau đó dùng trọng số này để tổng hợp các Value tương ứng.
Công thức được viết là softmax(QK^T / sqrt(dk)) nhân với V, trong đó phép chia cho căn bậc hai của chiều Key giúp ổn định gradient. Nhờ cơ chế này, mô hình có thể xác định từ nào quan trọng với từ nào trong toàn bộ câu, bất kể khoảng cách giữa chúng xa đến đâu, giải quyết triệt để vấn đề mất gradient khi xử lý chuỗi dài của RNN.
Multi-Head Attention: nhiều góc nhìn cùng lúc
Thay vì chỉ thực hiện attention một lần, Transformer chạy song song 8 lần với các phép chiếu khác nhau, gọi là 8 đầu attention (attention heads). Mỗi đầu học một kiểu quan hệ riêng, chẳng hạn một đầu chú ý đến quan hệ cú pháp, đầu khác chú ý đến quan hệ ngữ nghĩa, sau đó các kết quả được nối lại và chiếu qua một ma trận tổng hợp. Điều này cho phép mô hình khai thác thông tin từ nhiều không gian biểu diễn khác nhau cùng lúc.

Kích thước embedding của mô hình là 512 chiều, và toàn bộ kiến trúc gồm 6 lớp encoder xếp chồng và 6 lớp decoder. Mỗi lớp encoder gồm một khối multi-head self-attention theo sau là mạng feed-forward, còn decoder có thêm khối cross-attention để lấy thông tin từ encoder và cơ chế masked self-attention để không nhìn thấy các từ phía trước khi dự đoán.
Positional Encoding: giúp mô hình hiểu thứ tự từ
Vì xử lý song song toàn bộ câu, Transformer không có khái niệm thứ tự từ như RNN. Để giải quyết, bài báo đề xuất thêm positional encoding dạng sóng sin vào vector embedding của mỗi token. Mỗi vị trí trong câu nhận một tín hiệu riêng biệt theo tần số khác nhau, giúp mô hình phân biệt được thứ tự và khoảng cách tương đối giữa các từ.

Từ Transformer đến BERT, GPT và ChatGPT
Năm 2018, kiến trúc Transformer tách thành hai nhánh phát triển: mô hình encoder-only gọi là BERT của Google, học cách hiểu ngôn ngữ hai chiều và thống trị các bài toán hiểu ngôn ngữ; mô hình decoder-only gọi là GPT của OpenAI, học sinh văn bản tự động hồi quy. Nhánh GPT phát triển mạnh hơn qua GPT-2, GPT-3 và đỉnh cao là ChatGPT ra mắt cuối năm 2022, thực chất là phiên bản tinh chỉnh của GPT-3.5.
Mọi mô hình ngôn ngữ lớn hiện nay như GPT-4, Claude, Gemini hay DeepSeek đều kế thừa cấu trúc Transformer với các cải tiến về quy mô, dữ liệu và kỹ thuật huấn luyện. Kiến trúc này cũng lan sang xử lý hình ảnh với Vision Transformer, tạo video và nhiều lĩnh vực khác.
Hạn chế của Transformer
Hạn chế lớn nhất của Transformer là chi phí tính toán tăng theo bình phương độ dài chuỗi đầu vào, ký hiệu O(n^2), vì mỗi cặp token đều phải tính attention. Điều này khiến việc xử lý ngữ cảnh rất dài trở nên tốn kém, và là động lực cho các nghiên cứu về attention tuyến tính, cửa sổ trượt hay các kiến trúc mới như Mamba nhằm giảm chi phí này.
