Transformer Architecture Là Gì? Mô Hình Cốt Lõi Của LLM

Chatgpt Image Sep 3, 2026, 05_20_42 Pm

Series: Machine Learning Fundamentals – Bài 35

Ở bài trước, chúng ta đã tìm hiểu Recurrent Neural Network (RNN) cùng các biến thể LSTM và GRU – những mô hình đặt nền móng cho việc xử lý dữ liệu chuỗi (Sequential Data). Tuy nhiên, rào cản lớn nhất của RNN/LSTM là tính toán tuần tự (Sequential Computation): phải chờ tính xong bước thời gian $t-1$ mới tính được bước $t$. Điều này khiến RNN không thể song song hóa (Parallelization) trên GPU và gặp hiện tượng “chai lì” khi xử lý các chuỗi văn bản siêu dài.

Năm 2017, bài báo lịch sử “Attention Is All You Need” của Google ra đời, giới thiệu kiến trúc Transformer Architecture. Đây chính là bước ngoặt công nghệ mở ra kỷ nguyên Generative AI, Large Language Models (ChatGPT, Claude, Gemini) và định hình lại toàn bộ ngành AI hiện đại.

Transformer Architecture là gì?

Transformer Architecture là một kiến trúc Deep Learning loại bỏ hoàn toàn các vòng lặp hồi quy (Recurrent Loops) của RNN và các phép tích chập (Convolution) của CNN. Thay vào đó, nó dựa hoàn toàn vào cơ chế Tự chú ý (Self-Attention) để xử lý toàn bộ các từ trong câu cùng một lúc (Parallel Processing).

RNN:          [Từ 1] ──> [Từ 2] ──> [Từ 3] ──> [Từ 4]  (Xử lý tuần tự - Chậm)
                                                         
Transformer:  [Từ 1, Từ 2, Từ 3, Từ 4]                 (Xử lý song song - Cực nhanh)
                    │   │   │   │
                    ▼   ▼   ▼   ▼
               [Self-Attention Layer]

Tài liệu chính thức mô tả Transformer xử lý ngữ cảnh của tất cả các vị trí trong chuỗi đầu vào song song, giúp tăng tốc độ huấn luyện lên gấp hàng chục lần. Xem thêm tại PyTorch Transformer Documentation.

Trái tim của Transformer: Cơ chế Self-Attention

Cơ chế Self-Attention (Tự chú ý) cho phép mô hình đánh giá mức độ liên quan giữa mỗi từ với tất cả các từ còn lại trong cùng một câu, bất kể khoảng cách giữa chúng xa hay gần.

Ví dụ: Trong câu “Con hổ chạy qua rừng và rất nhanh”, Self-Attention giúp mô hình hiểu từ “nó” liên kết trực tiếp với “Con hổ” chứ không phải “rừng”.

Công thức toán học của Scaled Dot-Product Attention

Mỗi từ đầu vào được biến đổi thành 3 vectơ:

  • Query ($Q$): Vectơ câu hỏi (“Tôi đang tìm kiếm thông tin gì?”).

  • Key ($K$): Vectơ từ khóa (“Tôi chứa đựng thông tin gì?”).

  • Value ($V$): Vectơ nội dung thực sự của từ.

$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{Q K^T}{\sqrt{d_k}}\right) V$$

Trong đó $d_k$ là chiều của vectơ Key. Việc chia cho $\sqrt{d_k}$ giúp ổn định Gradient (tránh làm bão hòa hàm Softmax khi số chiều quá lớn).

Cấu trúc Multi-Head Attention (Chú ý đa đầu)

Thay vì chỉ tính toán Attention một lần, Transformer chia các vectơ $Q, K, V$ thành nhiều phần nhỏ để chạy Multi-Head Attention song song.

  • Mục đích: Mỗi “Head” (đầu chú ý) sẽ học một loại mối quan hệ ngữ cảnh khác nhau.

    • Head 1: Học mối quan hệ ngữ pháp (Chủ ngữ – Động từ).

    • Head 2: Học đại từ thay thế (“nó” – “con hổ”).

    • Head 3: Học ngữ cảnh không gian/thời gian.

Sau đó, kết quả từ tất cả các Head được nối lại (Concatenate) và chiếu qua một ma trận trọng số tuyến tính.

Mã hóa vị trí (Positional Encoding)

Vì Transformer xử lý tất cả các từ cùng một lúc, mô hình không tự biết thứ tự trước/sau của các từ trong câu (khác với RNN vốn đọc từng từ từ trái sang phải).

Để giải quyết vấn đề này, Transformer cộng thêm một vectơ Positional Encoding vào mỗi Word Embedding đầu vào. Vectơ này sử dụng các hàm lượng giác ($\sin$$\cos$) ở các tần số khác nhau để đánh dấu vị trí tuyệt đối và tương đối của từng từ trong chuỗi.

Tổng quan kiến trúc Encoder – Decoder

Mô hình Transformer nguyên bản bao gồm 2 nhánh chính:

[Input Tokens] ──> [Positional Encoding]
                         │
                         ▼
             ┌──────────────────────┐
             │    ENCODER BLOCK     │ (Xử lý & Hiểu văn bản đầu vào)
             └──────────────────────┘
                         │
                         ▼ (Context Vectors)
             ┌──────────────────────┐
             │    DECODER BLOCK     │ (Sinh văn bản đầu ra từng từ)
             └──────────────────────┘
                         │
                         ▼
                  [Output Tokens]
  1. Nhánh Encoder (Bộ mã hóa): Nhận câu đầu vào, đi qua các tầng Multi-Head Self-AttentionFeed-Forward Neural Network để tạo ra bản biểu diễn ngữ cảnh toàn diện. (Là nền tảng của các mô hình như BERT).

  2. Nhánh Decoder (Bộ giải mã): Nhận đầu ra từ Encoder kết hợp với các từ đã sinh ra trước đó để dự đoán từ tiếp theo. Decoder sử dụng Masked Multi-Head Attention để ngăn mô hình “nhìn trước” các từ ở tương lai. (Là nền tảng của các mô hình như GPT-3, GPT-4, LLaMA).

Dữ liệu có cần Preprocessing / Scaling không?

CỰC KỲ BẮT BUỘC.

  1. Tokenization & Subword Embedding: Văn bản phải được chuyển thành các chuỗi Token (Byte-Pair Encoding – BPE, WordPiece) và ánh xạ sang không gian vectơ liên tục (Embedding Vector).

  2. Layer Normalization: Khác với CNN thường dùng Batch Normalization, Transformer bắt buộc dùng Layer Normalization sau mỗi lớp Attention và Feed-Forward để chuẩn hóa các kích hoạt (Activations) về cùng thang đo, giúp các mô hình hàng tỷ tham số hội tụ ổn định.

  3. Padding & Attention Mask: Với các câu có độ dài khác nhau, dữ liệu được Pad về cùng độ dài và dùng Attention Mask (gán giá trị $-\infty$ trước khi qua Softmax) để mô hình bỏ qua các vị trí Pad.

So sánh RNN/LSTM và Transformer Architecture

Tiêu chí Recurrent Neural Network (RNN/LSTM) Transformer Architecture
Cơ chế chính Vòng lặp hồi quy & Hidden State Tự chú ý (Self-Attention) & Positional Encoding
Khả năng song song Không (Phải xử lý tuần tự từng bước $t$) Rất cao (Xử lý toàn bộ chuỗi cùng lúc trên GPU)
Phụ thuộc xa (Long Dependencies) Kém (Dễ mất thông tin dù có LSTM/GRU) Tuyệt vời (Kết nối trực tiếp mọi cặp từ trong câu)
Tốc độ huấn luyện Chậm trên tập dữ liệu lớn Cực nhanh trên hệ thống GPU/TPU phân tán
Chi phí bộ nhớ Tăng tuyến tính theo độ dài chuỗi $O(N)$ Tăng theo bình phương độ dài chuỗi $O(N^2)$

Ưu điểm và Nhược điểm của Transformer Architecture

Ưu điểm

  • Song song hóa tối đa, khai thác $100\%$ sức mạnh của phần cứng GPU/TPU.

  • Nắm bắt ngữ cảnh dài hạn (Long-range Dependencies) hoàn hảo nhờ cơ chế Attention trực tiếp.

  • Khả năng mở rộng (Scalability) tuyệt vời, làm nền tảng cho các mô hình ngôn ngữ lớn (LLM).

Nhược điểm

  • Độ phức tạp tính toán bộ nhớ $O(N^2)$: Khi độ dài chuỗi $N$ tăng lên (ví dụ: đoạn văn hàng triệu từ), chi phí tính ma trận Self-Attention bùng nổ rất nhanh.

  • Yêu cầu tập dữ liệu huấn luyện khổng lồ và chi phí điện năng/phần cứng cực kỳ tốn kém.

Các ứng dụng thực tế của Transformer

  • Large Language Models (LLMs): ChatGPT, Gemini, Claude, LLaMA (Sinh văn bản, lập trình, tóm tắt).

  • Dịch máy & Xử lý ngôn ngữ: Google Translate, kiểm tra chính tả Grammarly.

  • Thị giác máy tính (Vision Transformers – ViT): Áp dụng Self-Attention cho các mảnh ảnh (Patches) thay cho phép tích chập CNN.

  • Hóa sinh & Y tế: AlphaFold 2 (Dự đoán cấu trúc Protein của DeepMind).

Tóm tắt

  1. Transformer Architecture thay thế vòng lặp tuần tự của RNN bằng cơ chế Self-Attention xử lý song song.

  2. Self-Attention tính toán tương quan giữa các từ qua bộ ba vectơ $Q, K, V$.

  3. Positional Encoding giúp mô hình nhận biết vị trí và thứ tự từ trong câu.

  4. Multi-Head Attention giúp trích xuất đồng thời nhiều khía cạnh ngữ cảnh khác nhau.

  5. Bắt buộc dùng Layer NormalizationToken Embedding trước khi huấn luyện.

Tài liệu tham khảo

  1. Vaswani et al. (2017): Attention Is All You Need – Bài báo gốc kinh điển về Transformer.

  2. PyTorch Documentation: Transformers in PyTorch

  3. Hugging Face Documentation: Transformers Library

Khóa học tại MCNA Technology School

Nếu bạn muốn thực hành Machine Learning, Python và xây dựng các mô hình trên dữ liệu thực tế, có thể tham khảo:

Tác giả: Bùi Đình Tuyển – Data Analyst tại MCNA Technology School

📞 Hotline: 0939.866.825 (Mr. Khang)

🌐 Website: MCNA Technology School

📍 Hà Nội: 30 Trung Liệt, Đống Đa | Liền kề 44B TT2 Văn Quán, Hà Đông

📍 TP.HCM: 50B Phan Tây Hồ, Cầu Kiệu

Chỉ mục