Nếu BERT nổi bật với khả năng hiểu và biểu diễn văn bản, thì một hướng phát triển khác của Transformer lại tập trung vào việc sinh văn bản.
Đó chính là GPT – Generative Pre-trained Transformer.
GPT là nền tảng của một dòng mô hình ngôn ngữ lớn đã phát triển mạnh trong những năm gần đây. Nhưng về bản chất, ý tưởng cốt lõi lại bắt đầu từ một bài toán rất đơn giản:
Nếu biết những token phía trước, mô hình có thể dự đoán token tiếp theo là gì?
1. GPT là gì?
GPT là viết tắt của Generative Pre-trained Transformer.
Đây là dòng mô hình ngôn ngữ dựa trên kiến trúc Transformer Decoder, được thiết kế để học cách mô hình hóa và sinh sequence.
Ba từ trong tên GPT mô tả ba ý tưởng quan trọng:
- Generative: có khả năng tạo ra nội dung mới.
- Pre-trained: được huấn luyện trước trên lượng dữ liệu lớn.
- Transformer: sử dụng kiến trúc Transformer.
Có thể hình dung:
Large Text Dataset
│
▼
Pre-training
│
▼
GPT Model
│
▼
Text Generation
2. GPT khác BERT như thế nào?
GPT và BERT đều dựa trên Transformer nhưng sử dụng hai hướng kiến trúc khác nhau.
| Đặc điểm | BERT | GPT |
|---|---|---|
| Kiến trúc | Transformer Encoder | Transformer Decoder |
| Mục tiêu chính | Hiểu và biểu diễn ngôn ngữ | Sinh sequence |
| Pretraining tiêu biểu | Masked Language Modeling | Next-token Prediction |
| Cách sử dụng context | Bidirectional trong biểu diễn | Chỉ sử dụng token trước đó khi dự đoán token tiếp theo |
| Ứng dụng tiêu biểu | Classification, NER, QA | Text Generation, Completion |
Đây là khác biệt quan trọng để hiểu tại sao GPT phù hợp với việc tạo văn bản.
3. GPT dự đoán token tiếp theo như thế nào?
Ý tưởng cơ bản của GPT rất đơn giản:
Dựa trên những token đã xuất hiện, dự đoán token tiếp theo.
Ví dụ:
"The capital of France is"
Mô hình có thể tính xác suất cho các token tiếp theo:
Paris → 0.85
London → 0.03
Berlin → 0.02
Madrid → 0.01
...
Một token được lựa chọn dựa trên phân phối xác suất đó.
Sau khi có token mới:
"The capital of France is Paris"
Token vừa sinh lại được đưa vào context để dự đoán token tiếp theo.
"The capital of France is Paris"
↓
"The capital of France is Paris and"
Quá trình này tiếp tục lặp lại.
4. Autoregressive Generation là gì?
Cách GPT sinh văn bản được gọi là autoregressive generation.
Mô hình dự đoán từng token dựa trên những token đã có trước đó.
Token 1
↓
Token 2
↓
Token 3
↓
Token 4
↓
...
↓
Token N
Về mặt xác suất, GPT mô hình hóa sequence theo dạng:
P(x₁, x₂, ..., xₙ)
=
P(x₁)
× P(x₂|x₁)
× P(x₃|x₁,x₂)
× ...
× P(xₙ|x₁,...,xₙ₋₁)
Điều này cho phép mô hình tạo ra cả một sequence bằng cách liên tục dự đoán token tiếp theo.
5. Causal Attention là gì?
Để GPT không “nhìn thấy tương lai”, Transformer Decoder sử dụng Causal Self-Attention hay còn gọi là Masked Self-Attention.
Ví dụ sequence:
I love Machine Learning
Khi dự đoán token ở vị trí hiện tại, mô hình chỉ được phép sử dụng những token ở phía trước.
I ✓
love ✓ ✓
Machine ✓ ✓ ✓
Learning✓ ✓ ✓ ✓
Những vị trí phía sau được che bằng attention mask.
Nhờ vậy, trong quá trình training, mô hình học đúng nhiệm vụ:
Context
↓
Predict next token
6. GPT có thực sự “viết từng từ” không?
Không chính xác.
GPT hoạt động trên token, không nhất thiết là từ hoàn chỉnh.
Một token có thể là:
- Một từ.
- Một phần của từ.
- Dấu câu.
- Ký hiệu.
- Một phần nhỏ của chuỗi ký tự.
Ví dụ minh họa:
"unbelievable"
→ "un" + "believ" + "able"
Cách chia token thực tế phụ thuộc vào tokenizer của từng mô hình.
Vì vậy, khi nói GPT “dự đoán từ tiếp theo”, cách diễn đạt chính xác hơn là GPT dự đoán token tiếp theo.
7. GPT được Pre-training như thế nào?
GPT được pretrain trên lượng lớn dữ liệu văn bản.
Mục tiêu cơ bản là tối ưu khả năng dự đoán token tiếp theo.
Input:
"The student is learning"
Target:
"Python"
Mô hình tạo ra phân phối xác suất:
Python → 0.60
Machine → 0.15
Data → 0.10
English → 0.03
...
Trong quá trình training, mô hình so sánh dự đoán với token mục tiêu và điều chỉnh các tham số thông qua backpropagation và optimizer.
Quá trình này được lặp lại trên rất nhiều sequence.
8. Loss Function trong GPT
Một hàm loss phổ biến cho bài toán next-token prediction là Cross-Entropy Loss.
Nếu target token là:
"Python"
mô hình càng đặt xác suất cao cho “Python” thì loss càng thấp.
Có thể biểu diễn đơn giản:
Prediction
│
▼
Compare with Target
│
▼
Cross-Entropy Loss
│
▼
Backpropagation
│
▼
Update Parameters
Qua hàng triệu hoặc hàng tỷ bước training, mô hình dần điều chỉnh các tham số để cải thiện khả năng dự đoán.
9. GPT học được gì trong quá trình training?
GPT không được lập trình thủ công để ghi nhớ từng quy tắc ngôn ngữ.
Thay vào đó, các pattern được học thông qua quá trình tối ưu hóa trên dữ liệu.
Mô hình có thể học được những mối quan hệ như:
- Cấu trúc câu.
- Quan hệ giữa các từ.
- Pattern ngữ pháp.
- Thông tin xuất hiện trong dữ liệu training.
- Mối quan hệ giữa các khái niệm.
Có thể hình dung:
Large Dataset
↓
Training
↓
Millions / Billions of Parameters
↓
Learned Representations
↓
Next-token Prediction
Tuy nhiên, việc mô hình có thể tạo ra câu trả lời phù hợp không đồng nghĩa với việc mọi thông tin được sinh ra đều chính xác.
10. Temperature là gì?
Khi GPT tạo token tiếp theo, mô hình có thể lựa chọn token dựa trên phân phối xác suất.
Temperature là một tham số có thể được sử dụng để điều chỉnh độ “phẳng” của phân phối xác suất trong quá trình sampling.
Temperature thấp thường khiến lựa chọn tập trung hơn vào các token có xác suất cao.
Temperature cao làm phân phối rộng hơn và cho phép các lựa chọn ít xác suất hơn xuất hiện thường xuyên hơn.
Temperature thấp
↓
Phân phối tập trung
↓
Output ổn định hơn
Temperature cao
↓
Phân phối rộng hơn
↓
Output đa dạng hơn
Temperature không trực tiếp thay đổi kiến thức của mô hình; nó chủ yếu ảnh hưởng đến cách token được chọn trong quá trình sampling.
11. Sampling là gì?
Sau khi mô hình tạo ra xác suất cho các token tiếp theo, hệ thống cần quyết định token nào sẽ được chọn.
Có nhiều chiến lược sampling khác nhau.
Greedy Decoding
Luôn chọn token có xác suất cao nhất.
Token A → 0.60
Token B → 0.25
Token C → 0.15
→ Chọn Token A
Top-K Sampling
Chỉ giữ lại K token có xác suất cao nhất trước khi sampling.
Top-P Sampling
Chọn một tập token có tổng xác suất đạt đến một ngưỡng P nhất định rồi sampling trong tập đó.
Các chiến lược này ảnh hưởng đến tính đa dạng và tính ngẫu nhiên của output.
12. Context Window là gì?
GPT không thể xử lý một lượng token vô hạn trong một lần.
Context Window là giới hạn lượng token mà mô hình có thể xem xét trong một lần xử lý.
Ví dụ minh họa:
┌──────────────────────────────┐
│ Context │
│ │
│ Token 1 │
│ Token 2 │
│ Token 3 │
│ ... │
│ Token N │
└──────────────────────────────┘
│
▼
Predict next token
Context window càng lớn, mô hình càng có khả năng xử lý những sequence dài hơn trong một lần gọi, nhưng chi phí tính toán và bộ nhớ cũng trở thành một vấn đề quan trọng.
13. GPT-1, GPT-2 và GPT-3
Dòng GPT đã phát triển qua nhiều thế hệ.
| Thế hệ | Năm | Đặc điểm nổi bật |
|---|---|---|
| GPT-1 | 2018 | Đặt nền tảng cho hướng pretraining generative Transformer |
| GPT-2 | 2019 | Mở rộng đáng kể quy mô mô hình và dữ liệu |
| GPT-3 | 2020 | Quy mô lớn và thể hiện mạnh khả năng few-shot learning |
Điểm đáng chú ý là quá trình phát triển không chỉ đơn giản là “tăng số parameter”. Dữ liệu, kiến trúc, mục tiêu training, hạ tầng tính toán và phương pháp đánh giá đều đóng vai trò quan trọng.
14. GPT-3 và Few-shot Learning
Một trong những khả năng gây chú ý của các mô hình GPT lớn là in-context learning.
Thay vì phải fine-tune mô hình cho từng nhiệm vụ, người dùng có thể cung cấp một số ví dụ ngay trong prompt.
Ví dụ:
Positive → I love this movie.
Negative → I hate this movie.
Positive → This product is excellent.
Negative → ?
Mô hình có thể suy ra pattern từ các ví dụ trong context và đưa ra output phù hợp.
Đây là một trong những yếu tố quan trọng trong sự phát triển của Large Language Models.
15. Từ GPT đến Large Language Model
Khi các mô hình Transformer được mở rộng về:
- Số lượng parameters.
- Dữ liệu training.
- Compute.
- Khả năng xử lý context.
chúng dần trở thành Large Language Models – LLMs.
Có thể hình dung quá trình:
Transformer
↓
GPT
↓
Larger GPT Models
↓
Large Language Models
↓
Instruction Tuning
↓
Chat-based AI
Tuy nhiên, một hệ thống chatbot hiện đại thường không chỉ bao gồm một mô hình pretrained đơn thuần. Có thể có thêm các bước như instruction tuning, preference optimization, safety training và nhiều thành phần hệ thống khác.
16. GPT có phải chỉ là một “máy dự đoán từ”?
Ở mức toán học, next-token prediction chính là mục tiêu cốt lõi của nhiều mô hình GPT-style.
Nhưng khi mô hình được training trên dữ liệu quy mô lớn, nhiệm vụ này có thể dẫn đến việc học được rất nhiều pattern phức tạp.
Ví dụ:
Prompt
↓
Context Representation
↓
Probability Distribution
↓
Next Token
↓
Updated Context
↓
Next Token
↓
...
Vì vậy, câu “GPT chỉ dự đoán token tiếp theo” đúng ở cấp độ mục tiêu training, nhưng không mô tả đầy đủ những khả năng phức tạp mà mô hình có thể thể hiện sau quá trình training quy mô lớn.
17. Hạn chế của GPT
GPT có khả năng sinh văn bản mạnh nhưng không phải lúc nào cũng tạo ra thông tin chính xác.
Hallucination
Mô hình có thể tạo ra thông tin nghe hợp lý nhưng không đúng với thực tế hoặc không được hỗ trợ bởi nguồn dữ liệu đáng tin cậy.
Phụ thuộc vào dữ liệu
Chất lượng và phạm vi dữ liệu training ảnh hưởng đến những pattern mà mô hình có thể học.
Chi phí tính toán
Các mô hình lớn cần lượng tài nguyên đáng kể trong quá trình training và inference.
Context không phải bộ nhớ vô hạn
Mặc dù context window của các mô hình hiện đại đã tăng đáng kể, nó vẫn là một giới hạn kỹ thuật và không nên được hiểu như một bộ nhớ dài hạn hoàn hảo.
18. GPT và Generative AI
GPT là một ví dụ tiêu biểu cho cách Transformer có thể được sử dụng để xây dựng hệ thống Generative AI.
Thay vì chỉ phân loại input:
Text
↓
Classification
↓
Positive / Negative
GPT có thể thực hiện:
Prompt
↓
Language Model
↓
Token 1
↓
Token 2
↓
Token 3
↓
...
↓
Generated Text
Chính khả năng sinh sequence này tạo nền tảng cho nhiều ứng dụng như:
- Text generation.
- Question answering.
- Summarization.
- Translation.
- Code generation.
- Writing assistance.
19. BERT và GPT trong chuỗi kiến thức AI
Sau khi học Transformer, có thể hình dung hai hướng phát triển tiêu biểu:
Transformer
│
┌───────────┴───────────┐
↓ ↓
Encoder Decoder
↓ ↓
BERT GPT
↓ ↓
Language Understanding Text Generation
Đây là một cách nhìn đơn giản hóa, nhưng rất hữu ích để hiểu sự khác biệt giữa hai dòng kiến trúc.
20. Tổng kết
GPT – Generative Pre-trained Transformer là một dòng mô hình ngôn ngữ dựa trên Transformer Decoder, nổi bật với khả năng sinh văn bản thông qua việc dự đoán token tiếp theo.
Những khái niệm quan trọng cần nhớ:
- Autoregressive: dự đoán token dựa trên context trước đó.
- Causal Attention: ngăn mô hình nhìn thấy token tương lai.
- Next-token Prediction: mục tiêu cốt lõi của quá trình pretraining.
- Pre-training: học pattern ngôn ngữ từ dữ liệu lớn.
- Context Window: giới hạn lượng token có thể được xử lý trong một context.
- Sampling: phương pháp lựa chọn token từ phân phối xác suất.
- In-context Learning: mô hình có thể sử dụng ví dụ được cung cấp ngay trong prompt.
Có thể ghi nhớ GPT bằng một câu:
GPT sử dụng Transformer Decoder để dự đoán token tiếp theo, lặp lại quá trình đó để tạo thành chuỗi văn bản hoàn chỉnh.
Từ GPT, chúng ta có thể tiếp tục tìm hiểu một khái niệm rất quan trọng trong AI hiện đại: Large Language Model (LLM) – điều gì khiến một mô hình ngôn ngữ trở thành “mô hình ngôn ngữ lớn”, và vì sao scale lại quan trọng?
Tài liệu tham khảo
Improving Language Understanding by Generative Pre-Training
Language Models are Unsupervised Multitask Learners
Language Models are Few-Shot Learners
Attention Is All You Need
Hugging Face – GPT-2 Documentation
🚀 Học Data Science & AI cùng MCNA Technology School
Nếu bạn muốn xây dựng nền tảng từ Python, Data Analysis đến AI và Machine Learning, có thể tham khảo:
Tác giả: Bùi Đình Tuyển – Data Analyst tại MCNA Technology School
Hotline: 0939.866.825 (Mr. Minh Khang)
Website: mcna.vn
Hà Nội: 30 Trung Liệt, Đống Đa | Liền kề 44B TT2 Văn Quán, Hà Đông
TP.HCM: 50B Phan Tây Hồ, Cầu Kiệu

