Viết tắt của Large Language Model, LLM là mô hình ngôn ngữ lớn — một chương trình được huấn luyện trên lượng văn bản khổng lồ để đoán chữ tiếp theo trong một đoạn văn. ChatGPT, Gemini hay DeepSeek đều dựng trên một LLM; toàn bộ khả năng viết, dịch, tóm tắt và trả lời của chúng sinh ra từ việc đoán chữ đó, lặp lại rất nhiều lần.
Nó thật sự làm gì bên trong
Nghe khó tin, nhưng đây là toàn bộ công việc của một LLM: cho một đoạn văn bản, tính xem chữ nào khả năng đến tiếp theo cao nhất, chọn một chữ, gắn vào cuối, rồi lặp lại. Bạn gõ "Thủ đô của Việt Nam là". Model không tra cứu bảng dữ liệu nào cả: nó tính rằng sau chuỗi đó "Hà" có xác suất cao nhất, thêm vào rồi tính tiếp ra "Nội", cứ thế tới khi thấy nên dừng.
Khác biệt nằm ở quy mô. Huấn luyện trên lượng văn bản đủ lớn, để đoán đúng chữ tiếp theo, model buộc phải học ngữ pháp, sự kiện, phong cách và cách lập luận mà không ai lập trình vào. Khả năng viết luận hay gỡ lỗi code là hệ quả của việc đoán chữ giỏi, không phải tính năng cài riêng — và điều này giải thích gần hết những hành vi lạ của AI bạn từng gặp.
Token là gì
Model không đọc theo chữ cái, cũng không hẳn theo từ. Nó cắt văn bản thành các mảnh gọi là token — một từ ngắn, một phần của từ dài hay một dấu câu. Vì sao cần biết: tiền tính theo token, cả token gửi vào lẫn token sinh ra; tiếng Việt tốn nhiều token hơn tiếng Anh cho cùng một nội dung, vì cách cắt token thường tối ưu cho tiếng Anh; và giới hạn ngữ cảnh cũng tính bằng token, không phải bằng trang.
Ngữ cảnh và chuyện AI hay quên
Cửa sổ ngữ cảnh là lượng token tối đa model nhìn thấy trong một lần: chỉ dẫn hệ thống, toàn bộ cuộc trò chuyện từ đầu, tài liệu bạn dán vào và cả câu trả lời nó đang viết. Ba hệ quả rất thực tế:
Model không có trí nhớ thật. Mỗi lượt hỏi, toàn bộ lịch sử được gửi lại từ đầu. Cảm giác "nó nhớ tôi vừa nói gì" chỉ vì phần đó vẫn nằm trong ngữ cảnh. Mở chat mới là sạch trơn, trừ khi ứng dụng có tính năng ghi nhớ riêng — thứ hoạt động bằng cách lén chèn ghi chú cũ vào ngữ cảnh.
Chat quá dài thì chất lượng tụt. Vượt giới hạn thì phần đầu bị cắt, model quên yêu cầu ban đầu hoặc tự mâu thuẫn. Xong một chủ đề thì mở chat mới.
Thông tin giữa đoạn dài dễ bị bỏ sót. Model chú ý phần đầu và phần cuối tốt hơn phần giữa, nên yêu cầu quan trọng hãy đặt ở cuối prompt.
Vì sao LLM bịa, và vì sao đó là đặc tính
Việc model nói ra thông tin sai một cách tự tin gọi là hallucination — ảo giác, dân dã là bịa: bịa tên sách không tồn tại, trích điều luật sai số, đưa ra hàm thư viện nghe hợp lý nhưng không hề có.
Đây không phải lỗi phần mềm chờ được vá, mà là hệ quả trực tiếp của cách model vận hành: nó được thiết kế để sinh chuỗi chữ nghe hợp lý, không phải để nói sự thật. Một câu đúng và một câu bịa nhưng trôi chảy không khác nhau về bản chất. Nó cũng không có cơ chế để biết mình đang không biết: hỏi về một điều luật không tồn tại, nó vẫn sinh ra thứ có hình dạng của câu trả lời, vì đó là việc duy nhất nó biết làm.
Bịa nặng nhất ở: con số, ngày tháng, tên riêng, trích dẫn, văn bản pháp lý và mọi lĩnh vực rất hẹp. Cách sống chung, không phải cách diệt tận gốc:
- Đưa tài liệu vào cùng câu hỏi — model tóm tắt văn bản trước mặt chính xác hơn hẳn nhớ lại.
- Luôn kiểm chứng con số, tên và trích dẫn — chỗ nó sai nhiều nhất mà nghe thuyết phục nhất.
- Cho phép nó nói không biết. Thêm câu "nếu không chắc thì nói không biết" giảm bịa rõ rệt.
- Dùng hệ thống có tra cứu tài liệu thật, tức hướng đi trong bài RAG là gì.
Tham số và kích thước model nghĩa là gì
Bạn hay thấy tên model kèm số và chữ B: 7B, 70B. B là billion — tỉ tham số. Tham số là các con số bên trong model, được điều chỉnh dần khi huấn luyện, và là nơi lưu toàn bộ "hiểu biết" của nó. Nhiều tham số hơn thường nghĩa là nắm nhiều kiến thức hơn, đổi lại chạy chậm hơn, tốn bộ nhớ hơn và đắt hơn.
Ba điều nên biết:
- Số tham số không phải thước đo chất lượng — model nhỏ làm kỹ có thể hơn model to làm ẩu.
- Về bộ nhớ: RAM hoặc VRAM cần nhiều hơn dung lượng file model một chút.
- Lượng tử hoá là nén model bằng cách hạ độ chính xác các con số bên trong: file nhỏ đi nhiều lần, chất lượng giảm một chút, đổi lại máy thường chạy được.
Model đóng và model mở
| Model đóng | Model mở | |
|---|---|---|
| Cách dùng | Qua web hoặc API nhà cung cấp | Tải trọng số về tự chạy |
| Dữ liệu của bạn | Đi lên máy chủ nhà cung cấp | Ở lại máy bạn nếu tự chạy |
| Chi phí | Trả theo token hoặc thuê bao | Miễn phí model, trả tiền phần cứng |
| Tuỳ biến | Giới hạn theo nhà cung cấp | Toàn quyền, tinh chỉnh được |
| Chất lượng đỉnh | Thường nhỉnh hơn | Khoảng cách ngày càng hẹp |
| Phù hợp với | Đa số người dùng và doanh nghiệp | Dữ liệu nhạy cảm, dùng nhiều, cần kiểm soát |
Lưu ý chữ nghĩa: "model mở" thường chỉ nghĩa là trọng số được công bố để tải về, chứ không phải mọi thứ đều công khai — dữ liệu huấn luyện thường vẫn kín và giấy phép mỗi model một khác. Ví dụ tiêu biểu là DeepSeek.
Chạy LLM trên máy cá nhân được không
Được, và dễ hơn nhiều so với vài năm trước: cài một công cụ như Ollama hoặc LM Studio, chọn model, tải về là chạy hoàn toàn offline. Nhưng cần thực tế về kỳ vọng: model chạy trên laptop là bản nhỏ đã nén, ổn cho việc nhẹ như tóm tắt, viết nháp, hỏi đáp kiến thức chung, nhưng kém rõ rệt so với dịch vụ đám mây ở việc khó, ở tiếng Việt và ở lập trình.
Ai nên tự chạy: người xử lý dữ liệu không được đưa lên mạng, người muốn dùng không giới hạn lượt, người thích vọc kỹ thuật. Còn lại, bản web của các dịch vụ lớn nhanh hơn, giỏi hơn và miễn phí ở mức thường ngày.
Dùng ở Việt Nam thế nào
Vì sao nên hiểu phần này. Hầu hết công cụ AI bạn dùng hằng ngày đều là một LLM khoác giao diện khác nhau. Biết nó đoán chữ và có thể bịa giúp tránh hai sai lầm phổ biến: tin con số nó đưa ra, và tưởng nó nhớ những gì bạn nói tuần trước.
Việc nó làm tốt. Soạn và sửa email, viết mô tả sản phẩm, dịch Việt–Anh, tóm tắt tài liệu và biên bản họp, viết và giải thích code — điểm chung là bạn đưa nguyên liệu vào và kiểm được kết quả. Cần chọn công cụ cụ thể thì xem AI miễn phí tốt nhất hiện nay.
Việc nên cẩn thận. Hỏi về quy định pháp luật Việt Nam, thủ tục hành chính hay số liệu thị trường trong nước — vùng nó bịa nhiều nhất, vì dữ liệu huấn luyện tiếng Việt thưa hơn tiếng Anh rất nhiều. Vẫn phải mở văn bản gốc ra đối chiếu.
Điều kiện cần. Bản web của các dịch vụ lớn dùng được từ Việt Nam, đăng ký bằng email hoặc số điện thoại, phần lớn miễn phí đủ cho cá nhân; chỉ khi trả phí hoặc dùng API mới cần thẻ quốc tế. Với dữ liệu công ty: đừng dán hợp đồng, dữ liệu khách hàng hay mã nguồn nội bộ vào bản miễn phí.
Câu hỏi thường gặp
LLM có hiểu điều nó nói không?
Chưa có câu trả lời được thống nhất, kể cả trong giới nghiên cứu. Về vận hành, nó dự đoán chuỗi token chứ không có ý thức. Cách dùng an toàn: coi nó là công cụ giỏi ngôn ngữ, không phải một người biết chuyện.
Vì sao hỏi lại cùng câu mà trả lời khác nhau?
Vì model chọn token tiếp theo có yếu tố ngẫu nhiên, để câu văn tự nhiên hơn — hành vi cố ý, không phải lỗi. Cần ổn định thì viết prompt chặt hơn, quy định rõ định dạng đầu ra, hoặc giảm tham số ngẫu nhiên nếu gọi qua API.
LLM có tự học từ cuộc trò chuyện của tôi không?
Không. Model chỉ thay đổi khi được huấn luyện lại, do nhà cung cấp làm theo chu kỳ. Nội dung bạn gõ có thể được lưu và dùng để cải thiện dịch vụ tuỳ chính sách và cài đặt tài khoản — nên kiểm tra phần cài đặt dữ liệu nếu bạn làm với thông tin nhạy cảm.
Model có tham số nhiều hơn thì luôn tốt hơn?
Không. Kích thước chỉ là một yếu tố; dữ liệu và cách huấn luyện đều ảnh hưởng lớn. Với nhiều việc cụ thể, model nhỏ được tinh chỉnh đúng còn chạy tốt hơn model lớn dùng chung, lại rẻ và nhanh hơn.
LLM khác chatbot thường ở chỗ nào?
Chatbot đời cũ chạy theo kịch bản: nhận diện từ khoá rồi trả lời câu có sẵn, chệch kịch bản là bó tay. LLM sinh câu trả lời mới cho từng tình huống, xử lý được cả câu hỏi chưa ai lường trước. Đổi lại, nó không đảm bảo trả lời đúng.