Fine-tuning (tinh chỉnh) là việc lấy một mô hình AI đã được huấn luyện sẵn rồi dạy thêm cho nó bằng dữ liệu riêng của bạn, để nó trả lời theo đúng phong cách hoặc định dạng bạn muốn. Nó không dạy model kiến thức mới, mà dạy model cách hành xử — và trong phần lớn trường hợp thực tế, bạn không cần đến nó.
Hình dung cho dễ
Hãy coi một model như ChatGPT hay Gemini là nhân viên giỏi, học nhanh, nhưng mới vào công ty bạn hôm qua. Có ba cách để nhân viên đó làm đúng ý bạn:
- Viết hướng dẫn rõ ràng cho từng việc — đây là prompt.
- Đưa tài liệu công ty để tra cứu khi làm — đây là RAG.
- Cho đi học một khoá riêng, xem hàng nghìn ví dụ tới khi thành phản xạ — đây là fine-tuning.
Cách thứ ba tốn kém và chậm nhất, nên nó là phương án cuối chứ không phải phương án đầu.
Fine-tuning khác gì viết prompt tốt hơn
Đây là nhầm lẫn phổ biến nhất: rất nhiều người định fine-tune trong khi vấn đề thật sự là prompt viết chưa tới.
Viết prompt là ra chỉ dẫn tại thời điểm hỏi: model không thay đổi gì, hết cuộc trò chuyện là quên sạch. Fine-tune là thay đổi chính model: sau đó nó cư xử theo cách mới ngay cả khi bạn không nhắc gì.
Nghe hấp dẫn, nhưng phần lớn thứ fine-tuning làm được thì prompt tốt cũng làm được gần hết, chỉ tốn vài phút thay vì vài ngày. Trước khi nghĩ đến tinh chỉnh, hãy thử đủ ba thứ:
- Prompt hệ thống chi tiết — vai trò, giọng văn, định dạng đầu ra, điều cấm.
- Few-shot — dán 3–5 ví dụ mẫu ngay trong prompt. Đây là "fine-tuning của người nghèo" và hiệu quả đến bất ngờ.
- Chia nhỏ việc — thay vì bắt model làm một lượt, tách thành các bước.
Chưa làm cả ba mà đã tính chuyện huấn luyện thì gần như chắc chắn bạn đang đi đường vòng. Xem thêm ở bài prompt là gì.
Khi nào thật sự cần fine-tune
Có vài tình huống prompt không giải quyết nổi.
Giọng văn rất đặc thù. Bạn muốn model viết đúng chất một thương hiệu mà mô tả bằng lời không đủ. Phong cách là thứ dễ chỉ bằng ví dụ, khó tả bằng chữ.
Định dạng đầu ra cứng, lặp lại hàng nghìn lần. Luôn phải trả về đúng một cấu trúc, không thừa một chữ. Fine-tune cho độ ổn định cao hơn hẳn việc nhắc lại luật trong từng prompt.
Muốn cắt chi phí và độ trễ. Prompt hệ thống dài mấy nghìn chữ chạy hàng triệu lượt thì nhồi phần đó vào model rồi dùng prompt ngắn sẽ rẻ và nhanh hơn hẳn.
Muốn model nhỏ làm được việc của model lớn. Ứng dụng thực dụng nhất: tinh chỉnh model nhỏ cho đúng một tác vụ hẹp, chất lượng gần model lớn nhưng chạy được trên hạ tầng của bạn.
Khi nào KHÔNG cần
Nói thẳng: phần lớn trường hợp rơi vào nhóm này.
Bạn muốn model biết thông tin nội bộ. Đây là hiểu lầm tai hại nhất. Fine-tuning dạy cách nói, không phải biết gì. Nhồi tài liệu công ty vào dữ liệu huấn luyện không khiến model tra cứu chúng chính xác — nó chỉ học văn phong của tài liệu rồi bịa ra nội dung nghe giống thật. Đó là việc của RAG.
Thông tin thay đổi thường xuyên như bảng giá, tồn kho, chính sách. Mỗi lần đổi là phải huấn luyện lại, không ai chịu nổi.
Bạn có ít hơn vài trăm ví dụ chất lượng, hoặc chưa có thước đo trước–sau. Thiếu dữ liệu thì tinh chỉnh chỉ làm model tệ đi, thiếu thước đo thì bạn không biết nó có giúp gì không.
Cần bao nhiêu dữ liệu, chất lượng ra sao
Không có con số vàng, nhưng nguyên tắc rất rõ: chất lượng quan trọng hơn số lượng, rất nhiều lần. Vài trăm ví dụ soạn kỹ, do người hiểu việc duyệt thường cho kết quả tốt hơn hàng chục nghìn ví dụ cào bừa, vì model học mọi thứ trong dữ liệu, kể cả cái sai. Mười ví dụ mâu thuẫn nhau đủ dạy nó rằng "trả lời kiểu gì cũng được".
Dữ liệu thường có dạng từng cặp: một yêu cầu đi kèm câu trả lời mẫu chuẩn. Vài điểm cần giữ:
- Nhất quán. Cùng kiểu câu hỏi thì cùng cấu trúc, cùng giọng.
- Đa dạng. Phủ nhiều biến thể tình huống thật, gồm cả ca khó và ca cần từ chối.
- Sạch. Bỏ dữ liệu cá nhân và tài liệu không có quyền dùng.
- Chừa 10–20% để chấm, không đưa vào huấn luyện.
Kinh nghiệm chung: phần lớn công sức của một dự án fine-tuning nằm ở chuẩn bị dữ liệu, không phải khâu huấn luyện.
LoRA và tinh chỉnh nhẹ
Fine-tuning đầy đủ nghĩa là cập nhật toàn bộ tham số của model — tốn phần cứng lớn và sinh ra một bản model nặng sau mỗi lần tinh chỉnh, nên với đa số người dùng là bất khả thi.
LoRA (Low-Rank Adaptation) nhẹ hơn nhiều: đóng băng model gốc, chỉ huấn luyện thêm một lớp điều chỉnh nhỏ gắn bên cạnh — như dán một lớp lọc mỏng lên ống kính thay vì thay cả ống kính.
Lợi ích rất thực tế: chạy được trên phần cứng khiêm tốn, huấn luyện nhanh, file nhẹ, và bạn giữ được nhiều bản LoRA cho nhiều tác vụ rồi lắp vào cùng một model gốc — muốn bỏ thì gỡ ra. Gần như mọi hướng dẫn tinh chỉnh cho cá nhân và đội nhỏ hiện nay đều dùng LoRA hoặc biến thể của nó.
Fine-tuning so với RAG
Hai thứ này hay bị đặt lên bàn cân, nhưng giải bài toán khác nhau và thường được dùng chung.
| Fine-tuning | RAG | |
|---|---|---|
| Dạy model điều gì | Cách nói, cách hành xử | Nội dung để tra cứu khi trả lời |
| Hợp với | Giọng văn, định dạng cố định, tác vụ hẹp | Tài liệu nội bộ, kiến thức hay thay đổi |
| Cập nhật thông tin | Phải huấn luyện lại | Chỉ cần thêm tài liệu vào kho |
| Công sức ban đầu | Cao — soạn dữ liệu, huấn luyện, đánh giá | Trung bình — dựng kho tài liệu và tìm kiếm |
| Truy nguồn được không | Không | Có, dẫn được về tài liệu gốc |
| Nguy cơ bịa | Không giảm | Giảm rõ rệt |
Quy tắc cho gọn: cần model biết thì dùng RAG, cần model cư xử theo cách nhất định thì fine-tune. Còn phân vân thì chọn RAG trước — rẻ hơn, sửa sai nhanh hơn. Chi tiết ở bài RAG là gì.
Dùng ở Việt Nam thế nào
Ai nên quan tâm. Đội sản phẩm chạy AI ở quy mô lớn muốn giảm chi phí token; công ty nội dung cần AI viết đúng một giọng thương hiệu; đơn vị làm phần mềm cho ngành hẹp như y tế, luật, kế toán, nơi thuật ngữ chuyên môn khiến model chung trả lời lệch. Ai chưa cần: cá nhân, freelancer và doanh nghiệp nhỏ dùng AI hằng ngày — prompt tốt cộng tài liệu tham chiếu là quá đủ.
Việc thực tế người Việt hay làm. Tinh chỉnh model nhỏ để phân loại phản hồi khách hàng bằng tiếng Việt, chuẩn hoá dữ liệu đơn hàng lộn xộn, sinh mô tả sản phẩm đúng một khuôn cho sàn thương mại điện tử, hoặc dạy model dùng đúng cách xưng hô của doanh nghiệp mình.
Điều kiện cần. Ba thứ, thiếu một là hỏng: dữ liệu tiếng Việt do người hiểu nghiệp vụ soạn và duyệt; bộ ví dụ để chấm điểm trước và sau; thẻ thanh toán quốc tế nếu dùng dịch vụ đám mây, hoặc máy có GPU rời nếu tự chạy LoRA tại chỗ.
Một lưu ý pháp lý. Đừng đưa dữ liệu cá nhân của khách hàng vào tập huấn luyện khi chưa có cơ sở hợp pháp. Model đã học rồi thì không "quên" theo yêu cầu được, khác hẳn kho tài liệu RAG nơi xoá một file là xong.
Câu hỏi thường gặp
Fine-tuning có làm model thông minh hơn không?
Không. Nó làm model hợp việc của bạn hơn trong một phạm vi hẹp, đổi lại kém linh hoạt ở việc khác. Model tinh chỉnh để viết mô tả sản phẩm có thể trả lời tệ đi khi bạn hỏi chuyện ngoài lề.
Tôi có thể fine-tune ChatGPT hay Gemini không?
Các nhà cung cấp lớn đều có dịch vụ tinh chỉnh cho một số model của họ: bạn tải dữ liệu lên và nhận về một model riêng gọi qua API. Model nào hỗ trợ và giá bao nhiêu đổi liên tục, nên xem tài liệu hiện hành thay vì tin con số cũ.
Fine-tune xong có bị mất khả năng cũ không?
Có, đây là rủi ro thật. Huấn luyện quá tay trên dữ liệu hẹp khiến model kém đi ở việc chung. Cách phòng: dùng LoRA thay vì tinh chỉnh toàn phần, huấn luyện vừa đủ, và luôn chấm điểm cả những việc bạn không muốn model tệ đi.
Tôi có cần biết lập trình để fine-tune không?
Có, ở mức cơ bản: chuẩn bị file dữ liệu đúng định dạng và gọi được API hoặc chạy script huấn luyện. Nhưng phần tốn thời gian nhất là soạn và kiểm dữ liệu, việc này cần người hiểu nghiệp vụ hơn người biết code.
Dùng cả fine-tuning và RAG cùng lúc được không?
Được, và nhiều hệ thống thực tế làm đúng vậy: fine-tune để trả lời đúng giọng, RAG để nạp kiến thức cập nhật. Nhưng hãy dựng RAG trước, chạy thật một thời gian, rồi mới cân nhắc tinh chỉnh nếu vẫn còn vấn đề phong cách.