Multimodal là gì mà model AI nào ra mắt gần đây cũng nhấn mạnh? Đa phương thức nghĩa là một mô hình AI duy nhất có thể nhận và xử lý nhiều loại dữ liệu — chữ, ảnh, âm thanh, video — thay vì chỉ làm việc với văn bản như chatbot đời đầu. Nhờ đó bạn chụp một hoá đơn, gửi vào và hỏi "tổng bao nhiêu" y như hỏi một người ngồi cạnh.
"Phương thức" ở đây là gì
Trong ngữ cảnh AI, mỗi phương thức (modality) là một kiểu dữ liệu đầu vào hoặc đầu ra: chữ viết, hình ảnh, âm thanh, video. Mô hình ngôn ngữ thuần tuý chỉ có một phương thức: chữ vào, chữ ra. Mô hình đa phương thức nhận được nhiều kiểu cùng lúc, thường là chữ kèm ảnh, ngày càng nhiều model nhận thêm âm thanh và video.
Điều quan trọng không phải "nhận được nhiều kiểu" mà là hiểu chúng trong cùng một dòng suy nghĩ. Gửi ảnh biểu đồ kèm câu hỏi "xu hướng quý ba thế nào", model nhìn cả hai như một ngữ cảnh chung, không tách riêng "đọc ảnh" rồi "đọc câu hỏi".
Cách nó làm được, nói cho người thường
Mô hình ngôn ngữ chỉ làm việc với dãy số gọi là token, mỗi token là một mẩu chữ. Bài Token là gì giải thích khái niệm đó. Mấu chốt của đa phương thức là: ảnh và âm thanh cũng bị biến thành dãy số kiểu tương tự, rồi xếp chung hàng với token chữ.
Với ảnh, một bộ phận gọi là bộ mã hoá ảnh chia ảnh thành ô vuông nhỏ, mỗi ô chuyển thành một vector số mang thông tin "trong ô này có gì". Với âm thanh, sóng âm được cắt thành lát ngắn, mỗi lát cũng thành vector. Video là chuỗi ảnh cộng âm thanh. Tất cả các vector đó đi vào cùng một model với vector chữ, và model được huấn luyện trên hàng triệu cặp "ảnh + mô tả", "âm thanh + lời thoại" để học cách ghép nghĩa giữa chúng.
Kết quả là trong "đầu" model, chữ "con mèo" và bức ảnh con mèo nằm gần nhau — chữ và ảnh dùng chung một hệ toạ độ nghĩa.
Chiều ngược lại, tạo ảnh hay giọng nói, cũng theo nguyên lý đó: model sinh dãy số rồi bộ giải mã đổi thành điểm ảnh hoặc sóng âm. Không phải model nào cũng làm được cả hai chiều; nhiều model nhìn được ảnh nhưng không vẽ.
Khác gì ghép nhiều model rời
Trước đây người ta vẫn "hỏi AI về ảnh" được bằng cách nối chuỗi: một model nhận dạng chữ trong ảnh, một model mô tả ảnh thành văn bản, rồi đưa văn bản cho chatbot. Cách ghép này vẫn có chỗ dùng, nhưng khác căn bản với model đa phương thức thật.
| Ghép nhiều model rời | Model đa phương thức | |
|---|---|---|
| Cách xử lý ảnh | Đổi ảnh thành chữ mô tả trước | Nhìn thẳng ảnh cùng câu hỏi |
| Thông tin bị mất | Nhiều: mô tả không ghi hết chi tiết | Ít hơn, model tự chọn chi tiết cần nhìn |
| Hỏi theo ngữ cảnh | Khó: model chat không thấy ảnh gốc | Dễ: "cái ở góc trái là gì?" |
| Chỉ vào vùng ảnh, hỏi tiếp | Gần như không | Được |
| Độ trễ | Cộng dồn qua từng bước | Một lần xử lý |
| Kiểm soát từng khâu | Dễ, thay từng model được | Khó hơn, một khối |
| Chi phí | Có thể rẻ với việc đơn giản | Thường tốn hơn cho việc đơn giản |
Ví dụ dễ thấy: bạn gửi ảnh menu quán ăn viết tay, hỏi "món nào không có hải sản". Cách ghép: bộ đọc chữ chuyển menu thành văn bản (có thể đọc sai chữ viết tay), rồi chatbot lọc theo văn bản đó. Model đa phương thức: nhìn thẳng menu, dùng cả ngữ cảnh "đây là menu quán ăn Việt" để đoán chữ viết tay khó đọc, và trả lời. Cách sau thường chính xác hơn với ảnh xấu, chữ tay, bố cục lộn xộn.
Ngược lại, với việc đơn giản lặp đi lặp lại như đọc mã số trên hàng nghìn phiếu in rõ, bộ đọc chữ chuyên dụng rẻ và ổn định hơn nhiều.
Dùng vào việc gì thực tế
Những việc dưới đây làm được ngay với các ứng dụng chat phổ biến:
- Chụp hoá đơn, biên lai và nhờ tính. "Tổng cộng bao nhiêu, chia đều cho 4 người", hoặc "liệt kê các món và giá thành bảng để tôi dán vào Excel". Hoạt động khá tốt với hoá đơn in, chấp nhận được với chữ viết tay rõ.
- Hỏi về ảnh bất kỳ. Chụp bảng hiệu tiếng nước ngoài để dịch, chụp bảng thành phần thực phẩm để hỏi có gì cần tránh, chụp linh kiện để hỏi tên và công dụng, chụp lỗi trên màn hình để hỏi cách sửa.
- Đọc tài liệu có bố cục phức tạp. Sơ đồ, biểu đồ, bảng lồng nhau, slide thuyết trình — những thứ trích chữ thuần tuý làm hỏng bố cục. Gửi ảnh chụp thay vì dán chữ thường ra kết quả tốt hơn.
- Tóm tắt video. Nhiều công cụ hiện nhận trực tiếp link hoặc file video và trả về tóm tắt, mốc thời gian, trích dẫn. Bài AI tóm tắt video YouTube hướng dẫn cụ thể.
- Nói chuyện bằng giọng. Chế độ thoại của các trợ lý AI cho phép hỏi bằng giọng, nghe trả lời bằng giọng, và ở một số công cụ, bật camera để AI "nhìn" cùng bạn.
- Học và làm bài. Chụp đề bài toán, sơ đồ vật lý và nhờ giải thích từng bước.
Giới hạn cần biết
Đọc số và chữ nhỏ chưa đáng tin tuyệt đối. Model có thể đọc nhầm 6 thành 8, bỏ sót một dòng trong bảng dài, hoặc "đoán" chữ mờ theo hướng hợp lý thay vì báo không đọc được. Với hoá đơn, hợp đồng, số tài khoản, hãy đối chiếu lại số quan trọng.
Đếm kém. Hỏi "trong ảnh có bao nhiêu người" với đám đông, kết quả thường sai. Model nhìn "toàn cảnh" tốt hơn đếm từng vật.
Ảnh cũng tốn token. Gửi hàng chục ảnh trong một hội thoại sẽ nhanh chạm giới hạn ngữ cảnh. Ảnh quá lớn thường bị thu nhỏ trước khi xử lý, nên chữ nhỏ có thể mất.
Video xử lý theo mẫu. Model không "xem" từng khung hình mà lấy mẫu vài khung mỗi giây hoặc thưa hơn. Chi tiết xuất hiện chớp nhoáng có thể bị bỏ qua.
Ảo giác vẫn có. Model có thể mô tả một chi tiết không có trong ảnh, nhất là khi câu hỏi gợi ý nó tồn tại. Cơ chế giống với hallucination ở văn bản: nó sinh câu trả lời hợp lý nhất, không phải đúng nhất.
Dùng ở Việt Nam thế nào
Chữ Việt trong ảnh là chỗ cần thử trước. Các model đa phương thức phổ biến đọc chữ Việt in khá tốt, kể cả dấu. Chữ viết tay tiếng Việt, đặc biệt dấu thanh viết tháu, là nơi sai nhiều hơn; hoá đơn viết tay ở chợ hay quán nhỏ nên coi kết quả là bản nháp cần soát. Bảng hiệu, biển báo, menu in thì thường ổn.
Giọng nói tiếng Việt. Chế độ thoại của các trợ lý lớn nghe hiểu tiếng Việt ở mức dùng được, giọng miền Bắc chuẩn thường được nhận tốt hơn giọng địa phương nặng. Giọng đọc ra tiếng Việt của một số công cụ vẫn còn ngữ điệu hơi máy; nếu cần lồng tiếng chất lượng thì nên dùng công cụ chuyên lồng tiếng thay vì chế độ thoại.
Ai nên tận dụng ngay:
- Kế toán, hành chính, chủ cửa hàng nhỏ: nhập liệu từ hoá đơn, phiếu thu, bảng giá chụp bằng điện thoại. Tiết kiệm thời gian rõ rệt, chỉ cần thói quen soát lại số.
- Học sinh, sinh viên: chụp đề bài, sơ đồ, slide để hỏi. Nhanh hơn gõ lại công thức nhiều lần.
- Người làm nội dung: gửi ảnh sản phẩm để viết mô tả, gửi ảnh thiết kế để xin góp ý, đưa video để lấy phụ đề và tóm tắt.
Lưu ý riêng về dữ liệu: ảnh chụp căn cước, sổ đỏ, hợp đồng, hồ sơ bệnh án gửi lên dịch vụ đám mây là gửi dữ liệu cá nhân ra ngoài. Hãy che thông tin không cần thiết trước khi gửi, hoặc dùng công cụ mà tổ chức của bạn đã phê duyệt.
Câu hỏi thường gặp
Multimodal có phải là AI tạo ảnh không?
Không hẳn. Tạo ảnh là một khả năng đa phương thức theo chiều ra. Nhiều model chỉ "nhìn" được ảnh mà không tạo, và nhiều công cụ tạo ảnh không trò chuyện được. Đa phương thức là khái niệm rộng hơn, gồm cả hai chiều.
Gửi ảnh cho AI có tốn nhiều hơn gửi chữ không?
Thường có. Mỗi ảnh quy đổi ra hàng trăm đến hàng nghìn token tuỳ kích thước và model, nên một ảnh chụp trang tài liệu có thể tốn hơn dán chính đoạn chữ đó. Với bản chat miễn phí, điều này thể hiện ở việc nhanh chạm giới hạn lượt hơn.
Vì sao AI đọc sai số trên hoá đơn của tôi?
Ảnh mờ, nghiêng, chữ nhỏ, hoặc ảnh bị thu nhỏ trước khi xử lý là các nguyên nhân hay gặp. Chụp thẳng, đủ sáng, cắt bớt phần thừa, và nếu hoá đơn dài thì chụp thành nhiều ảnh, mỗi ảnh một phần.
Model đa phương thức có xem được video dài không?
Có công cụ nhận video dài, nhưng nó lấy mẫu khung hình thưa và dựa nhiều vào âm thanh, lời thoại. Nội dung nói ra thì tóm tắt tốt; chi tiết hình ảnh thoáng qua thì có thể bị bỏ sót.
Điện thoại có chạy được AI đa phương thức không?
Các ứng dụng phổ biến xử lý trên máy chủ, điện thoại chỉ gửi ảnh và nhận kết quả, nên máy nào có mạng là dùng được. Một số điện thoại đời mới có model nhỏ chạy trực tiếp trên máy cho việc đơn giản, nhưng hạn chế hơn bản đám mây.