DeepSeek công bố V4-Flash, mô hình được cho là ngang Claude Opus 4.8 ở suy luận và lập trình, nhưng chi phí mỗi lượt đầu ra chỉ 0,28 USD so với 25-30 USD. Chênh lệch lớn tới mức đáng ngờ — và đáng kiểm chứng.
Khi một lựa chọn rẻ hơn hai chữ số phần trăm, câu hỏi không còn là "có nên thử không" mà là "thử thế nào cho đúng". Bài này giải thích con số đó đến từ đâu, khi nào việc đổi mô hình thực sự tiết kiệm được tiền, và khi nào nó khiến bạn trả giá ở chỗ khác.
Con số 0,28 USD so với 25-30 USD nghĩa là gì
Theo Crypto Briefing, chi phí tạo ra một kết quả đầu ra của DeepSeek-V4-Flash vào khoảng 0,28 USD, trong khi mức tương ứng ở Anthropic dao động 25-30 USD. Trước khi rút ra kết luận, cần hiểu con số này được tính trên một tác vụ cụ thể, không phải giá niêm yết theo token của nhà cung cấp.
Điều đó quan trọng vì tổng chi phí thật của bạn phụ thuộc vào bốn thứ, không chỉ đơn giá:
- Độ dài đầu vào. Nếu bạn nhồi cả tài liệu dài vào mỗi lần gọi, phần đầu vào có thể át phần đầu ra.
- Số lần thử lại. Một mô hình rẻ nhưng phải gọi ba lần mới ra kết quả dùng được thì không còn rẻ gấp trăm lần nữa.
- Độ dài đầu ra. Mô hình có xu hướng suy luận dài sẽ sinh nhiều token hơn cho cùng một câu hỏi.
- Bộ nhớ đệm ngữ cảnh. Nếu phần nhắc lặp lại được lưu đệm, chi phí thực tế giảm mạnh — và mức giảm này khác nhau giữa các nhà cung cấp.
Vì vậy đừng lấy tỷ lệ 99% làm con số dự toán. Hãy lấy nó làm lý do để chạy một phép đo trên chính khối lượng công việc của bạn.
DeepSeek là ai
DeepSeek là công ty AI Trung Quốc, được biết đến vì liên tục phát hành các mô hình đạt hiệu năng cao với chi phí huấn luyện và vận hành thấp hơn đáng kể so với mặt bằng chung. Dòng V4 gồm V4-Pro và V4-Flash, với các bản thử nghiệm được phát hành ngày 24/4/2026. Sau đó còn có các bản cập nhật như V4-Flash-0731 và một bản thử nghiệm thiên về xử lý hình ảnh, cho thấy nhóm phát triển vẫn đang lặp nhanh.
Trong đặt tên của phần lớn nhà cung cấp, "Pro" là bản mạnh hơn và đắt hơn, còn "Flash" là bản tối ưu cho tốc độ và chi phí. Điều đáng chú ý ở đây là bản được đem ra so sánh với mô hình đầu bảng của đối thủ lại chính là bản tiết kiệm.
V4-Flash là mô hình đa phương thức: xử lý được cả văn bản lẫn hình ảnh, và hỗ trợ ngữ cảnh dài tới 1 triệu token.
Vì sao rẻ được như vậy
Phần giải thích kỹ thuật nằm ở cách mô hình quản lý bộ nhớ làm việc. Khi xử lý hình ảnh, V4-Flash dùng khoảng 90 mục trong bộ nhớ đệm khoá-giá trị, so với khoảng 870 mục của mô hình đối chiếu.
Bộ nhớ đệm khoá-giá trị là nơi mô hình lưu lại những gì đã đọc để không phải tính lại từ đầu ở mỗi bước sinh. Nó chiếm phần lớn bộ nhớ GPU trong lúc chạy, và chính dung lượng này quyết định một máy chủ phục vụ được bao nhiêu yêu cầu cùng lúc. Giảm số mục cần lưu xuống gần một phần mười nghĩa là cùng một cỗ máy phục vụ được nhiều người dùng hơn nhiều lần — và chi phí mỗi lượt gọi giảm theo.
Đây là điểm đáng ghi nhận về mặt kỹ thuật: khoản tiết kiệm đến từ kiến trúc, không phải từ việc bán dưới giá vốn để giành thị phần. Khoản tiết kiệm kiểu thứ hai thường biến mất sau vài quý; khoản tiết kiệm kiểu thứ nhất thì bền hơn.
Khi nào nên đổi, khi nào không
Nên cân nhắc đổi khi:
Tác vụ của bạn lặp lại với khuôn mẫu rõ ràng — phân loại, trích xuất trường dữ liệu, tóm tắt, dịch, chuẩn hoá định dạng. Đây là những việc mà chênh lệch chất lượng giữa các mô hình hàng đầu và mô hình hạng dưới thường nhỏ, trong khi chênh lệch chi phí thì rất lớn.
Bạn chạy khối lượng lớn và chi phí mô hình đã thành một khoản đáng kể trong bảng chi phí vận hành. Ở quy mô nhỏ, công sức chuyển đổi và kiểm thử có thể tốn hơn số tiền tiết kiệm được.
Bạn có sẵn bộ kiểm thử để so sánh khách quan. Không có bộ kiểm thử, việc đổi mô hình chỉ là thay một cảm giác bằng một cảm giác khác.
Không nên đổi vội khi:
Kết quả sai gây hậu quả khó đảo ngược — liên quan tới tiền, hồ sơ pháp lý, y tế, hoặc nội dung xuất bản không qua người kiểm duyệt.
Quy trình của bạn phụ thuộc vào những hành vi tinh tế của một mô hình cụ thể: cách nó gọi công cụ, cách nó bám theo hướng dẫn dài, cách nó từ chối. Những thứ này hiếm khi được phản ánh trong bảng điểm chuẩn và lại là thứ vỡ trước tiên khi đổi.
Bạn đang chịu ràng buộc về nơi dữ liệu được xử lý. Vấn đề này không giải quyết được bằng giá.
Cách thử trong một buổi chiều
- Lấy 50-100 mẫu thật từ nhật ký hệ thống, gồm cả những ca khó và ca đã từng sai, không chỉ ca đẹp.
- Ghi lại kết quả của mô hình hiện tại làm mốc so sánh, cùng chi phí và thời gian phản hồi của từng lượt.
- Chạy lại cùng bộ nhắc trên mô hình mới, không sửa gì, để thấy mức độ tương thích thô.
- Chấm điểm mù. Trộn lẫn kết quả hai bên và chấm mà không biết cái nào của ai. Đây là bước hay bị bỏ và cũng là bước quyết định.
- Tính lại chi phí thật gồm cả số lần thử lại, rồi so với con số tiết kiệm kỳ vọng.
- Nếu quyết định đổi, hãy đổi dần — chuyển một phần lưu lượng trước, giữ đường quay lại, và theo dõi tỷ lệ lỗi trong ít nhất một tuần.
Một điểm thuận lợi: các mô hình này thường tương thích với giao diện lập trình quen thuộc, nên bước một và ba thường chỉ tốn vài dòng cấu hình. Chi phí thử nghiệm thấp là lý do chính đáng để thử, ngay cả khi bạn chưa định đổi.
Điều chưa rõ và nên theo dõi
So sánh hiệu năng trong bản tin dựa trên các bài kiểm tra chuẩn về suy luận và lập trình. Các bài kiểm tra này hữu ích nhưng không đo được độ ổn định khi chạy dài ngày, chất lượng tiếng Việt trên văn bản chuyên ngành, hay hành vi khi gặp đầu vào bất thường.
Thị trường dự đoán đã hạ khả năng Anthropic giữ vị trí dẫn đầu tới cuối tháng 9/2026 sau thông tin này — một chỉ dấu về kỳ vọng, không phải một kết quả. Thứ đáng theo dõi hơn là phản ứng về giá từ các nhà cung cấp lớn. Trong hai năm gần đây, mỗi lần một mô hình rẻ xuất hiện và chứng minh được chất lượng, mặt bằng giá chung đều đi xuống sau đó. Nếu bạn đang lên ngân sách AI cho năm tới, đừng khoá giá dài hạn ở mức hiện tại.
Nguồn tham khảo
- cryptobriefing.com — DeepSeek unveils AI model challenging Anthropic’s dominance - Crypto Briefing
- cryptobriefing.com — DeepSeek unveils AI model that approaches Anthropic's performance at a fraction of the cost - Crypto Briefing