Gemini 3.7 Flash: mô hình Google nhắm vào lập trình và agent



Gemini 3.7 Flash: mô hình Google nhắm vào lập trình và agent

Ngày 13/8/2026, Google công bố Gemini 3.7 Flash, bản nâng cấp nhắm thẳng vào hai nhóm tác vụ: viết mã và xây dựng tác nhân AI. Nó ra mắt chỉ ba tuần sau Gemini 3.6 Flash, và điều đó cũng nói lên nhiều thứ như chính các thông số của mô hình.

Gemini 3.7 Flash là gì

Google mô tả đây là mô hình "workhorse" thông minh nhất của họ cho đến lúc này trong nhóm tác vụ lập trình và tác nhân. Mục tiêu là giúp doanh nghiệp dựng các hệ thống AI có khả năng tự lên kế hoạch, gọi công cụ và hoàn thành quy trình nhiều bước với ít can thiệp của con người hơn.

Theo mô tả từ DeepMind, mô hình này là bản nâng cấp trên nền Gemini 3.6 Flash với cải tiến ở khả năng suy luận. Nó nhận đầu vào là văn bản với cửa sổ ngữ cảnh lên tới một triệu token, kèm hình ảnh, âm thanh và video, và tạo đầu ra văn bản dài tối đa 64.000 token.

Điểm được Google nhấn mạnh song song với năng lực là chi phí: đây là lựa chọn rẻ hơn trong dải sản phẩm của họ. Reuters khi đưa tin tập trung vào phần cải thiện hiệu suất ở các tác vụ lập trình.

"Workhorse" nghĩa là gì trong cách Google đặt tên

Từ này xuất hiện trong hầu hết thông cáo của Google về dòng Flash, và nó không phải từ ngữ tiếp thị vô nghĩa. Nó mô tả một vị trí cụ thể trong danh mục sản phẩm.

Các nhà cung cấp mô hình lớn thường chia sản phẩm thành hai nhóm. Nhóm đầu bảng đắt, chậm hơn, dùng cho những bài toán khó nhất, và chủ yếu tồn tại để thắng các phép so sánh và định vị thương hiệu. Nhóm workhorse thì rẻ hơn nhiều lần, nhanh hơn, và là thứ thực sự chạy trong sản phẩm thương mại.

Lý do là kinh tế học của việc triển khai. Một ứng dụng gọi mô hình hàng triệu lượt mỗi ngày không thể dùng mô hình đắt nhất cho mọi lượt gọi. Phần lớn tác vụ trong một quy trình thực tế, phân loại, trích xuất, định tuyến, tóm tắt, viết đoạn mã ngắn, đều không cần năng lực cao nhất. Chúng cần đủ tốt, rẻ và nhanh. Đó là lý do dòng Flash quan trọng với doanh thu hơn dòng đầu bảng, dù ít được nhắc tới hơn.

Đặt "thông minh nhất cho lập trình và agent" vào nhóm workhorse vì thế là một tuyên bố về chiến lược giá, không chỉ về chất lượng mô hình.

Các thông số có ý nghĩa gì khi dùng thật

Một triệu token ngữ cảnh nghe trừu tượng, nên cần quy đổi. Cửa sổ ngữ cảnh là lượng thông tin mô hình có thể nhìn cùng lúc trong một lượt làm việc. Ở quy mô một triệu token, bạn có thể đưa vào toàn bộ một mã nguồn cỡ vừa, hoặc một tập tài liệu dài, và hỏi những câu đòi hỏi mô hình nhìn thấy mối liên hệ giữa các phần cách xa nhau.

Điều này quan trọng đặc biệt với tác vụ lập trình. Phần lớn lỗi mà mô hình tạo ra khi sửa mã không đến từ việc nó không biết cú pháp, mà từ việc nó không nhìn thấy phần còn lại của hệ thống. Ngữ cảnh rộng làm giảm nhóm lỗi đó, dù không xoá bỏ được: đưa nhiều thông tin vào không đồng nghĩa với việc mô hình chú ý đúng chỗ.

Giới hạn đầu ra 64.000 token đặt trần cho lượng nội dung sinh ra trong một lượt. Với việc sinh mã, con số này đủ rộng cho một tệp lớn hoặc một loạt thay đổi, nhưng vẫn là lý do để chia nhỏ tác vụ thay vì yêu cầu mô hình viết cả một hệ thống trong một lần gọi.

Khả năng nhận hình ảnh, âm thanh và video bên cạnh văn bản mở ra nhóm ứng dụng khác: đọc ảnh chụp màn hình lỗi, xử lý bản ghi cuộc họp, phân tích nội dung video. Với các tác nhân tự động, đây là điều kiện cần để làm việc với giao diện và tài liệu thực tế chứ không chỉ với văn bản thuần.

Nhịp ba tuần một lần nói lên điều gì

Gemini 3.7 Flash ra mắt ba tuần sau Gemini 3.6 Flash. Nhịp này có hệ quả thực tế với người xây dựng sản phẩm, và hệ quả đó không hoàn toàn tích cực.

Mặt tốt là năng lực cải thiện nhanh, và chi phí cho cùng một mức chất lượng có xu hướng giảm theo mỗi vòng. Mặt khó là việc đánh giá trở nên tốn kém. Nếu bạn vừa dành hai tuần kiểm thử một mô hình trên tập dữ liệu riêng, xây bộ đánh giá, hiệu chỉnh câu lệnh, thì ngay khi xong đã có phiên bản mới. Làm lại toàn bộ quy trình mỗi ba tuần là không khả thi với phần lớn đội ngũ.

Cách xử lý thực dụng là tách phần đánh giá ra thành tài sản riêng. Xây một bộ trường hợp kiểm thử đại diện cho chính công việc của bạn, chạy tự động, và chấm điểm được. Khi có mô hình mới, bạn chạy lại bộ đó trong vài giờ thay vì đánh giá lại từ đầu. Điều này cũng giúp tránh bẫy phổ biến: đổi mô hình vì điểm chuẩn công bố cao hơn, trong khi trên tác vụ cụ thể của bạn thì nó kém hơn bản cũ.

Bản Pro và cuộc đua đang diễn ra

Google chưa công bố thời điểm ra mắt bản Pro của Gemini 3.5, dù nó đã được thử nghiệm cùng các đối tác từ tháng 7. Reuters lưu ý rằng giới đầu tư đang theo dõi bản này như một phép thử xem DeepMind có giữ được nhịp với các đối thủ như Anthropic và OpenAI hay không.

Cách phân vai ở đây khá rõ. Bản đầu bảng là nơi diễn ra cuộc đua về uy tín kỹ thuật và là thứ các nhà đầu tư dùng để đánh giá vị thế của một phòng thí nghiệm. Dòng Flash là nơi diễn ra cuộc đua về thị phần thực tế, vì đó là thứ chạy trong sản phẩm và tạo ra doanh thu theo khối lượng.

Với người dùng cuối, cuộc đua ở dòng workhorse có ảnh hưởng trực tiếp hơn nhiều. Nó là thứ quyết định chi phí gọi API bạn trả mỗi tháng.

Lập trình viên nên thử theo thứ tự nào

Nếu đang dùng một mô hình khác trong sản phẩm, đừng đổi ngay. Cách tiếp cận ít rủi ro là chạy song song: gửi cùng một tập yêu cầu thật tới cả mô hình hiện tại và mô hình mới, so sánh đầu ra và chi phí, trong khi người dùng vẫn nhận kết quả từ mô hình cũ.

Ba nhóm tác vụ đáng thử trước với một mô hình định vị như thế này: sửa lỗi trong mã có sẵn, nơi ngữ cảnh rộng phát huy tác dụng rõ nhất; các quy trình nhiều bước có gọi công cụ, đúng nhóm mà mô hình được thiết kế cho; và các tác vụ khối lượng lớn chi phí nhạy cảm, nơi mức giá thấp hơn tạo khác biệt thật.

Với lập trình viên và doanh nghiệp phần mềm ở Việt Nam, điều đáng lưu ý là lợi ích lớn nhất không nằm ở việc mô hình viết mã giỏi hơn bao nhiêu, mà ở chi phí trên mỗi lượt gọi. Ở quy mô sản phẩm có nhiều người dùng, chênh lệch giá giữa dòng đầu bảng và dòng workhorse thường là yếu tố quyết định tính năng AI có khả thi về mặt kinh doanh hay không. Đó là phép tính nên làm trước khi dành thời gian so sánh chất lượng.

Nguồn tham khảo

  • blog.google — Gemini 3.7 Flash: our most intelligent workhorse model
  • reuters.com — Google unveils Gemini 3.7 Flash AI model for coding, agent workflows
  • deepmind.google — Gemini 3.7 Flash - Model Card