Google vừa công bố các bản cập nhật cho mô hình Gemini, tập trung vào khả năng xử lý giọng nói. Cụ thể, hai mô hình mới được giới thiệu là Gemini 3.8 Live và Gemini 3.5 Transcribe, cùng với một số cải tiến cho API trangcongnghe.com.vn.
Google vừa công bố các bản cập nhật cho mô hình Gemini, tập trung vào khả năng xử lý giọng nói. Cụ thể, hai mô hình mới được giới thiệu là Gemini 3.8 Live và Gemini 3.5 Transcribe, cùng với một số cải tiến cho API trangcongnghe.com.vn. Các mô hình này hướng tới việc nâng cao trải nghiệm tương tác giọng nói trong thời gian thực.
Sự việc diễn ra thế nào
Google đã bổ sung Gemini 3.8 Live, 3.8 Live Extended Thinking và Gemini 3.5 Transcribe vào Gemini API và Google AI Studio. Gemini 3.8 Live là phiên bản nâng cấp của dòng mô hình speech-to-speech, cho phép thực hiện tác vụ trong khi vẫn duy trì hội thoại. Phiên bản 3.8 Live Extended Thinking có khả năng suy luận sâu hơn và dẫn đầu bảng xếp hạng Speech-to-Speech của Artificial Analysis. Điểm mới nổi bật bao gồm khả năng gọi hàm không đồng bộ, ngữ cảnh hình ảnh, độ chính xác cao với ký tự chữ và số, hỗ trợ đa ngôn ngữ (hơn 97 ngôn ngữ) và cập nhật nội dung từng bước trangcongnghe.com.vn.
Gemini 3.5 Transcribe, ra mắt trước đó, là mô hình chuyên dụng để chuyển giọng nói thành văn bản với độ trễ thấp trangcongnghe.com.vn. Bên cạnh đó, Gemini 3.5 hỗ trợ dịch trực tiếp hơn 70 ngôn ngữ, hoạt động như một "người phiên dịch" thay vì trợ lý ảo ai.google.dev. Gemini 3.8 Live có thể xử lý đầu vào đa dạng (text, ảnh, audio, video) và có giới hạn token đầu vào 131,072 và đầu ra 65,536 ai.google.dev.
Các báo đưa tin ra sao
Các nguồn tin đều thống nhất về việc Google ra mắt các mô hình Gemini mới tập trung vào giọng nói. Tuy nhiên, ai.google.dev đi sâu vào sự khác biệt giữa Live Agent (trợ lý ảo) và Live Translation (dịch thuật thời gian thực), nhấn mạnh rằng Live Translation hoạt động như một "người phiên dịch" đơn thuần, chỉ tập trung vào dịch thuật trong khi Live Agent có thể hành động thay mặt người dùng. trangcongnghe.com.vn cung cấp thông tin chi tiết về giá cả: 0,005 USD/phút cho đầu vào âm thanh và 0,018 USD/phút cho đầu ra âm thanh.
Vì sao đáng chú ý
Việc ra mắt Gemini 3.8 Live và 3.5 Transcribe cho thấy Google đang tập trung vào việc cải thiện khả năng tương tác giọng nói tự nhiên và thời gian thực. Các mô hình này có thể ứng dụng rộng rãi trong nhiều lĩnh vực như dịch thuật, trợ lý ảo, trung tâm hỗ trợ khách hàng, và các ứng dụng giáo dục. Khả năng xử lý đa ngôn ngữ và độ chính xác cao đặc biệt quan trọng trong bối cảnh toàn cầu hóa, giúp phá vỡ rào cản ngôn ngữ và mở rộng phạm vi tiếp cận của các dịch vụ số.
Ở Việt Nam thì sao
Hiện tại, chưa có thông tin chính thức về việc các mô hình Gemini 3.8 Live và 3.5 Transcribe đã được hỗ trợ trực tiếp tại Việt Nam. Để sử dụng, có thể cần tài khoản Google Cloud và các API liên quan, cùng với thẻ thanh toán quốc tế. Các lập trình viên và doanh nghiệp Việt Nam có thể tận dụng các API này để phát triển các ứng dụng giọng nói thông minh, ví dụ như chatbot hỗ trợ khách hàng đa ngôn ngữ, hoặc hệ thống ghi chú giọng nói tự động. Sinh viên và nhà nghiên cứu trong lĩnh vực trí tuệ nhân tạo cũng có thể sử dụng các mô hình này để thử nghiệm và phát triển các giải pháp mới. Người dùng Việt Nam nên theo dõi thông báo từ Google về việc hỗ trợ chính thức tại Việt Nam, hoặc tìm hiểu cách tích hợp thông qua các đối tác tích hợp Live API như Agora, Fishjam trangcongnghe.com.vn.
Nguồn tham khảo
- trangcongnghe.com.vn — Google ra mắt Gemini 3.8 Live và 3.5 Transcribe cho ứng dụng giọng nói
- ai.google.dev — Live translation with Gemini Live API - Google AI for Developers
- ai.google.dev — Gemini 3.8 Live | Gemini API - Google AI for Developers