Google vừa công bố hai mô hình AI giọng nói mới: Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, mở rộng khả năng của Gemini API và Google AI Studio trangcongnghe.com.vn. Các mô hình này hứa hẹn cải thiện đáng kể trải nghiệm tương tác giọng nói, đặc biệt trong các ứng dụng thời gian thực.
Google vừa công bố hai mô hình AI giọng nói mới: Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, mở rộng khả năng của Gemini API và Google AI Studio trangcongnghe.com.vn. Các mô hình này hứa hẹn cải thiện đáng kể trải nghiệm tương tác giọng nói, đặc biệt trong các ứng dụng thời gian thực.
Toàn cảnh sự việc
Gemini 3.8 Live và 3.8 Live Extended Thinking là thế hệ mới của dòng mô hình speech-to-speech của Google, được thiết kế để xử lý các cuộc hội thoại phức tạp và đa nhiệm unite.AI. Điểm nổi bật của Gemini 3.8 Live là khả năng thực hiện tác vụ trong khi vẫn duy trì hội thoại liên tục. Phiên bản Extended Thinking được trang bị khả năng suy luận sâu, giúp xử lý các yêu cầu phức tạp và nhiều bước.
Ngoài ra, Google cũng giới thiệu Gemini 3.5 Transcribe – mô hình chuyển giọng nói thành văn bản với độ trễ thấp, ra mắt hồi tháng trước trangcongnghe.com.vn. Các tính năng quan trọng khác bao gồm hỗ trợ đa ngôn ngữ (hơn 97 ngôn ngữ), khả năng xử lý chính xác dữ liệu kỹ thuật, và tích hợp hình ảnh trực quan để hiểu rõ hơn ngữ cảnh hội thoại.
Các báo đưa tin ra sao
Hai nguồn tin đều thống nhất về các tính năng chính của Gemini 3.8 Live và 3.8 Live Extended Thinking. Tuy nhiên, Unite.AI cung cấp chi tiết hơn về ngày công bố chính thức (15 tháng 9 năm 2026) và thông tin về đội ngũ phát triển (Tom Ouyang và Malini Jaganathan). Unite.AI cũng nhấn mạnh rằng Google định vị Gemini 3.8 Live cho quy mô và hiệu quả chi phí, trong khi Extended Thinking tập trung vào các tác vụ phức tạp unite.AI. Trang công nghệ cũng đưa ra mức giá cụ thể là 0,005 USD/phút cho đầu vào âm thanh và 0,018 USD/phút cho đầu ra âm thanh.
Vì sao chuyện này quan trọng
Sự ra mắt của Gemini 3.8 Live và 3.8 Live Extended Thinking đánh dấu bước tiến quan trọng trong lĩnh vực AI giọng nói. Các mô hình này mở ra tiềm năng lớn cho các ứng dụng như trợ lý ảo, trung tâm hỗ trợ khách hàng, và các công cụ hỗ trợ làm việc bằng giọng nói. Khả năng suy luận sâu và xử lý đa nhiệm của Gemini 3.8 Live Extended Thinking đặc biệt hữu ích cho các tác vụ phức tạp, nơi cần sự chính xác và hiệu quả cao. Việc hỗ trợ đa ngôn ngữ cũng mở rộng khả năng tiếp cận của các ứng dụng này trên toàn cầu.
Ở Việt Nam thì sao
Hiện chưa có thông tin chính thức về việc Gemini 3.8 Live và các mô hình liên quan có sẵn trực tiếp tại Việt Nam hay không. Để sử dụng, có thể cần tài khoản Google và khả năng thanh toán quốc tế. Các lập trình viên và doanh nghiệp Việt Nam có thể tận dụng các API này để phát triển các ứng dụng giọng nói, nhưng cần cân nhắc chi phí và yêu cầu kỹ thuật. Sinh viên ngành công nghệ thông tin có thể tìm hiểu về các mô hình này để nâng cao kiến thức và kỹ năng. Các nhà đầu tư cũng có thể quan tâm đến tiềm năng ứng dụng của công nghệ này trong các lĩnh vực như dịch vụ khách hàng, giáo dục, và y tế. Cần theo dõi thêm thông tin từ Google và các đối tác tích hợp để biết khi nào các dịch vụ này được hỗ trợ chính thức tại Việt Nam.
Nguồn tham khảo
- trangcongnghe.com.vn — Google ra mắt Gemini 3.8 Live và 3.5 Transcribe cho ứng dụng giọng nói
- Unite.AI — Google ra mắt các mô hình giọng nói Gemini 3.8 Live và Extended Thinking