Bỏ qua menu

Trang thông tin điện tử tổng hợp

RSS

Google ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking

Google ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking

Google đã giới thiệu hai mô hình đối thoại trực tiếp mới là Gemini 3.8 LiveGemini 3.8 Live Extended Thinking. Theo công bố, đây là những mô hình đối thoại trực tiếp tiên tiến nhất của hãng, với cải tiến về trí tuệ và khả năng suy luận song song, cho phép người dùng thực hiện tác vụ phức tạp bằng giọng nói.

Hai mô hình, hai mục đích

  • Gemini 3.8 Live: Tối ưu cho quy mô và hiệu quả chi phí, kết hợp trí tuệ đối thoại với hội thoại mượt mà và hỗ trợ hình ảnh.
  • Gemini 3.8 Live Extended Thinking: Thiết kế cho tác vụ phức tạp, với trí tuệ tăng cường và suy luận đa bước.

Cả hai mô hình đều hướng đến các nhà phát triển và doanh nghiệp với vai trò nền tảng cho các voice agent sẵn sàng vận hành thực tế. Chúng cũng giúp việc trò chuyện với Gemini trên ứng dụng Gemini, Google Workspace và Search trở nên liền mạch hơn.

Kết quả đo lường

Gemini 3.8 Live Extended Thinking đạt vị trí số 1 tổng thể trên Chỉ số Chất lượng Speech to Speech của Artificial Analysis với 82,6 điểm; dẫn đầu về hoàn thành tác vụ agentic với 68,6% trên τ-Voice và 35,1% trên benchmark τ-Voice-banking của Sierra. Mô hình cũng đạt 97,7% trên Big Bench Audio. Gemini 3.8 Live đứng thứ hai trên Speech Agent Arena và được đánh giá là hiệu quả về chi phí. Trên EVA-Bench của ServiceNow, các mô hình được chạy trên Live API thuộc Gemini Enterprise Agent Platform.

Khả năng xử lý hình ảnh và ngôn ngữ

Gemini 3.8 Live xử lý đầu vào hình ảnh gần như thời gian thực, tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong suốt cuộc trò chuyện. Mô hình thực thi công cụ và gọi API trong nền trong khi vẫn tiếp tục hội thoại, cho phép ghi nhận yêu cầu và trò chuyện tiếp trong lúc tác vụ hoàn tất. Với các tác vụ cần suy luận sâu hơn, Gemini 3.8 Live Extended Thinking vừa suy luận vừa nói, dùng tín hiệu như “Let me check that…” để phản hồi tự nhiên và tường thuật tiến độ tác vụ nền theo từng bước.

Triển khai và hệ sinh thái

Gemini 3.8 Live bắt đầu triển khai từ hôm nay: cho nhà phát triển trong Gemini API và Google AI Studio; cho doanh nghiệp ở chế độ xem trước riêng tư trong Gemini Enterprise và sắp có trên Gemini Enterprise for Customer Experience; cho mọi người trong Search Live. Gemini 3.8 Live Extended Thinking cũng triển khai từ hôm nay: cho nhà phát triển trong Gemini API và Google AI Studio; cho doanh nghiệp ở chế độ xem trước riêng tư trong Gemini Enterprise, sắp có trên Gemini Enterprise for Customer Experience và cho khách hàng doanh nghiệp Google Workspace; cho mọi người trong Gemini Live, cho người đăng ký Google AI Pro và Ultra trong Workspace ở Docs, và cho tất cả người đăng ký Google AI trong Gmail và Keep.

Thông qua Gemini Live API, các nền tảng như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents cho phép nhà phát triển xây dựng giao diện điều khiển bằng giọng nói. Google cũng hợp tác với Salesforce, Genspark và Lumeris.

Về minh bạch, mọi âm thanh do sản phẩm AI của Google tạo ra đều được gắn watermark SynthID không thể nhận biết bằng giác quan, giúp phát hiện nội dung do AI tạo nhằm hạn chế thông tin sai lệch.

Nguồn tham khảo: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking.

TH (phapluatxahoi.kinhtedothi.vn)

Hình ảnh Tòa soạn Trang Công Nghệ

Tòa soạn Trang Công Nghệ

Tin công nghệ được tổng hợp và đối chiếu với nguồn dẫn, có sử dụng công cụ AI trong quá trình biên soạn.

Đọc nhiều nhất
Marvell Technology công bố kết quả tài chính quý 2 năm 2027
Cristiano Ronaldo trở lại, Al-Nassr đè bẹp Al-Riyadh 4-0
Cách ẩn và làm mờ bảng trong Word nhanh chóng
GTA 6 sẽ có bản đồ lớn nhất và phức tạp nhất từ trước đến nay
Đọc nhiều nhất
Marvell Technology công bố kết quả tài chính quý 2 năm 2027
Cristiano Ronaldo trở lại, Al-Nassr đè bẹp Al-Riyadh 4-0
Cách ẩn và làm mờ bảng trong Word nhanh chóng
GTA 6 sẽ có bản đồ lớn nhất và phức tạp nhất từ trước đến nay

Xem gì ?