Bỏ qua menu

Trang thông tin điện tử tổng hợp

RSS

Google ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS

Google ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS

Google vừa giới thiệu hai mô hình chuyển văn bản thành giọng nói (TTS) mới trong dòng Gemini 3.8: Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS. Theo Google, đây là những mô hình tạo âm thanh biểu cảm nhất của hãng tính đến nay, cho phép tạo giọng nói nhân vật tùy chỉnh và điều khiển đối thoại theo từng cảnh trên Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook và Google Vids.

Hai mô hình, hai mục đích

Gemini 3.8 Flash TTS hướng tới việc chỉ đạo sáng tạo chuyên sâu và thiết kế nhân vật. Người dùng có thể tạo giọng nói hoàn toàn mới từ đầu bằng lệnh ngôn ngữ tự nhiên, điều khiển từng câu thoại với các chỉ dẫn về diễn xuất, tốc độ, thay đổi phương ngữ và âm thanh đệm.

Gemini 3.8 Flash-Lite TTS được tối ưu cho khối lượng lớn và hiệu quả chi phí, phù hợp với lồng tiếng quy mô lớn, sản xuất nội dung âm thanh và các tác nhân giọng nói biểu cảm, với khả năng kiểm soát chi tiết về âm sắc, tốc độ và sắc thái.

Hai mô hình này nối tiếp dòng Gemini Audio gồm 3.5 Live Translate, 3.5 Transcribe, 3.8 Live và 3.8 Live Extended Thinking.

Tạo và tùy chỉnh giọng nói

  • Thiết kế giọng nói bằng AI: Gemini 3.8 Flash TTS cho phép tạo giọng nói riêng bằng cách tùy chỉnh vai trò, giọng điệu và đặc điểm giọng nói trên hơn 100 ngôn ngữ và phương ngữ thông qua lệnh ngôn ngữ tự nhiên.
  • Thư viện giọng nói: Hơn 2.000 giọng nói sẵn sàng sử dụng, bao phủ nhiều biến thể khu vực như tiếng Tây Ban Nha Mexico, tiếng Pháp Quebec và tiếng Anh Scotland.
  • Tái tạo giọng nói: Tái tạo hồ sơ giọng nói nhất quán chỉ từ mẫu âm thanh dài 30 giây, kèm xác minh sự đồng thuận, watermark SynthID và chứng chỉ C2PA.
  • Lưu và mở rộng: Lưu và quản lý giọng nói tùy chỉnh để duy trì hiệu suất ổn định, hạn chế sai lệch giữa các dự án.
  • Pha trộn giọng nói: Tính năng sắp ra mắt cho phép chọn giọng từ thư viện và tinh chỉnh âm sắc, cao độ, tốc độ và giọng điệu bằng lệnh.

Điều khiển diễn xuất theo từng câu thoại

Cả hai mô hình đều cho phép kiểm soát chính xác cách mỗi câu thoại được thể hiện. Người dùng có thể viết chỉ dẫn sân khấu hoặc để Gemini dẫn dắt dựa trên các gợi ý trong kịch bản, từ giọng nhân viên chăm sóc khách hàng điềm tĩnh đến cảnh hồi hộp thì thầm.

Google ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS

Mô hình duy trì chất lượng giọng nói, nhịp điệu tự nhiên và âm sắc nhân vật qua nhiều giờ âm thanh liên tục với mức sai lệch người nói tối thiểu, phù hợp cho podcast và sách nói. Tính năng dàn dựng cảnh hai người nói cho phép điều khiển hội thoại nhiều lượt từ một kịch bản duy nhất, giữ hai giọng tách biệt rõ ràng. Người dùng cũng có thể thêm các âm thanh biểu cảm như tiếng cười, tiếng thở dài, tiếng hít vào và các từ đệm như "mhm" hay "yeah" để tạo nhịp phản ứng chính xác.

Hiệu suất và độ phủ ngôn ngữ

Theo Google, Gemini 3.8 Flash TTS đứng đầu bảng xếp hạng Voice Design Benchmark của Hume AI với 71,4 điểm và dẫn đầu về mô hình hóa giọng điệu với 60,8 điểm. Hai mô hình lần lượt chiếm vị trí số 1 và số 2 trên Overall Quality Index của Hume AI. Trong các đánh giá ưu tiên của con người trên Voice Arena, Gemini 3.8 Flash và Flash-Lite TTS đạt vị trí cao ở nhiều ngôn ngữ chủ chốt, gồm tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi.

An toàn và minh bạch

Google cho biết các tính năng tạo và tái tạo giọng nói được xây dựng với các biện pháp bảo vệ nghiêm ngặt. Với tái tạo giọng nói, người dùng phải cung cấp bản ghi âm đồng thuận bằng lời nói của chủ sở hữu giọng nói khớp với người nói tham chiếu trước khi giọng nói được tạo. Mọi clip âm thanh do các mô hình Gemini Audio tạo ra đều được gắn watermark SynthID, một dấu ấn không thể nhận biết bằng tai người được dệt trực tiếp vào đầu ra âm thanh, giúp phát hiện giọng nói do AI tạo nhằm hạn chế thông tin sai lệch.

Triển khai và đối tác

Gemini 3.8 Flash TTS bắt đầu triển khai từ hôm nay: với nhà phát triển qua Gemini API và Google AI Studio; với doanh nghiệp sẽ sớm có qua API trong Gemini Enterprise; với mọi người trong Gemini Notebook. Gemini 3.8 Flash-Lite TTS cũng triển khai từ hôm nay: với nhà phát triển qua Gemini API và Google AI Studio; với doanh nghiệp sẽ sớm có qua API trong Gemini Enterprise; với mọi người trong Google Vids.

Qua Gemini API, các nền tảng như Agora, LiveKit, Pipecat và Vercel giúp nhà phát triển xây dựng và triển khai trải nghiệm tạo giọng nói hiệu suất cao. Google cũng hợp tác với Figma, HeyGen, Linguana, Wondercraft, 99.co và Ollang để tích hợp các mô hình TTS mới, phục vụ lồng tiếng toàn cầu, bản địa hóa nội dung theo giọng điệu khu vực và vận hành tác nhân giọng nói hội thoại ở quy mô lớn.

Nguồn tham khảo: Gemini 3.8 text-to-speech says hello.

Bài viết được biên soạn với sự hỗ trợ của AI dựa trên nguồn dẫn ở trên.

TH (phapluatxahoi.kinhtedothi.vn)

Hình ảnh Tòa soạn Trang Công Nghệ

Tòa soạn Trang Công Nghệ

Tin công nghệ được tổng hợp và đối chiếu với nguồn dẫn, có sử dụng công cụ AI trong quá trình biên soạn.

Đọc nhiều nhất
Marvell Technology công bố kết quả tài chính quý 2 năm 2027
Cristiano Ronaldo trở lại, Al-Nassr đè bẹp Al-Riyadh 4-0
Xiaomi 18 Pro Max lộ điểm Geekbench với Snapdragon 8 Elite Gen 6 Pro
Samsung bắt đầu phát hành One UI 9 cho Galaxy S26 và nhiều thiết bị
Đọc nhiều nhất
Marvell Technology công bố kết quả tài chính quý 2 năm 2027
Cristiano Ronaldo trở lại, Al-Nassr đè bẹp Al-Riyadh 4-0
Xiaomi 18 Pro Max lộ điểm Geekbench với Snapdragon 8 Elite Gen 6 Pro
Samsung bắt đầu phát hành One UI 9 cho Galaxy S26 và nhiều thiết bị

Xem gì ?