Gemini 3.5 Transcribe là gì? AI chuyển giọng nói thành văn bản mới của Google

Gemini 3.5 Transcribe là model speech-to-text mới của Google, hỗ trợ hơn 85 locale, streaming thời gian thực, speaker diarization, word-level timestamps và chế độ Smart transcription làm sạch lời nói tự nhiên.

Ngày 26/8/2026, Google giới thiệu Gemini 3.5 Transcribe, model speech-to-text chuyên dụng mới được thiết kế để biến giọng nói thành văn bản chính xác, có cấu trúc và phù hợp hơn với các ứng dụng thời gian thực. Google gọi đây là model chuyển giọng nói thành văn bản chính xác nhất của hãng ở thời điểm công bố.

Điểm đáng chú ý của Gemini 3.5 Transcribe không chỉ nằm ở việc nhận dạng từ được nói. Model có thể tự phát hiện ngôn ngữ, xử lý code-switching, phân biệt người nói, tạo timestamp ở cấp từ, ưu tiên từ vựng chuyên ngành và thậm chí làm sạch lời nói tự nhiên thành văn bản dễ đọc. Điều này đưa speech-to-text từ một công cụ chép lời đơn thuần thành một lớp đầu vào thông minh cho voice agent, cuộc họp, call center, caption và nhiều workflow AI khác.

Tóm tắt nhanh

Gemini 3.5 Transcribe là model speech-to-text chuyên dụng mới của Google, ra mắt ngày 26/8/2026.

• Model hỗ trợ tự nhận dạng ngôn ngữ ở hơn 85 locale, có tiếng Việt vi-VN và có thể xử lý việc chuyển đổi ngôn ngữ trong cùng cuộc hội thoại.

• Hai hướng sử dụng chính là streaming thời gian thực với gemini-3.5-transcribe-live và xử lý audio đã ghi với gemini-3.5-transcribe.

• Chế độ Smart transcription có thể loại bỏ filler words, sửa các lần tự đính chính khi nói và tự định dạng nội dung thành đoạn văn, danh sách, ngày tháng hoặc con số dễ đọc.

• Google công bố WER khoảng 5,50% ở streaming5,04% ở non-streaming trên FLEURS; time-to-final transcription nhanh hơn Chirp 3 khoảng 70% trong phép đo được Google dẫn lại.

Gemini 3.5 Transcribe là gì?

Gemini 3.5 Transcribe là một model AI chuyên chuyển lời nói thành văn bản, được xây trên khả năng hiểu audio của Gemini nhưng tối ưu riêng cho bài toán speech-to-text. Thay vì dùng một model đa phương thức tổng quát để nghe audio rồi trả lời câu hỏi, Transcribe tập trung vào việc nhận dạng chính xác những gì được nói và trả về transcript có cấu trúc.

Theo tài liệu Gemini API, model được thiết kế để xử lý nhiều giọng nói, tiếng ồn nền và hội thoại đa ngôn ngữ. Nó có thể tự phát hiện ngôn ngữ, nhận biết các speaker khác nhau, gắn thời gian cho từng từ và nhận gợi ý từ vựng chuyên biệt từ ứng dụng.

Nói đơn giản, nếu speech recognition truyền thống chủ yếu trả lời câu hỏi “người dùng vừa nói những từ nào?”, Gemini 3.5 Transcribe cố gắng tiến thêm một bước: “làm thế nào để biến lời nói tự nhiên thành văn bản chính xác và hữu ích cho workflow tiếp theo?”.

Gemini 3.5 Transcribe khác speech-to-text truyền thống như thế nào?

Speech-to-text không phải công nghệ mới. Tuy nhiên, các hệ thống nhận dạng giọng nói thường gặp khó khăn khi audio có tiếng ồn, người nói đổi ngôn ngữ, sử dụng thuật ngữ chuyên ngành, nói ngập ngừng hoặc tự sửa câu giữa chừng. Google thiết kế Gemini 3.5 Transcribe để xử lý chính những tình huống này tốt hơn.

1. Tự phát hiện ngôn ngữ và code-switching

Model có thể tự động nhận dạng ngôn ngữ ở hơn 85 locale mà không bắt buộc developer phải chọn trước một mã ngôn ngữ. Quan trọng hơn, Gemini 3.5 Transcribe có thể xử lý code-switching, tức người nói chuyển từ ngôn ngữ này sang ngôn ngữ khác trong cùng một câu hoặc giữa các câu.

Khả năng này đặc biệt hữu ích trong các cuộc họp quốc tế, hội thoại của người dùng song ngữ hoặc môi trường công nghệ nơi tiếng Việt và tiếng Anh thường được sử dụng xen kẽ.

2. Custom vocabulary lên tới 1.000 cụm từ

Developer có thể cung cấp tối đa 1.000 cụm từ để model ưu tiên nhận dạng. Danh sách này có thể chứa tên sản phẩm, tên người, thuật ngữ y khoa, từ viết tắt, tên công nghệ hoặc vocabulary riêng của doanh nghiệp.

Ví dụ, một hệ thống ghi âm cuộc họp kỹ thuật có thể đưa các từ như “Kubernetes”, “BigQuery” hoặc tên sản phẩm nội bộ vào custom vocabulary để giảm khả năng model nghe nhầm thành những từ phổ thông có âm gần giống.

3. Phân biệt nhiều người nói

Gemini 3.5 Transcribe hỗ trợ speaker diarization, tức xác định đâu là lời của speaker 1, speaker 2 và các speaker khác. Tài liệu Google hiện cho biết model hỗ trợ tối đa 8 người nói; attribution khi có từ 3 speaker trở lên vẫn được đánh dấu là experimental.

Đây là khả năng quan trọng cho transcript cuộc họp, phỏng vấn, podcast, call center và các pipeline phân tích hội thoại, bởi nội dung chỉ thực sự hữu ích khi hệ thống biết ai đã nói điều gì.

4. Timestamp ở cấp từ

Model có thể tạo thời gian bắt đầu và kết thúc cho từng từ. Word-level timestamps giúp ứng dụng đồng bộ transcript với audio, tạo subtitle, tìm nhanh đoạn phát biểu hoặc cho phép người dùng bấm vào một câu để nhảy đến đúng vị trí trong bản ghi.

5. Smart transcription làm sạch lời nói tự nhiên

Đây là một trong những khác biệt đáng chú ý nhất. Trong hội thoại thực tế, con người thường nói “ừm”, “ờ”, lặp từ, nói dở câu hoặc tự sửa lại ý. Chế độ Smart transcription có thể loại bỏ những disfluency này để tạo ra văn bản dễ đọc hơn.

Model cũng có thể xử lý self-correction. Nếu người nói thay đổi ngày giờ hoặc một chi tiết ngay trong câu, Smart mode có thể giữ lại phiên bản cuối cùng thay vì chép nguyên cả quá trình sửa miệng. Ngoài ra, model có thể tự cấu trúc nội dung thành đoạn văn, danh sách, ngày tháng, tiền tệ và con số đã chuẩn hóa.

Verbatim và Smart khác nhau như thế nào?

Gemini 3.5 Transcribe cung cấp hai chế độ transcription chính và mỗi chế độ phù hợp với một mục đích khác nhau.

Verbatim là chế độ mặc định. Nó cố gắng giữ nguyên những gì người nói thực sự phát âm, bao gồm filler words, câu lặp, khoảng dừng và những lần bắt đầu câu nhưng không hoàn thành. Đây là lựa chọn phù hợp khi cần transcript gần với bản ghi gốc, nghiên cứu hội thoại, legal review hoặc khi cần word-level timestamps và speaker diarization.

Smart ưu tiên khả năng đọc. Nó loại bỏ các lỗi diễn đạt, xử lý self-correction và áp dụng định dạng thông minh. Smart phù hợp cho ghi chú cuộc họp, dictation, tạo nội dung từ giọng nói hoặc bất kỳ trường hợp nào người dùng muốn nhận một văn bản đã được làm sạch thay vì bản chép lời từng chữ.

Có một giới hạn quan trọng: theo tài liệu hiện tại của Google, Smart mode không tương thích với word-level timestamps và diarization. Nếu ứng dụng cần biết chính xác từ nào được nói lúc nào hoặc ai là người nói, developer nên sử dụng Verbatim.

Gemini 3.5 Transcribe hỗ trợ streaming thời gian thực như thế nào?

Google cung cấp Gemini 3.5 Transcribe theo hai hướng triển khai khác nhau.

Streaming với gemini-3.5-transcribe-live

Đối với microphone hoặc audio stream đang diễn ra, developer có thể dùng model gemini-3.5-transcribe-live thông qua Gemini Live API. Google mô tả chế độ này là continuous bidirectional streaming với độ trễ dưới một giây, hướng tới voice agent, live captioning và giao diện điều khiển bằng giọng nói.

Audio đã ghi với gemini-3.5-transcribe

Với file audio, cuộc họp, cuộc gọi hoặc recording đã có sẵn, developer sử dụng gemini-3.5-transcribe. Hướng này phù hợp cho xử lý batch, meeting transcript, post-call analytics, podcast và những workflow không yêu cầu phản hồi ngay khi người dùng đang nói.

Gemini 3.5 Transcribe chính xác đến mức nào?

Một chỉ số phổ biến để đánh giá speech recognition là Word Error Rate (WER). WER đo tỷ lệ từ bị chèn sai, bỏ sót hoặc thay thế so với transcript chuẩn. WER càng thấp thì kết quả nhận dạng càng tốt.

Google cho biết trên benchmark FLEURS ở nhóm ngôn ngữ và locale được đánh giá, Gemini 3.5 Transcribe đạt WER khoảng 5,50% trong streaming5,04% ở non-streaming. Google cũng dẫn phép đo của Artificial Analysis cho thấy thời gian từ lúc audio kết thúc đến khi có transcript cuối cùng cải thiện khoảng 70% so với Chirp 3.

Các con số benchmark không đồng nghĩa mọi recording đều đạt cùng mức chính xác. Chất lượng thực tế vẫn phụ thuộc vào microphone, tiếng ồn, accent, tốc độ nói, domain vocabulary, số lượng speaker và ngôn ngữ. Vì vậy WER nên được xem là tín hiệu so sánh model, không phải cam kết độ chính xác tuyệt đối cho mọi use case.

Gemini 3.5 Transcribe có hỗ trợ tiếng Việt không?

Có. Danh sách ngôn ngữ chính thức của Gemini API có tiếng Việt với mã vi-VN. Model cũng có thể tự phát hiện ngôn ngữ, vì vậy trong nhiều trường hợp developer không cần khai báo trước rằng audio là tiếng Việt.

Khả năng code-switching cũng đáng chú ý với người dùng Việt Nam. Một cuộc họp công nghệ có thể chứa những câu tiếng Việt xen lẫn thuật ngữ tiếng Anh như API, deployment, conversion rate hoặc tên sản phẩm. Gemini 3.5 Transcribe được thiết kế để chuyển đổi giữa các ngôn ngữ trong câu và giữa các câu mà không cần cấu hình lại thủ công.

Tuy nhiên, việc một locale được hỗ trợ không có nghĩa độ chính xác hoàn toàn giống nhau ở mọi ngôn ngữ. Với nội dung chuyên ngành hoặc tên riêng tiếng Việt, custom vocabulary vẫn là công cụ đáng sử dụng.

Gemini 3.5 Transcribe có thể được dùng vào việc gì?

Voice Agent: chuyển lời người dùng thành text với độ trễ thấp để agent hiểu yêu cầu và phản hồi trong thời gian thực.

Ghi chú cuộc họp: tạo transcript, phân biệt speaker và chuyển bản ghi thành văn bản đã làm sạch.

Call center và post-call analytics: chuyển cuộc gọi thành dữ liệu có thể tìm kiếm, tóm tắt và phân tích sau cuộc gọi.

Live caption và subtitle: dùng streaming để tạo phụ đề gần thời gian thực hoặc dùng timestamps cho audio/video đã ghi.

Dictation và nhập liệu bằng giọng nói: Smart mode có thể biến lời nói tự nhiên thành email, ghi chú, prompt hoặc văn bản đã có cấu trúc.

Podcast và phỏng vấn: diarization giúp xác định người nói, còn timestamps giúp đồng bộ transcript với timeline.

Workflow đa ngôn ngữ: tự phát hiện ngôn ngữ và code-switching giúp giảm số bước cấu hình trong sản phẩm phục vụ người dùng quốc tế.

Google đang đưa Gemini 3.5 Transcribe vào những sản phẩm nào?

Google không chỉ phát hành model dưới dạng API. Công ty đang sử dụng công nghệ transcription mới trên một số sản phẩm và bề mặt tương tác bằng giọng nói.

Trên Android, tính năng Rambler của Gboard có thể biến lời nói tự nhiên thành văn bản đã định dạng và loại bỏ filler words. Trong Gemini app trên macOS, transcription được kết hợp với screen context và các model Gemini khác để người dùng ra lệnh bằng giọng nói, xử lý file hoặc thực hiện workflow ngay tại con trỏ.

Google cũng cho biết 3.5 Transcribe được sử dụng trong Google Antigravity để tận dụng screen context và chat history khi người dùng cho phép, có mặt trong Build mode của Google AI Studio và dự kiến được đưa vào Chrome để hỗ trợ talk-to-type trong các trường nhập liệu.

Developer có thể sử dụng Gemini 3.5 Transcribe ở đâu?

Developer có thể tiếp cận model thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform. Với audio đã ghi, model ID là gemini-3.5-transcribe. Với transcription thời gian thực, model ID là gemini-3.5-transcribe-live thông qua Live API.

Google cho biết các nền tảng như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents đang tận dụng Gemini Live API để xây các giao diện voice-driven. Điều này cho thấy Transcribe không chỉ nhắm tới ứng dụng Google mà còn đóng vai trò hạ tầng cho hệ sinh thái voice agent rộng hơn.

Những giới hạn cần biết về Gemini 3.5 Transcribe

Smart mode đánh đổi tính nguyên bản: vì model chủ động làm sạch filler words và self-correction, transcript không còn là bản chép từng chữ. Các workflow cần bằng chứng chính xác nên dùng Verbatim.

Smart mode không dùng cùng diarization và word-level timestamps: đây là giới hạn API quan trọng khi thiết kế sản phẩm.

Diarization nhiều speaker chưa hoàn toàn trưởng thành: Google ghi chú attribution từ 3 speaker trở lên là experimental, dù model có thể hỗ trợ tối đa 8 speaker.

85+ locale không đồng nghĩa chất lượng bằng nhau: độ chính xác vẫn phụ thuộc accent, môi trường âm thanh và domain.

Speech-to-text khác audio understanding: nếu mục tiêu là đặt câu hỏi về nội dung audio, phân tích âm thanh hoặc suy luận từ recording, Google khuyến nghị dùng khả năng Audio understanding thay vì Transcribe.

Quyền riêng tư và sự đồng ý vẫn quan trọng: ứng dụng ghi âm cuộc gọi, cuộc họp hoặc giọng nói cần tuân thủ chính sách dữ liệu và quy định về consent phù hợp với khu vực triển khai.

Vì sao Gemini 3.5 Transcribe đáng chú ý?

Sự phát triển của AI Agent đang khiến voice trở thành một giao diện ngày càng quan trọng. Để agent có thể nghe người dùng tự nhiên, lớp speech-to-text phải đủ nhanh, đủ chính xác và hiểu được cách con người thực sự nói, không chỉ những câu đọc rõ ràng trong môi trường yên tĩnh.

Gemini 3.5 Transcribe đáng chú ý vì Google đang kết hợp ba yếu tố trong cùng một model: nhận dạng speech truyền thống, khả năng hiểu ngữ cảnh của Gemini và một lớp hậu xử lý có thể biến lời nói thô thành văn bản hữu ích. Streaming sub-second phục vụ tương tác thời gian thực, trong khi Smart transcription hướng tới trải nghiệm dictation gần với cách con người muốn viết hơn là cách họ thực sự nói.

Nếu hướng phát triển này tiếp tục, speech-to-text sẽ ngày càng ít được nhìn như một tính năng độc lập. Nó có thể trở thành lớp đầu vào mặc định cho voice agent, hệ thống làm việc bằng giọng nói và các ứng dụng AI luôn sẵn sàng nghe, hiểu và hành động.

Câu hỏi thường gặp về Gemini 3.5 Transcribe

Gemini 3.5 Transcribe là gì?

Gemini 3.5 Transcribe là model speech-to-text chuyên dụng của Google dùng để chuyển giọng nói thành văn bản, hỗ trợ nhận dạng ngôn ngữ, diarization, timestamps, custom vocabulary và Smart transcription.

Gemini 3.5 Transcribe có hỗ trợ tiếng Việt không?

Có. Google liệt kê tiếng Việt với mã vi-VN trong danh sách ngôn ngữ được hỗ trợ.

Gemini 3.5 Transcribe có thể chép lời trực tiếp không?

Có. Model gemini-3.5-transcribe-live hoạt động qua Gemini Live API cho streaming transcription độ trễ thấp.

Gemini 3.5 Transcribe có phân biệt người nói không?

Có. Speaker diarization hỗ trợ tối đa 8 speaker; Google hiện đánh dấu attribution khi có từ 3 speaker trở lên là experimental.

Smart transcription có tác dụng gì?

Smart transcription làm sạch filler words, lỗi nói lắp, câu bắt đầu sai, xử lý self-correction và tự định dạng lời nói thành văn bản dễ đọc hơn.

Khi nào nên dùng Verbatim thay vì Smart?

Nên dùng Verbatim khi cần giữ nguyên lời nói, cần speaker diarization hoặc word-level timestamps. Smart phù hợp hơn khi ưu tiên một bản transcript đã được làm sạch để đọc hoặc tái sử dụng.

Gemini 3.5 Transcribe có thay thế Audio understanding không?

Không. Transcribe được tối ưu cho speech-to-text. Nếu cần hỏi đáp, phân tích hoặc suy luận về nội dung audio, Google cung cấp khả năng Audio understanding riêng.

Điều gì cần theo dõi tiếp theo?

Ba điểm đáng theo dõi là chất lượng thực tế của tiếng Việt trong nhiều môi trường âm thanh khác nhau, mức độ phổ biến của model trong các voice-agent framework và tốc độ Google đưa transcription theo ngữ cảnh vào Chrome, Android và những bề mặt làm việc mới. Nếu những trải nghiệm này hoạt động tốt ở quy mô lớn, Gemini 3.5 Transcribe có thể trở thành một thành phần quan trọng trong làn sóng giao diện AI điều khiển bằng giọng nói.

Bot.io.vn
Bot.io.vn