Agentic Video Understanding là gì? Gemini tự quyết định đoạn video nào cần xem

Agentic Video Understanding là cách Gemini chủ động điều hướng video, chỉ tải frame, audio hoặc transcript cần thiết thay vì đọc toàn bộ theo 1 FPS, giúp giảm mạnh token và chi phí khi phân tích video dài.

Chọn Bot.io.vn làm nguồn ưu tiên

Google đang thay đổi cách Gemini “xem” video. Thay vì nạp video theo một tốc độ khung hình cố định rồi đưa gần như toàn bộ dữ liệu vào context, Agentic Video Understanding cho phép model tự quyết định đoạn nào đáng xem, cần xem nhanh hay chậm, và nên lấy tín hiệu từ frame hình ảnh, audio hay transcript.

Google công bố tính năng này ngày 1/9/2026 cho Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite. Tài liệu Gemini API cập nhật ngày 3/9 đã bổ sung Gemini 3.8 Flash vào danh sách hỗ trợ. Đây không phải một model video mới, mà là một chế độ xử lý video kiểu agent dành cho các model Gemini Flash.

Tóm tắt nhanh

Agentic Video Understanding là chế độ để Gemini chủ động điều hướng timeline video thay vì đọc cố định 1 FPS.

Model có thể chỉ tải transcript, frame hoặc audio cần thiết cho câu hỏi đang xử lý.

Google báo cáo trên các benchmark nội bộ/tiêu chuẩn: giảm tới 88% token, giảm tới 66% chi phí và tăng tới 7% chất lượng so với static processing.

Tính đến 4/9/2026, docs liệt kê hỗ trợ trên Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash và 3.5 Flash Lite.

Agentic phù hợp nhất với video dài hoặc câu hỏi nhắm vào một khoảnh khắc cụ thể; static vẫn có lợi cho clip ngắn cần độ trễ thấp hoặc kiểm tra toàn bộ frame.

Agentic Video Understanding là gì?

Agentic Video Understanding là cơ chế để Gemini chủ động tìm kiếm bằng chứng bên trong video trước khi trả lời. Model không nhất thiết phải đưa toàn bộ chuỗi frame, audio và transcript vào context ngay từ đầu. Thay vào đó, nó có thể điều hướng timeline, tải đúng đoạn cần thiết và lặp lại quá trình này nhiều lần tùy câu hỏi.

Trong bài công bố, Google DeepMind mô tả hệ thống này là sự kết hợp giữa reasoning của model và các native video tools. Model có thể search, scan và inspect những đoạn mục tiêu qua ba loại tín hiệu chính: hình ảnh, âm thanh và transcript. Ý tưởng gần với một AI Agent dùng tool: model suy nghĩ về việc cần tìm gì, gọi công cụ để lấy thêm bằng chứng, rồi mới tổng hợp câu trả lời.

Đây không phải model tạo video mới

Tên gọi dễ gây nhầm với AI tạo video. Agentic Video Understanding thuộc nhóm video analysis / video understanding: đọc, tìm, mô tả và trả lời câu hỏi về video có sẵn. Nó khác với Gemini Omni 1.1 Flash, nơi trọng tâm là tạo và chỉnh sửa video. Một bên “hiểu video”, bên còn lại “sinh hoặc biến đổi video”.

Vì sao cách xử lý video static dễ tốn token?

Ở chế độ static mặc định, Gemini trích frame theo tốc độ cố định 1 frame/giây (1 FPS) rồi đặt dữ liệu đó vào context trong một lần. Audio cũng được xử lý liên tục. Cách này dễ hiểu và ổn với clip ngắn, nhưng càng kéo dài video thì lượng dữ liệu đưa vào model càng tăng.

Theo tài liệu Gemini API, static processing ở media resolution thấp tiêu thụ xấp xỉ 100 token cho mỗi giây video; ở độ phân giải cao hơn, con số có thể vào khoảng 300 token/giây. Một video dài hàng chục phút vì thế có thể dùng một lượng context đáng kể dù câu hỏi chỉ cần vài đoạn ngắn.

Vấn đề không chỉ là chi phí. Với video dài như bài giảng 90 phút, webinar hay bản ghi nhiều giờ, developer thường phải chọn giữa hai hướng không lý tưởng: đưa nhiều dữ liệu vào context để tránh bỏ sót chi tiết, hoặc giảm sampling/cắt bớt dữ liệu và chấp nhận nguy cơ mất đúng khoảnh khắc cần tìm.

Agentic mode hoạt động như thế nào?

Khác biệt cốt lõi là model chuyển từ “đọc tất cả rồi suy luận” sang “suy luận xem cần đọc gì”. Google mô tả Gemini có thể tự quyết định xem đoạn nào, ở tốc độ nào và qua modality nào trước khi đưa ra câu trả lời.

1. Xác định mục tiêu của câu hỏi

Nếu prompt hỏi “ba thông báo quan trọng nhất trong keynote là gì?”, model không nhất thiết cần soi từng frame với cùng mức ưu tiên. Nó có thể bắt đầu từ transcript để xác định chủ đề, sau đó quay lại những đoạn chứa slide hoặc demo quan trọng để kiểm tra bằng hình ảnh.

2. Điều hướng timeline thay vì quét tuyến tính

Agentic mode có thể nhảy đến những đoạn có xác suất liên quan cao, scan một khoảng rộng, rồi zoom vào đoạn hẹp hơn. Đây là cơ sở cho các use case Google nêu như sub-second moment retrieval, nơi mục tiêu là tìm thời điểm chính xác của một sự kiện thay vì chỉ hiểu chủ đề tổng quát.

3. Chọn transcript, frame hoặc audio tùy tình huống

Một câu hỏi về lời nói có thể ưu tiên transcript; một câu hỏi về vật thể hoặc thao tác cần frame hình ảnh; còn câu hỏi liên quan tiếng động có thể cần audio. Docs cho biết agentic processing tải transcript và/hoặc frames và/hoặc audio theo yêu cầu, thay vì luôn gửi toàn bộ ba luồng vào context.

4. Lặp lại việc thu thập bằng chứng trước khi trả lời

Trong Interactions API, agentic processing có thể tạo các bước processing_call và processing_result. Các bước này cho thấy model đang yêu cầu thêm một phần dữ liệu video và nhận lại kết quả trước khi tạo model_output. Developer có thể dùng chúng như một progress trace để biết model thực sự đã điều hướng video.

Google báo cáo Agentic Video Understanding cải thiện bao nhiêu?

Theo bài công bố của Google DeepMind, trên các benchmark video analysis mà hãng thử nghiệm, agentic video understanding có thể giảm token tới 88%, giảm chi phí phân tích tới 66% và tăng accuracy tới 7% so với static processing.

Các mức “tới” này không phải bảo đảm cho mọi video. Hiệu quả phụ thuộc độ dài, loại nội dung và câu hỏi. Lợi ích được Google nhấn mạnh là rõ nhất ở long-form video: từ hướng dẫn 10 phút, bài giảng 90 phút đến bản ghi kéo dài nhiều giờ.

Ở thời điểm công bố, Gemini 3.7 Flash với agentic understanding được Google mô tả là đạt điểm cân bằng tốt nhất giữa accuracy và cost trong nhóm model họ benchmark. Sau đó, Gemini API docs cập nhật thêm Gemini 3.8 Flash vào danh sách hỗ trợ.

Những model Gemini nào hỗ trợ agentic video?

Ngày 1/9/2026, Google ra mắt tính năng trên Gemini 3.7 Flash, Gemini 3.6 Flash và Gemini 3.5 Flash-Lite. Tài liệu video understanding cập nhật ngày 3/9 hiện liệt kê thêm Gemini 3.8 Flash, model Flash mới nhất của Google.

Điểm này quan trọng vì announcement và docs không hoàn toàn giống nhau theo thời gian. Nếu đang xây production workflow, developer nên xem danh sách model hỗ trợ trong docs hiện tại thay vì chỉ dựa vào bài launch. Với Bot.io.vn, bài Gemini 3.8 Flash vẫn giữ intent riêng về model, pricing, context và khả năng agent/coding; bài này tập trung vào một capability video cụ thể.

Khi nào nên dùng agentic, khi nào nên dùng static?

Google khuyến nghị bắt đầu với agentic mode khi ưu tiên chất lượng hoặc hiệu quả token, đặc biệt với video dài. Tuy vậy, static processing vẫn có trường hợp hợp lý hơn.

Nên dùng agentic khi video dài hoặc câu hỏi chỉ nhắm vào một phần nhỏ

Ví dụ: tìm đoạn giảng viên giải thích một khái niệm trong lecture 90 phút, phát hiện thời điểm một lỗi xuất hiện trong video kiểm tra dây chuyền, tìm câu trả lời trong webinar dài, hoặc xác định khoảnh khắc cụ thể trong video thể thao. Khi câu hỏi chỉ cần một phần nhỏ dữ liệu, việc để model tự tìm đoạn cần thiết có thể tiết kiệm context đáng kể.

Static vẫn hợp với clip ngắn, latency-sensitive

Docs lưu ý agentic mode có reasoning và tool round-trip trước khi model bắt đầu trả lời, nên Time to First Token có thể cao hơn trên clip ngắn dưới khoảng 5 phút. Nếu ứng dụng cần phản hồi cực nhanh hoặc cần kiểm tra toàn bộ video theo sampling cố định, static processing có thể phù hợp hơn.

Static cũng hữu ích khi cần kiểm tra frame trên toàn clip

Agentic tối ưu bằng cách bỏ qua dữ liệu không cần thiết. Nếu use case yêu cầu coverage có hệ thống trên toàn bộ clip, chẳng hạn kiểm tra mọi đoạn theo cùng một tiêu chí, developer cần cân nhắc liệu chiến lược tìm kiếm chủ động có phù hợp hay không. Google cũng nhấn mạnh rằng video có chuyển động nhanh vẫn có thể cần thiết kế prompt và media resolution cẩn thận.

Cách bật Agentic Video Understanding trong Gemini API

Với Interactions API, phần quan trọng nhất là đặt processing: "agentic" trên video input. Ví dụ rút gọn với Gemini 3.8 Flash:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input=[
        {
            "type": "video",
            "uri": video_file.uri,
            "mime_type": video_file.mime_type,
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "Tóm tắt ba luận điểm chính và nêu timestamp quan trọng."
        }
    ]
)

print(interaction.output_text)

Tài liệu hiện cho phép video từ File API, Cloud Storage Registration, dữ liệu inline hoặc URL YouTube công khai tùy trường hợp. Với video lớn và dài, Google khuyến nghị File API hoặc Cloud Storage hơn là nhét dữ liệu trực tiếp vào request.

Làm sao biết request thực sự chạy agentic?

Developer có thể kiểm tra interaction.steps. Nếu xuất hiện processing_call và processing_result, nghĩa là model đã gọi cơ chế xử lý để điều hướng video và lấy thêm đoạn dữ liệu. Đây là cách đáng tin cậy hơn việc chỉ suy đoán từ câu trả lời cuối.

Agentic video có thể mở ra những use case nào?

Google nhấn mạnh ba khả năng nổi bật: tìm khoảnh khắc chính xác hơn, anomaly detection chính xác hơn và counting chính xác hơn. Nhưng giá trị thực tế rộng hơn, vì agentic navigation biến video dài thành một nguồn dữ liệu mà model có thể “tra cứu” theo mục tiêu.

Tóm tắt bài giảng, cuộc họp và webinar dài

Thay vì token hóa toàn bộ lecture ở độ phân giải cao, model có thể dùng transcript để tìm phần chính rồi mở frame khi cần đọc slide hoặc quan sát demo. Với các hệ thống knowledge management, đây là hướng tiếp cận tự nhiên hơn cho video dài.

Tìm sự kiện hoặc lỗi hiếm trong video

Trong QA, manufacturing hoặc phân tích quy trình, câu hỏi thường không phải “video nói gì?” mà là “lỗi xảy ra ở đâu và khi nào?”. Agentic navigation phù hợp với kiểu truy vấn này vì model có thể thu hẹp timeline và kiểm tra lại đoạn nghi vấn qua nhiều modality.

Phân tích kho video và nội dung media

Các đội media có thể dùng video understanding để tìm đoạn chứa chủ đề, nhân vật, slide hoặc sự kiện cụ thể trong kho nội dung. Với URL YouTube công khai, Gemini API cũng cho phép đưa video trực tiếp vào prompt, dù quyền truy cập và giới hạn của tính năng YouTube có thể thay đổi theo tier.

Ứng dụng trợ lý video cho người dùng cuối

Google cho biết họ dự định đưa cải tiến này tới người dùng Gemini app trên các model Flash/Flash-Lite và dùng nó cho tính năng Ask YouTube trong tương lai. Đây là roadmap Google nêu khi launch, không nên hiểu là mọi bề mặt sản phẩm đã được rollout hoàn toàn ngay ngày 1/9.

Agentic Video Understanding khác Gemini Omni 1.1 Flash như thế nào?

Hai chủ đề đều liên quan video nhưng giải quyết hai bài toán khác nhau. Gemini Omni 1.1 Flash tập trung vào video generation và editing: kéo dài video, nội suy khung hình, draft, upscale và workflow sáng tạo. Agentic Video Understanding tập trung vào đọc video đã có để tìm thông tin, timestamp, sự kiện và bằng chứng.

Nếu bài toán là “tạo cho tôi một clip”, hãy nghĩ đến model generation. Nếu bài toán là “trong video dài này đoạn nào nói về X, và bằng chứng hình ảnh nằm ở đâu?”, agentic video understanding mới là capability phù hợp. Vì intent tách biệt, hai chủ đề nên có URL riêng thay vì gom vào một bài.

Agentic video liên quan gì đến Gemini 3.5 Transcribe?

Gemini 3.5 Transcribe là bài toán speech-to-text chuyên biệt, biến audio thành văn bản với các tính năng như streaming và diarization. Agentic video understanding có thể sử dụng transcript như một trong nhiều nguồn tín hiệu, nhưng không chỉ dừng ở transcription: model còn quay lại frame hoặc audio khi câu hỏi yêu cầu.

Chi phí và latency thực tế cần hiểu thế nào?

Google cho biết agentic video understanding dùng standard Gemini API token pricing và không có feature fee riêng. Vì vậy, mức giảm chi phí được hãng báo cáo chủ yếu đến từ việc giảm lượng dữ liệu cần đưa vào model, chứ không phải do một bảng giá đặc biệt cho agentic mode.

Đổi lại, model phải suy luận về việc nên xem gì và gọi các bước xử lý nội bộ. Trên video ngắn, thời gian đến token đầu tiên có thể tăng. Trên video dài hoặc prompt phức tạp, docs khuyên dùng streaming hoặc background execution để tránh timeout và đồng thời hiển thị tiến trình xử lý.

Điều quan trọng là benchmark “giảm 66% chi phí” là vendor-reported result. Workload thực tế cần đo bằng token usage, latency và chất lượng câu trả lời của chính ứng dụng trước khi quyết định chuyển toàn bộ traffic sang agentic.

Những giới hạn cần nhớ

Agentic không biến Gemini thành một hệ thống video hoàn hảo. Việc model chủ động chọn đoạn cần xem giúp hiệu quả hơn, nhưng cũng tạo ra một chiến lược attention có chọn lọc. Nếu model đánh giá sai đoạn quan trọng, nó có thể không tải đúng bằng chứng cần thiết.

Các câu trả lời video vẫn có thể sai, thiếu chi tiết hoặc suy diễn quá mức. Google khuyến nghị post-processing và human evaluation cho use case quan trọng. Với các tác vụ cần timestamp chính xác, đếm vật thể hoặc phát hiện anomaly, nên đánh giá trên dữ liệu thật của domain thay vì chỉ dựa vào benchmark chung.

Ngoài ra, static và agentic không phải hai lựa chọn loại trừ hoàn toàn. Docs cho phép đặt processing mode khác nhau cho từng video trong cùng một request, ví dụ lecture dài dùng agentic nhưng clip thí nghiệm ngắn dùng static. Đây có thể là cách tối ưu tốt hơn cho workflow đa video.

Câu hỏi thường gặp về Agentic Video Understanding

Agentic Video Understanding có phải một model Gemini mới không?

Không. Đây là một processing mode/capability cho các model Gemini Flash hỗ trợ video, không phải một model riêng. Tính đến 4/9/2026, docs liệt kê Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash và 3.5 Flash Lite.

Agentic mode có luôn rẻ hơn static 66% không?

Không. Google nói mức giảm chi phí là tới 66% trên benchmark của họ. Video ngắn hoặc câu hỏi cần coverage toàn diện có thể cho kết quả khác. Developer nên benchmark workload của mình.

Vì sao agentic có thể dùng ít token hơn tới 88%?

Vì model không phải nạp mọi frame/audio/transcript theo một chu kỳ cố định. Nó chỉ tải những đoạn và modality cần thiết cho prompt. Mức tiết kiệm lớn nhất thường xuất hiện khi video dài nhưng câu trả lời chỉ phụ thuộc vào một phần nhỏ nội dung.

Agentic Video Understanding dùng được với YouTube không?

Có. Google nói tính năng hỗ trợ video upload và URL YouTube công khai qua Gemini API. Tuy nhiên, giới hạn sử dụng YouTube khác nhau giữa free và paid tier và có thể thay đổi, nên cần kiểm tra docs trước khi triển khai production.

Có cần trả thêm phí để bật agentic không?

Google cho biết không có feature fee riêng. Agentic dùng bảng giá token chuẩn của Gemini API; chi phí cuối phụ thuộc token/thought/tool-use mà request thực tế tiêu thụ.

Static processing có bị thay thế không?

Không. Static vẫn là chế độ mặc định và hữu ích cho clip ngắn, latency-sensitive hoặc tác vụ cần sampling đều. Agentic là lựa chọn bổ sung để tối ưu long-form video và câu hỏi cần tìm đoạn mục tiêu.

Gemini app đã có agentic video cho mọi người chưa?

Tại thời điểm công bố 1/9, Google nói tính năng đã có qua Gemini API/AI Studio và Gemini Enterprise Agent Platform, còn rollout tới Gemini app sẽ diễn ra sau. Vì rollout sản phẩm có thể thay đổi nhanh, trạng thái app nên được kiểm tra lại theo thời điểm sử dụng.

Vì sao Agentic Video Understanding đáng chú ý?

Điểm đáng chú ý không chỉ nằm ở con số tiết kiệm token. Agentic Video Understanding cho thấy một xu hướng rộng hơn: model multimodal đang chuyển từ việc tiêu thụ dữ liệu thụ động sang chủ động quyết định cần quan sát gì. Với video dài, khả năng này có thể quan trọng ngang với context window lớn, bởi hệ thống không còn buộc phải đưa mọi thứ vào context để tránh bỏ sót.

Nếu hướng đi này tiếp tục, video understanding sẽ ngày càng giống một agent tra cứu evidence trong timeline hơn là một model “xem toàn bộ clip một lần”. Đối với developer, thay đổi thực tế là rõ ràng: ngoài việc chọn model, giờ còn phải chọn chiến lược xử lý media phù hợp với độ dài video, latency, cost và mức coverage mà sản phẩm cần.

Nguồn chính: Google DeepMind — Introducing agentic video understanding with Gemini; Gemini API — Video understanding; Gemini API optimization and inference. Thông tin được kiểm tra đến ngày 4/9/2026.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày