Gemini Omni 1.1 Flash là gì? Google nâng AI video lên bản production-ready

Gemini Omni 1.1 Flash là bản GA mới của Google cho tạo và chỉnh sửa video bằng AI, với kéo dài video tới 40 giây, nội suy khung hình đầu-cuối, draft 360p và upscale 4K.

Chọn Bot.io.vn làm nguồn ưu tiên

Gemini Omni 1.1 Flash là bản cập nhật production-ready của dòng Gemini Omni dành cho tạo và chỉnh sửa video. Google phát hành model này ngày 27/08/2026, đưa Gemini Omni từ giai đoạn preview sang trạng thái GA cho developer thông qua Gemini API.

Điểm đáng chú ý của bản 1.1 không nằm ở một hiệu ứng video đơn lẻ. Google bổ sung cả một nhóm công cụ để đưa video AI gần hơn với quy trình sản xuất thực tế: kéo dài cảnh tới tổng thời lượng 40 giây, đặt khung hình đầu và cuối, dựng nháp 360p để thử nhanh, rồi upscale lên 1080p hoặc 4K khi cần đầu ra hoàn thiện.

Gemini Omni 1.1 Flash là gì?

Gemini Omni 1.1 Flash là model video đa phương thức của Google DeepMind, có tên API gemini-omni-1.1-flash. Model nhận đồng thời văn bản, hình ảnh, âm thanh và video làm đầu vào, sau đó tạo video có hình ảnh và âm thanh. Khác với cách tạo video theo từng prompt tách biệt, Gemini Omni được thiết kế để tiếp tục chỉnh sửa qua nhiều lượt hội thoại, giữ lại bối cảnh của phiên làm việc.

Google mô tả Gemini Omni như nơi khả năng reasoning của Gemini kết hợp với generative media. Trong thực tế, điều này cho phép người dùng không chỉ yêu cầu “tạo một video”, mà còn tiếp tục nói “đổi góc máy”, “thay nhân vật này”, “giữ căn phòng nhưng đổi phong cách”, hoặc “tiếp tục cảnh này thêm 10 giây” trong cùng một luồng chỉnh sửa.

Bản 1.1 được Google công bố là GA vào ngày 27/08/2026. Endpoint preview cũ gemini-omni-flash-preview dự kiến ngừng hoạt động ngày 30/09/2026, vì vậy developer đang dùng bản preview nên chuyển sang gemini-omni-1.1-flash.

Gemini Omni 1.1 Flash có gì mới?

1. Kéo dài video tới tổng thời lượng 40 giây

Video extension là thay đổi quan trọng nhất của Gemini Omni 1.1 Flash. Model có thể phân tích tối đa 10 giây ngữ cảnh trước đó và tạo phần tiếp nối ở cuối clip. Mỗi lần mở rộng có thể thêm tối đa khoảng 10 giây, với tổng thời lượng tích lũy tối đa 40 giây.

Khả năng này hữu ích khi một cảnh ban đầu đã đúng nhân vật, ánh sáng và bố cục nhưng chưa đủ dài. Thay vì tạo lại từ đầu, developer có thể tiếp tục cảnh bằng prompt như “camera lùi dần và để lộ không gian phía sau” hoặc “nhân vật tiếp tục bước vào căn phòng”. Gemini Omni dùng phần cuối của video làm bối cảnh để duy trì chuyển động, nhân vật và âm thanh nhất quán hơn.

AI kéo dài phần cuối của cảnh video hiện có thành đoạn tiếp nối liền mạch

2. Đặt khung hình đầu và cuối để kiểm soát chuyển cảnh

Gemini Omni 1.1 Flash hỗ trợ first and last frame interpolation. Người dùng có thể cung cấp hai hình ảnh, một làm khung mở đầu và một làm khung kết thúc, rồi mô tả chuyển động mong muốn. Model sẽ tạo đoạn video nối hai trạng thái đó thành một chuyển cảnh liền mạch.

Cách làm này đặc biệt hữu ích khi cần kiểm soát điểm đến của cảnh quay. Thay vì chỉ prompt hướng chuyển động và chờ model tự quyết định khung cuối, creator có thể xác định trước cả điểm bắt đầu lẫn điểm kết thúc để giảm độ ngẫu nhiên trong workflow.

AI tạo chuyển động giữa khung hình đầu và khung hình cuối của một cảnh video

3. Dựng nháp 360p rồi upscale 1080p hoặc 4K

Bản 1.1 thêm tham số kiểm soát độ phân giải với các mức 360p, 720p, 1080p và 4K. 720p là mặc định. 360p phù hợp để thử concept nhanh và tiết kiệm chi phí trước khi chọn phiên bản tốt nhất để render ở độ phân giải cao hơn.

Một chi tiết cần phân biệt rõ: tài liệu Gemini API ghi 1080p và 4K là đầu ra được upscale. Vì vậy không nên mô tả Gemini Omni 1.1 Flash là model “tạo video native 4K”. Giá trị thực tế nằm ở việc tích hợp bước upscale trực tiếp vào workflow của model.

AI nâng bản video nháp thành đầu ra sắc nét và giàu chi tiết hơn

4. Chỉnh sửa video nhiều lượt bằng hội thoại

Gemini Omni sử dụng Interactions API để hỗ trợ chỉnh sửa theo nhiều lượt. Người dùng có thể tạo một clip, xem kết quả, rồi tiếp tục yêu cầu thay đổi một chi tiết cụ thể mà không cần xây dựng lại toàn bộ prompt từ đầu.

Đây là khác biệt quan trọng so với workflow text-to-video truyền thống. Với Omni, video trở thành một đối tượng có thể được tinh chỉnh từng bước. Google cho biết các lượt chỉnh sửa có thể thay đổi phong cách, hành động, camera angle, nhân vật hoặc đối tượng trong cảnh trong khi cố gắng giữ phần còn lại nhất quán.

Gemini Omni 1.1 Flash hỗ trợ những kiểu tạo video nào?

Gemini API hiện cho phép Gemini Omni 1.1 Flash thực hiện nhiều kiểu tác vụ video trong cùng một model.

Text-to-video: tạo video trực tiếp từ mô tả văn bản.

Image-to-video: dùng hình ảnh làm điểm xuất phát rồi tạo chuyển động.

Reference-to-video: kết hợp hình ảnh, video, âm thanh hoặc các tham chiếu khác để hướng dẫn đầu ra.

Edit: chỉnh sửa video bằng ngôn ngữ tự nhiên và tiếp tục tinh chỉnh qua nhiều lượt.

Extend: tạo phần tiếp nối ở cuối video hiện có.

Khả năng nhận nhiều loại input là lý do Google gọi Omni là hướng đi “create anything from any input”. Ví dụ, một workflow có thể bắt đầu bằng video thật, thêm một hình ảnh tham chiếu cho nhân vật mới, rồi dùng prompt văn bản để yêu cầu nhân vật xuất hiện trong phần cảnh được mở rộng.

Gemini Omni 1.1 Flash phù hợp với những công việc nào?

Gemini Omni 1.1 Flash phù hợp nhất với các quy trình cần tạo và lặp lại nhiều phiên bản video thay vì chỉ render một clip từ prompt duy nhất.

Creative tools: xây dựng ứng dụng cho phép người dùng tạo rồi chỉnh sửa video bằng hội thoại.

Marketing: tạo nhiều biến thể quảng cáo, đổi sản phẩm, nhân vật, bối cảnh hoặc tỷ lệ khung hình cho từng kênh.

Storyboard và pre-production: dựng nhanh concept ở 360p trước khi quyết định render bản chất lượng cao.

Video social: hỗ trợ cả tỷ lệ ngang 16:9 và dọc 9:16, phù hợp với nội dung mạng xã hội.

Video giải thích: kết hợp kiến thức của Gemini với hình ảnh, âm thanh và chuyển động để tạo cảnh minh họa theo một chủ đề cụ thể.

Nếu doanh nghiệp đang quan tâm đến hệ sinh thái Gemini rộng hơn, có thể xem thêm bài Gemini 3.5 Transcribe là gì? để hiểu hướng Google đang tách các khả năng multimodal thành những model chuyên biệt cho từng workflow.

Giá Gemini Omni 1.1 Flash bao nhiêu?

Theo bảng giá Gemini API tại thời điểm 31/08/2026, Gemini Omni 1.1 Flash chỉ có trên paid tier, không có free tier. Giá Standard là 1,50 USD cho mỗi 1 triệu input token, 9 USD cho mỗi 1 triệu output token dạng text và 17,50 USD cho mỗi 1 triệu output token dạng video.

Google tính video 720p ở mức 5.792 token mỗi giây. Với Standard pricing, chi phí hiệu dụng được Google quy đổi khoảng 0,10 USD cho mỗi giây video 720p. Một clip 10 giây vì vậy có chi phí đầu ra xấp xỉ 1 USD trước khi tính các phần input và những lượt thử lại.

Chi phí thực tế có thể cao hơn đáng kể khi một workflow tạo nhiều phiên bản, mở rộng cảnh nhiều lượt hoặc render lại để chọn kết quả tốt nhất. Tính năng 360p draft vì vậy có giá trị không chỉ về tốc độ mà còn giúp giảm chi phí thử nghiệm.

Những giới hạn cần biết trước khi dùng

Gemini Omni 1.1 Flash đã GA nhưng vẫn có các giới hạn quan trọng. Google DeepMind cho biết model vẫn có thể gặp khó khăn khi duy trì consistency hoàn toàn qua nhiều lần chỉnh sửa, xử lý cảnh có chuyển động phức tạp hoặc render văn bản thật chính xác.

Giới hạn video upload: video tải lên để edit hoặc extend hiện phải có thời lượng từ 10 giây trở xuống, trừ một số workflow mở rộng nhiều lượt với video do model tạo.

Vị trí mở rộng: video extension chỉ thêm nội dung ở cuối clip, không chèn vào đầu hoặc giữa video.

Âm thanh: API hiện không hỗ trợ voice editing và chưa hỗ trợ upload file âm thanh tham chiếu.

Khu vực: edit hoặc extend video upload hiện chưa khả dụng tại EEA, Thụy Sĩ và Vương quốc Anh.

Độ phân giải: 1080p và 4K là output qua upscaling, không phải native generation ở các độ phân giải đó.

Về safety, Google sử dụng production filters và SynthID cho nội dung do model tạo. Model có khả năng thay đổi lời nói của người trong video, nhưng Google cho biết đang hạn chế khả năng này trong khi tiếp tục nghiên cứu cách triển khai an toàn hơn.

Những giới hạn này cũng cho thấy vì sao đánh giá model video không nên chỉ dựa vào demo đẹp. Tương tự vấn đề được phân tích trong bài Benchmark contamination là gì?, chất lượng thực tế cần được kiểm tra bằng workflow, dữ liệu và tiêu chí phù hợp với nhu cầu sử dụng.

Gemini Omni 1.1 Flash khác gì bản preview?

Bản 1.1 là bước chuyển từ thử nghiệm sang sản phẩm dành cho developer. So với gemini-omni-flash-preview, bản GA bổ sung video extension, first/last-frame interpolation và kiểm soát độ phân giải 360p, 720p, 1080p, 4K. Google cũng dùng tên endpoint mới gemini-omni-1.1-flash và đã công bố lịch ngừng endpoint preview cũ.

Điểm quan trọng nhất không phải là số phiên bản “1.1”, mà là thay đổi về vị thế sản phẩm. Khi một model chuyển sang GA, developer có cơ sở tốt hơn để đưa nó vào sản phẩm thực tế thay vì chỉ thử nghiệm tính năng trong prototype.

Gemini Omni 1.1 Flash có đáng chú ý không?

Có, đặc biệt nếu nhìn Gemini Omni 1.1 Flash như một công cụ xây dựng workflow thay vì một model tạo clip đơn lẻ. Video extension, interpolation, conversational editing và cơ chế draft rồi upscale giúp quy trình tạo video AI tiến gần hơn tới cách creator làm việc: thử nhanh, chỉnh từng bước, khóa các điểm quan trọng và chỉ render chất lượng cao khi đã chọn được phương án.

Tuy vậy, “production-ready” không có nghĩa mọi cảnh đều sẵn sàng dùng ngay. Consistency, chuyển động phức tạp, text rendering và các giới hạn về video upload vẫn cần được kiểm tra trong từng use case. Với doanh nghiệp hoặc developer, cách tiếp cận hợp lý là đánh giá Gemini Omni trên chính loại nội dung mình sẽ sản xuất thay vì suy luận từ demo của nhà cung cấp.

Kết luận

Gemini Omni 1.1 Flash đánh dấu bước trưởng thành đáng kể của AI video trong hệ sinh thái Gemini. Google không chỉ tăng chất lượng đầu ra mà còn bổ sung các cơ chế kiểm soát cần thiết cho quá trình sản xuất: kéo dài cảnh, xác định khung đầu và cuối, chỉnh sửa nhiều lượt, dựng nháp 360p và upscale lên 1080p hoặc 4K.

Đối với creator, marketer và developer, giá trị lớn nhất của bản 1.1 là khả năng biến video generation thành một quá trình lặp có kiểm soát. Đây cũng là hướng phát triển đáng theo dõi khi các model generative media chuyển từ công cụ tạo nội dung một lần sang nền tảng có thể tích hợp sâu vào phần mềm và quy trình sản xuất.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày