Lyria 3.5 là gì? Google đưa AI tạo nhạc vào Gemini và Gemini API

Lyria 3.5 là model AI tạo nhạc mới của Google, hiện có trong Gemini app và Gemini API, hỗ trợ tạo nhạc từ text hoặc image với audio stereo 44.1 kHz, vocal và lyrics.

Chọn Bot.io.vn làm nguồn ưu tiên

Ngày 4/9/2026, Google đưa Lyria 3.5 vào Gemini app và mở quyền truy cập cho developer qua Gemini API. Đây là model tạo nhạc mới nhất của Google, tập trung vào chất lượng âm thanh, vocal tự nhiên hơn, cấu trúc bài hát mạch lạc hơn và khả năng điều khiển chi tiết bằng prompt.

Điểm đáng chú ý là Lyria 3.5 không chỉ tạo một đoạn nhạc nền ngắn. Ở bản Pro, model được thiết kế cho bài hát dài với verse, chorus và bridge; API còn hỗ trợ đầu vào bằng hình ảnh, lyrics theo ngôn ngữ của prompt và audio stereo 44.1 kHz.

Tóm tắt nhanh

Lyria 3.5 là family model AI tạo nhạc của Google, hiện có trong Gemini app, Gemini API, Google AI Studio, Flow Music và Google Vids.

Gemini API cung cấp hai hướng chính: Lyria 3.5 Clip cho đoạn 30 giây và Lyria 3.5 Pro cho bài hát dài vài phút với cấu trúc hoàn chỉnh.

Model hỗ trợ prompt text hoặc image, đầu ra MP3; bản Pro có thể yêu cầu WAV. Audio được tạo ở chất lượng stereo 44.1 kHz.

Google đang niêm yết API preview ở mức 0,04 USD cho Clip và 0,08 USD cho Pro mỗi request thành công.

Lyria 3.5 đã xuất hiện trong Flow Music từ cuối tháng 7; tin mới đầu tháng 9 là việc mở rộng mạnh sang Gemini và API, chứ không phải model lần đầu được công bố.

Lyria 3.5 là gì?

Lyria 3.5 là model tạo nhạc bằng AI của Google DeepMind. Theo model card, hệ thống nhận mô tả bằng văn bản và tạo ra audio âm nhạc; trong Gemini API, phiên bản hiện tại còn nhận được hình ảnh làm input và có thể trả về cả audio lẫn lyrics.

Google gọi Lyria 3.5 là model music generation mạnh nhất của hãng tại thời điểm hiện tại. Mục tiêu không chỉ là tạo âm thanh nghe được, mà là duy trì musical coherence: giai điệu, hòa âm, vocal, lời bài hát và cấu trúc cần liên kết với nhau xuyên suốt một track.

Lyria 3.5 đã ra mắt chưa?

Có, nhưng cần tách hai mốc. Google giới thiệu Lyria 3.5 trong Flow Music ngày 29/7/2026. Đến ngày 3–4/9/2026, Google đưa family Lyria 3.5 vào public preview của Gemini API và đồng thời mở model trong Gemini app cho người dùng toàn cầu.

Điểm mới của Lyria 3.5 so với thế hệ trước

Google nhấn mạnh bốn thay đổi: musicality tốt hơn, lyrics bám prompt hơn, vocal biểu cảm và phát âm tự nhiên hơn, cùng khả năng điều khiển tempo và thời lượng chính xác hơn. DeepMind cũng cho biết Lyria 3.5 cải thiện rõ so với Lyria 2 về audio fidelity và khả năng làm theo yêu cầu khi có lời hát.

Với creator, khác biệt này quan trọng hơn một con số benchmark đơn lẻ. Một model tạo nhạc hữu ích phải giữ được chủ đề và nhịp điệu qua nhiều đoạn, thay vì chỉ tạo vài giây đầu nghe ấn tượng rồi mất cấu trúc.

Lyria 3.5 có thể tạo bài hát dài đến đâu?

Trong API, Lyria 3.5 Clip tạo cố định đoạn nhạc 30 giây, phù hợp loop, preview hoặc nhạc nền ngắn. Lyria 3.5 Pro hướng tới full-length song dài vài phút và cho phép điều khiển thời lượng bằng prompt.

Tài liệu API mô tả Pro phù hợp với bài có nhiều verse, chorus và bridge. Vì vậy, khi cần một bài hát có cấu trúc hoàn chỉnh, Pro là lựa chọn phù hợp hơn Clip; còn Clip hữu ích khi cần thử ý tưởng nhanh hoặc tạo đoạn nhạc ngắn cho social/video.

Lyria 3.5 tạo nhạc từ text và hình ảnh như thế nào?

Developer có thể gửi prompt văn bản mô tả genre, mood, nhạc cụ, tempo, vocal, cấu trúc và nội dung lyrics. API cũng hỗ trợ input bằng hình ảnh, cho phép dùng một visual làm tín hiệu sáng tạo để định hướng phong cách hoặc cảm xúc của track.

Ví dụ, thay vì chỉ yêu cầu “tạo một bài synth-pop”, prompt có thể mô tả tempo khoảng 120 BPM, vocal nữ, intro bằng synth pad, chorus sáng hơn và outro giảm dần còn piano. Lyria 3.5 được thiết kế để bám những chỉ dẫn dạng cấu trúc như vậy.

Lyrics và vocal là phần Google cải thiện mạnh

Google cho biết Lyria 3.5 tạo lyrics chất lượng cao hơn, bám prompt tốt hơn và hiểu cấu trúc bài hát tốt hơn. Vocal cũng được cải thiện về độ biểu cảm, cảm xúc và phát âm.

Một chi tiết hữu ích với người dùng quốc tế là tài liệu Gemini API nói Lyria 3.5 tạo lyrics theo ngôn ngữ của prompt. Điều đó mở ra khả năng thử nghiệm bài hát đa ngôn ngữ, dù chất lượng thực tế vẫn có thể khác nhau theo ngôn ngữ, thể loại và độ khó của câu chữ.

Audio 44.1 kHz có ý nghĩa gì?

Lyria 3.5 tạo audio stereo 44.1 kHz, mức sample rate rất phổ biến trong phân phối nhạc số. Điều này không đồng nghĩa file AI tự động đạt chất lượng mastering chuyên nghiệp, nhưng nó giúp đầu ra thuận tiện hơn cho workflow dựng video, demo nhạc hoặc hậu kỳ.

Mặc định API trả MP3. Với Lyria 3.5 Pro, developer có thể yêu cầu WAV khi cần file ít nén hơn cho các bước chỉnh sửa tiếp theo.

Lyria 3.5 đang có ở đâu?

Gemini app

Từ 4/9, Google mở Lyria 3.5 cho người dùng Gemini app trên web và mobile toàn cầu. Giao diện cho phép chọn hoặc mô tả thể loại, chọn vocal hoặc instrumental, dùng template và chọn track ngắn hay dài.

Gemini API và Google AI Studio

Developer có thể dùng Lyria 3.5 qua Gemini API và thử trực tiếp trong Google AI Studio. Public preview hiện cung cấp model cho clip ngắn và full song, đồng thời hỗ trợ cả GenerateContent lẫn Interactions API.

Flow Music và Google Vids

Lyria 3.5 đã có trong Flow Music từ cuối tháng 7 cho workflow sáng tác nhạc bằng AI. Google cũng đưa model vào Google Vids, phù hợp các tình huống cần nhanh chóng tạo soundtrack hoặc nhạc nền riêng cho video.

Lyria 3.5 Clip và Lyria 3.5 Pro khác nhau thế nào?

Tiêu chíLyria 3.5 ClipLyria 3.5 Pro
Mục tiêuClip, loop, previewBài hát dài có cấu trúc
Thời lượng30 giâyVài phút, điều khiển bằng prompt
Đầu raMP3MP3, có thể yêu cầu WAV
Use caseThử ý tưởng, social, loopFull song, soundtrack, jingle dài
Giá API preview0,04 USD/request0,08 USD/request

Tên model và endpoint có thể thay đổi trong giai đoạn preview. Khi triển khai production, developer nên kiểm tra lại trang model và release notes thay vì hard-code giả định rằng preview ID sẽ tồn tại lâu dài.

Giá Lyria 3.5 API bao nhiêu?

Tại thời điểm 5/9/2026, trang pricing của Gemini Developer API niêm yết Lyria 3.5 Clip Preview ở mức 0,04 USD mỗi song/request và Lyria 3.5 Pro Preview ở mức 0,08 USD mỗi full song/request. Free tier không được liệt kê cho hai model preview này.

Cách tính theo request giúp việc ước lượng chi phí đơn giản hơn so với model tính theo token hoặc theo giây video. Tuy vậy, giá và rate limit của preview có thể thay đổi, nên sản phẩm thương mại cần đọc pricing hiện hành trước khi xây business model.

Lyria 3.5 có phải là Lyria RealTime không?

Không. Lyria 3.5 trong bài này là family tạo clip hoặc full song theo request. Nếu cần tạo và điều khiển nhạc theo thời gian thực, Google có một hướng riêng là Lyria RealTime. Hai sản phẩm phục vụ workflow khác nhau.

Lyria 3.5 khác Gemini Omni ở điểm nào?

Lyria 3.5 chuyên cho music generation. Gemini Omni 1.1 Flash trên Bot.io.vn lại tập trung vào video generation và video editing. Cả hai đều thuộc hệ sinh thái generative media của Google, nhưng một model sở hữu intent “tạo nhạc”, model còn lại sở hữu intent “tạo/chỉnh sửa video”.

Với một workflow marketing, hai model thậm chí có thể bổ sung nhau: Lyria tạo soundtrack hoặc jingle, còn Gemini Omni tạo visual/video. Vì vậy Bot.io.vn tách hai chủ đề thành hai URL thay vì gom chung.

Cách gọi Lyria 3.5 bằng Gemini API

Google cung cấp Lyria 3.5 qua Gemini API. Với Interactions API, developer gửi model ID và prompt, sau đó nhận audio. Một request REST tối giản có thể có dạng:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "lyria-3.5",
    "input": "A warm acoustic pop song with gentle vocals and a hopeful chorus"
  }'

Trong public preview, docs cũng liệt kê các model ID chuyên biệt như lyria-3.5-clip-preview và lyria-3.5-pro-preview. Đây là lý do developer nên kiểm tra docs tại thời điểm tích hợp, vì naming giữa endpoint mới và legacy GenerateContent có thể khác nhau.

Cách viết prompt cho Lyria 3.5 hiệu quả hơn

Prompt tốt nên mô tả ít nhất genre, mood, tempo, nhạc cụ chính, loại vocal và cấu trúc mong muốn. Nếu muốn instrumental, Google khuyến nghị nói rõ “instrumental only, no vocals” thay vì chỉ bỏ qua phần vocal.

Lyria 3.5 có watermark AI không?

Có. Google sử dụng SynthID để nhúng watermark vào nội dung âm thanh do các model Lyria tạo ra. Mục tiêu là giúp xác định nội dung được tạo bằng AI mà không làm thay đổi trải nghiệm nghe một cách rõ ràng.

Watermark không giải quyết toàn bộ vấn đề bản quyền hoặc quyền sử dụng thương mại. Creator và doanh nghiệp vẫn cần tuân thủ điều khoản của Google và tự đánh giá rủi ro liên quan tới thương hiệu, quyền tác giả, lời bài hát và nội dung đầu vào.

Những giới hạn cần nhớ trước khi dùng Lyria 3.5

Lyria 3.5 đang ở giai đoạn preview trên API, nên model ID, rate limit và đặc tính phục vụ có thể thay đổi. Chất lượng cũng không đồng đều với mọi genre, ngôn ngữ, loại vocal hoặc prompt phức tạp.

Model card của DeepMind cũng nhấn mạnh các chính sách về nội dung nguy hiểm, vi phạm quyền của người khác, misinformation và các trường hợp sử dụng bị cấm. Vì thế “tạo được nhạc” không có nghĩa mọi yêu cầu sáng tạo đều được hệ thống chấp nhận.

Lyria 3.5 đáng chú ý ở điểm nào với creator và doanh nghiệp?

Điểm đáng chú ý nhất là Google đang đưa music generation từ một công cụ thử nghiệm riêng vào các sản phẩm có lượng người dùng và developer lớn. Gemini app giúp người dùng phổ thông tạo track mà không cần code; Gemini API biến cùng capability đó thành một primitive để tích hợp vào sản phẩm.

Các use case dễ hình dung gồm nhạc nền video, jingle thương hiệu, soundtrack cho prototype game, ringtone cá nhân hóa, demo bài hát, loop cho social content hoặc tạo nhiều phương án âm nhạc trước khi producer chỉnh sửa thủ công.

Câu hỏi thường gặp về Lyria 3.5

Lyria 3.5 có dùng được trong Gemini không?

Có. Google thông báo Lyria 3.5 đã có trong Gemini app trên web và mobile cho người dùng toàn cầu từ 4/9/2026.

Lyria 3.5 có API không?

Có. Lyria 3.5 hiện có trong Gemini API và Google AI Studio. Public preview bao gồm hướng tạo clip 30 giây và hướng tạo full song.

Lyria 3.5 có tạo nhạc từ ảnh không?

Có trong Gemini API. Tài liệu Google xác nhận model nhận input text và image để tạo audio.

Lyria 3.5 có tạo lời bài hát không?

Có. Model hỗ trợ đầu ra lyrics, đồng thời Google cho biết Lyria 3.5 cải thiện prompt adherence và structural awareness của phần lời.

Lyria 3.5 có miễn phí không?

Trải nghiệm trong Gemini app phụ thuộc chính sách sản phẩm và hạn mức tài khoản. Với Gemini API, pricing hiện tại không liệt kê free tier cho Lyria 3.5 preview; Clip là 0,04 USD/request và Pro là 0,08 USD/request.

Lyria 3.5 có thay thế producer âm nhạc không?

Không nên hiểu như vậy. Model có thể tăng tốc việc tạo demo, ideation và soundtrack, nhưng quyết định nghệ thuật, arrangement cuối, mixing, mastering, quyền sử dụng và định hướng thương hiệu vẫn cần con người kiểm soát.

Điều cần theo dõi tiếp theo

Bước tiếp theo đáng theo dõi là khi nào các endpoint preview trở thành stable, rate limit được mở rộng ra sao, chất lượng lyrics ngoài tiếng Anh cải thiện đến mức nào và Lyria 3.5 được tích hợp sâu hơn vào workflow video, quảng cáo và công cụ sáng tạo của Google.

Sự kiện tháng 9 cho thấy Google không còn xem AI tạo nhạc như một demo độc lập. Khi cùng model xuất hiện trong Gemini app, AI Studio, API, Flow Music và Vids, music generation đang trở thành một phần tiêu chuẩn của hệ sinh thái generative media của hãng.

Nguồn tham khảo

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày