Z.ai công bố chi tiết GLM-5.3-Flash, model multimodal 320B chỉ kích hoạt 18B tham số

Z.ai công bố thêm chi tiết kỹ thuật về GLM-5.3-Flash: model multimodal 320B tham số nhưng chỉ kích hoạt 18B mỗi token, dùng kiến trúc sparse + linear attention và open weights MIT.

Chọn Bot.io.vn làm nguồn ưu tiên

Cập nhật 08/09/2026: Z.ai vừa công bố thêm một loạt chi tiết kỹ thuật về GLM-5.3-Flash, model multimodal thuộc dòng GLM-5 có 320 tỷ tham số tổng nhưng chỉ kích hoạt khoảng 18 tỷ tham số cho mỗi token. Điểm mới hôm nay nằm ở phần kiến trúc, dữ liệu huấn luyện và cách Z.ai thử nghiệm model dưới tên ẩn danh Ox Alpha trước khi công khai.

Có một mốc thời gian cần làm rõ: GLM-5.3-Flash không phải model mới ra mắt ngày 8/9. Changelog của ZCode cho thấy model đã được đưa vào sản phẩm từ ngày 26/08/2026. Bài kỹ thuật mới của AutoClaw thuộc Z.ai ngày 8/9 bổ sung bức tranh chi tiết hơn về cách model được xây dựng và vì sao Z.ai định vị Flash cho coding, tác vụ agentic dài và xử lý đa phương thức.

Z.ai công bố thêm gì về GLM-5.3-Flash ngày 8/9?

Thông tin đáng chú ý nhất là cấu hình 320B total / 18B active. GLM-5.3-Flash là một model Mixture-of-Experts: tổng số tham số rất lớn, nhưng tại mỗi bước suy luận chỉ một phần nhỏ mạng được kích hoạt. Cách thiết kế này nhắm tới việc giữ năng lực của một model lớn trong khi giảm lượng compute thực sự phải sử dụng cho từng token.

Z.ai cũng xác nhận đây là model natively multimodal đầu tiên trong dòng GLM-5. Model được thiết kế để tiếp nhận không chỉ văn bản mà cả dữ liệu hình ảnh trong cùng kiến trúc, thay vì ghép thêm một lớp xử lý thị giác tách rời ở phía ngoài.

Theo bài công bố ngày 8/9, GLM-5.3-Flash được huấn luyện từ một base model mới trên corpus multimodal khoảng 30 nghìn tỷ token. Z.ai nói họ thiết kế lại cả kiến trúc lẫn training recipe để ưu tiên hai mục tiêu: giữ năng lực cao trên coding và agentic workflow, đồng thời giảm chi phí suy luận khi context kéo dài.

320B tham số nhưng chỉ 18B active có ý nghĩa gì?

Con số 18B active dễ gây hiểu nhầm nếu chỉ nhìn lướt qua. Nó không có nghĩa checkpoint của GLM-5.3-Flash nhỏ tương đương một model 18B. Model vẫn chứa hàng trăm tỷ tham số và bản weights chính thức trên Hugging Face được ghi nhận ở quy mô khoảng 321B tham số.

“18B active” mô tả lượng tham số được router chọn để tham gia tính toán cho mỗi token trong kiến trúc MoE. Vì vậy, lợi ích chủ yếu nằm ở chi phí compute khi chạy inference; yêu cầu bộ nhớ để self-host vẫn phụ thuộc vào toàn bộ checkpoint, precision, KV cache và cách phân phối model trên phần cứng.

Với developer, đây là điểm khác biệt quan trọng. GLM-5.3-Flash có thể hoạt động hiệu quả hơn một dense model có quy mô tương tự về tổng tham số, nhưng không nên hiểu “18B active” thành “có thể chạy nhẹ nhàng trên một GPU phổ thông”.

Kiến trúc mới kết hợp sparse attention và linear attention

Z.ai cho biết GLM-5.3-Flash là lần đầu tiên dòng GLM sử dụng kiến trúc attention lai giữa sparse attention và linear attention. Mục tiêu là giảm chi phí xử lý context dài mà vẫn giữ khả năng truy xuất thông tin chính xác trong chuỗi dữ liệu lớn.

Sparse attention giúp model không phải so sánh mọi token với toàn bộ token còn lại ở mọi lớp. Linear attention lại hướng tới giảm tốc độ tăng chi phí tính toán khi context dài hơn. Việc kết hợp hai hướng tiếp cận cho phép kiến trúc phân bổ compute khác nhau theo từng lớp hoặc từng kiểu biểu diễn.

Bài kỹ thuật mới còn nhắc tới Manifold-Constrained Hyper-Connections, một cơ chế Z.ai dùng để cải thiện hiệu quả scaling. Đây là chi tiết kỹ thuật đáng chú ý, nhưng hiện các tuyên bố về hiệu quả vẫn chủ yếu đến từ đội ngũ phát triển model; chưa nên coi đó là bằng chứng độc lập rằng kiến trúc này tốt hơn mọi thiết kế attention khác.

GLM-5.3-Flash có context 1 triệu token và open weights MIT

Model card chính thức trên Hugging Face cho thấy GLM-5.3-Flash có context ở mức 1 triệu token và được phát hành dưới giấy phép MIT. Đây là một điểm khác biệt lớn với nhiều frontier model chỉ cung cấp qua API hoặc có giấy phép open-weight hạn chế hơn.

Z.ai cũng cung cấp hướng triển khai qua nhiều framework quen thuộc như SGLang, vLLM, Transformers, KTransformers và Unsloth. Điều đó giúp các đội hạ tầng có nhiều lựa chọn hơn nếu muốn benchmark hoặc self-host model trên cụm GPU/NPU phù hợp.

Tuy vậy, open weights không đồng nghĩa với triển khai rẻ. Với checkpoint trên 300B tham số, self-host ở precision cao vẫn là bài toán hạ tầng nghiêm túc. Các bản quantization có thể giảm footprint, nhưng đổi lại cần kiểm tra tác động tới chất lượng, tốc độ và độ ổn định của tool use.

Ox Alpha là bước thử nghiệm ẩn danh trước khi GLM-5.3-Flash được công khai

Một chi tiết thú vị trong công bố mới là Z.ai xác nhận đã đưa GLM-5.3-Flash ra traffic thực dưới tên ẩn danh Ox Alpha trước khi công khai danh tính model. Cách làm này cho phép đội phát triển quan sát hành vi người dùng mà giảm bớt ảnh hưởng từ thương hiệu hoặc kỳ vọng về một model cụ thể.

Theo Z.ai, toàn bộ traffic của giai đoạn thử nghiệm này được phục vụ trên các bộ tăng tốc AI của Trung Quốc. Đây là một tuyên bố quan trọng về năng lực triển khai, nhưng bài công bố không cung cấp đủ dữ liệu độc lập để so sánh trực tiếp throughput hoặc hiệu suất năng lượng với các cụm GPU khác.

Về mặt đánh giá sản phẩm, stealth test có giá trị vì model phải đối mặt với prompt và workflow thật thay vì chỉ benchmark được chuẩn hóa. Tuy nhiên, kết quả từ traffic thật cũng khó tái lập nếu không có bộ dữ liệu, routing policy và cấu hình serving đầy đủ.

Benchmark của GLM-5.3-Flash nói lên điều gì?

Model card của Z.ai công bố một số kết quả đáng chú ý: 84,3 điểm trên Terminal-Bench 2.1, 63,4 trên DeepSWE và 55,3 trên Humanity’s Last Exam khi dùng tools. Hugging Face đã đưa ba kết quả này vào metadata evaluation của model.

Các con số cần được đọc đúng bối cảnh. DeepSWE được Z.ai chạy với mini-swe-agent và context 400K; HLE dùng tool đầy đủ, chiến lược quản lý context 300K và một model khác làm judge. Vì vậy, không nên so trực tiếp các con số này với một leaderboard dùng harness hoặc điều kiện khác.

Z.ai còn tuyên bố GLM-5.3-Flash vượt GLM-5.2 trên nhiều benchmark và workload thực tế với chi phí thấp hơn đáng kể. Đây vẫn là vendor-reported claim; trước khi chọn model cho production, developer nên benchmark lại trên repository, toolchain và loại prompt của chính mình.

GLM-5.3-Flash khác GLM-5.3 bản đầy đủ ở đâu?

Hai tên gọi dễ khiến người dùng nghĩ Flash chỉ là một endpoint nhanh hơn của cùng model, nhưng thực tế Z.ai mô tả chúng như hai model có mục tiêu khác nhau. GLM-5.3 bản đầy đủ nhắm tới năng lực tối đa cho coding và long-horizon agentic engineering; GLM-5.3-Flash ưu tiên hiệu quả inference và bổ sung multimodal native.

GLM-5.3-Flash cũng không đơn giản là một bản quantized của GLM-5.3. Bài ngày 8/9 nói model bắt đầu từ một base model mới và có kiến trúc/training recipe được thiết kế riêng. Vì thế developer nên xem đây là một lựa chọn riêng trong family GLM thay vì coi “Flash” chỉ là chế độ tốc độ.

Vì sao model này đáng chú ý với AI coding và agent?

Coding agent thường phải giữ context lớn, đọc nhiều file, gọi tool nhiều vòng và xử lý cả ảnh chụp màn hình hoặc tài liệu kỹ thuật. Cấu hình 1M context, multimodal native và kiến trúc tối ưu cho inference dài khiến GLM-5.3-Flash phù hợp về mặt thiết kế với loại workload này.

Đây cũng là lý do GLM-5.3-Flash nên được nhìn cùng xu hướng mà Bot.io.vn đã theo dõi ở Project HydraFusion của GitHub: năng lực coding ngày càng phụ thuộc vào cả model, orchestration, tool use và chi phí chạy nhiều bước chứ không chỉ một điểm benchmark.

So với Qwen3.8-Max-0902, GLM-5.3-Flash nhấn mạnh hiệu quả MoE và multimodal native. Còn Muse Spark 1.3 của Meta tập trung nhiều hơn vào giảm tool call và token trong workflow agentic. Ba hướng đi khác nhau cho thấy cạnh tranh model đang chuyển dần từ “ai có benchmark cao nhất” sang “ai giải quyết workload thật hiệu quả hơn”.

Những điểm chưa nên kết luận quá sớm

Thứ nhất, phần lớn benchmark và so sánh hiệu quả hiện tại đến từ Z.ai. Kết quả độc lập trên repository thực, workload doanh nghiệp và các agent framework khác vẫn cần thêm thời gian để tích lũy.

Thứ hai, 18B active không phản ánh đầy đủ chi phí phần cứng. Một hệ thống production còn chịu ảnh hưởng của kích thước weights, KV cache, batching, quantization, interconnect và độ trễ khi expert được phân phối qua nhiều accelerator.

Thứ ba, context 1M token không có nghĩa model sẽ duy trì chất lượng đồng đều ở mọi vị trí trong một prompt dài 1M token. Context capacity và khả năng sử dụng context hiệu quả là hai khái niệm khác nhau; các workload dài nên được kiểm tra bằng dữ liệu thật.

Cuối cùng, thông tin giá API thay đổi khá nhanh quanh các đợt launch. Vì tài liệu pricing công khai có thể cập nhật khác thời điểm, bài này không dùng một mức giá cứng làm luận điểm chính; developer nên kiểm tra bảng giá Z.ai tại thời điểm triển khai.

Điểm đáng theo dõi tiếp theo

GLM-5.3-Flash đáng chú ý không chỉ vì con số 320B/18B. Nó cho thấy một hướng phát triển frontier model ngày càng rõ: mở rộng tổng năng lực của mạng nhưng kiểm soát lượng compute được kích hoạt, đồng thời đưa multimodal và context dài vào cùng một kiến trúc phục vụ agent.

Nếu các benchmark độc lập xác nhận model giữ được chất lượng coding và tool use trong khi chi phí inference thấp, GLM-5.3-Flash có thể trở thành một lựa chọn đáng thử cho đội ngũ muốn triển khai agent với open weights. Nếu không, giá trị lớn nhất của model vẫn nằm ở việc cung cấp thêm một kiến trúc thực tế để cộng đồng kiểm chứng.

Với mốc ngày 8/9, điều quan trọng nhất không phải “Z.ai vừa ra một model mới”, mà là Z.ai vừa công bố rõ hơn cách GLM-5.3-Flash được xây dựng và thử nghiệm. Model đã xuất hiện từ cuối tháng 8; thông tin mới hôm nay giúp developer hiểu rõ hơn vì sao Z.ai chọn cấu hình 320B tổng, 18B active và attention lai cho một model multimodal hướng tới agent.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày