DeepSeek ra V4.1-Flash, giảm SSD cho KV cache còn 1/8 và chuẩn bị thay V4 Pro

DeepSeek phát hành V4.1-Flash, MoE 552B với 8B active khi prefill, 16B khi decode, KV cache dùng 1/4 HBM và 1/8 SSD so với V4-Flash.

Chọn Bot.io.vn làm nguồn ưu tiên

DeepSeek vừa phát hành DeepSeek-V4.1-Flash, model multimodal Mixture-of-Experts (MoE) mới hướng tới các workload đầu vào dài, AI Agent và coding. Điểm đáng chú ý không chỉ nằm ở quy mô 552B tham số, mà ở kiến trúc bất đối xứng cho phép model chỉ kích hoạt khoảng 8B tham số mỗi token khi prefill và 16B khi decode.

Theo thông báo chính thức của DeepSeek ngày 10/09/2026, V4.1-Flash đã có trên API với tên deepseek-flash, hỗ trợ multimodal native và sẽ dần thay V4 Pro. Với developer, thay đổi đáng quan tâm nhất là cách DeepSeek giảm mạnh chi phí lưu KV cache cho session dài.

DeepSeek V4.1-Flash ra mắt với kiến trúc Causal Encoder-Decoder

DeepSeek-V4.1-Flash dùng backbone MoE 552B và một kiến trúc mới có tên Causal Encoder-Decoder (CED). Model được tổ chức thành 40 lớp Transformer, gồm 20 lớp causal encoder nối với 20 lớp decoder.

Khác với decoder-only LLM truyền thống, CED tách rõ giai đoạn xử lý đầu vào và giai đoạn sinh đầu ra. Trong cấu hình DeepSeek công bố, phần encoder chỉ kích hoạt khoảng 8B tham số trên mỗi token đầu vào, trong khi decoder kích hoạt khoảng 16B tham số cho mỗi token được sinh.

Thiết kế bất đối xứng này đặc biệt phù hợp với các ứng dụng có input rất dài nhưng output tương đối ngắn: agent đọc repository lớn, phân tích tài liệu, xem nhiều ảnh hoặc duy trì lịch sử hội thoại dài. Chi phí không còn bị chi phối hoàn toàn bởi việc phải chạy một đường tính toán lớn giống nhau cho cả input và output.

Vì sao CED có thể giảm chi phí cho workload agent dài?

Trong một agentic workflow, phần prefill thường phải đọc lượng context lớn: system prompt, lịch sử hội thoại, tool result, file code, log và tài liệu. Nếu mỗi lượt đều phải kích hoạt cùng lượng tham số như lúc decode, chi phí đầu vào tăng nhanh khi session kéo dài.

CED cho phép DeepSeek dành đường tính toán nhẹ hơn cho input nhưng vẫn dùng decoder mạnh hơn khi cần tạo reasoning, code hoặc câu trả lời. Đây là một ví dụ rõ về xu hướng tối ưu kiến trúc theo đặc tính workload, thay vì chỉ tăng tổng tham số model.

Cách tiếp cận này có điểm tương đồng về mục tiêu với các model MoE hiệu quả như GLM-5.3-Flash: tổng quy mô model lớn nhưng lượng tham số thực sự tham gia trên mỗi token được kiểm soát. Tuy nhiên DeepSeek còn tách mức active parameters giữa prefill và decode.

KV cache là nút thắt mà DeepSeek đang cố giải quyết

KV cache lưu lại các key/value attention đã tính từ token trước để model không phải tính lại toàn bộ context ở mỗi bước sinh. Kỹ thuật này giúp inference nhanh hơn, nhưng với context hàng trăm nghìn hoặc hàng triệu token, KV cache có thể trở thành một phần đáng kể của HBM và storage.

Vấn đề càng rõ với AI Agent: session có thể chạy hàng giờ, liên tục thêm tool result và code diff vào context. Khi một nhà cung cấp muốn tái sử dụng cache giữa nhiều lượt gọi, lượng dữ liệu phải giữ trong bộ nhớ GPU hoặc SSD có thể ảnh hưởng trực tiếp đến throughput và giá API.

DeepSeek cho biết V4.1-Flash dùng nhiều kỹ thuật mới, trong đó có SWA Bounded Replay, Compressed Sparse Attention 2 (CSA2) và FP4 KV caching. Model card mô tả SWA Bounded Replay chỉ replay một cửa sổ token gần nhất để tái tạo trạng thái cần thiết, thay vì phải lưu toàn bộ phần SWA KV xuống SSD.

DeepSeek công bố KV cache dùng 1/4 HBM và 1/8 SSD so với V4-Flash

Theo số liệu của DeepSeek, KV cache của V4.1-Flash chỉ cần khoảng 1/4 lượng HBM và 1/8 lượng SSD so với DeepSeek-V4-Flash. Model card chính thức trên Hugging Face còn cho biết global KV cache đạt khoảng 890 byte mỗi token nhờ CSA2 và FP4 main KV caching.

Đây là điểm quan trọng hơn con số 552B nếu nhìn từ hạ tầng. Model có context 1M token chỉ thực sự hữu ích ở quy mô lớn khi nhà cung cấp kiểm soát được chi phí cache, băng thông và dung lượng lưu trữ cho những session dài.

Dù vậy, các tỷ lệ 1/4 và 1/8 là so sánh do chính DeepSeek công bố với thế hệ V4-Flash. Chúng không nên được hiểu thành việc mọi workload thực tế sẽ giảm giá hoặc tăng tốc đúng theo cùng tỷ lệ.

V4.1-Flash có context 1M token và multimodal native

DeepSeek-V4.1-Flash hỗ trợ context tối đa 1 triệu token, xử lý trực tiếp cả text và image rồi sinh text theo kiểu autoregressive. Với workload coding và agent, cửa sổ context lớn cho phép đưa nhiều file, lịch sử tool call và tài liệu vào một session hơn trước.

Multimodal native cũng khiến V4.1-Flash không chỉ là một coding LLM. Model có thể đọc screenshot, biểu đồ hoặc tài liệu có hình ảnh trong cùng pipeline. Đây là hướng mà nhiều model mới như MiniCPM5-2B và các VLM thế hệ mới đang đẩy mạnh, dù khác nhau rất xa về quy mô và mục tiêu triển khai.

Model card khuyến nghị context window 1M và cho phép điều chỉnh reasoning effort theo thang 1–100. DeepSeek cũng cung cấp reference implementation cho prompt encoding, tool calling, thinking mode và nội dung ảnh xen kẽ trong hội thoại.

DeepSeek bắt đầu thay V4-Flash và chuẩn bị route V4 Pro sang V4.1-Flash

V4.1-Flash hiện đã live trên DeepSeek API qua model name deepseek-flash. DeepSeek cho biết V4-Flash và V4-Flash-Vision-Exp đã được retire; các tên cũ tạm thời route sang V4.1-Flash để giữ tương thích.

Đáng chú ý hơn, từ 04:00 UTC ngày 14/09/2026, request gửi tới deepseek-v4-pro sẽ được route sang V4.1-Flash và tính theo mức giá của V4.1-Flash cho đến khi V4.1-Pro xuất hiện. Đây là một thay đổi vận hành, không chỉ là phát hành thêm một model tùy chọn.

DeepSeek cũng tiếp tục cơ chế giá giờ cao điểm/thấp điểm và nói giá off-peak bằng 50% peak. Với đội ngũ chạy batch job hoặc agent không cần phản hồi tức thì, lịch chạy vì vậy có thể trở thành một biến tối ưu chi phí bên cạnh việc chọn model.

Benchmark cho thấy gì và chưa cho thấy gì?

DeepSeek công bố nhiều benchmark cho reasoning, coding agent, long context và multimodal, đồng thời nói V4.1-Flash vượt một số flagship model trong bộ đánh giá của họ. Tuy nhiên đây vẫn là vendor-reported evaluation; kết quả phụ thuộc harness, reasoning effort, sampling và cách dựng task.

Điểm đáng chú ý là DeepSeek đã công khai thư mục evaluation để tái tạo một số kết quả DeepSWE. Việc cung cấp recipe và harness giúp bên thứ ba có cơ hội kiểm tra lại, nhưng chưa biến các con số công bố thành benchmark độc lập.

Khi đánh giá V4.1-Flash cho production, developer nên đo trên workload thật: tỷ lệ cache hit, token input/output, latency prefill, tốc độ decode, số lần tool call, khả năng sửa code đúng và tổng chi phí của cả session.

Open weights theo MIT nhưng triển khai local vẫn là bài toán hạ tầng lớn

Repository model được phát hành theo MIT License, cho phép cộng đồng nghiên cứu và triển khai theo điều khoản khá mở. DeepSeek cũng nói sẽ hỗ trợ hệ sinh thái inference và mở rộng lựa chọn deployment.

Tuy nhiên 552B backbone khiến đây không phải model “local AI” theo nghĩa chạy trên một workstation phổ thông. DeepSeek thậm chí dùng ví dụ triển khai lớn với khoảng 2.000 GPU và storage cluster. Open weights vì vậy không đồng nghĩa với chi phí self-host thấp.

V4.1-Flash cho thấy cuộc đua frontier model đang chuyển sang tối ưu hệ thống

Điểm đáng theo dõi ở DeepSeek-V4.1-Flash là sự dịch chuyển từ câu hỏi “model có bao nhiêu tham số?” sang “mỗi giai đoạn inference thực sự dùng bao nhiêu compute và cache?”. Với agent dài, kiến trúc prefill/decode bất đối xứng có thể quan trọng không kém chất lượng benchmark.

Xu hướng này cũng xuất hiện ở các hệ thống điều phối nhiều model như GitHub HydraFusion: thay vì dùng một cấu hình cố định cho mọi yêu cầu, hệ thống cố phân bổ compute theo phần việc cần thiết.

V4.1-Flash vì vậy đáng chú ý không chỉ vì là model mới của DeepSeek, mà vì nó biến KV cache, active parameters và sự khác biệt giữa prefill với decode thành các yếu tố thiết kế trung tâm. Hiệu quả thực tế sẽ cần được kiểm chứng thêm khi developer chạy các agent session dài trên API hoặc hạ tầng self-host.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày