H Company ra NeoMME, encoder multimodal dùng chung một Transformer cho ảnh và văn bản

NeoMME là family encoder 260M và 800M của H Company, xử lý text và raw image patches trong cùng một bidirectional Transformer cho retrieval và document AI.

Chọn Bot.io.vn làm nguồn ưu tiên

H Company vừa giới thiệu NeoMME, một family encoder multimodal-native và multilingual gồm hai phiên bản 260M và 800M tham số. Thay vì ghép một vision tower đã pretrain với một causal language model như nhiều VLM hiện nay, NeoMME đưa text token và raw image patches vào cùng một bidirectional Transformer.

Điểm này khiến NeoMME đáng chú ý không phải vì nó là một chatbot mới, mà vì nó nhắm tới lớp hạ tầng phía sau retrieval, document AI và Visual RAG. Model được thiết kế để biến text và hình ảnh thành representation phục vụ tìm kiếm, xếp hạng và downstream task, thay vì tự sinh câu trả lời như một generative VLM.

NeoMME vừa được công bố với điểm mới nào?

Theo paper NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference, family gồm bản 260M và 800M, đều xử lý multilingual text và raw image patches trong một shared bidirectional Transformer encoder.

Hai model được pretrain từ đầu, không dựa vào một pretrained vision tower hay causal decoder riêng. Text token và image patch đi qua các projection tương ứng để vào cùng hidden space, sau đó chia sẻ toàn bộ Transformer layers.

Các checkpoint nền tảng và phiên bản phục vụ retrieval được phát hành trên Hugging Face theo Apache 2.0, đồng thời NeoMME đã được đóng góp vào thư viện Hugging Face Transformers. Đây là điểm thuận lợi nếu developer muốn thử nghiệm trực tiếp thay vì phải dựng một implementation riêng.

NeoMME là encoder, không phải một chatbot hay VLM sinh văn bản

Encoder và generative model giải quyết hai loại bài toán khác nhau. Một generative VLM thường nhận ảnh và text rồi sinh token tiếp theo để trả lời câu hỏi, mô tả ảnh hoặc thực hiện tác vụ agentic. Encoder lại tập trung vào việc tạo representation có thể dùng cho classification, similarity, retrieval hoặc ranking.

Vì vậy, NeoMME không nên được đánh giá bằng câu hỏi “nó trả lời hay hơn model X không”. Với backbone encoder, câu hỏi đúng hơn là representation có tốt cho downstream task không, inference có nhanh không, storage embedding có hợp lý không và việc fine-tune có hiệu quả không.

Trong một hệ thống Visual RAG, NeoMME có thể đóng vai trò tìm ra những trang tài liệu phù hợp nhất với câu hỏi. Một VLM hoặc LLM khác sau đó mới đọc các trang được retrieve và tạo câu trả lời cuối cùng.

Single-tower multimodal architecture khác gì cách ghép vision tower với LLM?

Nhiều VLM hiện đại dùng một visual encoder riêng để xử lý ảnh, sau đó project visual features sang không gian của causal language model. Cách này tận dụng tốt các thành phần pretrained, nhưng nó cũng mang theo compute và parameter overhead của hai pipeline khác nhau, đặc biệt khi downstream task chỉ cần embedding thay vì generation.

NeoMME chọn hướng single-tower. Mỗi ảnh được chuyển thành các patch RGB không chồng lấp kích thước 32×32 pixel. Các patch được projection trực tiếp vào model width rồi đi qua cùng các bidirectional Transformer layer với text token.

Theo paper, sharing Transformer giúp text và image đi qua cùng một computational path, đồng thời đơn giản hóa vòng đời model: cùng một backbone có thể được pretrain, fine-tune, parallelize và serve cho nhiều loại input mà không cần duy trì hai tower có kiến trúc khác nhau.

Context 16.384 token của NeoMME dùng cho ảnh như thế nào?

Cả NeoMME-260M và NeoMME-800M hỗ trợ context tối đa 16.384 token. Với patch 32×32, nhóm tác giả cho biết mức context này đủ để encode tối đa hai ảnh 4K UHD tiêu chuẩn trong cấu hình được mô tả trong paper.

Image pipeline giữ aspect ratio và dùng dynamic resolution. Trong quá trình training, giới hạn cạnh dài được lấy mẫu trong khoảng 1.024–2.048 pixel để model không phụ thuộc vào một kích thước ảnh cố định. Đây là yếu tố quan trọng với document AI vì trang tài liệu có thể rất khác nhau về tỷ lệ và độ phân giải.

Để giảm chi phí attention ở context dài, phần lớn layer dùng symmetric sliding-window attention, xen kẽ các global-attention layer. Mục tiêu là giữ khả năng xử lý input dài mà không phải trả toàn bộ chi phí quadratic attention ở mọi layer.

Masked discrete diffusion được dùng để pretrain text ra sao?

NeoMME được pretrain với một masked discrete-diffusion text objective. Thay vì causal next-token prediction như LLM autoregressive, model học khôi phục text bị mask theo một quá trình nhiễu rời rạc. Với multimodal example, việc khôi phục text được conditioning trên các image patch nhìn thấy.

Cách pretrain này phù hợp với bản chất bidirectional encoder: model có thể dùng ngữ cảnh từ cả hai phía của một token thay vì chỉ nhìn phần prefix. Paper đặt NeoMME trong dòng phát triển từ BERT-style masked encoder tới masked diffusion cho representation learning.

Điểm cần phân biệt là dùng diffusion objective không biến NeoMME thành một image diffusion generator. Ở đây diffusion được áp dụng cho masked text pretraining để học representation, còn downstream focus của bản công bố là retrieval và embedding.

NeoMME-Retriever dùng dense và late-interaction retrieval như thế nào?

Để kiểm tra khả năng downstream, nhóm tác giả fine-tune backbone thành NeoMME-Retriever với cả dense head và late-interaction head. Một forward pass có thể tạo single-vector representation cho dense retrieval hoặc multi-vector representation cho late interaction.

Dense retrieval nén mỗi query hoặc document thành một vector cố định rồi tính similarity. Cách này đơn giản, tiết kiệm storage và thường có latency tốt. Late interaction giữ nhiều vector ở mức token hoặc patch, nhờ đó representation chi tiết hơn nhưng chi phí lưu trữ và scoring cao hơn.

Trong visual document retrieval, late interaction có thể hữu ích vì một trang PDF chứa nhiều vùng thông tin khác nhau như tiêu đề, bảng, biểu đồ, chú thích và đoạn văn. Giữ nhiều vector giúp truy vấn có cơ hội match chính xác với một vùng cụ thể thay vì ép toàn bộ trang vào một embedding duy nhất.

Benchmark của NeoMME cho thấy gì?

Trên ViDoRe v3, paper báo NeoMME-Retriever 260M đạt 0,523 nDCG@10, còn bản 800M đạt 0,556. Theo nhóm tác giả, bản 260M vượt các model được đánh giá có quy mô dưới 800M trong bảng so sánh của họ.

Về throughput indexing, NeoMME-260M được báo cáo encode ảnh trang 2048×2048 ở mức 51,3 trang/giây trên NVIDIA L40S, tương đương khoảng 1,97 lần throughput của ColModernVBERT trong cấu hình so sánh cùng kích thước input.

Nhóm cũng kết hợp hierarchical token pooling và asymmetric quantization để nén late-interaction embedding từ khoảng 1,5 MB xuống khoảng 6 kB mỗi document trong thiết lập ViDoRe v3, tức khoảng 255 lần, đồng thời giữ hơn 95% baseline nDCG@10.

Các con số trên đều là kết quả do tác giả báo cáo trong paper và official blog, không phải benchmark độc lập của bên thứ ba. Vì vậy chúng nên được dùng để hiểu trade-off mà kiến trúc hướng tới, không nên xem là bằng chứng NeoMME luôn tốt hơn mọi retriever trong workload thực tế.

NeoMME có ý nghĩa gì với Visual RAG và document AI?

Visual document retrieval giải quyết một vấn đề mà text-only RAG thường gặp: khi tài liệu chứa bảng, sơ đồ, bố cục nhiều cột, hình minh họa hoặc typography mang ý nghĩa, OCR và text extraction có thể làm mất một phần bằng chứng. Thay vì chỉ index text đã trích xuất, hệ thống có thể embed trực tiếp ảnh của từng trang.

Trong workflow này, query được encode rồi so khớp với các page embedding. Những trang liên quan nhất được chuyển tiếp cho một VLM để trả lời. NeoMME nhắm tới chính lớp retrieval đó, nơi tốc độ encode, kích thước embedding và khả năng giữ chi tiết thị giác có ảnh hưởng trực tiếp tới chi phí hệ thống.

Với doanh nghiệp có nhiều PDF, slide, report, manual hoặc tài liệu scan, một encoder nhỏ hơn nhưng vẫn xử lý trực tiếp layout và image có thể giúp giảm chi phí indexing. Tuy nhiên hiệu quả thực tế còn phụ thuộc ngôn ngữ, loại tài liệu, độ phân giải, query distribution và cách xây retrieval pipeline.

NeoMME khác các model multimodal tổng quát trên Bot.io.vn ra sao?

So với GLM-5.3-Flash, NeoMME nằm ở một tầng khác. GLM-5.3-Flash là model multimodal lớn hướng tới reasoning, coding và agentic workload; NeoMME chỉ có 260M–800M tham số và ưu tiên representation, retrieval và fine-tuning hiệu quả.

So với MiniCPM5-2B, NeoMME cũng không cạnh tranh trực tiếp. MiniCPM5-2B là generative model nhỏ cho local AI, tool use và coding agent, còn NeoMME là encoder backbone dùng cho embedding và downstream retrieval.

Với Agentic Video Understanding, điểm giao nhau nằm ở multimodal perception. Tuy vậy NeoMME tập trung vào retrieval representation, không chủ động lập kế hoạch xem video hoặc gọi công cụ để phân tích như một agent.

Những giới hạn cần lưu ý trước khi chọn NeoMME

Thứ nhất, backbone NeoMME không phải model trả lời câu hỏi hoàn chỉnh. Muốn dùng cho RAG, bạn vẫn cần retrieval pipeline, index, scoring và một generative model downstream nếu mục tiêu cuối là tạo câu trả lời.

Thứ hai, benchmark công bố chủ yếu xoay quanh retrieval và đặc biệt là visual document retrieval. Kết quả tốt trên ViDoRe không tự động đảm bảo model sẽ tốt cho mọi dạng image search, semantic search hoặc domain chuyên biệt.

Thứ ba, single-tower giúp hợp nhất compute path nhưng không có nghĩa đây luôn là kiến trúc tối ưu. Dual-tower vẫn có lợi thế trong nhiều hệ thống vì có thể precompute image embedding độc lập, scale từng modality riêng hoặc tận dụng các vision encoder đã được pretrain rất mạnh.

NeoMME cho thấy encoder vẫn có vai trò riêng trong kỷ nguyên generative AI

Sự phổ biến của LLM và VLM khiến nhiều hệ thống lấy generative backbone rồi chuyển đổi thành encoder cho mọi tác vụ. NeoMME đi theo hướng ngược lại: xây một native bidirectional encoder nhỏ hơn ngay từ đầu cho representation và retrieval.

Nếu các kết quả về throughput và compression tiếp tục được xác nhận trong workload thực, hướng này có thể hấp dẫn với các hệ thống Visual RAG quy mô lớn, nơi chi phí index hàng triệu trang tài liệu đôi khi quan trọng không kém chất lượng của generative model ở bước cuối.

Kết luận: NeoMME tối ưu cho lớp retrieval, không cố trở thành một LLM thu nhỏ

Điểm mạnh về ý tưởng của NeoMME là sự rõ ràng về vai trò. Model dùng một shared bidirectional Transformer cho text và raw image patches, có hai quy mô 260M và 800M, hỗ trợ context 16.384 token và được fine-tune cho dense lẫn late-interaction retrieval.

Thay vì chạy theo khả năng sinh văn bản, NeoMME đặt trọng tâm vào embedding, indexing throughput và storage efficiency. Với document AI và Visual RAG, đây là một hướng đáng theo dõi vì nó cho thấy multimodal AI không nhất thiết phải lớn hoặc generative mới tạo ra giá trị thực tế.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày