NVIDIA PAIR là gì? Biến nhiều PC trong nhà thành cụm AI cho multi-agent

NVIDIA PAIR là router inference mã nguồn mở giúp phân phối các request Ollama và LM Studio giữa nhiều máy trong cùng mạng local, phù hợp với workload multi-agent và local AI.

Chọn Bot.io.vn làm nguồn ưu tiên

Ngày 3/9/2026, NVIDIA công bố Personal AI Router (PAIR), một dự án mã nguồn mở giúp phân phối các yêu cầu suy luận AI giữa nhiều máy tính trong cùng mạng nội bộ. Thay vì để một PC xử lý tuần tự toàn bộ công việc của nhiều AI Agent, PAIR chọn một máy phù hợp cho từng request độc lập rồi chuyển request đó tới Ollama hoặc LM Studio đang chạy trên máy được chọn.

Điểm quan trọng nhất cần hiểu ngay từ đầu: PAIR không biến nhiều GPU thành một GPU lớn. Nó không gộp VRAM, không shard một model qua nhiều máy và không chia một request đang chạy giữa các node. Giá trị của PAIR nằm ở routing và load balancing cho nhiều request độc lập — đúng kiểu workload thường xuất hiện khi một agent chính gọi nhiều subagent cùng lúc.

Tóm tắt nhanh

NVIDIA PAIR là gì? Một local inference router mã nguồn mở, đưa nhiều máy trong cùng LAN vào một cụm routing để chia các request AI độc lập.

PAIR hiện hỗ trợ Ollama và LM Studio, đồng thời cung cấp proxy tương thích Ollama và OpenAI API để ứng dụng hiện có không phải thay đổi agent harness.

NVIDIA cho biết PAIR chạy trên Windows, Linux và macOS, có thể phối hợp các máy dùng GeForce RTX 20 Series trở lên, RTX PRO, DGX Spark và Apple M4+ tùy engine/model.

Trong demo năm subagent của NVIDIA, workload mất trung bình 18 phút trên một RTX Spark laptop và 8 phút 48 giây trên cụm ba thiết bị. Đây là demo theo cấu hình, không phải benchmark phổ quát hay cam kết tăng tốc tuyến tính.

PAIR là dự án Apache 2.0. Pairing dùng discovery trong LAN và PIN để bootstrap trust; traffic giữa các node đã pair được thiết kế dùng mutual TLS.

NVIDIA PAIR là gì?

NVIDIA PAIR (Personal AI Router) là một lớp routing cho local AI inference. Bạn cài PAIR trên các máy muốn đóng góp tài nguyên, pair chúng thành cluster, sau đó trỏ ứng dụng AI vào endpoint local của PAIR. Từ góc nhìn ứng dụng, endpoint đó vẫn giống API quen thuộc; PAIR đứng giữa để quyết định máy nào thực sự chạy request.

Repo chính thức mô tả PAIR là router dành cho một nhóm máy tương thích trong cùng mạng. Nó khám phá node, theo dõi inference engine và model đang có trên từng máy, rồi chuyển request tới node đủ điều kiện dựa trên model availability và workload hiện tại. Vì vậy, PAIR gần với một traffic controller cho local inference hơn là một hệ thống distributed training hay distributed tensor parallelism.

PAIR đã phát hành chưa?

Có. NVIDIA công bố PAIR ngày 3/9/2026 và mở source code trên GitHub. Repo có installer/build hướng dẫn cho Windows, Linux và macOS, cùng desktop app và terminal interface cho máy headless. Đây không chỉ là research concept; người dùng có thể tải release hoặc build từ source.

Vấn đề PAIR muốn giải quyết: nhiều AI Agent nhưng chỉ có một hàng đợi inference

Một workflow multi-agent thường không tạo ra một request khổng lồ. Agent điều phối có thể chia nhiệm vụ thành nhiều phần rồi gọi nhiều subagent chuyên trách: một agent đọc tài liệu, một agent kiểm tra số liệu, một agent viết code, một agent tổng hợp. Nếu tất cả request cùng đổ vào một inference engine trên một máy, chúng dễ phải xếp hàng dù trong nhà hoặc văn phòng vẫn còn các GPU khác đang nhàn rỗi.

Đây cũng là lý do PAIR hợp với hướng Persistent AI Agent: khi agent làm việc lâu hơn và có nhiều nhánh song song, bottleneck không chỉ nằm ở độ thông minh của model mà còn ở khả năng cấp inference capacity đúng lúc.

PAIR không thay agent framework. Agent vẫn chịu trách nhiệm phân rã nhiệm vụ, gọi subagent và tổng hợp kết quả. PAIR chỉ xử lý lớp hạ tầng: request nào nên chạy ở node nào.

PAIR hoạt động như thế nào?

Luồng cơ bản có thể hình dung theo bốn bước: ứng dụng gửi request tới local proxy của PAIR; proxy xác định những node nào thực sự có engine và model cần dùng; scheduler cung cấp thứ tự ưu tiên theo workload/GPU pressure; request được chuyển tới một node đủ điều kiện để inference.

1. Các máy tìm thấy nhau trong mạng local

PAIR hỗ trợ khám phá node trong LAN và cũng cho phép thêm máy bằng địa chỉ IP khi discovery không tìm thấy. Tài liệu kỹ thuật cho biết hệ thống dùng mDNS cho discovery. Tuy nhiên, discovery không đồng nghĩa với trust: thấy một máy trong mạng không tự động cho máy đó tham gia cluster.

2. Pairing tạo quan hệ tin cậy giữa các node

Khi pair hai máy, PAIR dùng lời mời và mã PIN sáu chữ số để bootstrap quá trình. Sau khi pairing hoàn tất, traffic cluster giữa các thành viên được thiết kế chạy qua mutual TLS. NVIDIA nhấn mạnh PIN chỉ là mã bootstrap ngắn hạn, vì vậy chỉ nên pair khi bạn tin tưởng cả máy lẫn mạng đang sử dụng.

3. Proxy lọc node theo model và engine

Một node chỉ đủ điều kiện xử lý request khi nó đang reachable, có inference engine tương thích đang chạy và inventory của engine cho biết model được yêu cầu có mặt trên node đó. Nếu model chỉ nằm trên một máy, request cho model đó vẫn buộc phải đi về máy ấy; PAIR không thể tự tạo thêm bản sao model hay mượn VRAM từ node khác.

4. Scheduler xếp hạng node theo tải

Scheduler hiện kết hợp số workload đang queued/running với một tín hiệu GPU pressure đã làm mượt. Sau đó proxy áp dụng thứ tự này cho tập node có khả năng phục vụ đúng model. Cách tách hai lớp rất quan trọng: model availability là cổng năng lực, còn scheduler quyết định thứ tự trong những node đủ năng lực.

PAIR còn có cơ chế reservation cục bộ để các request đến dồn dập không cùng nhìn thấy một node “đang rảnh” rồi tất cả lao vào node đó trước khi telemetry kịp cập nhật. Đây là chi tiết nhỏ nhưng phù hợp với workload multi-agent có burst concurrency.

PAIR không gộp VRAM và cũng không chia một model qua nhiều máy

Đây là điểm dễ bị hiểu sai nhất khi nghe cụm “biến nhiều PC thành cụm AI”. PAIR tạo một cụm routing, không tạo một GPU logic khổng lồ.

Không pool VRAM: bộ nhớ của các GPU không được cộng lại thành một vùng nhớ chung. Không shard model: PAIR không chia trọng số của một model qua nhiều máy. Không split request: một request đang inference không được bẻ nhỏ để chạy song song trên nhiều node.

Mỗi request độc lập được route tới một node đủ điều kiện. Tăng tốc đến từ concurrency giữa nhiều request, không phải làm một request đơn lẻ nhanh hơn bằng cách cộng GPU. Nếu mục tiêu là chạy một model vượt quá VRAM của bất kỳ máy đơn lẻ nào, PAIR không giải quyết trực tiếp bài toán đó.

PAIR hỗ trợ những hệ điều hành, engine và phần cứng nào?

Tài liệu repo hiện liệt kê Windows 11, Linux và macOS, với x64 và arm64; Windows on ARM vẫn được đánh dấu experimental. Các node khác hệ điều hành có thể được pair cùng cluster.

Về inference engine, PAIR hiện tập trung vào Ollama và LM Studio. NVIDIA Technical Blog nêu các hệ thống tương thích gồm GeForce RTX 20 Series trở lên, RTX PRO workstation GPU, DGX Spark và Apple silicon M4+. Tuy nhiên, khả năng chạy một model cụ thể vẫn phụ thuộc yêu cầu của chính Ollama/LM Studio, driver và lượng memory trên từng máy.

Một điểm thực tế: PAIR chạy được trên một node không đồng nghĩa engine và model bạn chọn cũng chạy được trên node đó. PAIR chỉ route tới node khi engine đang hoạt động và model thực sự xuất hiện trong inventory.

Demo của NVIDIA: 18 phút xuống 8 phút 48 giây nói lên điều gì?

NVIDIA minh họa PAIR bằng Hermes Desktop, Ollama và model Qwen 3.6 35B A3B. Hermes tạo năm subagent để xử lý các phần độc lập của một bài toán tổng hợp “Sunday Reset”; Hermes lo decomposition, delegation và synthesis, còn PAIR lo inference routing.

Với cùng workload năm subagent, NVIDIA cho biết một RTX Spark laptop hoàn thành trung bình trong 18 phút. Khi dùng cluster gồm RTX Spark laptop, DGX Spark và RTX 5090, thời gian trung bình là 8 phút 48 giây.

Con số này rất đáng chú ý nhưng không nên đọc thành “PAIR nhanh gấp đôi mọi workload”. NVIDIA tự ghi rõ đây là demo không chính thức, phụ thuộc mức độ song song của workload, model, engine settings, phần cứng, mạng và node availability. Nếu workflow chủ yếu tuần tự, khả năng tăng tốc sẽ thấp hơn nhiều.

Vì sao multi-agent là trường hợp sử dụng tự nhiên của PAIR?

Multi-agent tạo ra nhiều đơn vị công việc độc lập hơn một chatbot thông thường. Khi agent chính gọi năm specialist gần như cùng lúc, cluster routing có cơ hội phân tán chúng sang nhiều node. Một agent chạy inference trên RTX 5090, agent khác có thể chạy trên DGX Spark, thay vì cả năm phải chờ chung một queue.

Điều này tách hai bài toán vốn dễ bị trộn lẫn: model mạnh hơn giúp từng agent suy luận tốt hơn, còn hạ tầng routing tốt hơn giúp nhiều agent không giẫm lên cùng một tài nguyên. Các model như Gemini 3.8 Flash hay Qwen3.8-Max-0902 cho thấy xu hướng agent dài hạn ở tầng model; PAIR giải quyết một phần khác ở tầng local inference infrastructure.

Có cần cài cùng một model trên tất cả máy không?

Không. PAIR cho phép mixed inventory: máy A có model lớn, máy B có model nhỏ vẫn là cấu hình hợp lệ. Request cho model nào sẽ chỉ được xét trong nhóm node quảng bá model đó.

Nếu bạn muốn load balancing thực sự cho cùng một model, cần chuẩn bị model đó trên từ hai node trở lên. Một bản sao duy nhất đồng nghĩa mọi request gọi model ấy vẫn đi vào cùng một máy, bất kể các node khác đang rảnh.

Đây cũng là điểm cần tính toán khi xây home lab: nhân bản model trên nhiều máy tốn storage, nhưng đổi lại scheduler có nhiều lựa chọn hơn khi burst request xuất hiện.

PAIR có giữ dữ liệu AI ở local không?

Repo NVIDIA nói prompts và responses được thiết kế để ở trong mạng local khi toàn bộ client, model source, inference engine và node được cấu hình đều là local. Điều kiện này quan trọng: nếu ứng dụng của bạn vẫn gọi dịch vụ cloud ở một bước khác, PAIR không biến toàn bộ workflow thành offline.

Local applications truy cập proxy qua loopback; traffic giữa các cluster member đã pair sử dụng mTLS trong phạm vi được tài liệu mô tả. PAIR cũng từ chối máy không phải thành viên cluster ở lớp peer trust.

Bảo mật PAIR: mDNS, PIN và mTLS có đủ không?

PAIR có nhiều lớp bảo vệ hợp lý cho môi trường LAN, nhưng NVIDIA không xem mạng local là mặc định an toàn. Discovery chỉ giúp nhìn thấy node; quyết định trust diễn ra ở pairing. PIN sáu chữ số chỉ dùng để bootstrap và không phải credential entropy cao để bảo vệ một mạng không đáng tin.

Security documentation cũng cảnh báo không nên bind inference engine hoặc local API ra interface không đáng tin, không forward các port của PAIR qua router và không đặt một reverse proxy công khai không xác thực trước endpoint. Nếu dùng PAIR trong văn phòng, lab chung hoặc Wi-Fi nhiều người, phần trust boundary cần được xem nghiêm túc như chính model.

Scheduler của PAIR hiện còn những giới hạn nào?

PAIR đang ở giai đoạn đầu và scheduler hiện không phải một capacity planner đầy đủ. Repo chính thức thừa nhận chính sách hiện tại vẫn còn khá thô, đặc biệt khi cluster có phần cứng chênh lệch mạnh.

Chưa hiểu đầy đủ năng lực phần cứng: scheduler chưa dùng GPU model hay VRAM khả dụng làm tín hiệu xếp hạng trực tiếp. Chưa tính measured latency: một GPU chậm và một GPU nhanh có thể có cùng mức pressure. Chưa ưu tiên model warm: node phải cold-load model vẫn có thể được chọn trước node đang giữ model trong memory.

Mỗi workload vẫn chỉ được tính như một job: một completion vài token và một generation rất dài có thể mang cùng trọng số pending. Ngoài ra, request gửi thẳng vào port riêng của engine và bỏ qua PAIR không được phản ánh đầy đủ trong pending-work view.

Vì vậy, PAIR hiện hợp nhất với cụm máy tương đối tương đồng hoặc workload dễ song song. Trong một cluster rất heterogeneous, một GPU yếu có thể được chọn dù GPU mạnh hơn cho cùng model đang là lựa chọn tốt hơn về latency. NVIDIA cho biết routing policy thông minh hơn là hướng đang được xem xét, nhưng chưa đưa ra cam kết thời gian.

Cách bắt đầu với NVIDIA PAIR ở mức khái niệm

Quy trình thiết lập không yêu cầu đổi agent framework. Bạn cài PAIR trên từng máy tham gia, pair chúng thành cluster, bật Ollama hoặc LM Studio và chuẩn bị model ở những node muốn dùng. Sau đó ứng dụng được trỏ vào local proxy tương thích mà PAIR cung cấp.

Bước 1: cài PAIR trên các máy trong cùng mạng local. Bước 2: discovery hoặc thêm node bằng IP, rồi pair bằng PIN trên các máy tin cậy. Bước 3: cài/chạy Ollama hoặc LM Studio trên từng node cần inference.

Bước 4: tải model lên ít nhất một node; nhân bản lên nhiều node nếu muốn balance cùng model. Bước 5: trỏ ứng dụng/agent tới local PAIR endpoint thay vì trực tiếp tới engine. Bước 6: dùng Jobs/Workloads view để xác nhận request thực sự chạy trên nhiều node.

Tài liệu NVIDIA nhấn mạnh Jobs view mới là bằng chứng request đã được phân tán. Số subagent và số PAIR job không nhất thiết bằng nhau vì một agent có thể tạo nhiều lần gọi model.

Khi nào nên dùng PAIR?

PAIR đáng thử khi bạn đã có từ hai máy có khả năng local inference, workload tạo nhiều request độc lập và muốn giữ agent harness gần như không đổi. Home lab có một desktop RTX mạnh cộng laptop, workstation hoặc DGX Spark là ví dụ rõ ràng.

Nó cũng phù hợp với team muốn prototype multi-agent hoàn toàn trong LAN, tránh phải dựng ngay một orchestrator inference phức tạp chỉ để tận dụng vài máy có sẵn.

Khi nào PAIR không phải giải pháp phù hợp?

PAIR không phải lựa chọn cho bài toán cần cộng VRAM để chạy một model quá lớn, distributed training, tensor parallelism hay yêu cầu một request duy nhất phải được split qua nhiều GPU. Nó cũng chưa phải scheduler tối ưu cho cluster cực kỳ heterogeneous hoặc production datacenter cần policy/SLAs tinh vi.

PAIR có thực sự “biến PC trong nhà thành cụm AI” không?

Có, nếu hiểu “cụm AI” là một cụm node cùng nhận và chia các inference request. Không, nếu hiểu cụm đó như một siêu GPU có tổng VRAM bằng tất cả thiết bị cộng lại.

Cách mô tả chính xác hơn là: PAIR biến nhiều máy rời rạc thành một lớp inference routing thống nhất cho ứng dụng. App gửi request tới một địa chỉ local; PAIR lo tìm node có model và ít tải hơn. Với multi-agent, đó đã là một cải thiện hạ tầng rất thực tế dù không có distributed model execution.

PAIR là mã nguồn mở và còn có thể thay đổi nhanh

NVIDIA phát hành PAIR theo Apache License 2.0. Repo công khai source, tài liệu architecture, security, getting started, terminal interface và roadmap ở mức định hướng. Đây là lợi thế cho người muốn kiểm tra trust boundary hoặc tự build thay vì chỉ dùng binary có sẵn.

Tuy nhiên, roadmap không phải cam kết sản phẩm. NVIDIA ghi rõ họ đang cân nhắc scheduler thông minh hơn và nhiều policy routing hơn, nhưng thứ tự ưu tiên sẽ phụ thuộc phản hồi từ deployment thực tế.

Câu hỏi thường gặp về NVIDIA PAIR

NVIDIA PAIR có miễn phí không?

PAIR là dự án mã nguồn mở theo Apache 2.0. Chi phí thực tế vẫn phụ thuộc phần cứng, điện, model và điều khoản riêng của Ollama/LM Studio hoặc model bạn sử dụng.

PAIR có bắt buộc dùng GPU NVIDIA không?

Không hoàn toàn. NVIDIA liệt kê cả Apple M4+ trong các cấu hình được hỗ trợ và repo cho phép cluster trộn Windows, Linux, macOS. Tuy vậy, inference engine và model cụ thể vẫn có yêu cầu riêng; không phải máy nào cài được PAIR cũng chạy được mọi model.

PAIR có thể chạy một model 70B bằng cách cộng VRAM của hai máy không?

Không. PAIR không pool VRAM và không shard model. Model phải chạy được trên một node riêng lẻ theo yêu cầu của engine.

PAIR có cần sửa code AI Agent không?

NVIDIA thiết kế PAIR để các ứng dụng đang nói chuyện với Ollama hoặc API tương thích OpenAI có thể đổi endpoint thay vì viết lại agent harness. Mức thay đổi thực tế còn tùy cách ứng dụng đang hard-code host, port và engine.

PAIR có nhanh hơn một máy đơn lẻ không?

Có thể nhanh hơn rõ rệt khi workload có nhiều request song song. Demo NVIDIA giảm từ 18 phút xuống 8 phút 48 giây cho một workload năm subagent, nhưng chính NVIDIA cảnh báo kết quả phụ thuộc cấu hình và không đại diện cho mọi trường hợp.

PAIR có dùng được cho chatbot một người dùng không?

Có thể, nhưng lợi ích nhỏ hơn nếu chatbot chỉ tạo một request tại một thời điểm. PAIR có giá trị lớn hơn khi có concurrent requests: nhiều agent, nhiều user local hoặc nhiều tác vụ inference chạy đồng thời.

Điều cần theo dõi tiếp theo

PAIR đáng theo dõi ở ba hướng: scheduler có bắt đầu hiểu VRAM, model warmness và latency tốt hơn không; engine support có mở rộng ngoài Ollama/LM Studio không; và cộng đồng có chứng minh lợi ích ổn định trên workload multi-agent thực tế thay vì chỉ demo cấu hình cụ thể hay không.

Nếu NVIDIA tiếp tục cải thiện routing mà vẫn giữ API compatibility và local-first trust model, PAIR có thể trở thành một lớp hạ tầng hữu ích giữa AI Agent framework và những GPU rải rác mà cá nhân hoặc nhóm nhỏ đã sở hữu.

Nguồn tham khảo

NVIDIA Technical Blog: NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network, 03/09/2026.

NVIDIA GitHub: Personal AI Router (PAIR).

PAIR Docs: Overview · Architecture · Getting Started.

NVIDIA GitHub Security: Security Architecture Context.

Avatar photo
Bot.io.vn

Cập nhật tin AI mới nhất, công cụ hữu ích và hướng dẫn ứng dụng AI thực tế mỗi ngày