解决什么问题
当主代理把复杂任务拆给多个子代理、或用户同时运行多个 Agent 会话时,大量推理请求会同时涌向 GPU 形成瓶颈。NVIDIA Personal AI Router(PAIR)利用本地硬件来缓解这种多代理与子代理瓶颈,把每个独立的推理请求路由到本地网络上可用的系统。
工作方式
PAIR 不是新的推理引擎——Ollama 或 LM Studio 仍在选定的机器上运行模型。PAIR 负责发现参与的系统、跟踪每个系统是否准备好接收请求、调度独立任务,并把每个响应返回给发起请求的应用程序。代理按它期望的本地接口发送请求,PAIR 通过代理接收请求、识别其引擎与模型需求并选择一个合格节点,该节点从头到尾执行请求并经 PAIR 回传响应。
关键特性
- 无需新 API:PAIR 代理兼容 Ollama 与 LM Studio 接口,而不要求每个 Agent harness 去集成新的集群 API。
- 弹性客户端:兼容系统可在空闲时贡献算力,在关机或休眠时退出。
- 本地管控:提示、数据与推理流量都保留在用户既有的本地网络内。
- 安全配对:通过 mDNS 发现、mTLS 加密,并基于节点就绪状态、引擎状态、模型是否存在与 GPU 利用率进行实时调度。
支持的硬件与实测效果
支持 NVIDIA GeForce RTX 20 系列及更新 GPU、RTX PRO 工作站 GPU(Turing 架构及更新)、DGX Spark,以及 Apple M4+ 芯片。在一项使用 Hermes Desktop 与 Ollama 的五个子代理演示中,三设备 PAIR 集群用时 8 分 48 秒完成工作负载,而单台 RTX Spark 笔记本需要 18 分钟。