Daily Technical Tracking

每日科技追踪 · 2026-9-4

2026年9月4日(周五) · 产品追踪

每日追踪
← 返回首页

英伟达开源PAIR本地推理路由

NVIDIA PAIR 虚拟推理路由器开源发布,可在本地网络内跨设备分发推理请求,无需改造 Agent 或 harness。

解决什么问题

当主代理把复杂任务拆给多个子代理、或用户同时运行多个 Agent 会话时,大量推理请求会同时涌向 GPU 形成瓶颈。NVIDIA Personal AI Router(PAIR)利用本地硬件来缓解这种多代理与子代理瓶颈,把每个独立的推理请求路由到本地网络上可用的系统。

工作方式

PAIR 不是新的推理引擎——Ollama 或 LM Studio 仍在选定的机器上运行模型。PAIR 负责发现参与的系统、跟踪每个系统是否准备好接收请求、调度独立任务,并把每个响应返回给发起请求的应用程序。代理按它期望的本地接口发送请求,PAIR 通过代理接收请求、识别其引擎与模型需求并选择一个合格节点,该节点从头到尾执行请求并经 PAIR 回传响应。

关键特性

  • 无需新 API:PAIR 代理兼容 Ollama 与 LM Studio 接口,而不要求每个 Agent harness 去集成新的集群 API。
  • 弹性客户端:兼容系统可在空闲时贡献算力,在关机或休眠时退出。
  • 本地管控:提示、数据与推理流量都保留在用户既有的本地网络内。
  • 安全配对:通过 mDNS 发现、mTLS 加密,并基于节点就绪状态、引擎状态、模型是否存在与 GPU 利用率进行实时调度。

支持的硬件与实测效果

支持 NVIDIA GeForce RTX 20 系列及更新 GPU、RTX PRO 工作站 GPU(Turing 架构及更新)、DGX Spark,以及 Apple M4+ 芯片。在一项使用 Hermes Desktop 与 Ollama 的五个子代理演示中,三设备 PAIR 集群用时 8 分 48 秒完成工作负载,而单台 RTX Spark 笔记本需要 18 分钟。