概念图:家用局域网里多台电脑通过中央路由器共享本地 AI 推理负载
概念封面:本地异构节点组成个人 AI 集群——非产品截图, AI 生成配图,非新闻照片

备选标题

  1. 闲置的家用算力拼成集群:NVIDIA 开源 Personal AI Router(PAIR)
  2. 不拼显存、只路由请求:PAIR 想把 RTX、DGX Spark 和 Mac 接到同一本地端点
  3. Ollama / LM Studio 之上再加一层:NVIDIA PAIR 公测把本地 Agent 流量分到闲置机器

导语

在云端 Agent 仍占主流的当下,NVIDIA 正在用一套开源软件拉本地推理的队伍:**Personal AI Router(PAIR)**公测版,把同一局域网里的 GeForce RTXDGX SparkMac 发现并配对,对外只暴露一个本地端点,把独立推理请求路由到有引擎、有模型、负载更闲的节点。

官方强调两点边界:数据尽量留在家里;它不合并 GPU 显存、不把多卡拼成一张大卡、也不把一次推理切到多机——只是把并发请求分到不同机器。TechSpot 报道称,产品经理 Seth Schneider 把典型场景画成「全家闲置机器」:一台 RTX / DGX Spark、一台 5090 笔记本、孩子的游戏台式机和 MacBook,合计约 165 teraFLOPS 的闲置算力。

来源要点

NVIDIA 官方落地页怎么写

据 NVIDIA PAIR 产品页:

  • 定位: 面向家庭 / SOHO 的本地推理路由器;把兼容的 Windows、Linux、macOS 节点连成「个人 AI 集群」,无需特殊线缆或机架。
  • 能力: 发现节点;对接 OllamaLM Studio;向应用 / Agent 提供统一本地端点,并按引擎可用性、模型是否在节点上、当前负载做路由。
  • 隐私主张: 提示词、文件与 Agent 上下文留在用户本地网络,运行期不要求联网(下载模型仍需网络)。
  • 硬件门槛(页面校验配置): GeForce RTX 20 系及更新、DGX Spark/GB10、Mac M4 或更新;建议 ≥8 GB 内存、≥20 GB 磁盘。
  • 平台: Windows 11、DGX OS / Ubuntu、macOS Tahoe;提供各平台安装包下载。

GitHub README 补上的硬边界

Apache-2.0 仓库 NVIDIA/Personal-AI-Router 写明:PAIR 把每个独立请求路由到一台节点;池化显存、组成更大逻辑 GPU、跨机切分单次推理。它可在任意受支持系统上运行,但节点能否真正承接某个引擎/模型,取决于 Ollama / LM Studio 自身要求;只有跑起兼容引擎的节点才会进入候选集,且优先已知已加载该模型的节点。安装路径推荐签名发行版(Windows .exe / Linux .deb / macOS .dmg)。

TechSpot 的产品解读

TechSpot(2026-09-04)把 PAIR 概括为:跨操作系统拼本地推理集群,几分钟完成配对;用闲置算力喂聊天机器人与 Agent;并引用 Schneider 的家庭算力例子,强调目标不是数据中心级加速卡,而是把家里已有的高性能机器用起来。

为什么值得盯

  1. 本地 Agent 的「缺中间件」问题: 多机、多引擎、多模型时,应用侧通常要自己选节点;PAIR 用兼容 Ollama / OpenAI 风格的代理端点,试图让现有 harness 少改甚至不改
  2. 和「买一张更大的卡」不同的路径: 它卖的是调度与发现,不是更大的单卡吞吐;适合并发多请求,不适合把一个巨型模型硬拆到多机。
  3. 隐私叙事对准云端疲劳: 在 Frontier 模型继续上云的同时,NVIDIA 用开源路由器把「闲置家用算力」重新包装成可分享的本地容量。
  4. 硬件生态绑定清晰: RTX + DGX Spark + Apple Silicon 同网混部,是对消费级与工作站异构环境的明确押注。

观察

PAIR 真正有意思的地方,不在又一个本地聊天前端,而在 把家庭异构算力产品化成「可被 Agent 调用的统一本地端点」。若公测期安装体验与路由策略站得住,它可能成为 Ollama / LM Studio 之上的默认家用调度层;若节点发现、引擎安装或跨 OS 配对摩擦过大,它仍可能停在爱好者玩具。接下来该看的是:默认安全配对(mDNS / PIN / mTLS 一类机制是否够用)、对更多引擎的支持,以及「闲置算力」叙事能否落到可重复的性能数字,而不只是家庭场景故事。