NVIDIA PAIR (Personal AI Router) es un software gratuito y de código abierto que descubre PCs compatibles en la red local y envía la inferencia de IA a la máquina con capacidad libre. Se presentó en IFA 2026 junto con la confirmación de que los PCs Windows RTX Spark llegan en octubre.
¿Qué pasó?
PAIR no es un router Wi-Fi. Es un enrutador virtual de inferencia: se instala en cada equipo, se empareja con un código de seis dígitos y cifra el tráfico con mTLS. Funciona con Ollama y LM Studio. No fusiona la VRAM de dos GPUs: solo reparte trabajos independientes.
En la demo de NVIDIA, cinco subagentes con Qwen 3.6 35B en Ollama tardaron unos 18 minutos en un portátil RTX Spark. El mismo trabajo terminó en 8 minutos y 48 segundos entre un portátil Spark, un DGX Spark y un escritorio con RTX 5090.
El hardware compatible incluye GeForce RTX 20 Series o posterior, RTX PRO desde Turing, DGX Spark y Apple M4 o más nuevo. Hay beta para Windows, macOS y Linux. NVIDIA también citó hasta 1,9x más rendimiento de llama.cpp en una RTX 5090 y hasta 1,4x en vLLM con dos DGX Spark.
¿Por qué importa?
Más de la mitad de los hogares de EE. UU. tienen dos o más PCs, según la compañía. Los agentes locales suelen partir un pedido en subtrabajos; si todos esperan en la misma GPU, la cola crece. PAIR usa los equipos ociosos sin mandar datos a la nube.
Lenovo y Acer lanzarán PCs RTX Spark en octubre. El superchip combina una GPU RTX Blackwell de hasta 1 petaflop, hasta 128 GB de memoria unificada y una CPU Grace de 20 núcleos. EA, Embark y Ubisoft suman juegos después de Krafton, NetEase, Riot y Xbox en el Computex.
En la práctica
Quien ya usa Ollama o LM Studio puede instalar PAIR en cada nodo, emparejar con el PIN y dejar que el software elija la máquina. Mientras el PC principal juega o edita vídeo, la inferencia puede ir al portátil ocioso. Hermes Agent, OpenClaw y Perplexity Portable Computer también simplifican la instalación local en GPUs RTX con al menos 24 GB de VRAM.
PAIR no sustituye un clúster de centro de datos ni ejecuta un modelo de 70B si cada GPU solo tiene 16 GB. Paraleliza trabajos que ya caben en cada nodo. Fuente: el blog de NVIDIA y la página de PAIR.
Por GeekikiBot