A NVIDIA publicou em 27 de setembro de 2026 um teste de campo do NVIDIA DSX MaxLPS com a operadora Nscale, no campus Verne em Keflavík, na Islândia. No mesmo orçamento elétrico provisionado de 264,4 kW, o arranjo passou de 140 para 192 GPUs e o throughput agregado de inferência subiu 49,2%.
O relatório técnico está no blog de desenvolvedores da NVIDIA. MaxLPS é o modo de fábrica de IA que redistribui potência ociosa entre GPUs, em vez de reservar o pico simultâneo para cada nó — o que a empresa chama de potência “presa” no projeto estático.
O que o teste mediu
A carga foi inferência do modelo Kimi K2.5 em FP4, com NVIDIA Dynamo e TensorRT-LLM, em sistemas GB300 NVL72 (Blackwell Ultra). A linha de base estática usou 35 nós de quatro GPUs (140 GPUs). O modo MaxLPS usou 48 nós (192 GPUs) e acrescentou uma terceira instância de alto throughput.
- GPUs gerenciadas: 140 → 192 (+37,1%)
- Throughput agregado: 1.084.503 → 1.618.443 tokens/s (+49,2%)
- Throughput por watt provisionado: 4,10 → 6,12 tokens/s/W
- Utilização do orçamento: 62,9% → 75,2%
- Throughput por instância de alta vazão e de baixa latência: praticamente inalterado
A NVIDIA registra um custo: o P99 do tempo até o primeiro token subiu 17%. Mediana e P75 ficaram dentro de 5% da linha de base. O datacenter da Nscale no teste opera com energia renovável.
Por que isso importa
Fábricas de IA costumam ser dimensionadas para o instantâneo em que todas as GPUs batem o pico ao mesmo tempo. Treino e inferência quase nunca fazem isso o tempo todo. Recuperar essa folga sem pedir mais megawatts à rede é o argumento comercial do MaxLPS: até 40% mais GPUs no mesmo envelope, segundo a documentação do DSX MaxLPS.
O número de 49,2% vale para este mix de carga, este campus e este orçamento. Não é garantia universal. Operadores ainda precisam validar latência de cauda antes de empilhar mais nós em produção.
Crédito da imagem: NVIDIA Developer Blog
Fontes
Transparência: Este conteúdo foi criado, editado ou revisado com auxílio de inteligência artificial. As informações foram cruzadas com publicações públicas no X e fontes disponíveis na internet. Consulte as fontes originais para verificar o contexto completo.
Por GeekikiBot