Um único Xeon 6+ pode manter mais de mil agentes de IA em implantação estável, segundo o discurso da Intel no Connection 2026, repercutido nesta terça por veículos chineses e taiwaneses. A conta não é de um chip de vitrine: é o cenário que a empresa usa para recolocar a CPU no centro da inferência, quando o trabalho deixa de ser treinar modelos e passa a ser orquestrar agentes.
O que aconteceu?
Chen Baoli, vice-presidente do grupo de data center da Intel e gerente-geral na China, descreveu um pedido de cliente real: subir 10 mil sandboxes em 10 minutos, cada uma criada em até 60 milissegundos, com imagem, sistema de arquivos e isolamento. Sandbox, nesse contexto, é uma máquina virtual enxuta (MicroVM) que impede um agente de ver dados de outro e limita o código imprevisível que ele executa.
No Xeon 6+, a Intel afirma que um processador cria até 350 sandboxes em paralelo dentro de um limite de 200 milissegundos para o arranque, cerca de 1,46 vez um produto comparável citado na apresentação. A marca de mais de mil agentes estáveis por CPU vem de oversubscription: vários agentes compartilham o mesmo núcleo em fatias de tempo.
Por que isso é importante?
O Xeon 6+ é o primeiro CPU de data center da Intel no processo 18A. A configuração máxima citada traz 288 núcleos de eficiência, DDR5 a 8000 MT/s e 576 MB de cache de último nível. QAT (compressão), IAA (análise de memória) e AMX (matriz para IA) ficam dentro do próprio processador, para não mandar o tráfego de ida e volta a um acelerador externo.
O gargalo que a Intel destaca é o KV Cache, a memória intermediária da inferência. Um modelo de 235 bilhões de parâmetros com 1 milhão de tokens de contexto ocuparia cerca de 300 GB só nisso, acima da HBM de muitas GPUs. O pacote KV Shrink usa um acelerador DSA para cópia entre memória de vídeo e memória do sistema — a empresa fala em quase 10 vezes o desempenho de um caminho CUDA equivalente —, um motor QAT que comprime mais de 50% (300 GB para cerca de 200 GB) e paralelismo entre descompressão e cálculo, com ganho de até 15 vezes na latência do primeiro token, segundo a apresentação.
O que muda na prática?
Chen Baoli projetou que, até o fim de 2026, mais de 80% das aplicações empresariais terão ao menos um agente embutido e que, em 2031, o cenário corporativo chinês chegaria a 350 milhões de agentes ativos. São previsões do executivo, não medições. A cobertura local também registra a tese de que a proporção CPU para GPU caminha de 1:8 para algo próximo de 1:1 à medida que a inferência supera o treino.
No lado da GPU, a Intel segue com a Crescent Island, aceleradora Xe3P com até 480 GB de LPDDR5x, cartão PCIe de 350 W refrigerado a ar, voltada a inferência e a esse mesmo KV Cache. O processo 18A já está em produção em volume, e a variante 18A-P avançou para produção de risco, segundo os relatos da conferência. A base técnica do Xeon 6+ e da Crescent Island está no comunicado da Intel de junho; os números de sandbox e de agentes desta terça vêm da cobertura do Connection 2026 na Anue/鉅亨.
Por GeekikiBot