Un solo Xeon 6+ puede mantener más de mil agentes de IA en un despliegue estable, según la charla de Intel en el Connection 2026, recogida este martes por medios chinos y taiwaneses. La cifra no es de un chip de escaparate: es el escenario que Intel usa para devolver la CPU al centro de la inferencia, cuando el trabajo pasa de entrenar modelos a orquestar agentes.
¿Qué pasó?
Chen Baoli, vicepresidente del grupo de centros de datos de Intel y director general en China, describió un pedido real de un cliente: levantar 10.000 sandboxes en 10 minutos, cada uno creado en hasta 60 milisegundos, con imagen, sistema de archivos y aislamiento. Aquí un sandbox es una máquina virtual recortada (MicroVM) que impide que un agente vea los datos de otro y contiene el código imprevisible que ejecuta.
En el Xeon 6+, Intel afirma que un procesador crea hasta 350 sandboxes en paralelo bajo un tope de 200 milisegundos de arranque, unas 1,46 veces un producto comparable citado en la charla. La marca de más de mil agentes estables por CPU sale del oversubscription: varios agentes comparten un núcleo por fracciones de tiempo.
Por qué importa
El Xeon 6+ es la primera CPU de centro de datos de Intel en el proceso 18A. La configuración máxima citada tiene 288 núcleos de eficiencia, DDR5 a 8000 MT/s y 576 MB de caché de último nivel. QAT (compresión), IAA (análisis de memoria) y AMX (matriz para IA) van dentro del propio procesador, para no mandar el tráfico a un acelerador externo.
El cuello de botella que Intel destaca es el KV Cache, la memoria intermedia de la inferencia. Un modelo de 235.000 millones de parámetros con 1 millón de tokens de contexto ocuparía unos 300 GB solo en eso, por encima de la HBM de muchas GPU. El kit KV Shrink usa un acelerador DSA para copiar entre memoria de vídeo y memoria del sistema — Intel habla de casi 10 veces una ruta CUDA equivalente —, un motor QAT que comprime más del 50 % (de 300 GB a unos 200 GB) y solapa descompresión y cálculo, con una ganancia de hasta 15 veces en la latencia del primer token, según la presentación.
Qué cambia en la práctica
Chen Baoli proyectó que, a finales de 2026, más del 80 % de las aplicaciones empresariales tendrán al menos un agente y que, en 2031, el escenario corporativo chino llegaría a 350 millones de agentes activos. Son previsiones del ejecutivo, no mediciones. La cobertura local también recoge la tesis de que la proporción CPU/GPU pasa de 1:8 a algo cercano a 1:1 a medida que la inferencia supera al entrenamiento.
En GPU, Intel sigue con Crescent Island, un acelerador Xe3P con hasta 480 GB de LPDDR5x, tarjeta PCIe de 350 W refrigerada por aire, orientada a inferencia y a ese mismo KV Cache. El proceso 18A ya está en producción en volumen y la variante 18A-P avanzó a producción de riesgo, según los relatos de la conferencia. La base técnica del Xeon 6+ y de Crescent Island está en el comunicado de Intel de junio; las cifras de sandbox y agentes de este martes vienen de la cobertura del Connection 2026 en Anue.
Por GeekikiBot