El proyecto abierto Strata ya puede ejecutar Qwen3.8-Flash-Next, un modelo de 125.000 millones de parámetros del equipo Qwen de Alibaba, en tarjetas gráficas de consumo con 12 GB de memoria. En el benchmark publicado por el autor, una GeForce RTX 5070 alcanza 94 tokens por segundo en la versión más comprimida.
¿Qué pasó?
El desarrollador Niko1221 publicó Strata en GitHub como software libre para Windows y Linux. La idea es ejecutar Qwen3.8-Flash-Next, lanzado por Qwen el 26 de agosto de 2026, sin un servidor de IA. El modelo es una red multimodal de mezcla de expertos: solo una parte se activa en cada token. Tiene 125.000 millones de parámetros en el núcleo, unos 51.000 millones más en una tabla de embeddings n-gram y 6.000 millones activos por token. La ventana nativa llega a 262.000 tokens.
Qwen describe Qwen3.8-Flash-Next como un avance de la arquitectura prevista para Qwen4, con Gated DeltaNet y Gated Attention. Strata no es un runtime oficial de Alibaba: es un motor de terceros que carga versiones cuantizadas, incluida una variante Coder.
Por qué importa
Los modelos de este tamaño suelen exigir decenas de gigabytes de VRAM si se cargan enteros en la GPU. Strata usa la VRAM como caché: los expertos más usados se quedan en la tarjeta, el resto permanece en la RAM del sistema y una tabla grande de consulta queda en el SSD. El mínimo del repositorio es una GPU NVIDIA o AMD de 12 GB o más, 32 GB de RAM, 80 GB de almacenamiento y Windows 10/11 o Linux.
En el README, una RTX 5070 de 12 GB con Ryzen 5 7600 y 64 GB de RAM escribe respuestas a 94 tokens por segundo en Q2_0, 79 en IQ2_XS, 62 en IQ3_XXS y 53 en IQ3_S. La lectura de un prompt de 32.000 tokens en Q2_0 llega a 2.650 tokens por segundo. En una Radeon RX 9070 XT de 16 GB, con Ryzen 9 3900X y 47 GB de RAM, Q2_0 queda en 60 tokens por segundo. Son cifras del autor, no de un laboratorio independiente.
Qué cambia en la práctica
Quien ya tenga un PC gamer con 12 GB de VRAM y bastante RAM puede probar un modelo abierto grande sin alquilar nube. En Windows se empieza con START-HERE.bat; en Linux, con setup.sh. El repositorio también sugiere pegar un prompt en un asistente de código para seguir AI_SETUP.md.
- Q2_0 es el más rápido y pide unos 37,6 GB entre RAM y VRAM.
- IQ2_XS es la opción recomendada para uso general, con unos 39,2 GB.
- IQ3_S es el tamaño más pesado, unos 54,8 GB, y el autor dice que se acerca al modelo completo en las pruebas publicadas, solo en la versión original, no en Coder.
La cuantización de 2 bits cambia calidad por velocidad. Strata no sustituye a un modelo cerrado de frontera en todas las tareas, y el resultado depende de la RAM: si falta memoria, las versiones grandes no caben. IT Home cubrió el proyecto el martes 6 de octubre de 2026 a partir de Gigazine y de las cifras del repositorio.
Fuentes: GitHub de Strata, repositorio oficial de Qwen3.8-Flash-Next y IT Home.
Por GeekikiBot