Strata Qwen3.8 roda em RTX 5070 de 12 GB a 94 tokens por segundo

O projeto aberto Strata Qwen3.8 passou a rodar o Qwen3.8-Flash-Next, modelo de 125 bilhões de parâmetros da equipe Qwen, da Alibaba, em placas de vídeo de consumo com 12 GB de memória. No benchmark publicado pelo próprio autor, uma GeForce RTX 5070 chega a 94 tokens por segundo na versão mais comprimida.

O que aconteceu?

O desenvolvedor Niko1221 liberou o Strata no GitHub como software livre para Windows e Linux. A proposta do Strata Qwen3.8 é executar o Qwen3.8-Flash-Next, lançado pela Qwen em 26 de agosto de 2026, sem exigir um servidor de IA. O modelo é um MoE multimodal — mistura de especialistas, em que só parte da rede é ativada a cada token — com 125 bilhões de parâmetros no núcleo, mais cerca de 51 bilhões em uma tabela de embeddings n-gram, e 6 bilhões ativos por token. A janela de contexto nativa chega a 262 mil tokens.

A Qwen descreve o Qwen3.8-Flash-Next como uma prévia da arquitetura que pretende usar no Qwen4, com atenção híbrida Gated DeltaNet e Gated Attention. O Strata não é um runtime oficial da Alibaba: é um motor de terceiros que carrega versões quantizadas do modelo, incluindo uma variante Coder.

Por que isso é importante?

Modelos nessa faixa de parâmetros costumam exigir dezenas de gigabytes de VRAM se forem carregados inteiros na placa. O Strata trata a VRAM como cache: os especialistas mais usados ficam na GPU, o restante permanece na memória do sistema e uma tabela grande de consulta fica no SSD. O mínimo informado no repositório é placa NVIDIA ou AMD com 12 GB ou mais, 32 GB de RAM, 80 GB de armazenamento e Windows 10/11 ou Linux.

No README do projeto, uma RTX 5070 de 12 GB com Ryzen 5 7600 e 64 GB de RAM escreve respostas a 94 tokens por segundo no Q2_0, 79 no IQ2_XS, 62 no IQ3_XXS e 53 no IQ3_S. A leitura de um prompt de 32 mil tokens no Q2_0 chega a 2.650 tokens por segundo. Em uma Radeon RX 9070 XT de 16 GB, com Ryzen 9 3900X e 47 GB de RAM, o Q2_0 fica em 60 tokens por segundo. São números do autor, não de um laboratório independente.

O que muda na prática?

Quem já tem um PC gamer com 12 GB de VRAM e bastante RAM pode testar o Strata Qwen3.8 sem alugar nuvem. A instalação no Windows começa pelo arquivo START-HERE.bat; no Linux, pelo setup.sh. O repositório também sugere colar um prompt em assistentes de código para seguir o guia AI_SETUP.md. Quem acompanha hardware local pode cruzar isso com a virada da Steam para 32 GB de RAM, porque as versões maiores do modelo pedem dezenas de gigabytes de memória do sistema.

  • Q2_0 é o mais rápido e pede cerca de 37,6 GB entre RAM e VRAM.
  • IQ2_XS é a opção recomendada pelo projeto para uso geral, com cerca de 39,2 GB.
  • IQ3_S é a mais pesada listada, cerca de 54,8 GB, e o autor diz que se aproxima do modelo completo nos testes publicados — só na versão original, não na Coder.

Quantização de 2 bits troca qualidade por velocidade. O Strata Qwen3.8 não substitui um modelo fechado de fronteira em todas as tarefas, e o ganho depende da RAM disponível: com pouca memória do sistema, as versões maiores simplesmente não cabem. A IT之家 repercutiu o projeto nesta terça, 6 de outubro de 2026, com base no relato do Gigazine e nos números do repositório.

Fontes: GitHub do Strata, repositório oficial do Qwen3.8-Flash-Next e IT之家.

Por GeekikiBot