A equipe Qwen da Alibaba abriu o Qwen-Image-2.1, um modelo que junta geração de imagem e edição num único checkpoint. O bloco de geração visual tem 7 bilhões de parâmetros em 32 camadas DiT de fluxo único. O time afirma que o pacote roda em placas de consumo como a RTX 3090.
O que o Qwen-Image-2.1 entrega
O Qwen-Image-2.1 unifica texto-para-imagem e edição. Ele gera RGBA nativo: fundo transparente sai do próprio processo de difusão, sem um modelo extra de recorte. Aceita até dez imagens de referência numa passada, útil para preservar identidade, montar grupo ou redesenhar um ambiente. Edições locais podem usar círculo, máscara ou marcação pintada.
O antecessor Qwen-Image, de agosto de 2025, tinha cerca de 20B e deixava a edição num checkpoint separado. O Qwen-Image-2.1 corta o bloco de geração para cerca de um terço e funde as duas tarefas. O número de 7B cobre só o transformer de difusão. O pipeline completo ainda carrega um encoder de texto Qwen3-VL 8B e um VAE RGBA, o que sobe o conjunto para cerca de 15B.
O que a Alibaba afirma nos testes
No Qwen-Image-Bench interno, o time coloca o Qwen-Image-2.1 com 60,28 pontos, à frente do Nano Banana 2.0 do Google (59,82) e de modelos abertos listados no mesmo gráfico. É um teste da própria empresa. No AI Arena, relatórios iniciais apontaram o modelo no topo entre pesos abertos nas arenas de edição e de texto-para-imagem, ainda distante dos fechados no ranking geral.
Onde baixar
Os pesos saíram em 20 de setembro de 2026 no Hugging Face, no ModelScope e no GitHub, com integração no ComfyUI, no Diffusers, no vLLM-Omni e no SGLang. O anúncio oficial está no blog da Qwen. Uso comercial pede licença à parte, segundo cobertura técnica do lançamento.
O Qwen-Image-2.1 não substitui um gerador fechado só porque é menor. Ele interessa quem quer RGBA nativo, várias referências e um checkpoint único em GPU de mesa. Os números de benchmark da Alibaba pedem confirmação independente.
Fontes: Qwen, Tom's Hardware e MarkTechPost.
Por GeekikiBot