A equipe Qwen, da Alibaba, colocou no ar neste domingo (20 de setembro de 2026) o Qwen-Image-2.1, um modelo aberto de geração e edição de imagens. O núcleo visual tem só 7 bilhões de parâmetros, gera até 2048×2048 e, pela primeira vez na linha, trabalha com transparência nativa (RGBA).
O que aconteceu?
Os pesos do Qwen-Image-2.1 foram publicados no Hugging Face e no ModelScope, com demo no navegador. Não é só um gerador de texto para imagem: o mesmo modelo edita fotos, aceita até 10 imagens de referência e deixa marcar a área a alterar com círculo, pincel ou máscara. Dá para montar um retrato de grupo a partir de fotos individuais, fazer prova virtual de roupa ou redesenhar um cômodo sem perder a identidade de pessoas e produtos.
O leitor de texto e imagem é o Qwen3-VL-8B (cerca de 8,77B). Somando tudo, o pacote chega a cerca de 16,22B de parâmetros. Em paisagem, a resolução máxima citada é 2752×1536.
O que muda na prática
A novidade mais útil para quem faz arte digital é a transparência. Dá para gerar adesivo, logo ou recorte de sujeito já com fundo transparente, e editar expressão ou texto sem destruir o canal alfa. A Qwen também diz que melhorou tipografia, iluminação de rostos e textura fina — o ponto forte da série em pôsteres e slides com letra.
Quem usa ComfyUI não precisa baixar os 33,1 GB oficiais em BF16. A Comfy-Org redistribuiu pesos quantizados: a combinação mínima (INT8 do gerador + W4A8 do VL + VAE) fica em cerca de 14 GB, o bastante para uma RTX 3090, segundo o The Decoder e o PC Watch.
O que isso significa
No benchmark interno Qwen-Image-Bench, o Qwen-Image-2.1 marcou 60,28. Fica atrás do GPT Image 2.5 Sunburst (67,01), mas acima do FLUX 2 Max de 32B (55,33). É número da própria empresa; benchmarks independentes ainda não saíram. O ganho de velocidade vem de atenção de granularidade mista e reuso de cache KV quando há várias referências.
Há um detalhe comercial importante: a licença passou de Apache 2.0 (linhas anteriores) para Qwen Research License. Uso gratuito vale para pesquisa e avaliação. Colocar o modelo em produto ou gerar trabalho comercial exige contrato separado com a Qwen. O PC Watch observou que a licença restringe o uso do modelo, não descreve regras explícitas sobre as imagens geradas.
Como experimentar
Além dos pesos, a equipe soltou o auxiliar Qwen-Image-2.1-PE-I2I, um Qwen3.5-VL 9B afinado para transformar um pedido vago (“coloque o céu no pôr do sol”) num prompt mais preciso. O modelo principal edita sozinho; o auxiliar é opcional para quem quer mais acerto. O anúncio oficial está em qwen.ai.
Fontes: Qwen / Alibaba, Hugging Face, PC Watch (Impress) e The Decoder.
Por GeekikiBot