Qwen-Image-3.0 от Alibaba: читаемый текст в 10 пикселей и инфографика за один проход
Команда Qwen (Alibaba) представила Qwen-Image-3.0 — генератор изображений, который разборчиво рендерит текст размером от 10 пикселей, принимает промпты до 4500 токенов и поддерживает 12 языков. За один проход модель собирает инфографику, LaTeX-статьи и газетные полосы — правда, на выходе плоская картинка, а не редактируемый макет.
Processado por IA de The Decoder; editado por Hamidun News
A equipe do Qwen (Alibaba) apresentou em julho de 2026 o Qwen-Image-3.0 — um gerador de imagens que aceita prompts de até 4500 tokens, renderiza texto legível a partir de 10 pixels e suporta nativamente 12 idiomas.
O que o Qwen-Image-3.0 faz
O Qwen-Image-3.0 gera layouts complexos em uma única passada: infográficos, páginas no estilo de artigos científicos em LaTeX e páginas inteiras de jornal. A principal diferença em relação aos geradores anteriores é a legibilidade de fontes pequenas: o modelo produz textos legíveis com apenas 10 pixels de altura, enquanto a maioria dos modelos de difusão transforma esse texto em uma massa ilegível.
Principais características, segundo a equipe do Qwen:
- Comprimento do prompt — até 4500 tokens
- Texto legível mínimo — a partir de 10 pixels
- Suporte nativo a 12 idiomas
- Em uma única passada — infográficos, artigos em LaTeX, páginas de jornal
Qual é a pegadinha dos layouts complexos
O valor prático desses layouts continua em dúvida. O Qwen-Image-3.0 entrega uma imagem pronta, não um documento editável: um infográfico ou página de jornal gerado não pode ser aberto e corrigido — só redesenhado com um novo prompt. Para tarefas reais de diagramação, em que o texto é corrigido dezenas de vezes, essa limitação pesa mais do que o próprio fato de um texto de 10 pixels ser legível.
"O valor prático desses layouts fica em dúvida quando o resultado é uma imagem em pixels, e não um formato editável", observa o veículo
The Decoder.
O suporte a prompts de 4500 tokens, por sua vez, amplia de fato o controle: em uma única solicitação é possível descrever a estrutura da página, os textos dos blocos e o estilo ao mesmo tempo, sem dividir a tarefa em várias etapas.
Como isso se posiciona no mercado
O Qwen-Image-3.0 dá continuidade à linha de modelos abertos da Alibaba, que competem com geradores fechados como o Google Nano Banana e as soluções da OpenAI. A aposta em texto dentro da imagem e no multilinguismo com 12 idiomas é uma resposta direta ao ponto fraco da maioria dos modelos de imagem: até agora, os textos em imagens geradas precisavam ser corrigidos manualmente ou sobrepostos em um editor.
O que isso significa
Os geradores de imagens estão avançando sobre um nicho antes ocupado só por designers e diagramadores: pôsteres, infográficos, capas com muito texto. Enquanto a saída continuar sendo uma imagem "plana" sem camadas, o Qwen-Image-3.0 é mais uma ferramenta para rascunhos e prévias do que um substituto de um layout editável — mas o modelo eleva de forma notável o padrão de legibilidade de textos pequenos.
Perguntas frequentes
O que o Qwen-Image-3.0 faz de fábrica?
Em uma única passada, o modelo gera infográficos, páginas no estilo de artigos em LaTeX e páginas de jornal, aceita prompts de até 4500 tokens e renderiza texto legível a partir de 10 pixels em 12 idiomas.
Por que a geração de layouts complexos é criticada?
Porque o resultado é uma imagem em pixels, não um arquivo editável. Um infográfico ou página de jornal pronta não pode ser editada como um documento, só regenerada por inteiro com um novo prompt.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.