Análise AI Image 2: nova era da geração de imagens IA
Review gpt-image-2 (abr/2026): arquitetura, modo Thinking, texto e LM Arena.
Em 21 de abril de 2026 a OpenAI lançou ChatAI Images 2.0 com id gpt-image-2. Deixa de ser “imagem bonita” e vira sistema visual com planeamento, autochecagem e lotes comerciais. DALL·E 2/3 retirados em 12 maio 2026.
Arquitetura
Integração multimodal — imagem como linguagem. Raciocínio antes do render: layout, objetos, texto.
Instant vs Thinking
| Modo | Uso | Notas |
|---|---|---|
| Instant | Rascunhos | Menor latência |
| Thinking | Pósteres, séries | Até 8 imagens coerentes |
Texto
- Inglês curto: quase impressão
- CJK: ~90–95%
- Layout: hierarquia
Resolução
~2K, rácios 3:1–1:3.
LM Arena
Forte em texto — teste os seus prompts.
API
Cobrança por tokens, valores 2026.
Conclusão
Migrar para gpt-image-2: gerar → rever → publicar.
Arquitetura aprofundada
DALL·E 3 manteve geração relativamente separada do diálogo. AI Image 2 integra-se mais ao stack multimodal AI — imagem como linguagem, não decoração: bons visuais selecionam, ordenam e revelam como boas frases.
Consenso: raciocínio antes do render — layout, contagens, copy, estilo, autocontrolo em tarefas complexas. Explica saltos em banda desenhada, infográficos, layouts densos.
API e faturação por tokens
ID: gpt-image-2. Endpoints:
POST /v1/images/generationsPOST /v1/images/edits
Por tokens. Abril 2026: ~$30 / milhão tokens saída, ~$8 / milhão entrada. 1024×1024:
| Qualidade | ~Custo |
|---|---|
| Low | ~$0.006 |
| Medium | ~$0.053 |
| High | ~$0.211 |
Edits costumam custar mais que geração pura. Registe size, quality, n, retries.
Adequado vs limites
Sim: marketing com copy, mocks UI, e-commerce, storyboards.
Limites: sem PNG transparente nativo; arte extrema → Midjourney + AI tipografia; revisão legal.
Migração
- 10–20 prompts reais — Instant vs Thinking.
- Sandbox API para
gpt-image-2; custo medium. - gerar → rever → publicar.
AI Image 2: de brinquedo a linha semi-produtiva.