Recenzja AI Image 2: nowa era generowania obrazów AI
Przegląd gpt-image-2 (kwi 2026): architektura, Thinking, tekst i LM Arena.
21 kwietnia 2026 OpenAI uruchomiło ChatAI Images 2.0 z id gpt-image-2. To już nie „ładny obrazek”, lecz system wizualny planujący, samosprawdzający i dostarczający partie komercyjne. DALL·E 2/3 wycofane 12 maja 2026.
Architektura
Głębsza integracja multimodalna AI — obraz jako język. Rozumowanie przed renderem: layout, obiekty, copy.
Instant vs Thinking
| Tryb | Zastosowanie | Uwagi |
|---|---|---|
| Instant | Szkice | Niska latencja |
| Thinking | Plakaty, serie | Do 8 spójnych obrazów |
Tekst
- Krótki EN: prawie jakość druku
- CJK: ~90–95% na plakatach
- Układ: hierarchia i oddech
Rozdzielczość
~2K, proporcje 3:1–1:3.
LM Arena ~1512 Elo
Mocny w instrukcjach i tekście — testuj własne prompty.
API
Rozliczenie tokenów; wartości 2026.
Podsumowanie
Migracja do gpt-image-2: generuj → sprawdź → publikuj.
Architektura szczegółowo
DALL·E 3 trzymał generację względnie oddzielnie od dialogu. AI Image 2 integruje się głębiej ze stosem multimodal AI — obraz jako język, nie dekoracja: dobry visual wybiera, układa i ujawnia jak dobre zdanie.
Konsensus: reasoning przed renderem — layout, liczba obiektów, copy, styl, samokontrola w złożonych zadaniach. Wyjaśnia skok w komiksach, infografikach, gęstych layoutach.
API i rozliczenie tokenów
ID: gpt-image-2. Endpointy:
POST /v1/images/generationsPOST /v1/images/edits
Tokeny. Kwiecień 2026: ~$30 / mln output, ~$8 / mln input. 1024×1024:
| Jakość | ~Koszt |
|---|---|
| Low | ~$0.006 |
| Medium | ~$0.053 |
| High | ~$0.211 |
Edits często droższe niż sama generacja. Loguj size, quality, n, retries.
Kiedy tak / uwagi
Tak: marketing copy, mocki UI, e-commerce, storyboardy.
Uwagi: brak native PNG transparent; ekstremalna sztuka → Midjourney + AI typo; legal.
Migracja
- 10–20 realnych promptów — Instant vs Thinking.
- Sandbox API na
gpt-image-2; koszt medium. - generuj → sprawdź → publikuj.
AI Image 2: od zabawki do półprodukcyjnej linii.