
gpt-image-1.5 ist jener unspektakuläre Versionssprung, der für Produktionsteams tatsächlich relevant ist. Es handelt sich nicht um eine neue Architektur, und OpenAI hat das Modell nicht mit einem großen Launch-Event vermarktet, aber es ist der Snapshot, bei dem die am häufigsten zitierten Schwachstellen von gpt-image-1 endlich zuverlässig auf der nutzbaren Seite gelandet sind. Wenn Sie Bildgenerierung in ein echtes Produkt integrieren, ist dies die Version, bei der der Review-Aufwand pro Aufruf auf ein Niveau sinkt, das skaliert.
Was sich seit gpt-image-1 geändert hat
Die wichtigste Verbesserung betrifft das Rendern von Text innerhalb von Bildern. Die ursprüngliche Version konnte kurze Headlines noch einigermaßen zuverlässig setzen, scheiterte aber an mehrzeiligem Text, gemischten Schriftgrößen und an jeglichem Text, der in eine präzise Bounding-Box passen musste. gpt-image-1.5 schließt den Großteil dieser Lücke. Marketing-Banner, Produkt-Mockups mit realistischem UI-Text und Outputs im Infografik-Stil sind nun in den meisten Fällen ohne manuelle Nachbearbeitung als erste Entwurfsversion nutzbar.
Die kompositorische Treue ist der zweite bedeutsame Fortschritt. Wenn Sie drei Subjekte in einer definierten räumlichen Beziehung anfordern, traf gpt-image-1 die Subjekte korrekt, die Beziehung aber nur näherungsweise. gpt-image-1.5 trifft die Beziehung deutlich häufiger richtig, insbesondere bei bühnenhaften Kompositionen und Szenen im Produktfotografie-Stil mit mehreren Objekten.
Die Anatomie von Händen und Fingern ist nach wie vor nicht perfekt, aber die Fehlerquote ist spürbar gesunken. Sechsfingrige Ergebnisse treten selten genug auf, dass eine manuelle Review-Runde am Ende eines Batches praktikabel ist, statt bei jedem einzelnen Output zwingend erforderlich zu sein.
Wo es gut funktioniert
Marketing-Creative-Workflows, die sich schnell durch hundert Varianten iterieren müssen, um die wenigen zu finden, die zünden. E-Commerce-Produktbilder, bei denen konsistente Beleuchtung und ein sauberer Hintergrund über einen ganzen Katalog hinweg erforderlich sind. Redaktionelle Illustrationen für Blogposts und Reports, bei denen das Briefing locker genug ist, dem Modell Spielraum für die Komposition zu lassen. UI-Mockups für die Design-Exploration, bevor ein Designer übernimmt.
Für Agenturen, die Creative-Iterations-Pipelines in hohem Volumen betreiben, trifft gpt-image-1.5 das Preis-Qualitäts-Verhältnis besser als die Vorgängerversion. Die Kombination aus höherer Erfolgsquote im ersten Anlauf und gleichbleibendem Kostenprofil pro Bild bedeutet, dass mehr generierte Outputs ohne manuelle Nacharbeit ausgeliefert werden können.
Der einheitliche Endpoint für Generierung, Editing und Inpainting aus gpt-image-1 wird übernommen. Edits und Variationen verhalten sich in dieser Version vorhersehbarer, vor allem wenn das Eingabebild komplexe Hintergründe oder unruhige Kompositionen aufweist. Früher konnte man beobachten, dass Edits Strukturen aus dem Original in den bearbeiteten Bereich übernahmen. Das passiert nun seltener.
Wo es schwächelt
Sehr feine Typografie in kleinen Größen ist nach wie vor problematisch. Fließtext und dichte Spezifikationstexte sind ohne einen separaten Typografie-Overlay-Pass nicht zuverlässig lesbar. Wenn Ihr Output lesbaren Absatztext im Bild enthalten muss, müssen Sie echten Text weiterhin in Ihrem Anwendungscode überlagern.
Fotorealistische Menschen mit spezifischen Identitätsanforderungen bleiben eine Grenze. Das Modell beherrscht generische fotorealistische Menschen gut, ist aber nicht das richtige Werkzeug, wenn Sie eine bestimmte Person oder eine starke visuelle Kontinuität über eine Serie von Bildern derselben Figur hinweg benötigen. Für sequentielle Character-Arbeit hat ein steuerbarer Diffusion-Stack mit Referenzbild-Konditionierung weiterhin die Nase vorn.
Industrielle und technische Diagramme, die exakte Maßgenauigkeit oder korrekte geometrische Beziehungen erfordern, sind nicht die Stärke des Modells. Es produziert etwas, das wie ein technisches Diagramm aussieht, aber es ist unwahrscheinlich, dass das Ergebnis maßlich korrekt ist. Für Engineering- und CAD-nahe Arbeiten ist dies schlicht die falsche Werkzeugkategorie.
Auswählen oder weiterziehen
Für die meisten Teams ist gpt-image-1.5 die Version, auf die man sich standardisieren sollte, wenn man mit gpt-image-1 begonnen hat und die Reifegewinne ohne das Risikoprofil eines Major-Version-Sprungs mitnehmen möchte. Das Verhalten ist nahe genug, dass Prompt-Bibliotheken aus gpt-image-1 mit kleinen Anpassungen größtenteils übernommen werden können.
Wenn Sie heute neu starten, läuft die Wahl zwischen gpt-image-1.5 und dem neueren gpt-image-2 darauf hinaus, ob Sie das zusätzliche Qualitätsfenster und die operative Reife benötigen, die der neuere Release mitbringt. Für hochvolumige Anwendungen, bei denen die Kosten pro Bild dominieren, ist gpt-image-1-mini die Budget-Stufe, die einer Evaluierung wert ist.
Vendor-übergreifend ist gemini-2.5-flash-image der direkteste Konkurrent und gewinnt tendenziell bei bestimmten stilisierten Ästhetiken, verliert aber beim Rendern von Text innerhalb von Bildern. nano-banana-pro-preview ist Googles Top-Bildmodell und sollte mit benchmarkt werden, wenn Ihr Output-Mix stark in Richtung Fotorealismus oder feiner Kunststile tendiert. Die Wahl zwischen dem Bild-Stack von OpenAI und dem von Google hängt am häufigsten davon ab, welches konversationelle LLM Sie bereits einsetzen, denn eine einzige Vendor-Beziehung vereinfacht Beschaffung und Observability.
EU-Anforderungen an die Datenresidenz werden standardmäßig nicht erfüllt. Für regulierte Workflows benötigen Sie ein regionales Gateway oder einen anderen Anbieter. Daran hat sich seit gpt-image-1 nichts geändert, und es ist unwahrscheinlich, dass sich das in absehbarer Zeit ändert.
Letzte technische Prüfung: 2026-05-22 — Tokonomix.ai
