GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
guide/CometAPI Research

Wie man GPT Image 2.5 wie ein Profi promptet

Lernen Sie, wie Sie bessere Prompts für GPT Image 2.5 schreiben, mit wiederverwendbaren Formeln, praktischen Beispielen, Workflows mit Referenzbildern, präzisen Bearbeitungstipps

CometAPI
AnnaForschungsteam für KI-Modelle und API
Aktualisiert Sep 21, 2026 13 Min. Lesezeit
Wie man GPT Image 2.5 wie ein Profi promptet
Dieses Muster verwenden

Den ersten API-Aufruf ausführen.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Kurzfassung GPT Image 2.5 verändert das Bild-Prompting in einem wichtigen Punkt: Ein guter Prompt beschreibt nicht mehr nur, was erzeugt werden soll. Für Bearbeitungen und referenzbasierte Generierung sollte er auch festlegen, was sich nicht ändern darf.

Das ist wichtig, weil GPT Image 2.5 für präzisere Bearbeitung und stärkere Referenzerhaltung ausgelegt ist. OpenAI sagt, das Modell sei besser darin, nur das gewünschte Element zu verändern und dabei Subjekt, Komposition und umgebende Details intakt zu lassen.

Guter GPT Image 2.5 Prompt = Ergebnis + Subjekt + Szene + Komposition + visuelle Richtung + exakter Text + Einschränkungen + Ausgabe

Guter Bearbeitungs-Prompt = Änderziel + Erhaltungsliste + Integrationsregeln + Ausschlüsse + Ausgabe

Die zweite Formel ist besonders wichtig. Statt „Change the background to a beach“ schreibe: „Replace only the background with a quiet Mediterranean beach at sunset. Keep the person, face, pose, clothing, camera position, framing, lighting direction, and foreground unchanged.“

Zentrale Erkenntnisse

  • GPT Image 2.5 verbessert Treue und Multi-Turn-Konsistenz, Textrendering und Geschwindigkeit; Flare wird für die meisten Nutzer als Ausgangspunkt empfohlen.
  • Kernformel für Generierung: Ergebnis + Subjekt + Komposition + Stil + exakter Text (in Anführungszeichen) + Einschränkungen/Ausschlüsse.
  • Für Edits gilt die goldene Regel: „Change only X. Preserve [volle Liste von Identität, Pose, Beleuchtung, Geometrie, Text, Stil].“
  • Mehrere Referenzbilder funktionieren besser, wenn jedem eine klare Aufgabe zugewiesen wird (Subjekt, Kleidung, Hintergrund, Palette etc.).
  • Transparente Hintergründe, exakte Typografie und sequentielle Bearbeitung sind deutlich stärker, wenn korrekt gepromptet und Parameter richtig gesetzt werden.
  • Flare priorisiert Geschwindigkeit und Volumen; Sunburst priorisiert Edit-Präzision und finale Asset-Treue. Beide teilen sich die gleichen Tokenraten.
  • CometAPI bietet einheitlichen, kostengünstigen Zugriff auf gpt-image-2.5-flare und gpt-image-2.5-sunburst über vertraute, OpenAI-kompatible Wege.

Was ist GPT Image 2.5

OpenAI veröffentlichte ChatGPT Images 2.5 am 8. September 2026. Das Update fokussiert auf schärfere Details, natürlicheres Licht und Textur, Referenztreue, präzise Edits und stärkere Konsistenz über mehrere Bearbeitungsschritte hinweg. OpenAI berichtet über bis zu 50% geringere Latenz bei der Bildgenerierung im Vergleich zu Images 2.0.

Für Entwickler ist die Familie in zwei API-Modelle aufgeteilt:

  • GPT-Image-2.5 Flare — optimiert für schnelle, hochwertige Alltagsgenerierung und hochvolumige Workflows.
  • GPT-Image-2.5 Sunburst — optimiert für anspruchsvolle Generierungs- und Bearbeitungs-Workflows, bei denen Präzision wichtiger ist als Latenz.

Entwickler können die GPT Image 2.5 API in CometAPI nutzen, einschließlich der Modellbezeichner gpt-image-2.5-flare und gpt-image-2.5-sunburst.

Benchmark und Fähigkeiten

Arena-Text-zu-Bild-BenchmarkGPT Image 2.5 SunburstGPT Image 2.5 FlareGPT Image 2
Text-zu-Bild-Score1421 ± 131399 ± 131381 ± 4
Text-zu-Bild-Rang#1#2#3
Einzeln-Bild-Edit-Score1520 ± 91491 ± 91461 ± 3
Einzeln-Bild-Edit-Rang#1#2#3

Unabhängige Tests und frühe Arena-Rankings platzierten beide Modelle kurz nach dem Launch an der Spitze der Text-zu-Bild- und Bildbearbeitungs-Ranglisten, mit klaren Gewinnen bei Komposition, Detail, Stiltreue, Subjekterhaltung und Geschwindigkeit (Flare oft in ~20–40 Sekunden, gegenüber deutlich längerer Dauer früherer Generationen in manchen Benchmarks).

Zentrale Fähigkeiten umfassen Text- + Bild-Eingaben, Bildausgaben bis grob 4K (mit Einschränkungen: Kanten als Vielfache von 16, max. ~3840 px pro Seite, Seitenverhältnis ≤ 3:1), transparente Hintergründe (PNG/WebP), Qualitätsebenen (low → max), progressive Previews, Inpainting/bereichsspezifisches Editing sowie starke Unterstützung für Multi-Referenz- und sequentielle Bearbeitung. OpenAI berichtet von mehr als 3 Milliarden generierten Bildern pro Woche über ChatGPT Images und die GPT-Image-API-Familie.

Allgemeine Formel für Generierung und Bearbeitung mit GPT Image 2.5

Die wichtigste Regel: Ändern vs. Bewahren

Dieser Unterschied ist die wirkungsvollste Gewohnheit für GPT Image 2.5.

Generierung (neues Bild aus Text oder Referenzen)
Beschreibe alles, was erscheinen soll. Sei konkret beim Subjekt, Framing, Licht, Materialien, Farben und was nicht erscheinen darf.

Bearbeitung (Image-to-Image oder Multi-Turn-Verfeinerung)

  1. Benenne genau eine Änderung.
  2. Liste ausdrücklich alles auf, was unverändert bleiben muss (Identität, Pose, Kamerawinkel, Framing, Licht­richtung, Schatten, Hintergrundelemente, bestehender Text, Farben, Geometrie, Gesamtstil).
  3. Beschreibe, wie das neue Element mit vorhandenem Licht, Perspektive, Textur und Auflage-/Kontakt­schatten integriert werden soll.
  4. Füge klare Ausschlüsse hinzu (kein Extratext, keine Logos, keine Wasserzeichen, kein starkes Retouching).

Vage Multi-Change-Prompts oder fehlende Erhaltungsliste verursachen kumulative Drift. Wiederhole die Erhaltungsliste bei jeder Runde. Wenn ein Bereich pixelidentisch bleiben muss, komponiere den freigegebenen lokalen Edit in das ursprüngliche Master zurück, statt dem Modell allein zu vertrauen.

Minimales Generierungsskelett

[Ergebnis / Verwendungszweck] + Subjekt + Komposition + Stil / Licht / Materialien + exakter Text in Anführungszeichen + Einschränkungen und Ausschlüsse

Minimales Edit-Skelett

Change only [konkretes Element] to [neue Beschreibung]. Preserve [Identität, Pose, Framing, Licht, Schatten, Hintergrund, Text, Farben, Stil]. Match the new element to existing light and geometry. Do not add [unerwünschte Elemente].

Wie GPT Image 2.5 Prompting funktioniert

Die offizielle Prompting-Anleitung von OpenAI ist unkompliziert: Starte mit dem Bild, das du brauchst, und beschreibe dann Subjekt, Komposition, Stil und Einschränkungen. Für Edits trenne klar die angeforderte Änderung von den Details, die gleich bleiben müssen. Verfeinere jeweils nur eine Sache und inspiziere jedes Ergebnis. Strukturiere Prompts als Subjekt → Komposition → Stil → Text (in Anführungszeichen) → Einschränkungen. Weise jedem Referenzbild klare Rollen zu, iteriere eine Änderung nach der anderen, und setze Größe/Qualität/Hintergrund als API-Parameter statt im Prompt-Text.

Subjekt

Benenne die primäre Person, das Objekt oder die Szene mit sichtbaren, überprüfbaren Details: Erscheinung, Kleidung, Pose, Handlung, relative Größe und Interaktion mit Objekten.
Beispiel: „Eine junge Archivarin mit kurzem rotbraunem Bob, runden schwarzen Brillen und einem marineblauen Arbeitskittel, die einen versiegelten Briefumschlag mit einem roten Wachmond-Emblem hält.“

Komposition

Spezifiziere Framing, Kamerahöhe und -winkel, Platzierung des Subjekts (zentriert, linkes Drittel etc.), Negativraum, Schärfentiefe und was sichtbar sein muss (Ganzkörper mit Füßen, Halbnah, etc.).
Beispiel: „Ganzkörper, Füße sichtbar, niedrige Augenhöhe der Kamera. Figur im linken Drittel; endlose Archivregale ziehen sich hinter ihr zurück. Sauberer dunkler Raum oben rechts für spätere Titelplatzierung.“

Stil

Beschreibe das visuelle Medium, die Beleuchtung (Quelle + Richtung), Materialien, Farbpalette, Textur und Realismusgrad. Bevorzuge konkrete visuelle Sprache gegenüber reinen Stimmungsadjektiven. Fordere ausdrücklich „photorealistisch“, „echtes Foto“, Filmkorn oder einen benannten künstlerischen Stil an, wenn nötig.
Beispiel: „Detaillierter, handgemalter Anime-Hintergrund, zurückhaltendes Cel-Shading, natürliche Proportionen. Eine warme Schreibtischlampe gegen kühles blaues Mondlicht aus hohen Fenstern.“

Text

Setze jeden erforderlichen String in Anführungszeichen. Gib Position, Hierarchie, ungefähre Typografie und wie oft der Text erscheinen soll an. Buchstabiere ungewöhnliche oder Markennamen buchstabengetreu, wenn kritisch. Bitte immer um „no other text.“
Beispiel: die Schlagzeile "Open Late" in fetter, schmal laufender Schrift oben, und "Thursday to Sunday" in kleinerer Schrift unten. No other text.

Einschränkungen / Ausschlüsse

Liste, was nicht erscheinen darf und was unverändert bleiben muss. Hochwertige Ausschlüsse sind u. a. kein Extratext, keine Logos, keine Wasserzeichen, kein starkes Retouching und keine unerwünschten Objekte.

Für längere oder komplexere Anforderungen nutze beschriftete Abschnitte (SCENE / SUBJECT / STYLE / TEXT / CONSTRAINTS). Das verbessert die Lesbarkeit und erleichtert spätere Edits.

Wichtiger technischer Hinweis: Setze Modell, Qualität, Größe (oder Seitenverhältnis) und Hintergrund (auto / opak / transparent) als API-Parameter. Verlasse dich nicht auf den Prompt-Text, um Auflösung oder Transparenz zu erzwingen.

Wie nutzt man mehrere Referenzbilder mit GPT Image 2.5?

GPT Image 2.5 akzeptiert mehrere Bildinputs. Die Ergebnisse verbessern sich deutlich, wenn jede Referenz eine explizite Rolle erhält.

Empfohlenes Muster:

  1. Nummeriere oder benenne jedes Referenzbild klar.
  2. Gib seine genaue Aufgabe an: primäre Subjektidentität, Kleidung/Stilreferenz, Hintergrund/Setting, nur Farbpalette, Lichtreferenz etc.
  3. Beschreibe, wie die Elemente kombiniert werden und welche Teile wohin kommen.
  4. Wiederhole Erhaltungsregeln für das primäre Subjekt und alle geschützten Details.

Beispiel: „Use image 1 as the product (matte black water bottle with exact label text). Use image 2 only for the pale concrete ledge and natural outdoor lighting direction. Place the bottle from image 1 on the ledge from image 2, matching the existing soft shadows and light angle. Preserve the bottle’s exact shape, label text, colors, and reflections. Do not change the concrete texture or add any extra objects.“

Klare Rollenzuweisung verhindert unerwünschte Hybridisierung von Subjekten oder Stilen.

Fortgeschrittene Prompting-Techniken

Exakter Text & Typografie Tutorial

  • Setze erforderliche Strings immer in Anführungszeichen.
  • Gib Position, Hierarchie, ungefähres Gewicht und Stil sowie die Anzahl der Erscheinungen an.
  • Bitte um „no other text“, „no logos“ und „no watermarks.“
  • Für dichte Layouts oder mehrere Fonts teste mittlere oder hohe Qualität und überprüfe Rechtschreibung und Lesbarkeit visuell im Output.
  • Kritische Markennamen können buchstabengetreu buchstabiert werden, um die Zuverlässigkeit zu erhöhen.

Transparente Hintergründe

Setze background="transparent" im API-Call (oder die entsprechende UI-Option) und fordere PNG- oder WebP-Ausgabe an. Bitte ausdrücklich um saubere Kanten und nichts hinter dem Subjekt. Überprüfe den Alphakanal sorgfältig um Haare, Glas, feine Details und Kontaktbereiche. Füge Ausschlüsse hinzu wie „no background elements, no drop shadows unless requested.“ Transparente Generierung ist in 2.5 deutlich zuverlässiger, wenn sowohl Parameter als auch Prompt-Einschränkungen korrekt sind.

Multi-Turn-Editing-Workflow

  1. Starte von einer starken Basiserzeugung oder einer freigegebenen Referenz.
  2. Führe den vorherigen Output als neues Eingabebild zurück.
  3. Fordere exakt eine Änderung an.
  4. Wiederhole die vollständige Erhaltungsliste bei jedem Durchgang.
  5. Inspiziere das Ergebnis, bevor du fortfährst.
  6. Für Bereiche, die pixelgenau bleiben müssen, komponiere den freigegebenen lokalen Edit in das ursprüngliche Masterbild.

Diese disziplinierte Schleife nutzt die verbesserte Multi-Turn-Konsistenz von GPT Image 2.5 voll aus und minimiert kumulative Drift.

Flare vs. Sunburst: Welches Modell für welchen Prompt?

KriteriumGPT-Image-2.5 FlareGPT-Image-2.5 Sunburst
Primäre StärkeGeschwindigkeit + hohe AlltagsqualitätEdit-Präzision & finale Asset-Treue
LatenzBis zu ~50% niedriger als GPT Image 2Längere Generierungszeiten
Beste AnwendungsfälleSocial Content, Prototyping, hohes Volumen, schnelle IterationProduktionskampagnen, polierte Produktshots, komplexe Multi-Turn-Edits
Qualität vs GPT Image 2HöherHöchste Kontrolle / engste Erhaltung
Empfohlener StartpunktDie meisten WorkflowsWenn Qualität oder Edit-Präzision der Engpass ist
Token-PricingGleiche Raten für beideGleiche Raten für beide
Transparente Hintergründe & QualitätsstufenVoll unterstützt (low → max)Voll unterstützt

Pragmatische Entscheidungsregel: Ideen erkunden, Varianten erzeugen und schnell iterieren mit Flare. Wenn die finale, polierte Version benötigt wird oder wenn eine komplexe Edit-Sequenz zu driften beginnt, führe denselben Prompt + Referenzen + Einstellungen in Sunburst erneut aus und vergleiche. Viele Produktionsteams halten beide Modelle verfügbar und leiten den Traffic entsprechend.

Prompt-Vorlagen (sofort anpassbar)

1. Clean Product Hero

Purpose: Ecommerce or landing-page hero, square or 4:5.
Subject: [exact product description including materials and any label text in quotes].
Composition: Centered or slight three-quarter view, soft contact shadow, generous negative space at top for headline.
Style: Clean studio lighting from the left, photorealistic, high texture detail.
Constraints: No extra text, no logos, no people reflections, seamless background.

2. Exact-Text Poster / Ad

A vertical poster. Headline “YOUR EXACT HEADLINE” in bold condensed sans-serif across the upper third. Subhead “Secondary line here” in smaller weight directly below. [Full scene and subject description]. [Style]. No other text or logos.

3. Precise Single-Element Edit

Change only the [specific element] to [new description]. Preserve the subject’s exact face/identity, pose, clothing details, camera angle, lighting direction, shadows, background, and all existing text. Match the new element’s lighting, perspective, and contact shadows to the original scene. Do not add any new objects, text, or watermarks.

4. Multi-Referenz-Charakterkonsistenz

Verwende Bild 1 für das Gesicht, die Körperproportionen und die Identität der Figur. Verwende Bild 2 nur für das Outfit und die Stofftextur. Platziere die Figur aus Bild 1 mit dem Outfit aus Bild 2 in [Szenenbeschreibung]. Passe die Lichtrichtung von Bild 1 an. Erhalte Identität und Pose exakt. Keine zusätzlichen Accessoires oder Text.

5. Transparenter Cutout / Asset

[Detaillierte Subjektbeschreibung] freigestellt auf rein transparentem Hintergrund. Saubere Kanten, kein Schlagschatten, keine Hintergrundelements, kein Bodenkontaktschatten, außer ausdrücklich angefordert. Photorealistisch. Ausgabe bereit für Compositing.

Ersetze die Teile in eckigen Klammern durch deine Spezifika und wiederhole die Einschränkungen bei nachfolgenden Bearbeitungsschritten stets.

Warum Prompts scheitern

Häufige Fehlerbilder und wie man sie behebt:

  • Sich auf vage Stimmungswörter („cozy“, „epic“, „premium“) ohne visuelle Details verlassen → füge konkrete Skala, Lichtrichtung, Materialien und Farbe hinzu.
  • Mehrere Änderungen in einen Prompt packen → auf eine Änderung pro Durchgang beschränken.
  • Erhaltungsliste in späteren Edits weglassen oder verkürzen → Details driften; liste jedes Mal alles auf.
  • Exakter Text nicht in Anführungszeichen oder ohne Positions-/Typografieanweisungen → falsche Wörter oder Extratext erscheinen.
  • Referenzbilder ohne Rollen hochladen → das Modell mischt sie unvorhersehbar.
  • Erwarten, dass eine höhere Qualitätsstufe eine schwache Beschreibung rettet → der Prompt bestimmt das Ergebnis; Qualität beeinflusst vor allem Feinschliff, Kosten und Latenz.
  • Spezialsyntax, Gewichte oder „masterpiece 8K ultra detailed“-Keyword-Stacking → klare, geordnete Sätze schlagen Keyword-Stuffing konsistent.
  • Integrationsanweisungen bei Edits vergessen → neue Elemente wirken komponiert statt natürlich.

Höhere Qualitätsstufen (xhigh oder max) helfen bei dichtem Text, feinen Details oder komplexen Layouts, können aber eine unzureichend spezifizierte Beschreibung nicht kompensieren.

PT Image 2.5 Prompting Mistakes Should You Avoid?

FehlerSchwacher AnsatzBesserer Ansatz
Kein Ergebnis„Make something cinematic“„Create a 4:5 paid-social product photograph“
Vager Edit„Improve the background“„Replace only the background with…“
Keine Erhaltungsregeln„Change the shirt“Gesicht, Pose, Kamera und Hintergrund fixieren
Unzugewiesene Referenzen„Use these images“Jeder Referenz eine Rolle geben
Zu viele ÄnderungenFünf große Edits in einer AnfrageEine gesteuerte Änderung pro Durchlauf
Prompt = Compliance annehmenGenerierung blind vertrauenVisuelles QA durchführen

Zugriff auf GPT Image 2.5 über CometAPI

CometAPI bietet OpenAI-kompatiblen Zugriff auf sowohl gpt-image-2.5-flare als auch gpt-image-2.5-sunburst unter einem einzigen API-Schlüssel und den vertrauten Endpunkten /v1/images/generations und edits. Vorteile umfassen zentralisierte Authentifizierung und Abrechnung, wettbewerbsfähige Tokenraten, einfaches Umschalten zwischen Flare und Sunburst, Nutzungs­transparenz und die Möglichkeit, Bildgenerierung mit dem breiten Katalog von 500+ Modellen zu kombinieren, ohne mehrere Anbieter-Accounts zu managen.

Eine typische Migration erfordert nur die Änderung der Basis-URL auf https://api.cometapi.com/v1, die Bereitstellung deines CometAPI-Schlüssels und die Auswahl der gewünschten Modell-ID. Dieses Setup ist besonders wertvoll für Produktionspipelines, die die beiden Varianten A/B-testen, Kosten kontrollieren oder unterschiedliche Qualitätsstufen effizient routen müssen.

Für die neuesten Parameterlisten, Preise und Codebeispiele konsultiere die Bildgenerierungsdokumentation von CometAPI zusammen mit OpenAIs offizieller Bild-Prompting-Anleitung.

Fazit

GPT Image 2.5 belohnt Klarheit, Struktur und Disziplin. Definiere das Ergebnis, beschreibe sichtbares Subjekt und Komposition mit konkreten Details, benenne den Stil über Licht/Materialien/Farbe, setze exakten Text in Anführungszeichen und trenne (für jeden Edit) kompromisslos die einzelne Änderung von der vollständigen Erhaltungsliste. Gib jedem Referenzbild eine klare Aufgabe, entscheide iterativ und überlasse Größe, Qualität und Transparenz den API-Parametern. Starte Erkundung und hohes Volumen mit Flare; wechsle zu Sunburst, wenn finale Präzision oder komplexe Edit-Sequenzen es erfordern.

Beherrsche die Regel „Ändern vs. Bewahren“ und die Struktur Subjekt–Komposition–Stil–Text–Einschränkungen, und GPT Image 2.5 wird zu einem verlässlichen Produktionstool statt einer Quelle endloser Neugenerierung. Kombiniert mit einem einheitlichen Gateway wie CometAPI gewinnst du sowohl kreative Power als auch operative Einfachheit.

FAQs

Müssen GPT Image 2.5 Prompts lang sein?

Nicht unbedingt. Ein langer Prompt voller vager Adjektive kann schwächer sein als ein kurzer Prompt mit präzisen Kompositions- und Erhaltungsanweisungen. Füge Details dort hinzu, wo ein Fehler ins Gewicht fiele.

Wie verhindere ich, dass GPT Image 2.5 das ganze Bild verändert?

Nutze eine enge Anweisung wie „Change only the jacket“ und liste dann ausdrücklich auf, was unverändert bleiben muss: Identität, Pose, Framing, Kameraposition, Licht, Hintergrund, Text und andere freigegebene Elemente.

Wie erhalte ich das Gesicht einer Person?

Nutze ein klares Referenzfoto, weise es als maßgebliche Identitätsreferenz zu und benenne die Merkmale, die stabil bleiben müssen. Verlasse dich nicht ausschließlich auf „same person“.

Wie bringe ich GPT Image 2.5 dazu, exakten Text zu generieren?

Stelle den finalen Text wortwörtlich bereit, gib an, wo er erscheinen soll, spezifi­ziere seine Hierarchie und instruiere das Modell, keine weiteren Wörter hinzuzufügen. Überprüfe den finalen Text immer visuell.

Kann GPT Image 2.5 transparente PNGs erzeugen?

Ja. Setze den Hintergrund auf transparent und nutze PNG- oder WebP-Ausgabe.

Kann GPT Image 2.5 4K-Bilder erzeugen?

Ja. Die dokumentierten Maxima umfassen 3840 × 2160 (Landscape) und 2160 × 3840 (Portrait). Auflösungen über 2560 × 1440 sind experimentell, und benutzerdefinierte Dimensionen müssen die Teilbarkeits- und Seitenverhältnisvorgaben der API erfüllen.

Ist GPT Image 2.5 besser für Edits als GPT Image 2?

OpenAI hebt verbesserte Präzisionsbearbeitung, Referenzerhaltung und Multi-Turn-Konsistenz hervor. Frühe Arena-Preference-Ergebnisse favorisierten ebenfalls beide 2.5-Varianten zum damaligen Snapshot, doch diese vorläufigen Rankings können sich ändern.

Weiterlernen

Diesen Artikel mit der nächsten Entscheidung verknüpfen.

Alle Themen anzeigen
Veröffentlicht am Sep 21, 2026
Zuletzt aktualisiert Sep 21, 2026
4 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen