Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/CometAPI Research

GPT-5.6-Preise 2026: API-Kosten für Sol, Terra & Luna

Vergleichen Sie die GPT-5.6-API-Preise für Sol, Terra und Luna, mit realen Kostenbeispielen, Caching, Tarifen für langen Kontext, Tool-Gebühren und einer Erläuterung versteckter Kosten.

CometAPI
Mia MarenForschungsteam für KI-Modelle und API
Aktualisiert Aug 31, 2026 12 Min. Lesezeit
GPT-5.6-Preise 2026: API-Kosten für Sol, Terra & Luna
Dieses Muster verwenden

Den ersten API-Aufruf ausführen.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Aktualisierte Preise: Die GPT-5.6-Standardtarife für Kurzkontext betragen jetzt $5 Input / $30 Output für Sol, $2 / $12 für Terra und $0.20 / $1.20 für Luna pro 1 Million Token.

Am 30. Juli 2026 hat OpenAI die GPT-5.6-Terra-Preise um 20% und die Luna-Preise um 80% gesenkt. Die Sol-Preise bleiben unverändert.

Achten Sie auf die versteckten Kostentreiber: Der generische Alias gpt-5.6 leitet zu Sol, Anfragen mit mehr als 272K Eingabetoken nutzen höhere Langkontext-Tarife, und Ausgabetoken kosten in allen drei Stufen weiterhin so viel wie Eingabetoken.

Für latenzempfindliche Sol-Workloads bietet OpenAIs neuer Fast mode bis zu 2.5× schnellere Verarbeitung zu dem Standardpreis.

OpenAI-API-Preise auf einen Blick

Für Nutzer, die allgemein nach OpenAI-API-Preisen suchen, lautet die erste Frage meist: Welches aktuelle Modell bezahle ich tatsächlich? Die Tabelle unten gibt einen kompakten Überblick über mehrere aktuelle OpenAI-Textmodelle, bevor wir uns GPT-5.6 genauer ansehen.

(> Preisupdate — 30. Juli 2026: OpenAI hat die API-Preise für GPT-5.6 Terra um 20% und für Luna um 80% reduziert. Terra kostet jetzt $2 pro 1M Eingabetoken und $12 pro 1M Ausgabetoken, während Luna $0.20 Input und $1.20 Output kostet. Die Sol-Preise bleiben unverändert.)

ModellEingabe / 1M TokenZwischengespeicherte EingabeAusgabe / 1M Token
gpt-5.6-sol$5.00$0.50$30.00
gpt-5.6-terra$2.00$0.20$12.00
gpt-5.6-luna$0.20$0.02$1.20
gpt-5.5$5.00$0.50$30.00
gpt-5.4$2.50$0.25$15.00
gpt-5.4-mini$0.75$0.075$4.50
gpt-5.4-nano$0.20$0.02$1.25

Zum neuen Preis entspricht Luna dem $0.20-Input-Tarif von GPT-5.4 nano und bietet einen etwas niedrigeren Output-Tarif von $1.20 gegenüber $1.25.

Quelle*:* OpenAI API pricing

Das wichtigste Muster ist leicht zu übersehen: GPT-5.6-Ausgabetoken kosten über Sol, Terra und Luna hinweg 6× so viel wie Eingabetoken. Lange Antworten, geschwätzige Agents und reasoning-lastige Workflows können die Kosten daher schneller erhöhen als kleine Änderungen an der Promptlänge.

Für einen breiteren Überblick über die GPT-5.6-Familie — einschließlich Modellfähigkeiten, Positionierung, Benchmarks, API-Zugriff und wichtigen Launch-Features — siehe OpenAIs GPT-5.6 announcement oder CometAPIs GPT-5.6 guide. Dieser Artikel konzentriert sich speziell auf Preise, Kostenberechnungen und Faktoren, die Ihre tatsächliche API-Rechnung beeinflussen können.

GPT-5.6-Preisgestaltung: Sol vs. Terra vs. Luna

GPT-5.6 führt drei Preisstufen ein. OpenAI positioniert Sol als Flaggschiff-Route, Terra als ausgewogene Option und Luna als günstigere Stufe für umfangreiche Workloads.

Für einen tieferen Einblick in die Fähigkeiten, den Zugriff auf die GPT-5.6-API und die Anwendungsfälle der einzelnen Modelle finden Sie hier Details zum GPT-5.6 model .

GPT-5.6-Standardpreise für Anfragen mit ≤272K Eingabetoken

ModellKurzeingabeZwischengespeicherte EingabeCache-SchreibenKurzausgabeLangeingabeLangeingabe (zwischengespeichert)Cache-Schreiben (Lang)Langausgabe
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.00$0.20$2.50$12.00$4.00$0.40$5.00$18.00
gpt-5.6-luna$0.20$0.02$0.25$1.20$0.40$0.04$0.50$1.80

Quelle*:* OpenAI API pricing

Langkontext-Preise: Anfragen mit mehr als 272K Eingabetoken nutzen höhere Tarife. Eingabe, zwischengespeicherte Eingabe und Cache-Schreiben werden mit des Standardtarifs berechnet, während die Ausgabe mit 1.5× berechnet wird. Die höheren Tarife gelten für die gesamte Anfrage.

Ein sinnvoller Ausgangspunkt ist, Luna für einfachere, umfangreiche Aufgaben zu testen, Terra für ausgewogene Anwendungs-Workloads und Sol für die schwierigsten oder geschäftskritischen Aufgaben. Dies sind keine universellen Empfehlungen: Genauigkeit, Retries, Tool-Verhalten und manuelle Prüfung können den Unterschied zum Listenpreis überwiegen.

Ein wichtiger Alias-Hinweis

OpenAIs Model Guidance besagt, dass der generische Alias gpt-5.6 zu gpt-5.6-sol leitet.

Das bedeutet, dass eine an gpt-5.6 gesendete Anfrage die Sol-Preisstufe verwendet. Wenn Ihr Workload auf Terra oder Luna gut funktioniert, verwenden Sie die explizite Modell-ID, statt davon auszugehen, dass der generische Alias die günstigste passende Stufe wählt.

Beispiel 1: Eine typische API-Anfrage

Beginnen wir mit einer häufigen Anfragestruktur:

  • 1,000 Eingabetoken
  • 500 Ausgabetoken
ModellMonatliche EingabekostenMonatliche AusgabekostenGesamt
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$4,000$6,000$10,000
gpt-5.6-luna$400$600$1,000

Unter diesem Workload senkt Lunas neue Preisgestaltung die geschätzte monatliche Token-Rechnung von $5,000 auf $1,000, während Terra von $12,500 auf $10,000 fällt.

Berechnung für Sol:

(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020

Dieses Beispiel zeigt auch, warum die Ausgabelänge wichtig ist. Obwohl die Anfrage doppelt so viele Eingabetoken wie Ausgabetoken enthält, macht der Ausgabeteil 75% der Sol-Tokenkosten aus, weil die Ausgabe mit dem Sechsfachen des Input-Tarifs bepreist wird.

Bei Chat, Agents und Codegenerierung kann die Kontrolle unnötiger Geschwätzigkeit manchmal mehr sparen, als eine kleine System-Prompt zu kürzen.

Beispiel 2: Monatliche Kosten im großen Maßstab

Nehmen wir nun an, eine Anwendung verarbeitet 1 Million Anfragen pro Monat, mit durchschnittlich:

  • 2,000 Eingabetoken pro Anfrage
  • 500 Ausgabetoken pro Anfrage

Das entspricht 2 Milliarden Eingabetoken und 500 Millionen Ausgabetoken pro Monat.

ModellMonatliche EingabekostenMonatliche AusgabekostenGesamt
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$5,000$7,500$12,500
gpt-5.6-luna$2,000$3,000$5,000

Die Lücke ist groß genug, um Routing-Tests zu rechtfertigen, aber die niedrigste Zeile ist nicht automatisch die beste Produktionswahl. Wenn ein günstigeres Modell mehr Retries, Fehlaufgaben oder manuelle Prüfung verursacht, können die Gesamtkosten des Workflows höher sein.

Langkontext-Preise: Was passiert über 272K Token?

GPT-5.6-Modelle unterstützen ein Kontextfenster von 1.05M Token, aber OpenAI wendet höhere Tarife an, wenn eine Anfrage mehr als 272,000 Eingabetoken enthält.

Für diese Langkontext-Anfragen gilt:

  • Eingabe wird mit des Kurzkontext-Tarifs berechnet
  • Zwischengespeicherte Eingabe und Cache-Schreiben ebenfalls mit
  • Ausgabe wird mit 1.5× berechnet
  • Die höheren Tarife gelten für die gesamte Anfrage, nicht nur für Token oberhalb von 272K

Für Sol ändert sich damit die Eingabe von $5 auf $10 pro 1M Token und die Ausgabe von $30 auf $45. Die gleiche Multiplikatorstruktur gilt für Terra und Luna.

Das erzeugt einen deutlichen Kostensprung nahe 272K. Für Workloads in der Nähe dieser Schwelle reduzieren Sie doppelte Retrieval-Chunks, veralteten Gesprächsverlauf, unnötige Repository-Dateien oder ausführliche Tool-Ausgaben, bevor Sie die Anfrage senden. Siehe OpenAIs Cost Optimization Guide für zusätzliche Token-Reduktionstipps.

Standard-, Batch-, Flex- und Priority-Preise

Für geeignete GPT-5.6-Text-Workloads bietet OpenAI mehrere Verarbeitungsebenen.

StufeSol Eingabe/AusgabeTerra Eingabe/AusgabeLuna Eingabe/AusgabeTypischer Einsatz
Standard$5 / $30$2 / $12$0.20 / $1.20Normaler synchroner Datenverkehr
Batch$2.50 / $15$1 / $6$0.10 / $0.60Offline-asynchrone Jobs
Flex$2.50 / $15$1 / $6$0.10 / $0.60Kostensensible Workloads, die langsamere Verarbeitung tolerieren
Fast mode$10 / $60$4 / $24$0.40 / $2.40Latenzempfindlicher Kurzkontext-Datenverkehr

Batch und Flex bleiben etwa 50% günstiger als Standard. Priority Processing wurde am 30. Juli 2026 in Fast mode umbenannt, obwohl bestehende Anfragen mit service_tier: "priority" weiterhin kompatibel sind.

Für GPT-5.6 Sol bietet der Fast mode bis zu 2.5× schnellere Verarbeitung als Standard bei 2× dem Standard-Tokenpreis, ohne Änderung der Modellintelligenz. Er ist am sinnvollsten, wenn die nutzerseitige Latenz den Aufpreis rechtfertigt.

Prompt-Caching: Wann spart es bei GPT-5.6 Geld?

Für GPT-5.6 kosten Cache-Schreibvorgänge 1.25× des normalen Input-Tarifs, während zwischengespeicherte Reads zum niedrigeren Preis für zwischengespeicherte Eingaben abgerechnet werden.

Betrachten wir ein wiederverwendbares 100,000-Token-Präfix auf Sol:

AktionKosten
Einmal normal als unzwischengespeicherte Eingabe verarbeiten$0.50
Präfix in den Cache schreiben$0.63
Später das zwischengespeicherte Präfix lesen$0.05

Zwei unzwischengespeicherte Nutzungen kosten $1.00. Ein Cache-Schreiben plus ein passender zwischengespeicherter Read kostet $0.675 und spart in diesem vereinfachten Beispiel $0.325.

Grenze dieses Beispiels: Diese Berechnung vergleicht nur die Eingabekosten des wiederverwendbaren Präfixes. Sie umfasst keine Ausgabetoken, andere unzwischengespeicherte Eingaben, Tools oder Retries. Reale Einsparungen hängen davon ab, ob das Präfix die Cache-Anforderungen erfüllt und wie oft es tatsächlich wiederverwendet wird.

Caching ist daher am nützlichsten für lange, stabile Prompt-Präfixe, die wiederholt passende Anfragen erhalten. Ein Cache-Schreiben, das nie wiederverwendet wird, erhöht die Kosten statt sie zu senken.

OpenAIs Prompt Caching Guide dokumentiert Preise für Cache-Schreiben, zwischengespeicherte Reads, explizite Breakpoints und TTL-Verhalten.

Weitere Kosten, die Ihre OpenAI-API-Rechnung verändern können

Reasoning-Token und Pro-Modus

Reasoning-Token werden als Ausgabetoken berechnet, auch wenn sie nicht als sichtbarer Antworttext erscheinen. Höhere Reasoning-Einstellungen können daher den Gesamtverbrauch an Ausgabetoken und die Latenz erhöhen.

Wo unterstützt, sollte reasoning.mode = "pro" eher als Konfiguration zum Benchmarken betrachtet werden, nicht als Standardregel zur Kostenersparnis oder Qualitätssteigerung. OpenAI führt für diesen Modus keine separate feste Pro-Gebühr auf; der Kosteneffekt entsteht durch die resultierende Token-Nutzung. Ein vernünftiger Ausgangspunkt ist, Standard und Pro auf repräsentativen Aufgaben zu testen und Aufgabenerfolg, gesamte Ausgabetoken, Latenz und Retries zu vergleichen.

Websuche und andere Tools

OpenAI listet derzeit die Standard-Websuche mit $10 pro 1,000 Aufrufe, plus Suchinhalts-Token, die zum ausgewählten Modelltarif abgerechnet werden. Zwei Websuchen bei einer kleinen Luna-Anfrage können daher teurer sein als die Model-Token der Anfrage.

OpenAI führt außerdem einen separaten Web Search Preview-Preis für Nicht-Reasoning-Modelle mit $25 pro 1,000 Aufrufe auf, wobei Suchinhalts-Token kostenlos sind. Prüfen Sie die genaue Kombination aus Tool und Modell auf der offiziellen Preisseite, statt einen Websuche-Tarif auf jeden Endpunkt anzuwenden.

Regionale Verarbeitung

Geeignete Endpunkte für regionale Verarbeitung oder Datenresidenz für Modelle, die am oder nach dem 5. März 2026 veröffentlicht wurden, haben laut OpenAI-Preisseite einen 10% Aufschlag. Enterprise-Teams mit Residenzanforderungen sollten diesen Faktor in Budgetschätzungen einbeziehen.

So berechnen Sie die OpenAI-API-Kosten

Für eine einfache Anfrage:

Tokengesamtkosten =

(Eingabetoken / 1M × Input-Tarif)

  • (Ausgabetoken / 1M × Output-Tarif)

Für die Produktionsplanung erweitern zu:

Gesamte Workflow-Kosten =

unkaschierte Eingabe

  • zwischengespeicherte Eingabe
  • Cache-Schreiben
  • Ausgabe- und Reasoning-Token
  • Tool-Gebühren
  • Anpassungen der Verarbeitungsebene
  • regionaler Aufschlag, falls zutreffend
  • Retries und Fallback-Anfragen

Die nützlichste Kennzahl ist oft:

Kosten pro erfolgreicher Aufgabe = gesamte Workflow-Kosten / erfolgreiche Aufgaben

So wird verhindert, dass ein günstigerer Tokenpreis künstlich attraktiv wirkt, wenn er zugleich zu mehr Fehlschlägen oder Prüfaufwand führt.

So wählen Sie das richtige Modell, ohne zu viel zu bezahlen

Nutzen Sie die Preistabelle als Ausgangspunkt und testen Sie dann mit realen Aufgaben.

  1. Starten Sie mit dem günstigsten Modell, das der Aufgabe gewachsen scheint. Luna kann ein sinnvoller erster Test für einfache, umfangreiche Arbeiten sein, ist aber nicht automatisch die beste Wahl für jede Extraktions- oder Zusammenfassungsaufgabe.
  2. Messen Sie die Ausgabelänge. GPT-5.6-Ausgabetoken kosten 6× so viel wie Eingabetoken, daher verdient unnötige Ausführlichkeit besondere Aufmerksamkeit.
  3. Beachten Sie die 272K-Schwelle. Wird sie überschritten, ändern sich die Tarife für die gesamte Anfrage.
  4. Verwenden Sie Batch oder Flex für geeignete nicht dringende Arbeit. Testen Sie die betrieblichen Randbedingungen, bevor Sie Produktivtraffic umleiten.
  5. Cachen Sie nur wiederverwendbare Präfixe. Messen Sie tatsächliche Cache-Hits, statt davon auszugehen, dass ein langer Prompt automatisch gecacht werden sollte.
  6. Behalten Sie Tools und Retries im Blick. Sie können Einsparungen durch ein günstigeres Modell zunichtemachen.

Für Teams, die Routen über Anbieter hinweg vergleichen, bietet die CometAPI pricing eine Live-Übersicht über Modelle. Der CometAPI Quickstart und das Cookbook können verwendet werden, um denselben Testsatz über mehrere OpenAI-kompatible Routen auszuführen.

FAQ

Wie viel kostet GPT-5.6 im Jahr 2026?

Die Preise hängen vom Modell ab. Die GPT-5.6-Standardtarife für Kurzkontext reichen von $1 Input / $6 Output pro 1M Token für Luna bis $5 / $30 für Sol. Günstigere Modelle wie GPT-5.4 mini und nano sind ebenfalls verfügbar. Prüfen Sie das genaue Modell auf der Live-Preisseite von OpenAI.

Sind die ChatGPT-API-Preise dieselben wie die GPT-5.6-Preise?

„ChatGPT-API-Preise“ wird informell oft für OpenAI-API-Preise für chatfähige Modelle verwendet, aber ChatGPT-Abos und API-Abrechnung sind separate Produkte. Die API-Nutzung wird nach dem spezifischen Modell und Nutzungstyp bepreist.

Welches GPT-5.6-Modell ist am günstigsten?

gpt-5.6-luna ist das günstigste GPT-5.6-Modell und kostet $0.20 pro 1M Eingabetoken und $1.20 pro 1M Ausgabetoken. OpenAI hat beide Tarife am 30. Juli um 80% gesenkt, wodurch Luna für umfangreiche Agents, Klassifikation, Dokumentverarbeitung und klar definierte Tool-Workflows deutlich wirtschaftlicher wird.

Welches Modell verwendet gpt-5.6?

OpenAIs Modellleitfaden besagt, dass der Alias gpt-5.6 zu gpt-5.6-sol leitet. Verwenden Sie explizite Terra- oder Luna-Modell-IDs, wenn Sie diese Stufen wünschen.

Wann gelten die GPT-5.6-Langkontext-Preise?

Wenn die Eingabe 272,000 Token überschreitet, verwendet GPT-5.6 für die gesamte Anfrage höhere Langkontext-Tarife: 2× für eingabebezogene Tarife und 1.5× für die Ausgabe.

Sind Batch und Flex günstiger als Standard für GPT-5.6?

Für geeignete GPT-5.6-Workloads liegen die aufgeführten Batch- und Flex-Tokenpreise etwa 50% unter Standard. Sie haben unterschiedliche Verarbeitungseigenschaften, daher sollten Sie sicherstellen, dass der Workload diese Randbedingungen tolerieren kann.

Verursachen Cache-Schreibvorgänge bei GPT-5.6 zusätzliche Kosten?

Ja. GPT-5.6-Cache-Schreibvorgänge werden mit 1.25× des normalen Input-Tarifs berechnet, während passende zwischengespeicherte Reads zum rabattierten Tarif für zwischengespeicherte Eingaben abgerechnet werden. Einsparungen hängen von der tatsächlichen Wiederverwendung ab.

Vergleichen Sie GPT-5.6-Kosten an Ihrem eigenen Workload

Preistabellen sind ein Ausgangspunkt. Ihre tatsächlichen Kosten hängen von Prompts, Ausgabelänge, Cache-Trefferrate, Tools, Retries und Aufgabenerfolg ab.

Mit CometAPI können Sie GPT-5.6 Sol, Terra, Luna und andere Modelle über eine OpenAI-kompatible API mit demselben Workload testen.

Nächste Schritte: compare current model pricing, folgen Sie dem CometAPI Quickstart, oder verwenden Sie das CometAPI Cookbook, um reproduzierbare Modelevaluierungen aufzubauen.

Wählen Sie die günstigste Route, die Ihre Anforderungen an Qualität, Latenz und Zuverlässigkeit dennoch erfüllt.

Weiterlernen

Diesen Artikel mit der nächsten Entscheidung verknüpfen.

Alle Themen anzeigen
Veröffentlicht am Jul 15, 2026
Zuletzt aktualisiert Aug 31, 2026
588 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen