September 2026 – Tarife per 3. September 2026.
Wenn ein Unternehmen Aufgaben mithilfe generativer künstlicher Intelligenz (KI) automatisieren möchte, schafft es eine Abhängigkeit von einem Anbieter eines grossen Sprachmodells (LLM) und setzt sich der Schwankung der Token-Kosten (Abrechnungseinheit dieser Modelle) aus, die es nicht kontrollieren kann. Viele zögern daher, ein Projekt zu starten, aus Angst, dass dieser Preis aufgrund von Anbietern in die Höhe schnellt, die ihre Tarife erhöhen würden, sobald die Kunden gebunden sind, oder dass subventionierte Lockpreise steigen würden, sobald es darum geht, Gewinne zu erzielen. Fünf Jahre Daten ermöglichen es, beides zu testen.
Um Preise im Zeitverlauf zu vergleichen, muss man von gleicher Qualität ausgehen. Standardisierte Testbatterien messen die Qualität eines Modells: MMLU für die Allgemeinbildung, GPQA für Fragen auf Doktorebene, SWE-Bench für Code und die Elo-Rankings von LMArena für die menschliche Präferenz.
Diese Messungen bleiben unvollkommen, aber sie genügen, um Qualitätsstufen zu definieren und die richtige Frage zu stellen, nämlich die nach dem Preis des günstigsten Modells, das eine bestimmte Stufe zu einem bestimmten Zeitpunkt erreicht. Die Antwort ist eindeutig, und drei unabhängige Studien messen sie mit verschiedenen Methoden. Die öffentlichen Tarife setzen ihre Reihen bis 2026 fort.
| Qualitätsstufe | Trajektorie | Faktor | Tiefststand erreicht | Quelle |
|---|
| MMLU 42 (2021) | 60 $ → 0,06 $ / M Tokens in 3 Jahren | ÷ 1 000 | 0,06 $, Nov. 2024 | a16z, « LLMflation » |
| MMLU 65 (2022) | 20 $ → 0,07 $ in 23 Monaten | ÷ 280 | 0,07 $, Okt. 2024 | Stanford AI Index 2025 |
| MMLU 86 (2023) | 37,50 $ → 0,11 $ in 37 Monaten | ÷ 330 | 0,11 $, Apr. 2026 | Epoch AI, öffentliche Tarife |
Qualität MMLU 42Qualität MMLU 65Qualität MMLU 86
In logarithmischer Skala. Die drei Kurven fallen drei Jahre lang parallel ab, bis sie ein Plateau erreichen, wo sich die Kosten eines ausreichend kleinen Modells auf seine Hardware und seinen Strom beschränken.
Epoch AI misst über sechs Benchmarks hinweg einen medianen Rückgang um das Fünfzigfache pro Jahr. Die vorsichtige Grössenordnung, die man sich merken sollte, ist eine Reduktion um den Faktor zehn jedes Jahr bei konstanter Qualität, und seit 2021 sind keine Ausnahmen aufgetreten. Diese Steigung hält etwa drei Jahre pro Stufe, die Zeit, um von Dutzenden von Dollar auf wenige Rappen pro Million Tokens zu sinken, dann stoppt sie. Die GPT-3-Stufe kostet sechs Rappen im November 2024 und immer noch sechs Rappen im März 2026, während die GPT-4-Stufe vierzehn Monate braucht, um von achtzehn auf elf Rappen zu sinken.
Diese Preisuntergrenze macht die weitere Entwicklung für diejenigen lesbar, die heute eine Anwendung konzipieren. Ein ausreichend kleines Modell kostet schliesslich nur den Preis seiner Hardware und seines Stroms, und die Kurve stabilisiert sich dort. Die angestrebte Qualitätsstufe reduziert sich somit in drei Jahren um den Faktor hundert bis tausend, dann bleibt sie bei einigen Rappen pro Million Tokens, solange die Berechnungskosten halten. Beobachter, die die Entwicklung verfolgen, kündigen nun ein Tempo von drei bis fünf pro Jahr bis 2027 auf den oberen Stufen an, während die unteren Stufen ihren Abstieg beenden.
Ein Zahlenbeispiel veranschaulicht, was dies bedeutet. Eine Dokumentenextraktionspipeline, die monatlich 30 Millionen Tokens als Eingabe und 3 Millionen als Ausgabe verbraucht, kostete auf GPT-4 im Jahr 2023 etwa 1 080 Dollar pro Monat. Ein Modell gleicher Qualität senkt dieselbe Rechnung auf etwas mehr als 3 Dollar pro Monat im Jahr 2026, was einer Kostenreduktion um den Faktor 330 für denselben Dienst entspricht. Der Cache-Rabatt, der 90 % des Preises für wiederholte Eingaben abzieht, und der Batch-Verarbeitungsrabatt, der die Hälfte davon abzieht, kommen noch hinzu.
Dieselbe Entwicklung zeigt sich hier in linearer Skala, wo die vorherige Grafik eine Rate zeigte und diese hier eine Rechnung spürbar macht. Er wendet für dasselbe monatliche Volumen die tatsächlichen Eingabe- und Ausgabepreise des günstigsten Modells der GPT-4-Qualität an jedem Datum an, und er flacht ab Sommer 2025 ab, weil die Rechnung ihre Preisuntergrenze erreicht hat.
Warum niemand diese Kurve umkehren kann
Ein Trend beruhigt, sobald man versteht, warum er Bestand hat, und drei Mechanismen sichern diesen.
Die Open-Source-Preisuntergrenze gehört allen. Auf jeder Qualitätsstufe kommt ein Open-Weight-Modell, wie Llama, Mistral, DeepSeek oder Qwen, zwölf bis einundzwanzig Monate nach dem proprietären Pionier auf den Markt, und diese Verzögerung verkürzt sich. Die Konkurrenz zwischen Dutzenden von Cloud-Hostern legt seinen Preis fest, darunter AWS, Azure, GCP oder Groq, deren Tarife bis zu den Kosten für Hardware und Strom sinken. Ein proprietärer Anbieter, der seine Preise erhöhen würde, würde den Markt verlassen. Januar 2025 hat dies drastisch gezeigt, als DeepSeek eine Qualität anbot, die dem besten Reasoning-Modell von OpenAI für etwa 96 % weniger Kosten vergleichbar war. Der Unterschied ist strukturell geworden, mit einem mittleren Mischpreis von dreiundfünfzig Rappen pro Million Tokens bei Open-Weight-Modellen im Jahr 2026, verglichen mit drei Dollar bei proprietären Modellen.
Das Wechseln des Modells kostet fast nichts. Das API-Format von OpenAI ist faktisch zum Standard geworden, das vom Grossteil des Marktes identisch angeboten wird. In einer Anwendung, deren Modellaufrufe hinter einer Abstraktionsschicht liegen, läuft die Migration darauf hinaus, eine Konfiguration zu ändern und dem Ersatzmodell einen Evaluierungssatz zu unterbreiten. Diese Austauschbarkeit diszipliniert die Preise besser als eine Verhandlung.
Die aktuellen Preise erwirtschaften bereits eine Marge. Laut SemiAnalysis übersteigt die Bruttomarge von Anthropic bei seiner API 80 %, und was bei den grossen Laboren Geld verliert, ist das unbegrenzte Abonnement für Endverbraucher, im Gegensatz zum nutzungsbasiert abgerechneten Token. Es warten also keine versteckten Verluste darauf, durch eine zukünftige Preiserhöhung ausgeglichen zu werden. Der Markt geht sogar in die entgegengesetzte Richtung, da Google den Preis von Gemini Flash im August 2024 um 78 % gesenkt hat, als direkte Reaktion auf eine OpenAI-Einführung. OpenAI hat dasselbe am 30. Juli 2026 getan und den Tarif von GPT-5.6 Luna um 80 % gesenkt, von einem Dollar auf zwanzig Rappen pro Million Eingabe-Tokens.
Zwei physikalische Treiber ergänzen diese Marktmechanismen. Die algorithmische Effizienz verdoppelt die Leistung pro Parameter etwa alle 3,3 Monate, und die Hardware folgt derselben Entwicklung, wobei ein GPU H100 von etwa acht Dollar pro Stunde Ende 2024 auf weniger als zwei Dollar bei den günstigsten Hostern im Jahr 2026 gesunken ist.
Die vier Nuancen, die man kennen sollte
Die absolute Grenze hingegen wird teurer. Die Kosten des derzeit besten Modells steigen gemäss der MIT-Studie «The Price of Progress» um den Faktor drei bis achtzehn pro Jahr, da jeder marginale Gewinn mehr Berechnung erfordert. Die Tarife von September 2026 zeigen dies, mit GPT-6 Astra für zehn Dollar pro Million Eingabe-Tokens und fünfzig für die Ausgabe, während die Pro-Tier-Modelle auf dreissig und einhundertachtzig Dollar steigen. Das Beibehalten des Qualitätsniveaus Ihrer Anwendung folgt einem absteigenden Pfad, während das Verfolgen des neuesten Modells einem aufsteigenden Pfad folgen kann.
Die Anzahl der Tokens pro Aufgabe steigt. Reasoning-Modelle berechnen unsichtbare Zwischen-Tokens, und agentische Architekturen verbrauchen zehn- bis hundertmal mehr als ein einfacher Aufruf. Bei konstantem Umfang sinken die Kosten pro Aufgabe, und sie steigen wieder, sobald der Umfang erweitert wird.
Energie und Hardware verlangsamen die Entwicklung, ohne sie umzukehren. Die Nachfrage nach HBM-Speicher hält bis 2027 an, Strom kostet mehr, und Hyperscaler investieren im Jahr 2026 rund 700 Milliarden Dollar. Diese Friktionen sind real, und die Preisuntergrenze hält sich trotz ihnen, getragen von immer kleineren Modellen auf immer effizienterer Hardware.
Das wahre Risiko ist die Entfernung aus dem Katalog. Die Anbieter belassen die Preise ihrer alten Modelle und entfernen diese Modelle aus dem Katalog, mit festgestellten Vorlaufzeiten von etwa sechs Monaten bei OpenAI und mindestens sechzig Tagen bei Anthropic. Das Beispiel läuft aktuell, da OpenAI am 22. April 2026 die gebündelte Entfernung von GPT-3.5 Turbo, GPT-4, GPT-4 Turbo, o1, o3-mini und o4-mini zum 23. Oktober 2026 angekündigt hat. Für eine auf ein Modell festgelegte Anwendung bedeutet dies einen Wartungsaufwand, und der Nachfolger ist in der Praxis günstiger bei höherer Qualität.
Was sich daraus für die Konzeption ergibt
Das Kostenverhalten einer Anwendung im Laufe der Zeit hängt viel stärker von ihrer Architektur ab als vom Markt. Vier Prinzipien genügen, um sie an die Preisgrenze zu setzen, abseits der Preisliste eines einzelnen Anbieters.
Man isoliert den Modellaufruf hinter einer Abstraktionsschicht, sodass jede Modelländerung zu einer Konfigurationsänderung wird.
Man pflegt einen Business-Evaluierungssatz, versioniert, der ein Ersatzmodell in wenigen Tagen qualifiziert, um eine Preissenkung zu nutzen sowie eine Wertminderung zu absorbieren.
Man misst die Kosten pro Aufgabe, auf der Ebene, die die Marktdeflation von der Inflation der eigenen Nutzungen unterscheidet.
Man legt die Migrationspolitik offen, da im untersuchten Zeitraum alle sechs bis zwölf Monate ein Modell mit gleichwertiger Qualität und mindestens dreimal geringeren Kosten erschienen ist.
Für eine nach diesen Prinzipien konzipierte Anwendung, sinken bei konstantem Umfang die Inferenzkosten etwa drei Jahre lang, und legt sich dann auf eine Preisuntergrenze, die der Markt bei wenigen Rappen pro Million Tokens hält, und kein Anbieter kann anders entscheiden, da sowohl die Open-Source-Preisuntergrenze als auch Ihre Fähigkeit zum Wechseln ihm entgehen.
Quellen: a16z, «Welcome to LLMflation» (2024) · Epoch AI, «LLM inference price trends» (2025) · Stanford HAI, AI Index 2025 · Gundlach et al., «The Price of Progress» (arXiv:2511.23455) · Xiao et al., «Densing Law of LLMs» (Nature Machine Intelligence) · SemiAnalysis (2026) · Preistabellen und Abschreibungskalender der Herausgeber. Die «gemischten» Eingabe- und Ausgabepreise sind nach der Konvention von Epoch AI drei zu eins gewichtet, und es handelt sich um angezeigte Preise, ohne Rabatte, also Obergrenzen. Punkte nach Februar 2025 wurden aus den öffentlichen Tarifen rekonstruiert, da Epoch AI über dieses Datum hinaus keine Veröffentlichungen getätigt hat.
Diese Studie stammt vom Data & AI-Team von Galadrim. Die Kunden der Agentur bezahlen ihre Inferenz direkt bei den Anbietern, ohne Intermediation im laufenden Betrieb, und die Frage kommt häufig genug auf, um eine datenbasierte Antwort zu verdienen. Die oben genannten Design-Prinzipien sind diejenigen, die das Team in seinen eigenen Projekten anwendet.