Kurz gesagt: Es gibt keinen einzelnen Preis. Die Kosten eines AI-Projekts hängen zuerst vom Anwendungsfall und dem Wert ab, den es generiert, dann von zwei verschiedenen Positionen: der Entwicklung der Lösung (ein einmaliger Kostenpunkt) und dem Verbrauch der Modelle, sobald sie in Produktion sind (ein wiederkehrender Kostenpunkt). Es ist ratsam, das Gleichgewicht zwischen Kosten und Nutzen Anwendungsfall für Anwendungsfall zu beurteilen.
Bei Galadrim, einer 2017 gegründeten Tech-Agentur, die über 800 Kunden begleitet hat, behandelt die AI-Sparte diese Fragen täglich, vom Startup bis zum Grosskonzern. So setzen sich die Kosten eines AI-Projekts zusammen.
Warum es keinen « AI-Preis » gibt
Die Kosten eines AI-Projekts sind nur sinnvoll, wenn sie im Verhältnis zum Mehrwert betrachtet werden, den es bietet. Ein einzelner AI-Baustein kann einige Rappen oder mehrere hundert Euro pro Tag kosten, abhängig von der Aufgabe, dem Volumen und dem erforderlichen Leistungsniveau.
In der Praxis sind die Kosten übrigens nicht die erste Frage der Unternehmen. Sie versuchen zuerst, einen Anwendungsfall zu erschliessen : eine Aufgabe zu automatisieren, Dokumente zu verarbeiten, Kundenanfragen zu leiten. Die Kosten werden zu einem Thema, sobald die Machbarkeit nachgewiesen ist, und können danach präzise gesteuert werden.
Welches sind die zwei Hauptkostenpositionen eines AI-Projekts?
| Position | Art | Was es umfasst |
|---|
| Entwicklung | Einmalige Kosten | Bedürfnisdefinition, Lösungsentwicklung, Integration in das Informationssystem, Tests, Produktivsetzung. |
| Verbrauch (Run) | Wiederkehrende Kosten | Aufrufe an die AI-Modelle (nutzungsbasiert abgerechnet), Hosting, Monitoring, Wartung und Weiterentwicklungen. |
Viele Unternehmen unterschätzen den zweiten Posten. Eine AI-Lösung ist kein statisches Produkt: Sie verbraucht bei jeder Nutzung Ressourcen und erfordert eine langfristige Überwachung (Modellaktualisierungen, Veralten älterer Versionen, Optimierungen).
Die meisten Unternehmensprojekte stützen sich auf die API Modelle, meist über Cloud-Anbieter (für die Datensicherheitsgarantien). Die Abrechnung erfolgt dann nach Verbrauch, in Tokens (die vom Modell verarbeiteten Texteinheiten), mit zwei Komponenten:
Die Inputkosten (input) : der gesamte an das Modell gesendete Kontext (die Anweisung, die Dokumente, die Daten).
Die Outputkosten (output) : der als Antwort generierte Text.
Oft ignorierter Kernpunkt: der Output-Token kostet im Allgemeinen 5 bis 10 Mal mehr als der Input-Token. Direkte Konsequenz für die Kosten eines Anwendungsfalls:
Kostengünstige Aufgabe (viel Input, wenig Output): eine E-Mail klassifizieren, eine Anfrage an den richtigen Dienst weiterleiten, eine Information extrahieren. Konkretes Beispiel: die automatische Weiterleitung von Anfragen an den richtigen Sachbearbeiter bei einem Versicherungsbroker ist Klassifizierung und daher wenig Output-intensiv.
Kostenintensivere Aufgabe (viel Output): Artikel generieren, lange Inhalte produzieren.
Neben der nutzungsbasierten Abrechnung gibt es Abonnemente (insbesondere für Code-Agenten, die intern von Tech-Teams verwendet werden), oft wirtschaftlicher für eine intensive Nutzung.
Ein oft unterschätzter Punkt: Neuere Modelle sind « thinking », die vor der Antwort nachdenken und diese Denk-Tokens werden als Output abgerechnet. Konsequenz: Je höher Sie ein Denk-Niveau festlegen, desto höher steigt die Rechnung. Schlimmer noch, Grenzmodelle neigen dazu, diese Denk-Tokens zu maskieren : Sie zahlen dann für Output-Tokens, die Sie nicht einmal sehen. Das ist ein Kostenpunkt, der genau überwacht werden muss, sobald eine fortgeschrittene Denkweise aktiviert wird.
Warum hört man, dass die AI-Kosten explodiert sind?
Das ist eines der häufigsten Missverständnisse. Bei gleicher Intelligenz ist der Einheitspreis des Tokens nicht explodiert, er ist sogar eher gesunken. Ein von einem kleinen neueren Modell produzierter Token kann genauso «intelligent» sein wie ein Token eines grossen Modells von gestern, zu geringeren Kosten.
Woher kommt dann der Anstieg der Rechnungen? Von Agenten-Workflows. Ein AI-Agent begnügt sich nicht mit einer Antwort: Er reiht Schritte aneinander, ruft Tools auf, macht Hin- und Her-Bewegungen. Er verbraucht also viel mehr Tokens, aber er ermöglicht auch zuvor unmögliche Anwendungsfälle. Die Frage bleibt immer die gleiche: welchen Wert generiert der Workflow im Verhältnis zu seinen Kosten?
Hinzu kommt ein Markteffekt: Einige Nutzungen wurden von den Anbietern implizit über Abonnemente subventioniert. Sehr grosse Verbraucher wechseln nun zur nutzungsbasierten Abrechnung, die weniger subventioniert ist, wodurch ein Anstieg wahrgenommen wird, ohne dass der Token-Preis selbst explodiert ist.
Die Kosten sind kein Schicksal: Sie lassen sich durch Engineering steuern. Vier konkrete Hebel:
Den «Harness» des Agenten eingrenzen. Der Harness ist die Gesamtheit der dem Modell zur Verfügung gestellten Tools und Regeln. Dort werden Schutzmassnahmen kodiert, zum Beispiel nach fünf Aufrufen anzuhalten, direkt im Code statt in der Anweisung, da der Code deterministisch und somit zuverlässiger ist, um die Ausgaben zu kontrollieren.
Das richtige Modellniveau wählen. Man kann in drei Niveaus denken: nano/mini (schnell, wirtschaftlich), normal, und pro (der leistungsstärkste, der teuerste). Die richtige Methode: Mit einem «Grenz»-Modell beginnen, um die Machbarkeit zu beweisen, dann eine Stufe tiefer gehen, solange die Leistung nicht abnimmt. Eine einfache Klassifizierung funktioniert sehr gut auf einem kleinen Modell; eine kreative Aufgabe rechtfertigt ein High-End-Modell.
Einen Evaluationsmechanismus implementieren. Ein Referenzdatensatz und Metriken (Qualität, Latenz, Kosten) ermöglichen den objektiven Vergleich von Modellen und Versionen und ein Downgrade ohne Qualitätsverlust.
Die Optimierungen der Anbieter nutzen. Der Cache (Wiederverwendung eines bereits verarbeiteten Kontexts) und das flex pricing (ein längeres Antwortzeitfenster gegen einen reduzierten Tarif akzeptieren) reduzieren die Rechnung bei nicht dringenden Aufgaben.
Wie viel kostet es konkret?
Hier sind die Grössenordnungen, die ein Budget strukturieren:
Eine einfache Klassifizierungs- oder Extraktionsaufgabe (eine E-Mail sortieren, eine Rechnung lesen) kostet einen Bruchteil eines Rappen pro Aufruf: auf dieser Grössenordnung ist dies oft vernachlässigbar im Vergleich zur eingesparten menschlichen Arbeitszeit.
Eine Aufgabe zur Inhaltserstellung beansprucht viele Ausgangs-Tokens: die Stückkosten sind höher und sollten überwacht werden.
Ein agentischer Workflow (Suche, Dokumentenanalyse, mehrstufige Automatisierung) ist der variabelste Posten: seine Kosten hängen von der Anzahl der Iterationen ab, die durch Engineering begrenzt werden.
Die Entwicklung bleibt in den meisten Projekten der Hauptkostenpunkt beim Start; der Verbrauch wird mit zunehmendem Volumen entscheidend.
Sollte man ein proprietäres, Open Source oder souveränes Modell bevorzugen?
Die Modellwahl hat einen direkten Einfluss auf die Kosten und auf weitere Kriterien (Sicherheit, Souveränität). Eine Agentur unabhängig von den KI-Anbietern hat hier einen Vorteil: Sie kann bleiben modèle-agnostique und für jede Aufgabe das beste Wert-Kosten-Verhältnis auswählen, oder sogar das Modell unterwegs wechseln.
Open Source ist relevant, insbesondere in Souveränitätskontexten (zum Beispiel ein Modell, das auf GPUs in Frankreich bei einem Anbieter wie OVH im Gesundheitswesen gehostet wird). Aber Achtung: Die Inferenz eines Open-Source-Modells selbst zu betreiben, ist ein kostspieliges Geschäft, das Skalierbarkeit und Zuverlässigkeit erfordert. Meistens ist die Nutzung eines Inferenzanbieters oder eines Provider cloud die rentabelste und stabilste Lösung.
Über den Autor
Benjamin Drighès ist CTO IA und Partner von Galadrim. Er ist Anfang 2024 der Agentur beigetreten, um ihren Bereich Künstliche Intelligenz und Data aufzubauen, und leitet heute rund vierzig Ingenieure und Berater. Im Alltag begleitet er KMU, ETI und Grosskonzerne bei der Konzeption und Implementierung von KI-Lösungen, mit einem pragmatischen, auf den Geschäftswert ausgerichteten Ansatz.
Gegründet 2017, Galadrim ist eine französische Tech- und KI-Agentur, die über 800 Kunden bei ihren Projekten im Bereich massgeschneiderter Entwicklung und Künstlicher Intelligenz begleitet hat.
Haben Sie einen Anwendungsfall im Kopf und möchten dessen Kosten und ROI schätzen lassen? Die KI-Teams von Galadrim begleiten KMU, ETI und Grosskonzerne, von der Machbarkeitsstudie bis zur Implementierung, und bleiben dabei unabhängig von Modell-Anbietern.