LLM-API-Preise

KI-API-Kosten im Vergleich: Wie LLM-Preise funktionieren

Woraus LLM-API-Preise wirklich bestehen, was deine Rechnung treibt, und die echte Spanne der Input- und Output-Preise über 15 Anbieter, Stand 24. Juli 2026.

Oriveo TeamVeröffentlicht Aktualisiert 15 Min. Lesezeit
  • LLM-APIs rechnen über bis zu vier getrennte Zähler ab, und die meisten Preisvergleiche sehen sich nur einen davon an.
  • Output-Tokens kosten im Median das Vierfache der Input-Tokens, und bis zum Zwölffachen.
  • Veröffentlichte Input-Preise über 15 Anbieter reichen Stand 24. Juli 2026 von $0.01 bis $150 pro Million Tokens.
Oriveo auf dem iPhone: die Chatliste, rechts neben jedem Chat die geschätzten Kosten.

Wie Preise von LLM-APIs wirklich funktionieren

Fast jeder Vergleich von KI-API-Kosten nennt eine Zahl pro Modell, und diese Zahl ist fast immer der Input-Preis. Er ist die am wenigsten nützliche der vier Zahlen, die ein Anbieter veröffentlicht. Ein Modell rechnet über getrennte Zähler ab: Tokens, die du hineinschickst, Tokens, die es zurückschreibt, Tokens, die aus einem Cache gelesen werden, und – bei manchen Anbietern – Tokens, die in diesen Cache geschrieben werden. Jeder Zähler hat seinen eigenen Satz, und die Sätze liegen nicht nah beieinander.

Ein Token ist ungefähr drei Viertel eines englischen Wortes, eine Million Tokens liegt also irgendwo bei 750.000 Wörtern. Preise werden pro Million Tokens genannt, weil einzelne Nachrichten so billig sind, dass ein Preis pro Nachricht nur aus Nullen bestünde. Diese Darstellung verdeckt, wie schnell sich die Zähler in einer echten Unterhaltung addieren, in der jede Runde alles noch einmal schickt, was vorher gesagt wurde.

Die Tabelle unten zeigt alle vier Zähler für eine Handvoll Modelle, aus demselben Metadata-Feed, der die Modellauswahl und den Kostenrechner auf dieser Seite speist. Achte darauf, wie wenig die Input-Spalte dir sagt: Hier liegen die Input-Preise zwischen 0,30 und 2,50 US-Dollar, die Output-Preise aber zwischen 1,20 und 15,00 US-Dollar – und der Output ist der Zähler, der sich am meisten bewegt.

  • Input – alles, was du schickst: deine Nachricht, die Unterhaltung bisher, jeder System-Prompt, jeder angehängte Text.
  • Output – alles, was das Modell zurückschreibt, einschließlich Reasoning-Tokens bei Modellen, die sie erzeugen.
  • Cache-Lesen beim Input – wiederholter Kontext, den der Anbieter schon gesehen hat, abgerechnet zu einem viel niedrigeren Satz als frischer Input.
  • Cache-Schreiben – was manche Anbieter dafür berechnen, diesen Kontext überhaupt erst in den Cache zu legen.
Wie Preise von LLM-APIs wirklich funktionieren
ModellInput (USD / 1M Tokens)Output (USD / 1M Tokens)Cache-Lesen, InputCache-Schreiben
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

Output-Tokens sind die teure Hälfte

Das verlässlichste Muster bei LLM-Preisen ist, dass Schreiben mehr kostet als Lesen. Um das in eine Zahl statt in einen Eindruck zu fassen, haben wir jedes Textmodell im Metadata-Feed von Oriveo genommen, das einen Preis pro Token veröffentlicht – über alle 15 Anbieter – und den Output-Satz jedes Modells mit seinem eigenen Input-Satz verglichen, Stand 24. Juli 2026.

Das Median-Modell berechnet für Output genau das Vierfache des Inputs. Etwa jedes zehnte Modell berechnet für beides dasselbe oder für Output weniger, typisch für Open-Weight-Modelle, die von Hosting-Anbietern betrieben werden. Am anderen Ende berechnet rund jedes siebte mehr als das Sechsfache, und die weiteste Lücke im Feed liegt beim Zwölffachen.

Das hat direkte Auswirkungen auf deine Ausgaben. Den Prompt zu kürzen ist die Optimierung, nach der fast alle zuerst greifen, und meist ist sie der kleinere Hebel. Eine kürzere Antwort zu verlangen, die Output-Länge zu deckeln oder ein Modell zu wählen, das nicht lange laut denkt, senkt die Rechnung stärker, als der Frage einen Absatz abzuschneiden. Reasoning-Modelle verdienen hier einen zweiten Blick, denn die Thinking-Tokens, die sie erzeugen, werden als Output berechnet, auch wenn du sie nie siehst.

Output-Tokens sind die teure Hälfte
Output-Preis im Vergleich zum Input-PreisAnteil der bepreisten Textmodelle
Gleich oder günstiger (1× oder weniger)10%
1× bis 2×11%
2× bis 4×39%
4× bis 6×25%
Mehr als 6×15%

Was deine Rechnung tatsächlich treibt

Die erste API-Rechnung überrascht meist aus einem von vier Gründen, und keiner davon ist der Listenpreis des Modells in der Überschrift. Die Mechanik unten gilt bei jedem Anbieter, weil sie aus der Funktionsweise von Chat-APIs folgt und nicht aus der Richtlinie irgendeines Anbieters.

Der größte Punkt ist, dass der Kontext erneut geschickt wird. Ein API-Aufruf ist zustandslos: Das Modell hat keine Erinnerung an deine vorige Nachricht, also muss der Client bei jeder Nachricht die ganze Unterhaltung erneut schicken. Ein Thread, der vierzig Runden gelaufen ist, schickt in Runde einundvierzig vierzig Runden Verlauf als Input. Die Kosten einer Unterhaltung wachsen deshalb ungefähr mit dem Quadrat ihrer Länge. Deshalb kann ein langer Thread mehr kosten als zwanzig kurze, in denen es um dasselbe geht.

Prompt-Caching ist das Gegengewicht, und es lohnt sich, es zu verstehen, bevor du es abtust. Anbieter, die es unterstützen, lassen wiederholten Kontext als Cache-Lesen abrechnen statt als frischen Input. Im Feed, den wir gemessen haben, veröffentlicht etwa jedes fünfte Modell einen Preis fürs Cache-Lesen, und wo es ihn gibt, liegt der Cache-Satz im Median bei 10 % des eigenen Input-Preises dieses Modells. Der niedrigste, den wir gefunden haben, liegt unter 1 %, der höchste um 58 %. Manche Anbieter berechnen auch das Schreiben des Caches, typischerweise mit einem Aufschlag auf normalen Input. Caching lohnt sich also, wenn derselbe Kontext mehrmals wiederverwendet wird, und nicht, wenn er einmal genutzt wird.

  • Gesprächsverlauf – in jeder Runde vollständig erneut geschickt, deshalb kosten lange Threads überproportional mehr.
  • System-Prompts und Presets – wiederverwendbare Anweisungen werden jeder einzelnen Nachricht vorangestellt und vervielfachen ihre Token-Zahl unbemerkt.
  • Anhänge – ein Dokument oder Bild, das in einen Chat fällt, wird zu Input-Tokens und bleibt für jede spätere Runde in diesem Thread im Kontext.
  • Reasoning-Tokens – als Output berechnet bei Modellen, die sie erzeugen, ob das Reasoning angezeigt wird oder nicht.
  • Wiederholungen und Neugenerierungen – eine neu erzeugte Antwort ist eine zweite voll berechnete Anfrage, keine kostenlose Korrektur.

Die Preisspanne über 15 Anbieter

Die Tabelle unten ist eine Momentaufnahme der veröffentlichten Input-Preisspanne bei jedem der 15 Anbieter, mit denen sich Oriveo verbindet. Gezählt werden nur Textmodelle mit einem veröffentlichten Preis pro Token, gezeigt werden das günstigste und das teuerste davon bei diesem Anbieter. Die Tabelle zeigt, wo jeder Anbieter sitzt, und ist keine Empfehlung: Das günstigste Modell eines Anbieters und das teuerste sind selten Ersatz füreinander.

Quelle und Methode, damit du es prüfen kannst: Jede Zahl kommt aus dem Produktions-Metadata-Feed von Oriveo unter api.oriveoai.com/api/metadata, Contract-Version 47, erzeugt 2026-07-24T01:00:09Z – derselbe Feed, mit dem die App Nachrichten bepreist, und derselbe hinter dem Kostenrechner auf dieser Seite. Preise sind in US-Dollar pro Million Tokens, Stand 24. Juli 2026. Modelle zur Bilderzeugung und Modelle, die der Anbieter pro Anfrage statt pro Token bepreist, sind ausgeschlossen, weil eine Zahl pro Token für sie bedeutungslos wäre.

Zwei Dinge fallen auf. Das erste ist die Spanne: Der günstigste Input-Preis im ganzen Feed ist $0.01 pro Million Tokens und der teuerste ist $150, ein Faktor von fünfzehntausend zwischen zwei Zeilen in derselben Auswahl, Stand 24. Juli 2026. Das zweite ist, dass ein breiter Katalog und ein niedriger Preis auf verschiedenen Achsen liegen. Die Aggregatoren tragen die weiteste Spanne, weil sie viele Anbieter weiterverkaufen, während ein Anbieter mit nur eigenen Modellen eng an der eigenen Preisstaffel sitzt.

Behandle jede Zahl hier als verderblich. Anbieter setzen Preise neu, starten günstigere Stufen und nehmen Modelle laufend vom Markt. Mehrere der Zeilen unten haben sich innerhalb des letzten Quartals geändert. Jeder Artikel, der Modellpreise zitiert, ist ein Foto. Deshalb gibt es den Live-Feed und den Rechner, und deshalb nennt diese Seite ihr Aufnahmedatum, statt die Zahlen als dauerhaft hinzustellen.

Die Preisspanne über 15 Anbieter
AnbieterTextmodelle mit veröffentlichtem Token-PreisNiedrigster Input (USD / 1M)Höchster Input (USD / 1M)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

Warum dasselbe Modell mehr als einen Preis hat

Öffne zwei Modellverzeichnisse, und du findest dasselbe Modell zu verschiedenen Sätzen. Das ist meist kein Fehler. Open-Weight-Modelle werden von mehreren Hosting-Anbietern betrieben, jeder mit eigener Hardware, eigenem Durchsatz und eigener Marge. Ein Modell kann auf einem Host legitim das eine kosten und auf einem anderen etwas anderes. Im Feed oben erscheint dieselbe Open-Weight-Familie bei mehreren Anbietern zu tatsächlich verschiedenen Sätzen.

Der zweite Grund ist die Zwischenschicht, über die du kaufst. Aggregatoren sitzen zwischen dir und dem darunterliegenden Anbieter und müssen diese Position irgendwie finanzieren: über eine Spanne auf Token-Preisen, eine Aufladegebühr, einen Prozentsatz auf Anfragen, oder ein Credit-System, dessen Umrechnung in Tokens die Plattform festlegt und nicht die Preisliste des Anbieters. Nichts davon ist an sich schlecht. Es kommt darauf an, ob der Mechanismus veröffentlicht ist. OpenRouter zum Beispiel dokumentiert die Bedingungen offen: Stand 24. Juli 2026 ist die veröffentlichte Regel eine Gebühr von 5,5 % auf Karten-Aufladungen mit einem Minimum von $0.80, und für Keys, die du selbst mitbringst, die erste Million Anfragen im Monat ohne Berechnung, darüber hinaus 5 % des normalen Modellpreises, abgezogen in Credits.

Wenn du Plattformen vergleichst, lautet die Frage, die sich lohnt, nicht „was kostet ein Credit“, sondern „welcher veröffentlichte Weg führt vom Listenpreis eines Anbieters zu dem, was mir berechnet wird“. Wenn eine Plattform in Credits bepreist und diese Umrechnung nicht veröffentlicht, vergleichst du nicht mit dem Preis des Modells. Du vergleichst mit der Preispolitik der Plattform, und diese Politik kann sich ändern, ohne dass sich der Preis des Modells überhaupt ändert.

Abo oder nutzungsbasiert: was für dich günstiger ist

Mit dieser Frage kommen die meisten eigentlich an, und eine allgemeine Antwort hat sie nicht. Ein pauschales Monatsabo und eine gemessene API kreuzen sich bei irgendeinem Nutzungsvolumen, und dieser Kreuzungspunkt hängt von deinen eigenen Nachrichten ab: wie lang sie sind, wie lang die Antworten sind, welches Modell du wählst und wie lang deine Threads laufen. Wer einen Prozentsatz an Ersparnis nennt, ohne deine Zahlen zu haben, rät.

Du kannst es in etwa fünf Minuten ausrechnen, und die Arithmetik ist nicht schwer. Nimm eine wirklich typische Woche, nicht deine stressigste. Zähl die Nachrichten. Schätz die durchschnittliche Länge der Antworten, die du bekommst, in Wörtern, und multipliziere mit ungefähr 1,35, um auf Tokens zu kommen. Rechne die Input-Seite dazu und denk daran, dass jede Runde den bisherigen Thread erneut schickt. Multipliziere mit den veröffentlichten Input- und Output-Sätzen des Modells und vergleich das mit der Monatsgebühr, die du erwägst. Der Kostenrechner auf dieser Seite tut das gegen Live-Preise, damit du die Sätze nicht selbst pflegen musst.

Ein paar strukturelle Muster sind stabil genug, um sie zu nennen, ohne Zahlen zu erfinden. Gemessener Zugang gewinnt meist, wenn die Nutzung leicht oder stoßweise ist, wenn du mehrere Modelle gelegentlich nutzt statt eines intensiv, und wenn viel deiner Arbeit kurze Fragen mit kurzen Antworten sind. Abos gewinnen meist bei gleichmäßig hohem Tagesvolumen, und sie haben einen echten Vorteil, der kein Geld ist: eine vorhersehbare Rechnung. Gemessener Zugang ohne Sicht auf die Kosten pro Nachricht ist das Schlechteste aus beiden, und genau dieses Scheitern soll eine Kostenschätzung an jeder Nachricht verhindern.

Wie du die Ausgabe wirklich senkst

Sobald du die Zähler siehst, kommt der größte Teil der Ersparnis aus einer kleinen Zahl von Gewohnheiten und nicht daher, den günstigsten Anbieter zu jagen. In grober Reihenfolge, wie stark sie die Zahl bewegen, für eine typische Chat-Last:

Was meist nicht funktioniert, ist, alles auf das günstigste Modell im Katalog umzustellen. Ein Modell zum Fünftel des Preises, das drei Versuche braucht, bis die Antwort stimmt, spart nichts, und es kostet dich obendrein die Zeit. Die brauchbare Form dieses Rats ist, das Modell zur Aufgabe zu passen: günstige Modelle für Extraktion, Formatierung, Zusammenfassen und Übersetzen, teure für die Arbeit, für die du sonst einen Menschen bezahlt hättest.

  • Fang für ein neues Thema eine neue Unterhaltung an. Das ist der einzelne größte Hebel, weil du aufhörst, dafür zu zahlen, einen irrelevanten Verlauf erneut zu schicken.
  • Bitte um kürzere Antworten, wenn du eine kürzere Antwort willst. Output ist der teurere Zähler bei etwa neun von zehn Modellen.
  • Pass das Modell zur Aufgabe, statt für alles auf das stärkste zu setzen.
  • Halt System-Prompts und wiederverwendbare Presets knapp, denn sie werden bei jeder Nachricht berechnet, die sie nutzt.
  • Nutze Prompt-Caching, wo der Anbieter es unterstützt und du denselben langen Kontext wiederholt verwendest.
  • Nimm Anhänge aus einem Thread, sobald du mit ihnen fertig bist, statt sie durch jede spätere Runde mitzuschleppen.
  • Schau auf die Schätzung an einer Nachricht, bevor du dieses Muster hundertmal wiederholst.

Wie Oriveo dir die Kosten zeigt

Jede Nachricht in Oriveo trägt geschätzte Kosten, berechnet aus dem veröffentlichten Token-Preis des Anbieters und den tatsächlich gemeldeten Tokens, in dem Moment, in dem die Antwort fertig ist. Diese Schätzung gibt es in jeder Stufe, auch in der ohne Anmeldung, denn Kosten, die du nur in einem bezahlten Plan siehst, helfen dir nicht zu entscheiden, ob du für irgendetwas zahlen sollst. Derselbe Metadata-Feed, der in den Tabellen oben steckt, liefert diese Preise. Deshalb musst du in der App keine Preisliste pflegen.

Es ist eine Schätzung und wird auch als solche gekennzeichnet. Anbieter wenden eigene Rundung an, kleinste abrechenbare Einheiten, Sätze je Konto und gelegentliche Aktionspreise, und Token-Zahlen meldet der Anbieter nachträglich. Die Schätzung soll Entscheidungen während des Monats steuern. Die Rechnung deines Anbieters hat das letzte Wort, und wenn die zwei voneinander abweichen, hat die Rechnung recht.

Die tiefere Auswertung sitzt hinter den bezahlten Plänen. Usage Insights – Ausgaben aufgeschlüsselt nach Anbieter und Modell, Monatstrends und Budget-Warnungen – gehört zu Pro und Lifetime, die Stand 24. Juli 2026 $9.99 im Monat, $59.99 im Jahr oder einmalig $149.99 kosten. Diese Pläne kaufen nur Software-Funktionen und enthalten keine KI-Nutzung, keine Modell-Credits und kein Anbieter-Abo. Der Preis der App und der Preis deiner Tokens werden also nie zu einer Zahl gebündelt, die du nicht mehr auseinandernehmen kannst.

Ein Auswertungsbildschirm, der KI-Ausgaben nach Anbieter und Modell aufschlüsselt
Schätzungen pro Nachricht gibt es in jeder Stufe; die Aufschlüsselung nach Anbieter und Modell gehört zu den bezahlten Plänen.

Was diese Zahlen dir nicht sagen können

Eine Preistabelle ist ein Anfang, keine Entscheidung. Drei Dinge, die sie auslässt, sollten klar dastehen, weil sie einen Vergleich, der allein am Preis entschieden aussah, regelmäßig umdrehen.

Das erste ist Tokens pro Aufgabe. Zwei Modelle zum selben Satz können sich deutlich darin unterscheiden, wie viele Tokens sie brauchen, um dieselbe Antwort zu liefern, und ein wortreiches günstiges Modell kann pro fertiger Aufgabe mehr kosten als ein knappes teures. Das zweite ist die Wiederholungsrate: Eine Antwort, die du neu erzeugen musst, wird zweimal berechnet. Das dritte ist alles außerhalb des Token-Zählers: Ratenlimits, Latenz, Kontextfenster, Verfügbarkeit in deiner Region, und ob das Modell die Dateiformate lesen kann, mit denen du arbeitest.

Die ehrliche Art, einen Vergleich wie diesen zu nutzen, ist als Vorauswahl. Streich die Zeilen, die klar außerhalb deines Budgets liegen, probier zwei oder drei Kandidaten an deiner eigenen echten Arbeit, und schau, was eine fertige Aufgabe kostet, nicht was eine Million Tokens kostet. Die Schätzung pro Nachricht gibt es genau dafür, damit dieses Experiment einen Tag dauert und nicht einen Abrechnungszyklus.

Häufig gestellte Fragen

Was kostet eine Nachricht an eine LLM-API wirklich?
Das hängt von vier Zählern ab, nicht von einem: den Tokens, die du schickst, den Tokens, die das Modell zurückschreibt, Tokens, die aus dem Cache gelesen werden, und bei manchen Anbietern Tokens, die in den Cache geschrieben werden. Eine kurze Frage an ein mittelpreisiges Modell kostet typischerweise einen kleinen Bruchteil eines Cents. Dieselbe Frage am Ende eines langen Threads kostet mehr, weil die ganze Unterhaltung in jeder Runde als Input erneut geschickt wird.
Warum ist Output teurer als Input?
Tokens zu erzeugen ist sequenziell und rechengebunden, in einer Art, wie es das Lesen des Prompts nicht ist. Deshalb bepreisen Anbieter es höher. Über die 15 Anbieter, gemessen am 24. Juli 2026, berechnet das Median-Modell für Output das Vierfache des Inputs, und etwa jedes siebte berechnet mehr als das Sechsfache. Kürzere Antworten zu verlangen ist meist ein größerer Hebel, als den Prompt zu kürzen.
Senkt Prompt-Caching die Rechnung wirklich?
Es kann, wenn derselbe lange Kontext mehrmals wiederverwendet wird. Etwa jedes fünfte Modell im gemessenen Feed veröffentlicht einen Preis fürs Cache-Lesen, und wo es ihn gibt, liegt er im Median bei 10 % des eigenen Input-Satzes dieses Modells. Manche Anbieter berechnen auch das Schreiben des Caches. Einen Kontext zu cachen, den du nur einmal nutzt, kann also etwas mehr kosten, als ihn gar nicht zu cachen.
Ist eine nutzungsbasierte API günstiger als ein monatliches KI-Abo?
Bei leichter oder ungleichmäßiger Nutzung meist ja. Bei gleichmäßig schwerer täglicher Nutzung gewinnt oft eine Pauschale. Einen universellen Prozentsatz gibt es nicht, weil die Kreuzung von deinem Nachrichtenvolumen, der Antwortlänge und der Modellwahl abhängt. Schätz eine typische Woche mit einem Kostenrechner gegen aktuelle Preise, statt einer allgemeinen Behauptung zu trauen.
Warum kostet dasselbe Modell auf verschiedenen Plattformen verschieden viel?
Aus zwei Gründen. Open-Weight-Modelle werden von mehreren Hosting-Anbietern mit verschiedener Hardware und verschiedener Marge betrieben, dieselben Gewichte können also tatsächlich verschiedene Sätze tragen. Und Plattformen, die Zugang weiterverkaufen, legen eine eigene Schicht drauf: eine Spanne, eine Aufladegebühr, einen Prozentsatz oder ein Credit-System. Die Frage, die du stellen solltest, ist, ob der Weg vom Listenpreis des Anbieters zu dem, was dir berechnet wird, veröffentlicht ist.
Wie aktuell sind die Preise in diesem Artikel?
Jede Zahl wurde am 24. Juli 2026 aus dem Produktions-Metadata-Feed von Oriveo genommen, Contract-Version 47, erzeugt um 2026-07-24T01:00:09Z. Anbieterpreise ändern sich oft, behandel diese Zahlen also als Momentaufnahme dieses Datums. Der Kostenrechner auf der Seite liest denselben Feed live, und dort siehst du den aktuellen Satz.
Schlägt Oriveo auf das auf, was Anbieter berechnen?
Nein. Mit deinen eigenen API-Keys stellt jeder Anbieter deinem eigenen Konto zum veröffentlichten Listenpreis in Rechnung, und Oriveo nimmt obendrauf nichts. Verwaltete Nutzung wird zum offiziellen Listenpreis jedes Modells aus einem vorausbezahlten Guthaben berechnet. Bezahlte Oriveo-Pläne decken Software-Funktionen wie geräteübergreifenden Sync und Nutzungsauswertung ab und enthalten keine KI-Nutzung und keine Modell-Credits.

Passende Beiträge

Sieh beim Senden, was jede Nachricht kostet

Oriveo zeigt geschätzte Kosten an jeder Nachricht zum Listenpreis des Anbieters, über 15 offizielle Anbieter und 700+ Modelle, auf iPhone, Android und im Web – ohne Aufschlag auf die Nutzung beim Anbieter.