- Published on
Claude Kosten: pro Aufgabe rechnen, nicht pro Token
- Authors

- Name
- Phillip Pham
- @ddppham
Claude Kosten: pro Aufgabe rechnen, nicht pro Token
TL;DR
Wer Claude-Kosten mit „Anfrage × Token-Preis“ kalkuliert, liegt bei Agenten-Anwendungen um den Faktor 10 bis 20 daneben. In einer Agenten-Schleife wird der gesamte bisherige Verlauf in jeder Runde neu geschickt. In unserer Beispielrechnung kostet ein Reklamationsvorgang auf Claude Opus 5.5 nicht 0,06 US-Dollar, sondern 1,16 US-Dollar ohne Caching und 0,36 US-Dollar mit Caching. Und selbst das ist der kleinste Posten: Eine einzige Nacharbeit durch einen Sachbearbeiter kostet so viel wie rund 40 Modell-Durchläufe.
Preise geprüft am 29. September 2026, Anthropic-Erstanbieterpreise in US-Dollar. Über Amazon Bedrock und Google Vertex AI gelten eigene Preislisten. Prüfen Sie die Werte vor der Budgetierung an der offiziellen Preisübersicht.
Die Preisliste beantwortet die falsche Frage
Alle Angaben je Million Token:
| Modell | Eingabe | Ausgabe | Cache-Lesen |
|---|---|---|---|
| Claude Fable 5.1 | 10,00 USD | 50,00 USD | 0,25 USD |
| Claude Opus 5.5 | 4,00 USD | 20,00 USD | 0,20 USD |
| Claude Sonnet 5.5 | 2,00 USD | 10,00 USD | 0,20 USD |
| Claude Haiku 4.5 | 1,00 USD | 5,00 USD | 0,10 USD |
Das Cache-Schreiben kostet bei der Standard-Lebensdauer von fünf Minuten das 1,25-Fache des Eingabepreises, bei einer Stunde das Doppelte.
Diese Tabelle ist korrekt und für die Budgetplanung trotzdem fast nutzlos. Ihr Controlling fragt nicht, was eine Million Token kostet. Es fragt, was eine bearbeitete Reklamation, eine geprüfte Eingangsrechnung oder ein beantwortetes Kundenticket kostet. Zwischen diesen beiden Größen liegen drei Faktoren, die in keiner Preisliste stehen:
- Wie oft der Kontext pro Aufgabe erneut gesendet wird, also die Anzahl der Runden
- Wie viel das Modell denkt, bevor es antwortet (Thinking-Token werden als Ausgabe abgerechnet)
- Wie oft das Ergebnis nicht reicht und ein Mensch nacharbeiten muss
Die Kosten pro Entwickler für Coding-Assistenten haben wir in einem eigenen Beitrag durchgerechnet. Hier geht es um die Frage, die im Mittelstand häufiger auf dem Tisch liegt: Was kostet ein automatisierter Geschäftsvorgang?
Das Beispiel: ein Reklamations-Agent
Ein Maschinenbauer lässt eingehende Reklamationen von einem Claude-Agenten vorbearbeiten. Der Agent liest die Reklamation, fragt über Werkzeuge Auftragsdaten, Seriennummer, Garantiestatus und frühere Fälle ab und schreibt einen Bearbeitungsvorschlag für die Sachbearbeitung.
| Annahme | Wert |
|---|---|
| Systemanweisung und Werkzeugdefinitionen | 8.000 Token |
| Reklamation und Stammdaten beim Start | 4.000 Token |
| Runden (Werkzeugaufrufe) pro Vorgang | 10 |
| Ausgabe je Runde, inklusive Thinking | 600 Token |
| Werkzeugergebnis je Runde | 2.500 Token |
Die naive Rechnung
So sieht die Kalkulation in den meisten Business Cases aus: ein Aufruf, 12.000 Token rein, 600 Token raus.
Eingabe: 12.000 × 4,00 USD / Mio. = 0,048 USD
Ausgabe: 600 × 20,00 USD / Mio. = 0,012 USD
Summe pro Vorgang: 0,06 USD
Die tatsächliche Rechnung
Ein Agent schickt in jeder Runde alles mit, was bisher passiert ist: Systemanweisung, Werkzeuge, die Reklamation, jede frühere Modellantwort und jedes frühere Werkzeugergebnis. Die Eingabe in Runde k beträgt deshalb 12.000 + (k − 1) × 3.100 Token.
Eingabe über 10 Runden: 10 × 12.000 + 3.100 × (0+1+…+9)
= 120.000 + 139.500 = 259.500 Token
Ausgabe über 10 Runden: 10 × 600 = 6.000 Token
Ohne Prompt-Caching, Claude Opus 5.5:
Eingabe: 259.500 × 4,00 USD / Mio. = 1,038 USD
Ausgabe: 6.000 × 20,00 USD / Mio. = 0,120 USD
Summe pro Vorgang: 1,16 USD
Das ist das Neunzehnfache der naiven Schätzung. Die Eingabeseite macht knapp 90 Prozent aus, obwohl der Ausgabe-Token fünfmal so teuer ist. Und der Effekt wächst nicht linear, sondern ungefähr quadratisch mit der Rundenzahl: Ein Agent mit 20 Runden kostet nicht das Doppelte, sondern gut das Dreifache eines Agenten mit 10 Runden.
Mit Prompt-Caching: Ab Runde 2 wird der Verlauf der Vorrunde aus dem Cache gelesen, nur der neue Teil wird geschrieben.
Cache-Lesen: 219.600 × 0,20 USD / Mio. = 0,044 USD
Cache-Schreiben: 39.900 × 5,00 USD / Mio. = 0,200 USD
Ausgabe: 6.000 × 20,00 USD / Mio. = 0,120 USD
Summe pro Vorgang: 0,36 USD
Caching drückt den Vorgang von 1,16 auf 0,36 US-Dollar. Bei 2.000 Reklamationen im Monat sind das rund 720 statt 2.320 US-Dollar. Warum Caching in der Praxis oft stillschweigend nicht greift, steht im Beitrag zu Prompt-Caching. Prüfen Sie das in Ihren Logs über cache_read_input_tokens, nicht über die Konfiguration.
Der Modellvergleich, der in die Irre führt
Dieselbe Aufgabe auf Claude Sonnet 5.5 mit Caching:
Cache-Lesen: 219.600 × 0,20 USD / Mio. = 0,044 USD
Cache-Schreiben: 39.900 × 2,50 USD / Mio. = 0,100 USD
Ausgabe: 6.000 × 10,00 USD / Mio. = 0,060 USD
Summe pro Vorgang: 0,20 USD
Auf dem Papier ist Sonnet also 44 Prozent günstiger. Die Rechnung unterstellt aber, dass beide Modelle dieselbe Anzahl Runden brauchen und gleich oft zum Ziel kommen. Das ist eine Annahme, keine Messung.
Nehmen wir an, Sonnet braucht für dieselbe Reklamation 14 statt 10 Runden, weil es mehr Rückfragen an die Werkzeuge stellt. Dann steigt der Vorgang auf rund 0,29 US-Dollar. Der Vorsprung schrumpft von 16 auf 7 Cent. Ob das in Ihrem Fall so ist, wissen Sie erst, wenn Sie beide Modelle auf echten Vorgängen laufen lassen. Die Preisliste sagt darüber nichts.
Seit Claude Opus 5.5 kostet das Cache-Lesen bei Opus und Sonnet gleich viel, nämlich 0,20 US-Dollar je Million Token. Bei gut gecachten Agenten schmilzt der Preisabstand zwischen beiden Modellen deshalb auf die Ausgabe und die Cache-Schreibvorgänge zusammen. Die alte Faustregel „Sonnet ist halb so teuer“ gilt für diese Last nicht mehr.
Der Posten, der die Token-Rechnung erschlägt
Jetzt die Größe, die in keiner API-Abrechnung auftaucht. Wenn der Vorschlag des Agenten nicht reicht, übernimmt ein Sachbearbeiter.
| Annahme | Wert |
|---|---|
| Nacharbeit bei unbrauchbarem Vorschlag | 15 Minuten |
| Vollkosten Sachbearbeitung | 60 € pro Stunde |
| Kosten einer Nacharbeit | 15 € |
Die Kosten pro erledigter Aufgabe sind deshalb:
Kosten pro Aufgabe = Modellkosten + (1 − Erfolgsquote) × Nacharbeitskosten
Mit Beispielwerten, Umrechnung vereinfacht 1 USD ≈ 1 €:
| Variante | Modellkosten | Erfolgsquote | Nacharbeit anteilig | Summe |
|---|---|---|---|---|
| Modell A | 0,36 € | 90 % | 1,50 € | 1,86 € |
| Modell B | 0,20 € | 80 % | 3,00 € | 3,20 € |
Die Erfolgsquoten sind illustrativ, nicht gemessen. Das Muster gilt aber unabhängig von den konkreten Werten: Zehn Prozentpunkte Erfolgsquote sind bei 15 € Nacharbeit 1,50 € pro Vorgang wert. Das ist mehr als das Vierfache der gesamten Modellkosten auf Opus. Wer das günstigere Modell nur wegen des Token-Preises wählt, spart Cent und bezahlt Euro.
Das kann auch umgekehrt ausgehen. Wenn das günstigere Modell für Ihre Aufgabe dieselbe Erfolgsquote erreicht, ist es die richtige Wahl. Wie Sie Opus, Sonnet und Haiku den passenden Aufgaben zuordnen, steht im Beitrag zur Modellwahl. Entscheidend ist nur, dass die Entscheidung auf gemessenen Erfolgsquoten beruht und nicht auf der Preistabelle.
Die drei Stellschrauben pro Aufgabe
1. Rundenzahl senken
Die Rundenzahl ist wegen des quadratischen Wachstums der stärkste Hebel. Drei Maßnahmen wirken sofort:
- Werkzeuge bündeln: Ein Werkzeug
reklamation_kontext, das Auftrag, Seriennummer und Garantiestatus in einem Aufruf liefert, spart drei Runden gegenüber drei Einzelwerkzeugen. - Werkzeugergebnisse kürzen: Geben Sie nicht den kompletten ERP-Datensatz zurück, sondern nur die Felder, die für die Entscheidung relevant sind. Jeder eingesparte Token eines frühen Werkzeugergebnisses wird in allen folgenden Runden mitgespart.
- Pflichtdaten vorab mitgeben: Was der Agent in jedem Fall braucht, gehört in die Startnachricht und nicht in einen Werkzeugaufruf.
2. Denktiefe steuern
Bei den aktuellen Modellen denkt Claude vor der Antwort. Diese Thinking-Token werden als Ausgabe abgerechnet, auch wenn Sie sie nicht angezeigt bekommen. Gesteuert wird das über den Parameter effort mit den Stufen low, medium, high, xhigh und max.
Bei Claude Opus 5.5 ist die Voreinstellung medium, bei Claude Sonnet 5.5 high. Wer beim Modellwechsel die Einstellung aus einem älteren Projekt übernimmt, ändert damit unbemerkt seine Ausgabekosten. Für Klassifikation und Routing reicht meist low. Für die eigentliche Fallbewertung sollten Sie medium und high auf echten Vorgängen gegeneinander messen.
3. Nicht eilige Last in den Batch
Muss der Vorschlag nicht in Sekunden vorliegen, etwa bei der nächtlichen Vorbearbeitung aller Reklamationen des Tages, halbiert die Batch-API den Preis. Die Details stehen im Beitrag zur Batch-API. Die Gegenrichtung gibt es auch: Der Fast Mode für Claude Opus 5.5 liefert schnellere Antworten zum doppelten Preis (8 / 40 US-Dollar je Million Token). Er gehört nur in Anwendungen, in denen ein Mensch tatsächlich auf die Antwort wartet.
Ein Fallstrick beim Modellwechsel: der Tokenizer
Wer von einem älteren Modell wie Claude Sonnet 4.6 auf die aktuelle Generation wechselt, sollte seine Token-Zahlen neu messen. Seit Claude Opus 4.7 verwendet Anthropic einen neuen Tokenizer, der für denselben Text bis zu rund 35 Prozent mehr Token erzeugt. Ein niedrigerer Preis je Token ist deshalb nicht automatisch ein niedrigerer Preis je Vorgang. Zählen Sie mit dem Endpunkt count_tokens und der produktiven Modell-Kennung nach. Wie das geht, steht im Beitrag zum Token-Zählen.
So kommen Sie an Ihre eigene Zahl
- Zwanzig echte Vorgänge durchlaufen lassen, nicht synthetische Beispiele
- Pro Vorgang aus
usageloggen:input_tokens,cache_creation_input_tokens,cache_read_input_tokens,output_tokensund die Rundenzahl - Jeden Vorschlag fachlich bewerten lassen: brauchbar oder Nacharbeit
- Die Formel oben einsetzen, getrennt je Modell und
effort-Stufe
Der Aufwand liegt bei ein bis zwei Tagen. Danach haben Sie eine Zahl, die Ihr Controlling versteht, und eine Modellwahl, die auf Messung statt auf Preislisten beruht. Wenn die Kosten anschließend auf Abteilungen verteilt werden sollen, finden Sie die Systematik im Beitrag zur Kostenverrechnung.
Wenn Claude bei Ihnen bereits produktiv läuft und die Rechnung höher ausfällt als geplant, bietet die Pexon Consulting einen Token-Kosten-Audit für Claude an. Dabei werden die tatsächlichen Verbrauchsdaten ausgewertet und die Hebel priorisiert. Für die Planung vor dem Start gibt es die Claude-Pricing-Kalkulation, die die Bezugswege API, Bedrock, Vertex AI und Foundry gegeneinander rechnet.
Häufig gestellte Fragen
Was kostet Claude pro Anfrage?
Das hängt weniger vom Modell ab als von der Architektur. Ein einfacher Aufruf mit 12.000 Eingabe- und 600 Ausgabe-Token kostet auf Claude Opus 5.5 rund 6 Cent. Ein Agent, der für dieselbe Aufgabe zehn Werkzeugaufrufe macht, kostet ohne Caching rund 1,16 US-Dollar und mit Caching rund 0,36 US-Dollar, weil der gesamte Verlauf in jeder Runde neu gesendet wird.
Warum ist meine Claude-Rechnung viel höher als kalkuliert?
In den meisten Fällen hat die Kalkulation einen einzelnen Aufruf unterstellt, während die Anwendung als Agent in mehreren Runden arbeitet. Die Eingabe-Token wachsen dabei ungefähr quadratisch mit der Rundenzahl. Weitere häufige Ursachen sind Prompt-Caching, das wegen wechselnder Inhalte im Präfix nicht greift, sowie eine hohe effort-Einstellung, die viele Thinking-Token erzeugt.
Werden Thinking-Token berechnet, wenn ich sie nicht sehe?
Ja. Thinking-Token werden als Ausgabe-Token abgerechnet, unabhängig davon, ob die Anzeige auf zusammengefasst oder ausgeblendet steht. Die Anzeige-Einstellung ändert nur die Sichtbarkeit, nicht die Kosten. Gesteuert werden die Kosten über den Parameter effort.
Ist Claude Sonnet 5.5 immer günstiger als Claude Opus 5.5?
Pro Token ja, pro erledigter Aufgabe nicht zwingend. Bei gut gecachten Agenten kosten Cache-Lesevorgänge bei beiden Modellen gleich viel. Braucht Sonnet mehr Runden oder liefert es häufiger unbrauchbare Ergebnisse, kann der Vorteil verschwinden oder sich umkehren. Messen Sie beide Modelle auf echten Vorgängen, bevor Sie entscheiden.
Wie viel spart Prompt-Caching bei Agenten?
In unserer Beispielrechnung mit zehn Runden sinken die Kosten pro Vorgang auf Claude Opus 5.5 von 1,16 auf 0,36 US-Dollar, also um rund 70 Prozent. Je mehr Runden ein Agent macht, desto größer ist der Effekt, weil ein immer größerer Teil der Eingabe aus dem Cache gelesen wird.
Der nächste Schritt
Nehmen Sie Ihren teuersten Claude-Anwendungsfall, loggen Sie für zwanzig echte Vorgänge Token, Runden und fachliches Ergebnis, und rechnen Sie die Kosten pro erledigter Aufgabe aus. Liegt die Rundenzahl über zehn, ist das Bündeln von Werkzeugen Ihr größter Hebel, noch vor jedem Modellwechsel. Wir rechnen das gern mit Ihnen durch.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Was Claude pro Entwickler und Monat kostet — die Rechnung
Rund 126 Euro pro Entwickler und Monat bei aktiver Nutzung — mit Caching. Ohne Caching das Doppelte. Die vollständige Rechnung mit allen Annahmen offen.
Claude-Token zählen statt schätzen
Tokenizer aus dem OpenAI-Umfeld unterschätzen den Claude-Verbrauch deutlich. Der richtige Endpunkt und wie man damit budgetiert.
Claude Prompt-Caching: ab wann es sich rechnet
Cache-Lesen kostet ein Zehntel, Schreiben das 1,25-Fache. Ab der zweiten Anfrage lohnt es sich — wenn der Prefix stimmt.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)