20 May 2026
Ihre KI-Rechnung: Wie die Wahl des Modells die Kosten bestimmt.
Sundar Pichais nützlichster Satz auf der gestrigen Google I/O bezog sich nicht auf ein Produkt. Es ging um Ihre KI-Rechnung.
Ich höre mich selbst oft sagen, dass man das richtige Modell für das auswählen muss, was man zu tun versucht. Es gibt kein Patentrezept, und alles mit dem besten Grenzmodell bei maximaler Argumentation auszuführen, ist nicht die Lösung.
Sundar erklärte den Anwesenden, dass viele Unternehmen bereits ihre jährlichen KI-Budgets aufbrauchen, und wir haben erst Mai. Sein Vorschlag: Stellen Sie 80 % Ihrer Arbeitslasten auf Gemini 3.5 Flash um, und Sie könnten über eine Milliarde pro Jahr sparen. Erwähnenswert ist, dass Flash 3.5 selbst ungefähr das Dreifache seines Vorgängers kostet, so dass sogar Googles "billige" Option teurer wird.
Die finanzielle Realität
Lassen wir einmal den Blickwinkel des Anbieters beiseite. Die zugrunde liegende Forderung ist real.
- Der CTO von Uber bestätigte im April**, dass das Unternehmen sein gesamtes KI-Budget für 2026 in vier Monaten verbrannt hat.
- Starke Nutzer von Claude Code kosteten jeweils zwischen 500 und 2.000 Dollar pro Monat.
- Die Akzeptanz innerhalb des Unternehmens mit 5.000 Ingenieuren stieg innerhalb von drei Monaten von 32 % auf 84 %. Die Produktivität stieg. Die Rechnung ging nach oben.
Das ist kein Uber-Problem. Es ist ein Branchenmuster. Bei Meta kam es zu einem massiven, nicht überwachten Ausgabenexzess aufgrund einer internen Gamification-Rangliste namens "Claudeonomics ". Mitarbeiter, die um den Aufstieg in der Rangliste wetteiferten, verbrauchten in einem einzigen 30-Tage-Fenster die unglaubliche Summe von 60,2 Billionen Token. Zu Einzelhandels-API-Preisen hätte dies bei Opus etwa 900 Millionen Dollar gekostet.
Agententools verbrauchen Token um eine Größenordnung schneller als Chats, und die Finanzteams budgetierten auf der Chat-Kurve.
A Matter of Engineering Discipline
Fast niemand braucht Frontier Reasoning für den Großteil seiner Arbeit. Codevervollständigung, Zusammenfassung, Klassifizierung, routinemäßige Erstellung von Entwürfen, interne Nachschlagewerke: all das läuft perfekt auf billigeren, schnelleren Modellen.
Die teuren Modelle für die Aufgaben zu reservieren, die sie tatsächlich benötigen, ist eine grundlegende technische Disziplin, die auf einen neuen Input angewandt wird.
Die Unternehmen, die das als erste herausfinden, werden nicht die mit den größten KI-Budgets sein. Sie werden diejenigen sein, die die Modellauswahl als aktive Entscheidung und nicht als Standardeinstellung behandeln.
Pichais Pitch war Flash. Die eigentliche Frage ist umfassender. Was ist Ihre Routing-Logik?
Übersetzt mit DeepL.
Möchten Sie das auf Ihr Unternehmen anwenden?
Wenn dieser Beitrag eine gute Frage ausgelöst hat, sprechen wir darüber, wo KI, Automatisierung oder Produktstrategie in Ihrer Organisation praktischen Hebel schaffen können.
Gespräch starten