20 May 2026
La vostra fattura AI: come le scelte dei modelli determinano i costi.
La battuta più utile di Sundar Pichai al Google I/O di ieri non riguardava un prodotto. Riguardava la vostra fattura AI.
Una cosa che mi sento dire spesso è che bisogna scegliere il modello giusto per quello che si sta cercando di fare. Non esiste un modello unico e l'esecuzione di tutto con il miglior modello di frontiera al massimo del ragionamento non è la soluzione.
Sundar ha detto alla sala che molte aziende stanno già esaurendo i loro budget annuali per l'intelligenza artificiale, e siamo solo a maggio. Il suo consiglio: spostate l'80% dei vostri carichi di lavoro su Gemini 3.5 Flash e potreste risparmiare oltre un miliardo all'anno. Vale la pena notare che Flash 3.5 ha un prezzo circa triplo rispetto al suo predecessore, quindi anche l'opzione "economica" di Google sta diventando più costosa.
La realtà finanziaria
Accantoniamo per un momento l'aspetto dei fornitori. L'affermazione di fondo è reale.
- Il CTO di Uber ha confermato in aprile** che l'azienda ha bruciato l'intero budget per l'AI 2026 in quattro mesi.
- Gli utenti pesanti di Claude Code costavano tra i 500 e i 2.000 dollari al mese ciascuno.
- L'adozione all'interno dell'organizzazione di 5.000 ingegneri è passata dal 32% all'84% in tre mesi. La produttività è aumentata. Il conto è salito in modo verticale.
Non è un problema di Uber. È uno schema del settore. Meta ha subito un'enorme esplosione di spesa non monitorata a causa di una classifica interna gamificata chiamata "Claudeonomics ". I dipendenti che gareggiavano per scalare la classifica hanno consumato ben 60,2 trilioni di token in un'unica finestra di 30 giorni. Alle tariffe API al dettaglio, su Opus, questo sarebbe costato circa 900 milioni di dollari.
Gli strumenti agenziali consumano token a una velocità superiore di un ordine di grandezza rispetto alla chat, e i team finanziari hanno preventivato la curva della chat.
Una questione di disciplina ingegneristica
Quasi nessuno ha bisogno del ragionamento di frontiera per la maggior parte del proprio lavoro. **Completamento del codice, riassunto, classificazione, stesura di routine, ricerche interne: **tutto questo funziona perfettamente su modelli più economici e veloci.
Riservare quelli costosi ai lavori che ne hanno effettivamente bisogno è una disciplina ingegneristica di base applicata a un nuovo input.
Le aziende che lo capiranno per prime non saranno quelle con i budget più elevati per l'intelligenza artificiale. Saranno quelle che tratteranno la selezione dei modelli come una decisione attiva piuttosto che come un'impostazione predefinita.
Il discorso di Pichai era Flash. La vera domanda è più ampia. **Qual è la vostra logica di routing?
Tradotto con DeepL.
Vuoi applicare queste idee alla tua azienda?
Se questo articolo ha sollevato una domanda utile, parliamo di dove AI, automazione o strategia di prodotto possono creare leva concreta nella tua organizzazione.
Avvia la conversazione