Ritorno
Business 10 min di lettura - 18 set. 26 - Agg. 28 sett. 26 - Félix Monnier

Bisogna temere l'esplosione del prezzo dei token ? Cinque anni di dati sul costo dell'IA generativa

Settembre 2026 - tariffe rilevate al 3 settembre 2026.
Quando un'azienda desidera automatizzare compiti grazie all'intelligenza artificiale (IA) generativa, crea una dipendenza da un fornitore di un grande modello di linguaggio (LLM), e si espone alla variazione del costo dei tokens (unità di fatturazione di questi modelli) che non padroneggia. Molti esitano quindi al momento di avviare un progetto, per paura che questo prezzo aumenti a causa di fornitori che aumenterebbero le loro tariffe una volta che i clienti sono captivi, o di prezzi d'attrazione sovvenzionati che risalirebbero all'ora di rendere redditizio. I dati di cinque anni permettono di testare entrambi.

La constatazione: a parità di prestazioni, il prezzo è diviso per dieci ogni anno, fino a un minimo

Confrontare i prezzi nel tempo richiede di ragionare a parità di qualità. Batterie di test standardizzate misurano la qualità di un modello: MMLU per la cultura generale, GPQA per le domande di livello dottorato, SWE-Bench per il codice, e le classifiche Elo di LMArena per la preferenza umana.
Queste misure rimangono imperfette, ma sono sufficienti a definire dei livelli di qualità e a porre la domanda giusta, quella del prezzo del modello meno costoso che raggiunge un dato livello in un dato momento. La risposta è senza ambiguità, e tre studi indipendenti la misurano con metodi diversi. Le tariffe pubbliche prolungano le loro serie fino al 2026.
Livello di qualitàTraiettoriaFattoreMinimo raggiuntoFonte
MMLU 42 (2021)60 $ → 0,06 $ / M tokens in 3 anni÷ 1 0000,06 $, nov. 2024a16z, « LLMflation »
MMLU 65 (2022)20 $ → 0,07 $ in 23 mesi÷ 2800,07 $, ott. 2024Stanford AI Index 2025
MMLU 86 (2023)37,50 $ → 0,11 $ in 37 mesi÷ 3300,11 $, apr. 2026Epoch AI, tariffe pubbliche
Qualità MMLU 42Qualità MMLU 65Qualità MMLU 86
plancher : le matériel et l'électricité0,01 $0,1 $1 $10 $100 $20222023202420252026$ par million de tokens×10Qualité MMLU 420,06 $Qualité MMLU 650,07 $Qualité MMLU 860,11 $GPT-3 davinci · OpenAInov. 2021 · 60 $ / M tokensGPT-3 davinci, après baisse · OpenAIsept. 2022 · 20 $ / M tokensLlama 3.2 3B · Together AInov. 2024 · 0,06 $ / M tokensplusieurs modèles au plancher · hébergeurs open-weightmars 2026 · 0,06 $ / M tokenstext-davinci-003 · OpenAInov. 2022 · 20 $ / M tokensGPT-3.5 Turbo · OpenAImars 2023 · 1,63 $ / M tokensGPT-3.5 Turbo 1106 · OpenAInov. 2023 · 0,75 $ / M tokensGemini 1.5 Flash-8B · Googleoct. 2024 · 0,07 $ / M tokensGPT-4 (8k) · OpenAImars 2023 · 37,5 $ / M tokensGPT-4 Turbo · OpenAInov. 2023 · 15 $ / M tokensGPT-4o · OpenAImai 2024 · 7,5 $ / M tokensGemini 2.0 Flash · Googlefévr. 2025 · 0,18 $ / M tokensGemini 2.5 Flash-Lite · Googlejuil. 2025 · 0,17 $ / M tokensDeepSeek V4 Flash · DeepInfraavr. 2026 · 0,11 $ / M tokens
In scala logaritmica. Le tre curve scendono parallelamente per tre anni fino a raggiungere un livello, dove il costo di un modello abbastanza piccolo si riduce al suo hardware e alla sua elettricità.
Epoch AI misura su sei benchmarks un declino mediano di un fattore cinquanta all'anno. L'ordine di grandezza prudente da considerare è una divisione per dieci ogni anno a qualità costante, e nessuna eccezione appare dal 2021. Questa pendenza dura circa tre anni per livello, il tempo di passare da decine di dollari a pochi centesimi per milione di token, poi si ferma. Il livello GPT-3 vale sei centesimi nel novembre 2024 e ancora sei centesimi nel marzo 2026, mentre il livello GPT-4 impiega quattordici mesi per scendere da diciotto a undici centesimi.
Questo fondo rende il seguito leggibile per chi progetta un'applicazione oggi. Un modello abbastanza piccolo finisce per costare il solo prezzo del suo hardware e della sua elettricità, e la curva si immobilizza lì. Il livello di qualità mirato perde quindi un fattore da cento a mille in tre anni, poi rimane a pochi centesimi per milione di token finché il costo del calcolo regge. Gli osservatori che seguono la serie annunciano ormai un ritmo da tre a cinque all'anno fino al 2027 sui livelli alti, man mano che i livelli bassi completano la loro discesa.
Un esempio numerico dà la misura di ciò che rappresenta. Una pipeline di estrazione documentale che consuma 30 milioni di token in entrata e 3 milioni in uscita ogni mese costava circa 1 080 dollari al mese sul GPT-4 del 2023. Un modello di qualità equivalente riporta la stessa fattura a poco più di 3 dollari al mese nel 2026, ovvero un costo diviso per 330 per lo stesso servizio. Lo sconto di cache, che elimina il 90 % del prezzo dell'entrata ripetuta, e lo sconto di elaborazione per lotti, che ne elimina la metà, si cumulano ancora sopra.
0 $300 $600 $900 $1 200 $2023202420252026$ par mois, à périmètre constant1 080 $/mois3 $/moisplancher tenu depuis juil. 2025GPT-4 (8k) · OpenAImars 2023 · 30 $ en entrée, 60 $ en sortieGPT-4 Turbo · OpenAInov. 2023 · 10 $ en entrée, 30 $ en sortieGPT-4o · OpenAImai 2024 · 5 $ en entrée, 15 $ en sortieGPT-4o, après reprix · OpenAIoct. 2024 · 2,5 $ en entrée, 10 $ en sortieGPT-4.1 mini · OpenAIavr. 2025 · 0,4 $ en entrée, 1,6 $ en sortieGemini 2.5 Flash-Lite · Googlejuil. 2025 · 0,1 $ en entrée, 0,4 $ en sortieDeepSeek V4 Flash · DeepInfraavr. 2026 · 0,09 $ en entrée, 0,18 $ en sortie
La stessa traiettoria appare qui in scala lineare, dove il grafico precedente dimostrava un tasso e dove questo fa sentire una fattura. Applica allo stesso volume mensile i prezzi di entrata e di uscita reali del modello più economico di qualità GPT-4 a ogni data, e si appiattisce a partire dall'estate 2025 perché la fattura ha toccato il suo fondo.

Perché nessuno può invertire questa curva

Una tendenza rassicura dal momento in cui si capisce perché si mantiene, e tre meccanismi la bloccano.
  1. Il fondo open source appartiene a tutti. A ogni livello di qualità, un modello a pesi aperti, come Llama, Mistral, DeepSeek o Qwen, arriva da dodici a ventuno mesi dopo il pioniere proprietario, e questo ritardo si accorcia. La concorrenza tra decine di fornitori cloud fissa il suo prezzo, con AWS, Azure, GCP o Groq, le cui tariffe scendono fino al costo dell'hardware e dell'elettricità. Un fornitore proprietario che aumentasse i suoi prezzi uscirebbe dal mercato. Il gennaio 2025 lo ha illustrato brutalmente, quando DeepSeek ha proposto una qualità comparabile al miglior modello di ragionamento di OpenAI per circa il 96 % più economico. Il divario è diventato strutturale, con un prezzo misto mediano di cinquantatré centesimi per milione di token presso i modelli a pesi aperti nel 2026, contro tre dollari presso i proprietari.
  2. Cambiare modello non costa quasi nulla. Il formato API di OpenAI è diventato uno standard di fatto, esposto in modo identico dalla quasi totalità del mercato. In un'applicazione i cui richiami al modello vivono dietro a uno strato di astrazione, la migrazione equivale a cambiare una configurazione e a far passare al sostituto un set di valutazione. Questa sostituibilità disciplina i prezzi meglio di una negoziazione.
  3. I prezzi attuali generano già un margine. Secondo SemiAnalysis, il margine lordo di Anthropic sulla sua API supera l'80 %, e ciò che perde denaro presso i grandi laboratori rimane l'abbonamento illimitato per il grande pubblico, a differenza del token fatturato all'uso. Nessuna perdita nascosta attende quindi di essere colmata da un aumento futuro. Il mercato va persino nella direzione opposta, poiché Google ha abbassato il prezzo di Gemini Flash del 78 % nell'agosto 2024, in reazione diretta a un lancio di OpenAI. OpenAI ha fatto lo stesso il 30 luglio 2026, tagliando dell'80 % la tariffa di GPT-5.6 Luna, riportata da un dollaro a venti centesimi per milione di token in entrata.
Due motori fisici si aggiungono a questi meccanismi di mercato. L'efficienza algoritmica raddoppia le prestazioni per parametro ogni 3,3 mesi circa, e l'hardware segue la stessa pendenza, con una GPU H100 passata da circa otto dollari l'ora a fine 2024 a meno di due dollari presso i fornitori più economici nel 2026.

Le quattro sfumature da conoscere

La frontiera assoluta, invece, aumenta di prezzo. Il costo del miglior modello del momento aumenta di un fattore da tre a diciotto all'anno, secondo lo studio MIT « The Price of Progress », perché ogni guadagno marginale richiede più calcolo. Le tariffe di settembre 2026 lo dimostrano, con GPT-6 Astra a dieci dollari per milione di token in entrata e cinquanta in uscita, quando i livelli Pro salgono a trenta e centottanta dollari. Mantenere il livello di qualità della tua applicazione segue una traiettoria discendente, mentre inseguire l'ultimo modello può seguire una traiettoria ascendente.
Il numero di token per compito aumenta. I modelli di ragionamento fatturano token intermedi invisibili, e le architetture agentive consumano da dieci a cento volte di più di una semplice chiamata. A perimetro costante, il costo per compito diminuisce, e risale non appena il perimetro si arricchisce.
L'energia e l'hardware rallentano la pendenza senza raddrizzarla. La tensione sulla memoria HBM si mantiene fino al 2027, l'elettricità costa di più, e gli hyperscaler investono circa 700 miliardi di dollari nel 2026. Questi attriti sono reali, e il fondo si mantiene nonostante essi, sostenuto da modelli sempre più piccoli su hardware sempre più efficiente.
Il vero rischio è il ritiro dal catalogo. I fornitori lasciano i prezzi dei loro vecchi modelli inalterati e ritirano questi modelli dal catalogo, con preavvisi constatati di circa sei mesi presso OpenAI e di almeno sessanta giorni presso Anthropic. L'esempio è in corso, poiché OpenAI ha annunciato il 22 aprile 2026 il ritiro raggruppato di GPT-3.5 Turbo, GPT-4, GPT-4 Turbo, o1, o3-mini e o4-mini al 23 ottobre 2026. Per un'applicazione fissa su un modello, questo impone una manutenzione a data, e il successore risulta in pratica meno costoso a qualità superiore.

Ciò che ne deriva per la progettazione

Il comportamento del costo di un'applicazione nel tempo dipende dalla sua architettura molto più che dal mercato. Quattro principi bastano a collocarla sulla frontiera dei prezzi, a distanza dalla griglia tariffaria di un unico fornitore.
  1. Si isola la chiamata al modello dietro a uno strato di astrazione, in modo che ogni cambiamento di modello diventi un cambiamento di configurazione.
  2. Si mantiene un set di valutazione di business, versionato, che qualifica un modello sostitutivo in pochi giorni, per cogliere un calo di prezzo come per assorbire una deprecazione.
  3. Si misura il costo per compito, alla scala che distingue la deflazione del mercato dall'inflazione dei propri usi.
  4. Si esplicita la politica di migrazione, perché nel periodo studiato, un modello di qualità equivalente e almeno tre volte più economico è apparso ogni sei a dodici mesi.
Per un'applicazione progettata secondo questi principi, a perimetro costante, il costo di inferenza diminuisce per circa tre anni, poi si assesta su un fondo che il mercato mantiene a pochi centesimi per milione di token, e nessun fornitore può decidere diversamente, poiché il fondo open source e la tua capacità di allontanarti gli sfuggono entrambi.

Fonti: a16z, « Welcome to LLMflation » (2024) · Epoch AI, « LLM inference price trends » (2025) · Stanford HAI, AI Index 2025 · Gundlach et al., « The Price of Progress » (arXiv:2511.23455) · Xiao et al., « Densing Law of LLMs » (Nature Machine Intelligence) · SemiAnalysis (2026) · griglie tariffarie e calendari di deprecazione degli editori. I prezzi «misti» di entrata e uscita sono ponderati tre a uno, secondo la convenzione di Epoch AI, e sono prezzi pubblicati, al netto di sconti, quindi maggiorati. I punti posteriori a febbraio 2025 sono ricostruiti a partire dalle tariffe pubbliche, non avendo Epoch AI pubblicato oltre questa data.
Questo studio proviene dal team Data & IA di Galadrim. I clienti dell'agenzia pagano la loro inferenza direttamente presso i fornitori, senza intermediazione sul run, e la questione ritorna abbastanza spesso da meritare una risposta basata sui dati. I principi di progettazione sopra indicati sono quelli che il team applica ai propri progetti.

FAQ

Il costo dell'intelligenza artificiale esploderà una volta che ne dipenderemo?

Tre ragioni rendono questa paura improbabile, e sono collegate. Modelli ad accesso libero raggiungono ogni livello di qualità dodici-ventuno mesi dopo i modelli proprietari, e la concorrenza tra i fornitori di hosting riporta il loro prezzo al costo della macchina e dell'elettricità. Cambiare fornitore richiede oggi pochi giorni di lavoro, e le tariffe applicate generano già un margine confortevole, quindi non ci sono ulteriori aumenti in arrivo per coprire perdite nascoste.

Dobbiamo aspettare che i prezzi scendano ancora prima di lanciare un progetto?

Gli attuali livelli di qualità hanno già raggiunto il loro prezzo minimo, e lo mantengono dal 2024. Aspettare, quindi, posticipa il valore d'uso senza alleggerire la fattura. La vera precauzione riguarda la progettazione, poiché un progetto che mantiene la libertà di cambiare modello beneficia di ogni futura riduzione.

Siamo prigionieri del nostro fornitore di intelligenza artificiale?

I fornitori propongono interfacce molto simili tra loro, tanto che sostituire un modello con un altro equivale a cambiare un'impostazione, quindi a verificare la qualità sui tuoi stessi documenti. Questa verifica si basa su una serie di casi di riferimento, creata una volta e riutilizzata ad ogni cambio. Un'azienda che mantiene questa serie ha il controllo nella negoziazione, poiché andarsene le costa poco.

Cosa succede se il fornitore interrompe il modello che utilizziamo?

I fornitori annunciano queste interruzioni in anticipo, con preavvisi constatati di circa sei mesi presso OpenAI e di almeno sessanta giorni presso Anthropic. Il modello successivo risulta in pratica meno costoso e di qualità superiore. Il passaggio richiede quindi pochi giorni di verifica, se la serie di casi di riferimento esiste già.

Quale parte del budget un progetto di questo tipo dedica all'intelligenza artificiale?

Il consumo del modello raramente incide maggiormente sulla fattura totale. Per la rifatturazione energetica realizzata con Eiffage Energie Systèmes, un conteggio si attesta tra dieci e venticinque centesimi di modello, mentre la sua revisione da parte di un gestore rimane la voce principale. Il resto del budget è destinato all'integrazione nel sistema informativo e al supporto dei team.

Dobbiamo ospitare l'intelligenza artificiale internamente per controllare i costi?

Il prezzo minimo di mercato deriva già dalla concorrenza tra i fornitori di hosting, e eguagliarlo internamente richiede un volume importante e regolare. L'hosting interno si decide quindi sulla sovranità o sulla riservatezza dei dati, piuttosto che sulla fattura. L'articolo sull'agente di rifatturazione di Eiffage mostra che un progetto ben concepito mantiene comunque la libertà di spostare il proprio modello.

Desideri essere accompagnato per lanciare il tuo progetto digitale ?

Invia il tuo progetto ora