Modelli e fornitori
Come funzionano i prezzi dei modelli di IA?
L'unità di base: cos'è un token?
I modelli linguistici non leggono e scrivono in parole ma in token, piccoli frammenti di testo. In media un token vale circa quattro caratteri, ovvero circa tre quarti di una parola inglese; le lingue con parole lunghe generano più token per parola. Ogni richiesta e ogni risposta viene scomposta in token e conteggiata.
- Token = unità minima di fatturazione nei prezzi IA a consumo.
- Regola pratica: ~1.000 token equivalgono a circa 750 parole inglesi; un po' meno in italiano tecnico.
- Non solo testo: anche immagini, audio e allegati vengono convertiti in equivalenti in token.
Abbonamento app o API: due mondi di fatturazione
Per gli utenti finali di solito c'è un'app di chat (come ChatGPT, Claude o Gemini) con un abbonamento mensile fisso. Paghi una tariffa forfettaria e usi il modello entro limiti di uso corretto, a prescindere dai token consumati internamente. Per sviluppatori e prodotti c'è l'API: paghi i token effettivamente usati, ma puoi integrare il modello nel tuo software.
- Abbonamento (app): prezzo fisso prevedibile, nessuna configurazione, ideale per uso personale e occasionale.
- API: costo variabile in base al consumo, piena automazione, ideale per prodotti e grandi volumi.
- I piani business ed enterprise combinano entrambi e aggiungono amministrazione, controllo accessi e garanzie sui dati.
- Alcuni fornitori offrono fatturazione a messaggio o modelli a credito prepagato come via di mezzo.
Perché i token di input e output costano in modo diverso
Nell'API, i token di input (il prompt più il contesto fornito) e i token di output (la risposta generata) hanno prezzi separati. I token di output sono quasi sempre più cari, perché generare testo è più oneroso che leggerlo. Fondamentale per il controllo dei costi: tutto il contesto inviato - istruzione di sistema, cronologia, documenti caricati - conta di nuovo come input a ogni richiesta.
- Finestra di contesto = numero massimo di token gestiti per richiesta; finestre più ampie consentono più contesto, ma ogni token inviato costa.
- Le conversazioni lunghe diventano costose perché la cronologia viene rinviata come input a ogni nuovo messaggio.
- Prompt più brevi e mirati e una selezione del contesto riducono direttamente i costi.
Sconti, caching e costi nascosti
I fornitori offrono meccanismi per ridurre i costi - e fattori che li aumentano silenziosamente. Il prompt caching addebita il contesto ricorrente a tariffa ridotta, e il batch sconta le richieste massive non urgenti. Al contrario, i modelli di ragionamento più recenti possono generare token di pensiero extra, spesso invisibili, anch'essi fatturati come output.
- Prompt caching: il contesto riutilizzato (es. un'istruzione lunga) viene addebitato a tariffa ridotta.
- Modalità batch/asincrona: sconto per attività che non devono essere immediate.
- Token di ragionamento: i passaggi interni dei modelli avanzati aumentano silenziosamente i token di output.
- La scelta del modello è la leva maggiore: i modelli più piccoli costano spesso molte volte meno per token dei modelli di punta.
Stimare i costi dell'IA: un modello mentale semplice
Per una stima API approssimativa basta una catena: token di input stimati più token di output stimati per richiesta, per numero di richieste al mese, per i prezzi dei token indicati dal fornitore. Calcola input e output separatamente, perché le tariffe differiscono. Per le app, confronta invece il prezzo dell'abbonamento con il valore atteso per utente attivo.
- Formula API: (token input + token output) x richieste x prezzo token = costo mensile approssimativo.
- Parti da un modello più piccolo e passa a uno più grande solo quando il bisogno è provato.
- Imposta limiti di output, quote d'uso e avvisi di costo prima di andare in produzione.
- Mai citare cifre attuali a memoria - controlla sempre la pagina prezzi del fornitore.
Prospettiva svizzera: valuta, protezione dei dati e governance
La maggior parte dei grandi fornitori di IA fattura in dollari USA; per i budget svizzeri si aggiungono il cambio e, a seconda dei casi, l'IVA, quindi i costi finali in CHF possono variare. Oltre al prezzo conta il trattamento: inserire dati personali nei prompt ricade sotto la nuova legge sulla protezione dei dati (revDSG/nLPD) e la vigilanza dell'IFPDT (EDOEB). L'EU AI Act ha effetto extraterritoriale e può toccare fornitori svizzeri che operano sul mercato UE.
- Calcola in CHF con un margine per le oscillazioni del cambio e possibili imposte.
- Chiarisci ubicazione dei dati, condizioni di trattamento e se i tuoi input servono all'addestramento.
- Opzioni sovrane come il modello svizzero aperto Apertus (ETH/EPFL) possono rafforzare protezione dei dati e controllo dei costi.
Domande frequenti
Quanto costa un token?
Non esiste una cifra unica affidabile, perché i prezzi variano molto per modello, fornitore e tra input e output, e cambiano spesso. I prezzi si indicano di solito per milione di token. Per i valori attuali, controlla sempre la pagina prezzi ufficiale del fornitore.
Conviene l'abbonamento o l'API?
Dipende dal modello d'uso. Per un uso personale e regolare tramite chat, l'abbonamento forfettario è di solito più prevedibile ed economico. Per un uso automatizzato, integrato nel software o molto variabile, l'API a consumo è spesso più conveniente: paghi solo ciò che usi.
Perché i token di output costano più di quelli di input?
Perché generare testo è più oneroso che leggerlo. Il modello calcola ogni token di output uno dopo l'altro, mentre il contesto di input è elaborato in un unico passaggio. Per questo i fornitori indicano di solito un prezzo per token più alto per l'output.
Cos'è la finestra di contesto e influisce sul prezzo?
La finestra di contesto è il numero massimo di token che un modello considera insieme per richiesta. Una finestra più ampia consente documenti e cronologie più lunghi, ma costa solo se la riempi davvero: paghi i token usati, non la dimensione della finestra.
Cosa sono i token di ragionamento?
I modelli recenti con forte ragionamento producono passaggi di pensiero interni prima della risposta. Questi token di ragionamento spesso non sono visibili ma vengono fatturati come token di output. Su compiti complessi possono aumentare i costi in modo sensibile: un motivo per abbinare con cura modello e compito.
Come stimo i costi dell'IA per un'azienda?
Stima i token di input e output per operazione tipica, moltiplica per il volume atteso e per i prezzi attuali del fornitore. Parti da un modello più piccolo, imposta limiti di costo e avvisi, e calcola in CHF con un margine sul cambio. Verifica inoltre i requisiti di protezione dati secondo la revDSG prima di trattare dati personali.
Termini nel glossario
AI pratica per la vostra azienda
Dall’idea alla realizzazione: vi mostriamo cosa è concretamente possibile nel vostro caso.
Richiedi una demo