Modelli di intelligenza artificiale, la competizione si sposta sul prezzo dell'inferenza
OpenAI taglia il costo di GPT-5.6 Luna, Anthropic colloca Claude Opus 5 a metà del suo modello di punta, DeepSeek alza del 93% il prezzo di V4 Flash. Nello stesso quadro Alibaba pubblica Qwen 3.8 con licenza aperta e Google presenta un compilatore per l'inferenza su dati cifrati.
L’edizione del mattino non ha coperto la sezione Tech. Il fatto che vale il pezzo del pomeriggio è un cambio di terreno della competizione tra i produttori di modelli linguistici: non più i punteggi nei test di riferimento, ma il prezzo pagato per ogni milione di unità elaborate e la velocità con cui il modello risponde.
I movimenti recenti vanno in due direzioni opposte. OpenAI ha ridotto in modo sostanziale il prezzo di GPT-5.6 Luna, diventato l’impostazione predefinita per gli utenti gratuiti di ChatGPT. Anthropic ha collocato Claude Opus 5 a circa metà del prezzo del proprio modello di fascia superiore, Fable 5. In senso contrario si è mossa la cinese DeepSeek, che il 14 agosto ha aumentato del 93% il prezzo di V4 Flash, portandolo da 0,14 a 0,27 dollari per milione di unità elaborate (Tech Startups; AIToolsRecap).
| Fornitore | Mossa | Dato |
|---|---|---|
| OpenAI | Riduzione di prezzo di GPT-5.6 Luna | modello predefinito per gli utenti gratuiti |
| Anthropic | Posizionamento di Claude Opus 5 | circa metà del prezzo di Fable 5 |
| DeepSeek | Rialzo di V4 Flash (14 agosto) | +93%, da 0,14 a 0,27 dollari |
Secondo dati citati dal Financial Times e ripresi dalla rassegna tecnologica, i prezzi pagati dai clienti per i principali modelli statunitensi sono calati in misura significativa da metà luglio. Il criterio di acquisto che emerge dalle stesse fonti riguarda il rapporto tra costo dell’elaborazione e lavoro effettivamente prodotto: un parametro che favorisce i modelli efficienti rispetto a quelli semplicemente più grandi.
Perché un fornitore alza i prezzi
Il rialzo di DeepSeek è l’anomalia che rende leggibile il resto. In un mercato dove il concorrente principale taglia, aumentare del 93% il listino di una variante veloce significa o che la domanda per quella specifica configurazione eccede la capacità disponibile, o che il prezzo precedente era fissato sotto il costo. Le fonti disponibili non consentono di stabilire quale delle due ipotesi valga, e questo giornale non sceglie tra le due.
Licenze aperte e dati cifrati
Nella stessa fase si collocano due rilasci di segno diverso. Il gruppo Qwen di Alibaba ha pubblicato Qwen 3.8 27B sotto licenza Apache 2.0, modello con visione integrata che dichiara un contesto nativo di 262mila unità testuali, estendibile fino a un milione, su architettura Gated DeltaNet e Gated Attention. La variante FP8 riporta 61,7 su SWE-Bench Pro, 73,0 su Terminal-Bench 2.1 e 90,3 su LiveCodeBench v6: sono dati pubblicati dallo sviluppatore stesso, quindi misure dichiarate dalla parte interessata e non verifiche indipendenti.
Google ha presentato HEIR, catena di strumenti a codice aperto che converte modelli già addestrati per far girare l’inferenza direttamente su dati cifrati, senza che il server veda gli ingressi in chiaro. La dimostrazione ha riguardato un sistema di raccomandazione e un caso di rilevamento di frodi con carte di credito.
Su questi due rilasci la notizia proviene al momento da un’unica origine (AI Weekly, che riprende le pubblicazioni del gruppo Qwen su Hugging Face e il blog ufficiale di Google); nessuna conferma indipendente disponibile.
Il punto verificabile è il listino: il prezzo per milione di unità elaborate è pubblico per tutti i fornitori citati, e il confronto con i valori di metà luglio si può rifare tra un mese sugli stessi listini.
← Archivio · Prima pagina · Editoriali passati · Segnala un errore