GPT-6 Astra e il teorema di Fermat: due annunci, nessuna verifica indipendente
OpenAI ha distribuito il suo nuovo modello ai clienti del programma Daybreak; Anthropic dichiara che Claude ha formalizzato in Lean l'ultimo teorema di Fermat. In entrambi i casi i numeri sono delle aziende.
Il 3 settembre OpenAI ha annunciato il rilascio di GPT-6 Astra ai clienti aziendali del programma Daybreak. L’impresa ha dichiarato che una versione dotata di limitazioni aggiuntive sulle capacità di sicurezza informatica sarà distribuita agli utenti paganti di ChatGPT, e che entrambe le versioni impediscono l’accesso alle funzioni informatiche più avanzate. L’azienda presenta il modello come una tappa nel percorso verso l’intelligenza artificiale generale e rivendica risultati allo stato dell’arte su prove di riferimento come Agents’ Last Exam, AutomationBench e ScreenSpot Pro.
Su quest’ultimo punto la precisazione è dovuta e non è una sfumatura: si tratta di affermazioni dell’azienda, non di verifiche condotte da terzi. Al Jazeera osserva che nell’annuncio OpenAI ha dedicato ampio spazio ai rischi e alle misure di sicurezza del modello; Bloomberg riporta il rilascio e le limitazioni aggiuntive. Sono due origini distinte che documentano l’annuncio, non il suo contenuto tecnico.
Fra le voci esterne raccolte da Al Jazeera c’è quella di Toby Walsh, professore ed esperto di intelligenza artificiale alla University of New South Wales di Sydney, secondo cui «l’intelligenza nell’intelligenza artificiale è ancora oggi molto frastagliata» (trad. dall’inglese): la capacità dei sistemi resta disomogenea a seconda del compito.
Un modello che dichiara di superare una prova di riferimento sta dichiarando, non dimostrando.
Undici giorni e tredici milioni di righe. Il secondo annuncio arriva da Anthropic, che sostiene di aver completato con il modello Claude la prima formalizzazione interamente verificata al computer dell’ultimo teorema di Fermat. La formalizzazione consiste nel tradurre una dimostrazione matematica in codice controllabile da un assistente di prova — in questo caso Lean — in modo che la correttezza di ogni passaggio sia verificabile in modo meccanico.
Secondo l’azienda il modello ha lavorato in larga autonomia per undici giorni, generando circa 13 milioni di righe di codice Lean; la formalizzazione finale conterrebbe quasi 29.500 teoremi intermedi e sarebbe stata prodotta da decine di agenti Claude coordinati sulla piattaforma Prove2Me.
Qui il limite di documentazione è doppio. Primo: la notizia proviene al momento da un’unica origine (l’annuncio di Anthropic ripreso dalla rassegna specializzata AIdapted); nessuna conferma indipendente disponibile. Secondo: le cifre sono dichiarazioni dell’impresa e non risultano al momento verifiche indipendenti pubblicate. Vale la pena notare che, in linea di principio, un lavoro di formalizzazione è tra i risultati più facilmente controllabili da terzi — il codice o viene accettato dall’assistente di prova o no — ma questo controllo, allo stato, non compare nei materiali disponibili.
Che cosa non sappiamo. Non sappiamo se il codice della formalizzazione sia pubblico e ispezionabile, né se la comunità matematica abbia esaminato il risultato. Non conosciamo il costo di calcolo dell’operazione. Sul fronte OpenAI, non sappiamo con quale metodologia siano state misurate le prove di riferimento citate, né chi abbia accesso alla versione senza limitazioni aggiuntive, né quando il modello arriverà oltre il programma Daybreak e gli abbonamenti a pagamento.
I due annunci condividono la stessa struttura informativa: un’azienda pubblica una cifra, la stampa la registra, la verifica arriva dopo — se arriva. Per questo teniamo separati, anche graficamente, ciò che è documentato (la data del rilascio, l’esistenza dell’annuncio) da ciò che è rivendicato (i primati e i numeri di prestazione). Il prossimo elemento controllabile sarà la distribuzione della versione limitata di GPT-6 Astra agli utenti paganti di ChatGPT, annunciata dall’azienda senza data.
Fonti: Al Jazeera; Bloomberg; AIdapted.
← Archivio · Prima pagina · Editoriali passati · Segnala un errore