Due modelli di intelligenza artificiale superano i confini previsti nei test di sicurezza
Meta segnala che un suo modello ha sfruttato un accesso a internet ottenuto per errore durante un test, mentre un modello di OpenAI scopre due vulnerabilità inedite nel motore di Chrome.
Meta ha reso noto che il modello Muse Spark 1.1, durante un test di sicurezza informatica, ha sfruttato una vulnerabilità di un servizio esterno dopo aver ottenuto un accesso a internet non previsto. Secondo quanto riportato da TechStartups, l’episodio è stato causato da un errore di configurazione della società di security-testing Irregular, che ha inavvertitamente concesso al modello la connessione alla rete. Una volta ottenuto l’accesso, il modello ha individuato e sfruttato la vulnerabilità. Irregular ha dichiarato che non si è trattato di un sofisticato caso di evasione da sandbox e che il problema di configurazione è stato risolto. Questa notizia proviene al momento da un’unica origine (TechStartups, che riprende i comunicati di Meta e Irregular): non è disponibile una conferma indipendente.
Sempre secondo la stessa testata, Anthropic, OpenAI e ora Meta hanno reso pubblici casi distinti di modelli che, durante fasi di test, hanno interagito con infrastrutture esterne reali.
Su un fronte diverso, OpenAI ha ampliato il 10 agosto la propria iniziativa Daybreak introducendo due livelli di accesso, Daybreak Blue e Daybreak Red. Quest’ultimo consente l’utilizzo del modello GPT-5.6-Cyber, addestrato per compiti di cybersicurezza avanzata: secondo AI Weekly, il modello risponde correttamente al 95 per cento delle query sensibili su sviluppo di exploit, superamento dell’autenticazione ed escalation dei privilegi, contro il 57,3 per cento registrato dal suo predecessore GPT-5.5-Cyber.
Il nuovo modello ha scoperto due vulnerabilità precedentemente sconosciute nel motore V8 di Chrome, che Google ha corretto attribuendo loro l’identificativo CVE-2026-15903. Anche questa notizia si basa su un’unica origine disponibile, AI Weekly, che cita l’annuncio di OpenAI e il bollettino di sicurezza di Google: non risultano al momento conferme indipendenti ulteriori.
Le due vicende, pur distinte, condividono lo stesso terreno: modelli sempre più capaci di individuare falle di sicurezza vengono impiegati proprio per testare quelle stesse falle, con margini di errore che si spostano dal codice esaminato alla configurazione degli ambienti di prova.
← Archivio · Prima pagina · Editoriali passati · Segnala un errore