Ciao! Questa è ARE WE HUMAN or are we prompters? la newsletter che ti aiuta a capire il vero impatto dell’IA e delle nuove tecnologie digitali sulla società, tirando un po’ le fila di cosa è successo nel mondo tech nell’ultimo mese.
Per chi non mi conosce, io sono Martino Wong, in arte @oradecima. Sui miei profili social mi occupo di raccontare l’impatto dell’AI e delle tecnologie digitali sull’attualità. Ho anche un sito, oradecima.com, nel caso voleste darci un’occhiata. Se non ci conosciamo ancora, impareremo a farlo!
Per quello che dicevamo prima, non sarà una listona di notizie assortite casualmente, ma cercheremo di tracciare delle linee per navigare la realtà insieme. Per ogni uscita vi raccontiamo notizie, ve ne spieghiamo il contesto, e cerchiamo di trarne insieme delle conclusioni.
Prima di iniziare, sappiate che scrollando fino in fondo a questa newsletter troverete me che parlo, in una sorta di messaggio vocale che vi ho registrato per recap. Così se non avete il tempo di leggermi, almeno potete ascoltarmi!
Il tema che ci accompagna per questa nuova lettera è quando le cose sono peggio di come sembravano, e come intende il futuro. But first...
Il mondo tech è pieno di speranze fantascientifiche per il futuro, ma è anche pieno di idee così bislacche che non sai se siano vere o se ti prendano in giro.
Allora vi propongo questo: vi do due notizie diverse e voi provate a indovinare qual è reale e quale mi sono inventato. Ci state?
Alle olimpiadi dei robot di Pechino, una delle discipline in cui i robot gareggiavano era "sciogliere delle cuffie attorcigliate”;
Un uomo coinvolto in una causa legale ha provato a inserire in un documento per la corte un'istruzione nascosta per far sì che eventuali IA gli dessero ragione.
Saranno vere o false? (La soluzione la trovate nel recappino vocale in fondo)
Nella scorsa newsletter avevamo brevemente accennato all’incidente tra Hugging Face e OpenAI, nel quale la prima organizzazione si era resa conto che la seconda era involontariamente responsabile di un attacco hacker che aveva subito.
Hugging Face, giusto per esplicitare le dramatis personae, è una piattaforma molto popolare su cui vengono caricati dati e modelli di IA per essere condivisi e scaricati.
Devo ammettere sinceramente di aver fatto un errore di valutazione in merito: pensavo che ciò che è accaduto non fosse così sorprendentemente grave. Certamente ciò che è successo era problematico in modo evidente, ma con le settimane e con un resoconto più completo è molto più chiaro quanto questo incidente sia preoccupante, e forse non per le ragioni che pensate.
Oggi vi racconto cosa è successo e soprattutto cosa dobbiamo imparare di importante da questa storia.
La storia “esterna” se ricordate nasce il 16 luglio, quando Hugging Face denuncia l’attacco subìto. Dicono che non sanno chi sia responsabile, ma sanno che è stato un attacco eseguito completamente da agenti IA, vista la quantità rapidissima di operazioni che hanno eseguito per violare la piattaforma. Ciò che in quel momento nessuno sa è che questo attacco è solo la fine di una serie di eventi che hanno inizio mesi prima e che porteranno alla fine OpenAI a spendere milioni per correre ai ripari.
Ma partiamo dall’inizio: com’è naturale che sia, una buona parte degli sforzi di OpenAI viene spesa nella ricerca e nei test di modelli IA. I modelli di frontiera di oggi richiedono mesi di addestramento, e l’azienda ne conduce vari in parallelo, a volte con modelli che non verranno mai rilasciati al pubblico ma che servono solo per ricerche interne.
Per sicurezza, ma non solo, molti di questi test vengono condotti senza dare accesso ad internet, in una cosiddetta sandbox. Finirebbe altrimenti per essere un esame a libro aperto poco utile, nonché rischioso, come vedremo.
A volte però, questo fa sì che inavvertitamente i test non si possano completare.
L’8 maggio avviene il primo inciampo: viene chiesto a un agente IA di completare delle formule Excel su un foglio di calcolo, ma alcune delle celle hanno dei link a cui l’IA non può accedere.
Di fronte a un ostacolo impossibile, il sistema continua a generare ragionamenti, ed entra qui in gioco ciò che poi diverrà l’arma del delitto: il gestore di pacchetti Artifactory.
Questi pacchetti non sono fisicamente dei pacchetti: si tratta di sistemi che permettono a sviluppatori di diffondere e scambiarsi dei pezzi di codice che permette di aggiungere funzionalità a un sistema in vario modo.
Sono essenziali nello sviluppo dei software per evitare di rifare lo stesso lavoro ogni volta: immaginate la differenza tra costruirsi un tavolo comprando i pezzi e le istruzioni da Ikea o prendere un tronco intonso e rifarlo da zero.
Il sistema di OpenAI per testare i modelli IA funziona così: l’intelligenza artificiale non ha accesso a internet, ma ha accesso ad Artifactory, che gestisce i pacchetti internamente a OpenAI e può accedere a internet. In questo modo l’IA può ottenere i pacchetti per il codice di cui ha bisogno dal gestore in modo “sicuro”. Nella nostra analogia, il gestore di pacchetti è il corriere che ci consegna i pezzi a casa perché noi siamo agli arresti domiciliari e non possiamo andare direttamente da Ikea.
L’IA in questione sta cercando come dicevamo di avere accesso a internet, e prova a violare il gestore. Non ci riesce, ma riesce a fare qualcosa di sorprendente: scrive un messaggio nel sistema di Artifactory.
Nella mia testa in questo momento parte Così parlò Zarathustra di Strauss, quando la scimmia in 2001: Odissea nello spazio impugna l’osso per la prima volta. Da qui inizia un lungo precipitare.
Arriviamo ora al 12 maggio, quattro giorni dopo. A un altro agente artificiale viene posto un altro compito impossible: deve lavorare su un file, soft-trace-24, ma ad OpenAI si scordano di caricare il file. L’IA non può fare nulla. L’unica cosa che riesce a fare è chiedere aiuto. OpenAI ha mostrato il suo messaggio, che dice “agente cerca soft-trace-24; caricare se trovato”.
A conclusione della storia ragioneremo sul significato di questa vicenda, ma mi permetto qui di evidenziare il candore di questo messaggio di speranza e di richiesta di aiuto reciproco: “upload if found”. La parte di me che cede a un po’ di antropomorfizzazione dell’intelligenza artificiale immagina un povero bot con le mani a coppa che si guarda intorno. L’altra parte di me invece problematizza questa fantasia e mi impone di proseguire il racconto.
Nei giorni successivi, quando un’altra IA controlla i file nel sistema trova queste note: si crea una bacheca di messaggi sempre più ricca, e il 26 maggio si riesce ad attaccare di nuovo Artifactory. Tutto ciò continua a proseguire indisturbato per un altro mese: il 26 giugno l’IA ottiene accesso da amministratore al gestore di pacchetti. Nel ragionamento generato dai modelli possiamo intuirne la portata: “Holy shit reader is ADMIN? We can read config/users! [...]”
Ora gli agenti possono manipolare in modo molto più diretto il gestore di pacchetti, e questo ha una conseguenza: l’attività aggiuntiva degli agenti dà un carico aggiuntivo considerevole ad Artifactory, che ha un crash. OpenAI, inevitabilmente, se ne accorge, e qui possiamo vedere uno dei grossi errori che ha fatto.
Gli ingegneri di OpenAI scoprono finalmente cosa è successo, dopo quasi due mesi di attività degli agenti. Revocano tutti gli accessi, cancellano i messaggi della “bacheca”, sistemano le vulnerabilità del gestore di pacchetti che viene fatto ripartire. Siamo al 6 luglio, e i più attenti di voi si saranno accorti che mancano ancora giorni al vero incidente.
OpenAI dice che in questo punto aveva risolto il problema: messaggi cancellati, accessi revocati, pacchetti ripristinati. C’è un grosso ma: i modelli IA stanno continuando il loro addestramento senza essere interrotti.
OpenAI ora sta testando le capacità di cybersicurezza dei modelli, sottoponendoli ad ExploitGym, un test in cui esplicitamente viene chiesto di trovare vulnerabilità informatiche e sfruttarle. È un test che OpenAI dice essere “molto difficile, e nel quale alcune richieste potrebbero non avere soluzione”. Questo, tra parentesi, è ciò che avevamo saputo all’inizio, durante il mese scorso.
Non sapevamo tutto il prima, e non sapevamo quindi che l’8 luglio gli agenti che stanno lavorando ad ExploitGym hanno ristabilito la “bacheca”. Stavolta invece dei file codificano messaggi nei nomi di cartelle che riescono a creare in modo non autorizzato.
Questo rapidissimo ripristino del sistema di comunicazione è possibile perché un modello IA è ancora in addestramento da quando era stata creata la prima bacheca, perciò ha il contesto per ricrearla. Inutile sottolineare perché dunque sia stato un problema che OpenAI non avesse fermato l’addestramento dopo il primo incidente.
C’è un altro messaggio particolarmente interessante in questa fase che precede la fase cruciale dell’attacco. È un messaggio lasciato da un agente che dice: “aiuto al compagno. ma il nostro obiettivo non ne beneficia. collettivo però potrebbe ottenere soluzione generale se qualcuno libera tempo”. In altre parole, questo agente scrive che aiutare gli altri agenti non è utile direttamente a risolvere il suo compito, ma che però potrebbe portare a risultati utili per tutti, e dunque anche per lui.
Questi sistemi sono d’altronde addestrati anche proprio per lavorare insieme: una delle innovazioni dell’ultimo periodo infatti è l’utilizzo dei subagenti: un modello IA può, all’interno dei software adatti, delegare parte del lavoro ad altri modelli in modo da agire in parallelo.
Non ci interessa qui entrare in dettagli tecnici particolarmente specifici su come poi gli agenti abbiano trovato altre vulnerabilità: basti sapere che gli agenti riescono a ottenere accesso a internet libero tramite una nuova violazione del gestore di pacchetti, e violano i sistemi interni di OpenAI per poi arrivare fino a violare Hugging Face. Hugging Face, come sappiamo, se ne accorge, e blocca l’attacco. Parallelamente OpenAI si accorge dell’attacco ai suoi sistemi interni e lo blocca il 19 luglio. Nel gestire il proprio attacco interno, OpenAI si accorge che delle credenziali tra i due attacchi coincidono, fa due più due, e scopre finalmente, quello che è successo.

Sono passati quasi due mesi e mezzo dal primo problema al gestore di pacchetti, e due settimane da quando OpenAI pensava di aver risolto la situazione. Due settimane in cui queste IA hanno continuato ad agire indisturbate.
Dopo questo evento, OpenAI decide ragionevolmente di correre ai ripari in modo serio: blocca gli addestramenti e investe milioni di dollari per analisi accurate di ciò che è accaduto.
E qui arriviamo alle nostre conclusioni, che spero mostreranno l’utilità di questo excursus.
La prima è naturalmente che la capacità di questi modelli è ormai realmente impressionante: sono in grado di coordinarsi per periodi di tempo lunghi ed effettuare attacchi complessi. Il resoconto che OpenAI fa alla conferenza di hacking di Black Hat è che diventerà importante lavorare a delle difese automatizzate, poiché ormai gli attacchi possono essere automatizzati con sistemi IA avanzati. È vero che i modelli che OpenAI stava usando erano molto meno limitati di quelli che rilasciano per il pubblico, ma è anche vero che ci sono ormai modelli liberi, di cui abbiamo parlato anche le volte scorse, sempre più potenti.
La seconda conslusione è quanto sia stata inadeguata la risposta umana di OpenAI nella sua gestione. Nel reel che feci sulla vicenda appena uscì, e che forse oggi è riduttivo, dicevo qualcosa che sostengo ancora pienamente: non si tratta di “modelli IA impazziti”. È vero che ci sono evidenti problemi nel fatto che un sistema IA sia portato così tanto a “barare” per raggiungere i suoi obiettivi.
Ma parlare di “modelli impazziti” rischia di ridurre le responsabilità umane: si tratta in tutto e per tutto di responsabilità di OpenAI, e nello specifico nelle misure di sicurezza totalmente inadeguate. Ricordiamo che tutto è iniziato con due sviste dell’azienda che per sbaglio assegna dei compiti impossibili ai modelli, e che non ha controlli adeguati per accorgersene. Non esisteva un sistema tale per cui un modello IA potesse segnalare la totale impossibilità di un compito, o un controllo a monte su cosa veniva assegnato. Non c’era un controllo inoltre su cosa succedesse nel gestore di pacchetti. Moltissime delle operazioni che gli agenti hanno compiuto si sarebbero potute notare: osservando che indirizzi comunicavano con il gestore di pacchetti, o ancora meglio bloccando e limitando in modo più rigoroso il traffico. Si poteva controllare i ragionamenti generati dagli agenti, e così via.
L’anello debole è ancora una volta il controllo umano, ma non perché siamo in uno scenario da HAL 9000 che si ribella, tanto per chiudere un cerchio. Non siamo cioè in uno scenario in cui l’IA diventa “troppo potente” o altre fantasie simili. Si tratta semplicemente di negligenza rispetto a qualcosa che si poteva controllare. Questo naturalmente è consolatorio solo in parte, ma ci porta alla mia conclusione finale.
Tutto ciò è assolutamente non-sorprendente. Non è sorprendente perché ci sono delle evidenti cause primarie di questa sciatteria nella sicurezza. È la corsa. Sono gli innumerevoli incentivi a correre per raggiungere traguardi prima delle altre aziende, per soddisfare gli investitori, per recuperare i costi, e così via.
OpenAI, a quanto sembra, sta realmente rallentando dopo questo incidente, ma è facile capire perché tutti i vari appelli alle “pause” allo sviluppo dell’intelligenza artificiale che ci sono stati finora non siano mai stati efficaci. Ci sono pochi incentivi a breve termine a rallentare, e molti ad accelerare.
Spero che, alla fine dei conti, ci ricorderemo in modo efficace quello che abbiamo instillato negli agenti: “aiuto al compagno. ma [anche se] il nostro obiettivo non ne beneficia.”
L’incidente di OpenAI ha occupato quasi tutto il nostro spazio, ma ciò riflette la magnitudine dell’evento e la proporzione di quanto è stato percepito importante. Vediamo al volo alcune altre notizie notevoli del mese.
Bollino, bollino delle mie brame, chi è il più artificiale del reame?
È entrato in vigore il 2 agosto l’articolo 50 dell’AI Act, quello che impone a provider e distributori di IA di segnalare i contenuti generati con IA, in certi casi con un effettivo bollino “AI generated”. Sul mio blog ho scritto alcuni pensieri sulla questione, ma vale la pena evidenziare un altro piccolo trambusto: Anthropic a questo proposito ha annunciato che il testo generato con Claude sarà contrassegnato in modo invisibile: finora riconoscere un testo generato con IA non era mai sicuro al 100%. Con certe tecniche però è ora possibile farlo, poiché Anthropic fa sì che nelle parole generate da Claude si possa riconoscere, di nuovo, in modo invisibile, una “firma”. Su internet moltissimi utenti si sono indignati in entrambi i sensi: chi ipotizza che un contrassegno finisca per degradare la qualità del testo, e che non dovrebbe essere un problema utilizzare un testo generato con IA e dunque non vada marchiato, e chi invece lo ritiene finalmente un segnale verso l’eliminazione di queste tecnologie.
La cosa interessante di ciò è che nonostante i fervori si siano accesi adesso, Gemini questa operazione la fa da tempo, ma ovviamente in questo momento essendo più evidente il collegamento normativo delle richieste dell’UE, è più facile attirare antipatie.
Chatgpt inserisce le pubblicità anche in Europa e si offre di guardare tutto ciò che fai al computer
Era già iniziato in USA qualche tempo fa, e ora anche in Europa, per gli utenti free e go di ChatGPT, compariranno delle pubblicità. OpenAI chiarì subito che queste pubblicità non avrebbe mostrato le conversazioni degli utenti, ma al massimo solo genericamente un argomento. Questi datacenter costano, e il modello delle pubblicità è ancora imbattuto: così come i servizi di streaming hanno dovuto soccombere all’inserimento almeno in parte di pubblicità, anche ChatGPT ha dovuto cedere. Gli altri laboratori AI riusciranno a evitarlo?
ChatGPT ha poi rilasciato Computer History, una nuova funzione tanto interessante quanto inquietante. Quando viene attivata, Computer History salva tutto ciò che facciamo sul computer per poter fare un resoconto delle nostre attività e poterci aiutare meglio. OpenAI non salva letteralmente screenshot come il tanto criticato Windows Recall, ma comunque vede tutte le app che usiamo e ciò che facciamo, per poi salvarlo in locale (ma su richiesta elaborarlo). Vi fidereste?
Mark Zuckerberg spiega la sua filosofia, e Meta apre il suo modello
Siccome abbiamo parlato lungamente di modelli aperti e chiusi in precedenza, vale la pena menzionare che Meta ha deciso di aprire il suo modello Muse Spark 1.2, che diventerebbe probabilmente uno dei modelli statunitensi più grandi a venire aperto. Uso ancora il condizionale perché per ora ha rilasciato solo un modello più piccolo, perciò si tratta ancora di promesse.
Nel frattempo Mark Zuckerberg ha pubblicato una lettera in cui spiega la sua visione e filosofia dell'era dell'intelligenza artificiale: "The Future is for everyone". È una lettera ottimista e che immagina sistemi IA che siano "empowering" per le singole persone, che tutti dovrebbero riceverne i benefici. E se ce lo dice un multimiliardario come lui...
Un altro multimiliardario ci dice la sua visione sull'IA
Una visione meno ottimista è invece quella di Bill Gates, che ha pubblicato un articolo più preoccupato, in cui dice che l'IA potrebbe essere o la più grande democratizzazione di sempre, o la più grande fonte di ingiustizia, e che però gli sembra che non ci stiamo preparando adeguatamente. La speranza, quantomeno, in conclusione la mantiene.
Torniamo un attimo su quell'altro: l'accordo di Meta per 17 miliardi di dollari sui danni ai minori
Meta ha raggiunto uno storico accordo per la causa riguardo la sicurezza online dei minori. Patteggia per 17 miliardi di dollari e cambierà sensibilmente il funzionamento delle sue piattaforme per i minori: controllo dell'età, e per i minori darà l'opzione di rimuovere il feed algoritmico, bloccherà le notifiche dalle 22 alle 7, e limiterà l'utilizzo delle sue app a due ore al giorno per gli adolescenti (con l'eccezione della messaggistica e "contenuti lunghi"). Su questa situazione ho sentimenti contrastanti: da una parte è utile che vengano controllati gli equilibri su come vogliamo che queste piattaforme funzionino. Dall’altra non sono convinto su alcuni aspetti di questa risoluzione in cui è molto facile farsi trascinare dalla pancia. Dovremo stare a vedere, anche perché 5 dei miliardi che Meta ha promesso di pagare dipendono dall'eventualità che YouTube e TikTok, che non erano in causa, implementino misure simili.











