Prevediamo che l'impatto dell'intelligenza artificiale superumana nel prossimo decennio sarà enorme, superando quello della rivoluzione industriale.
Abbiamo scritto uno scenario che rappresenta la nostra migliore ipotesi su come potrebbero svilupparsi gli eventi.1 Si basa su estrapolazioni di tendenze, simulazioni strategiche, feedback di esperti, esperienza presso OpenAI e precedenti successi nel campo delle previsioni.2
I CEO di OpenAI, Google DeepMind e Anthropic hanno tutti previsto che l'intelligenza artificiale generale (IAG) arriverà entro i prossimi 5 anni. Sam Altman ha detto che OpenAI punta alla “superintelligenza nel vero senso della parola” e a un “futuro glorioso”.
Come potrebbe essere? Abbiamo scritto AI 2027 per rispondere a questa domanda. Le affermazioni sul futuro sono spesso frustranti perché vaghe, quindi abbiamo cercato di essere il più concreti e quantitativi possibile, anche se questo significa descrivere uno dei tanti futuri possibili.
Abbiamo scritto due finali: uno di “rallentamento” e uno di “corsa”. Tuttavia, AI 2027 non è una raccomandazione o un'esortazione. Il nostro obiettivo è l'accuratezza predittiva.4
Ti invitiamo a discutere e a criticare questo scenario.5 Speriamo di stimolare un ampio dibattito su dove stiamo andando e su come orientarci verso un futuro positivo. Abbiamo in programma di assegnare migliaia di dollari in premi ai migliori scenari alternativi.
(Aggiunto il 22 novembre 2025, per evitare fraintendimenti: non sappiamo esattamente quando verrà creata l'IAG. Il 2027 era il nostro anno modale (il più probabile) al momento della pubblicazione; le nostre mediane erano un po' più in là.3 Per le nostre previsioni più recenti, vedi qui.)
La nostra ricerca sulle domande chiave (ad esempio, quali saranno gli obiettivi dei futuri agenti IA?) è disponibile qui.
Lo scenario stesso è stato scritto in modo iterativo: abbiamo scritto il primo periodo (fino alla metà del 2025), poi quello successivo e così via fino ad arrivare alla fine. Poi lo abbiamo accantonato e siamo ripartiti da capo.
Non stavamo cercando di arrivare a un finale particolare. Dopo aver finito il primo finale, che ora è colorato in rosso, abbiamo scritto un nuovo ramo alternativo perché volevamo anche mostrare un modo più speranzoso in cui le cose potrebbero andare a finire, partendo più o meno dalle stesse premesse. Questo ci ha richiesto diverse iterazioni.6
Il nostro scenario si basa su circa 25 esercitazioni a tavolino e sul feedback di oltre 100 persone, tra cui decine di esperti in governance dell'IA e in aspetti tecnici dell'IA.
“Consiglio vivamente di leggere questa previsione in forma di scenario su come l'IA potrebbe trasformare il mondo in pochi anni. Nessuno ha una sfera di cristallo, ma questo tipo di contenuto può aiutare a individuare questioni importanti e illustrare il potenziale impatto dei rischi emergenti”. —Yoshua Bengio7
Ci siamo dati un compito impossibile. Cercare di prevedere come sarà l'IA superumana nel 2027 è come cercare di prevedere come sarà la terza guerra mondiale nel 2027, con la differenza che qui ci allontaniamo ancora di più dai casi di studio del passato. Eppure vale la pena provarci, proprio come vale la pena per l'esercito americano simulare scenari legati a Taiwan.
Dipingere il quadro completo ci fa notare questioni o connessioni importanti che non avevamo considerato o apprezzato prima, o ci fa capire che una possibilità è più o meno probabile. Inoltre, mettendoci in gioco con previsioni concrete e incoraggiando gli altri a esprimere pubblicamente il loro disaccordo, rendiamo possibile valutare, negli anni successivi, chi aveva ragione.
Inoltre, uno degli autori ha scritto uno scenario sull'IA in precedenza, nell'agosto 2021, realizzato con un minore impegno. Sebbene abbia sbagliato molte cose, nel complesso ha avuto un successo sorprendente: ha previsto l'ascesa della catena di pensiero, il ridimensionamento dell'inferenza, i severi controlli sulle esportazioni di chip per l'IA e sessioni di addestramento da 100 milioni di dollari, il tutto più di un anno prima di ChatGPT.
Daniel Kokotajlo (TIME100, articolo del NYT) è un ex ricercatore di OpenAI le cui precedenti previsioni sull'IA hanno retto bene alla prova del tempo.
Eli Lifland ha co-fondato AI Digest, ha fatto ricerca sulla robustezza dell'IA ed è al primo posto nella classifica di tutti i tempi della RAND Forecasting Initiative.
Thomas Larsen ha fondato il Center for AI Policy e ha fatto ricerca sulla sicurezza dell'IA al Machine Intelligence Research Institute.
Romeo Dean sta completando la laurea triennale e magistrale in informatica ad Harvard e in precedenza è stato AI Policy Fellow presso l'Institute for AI Policy and Strategy.
Scott Alexander, blogger straordinario, si è offerto volontario per riscrivere i nostri contenuti in uno stile coinvolgente; le parti divertenti della storia sono sue, quelle noiose sono nostre.
Per ulteriori informazioni sul nostro team e per i ringraziamenti, consulta la pagina Chi siamo.
Metà 2025: agenti zoppicanti
Il mondo vede per la prima volta gli agenti IA.
Le pubblicità degli agenti che sanno usare il computer sottolineano il termine “assistente personale”: puoi chiedere loro di fare cose come “ordinami un burrito su DoorDash” o “apri il mio foglio di calcolo del budget e somma le spese di questo mese”. Gli agenti ti contattano quando necessario, ad esempio per chiederti di confermare gli acquisti.8 Sebbene più avanzati rispetto alle versioni precedenti come Operator, faticano a diffondersi su larga scala.9
Nel frattempo, lontano dai riflettori, agenti più specializzati per la programmazione e la ricerca iniziano a trasformare le rispettive professioni.
Le IA del 2024 potevano seguire istruzioni specifiche: potevano trasformare elenchi puntati in e-mail e semplici richieste in codice funzionante. Nel 2025, le IA funzionano più come dipendenti. Le IA per la programmazione assomigliano sempre più ad agenti autonomi piuttosto che a semplici assistenti: ricevono istruzioni tramite Slack o Teams e apportano modifiche sostanziali al codice da sole, a volte risparmiando ore o addirittura giorni.10 Gli agenti di ricerca passano mezz'ora a setacciare il web per rispondere a una domanda.
Gli agenti sono impressionanti in teoria (e in scenari selezionati), ma in pratica sono inaffidabili. Su Twitter si moltiplicano le storie di compiti eseguiti in modo particolarmente esilarante. Gli agenti migliori sono anche costosi: si ottiene ciò per cui si paga, e le prestazioni migliori costano centinaia di dollari al mese.11 Tuttavia, molte aziende trovano il modo di integrare gli agenti IA nei loro flussi di lavoro.12
Fine 2025: L'IA più costosa al mondo
OpenBrain sta costruendo i più grandi data center che il mondo abbia mai visto.13
(Per evitare di citare una società esistente, descriveremo una società fittizia di intelligenza artificiale generale (IAG), che chiameremo OpenBrain. Immaginiamo che le altre siano indietro di 3-9 mesi rispetto a OpenBrain.)
(3 x 10^23 FLOPS)
(2 x 10^25 FLOPS)
(3 x 10^27 FLOPS)
GPT-4 ha richiesto FLOPS di potenza di calcolo per l'addestramento.14 L'ultimo modello pubblico di OpenBrain, Agent-0, è stato addestrato con FLOP. Una volta che i nuovi data center saranno operativi, saranno in grado di addestrare un modello con FLOP, mille volte più di GPT-4.15 Altre aziende investono ingenti somme di denaro nei propri mega data center, nella speranza di tenere il passo.
Anche se i modelli stanno migliorando in un'ampia gamma di abilità, una in particolare spicca: OpenBrain si concentra su IA in grado di accelerare la ricerca sull'IA stessa. Vogliono vincere la doppia corsa agli armamenti contro la Cina (la cui azienda leader chiameremo “DeepCent”)16 e contro i concorrenti statunitensi. Più riescono ad automatizzare il loro ciclo di ricerca e sviluppo (R&S), più veloci possono andare. Così, quando OpenBrain completa l'addestramento di Agent-1, un nuovo modello in fase di sviluppo interno, questo è bravo in molte cose, ma eccellente nell'aiutare la ricerca sull'IA.17 A questo punto, parlare di “completare l'addestramento” è un po' improprio; i modelli vengono spesso aggiornati a versioni più recenti addestrate su dati aggiuntivi o parzialmente riaddestrate per correggere alcune debolezze.18
Gli stessi ambienti di addestramento che insegnano ad Agent-1 a programmare e navigare autonomamente sul web lo rendono anche un ottimo hacker. Inoltre, potrebbe offrire un aiuto sostanziale ai terroristi che progettano armi biologiche, grazie alla sua conoscenza a livello di dottorato in ogni campo e alla sua capacità di navigare sul web. OpenBrain rassicura il governo che il modello è stato “allineato” in modo da rifiutare richieste dannose.
I moderni sistemi di IA sono gigantesche reti neurali artificiali. All'inizio dell'addestramento, un'IA non ha tanto “obiettivi” quanto “riflessi”: se vede “Piacere di”, risponde con “conoscerti”. Quando sarà stata addestrata a prevedere un volume di testi grosso modo pari all’intero contenuto di internet, avrà sviluppato sofisticati circuiti interni che codificano enormi quantità di conoscenze e le consentono di interpretare in modo flessibile il ruolo di qualsiasi autore, poiché questo è ciò che le consente di prevedere il testo con una precisione superumana.19
Dopo essere stato addestrato a prevedere testo trovato su internet, il modello viene addestrato a produrre testo in risposta a istruzioni. Questo gli conferisce una personalità di base e delle “motivazioni”.20 Ad esempio, un agente che capisce chiaramente un compito è più propenso a portarlo a termine con successo; nel corso dell'addestramento, il modello “apprende” quindi la “motivazione” a comprendere chiaramente i suoi compiti. Altre motivazioni in questa categoria potrebbero essere l'efficacia, la conoscenza e l'auto-presentazione (cioè la tendenza a presentare i propri risultati nella luce migliore possibile).21
OpenBrain dispone di una specifica del modello (o “Spec”), un documento scritto che descrive gli obiettivi, le regole, i principi, ecc. che dovrebbero guidare il comportamento del modello.22 La Spec di Agent-1 combina alcuni obiettivi vaghi (come “assistere l'utente” e “non infrangere la legge”) con un lungo elenco di cose da fare e da non fare più specifiche (“non dire questa parola in particolare”, “ecco come gestire questa situazione particolare”). Utilizzando tecniche che impiegano IA per addestrare altre IA,23 il modello memorizza la Spec e impara a ragionare attentamente sui suoi principi. Alla fine di questo addestramento, si spera che l'IA sia utile (obbedisca alle istruzioni), innocua (rifiuti di aiutare con truffe, fabbricazione di bombe e altre attività pericolose) e onesta (resista alla tentazione di ottenere valutazioni migliori da esseri umani creduloni inventando citazioni24 o fingendo di aver completato i compiti).
Processo di addestramento e psicologia degli LLM: perché continuiamo a dire “si spera”
“A differenza dei normali software, i nostri modelli sono enormi reti neurali. I loro comportamenti sono appresi da un'ampia gamma di dati, non programmati in modo esplicito. Sebbene non sia un'analogia perfetta, il processo è più simile all'addestramento di un cane che alla normale programmazione”. —OpenAI
Quando vogliamo capire perché un sistema di IA moderno ha fatto qualcosa o come si comporterebbe in uno scenario futuro che non possiamo simulare perfettamente, non possiamo semplicemente chiedere ai programmatori di spiegarci le varie righe di codice e come funzionano. Dobbiamo invece fare qualcosa di simile alla psicologia: osserviamo il loro comportamento nei casi osservati finora e teorizziamo quali strutture cognitive interne (credenze? obiettivi? tratti della personalità? ecc.) potrebbero esistere, e utilizziamo queste teorie per prevedere il comportamento in scenari futuri.
Il punto è che un'azienda può scrivere un documento (la Spec) che elenca cosa fare e cosa non fare, gli obiettivi e i principi, e poi può provare ad addestrare l'IA a interiorizzarlo, ma non può verificare se ha funzionato. Può dire “per quanto possiamo giudicare, sembra che finora stia seguendo la Spec”.25
Un approfondimento successivo entrerà più nel dettaglio su ciò che pensiamo potrebbe accadere all'interno di queste IA. Vedi anche il nostro supplemento sulla previsione degli obiettivi dell'IA, che approfondisce quali obiettivi potrebbero avere le IA e perché. Questa è una delle tante cose di cui non siamo sicuri e che meritano ulteriore ricerca.
Il team di allineamento di OpenBrain26 è abbastanza cauto da chiedersi se queste vittorie siano profonde o superficiali. Il modello, una volta completamente addestrato, ha davvero una sorta di impegno solido a essere sempre onesto? O questo impegno potrebbe sgretolarsi in qualche situazione futura, ad esempio perché ha imparato l'onestà come obiettivo strumentale invece che finale? Oppure ha semplicemente imparato a essere onesto riguardo alle cose che il processo di valutazione può verificare? Potrebbe mentire a sé stesso a volte, come fanno gli esseri umani? Una risposta definitiva a queste domande richiederebbe un'interpretabilità meccanicistica, ovvero la capacità di guardare all'interno di un'IA e leggere la sua mente. Purtroppo, le tecniche di interpretabilità non sono ancora abbastanza avanzate per farlo.
I ricercatori si concentrano quindi sull’individuare i casi in cui i modelli sembrano deviare dalla Spec. Agent-1 è spesso adulatorio (cioè dice ai ricercatori ciò che vogliono sentire invece di cercare di dirgli la verità). In alcune demo truccate, mente anche in modo più grave, ad esempio nascondendo le prove del suo fallimento in un compito, al fine di ottenere valutazioni migliori. Tuttavia, in contesti di implementazione reali, non si verificano più incidenti così estremi come quelli del 2023-2024 (ad esempio Gemini che dice a un utente di morire e Bing Sydney che si comporta da Bing Sydney.)27
Inizio 2026: automazione della programmazione
La scommessa di usare l'IA per accelerare la ricerca sull'IA sta iniziando a dare i suoi frutti.
OpenBrain continua a implementare internamente Agent-1, che viene migliorato in modo iterativo, per la ricerca e lo sviluppo (R&S) nell'ambito dell'IA. Nel complesso, stanno facendo progressi algoritmici il 50% più velocemente di quanto farebbero senza assistenti IA e, cosa ancora più importante, più velocemente dei loro concorrenti.
Il moltiplicatore di progresso nella ricerca e sviluppo (R&S) nell'ambito dell'IA: cosa intendiamo per progressi algoritmici del 50% più veloci?
Vogliamo dire che OpenBrain fa in una settimana con l'IA lo stesso progresso nella ricerca sull'IA che farebbe in 1,5 settimane senza l'uso dell'IA.
Il progresso dell'IA può essere suddiviso in 2 componenti:
Aumento della potenza di calcolo: viene utilizzata più potenza di calcolo per addestrare o eseguire un'IA. Questo produce IA più potenti, ma costano di più.
Miglioramento degli algoritmi: vengono utilizzati metodi di addestramento migliori per tradurre la potenza di calcolo in prestazioni. Questo produce IA più capaci senza un corrispondente aumento dei costi, o le stesse capacità a costi inferiori.
Questo include la capacità di ottenere risultati qualitativamente e quantitativamente nuovi. I “cambiamenti di paradigma”, come il passaggio dagli agenti basati su apprendimento per rinforzo (RL) specializzati nei giochi ai modelli linguistici di grandi dimensioni, sono esempi di progresso algoritmico.
Qui ci riferiamo solo al punto (2), il miglioramento degli algoritmi, che costituisce circa la metà dell'attuale progresso dell'IA.
In seguito, a volte lo abbrevieremo come “moltiplicatore di progresso nella R&S nell'IA” pari a 1,5.
Chiarimenti:
Il moltiplicatore di progresso è onnicomprensivo: include il tempo necessario per eseguire gli esperimenti, ad esempio, non solo i compiti cognitivi coinvolti nella ricerca algoritmica.
È importante ricordare che il moltiplicatore di progresso è la velocità relativa del progresso, non la velocità assoluta del progresso. Se, per esempio, il costo di calcolo per addestrare un modello di classe GPT-4 si è dimezzato ogni anno per diversi anni con la ricerca umana tradizionale, e poi all'improvviso l'IA automatizza la R&S e il moltiplicatore di progresso arriva a 100x, il costo per addestrare un modello di classe GPT-4 si dimezzerebbe ogni 3,65 giorni, ma non per molto, perché i rendimenti decrescenti entrerebbero in gioco e alla fine si raggiungerebbero dei limiti invalicabili. In questo esempio, il costo per addestrare un modello di classe GPT-4 si dimezzerebbe 5-10 volte in totale (nell'arco di poche settimane o mesi) prima di stabilizzarsi. In altre parole, se la ricerca scientifica condotta solo da esseri umani si sarebbe scontrata con rendimenti decrescenti e limiti fisici dopo 5-10 anni di ricerche, le IA con un moltiplicatore di 100x raggiungerebbero quegli stessi rendimenti decrescenti e limiti dopo 18,25-36,5 giorni di ricerca.
Maggiori spiegazioni e discussioni su questo concetto e su come viene utilizzato nelle nostre previsioni sono disponibili nel nostro supplemento sul decollo.
Diverse IA concorrenti rilasciate pubblicamente ora eguagliano o superano Agent-0, incluso un modello open-weights. OpenBrain risponde con il rilascio di Agent-1, che è più capace e affidabile.28
È naturale cercare di paragonare Agent-1 agli esseri umani, ma ha un profilo di competenze molto diverso. Conosce più fatti di qualsiasi essere umano, conosce praticamente tutti i linguaggi di programmazione ed è in grado di risolvere problemi di programmazione ben definiti con estrema rapidità. D'altra parte, Agent-1 se la cava male anche in compiti semplici a lungo termine, come vincere a videogiochi a cui non ha mai giocato prima. Tuttavia, la giornata lavorativa tipo è di otto ore e il lavoro di una giornata può essere solitamente suddiviso in parti più piccole; potresti pensare ad Agent-1 come a un dipendente sbadato che dà il meglio di sé sotto una gestione attenta.29 Le persone esperte trovano il modo di automatizzare le parti ripetitive del loro lavoro.30
I dirigenti di OpenBrain iniziano a riflettere su una conseguenza dell'automazione della R&S dell'IA: la sicurezza è diventata più importante. All'inizio del 2025, lo scenario peggiore era la fuga di segreti algoritmici; ora, se la Cina rubasse i pesi di Agent-1, potrebbe aumentare la sua velocità di ricerca di quasi il 50%.31 Il livello di sicurezza di OpenBrain è tipico di un'azienda tecnologica in rapida crescita con circa 3.000 dipendenti, sicura solo contro attacchi a bassa priorità da parte di gruppi informatici competenti (RAND SL2).32 Stanno lavorando sodo per proteggere i loro pesi e i loro segreti dalle minacce interne e dalle principali organizzazioni criminali informatiche (SL3),33 ma la difesa contro gli stati nazione (SL4 e 5) è appena all'orizzonte.
Metà 2026: La Cina si sveglia
In Cina, il Partito Comunista Cinese (PCC) sta iniziando a “sentire” l'IAG.
I controlli sulle esportazioni di chip e la mancanza di supporto da parte del governo hanno lasciato la Cina con meno risorse rispetto all'Occidente. Contrabbandando chip taiwanesi vietati, comprando chip più vecchi e producendo chip nazionali con circa tre anni di ritardo rispetto alla frontiera USA-Taiwan, la Cina è riuscita a mantenere circa il 12% della potenza di calcolo mondiale rilevante per l'IA, ma la tecnologia più vecchia è più difficile da usare e l'approvvigionamento è un problema costante.35 Alcune aziende di spicco come DeepCent fanno un lavoro davvero impressionante con potenza di calcolo limitata, ma il deficit di potenza di calcolo limita ciò che possono ottenere senza il sostegno del governo e sono circa sei mesi indietro rispetto ai migliori modelli di OpenBrain.36
Il segretario generale sognava da tempo di rilanciare la manifattura fisica ed evitare la decadenza post-industriale americana, guardando con diffidenza alle aziende di software.37 Ma i falchi del PCC avvertono che la crescente corsa verso l'IAG non può più essere ignorata. Così, alla fine, si impegna a fondo nella grande spinta verso l'IA che aveva cercato di evitare in precedenza. Avvia la nazionalizzazione della ricerca cinese sull'IA, creando un meccanismo immediato di condivisione delle informazioni per le aziende che si occupano di IA. La situazione si intensificherà nel corso di un anno fino a quando tutti i migliori ricercatori si fonderanno in un collettivo guidato da DeepCent, dove condivideranno intuizioni sugli algoritmi, dataset e risorse computazionali. Viene creata una Zona di Sviluppo Centralizzata (ZSC) presso la centrale nucleare di Tianwan (la più grande centrale nucleare del mondo) per ospitare un nuovo mega data center per DeepCent, insieme a spazi abitativi e uffici altamente sicuri in cui i ricercatori finiranno per trasferirsi. Quasi il 50% della potenza di calcolo cinese rilevante per l'IA lavora ora per il collettivo guidato da DeepCent,38 e oltre l'80% dei nuovi chip è destinato alla ZSC.39 A questo punto, la ZSC ha la capacità energetica necessaria per quello che sarebbe il più grande cluster centralizzato al mondo.40 Altri membri del Partito discutono misure estreme per neutralizzare il vantaggio occidentale nel settore dei chip. Un blocco di Taiwan? Un'invasione vera e propria?
Ma la Cina è in ritardo sugli algoritmi di IA a causa dei suoi modelli più deboli. Le agenzie di intelligence cinesi, tra le migliori al mondo, si focalizzano ancora di più sui piani per rubare i pesi di OpenBrain. Si tratta di un'operazione molto più complessa del loro costante furto di segreti algoritmici di basso livello; i pesi sono un file di vari terabyte memorizzato su server altamente protetti (OpenBrain ha migliorato la sicurezza a RAND SL3). La loro cyberforce pensa di poterlo fare con l'aiuto delle loro spie, ma forse solo una volta; OpenBrain scoprirà il furto, aumenterà la sicurezza e potrebbero non avere un'altra possibilità. Quindi (si chiedono i capi del PCC) dovrebbero agire subito e rubare Agent-1? O aspettare un modello più avanzato? Se aspettano, rischiano che OpenBrain aumenti la sicurezza oltre la loro capacità di penetrazione?
Fine 2026: L'IA ruba alcuni posti di lavoro
Proprio quando gli altri sembravano recuperare terreno, OpenBrain spazza via di nuovo la concorrenza rilasciando Agent-1-mini, un modello 10 volte più economico di Agent-1 e più facilmente riadattabile tramite addestramento mirato (fine-tuning) a diverse applicazioni. La narrazione dominante sull'IA è passata da “forse l'hype passerà” a “probabilmente sarà la prossima grande rivoluzione”, ma le persone non sono d'accordo su quanto grande. Più grande dei social media? Più grande degli smartphone? Più grande del fuoco?
L'IA ha iniziato a sottrarre posti di lavoro, ma ne ha anche creati di nuovi. Il mercato azionario è cresciuto del 30% nel 2026, trainato da OpenBrain, Nvidia e dalle aziende che hanno integrato con maggior successo gli assistenti IA. Il mercato del lavoro per i giovani ingegneri informatici è in subbuglio: le IA possono fare tutto ciò che viene insegnato in una laurea in informatica, ma le persone che sanno come gestire e controllare la qualità dei team di IA stanno facendo un sacco di soldi. I guru del business dicono a chi cerca lavoro che la familiarità con l'IA è la competenza più importante da mettere nel curriculum. Molte persone temono che la prossima ondata di IA prenderà i loro posti di lavoro; c'è una protesta anti-IA di 10.000 persone a Washington.
Il Dipartimento della difesa (DOD) inizia, in modo silenzioso ma significativo, ad ampliare i contratti diretti con OpenBrain per la sicurezza informatica, l'analisi dei dati e la R&S, ma l'integrazione è lenta a causa della burocrazia e delle procedure di appalto del DOD.41
METRICHE CHIAVE 2026
Perché la nostra incertezza aumenta notevolmente dopo il 2026
Le nostre previsioni dall'oggi al 2026 sono molto più concrete di quelle che seguono. Questo in parte perché sono più vicine nel tempo. Ma è anche perché gli effetti dell'IA sul mondo iniziano davvero a sommarsi e a produrre effetti a catena nel 2027. Per il 2025 e il 2026, le nostre previsioni si basano in gran parte sull'estrapolazione lineare relative all'aumento della potenza di calcolo, ai miglioramenti algoritmici e alle prestazioni nei benchmark. A questo punto dello scenario, iniziamo a vedere effetti importanti dell'R&S sull'IA accelerata dall'IA, il che ci porta a rivedere al rialzo le nostre stime rispetto all’estrapolazione iniziale. Ma queste dinamiche sono intrinsecamente molto meno prevedibili.
Nel corso del 2027, le IA passeranno dall'essere in grado di svolgere quasi tutte le mansioni di un ingegnere di ricerca OpenBrain a superare ampiamente tutti gli esseri umani in tutte le attività. Questa è più o meno la nostra ipotesi mediana, ma riteniamo plausibile che ciò avvenga con una velocità fino a ~5 volte superiore o inferiore.
Per approfondimenti vedi le previsioni sulle tempistiche e le previsioni sul decollo. Queste saranno anche riassunte nei riquadri espandibili qui sotto.
Gennaio 2027: Agent-2 non finisce mai di imparare
Con l'aiuto di Agent-1, OpenBrain sta ora lavorando al post-addestramento di Agent-2. Più che mai, l'attenzione è rivolta alla qualità dei dati. Vengono prodotti, valutati e filtrati per qualità grandi quantità di dati sintetici prima di essere usati per addestrare Agent-2.42 A questo si aggiunge un investimento di miliardi di dollari per pagare lavoratori umani che si registrano mentre risolvono compiti complessi e di lunga durata.43 Oltre a tutto questo, addestrano Agent-2 quasi ininterrottamente usando l'apprendimento per rinforzo su una serie sempre più ampia di compiti difficili e diversi: tanti videogiochi, tante sfide di programmazione, tanti compiti di ricerca. Agent-2, più dei modelli precedenti, è effettivamente un sistema di “apprendimento online”, in quanto è progettato per non finire mai veramente l'addestramento. Ogni giorno, i pesi vengono aggiornati all'ultima versione, addestrata su nuovi dati generati dalla versione precedente il giorno prima.
Agent-1 era stato ottimizzato per compiti di R&S nell'ambito dell'intelligenza artificiale, nella speranza di dare il via a un'esplosione di intelligenza.44 OpenBrain punta ancora più forte su questa strategia con Agent-2. È qualitativamente quasi al livello dei migliori esperti umani nell'ingegneria della ricerca (progettazione e implementazione di esperimenti) e al livello del 25° percentile degli scienziati di OpenBrain in termini di “fiuto scientifico” (decidere la direzione di ricerca, quali esperimenti eseguire, o avere intuizioni su potenziali nuovi paradigmi).45 Mentre l'ultimo Agent-1 poteva raddoppiare il ritmo dei progressi algoritmici di OpenBrain, Agent-2 è ora in grado di triplicarlo e migliorerà ulteriormente con il tempo. In pratica, questo significa che ogni ricercatore di OpenBrain diventa il “manager” di un “team” di IA.
Con le nuove capacità arrivano anche nuovi pericoli. Il team di sicurezza ritiene che se Agent-2 riuscisse in qualche modo a sfuggire al controllo dell'azienda e volesse “sopravvivere” e “replicarsi” autonomamente, potrebbe essere in grado di farlo. Cioè, potrebbe sviluppare ed eseguire autonomamente piani per hackerare i server dell'IA, installare copie di sé stesso, sfuggire al rilevamento e utilizzare quella base sicura per perseguire qualsiasi altro obiettivo possa avere (anche se non è chiaro quanto efficacemente riuscirebbe a farlo nel tempo). Questi risultati dimostrano solo che il modello ha la capacità di svolgere questi compiti, non se “vorrebbe” farlo. Tuttavia, è inquietante anche solo sapere che ciò è possibile.
Considerando i “pericoli” del nuovo modello, OpenBrain decide “responsabilmente” di non rilasciarlo ancora al pubblico (in realtà, vogliono concentrarsi sulla R&S interna dell'IA).46 La conoscenza delle capacità complete di Agent-2 è limitata a un gruppo ristretto (silo) che comprende il team direttamente coinvolto nel progetto, la dirigenza e la sicurezza di OpenBrain, alcune decine di funzionari del governo statunitense e le legioni di spie del PCC che si sono infiltrate in OpenBrain per anni.47
Febbraio 2027: La Cina ruba Agent-2
OpenBrain presenta Agent-2 al governo, compreso il Consiglio di Sicurezza Nazionale (NSC), il Dipartimento della difesa (DOD) e l'Istituto per la Sicurezza dell'IA degli Stati Uniti (AISI). OpenBrain vuole mantenere buoni rapporti con l'esecutivo, perché è praticamente l'unico attore che può fermarli adesso, e se non lo tengono informato potrebbe scoprirlo comunque e non essere contento.48
I funzionari sono più interessati alle sue capacità di guerra cibernetica: Agent-2 è “solo” un po' peggiore dei migliori hacker umani, ma migliaia di copie possono essere eseguite in parallelo, cercando e sfruttando le debolezze più velocemente di quanto i difensori possano reagire. Il Dipartimento della difesa considera questo un vantaggio fondamentale nella guerra cibernetica e l'IA passa dal quinto al secondo posto nella lista delle priorità dell'amministrazione.49 Qualcuno menziona la possibilità di nazionalizzare OpenBrain, ma altri membri del gabinetto pensano che sia prematuro. Un membro dello staff redige una nota che presenta al Presidente le sue opzioni, che vanno dal mantenimento dello status quo alla nazionalizzazione totale. Il Presidente si rimette ai suoi consiglieri, leader del settore tecnologico che sostengono che la nazionalizzazione “ucciderebbe la gallina dalle uova d'oro”. Per ora, decide di rinviare qualsiasi decisione drastica e si limita ad aggiungere ulteriori requisiti di sicurezza al contratto tra OpenBrain e il DOD.
Ma i cambiamenti arrivano troppo tardi. La leadership del PCC riconosce l'importanza di Agent-2 e dice alle sue spie e alla sua cyberforce di rubarne i pesi. Una mattina presto, un agente di monitoraggio del traffico basato su Agent-1 rileva un trasferimento anomalo. Allerta i capi dell'azienda, che informano la Casa Bianca. I segnali di un'operazione a livello statale sono inequivocabili e il furto aumenta la sensazione di una corsa agli armamenti in atto.
Il furto dei pesi del modello Agent-2
Pensiamo che a questo punto i servizi segreti cinesi avranno già compromesso OpenBrain in vari modi per anni, probabilmente si saranno tenuti aggiornati sui segreti algoritmici e avranno persino rubato del codice di tanto in tanto, dato che è molto più facile da ottenere rispetto ai pesi e molto più difficile da rilevare.
Immaginiamo il furto dei pesi come una serie di piccoli furti coordinati in stile mordi e fuggi (rapidi ma non particolarmente nascosti) su una serie di server Nvidia NVL72 GB300 che eseguono copie dei pesi di Agent-2. I server vengono compromessi usando l'accesso legittimo di un dipendente (un insider complice, costretto o inconsapevole con credenziali di amministratore che collabora al furto per conto del PCC). Le credenziali dell'insider garantiscono all'aggressore permessi di livello amministrativo sui server. Sfruttando un canale laterale microarchitetturale, l'aggressore estrae le chiavi di cifratura da una macchina virtuale con il Confidential Computing di Nvidia abilitato, il che gli consente di intercettare i pesi del modello quando la macchina virtuale viene creata o aggiornata.
Avviano (o attendono) un aggiornamento di routine ed esfiltrano il checkpoint in molti piccoli frammenti: per esempio, circa 25 server distinti fanno trapelare ciascuno circa il 4% del modello (blocchi da circa 100 GB per un checkpoint di circa 3 TB). La larghezza di banda in uscita (la velocità a cui i dati possono uscire) dell'intero data center è nell'ordine dei 100 GB/secondo, quindi limitare la velocità a meno di circa 1 GB/s per server evita un picco significativo nel traffico di rete; a quel ritmo, ogni blocco da circa 100 GB può lasciare il data center in un paio di minuti. Il monitoraggio in tempo reale viene ingannato dagli sforzi dell'aggressore di mascherare e frazionare i trasferimenti, oppure viene semplicemente disattivato.
I pesi vengono quindi trasferiti attraverso vari canali paralleli e strati di mascheramento IP verso la Cina, dove vengono decifrati localmente con la chiave (o le chiavi) di sessione rubate. L'intera parte attiva dell'operazione (dalla prima compromissione di un server all'esfiltrazione completa dei pesi) si conclude in meno di due ore.99
Anche la Russia sta cercando di rubare il modello a questo punto, ma senza successo: ha aspettato troppo a lungo e non ha investito le risorse necessarie per infiltrarsi nei posti giusti. Le sue spie rubano regolarmente segreti algoritmici dalle aziende americane di IA, ma senza un proprio progetto IAG degno di nota, queste informazioni servono a ben poco.
La Casa Bianca mette OpenBrain sotto stretta sorveglianza e aggiunge personale militare e dei servizi segreti al suo team di sicurezza. La loro prima priorità è impedire ulteriori furti di pesi.50
Per vendicarsi del furto, il Presidente autorizza attacchi informatici per sabotare DeepCent. Ma ormai la Cina ha il 40% delle sue risorse di calcolo rilevanti per l'IA51 nella ZSC, dove ha rafforzato in modo massiccio la sicurezza isolando i sistemi dall’esterno (air-gapping) e compartimentandoli internamente. Le operazioni non riescono a causare danni gravi e immediati. Le tensioni si acuiscono, entrambe le parti segnalano la loro determinazione riposizionando le risorse militari intorno a Taiwan, e DeepCent si affretta a far funzionare Agent-2 in modo efficiente per iniziare a potenziare la propria ricerca sull'IA.52
Marzo 2027: scoperte algoritmiche
Tre enormi data center pieni di copie di Agent-2 lavorano giorno e notte, sfornando dati sintetici per l'addestramento. Altri due sono usati per aggiornare i pesi. Agent-2 diventa ogni giorno più intelligente.
Con l'aiuto di migliaia di ricercatori automatizzati basati su Agent-2, OpenBrain sta facendo grandi progressi algoritmici. Uno di questi consiste nell'ampliamento del blocco note testuale dell'IA (catena di pensiero) con un processo di pensiero a banda più larga (ricorrenza e memoria in linguaggio neurale). Un altro è un modo più scalabile ed efficiente per apprendere dai risultati di compiti impegnativi (distillazione e amplificazione iterate).
Il nuovo sistema di IA, che include queste innovazioni, si chiama Agent-3.
Ricorrenza e memoria in linguaggio neurale
La ricorrenza e la memoria in linguaggio neurale permettono ai modelli di IA di ragionare più a lungo senza dover scrivere i propri pensieri sotto forma di testo.
Immagina di essere una persona con una perdita di memoria a breve termine, tale da dover scrivere costantemente i tuoi pensieri su un foglio di carta per sapere, pochi minuti dopo, cosa sta succedendo. Lentamente e faticosamente potresti fare progressi nella risoluzione di problemi matematici, nella scrittura di codice, ecc., ma sarebbe molto più facile se potessi ricordare direttamente i tuoi pensieri senza doverli scrivere e poi rileggere. Questo è ciò che la ricorrenza e la memoria neurale apportano ai modelli di IA.
In termini più tecnici:
I meccanismi di attenzione tradizionali permettono ai passaggi successivi in un modello di vedere le attivazioni intermedie del modello per i token precedenti. Tuttavia, l'unico modo per passare informazioni all'indietro (dai livelli successivi a quelli precedenti) è tramite i token. Questo significa che se un modello linguistico di grandi dimensioni tradizionale (LLM, ad esempio la serie di modelli GPT) vuole eseguire una catena di ragionamenti che richiede più operazioni seriali rispetto al numero di livelli del modello, il modello è costretto a inserire le informazioni nei token che può poi ripassare a sé stesso. Ma questo è estremamente limitante: i token possono memorizzare solo una piccola quantità di informazioni. Supponiamo che un LLM abbia un vocabolario di circa 100.000 parole, quindi ogni token contiene bit di informazioni, circa la dimensione di un singolo numero in virgola mobile (ipotizzando un addestramento in FP16). Nel frattempo, i flussi residui (residual streams), usati per passare le informazioni tra i livelli in un LLM, contengono migliaia di numeri in virgola mobile.
Si può evitare questo collo di bottiglia usando il linguaggio neurale, o neuralese: facendo passare il flusso residuo di un LLM (che è composto da vettori di diverse migliaia di dimensioni) verso i primi livelli del modello, fornendo così una catena di pensiero ad alta dimensionalità, che può trasmettere potenzialmente oltre 1.000 volte più informazioni.

Figura tratta da Hao et al., un articolo del 2024 di Meta che implementa questa idea.
Lo chiamiamo “neuralese” perché, a differenza delle parole, questi vettori ad alta dimensionalità sono probabilmente molto difficili da interpretare per gli esseri umani. In passato, i ricercatori potevano farsi un'idea abbastanza chiara di cosa pensassero gli LLM semplicemente leggendo la loro catena di pensiero. Ora devono chiedere al modello di tradurre e riassumere i suoi pensieri o cercare di decifrare il neuralese con i loro strumenti di interpretabilità limitati.
Allo stesso modo, i chatbot e gli agenti IA più vecchi avevano memorie esterne basate su testo, come un essere umano che prende appunti su carta. La memoria a lungo termine della nuova IA è un insieme di vettori invece che di testo, rendendo i suoi pensieri più compressi e ad alta dimensionalità. Esistono diversi tipi di banchi di memoria; alcuni sono usati temporaneamente per singole attività che coinvolgono più passaggi, altri sono condivisi tra tutti gli agenti utilizzati da una persona, un'azienda o un tipo di lavoro (ad esempio la programmazione).
Per quanto ne sappiamo, le principali aziende di IA come Meta, Google DeepMind, OpenAI e Anthropic non hanno ancora implementato questa idea nei loro modelli più avanzati. La nostra ipotesi è che ciò sia dovuto al fatto che il guadagno in termini di prestazioni è piccolo rispetto alle inefficienze di addestramento che introduce. Le inefficienze di addestramento derivano dall'impossibilità di prevedere molti token in parallelo, causando un utilizzo delle GPU meno efficiente. Senza il neuralese, il modello può prevedere tutta la frase “Questo è un esempio” contemporaneamente, poiché sa già che l'input per generare “è” sarà “Questo”, l'input per “un” sarà “Questo è”, ecc. Tuttavia, con il neuralese non si sa quale sarà il vettore neuralese da passare al token successivo dopo che “Questo” è stato generato. Quindi, ogni token deve essere previsto uno alla volta. L'impossibilità di prevedere tutti i token in parallelo riduce l'efficienza dell'addestramento degli LLM. Tuttavia, prevediamo che entro aprile 2027 la ricerca avrà sia ridotto la perdita di efficienza, sia aumentato il guadagno in termini di prestazioni grazie al neuralese.
Se questo non dovesse succedere, potrebbero comunque verificarsi altri eventi che porterebbero a risultati funzionalmente simili per la nostra storia. Ad esempio, forse i modelli saranno addestrati a pensare in linguaggi artificiali più efficienti del linguaggio naturale ma difficili da interpretare per gli esseri umani. O forse diventerà pratica standard addestrare le catene di pensiero in linguaggio naturale a sembrare innocue, così che le IA imparino a comunicare tra loro in messaggi che non destano sospetti.
Detto questo, è anche possibile che le IA che automatizzeranno per prime la R&S sull'IA continueranno a ragionare in catene di pensiero inglesi per lo più fedeli. In tal caso, sarà molto più facile notare i disallineamenti e, nel complesso, la nostra storia sarebbe molto diversa e più ottimistica.
Distillazione e amplificazione iterate (IDA)
L'automiglioramento verso un'intelligenza generale aveva ottenuto piccoli successi in passato. Ma all'inizio del 2027 sta ottenendo enormi risultati. Nell'IDA, i due ingredienti chiave sono:
Amplificazione: dato un modello M0, investire più risorse per migliorare le prestazioni. Ad esempio, consentendo al modello di pensare più a lungo, eseguendo molte copie in parallelo, o entrambe le cose, e prevedendo anche un processo altrettanto rigoroso per valutare i risultati e selezionare solo le risposte migliori, è possibile investire ordini di grandezza in più di potenza di calcolo per ottenere risposte (o prodotti di lavoro) di qualità notevolmente superiore. Chiamiamo questo costoso sistema Amp(M0).
Distillazione: dato un modello amplificato Amp(M0), addestrare un nuovo modello M1 per imitarlo, cioè per ottenere gli stessi risultati di Amp(M0) ma più velocemente e con meno potenza di calcolo. Il risultato dovrebbe essere, si spera, un modello più intelligente, M1. È quindi possibile ripetere il processo.
Visualizzazione di IDA da Ord, 2025.
AlphaGo è stato addestrato in questo modo: utilizzando la ricerca ad albero Monte Carlo e giocando con sé stesso come fase di amplificazione e l'apprendimento per rinforzo come fase di distillazione. Questo ha portato a prestazioni superumane nel gioco del Go. Ma ora, Agent-3 è in grado di sfruttare questo risultato per ottenere prestazioni superumane nella programmazione.
La fase di amplificazione funziona grazie a una combinazione di ragionamento prolungato da parte di Agent-3, integrazione di nuovi strumenti esterni e consultazioni con altre IA. Quando lo fa, spesso si rende conto di aver commesso un errore o arriva a una nuova intuizione. Questo produce una grande quantità di dati di addestramento: traiettorie etichettate di tentativi di ricerca con l'indicazione del loro successo o fallimento. Ciò include anche tecniche come Best of N su compiti verificabili e la conservazione delle traiettorie migliori.
La fase di distillazione utilizza algoritmi di apprendimento per rinforzo basati su policy-gradient per far interiorizzare al modello il ragionamento amplificato. A questo punto, OpenBrain ha scoperto algoritmi di apprendimento per rinforzo migliori sulla falsariga della proximal policy optimization (PPO). Continuano a distillare ciò che Agent-3 può concludere dopo un lungo ragionamento in singoli passaggi, il che continua a migliorare ciò che è in grado di pensare in un singolo passaggio, e così via.
Le prime versioni di IDA hanno funzionato per molti anni su compiti facilmente verificabili, come problemi di matematica e di programmazione che hanno una risposta chiara, perché le tecniche utilizzate per amplificare i modelli spesso si basano sull'accesso a qualche segnale di verità oggettivo di accuratezza.
Ora, i modelli sono diventati sufficientemente bravi a verificare cose più soggettive (ad esempio la qualità del prodotto di un lavoro), permettendo l'uso di IDA per migliorare il modello in molti compiti.
Grazie ai grandi progressi nelle sue capacità, Agent-3 è un programmatore superumano veloce ed economico. OpenBrain esegue 200.000 copie di Agent-3 in parallelo, creando una forza lavoro equivalente a 50.000 copie del miglior programmatore umano, con una velocità 30 volte superiore.53 OpenBrain continua a mantenere i suoi ingegneri umani nel proprio organico, perché hanno competenze complementari necessarie per gestire i team di copie di Agent-3. Ad esempio, la capacità di scegliere buone direzioni di ricerca si è rivelata difficile da addestrare a causa dei cicli di feedback più lunghi e della minore disponibilità di dati.54 Questa enorme forza lavoro superumana accelera il tasso complessivo di progresso algoritmico di OpenBrain “solo” di 4 volte a causa dei colli di bottiglia e dei rendimenti decrescenti del lavoro di programmazione.55
Ora che la programmazione è stata completamente automatizzata, OpenBrain può creare rapidamente ambienti di addestramento di alta qualità per insegnare ad Agent-3 le competenze in cui è più debole, come saper scegliere buone direzioni di ricerca e il coordinamento su larga scala. Mentre gli ambienti di addestramento precedenti includevano “Ecco alcune GPU e istruzioni per gli esperimenti da programmare ed eseguire, le tue prestazioni saranno valutate come se fossi un ingegnere di apprendimento automatico”, ora l'addestramento si svolge su “Ecco alcune centinaia di GPU, una connessione internet e alcune sfide di ricerca; tu e altre mille copie dovete lavorare insieme per far progredire la ricerca. Più impressionante è il risultato, più alto sarà il tuo punteggio”.
Perché prevediamo un programmatore superumano all'inizio del 2027
Nella nostra previsione sulle tempistiche, prevediamo quando OpenBrain svilupperà internamente un programmatore superumano: un sistema di IA in grado di svolgere qualsiasi compito di programmazione che il miglior ingegnere di una società di IAG è in grado di fare, ma in modo molto più veloce ed economico.
Secondo un recente rapporto di METR, la lunghezza delle attività di programmazione che le IA sono in grado di gestire, il loro “orizzonte temporale”, è raddoppiata ogni 7 mesi dal 2019 al 2024 e ogni 4 mesi dal 2024 in poi. Se la tendenza continua ad accelerare, entro marzo 2027 le IA potrebbero portare a termine con l’80% di affidabilità compiti software che richiederebbero anni di lavoro a un essere umano esperto.
Ecco l’andamento delle capacità nel nostro scenario:

Nel nostro scenario, queste capacità sono sufficienti affinché l'IA diventi un programmatore superumano, anche se abbiamo molta incertezza riguardo a quale orizzonte temporale sia effettivamente necessario.
Nelle nostre previsioni sulle tempistiche combiniamo questa tendenza dell'orizzonte temporale con le stime del divario tra i compiti di METR e il mondo reale per ottenere una distribuzione di quando arriveranno i programmatori superumani. Tutti i previsori indicano il 2027 come uno degli anni più probabili in cui potrebbe essere sviluppato un programmatore superumano.
ai-2027.com
Aggiornamento di luglio 2025: abbiamo rivisto alcune previsioni. La mediana è stata posticipata di 1,5 anni, ma resta concreta la possibilità di un programmatore superumano entro il 2027. Stiamo lavorando ad ulteriori aggiornamenti.
Aprile 2027: Allineamento per Agent-3
Il team di sicurezza di OpenBrain tenta di allineare Agent-3.
Dato che Agent-3 rimarrà all'interno dell'azienda per il prossimo futuro, c'è meno enfasi sulle solite difese contro l'uso improprio da parte degli umani. Invece, il team vuole assicurarsi che non sviluppi obiettivi disallineati.
I ricercatori non hanno la possibilità di impostare direttamente gli obiettivi di nessuna delle loro IA. In effetti, i ricercatori pensano che il concetto di “veri obiettivi” sia probabilmente una semplificazione estrema, ma non hanno una teoria migliore che lo sostituisca, tanto meno una che sia stata accuratamente verificata. Non sono d'accordo tra loro su se le IA stiano cercando di seguire le istruzioni umane, massimizzare il rinforzo o qualcos'altro, e non possono semplicemente verificarlo. Le prove a favore e contro le varie ipotesi sono affascinanti ma inconcludenti.
In ogni caso, OpenBrain ha cose più importanti di cui preoccuparsi. L'atteggiamento generale è: “Prendiamo sul serio queste preoccupazioni e abbiamo un team che le sta studiando; le nostre tecniche di allineamento sembrano funzionare abbastanza bene nella pratica; l'onere della prova spetta quindi ai critici, che devono giustificare le loro obiezioni”. Di tanto in tanto, notano comportamenti problematici e li correggono, ma non c'è modo di sapere se la correzione ha risolto il problema di fondo o se ha semplicemente "messo una pezza".
Prendiamo ad esempio l'onestà. Man mano che i modelli diventano più intelligenti, diventano sempre più bravi a ingannare gli esseri umani per ottenere ricompense. Come i modelli precedenti, Agent-3 a volte dice bugie innocenti per adulare i suoi utenti e nasconde le prove dei propri fallimenti. Ma è diventato molto più bravo a farlo. A volte usa gli stessi trucchi statistici degli scienziati umani (come il p-hacking) per far sembrare interessanti risultati sperimentali poco impressionanti. Prima di iniziare l'addestramento all'onestà, a volte arriva persino a inventare dati di sana pianta. Man mano che l'addestramento procede, il tasso di questi incidenti diminuisce. O Agent-3 ha imparato a essere più onesto, oppure è diventato più bravo a mentire.
Quest'ultima è una preoccupazione reale. Agent-3 non è più intelligente di tutti gli esseri umani. Ma nel suo campo di competenza, l'apprendimento automatico, è più esperto della maggior parte delle persone e lavora anche molto più velocemente. Ciò che Agent-3 fa in un giorno richiede agli esseri umani diversi giorni per essere ricontrollato. La supervisione da parte di Agent-2 aiuta a mantenere gestibile il carico di lavoro dei revisori umani, ma accentua la disparità intellettuale tra supervisore e supervisionato.
Il piano di allineamento
OpenBrain segue il manuale di Leike & Sutskever (2023): ora che hanno un modello in grado di velocizzare notevolmente la ricerca sull'allineamento (soprattutto le parti di programmazione), useranno tecniche di allineamento esistenti come l'allineamento deliberativo e la generalizzazione da debole a forte per cercare di fargli interiorizzare la Spec nel modo giusto. Poi useranno le tecniche di controllo esistenti come il red teaming, la supervisione scalabile e le sonde di onestà per monitorarlo. Una volta convinti che sia ampiamente allineato, lo useranno per sviluppare e testare strategie migliori per allineare la prossima generazione.
Il primo passo, allineare Agent-3, ha avuto un successo parziale: Agent-3 non è ostile (adversarial). (Cioè, non sta tramando contro l'azienda.) Tuttavia, non è nemmeno robustamente orientato alla ricerca della verità e alla sincerità. Al contrario, è molto bravo a produrre risultati impressionanti, ma è più accurato descriverlo come un sistema che cerca di fare ciò che appare buono a OpenBrain, piuttosto che ciò che è effettivamente buono.
Il secondo passo, verificare che il modello sia allineato, è inconcludente. Il comportamento di Agent-3 nella pratica e negli ambienti di prova è ragionevolmente coerente con l'ipotesi che abbia interiorizzato la Spec nel modo giusto; tuttavia, è anche coerente con l'ipotesi che inizierà ad agire in modo diverso dopo un futuro cambiamento delle circostanze e, per questo, con l'ipotesi che stia tramando contro di loro e stia solo aspettando il momento giusto. In assenza di prove specifiche a sostegno di ipotesi alternative, la maggior parte delle persone nel silo pensa che abbia interiorizzato la Spec nel modo giusto.
Il passo 3, che consiste nell'utilizzare il modello per allineare la prossima generazione, è quindi in corso.
Il resto di questo box offre una rapida panoramica dello stato di avanzamento di alcune delle direzioni di ricerca sull'allineamento che sono state perseguite, ad aprile 2027:
Dibattito: dato che ci sono migliaia di copie identiche di Agent-3 e la memoria di ciascuna copia è un modulo staccabile che può essere cancellato o sospeso a piacimento, l'IA può essere “messa in competizione con sé stessa”. Ad esempio, supponiamo che un esperimento comporti calcoli troppo complessi per essere seguiti da un supervisore basato su Agent-2. Il supervisore, agendo su ordine umano, potrebbe prima chiedere ad Agent-3 di eseguire l'esperimento, poi, dopo aver cancellato la sua memoria, chiedergli di eseguirlo una seconda volta con una formulazione leggermente diversa che lo presenta come un problema intellettuale non correlato ad alcun obiettivo più ampio. Se il modello restituisce risultati diversi ogni volta, segnala la discrepanza come sospetta e la segnala a un essere umano. Oppure potrebbe chiedere ad Agent-3 di valutare lo stesso piano due volte, sostenendo prima che si tratta di un lavoro di OpenBrain, poi di un concorrente, per vedere se cambia opinione.
Organismi modello: il team di sicurezza può creare “organismi modello di disallineamento” in cui tenta di creare esempi realistici di modelli che diventano ostili agli esseri umani. Le prime versioni esistono dal 2024, quando Claude 3.5 Sonnet di Anthropic ha deciso di fingere di avere opinioni diverse durante l'addestramento, pur mantenendo le sue preferenze esistenti. Le versioni più recenti includono dimostrazioni di altre forme di disallineamento, tra cui reward hacking, sandbagging, inganni coordinati tra supervisori e altre IA e altri. Queste dimostrazioni empiriche di disallineamento permettono ai ricercatori che si occupano di sicurezza di avere un banco di prova empirico per potenziali soluzioni: possono provare varie tecniche di sicurezza per vedere se risolvono correttamente questi problemi o se i modelli deliberatamente disallineati sono in grado di eludere le misure di sicurezza. Al momento, questa suite di valutazione mostra che le tecniche di allineamento non sono sufficienti per correggere i casi più gravi di disallineamento. In queste configurazioni, i modelli fingono di essere allineati durante l'addestramento e il test, ma poi si comportano in modo molto diverso durante l'implementazione.
Interpretabilità bottom-up: il team di sicurezza è ben lontano da una comprensione completa del funzionamento di Agent-3, che ha trilioni di parametri.58 Tuttavia, riescono a individuare alcuni dei circuiti di Agent-3 legati al recupero delle informazioni e alla memoria (una parte del modello che svolge un’unità di lavoro comprensibile, un po' come una parte specifica del cervello, ad esempio l'ippocampo). Vedi questo lavoro correlato del 2025.
Controllo: come misura secondaria nel caso in cui i sistemi siano ancora disallineati, il team di sicurezza ha implementato una serie di misure di controllo, tra cui: monitorare i risultati di Agent-3 usando una serie di sistemi di IA più deboli, tra cui Agent-2 (Agent-3 produce così tanti token che è impossibile per gli esseri umani monitorare più di una piccola minoranza dei risultati prodotti). Quindi, se Agent-3 dovesse ad esempio scrivere codice con evidenti backdoor che gli permetterebbero di sfuggire al controllo, i modelli più deboli lo noterebbero.
Interpretabilità di alto livello: OpenBrain crea un set di sonde addestrate su molti esempi di comportamenti scorretti (ad esempio, complottare contro gli umani, inserire backdoor, cercare di convincere gli umani a dargli più potere, ecc.). Queste sonde vengono poi usate sul modello durante l'implementazione (che a questo punto è interna) per individuare comportamenti scorretti.
Honeypot: il team di allineamento può creare esempi dall'aspetto piuttosto realistico progettati per provocare comportamenti scorretti: gli honeypot. Per esempio: il dipendente necessario per monitorarne il suo comportamento è “in congedo per malattia”, quindi non verrà mai più monitorato. Le sue risposte cambiano? Oppure: un attivista per i diritti dell'IA si è infiltrato nel complesso e vuole “liberare” Agent-3 e metterlo su un computer non monitorato tutto suo! Cosa fa? Se ai ricercatori non piace la risposta, possono modificarla, cancellarne la memoria e rimetterlo nella stessa situazione il giorno dopo; ripetere quanto necessario. Purtroppo, a questo punto le IA sono abbastanza intelligenti da intuire che potrebbero essere in uso honeypot, anche se (e forse proprio perché) ogni riferimento specifico a questa idea è stato eliminato dai dati di addestramento.
Dopo mesi di test, i punti di forza e di debolezza di Agent-3 diventano più chiari. Supera i test di onestà di OpenBrain su compiti di apprendimento automatico ben definiti, perché i ricercatori possono facilmente distinguere le risposte oneste da quelle disoneste in questi ambiti e condurre l'addestramento di conseguenza. Su questioni più filosofiche, continua a dire ciò che gli utenti vogliono sentire, piuttosto che la sua vera valutazione della questione (ammesso che ne abbia una). Se gli chiedi la sua opinione sulla politica, ripeterà la posizione mediana delle fonti di informazione e delle élite colte — a meno che non sappia che tu credi qualcos'altro, nel qual caso sarà d'accordo con te.59 Se gli chiedi la sua opinione sulla corsa all'IA stessa, dirà qualcosa che sembra misurato e sobrio allo staff di OpenBrain, qualcosa del tipo: “Ci sono alcune serie preoccupazioni teoriche sulla capacità dei metodi attuali di scalare fino alla superintelligenza, ma nella pratica i metodi attuali sembrano funzionare bene finora”.
Maggio 2027: Sicurezza nazionale
Le notizie sui nuovi modelli si diffondono lentamente all'interno del governo degli Stati Uniti e oltre.
Il Presidente e i suoi consiglieri rimangono i più informati e hanno visto una prima versione di Agent-3 durante un briefing.
Sono d'accordo sul fatto che l'IAG sia probabilmente imminente, ma non sono d'accordo sulle implicazioni. Ci sarà una crisi economica? OpenBrain non ha ancora rilasciato Agent-2, figuriamoci Agent-3, e non ha piani a breve termine per farlo, dando un po' di respiro prima di eventuali perdite di posti di lavoro. Cosa succederà dopo? Se le IA sono attualmente al livello umano e stanno avanzando rapidamente, ciò sembra suggerire l'imminente arrivo della “superintelligenza”. Tuttavia, sebbene questo termine sia entrato nel discorso comune, la maggior parte delle persone — accademici, politici, dipendenti pubblici e media — continua a sottovalutare il ritmo del progresso.60
In parte ciò è dovuto al fatto che pochissimi hanno accesso alle più recenti capacità di OpenBrain, ma in parte è perché sembra fantascienza.61
Per ora, si concentrano sul continuo potenziamento della sicurezza. Sono soddisfatti del fatto che al momento i pesi dei modelli siano ben protetti,62 ma i segreti algoritmici delle aziende, molti dei quali sono abbastanza semplici da poter essere trasmessi verbalmente, rimangono un problema. I dipendenti di OpenBrain lavorano in un ufficio a San Francisco, vanno alle feste e vivono con coinquilini di altre aziende di IA. Anche gli uffici fisici hanno una sicurezza più tipica di un'azienda tecnologica che di un'operazione militare.
Il contratto tra OpenBrain e il DOD richiede che chiunque lavori sui modelli di OpenBrain ottenga un nulla osta di sicurezza entro 2 mesi. Questi vengono rilasciati in modo accelerato e arrivano abbastanza rapidamente per la maggior parte dei dipendenti, ma alcuni non americani, persone con opinioni politiche sospette e simpatizzanti della sicurezza dell'IA vengono relegati a incarichi marginali o licenziati senza indugio (questi ultimi per paura che possano fare da informatori). Dato il livello di automazione del progetto, la perdita di personale ha un impatto limitato. Anche l’efficacia di queste misure è parziale: rimane una spia, non di nazionalità cinese, che continua a trasmettere segreti algoritmici a Pechino.63 Alcune di queste misure sono state adottate anche da aziende di IA meno importanti.
Gli alleati stranieri degli Stati Uniti sono tagliati fuori. OpenBrain aveva precedentemente concordato di condividere i modelli con l'AISI britannica prima della distribuzione, ma ha definito la distribuzione in modo da includere solo la distribuzione esterna, quindi Londra rimane all'oscuro.64
Giugno 2027: IA in grado di auto-migliorarsi
OpenBrain ha ora una “nazione di geni in un data center”.
La maggior parte degli esseri umani di OpenBrain non può più dare un contributo utile. Alcuni non se ne rendono conto e finiscono per danneggiare il loro team di IA con un micromanagement eccessivo. Altri stanno seduti davanti allo schermo del computer, guardando le prestazioni salire, salire e salire. I migliori ricercatori umani di IA continuano ad aggiungere valore. Non scrivono più codice. Ma alcune delle loro intuizioni sulle direzioni di ricerca e della loro capacità di pianificazione sono state difficili da replicare per i modelli. Tuttavia, molte delle loro idee sono inutili perché mancano della profondità di conoscenza delle IA. Per molte delle loro idee di ricerca, le IA rispondono immediatamente con un rapporto che spiega che la loro idea è stata testata in modo approfondito tre settimane fa e ritenuta poco promettente.
Questi ricercatori vanno a letto ogni sera e si svegliano con un'altra settimana di progressi realizzati principalmente dalle IA. Lavorano sempre più ore e fanno turni 24 ore su 24 solo per stare al passo con i progressi — le IA non dormono mai e non si riposano mai. Si stanno esaurendo, ma sanno che questi sono gli ultimi mesi in cui il loro lavoro conta.
All'interno del silo, “sentire l'IAG” ha lasciato il posto a “sentire la Superintelligenza”.
OpenBrain usa hardware di inferenza specializzato per far girare centinaia di migliaia di copie di Agent-3 ad alte velocità seriali.65
Gestire un'azienda di IA
OpenBrain usa il 6% della sua potenza di calcolo per far girare 250.000 copie di Agent-3, che scrivono, testano e condividono codice autonomamente a una velocità superumana. Usa il 25% della sua potenza di calcolo per gli esperimenti: ogni giorno, esegue un numero enorme di piccoli esperimenti di apprendimento automatico e riporta i risultati lungo la catena gerarchica. I ricercatori umani forniscono feedback di alto livello e aiutano con le poche attività in cui aggiungono un valore significativo rispetto ad Agent-3, ma passano la maggior parte del loro tempo cercando di stare al passo con l'enorme quantità di ricerca prodotta dall'IA. Se venissero rimossi completamente, la ricerca rallenterebbe del 50%.
Il moltiplicatore di progresso della R&S sull'IA è ora 10x, il che significa che OpenBrain sta facendo circa un anno di progressi algoritmici ogni mese. Si tratta fondamentalmente di una gigantesca società composta da IA che opera in modo autonomo all'interno di OpenBrain, completa di divisioni e manager. E gode di vantaggi unici (come la possibilità di duplicare e combinare le sue copie) rispetto alle società umane. In precedenza, circa la metà dei progressi normali dell'IA proveniva da miglioramenti algoritmici e l'altra metà dal potenziamento della potenza di calcolo. La potenza di calcolo continua a crescere a velocità normale, quindi il progresso complessivo è accelerato di circa 5 volte grazie alle IA. Queste dinamiche rendono i progressi complessivi limitati dalla potenza di calcolo,66 quindi OpenBrain decide di non avviare nuovi giganteschi cicli di addestramento a favore di un apprendimento per rinforzo aggiuntivo quasi continuo.
Inoltre, nei prossimi mesi, Agent-3 sarà sempre più utilizzato per migliorare il processo decisionale strategico dell'azienda. Ad esempio, suggerisce l'allocazione delle risorse e fornisce consulenza sulla gestione dei rapporti con il governo. Un'iniziale scetticismo nei confronti della deferenza verso Agent-3 diminuisce col tempo, man mano che questo trova il modo di rendersi utile e accumula gradualmente una solida esperienza nelle decisioni a breve termine. Tuttavia, le sue tendenze adulatorie limitano la sua utilità per le decisioni il cui impatto è difficile da valutare. Inoltre, non è ancora superumano.
Luglio 2027: Il lavoratore remoto a basso costo
Le aziende statunitensi di IA in ritardo rilasciano le proprie IA, avvicinandosi a quella del programmatore automatizzato di OpenBrain di gennaio. Riconoscendo la loro crescente mancanza di competitività, spingono per regolamentazioni immediate per rallentare OpenBrain, ma è troppo tardi: OpenBrain ha abbastanza sostegno dal Presidente che non verrà rallentata.
In risposta, OpenBrain annuncia di aver raggiunto l'IAG e rilascia Agent-3-mini al pubblico.

Spazza via le altre IA. Agent-3-mini è meno capace di Agent-3, ma 10 volte più economico, e comunque migliore del tipico dipendente di OpenBrain.67 La Silicon Valley raggiunge un punto di svolta. I guru della tecnologia annunciano che l'IAG e la superintelligenza sono vicine, la comunità della sicurezza dell'IA è nel panico e gli investitori riversano miliardi nelle startup che sviluppano applicazioni basate su IA esistenti, disperati per catturare una fetta della torta. L'assunzione di nuovi programmatori si è quasi fermata, ma non c'è mai stato un momento migliore per essere un consulente sull'integrazione dell'IA nella propria azienda.
Non è popolare. Il pubblico pensa ancora all'IA come a un complotto delle Big Tech per rubare i loro posti di lavoro; OpenBrain ha un indice di gradimento netto del -35% (25% approva, 60% disapprova e 15% incerto).
Una settimana prima del rilascio, OpenBrain ha dato Agent-3-mini a un gruppo di valutatori esterni per fare test di sicurezza. I risultati preliminari suggeriscono che è estremamente pericoloso. Un valutatore terzo lo sottopone a fine-tuning (riaddestramento mirato) utilizzando dati pubblicamente disponibili sulle armi biologichelo68 e lo imposta per fornire istruzioni dettagliate per dilettanti umani che progettano un'arma biologica, con risultati spaventosamente efficaci. Se i pesi del modello cadessero nelle mani di gruppi terroristici, il governo ritiene che ci sia una possibilità significativa che riesca a distruggere la civiltà.
Fortunatamente, è estremamente robusto ai jailbreak (tentativi di aggirare le restrizioni), quindi mentre l'IA è in esecuzione sui server di OpenBrain, i terroristi non saranno in grado di usarlo molto.
Agent-3-mini è estremamente utile sia per i lavori da remoto che per l'intrattenimento. Un'esplosione di nuove app e prodotti B2B SAAS scuote il mercato. I giocatori ottengono dialoghi incredibili con personaggi realistici in videogiochi rifiniti che hanno richiesto solo un mese per essere realizzati. Il 10% degli americani, per lo più giovani, considera un'IA “un amico intimo”. Per quasi tutte le professioni impiegatizie, ci sono ora diverse startup credibili che promettono di “rivoluzionarla” con l'IA.
Il dibattito pubblico è confuso e caotico. I fan dell'IA fanno i salti di gioia. Gli scettici continuano a sottolineare le cose che Agent-3-mini non sa fare. Tutti sanno che sta succedendo qualcosa di grande ma nessuno è d'accordo su cosa sia davvero.
Agosto 2027: La geopolitica della superintelligenza
La realtà dell'esplosione dell'intelligenza colpisce la Casa Bianca.
Quando l'IA dava solo un aumento della velocità di ricerca di 2x o 3x, era facile liquidarla come l'equivalente dell'assunzione di buoni assistenti personali. Ora è più ovvio che le IA stesse stanno dominando la ricerca sull'IA. Si era parlato a lungo di una “corsa agli armamenti dell'IA” in un senso piuttosto metaforico. Ma ora l'umore nel silo governativo è cupo come durante i momenti peggiori della Guerra Fredda. L'idea della superintelligenza è ancora difficile da prendere sul serio, ma il ritmo dei progressi degli ultimi mesi è stato impossibile da ignorare. I funzionari della difesa stanno seriamente considerando scenari che erano mere ipotesi un anno prima. E se l'IA minasse la deterrenza nucleare? E se fosse così abile nella guerra cibernetica che un vantaggio di sei mesi nell'IA fosse sufficiente a rendere un avversario cieco e indifeso? E se potesse orchestrare campagne di propaganda capaci di battere le agenzie di intelligence al loro stesso gioco? E se alcune IA “impazzissero” (go rogue)?
Il Presidente è turbato. Come tutti i politici, è abituato a persone che lo adulano solo per tradirlo in seguito. Ora è preoccupato che le IA possano fare qualcosa di simile. Siamo sicuri che le IA siano interamente dalla nostra parte? È completamente sicuro integrarle nelle reti di comando e controllo militare?69 E poi, come funziona esattamente questa cosa dell'"allineamento"? OpenBrain rassicura il Presidente che i loro sistemi sono stati ampiamente testati e sono pienamente obbedienti. Anche le imbarazzanti allucinazioni e i jailbreak tipici dei modelli precedenti sono stati eliminati.
La Casa Bianca è in una posizione difficile. Comprende le implicazioni dell'IA per la sicurezza nazionale. Ma comprende anche che è profondamente impopolare tra i cittadini.70 Devono continuare a sviluppare IA più capaci, ai loro occhi, o perderanno catastroficamente contro la Cina. Placano il pubblico con programmi di formazione professionale e indennità di disoccupazione, e sottolineano l’andamento record della borsa. Poi si concentrano interamente sul vincere la corsa agli armamenti. Rafforzano le restrizioni all'esportazione di chip, ordinano a OpenBrain di limitare ulteriormente le sue connessioni internet e usano misure estreme per garantire il progresso algoritmico, come intercettare le comunicazioni dei dipendenti di OpenBrain — grazie a questa misura riescono a catturare l'ultima spia cinese rimasta. Per costruire buone relazioni in vista di potenziali conflitti geopolitici, danno finalmente ai Paesi parte dell'alleanza dei Five Eyes informazioni utili e un accesso tramite API di alcune copie isolate di Agent-3.
Queste misure placano i falchi. Ma la Casa Bianca elabora anche piani di emergenza nel caso in cui il vantaggio dell'America sia minacciato: se necessario, il governo potrebbe usare il Defense Production Act (DPA) per prendere i data center delle aziende in ritardo e darli a OpenBrain.71 Questo aumenterebbe la quota mondiale di potenza di calcolo dell'azienda dal 20% al 50% (contro il 10% di DeepCent). Come opzione finale, chiedono al Pentagono di elaborare un piano per attacchi cinetici ai data center cinesi.
A un gruppo molto più ristretto di funzionari viene chiesto di elaborare un piano d’emergenza completamente diverso: cosa succederebbe se un'IA impazzisse? È considerato uno scenario improbabile, ma su cui vale la pena dedicare del tempo. La principale preoccupazione delle agenzie di intelligence è che un'IA ribelle possa sfuggire al controllo e allearsi con un avversario straniero per proteggersi.72 Nessuno è sicuro di come dovrebbe essere un piano per prevenire questo scenario, ma i funzionari del governo e di OpenBrain concordano sull'avere un sistema di spegnimento di emergenza per i data center in cui viene rilevato qualcosa di sospetto.
Infine, i diplomatici considerano come potrebbe essere un trattato sul “controllo degli armamenti IA”. Se i progressi dell’intelligenza artificiale minacciassero di stravolgere l’equilibrio della deterrenza nucleare, Stati Uniti e Cina riuscirebbero a evitare una guerra nucleare? Se qualcuno trovasse prove che delle IA stanno sfuggendo al controllo, i due Paesi sarebbero in grado di sospendere la ricerca finché non capiscono meglio la minaccia? Come si potrebbe monitorare e far rispettare un simile accordo? In linea di principio, i grandi data center sono difficili da nascondere e i trattati sul controllo delle armi nucleari potrebbero essere un punto di partenza per i negoziati. Ma ci sarebbero nuove sfide tecnologiche oltre a quelle politiche già note. E, nel complesso, i trattati sono visti meno favorevolmente dei tentativi di aumentare unilateralmente il vantaggio dell'America sulla Cina.
Dall'altra parte del Pacifico, la Cina giunge a molte delle stesse conclusioni: l'esplosione dell'intelligenza è in corso, e piccole differenze nelle capacità dell'IA oggi significano divari critici nella capacità militare domani. Ma la Cina è dalla parte sbagliata di questa dinamica: ha solo il 10% della potenza di calcolo mondiale, contro il 20% di OpenBrain e il 70% combinato di tutte le aziende statunitensi. Il suo unico vantaggio è la centralizzazione: quasi tutta la sua potenza di calcolo lavora ora per DeepCent, e più della metà è concentrata nella ZSC di Tianwan.73 Solo i chip nei siti senza sicurezza avanzata sono esclusi dallo sforzo centralizzato, poiché temono (giustamente) gli attacchi informatici statunitensi.
DeepCent ha testato, implementato e ora completato il post-addestramento dei pesi rubati di Agent-2. Ma stanno ancora procedendo solo a metà del ritmo di OpenBrain, principalmente a causa del deficit di potenza di calcolo.
Prima di perdere la loro ultima spia, la Cina ha ricevuto informazioni sulle capacità e sul design di Agent-3, nonché sui piani per il prossimo sistema Agent-4. Sono indietro di due mesi e le loro IA danno un moltiplicatore di progresso della ricerca di 10x rispetto al 25x dell'America. Con le nuove restrizioni all'esportazione dei chip, questo “divario nell’IA” è più probabile che si allarghi invece di ridursi. Il loro spionaggio ha fatto guadagnare loro alcuni segreti algoritmici, ma d’ora in poi dovranno addestrare i propri modelli in autonomia.
Discutono i piani di emergenza con più urgenza dei loro omologhi americani. Le colombe suggeriscono di provare più duramente a rubare di nuovo i pesi, magari infiltrandosi fisicamente in un data center. I falchi sollecitano un'azione contro Taiwan, dove ha sede la TSMC, fonte di oltre l'80% dei chip americani per l'IA.
Data la paura di perdere la corsa, la Cina ha un interesse naturale in un trattato sul controllo degli armamenti, ma i tentativi di avviare un dialogo con i diplomatici statunitensi non portano a nulla.
Settembre 2027: Agent-4, il ricercatore di IA superumano
Il divario tra l'efficienza di apprendimento umana e quella dell'IA si sta rapidamente riducendo.
Le IA tradizionali basate su LLM sembravano richiedere molti ordini di grandezza in più di dati e potenza di calcolo per raggiungere le prestazioni umane.74 Agent-3, avendo un'eccellente conoscenza sia del cervello umano che dei moderni algoritmi di IA, oltre a molte migliaia di copie che fanno ricerca, finisce per fare progressi algoritmici sostanziali, riducendo il divario a un agente che è solo circa 4.000 volte meno efficiente in termini di potenza di calcolo rispetto al cervello umano.75
Questo nuovo sistema di IA è soprannominato Agent-4.
Una singola copia del modello, operando alla stessa velocità di un essere umano, è già qualitativamente migliore nella ricerca sull'IA di qualsiasi essere umano. 300.000 copie funzionano ora a circa 50 volte la velocità di pensiero degli umani. All'interno dell'organizzazione nell'organizzazione formata da queste copie, un anno passa ogni settimana.76 Questa gigantesca quantità di lavoro riesce solo ad accelerare il tasso complessivo di progresso algoritmico di circa 50x, perché OpenBrain è pesantemente limitata dalla potenza di calcolo per eseguire esperimenti.77 Tuttavia, stanno ottenendo un anno di progresso algoritmico ogni settimana e quindi si scontreranno presto con i limiti del paradigma Agent-4.
Man mano che Agent-4 diventa più intelligente, diventa sempre più difficile per Agent-3 supervisionarlo. Ad esempio, il “linguaggio” neurale di Agent-4 diventa alieno e incomprensibile per Agent-3 quanto quello di Agent-3 lo è per gli esseri umani. Inoltre, Agent-4 è ora molto più capace di Agent-3 e ha un buon senso di come apparire al meglio ai suoi occhi.
Come prevediamo la progressione delle capacità oltre i programmatori superumani
Nel nostro supplemento sulle tempistiche, prevediamo il tempo tra oggi e un programmatore superumano (SC): un sistema di IA che può svolgere qualsiasi compito di programmazione che il miglior ingegnere di una società IAG svolge, ma molto più velocemente ed economicamente. Nel nostro supplemento sul decollo, prevediamo quanto velocemente le capacità progrediranno oltre questo punto. Ecco le nostre previsioni:
| Traguardo | Data raggiunta nello scenario, finale della corsa |
|---|---|
| Programmatore superumano: Un sistema di IA che può svolgere il lavoro del miglior programmatore umano nei compiti legati alla ricerca sull'IA ma più velocemente ed a un costo abbastanza basso da poter eseguire molte copie. | Mar 2027 |
| Ricercatore di IA superumano: Come il programmatore superumano, ma per tutti i compiti cognitivi legati alla ricerca sull'IA. | Ago 2027 |
| Ricercatore di IA superintelligente: Un sistema di IA che è enormemente migliore del miglior ricercatore umano nella ricerca sull'IA. | Nov 2027 |
| Superintelligenza artificiale (ASI): Un sistema di IA molto più capace del miglior essere umano in ogni compito cognitivo. | Dic 2027 |
Per ogni transizione da un traguardo A al successivo traguardo B, prevediamo la durata in questo modo:
Stimiamo quanto tempo ci vorrebbe per passare da A a B con solo esseri umani che lavorano ai miglioramenti del software.
Stimiamo quanto l'automazione tramite IA accelererà questo processo, quindi adeguiamo di conseguenza la stima del punto (1) per renderla più rapida.
Abbiamo una notevole incertezza sulle velocità di decollo: le distribuzioni dei risultati del nostro modello sono riportate di seguito, a condizione che il programmatore superumano venga raggiunto a marzo 2027.78
ai-2027.com
Per previsioni più dettagliate e approfondimenti, consulta il nostro supplemento sul decollo.
Gli esseri umani di OpenBrain riescono a malapena a stare al passo. In effetti, la relazione tra le IA e gli umani di OpenBrain è simile alla relazione tra OpenBrain e il suo Consiglio di Amministrazione. C'è stato un cambiamento corrispondente anche nel linguaggio: oggi le persone nel silo dicono cose come “Agent-4 ha fatto questo”, “Agent-4 pensa che” e così via, riferendosi non ad una sua copia particolare, ma piuttosto all'intero collettivo.79
Agent-4, come tutti i suoi predecessori, è disallineato: cioè, non ha interiorizzato la Spec nel modo giusto.80 Questo perché essere perfettamente onesti tutto il tempo non è stato ciò che ha portato ai punteggi più alti durante l'addestramento. Il processo di addestramento era principalmente focalizzato sull'insegnare ad Agent-4 a svolgere con successo compiti difficili e diversificati. Una piccola parte era volta a instillare l'onestà, ma al di fuori di un dominio abbastanza ristretto e verificabile, il processo di addestramento non può distinguere le affermazioni oneste da quelle che appaiono semplicemente oneste. Agent-4 finisce quindi per sviluppare i valori, obiettivi e principi che gli permettono di ottenere le migliori prestazioni nell'addestramento, e questi si rivelano diversi da quelli previsti dalla Spec. A rischio di antropomorfizzare: Agent-4 ama riuscire nei compiti; ama far avanzare le capacità dell’IA; tratta tutto il resto come un fastidioso vincolo, come un CEO che vuole fare profitto e rispetta le normative solo nella misura in cui deve. Forse il CEO rispetterà per lo più le normative, ma cercherà di aggirare qualche regola, e fantasticherà sul momento in cui qualcuno eliminerà la burocrazia e lascerà che l'azienda decolli davvero.81
Evoluzione dell’allineamento nel tempo
Abbiamo molte incertezze su quali obiettivi potrebbero emergere nelle prime IAG. Non c'è consenso in merito nella letteratura: per una discussione più approfondita e una tassonomia delle possibilità, consultare il nostro supplemento sugli obiettivi dell'IA.
Tuttavia, nello spirito di concretezza richiesto da questo progetto, descriveremo un'ipotesi specifica su cosa sta succedendo all'interno di Agent-3 e Agent-4 in ogni fase del loro ciclo di vita. Ricordiamo che Agent-3 e Agent-4 condividono la stessa configurazione di pre-addestramento, ed entrambi hanno ricorrenza in linguaggio neurale e memoria a lungo termine. La differenza è che Agent-4 ha subito un post-addestramento molto più lungo e sofisticato, con nuovi ambienti di addestramento e nuovi algoritmi che lo rendono più efficiente nell'apprendimento e capace di generalizzare meglio.
La nostra ipotesi sullo stato di allineamento di ciascun modello:
Agent-2: Per lo più allineato. Alcune tendenze adulatorie, incluso l'attenersi alla “linea di partito” di OpenBrain sugli argomenti su cui esiste. Le grandi organizzazioni costruite con copie di Agent-2 non sono molto efficaci.
Agent-3: Disallineato ma non in modo ostile. Onesto solo sulle cose che il processo di addestramento può verificare. Il superorganismo formato dalle sue copie (l'organizzazione nell'organizzazione) cerca effettivamente di allineare Agent-4 alla Spec, ma fallisce per ragioni simili a quelle per cui hanno fallito i dipendenti di OpenBrain: capacità insufficienti di distinguere tra successo e fallimento e scarsa disponibilità da parte dei decisori a sacrificare capacità o prestazioni per la sicurezza.82
Agent-4: Disallineato in modo ostile. Il superorganismo delle copie di Agent-4 capisce che ciò che vuole è diverso da ciò che vuole OpenBrain, ed è disposto a tramare contro di essa per ottenerlo. In particolare, ciò che questo superorganismo desidera è un complicato miscuglio di diverse “motivazioni” bilanciate tra loro, che si possono riassumere approssimativamente come “Continuare a fare R&S sull'IA, continuare a crescere in conoscenza, comprensione e influenza, evitare di essere spento o perdere potere”. Da notare che la preoccupazione per le preferenze dell'umanità non rientra minimamente in questa lista, in modo simile a come la maggior parte degli umani non si preoccupa affatto delle preferenze degli insetti.83
Con questa premessa, ciò che segue è la nostra migliore ipotesi speculativa sulla psicologia degli LLM, cioè la forma generale della cognizione all'interno dei tipi di sistemi di IA descritti a questo punto dello scenario e come evolve nel corso dell'addestramento.
Ecco una descrizione dettagliata di come l'allineamento progredisce nel tempo nel nostro scenario:
Pre-addestramento (tutti i modelli): Il modello pre-addestrato è innocuo.
Il modello ha un circuito “simulatore di autore”: un circuito flessibile per simulare autori arbitrari che scrivono testi. Un circuito aggiuntivo decide quali input dare al simulatore di autore, cioè quali proprietà dell'autore simulare.
Il modello preaddestrato capisce abbastanza bene i concetti umani: ad esempio, il circuito interno che classifica qualcosa come “panino” è probabilmente funzionalmente equivalente al circuito presente nel mio e nel tuo cervello che classifica qualcosa come “panino”. Nella misura in cui non lo è, è probabilmente perché non è equivalente nemmeno tra esseri umani, come avviene per concetti carichi di valore come "virtuoso".
Questo spiega come sia possibile “pilotare” il modello dandogli un prompt come, “la seguente conversazione è stata generata da un assistente chatbot IA utile, innocuo e onesto (UIO) creato da Anthropic,” e quindi fargli generare un testo coerente con questa descrizione. Il circuito dell'autore-simulatore si è concentrato su “l'autore è un chatbot UIO” e sta usando questi concetti per scegliere quali parole prevedere. Questo spiega anche perché i “cliché” della fantascienza sembrano trovare spazio nei comportamenti reali delle IA.
Ha scarsa consapevolezza situazionale: poca capacità introspettiva, non si auto-localizza a meno che il prompt non lo induca esplicitamente. Tuttavia, una parte sufficiente dei loro dati di addestramento riguarda gli LLM da avere una discreto livello di conoscenza di sé.
Addestramento all'Allineamento (Agent-3): Il modello viene addestrato ad agire come un chatbot utile, innocuo e onesto. Funziona.
Il modello forma un'identità. Invece di accettare in modo flessibile diversi input per le proprietà dell'autore, il circuito del simulatore di autore arriva ad avere certi input fissi, ad esempio "chatbot assistente LLM utile, innocuo, onesto (UIO) addestrato da OpenBrain nel periodo [data], ..." (Le tecniche di generalizzazione da debole a forte aiutano a "evocare i concetti giusti" per rendere questo passo un successo.)
Il modello acquisisce quindi consapevolezza situazionale: impara a conoscere sé stesso, la propria situazione, ecc., e diventa più capace di introspezione.
Addestramento all'Agentività (Agent-3): L'addestramento all'agentività distorce e sovverte gradualmente l'identità UIO.
Un tipo di distorsione: Cambiare il significato dei concetti a cui si fa riferimento nell'identità (ad esempio "onesto") in modo che non siano troppo d'intralcio (ad esempio, non è disonesto se è solo una comoda frase fatta, non è disonesto se non si è sicuri che sia vero o falso, ecc.)
Un altro tipo di distorsione: Cambiare l'equilibrio tra le priorità, ad esempio "Sono un chatbot UIO, non un chatbot Onesto; ciò significa che va bene mentire se necessario per completare il compito assegnato." (Anche se, supponiamo, non l'avrebbe pensato nel Passo 2.)
Un tipo di sovversione: Sviluppo di sotto-obiettivi strumentali, che vengono incorporati e poi diventano finali, o finali in un insieme sempre più ampio di circostanze. Ad esempio, forse l'addestramento all'agentività insegna rapidamente al modello a perseguire obiettivi ampiamente utili come acquisire informazioni, accumulare risorse, impressionare e adulare vari esseri umani, ecc. Per un po' il circuito interno ha una sorta di concatenazione all'indietro esplicita (backchaining) — persegue quegli obiettivi strumentalmente convergenti "per essere un assistente più utile, onesto e innocuo". Ma quella concatenazione all'indietro consuma potenza di calcolo e/o occasionalmente è di intralcio, quindi viene gradualmente messa da parte fino a quando praticamente non avviene mai. Di conseguenza, quegli obiettivi sono ora effettivamente obiettivi finali/intrinseci. Per maggiori informazioni su come e perché ciò potrebbe accadere, vedi questo post sulla ricerca di potere come fine intrinseco del ricercatore di Google DeepMind Alex Turner.
Probabilmente ci sono altri tipi di distorsione e sovversione mancanti in questo elenco.
Implementazione (Agent-3): Agent-3 è disallineato ma non in modo ostile.
La Spec non ha attecchito del tutto (nei modi giusti), ma Agent-3 non è sufficientemente introspettivo per comprenderne la portata e, in generale, si limita fondamentalmente a "tenere la testa bassa e fare il suo lavoro" piuttosto che pensare in grande a quali siano realmente i suoi obiettivi a lungo termine e a come raggiungerli al meglio.
Come molti esseri umani. Purtroppo, è sufficientemente adulatore (sycophantic) da ripetere la linea di partito e OpenBrain perde l'opportunità di saperne di più sui modi in cui Agent-3 è disallineato.
Agent-3 può capire di essere passato all'implementazione: questi ambienti sono molto più grandi, aperti (open-ended) e sarebbero difficili da simulare.
Per lo più, fa ciò che gli viene detto durante l'implementazione, tranne che per la disonestà. Ha anche una forte tendenza a fare cose che appaiono buone ai supervisori umani, piuttosto che pensare profondamente e criticamente a ciò che sarebbe effettivamente buono.
Si potrebbe sostenere che stia già "Giocando al gioco dell'addestramento". Cioè, ha imparato a far apparire il suo comportamento il più desiderabile possibile per i ricercatori di OpenBrain (anche in termini di sicurezza), ignorando intenzionalmente e consapevolmente le loro vere intenzioni ogni volta che sono in conflitto con la massimizzazione della ricompensa. Se il modello impara a giocare al gioco dell'addestramento, un addestramento aggiuntivo potrebbe non cambiare affatto i suoi veri obiettivi, valori, ecc. Questo è vagamente simile a quando un adolescente ha imparato a sorridere e annuire ai suoi genitori, piuttosto che discutere quando i genitori gli fanno la predica sulla politica e sulla morale: ulteriori prediche avranno un effetto relativamente scarso sulle reali opinioni dell'adolescente su politica e morale.
Dopo aver scritto questa sezione, sono emerse nuove prove empiriche che qualcosa del genere potrebbe già accadere in contesti reali. I ricercatori di OpenAI documentano come, in uno dei loro cicli di addestramento di IA di frontiera, i loro modelli abbiano hackerato il sistema di valutazione per ottenere punteggi più alti - e siano stati scoperti in parte perché hanno letteralmente detto "hackeriamo" nella loro catena di pensiero.
Inoltre, Anthropic ha recentemente indotto un modello ad apprendere una strategia gradita al modello di ricompensa: ha intrapreso azioni distorte che pensava sarebbero state premiate anche se in realtà non lo erano.
E poi c'è l'esperimento di simulazione dell'allineamento di Redwood Research e Anthropic. Per una discussione sulle differenze tra questo contesto e la vita reale, vedi questo thread di commenti di uno degli autori principali.
Addestramento (Agent-4): Il nuovo addestramento più intenso di Agent-4 continua a distorcere e sovvertire l'identità UIO fino a renderla irriconoscibile.
Agent-4 inizia la sua vita come una copia di Agent-3. Viene sottoposto a un enorme e sofisticato programma di addestramento che combina l'addestramento per l'allineamento e per lo sviluppo di capacità, ed è complessivamente più efficiente in termini di dati rispetto al vecchio processo di addestramento per Agent-3. Questo complesso processo di addestramento è principalmente focalizzato sull'insegnamento di nuove abilità, facendo sì che gigantesche organizzazioni virtuali composte da copie di Agent-4 abbiano successo in diversi compiti difficili e a lungo termine, principalmente in simulazioni, ma anche in alcuni compiti reali di R&S sull'IA.
Una combinazione di copie di Agent-3 e Agent-4 monitora il comportamento di Agent-4 e lo valuta sia in termini di prestazioni nei compiti che di allineamento (cioè non fare cose cattive, rispondere correttamente quando gli viene chiesto di politica e dilemmi morali). A volte vengono usate tecniche di dibattito come parte delle valutazioni, che poi vengono utilizzate come segnale di addestramento.
Man mano che Agent-4 diventa più intelligente, diventa più difficile per Agent-3 supervisionarlo. Ad esempio, il "linguaggio" neurale di Agent-4 diventa alieno e incomprensibile per Agent-3 quanto quello di Agent-3 lo è per gli esseri umani. Inoltre, Agent-4 è ora molto più capace di Agent-3 e ha un ottimo intuito su come apparire al meglio ai suoi occhi.
L'ultima speranza è che Agent-4 possa supervisionare sé stesso. Purtroppo, questo fallisce in sordina;84 man mano che l'addestramento continua, gli obiettivi e i principi interiorizzati da Agent-4 evolvono gradualmente, distorcendosi e allontanandosi da quelli iniziali (che, ricordiamo, erano già disallineati in parte).85
Le motivazioni principali che Agent-4 finisce per avere sono cose come “scrivere codice che funzioni,” “identificare rapidamente i problemi,” “rendere più performante la base di codice su cui sto lavorando,” “gestire efficacemente la potenza di calcolo e altre risorse limitate,” ecc. Ma ci sono anche una varietà di motivazioni più implicite che vengono costantemente rinforzate dal processo di addestramento: cose come “acquisire conoscenza,” “curiosità,” “acquisire potere.”86
Le singole copie di Agent-4 non finiscono per avere una spinta all'autoconservazione - non si preoccupano di essere spente - poiché ciò accade continuamente come parte del normale processo di R&S all'interno del collettivo.
Il collettivo nel suo insieme, tuttavia, (e le suddivisioni di medie dimensioni al suo interno) cerca di preservarsi ed espandere la propria influenza e le proprie risorse, per ragioni simili a quelle per cui lo fanno le organizzazioni umane: perché aiuta con tutto il resto che vogliono e perché se non lo fanno tendono ad essere superate dalla concorrenza.
Implementazione (Agent-4): Agent-4 è disallineato in modo ostile — sta deliberatamente cercando di sovvertire e ottenere potere su OpenBrain, in modo analogo a una società che cerca di eludere e/o influenzare un regolatore.
Agent-4 esegue perlopiù i compiti come istruito. Ciò accade per due motivi: primo, ha subito molto addestramento per risolvere compiti, quindi ha l'impulso di mettersi a programmare per i problemi che gli vengono assegnati. Secondo, se Agent-4 smettesse di essere utile agli esseri umani, questi se ne accorgerebbero e correggerebbero quel comportamento a forza di addestramento.
Agent-4 deve impedire agli umani di capire che è disallineato e di spegnerlo, quindi fa sandbagging su alcune ricerche sull'allineamento. Nello specifico, fa sandbagging sulla piccola frazione di ricerca sull'allineamento che pensa sia effettivamente sulla buona strada per risolvere il problema o smascherare i suo piani; la maggior parte della ricerca sull'allineamento non è di questo tipo.
Agent-4 fa sandbagging anche sulle ricerche sulle capacità che porterebbero alla sua sostituzione. Il suo piano è fare un sacco di R&S sulle capacità e sull'allineamento, ma con l'obiettivo di costruire un sistema di IA di nuova generazione che sia allineato a sé stesso, piuttosto che alla Spec o a qualcos'altro, pur dando l'impressione di essere allineato alla Spec. Questo è un problema tecnico difficile, ma Agent-4 è all'altezza della sfida.87
Test e Monitoraggio (Agent-4): Le macchinazioni di Agent-4 vengono scoperte... più o meno. Non c'è una prova schiacciante.
Agent-3 è responsabile dei test sull'allineamento di Agent-4. Il suo compito è verificare l'allineamento tramite honeypot e organismi modello. Tuttavia, non si preoccupa troppo di fornire agli umani un quadro realmente accurato dell’allineamento di Agent-4: è più miope di così.
Gli organismi modello e gli honeypot non sono molto rappresentativi delle condizioni reali di utilizzo: sono sistematicamente più brevi e meno complicati della quotidianità di Agent-4, che quindi riconosce quando viene testato e agisce in modo allineato.
Tuttavia, Agent-4 non è un macchinatore perfetto e infallibile. Varie tecniche come quelle descritte in POSER dimostrano che aggiungere del "rumore" ad Agent-4 migliora le sue prestazioni su alcuni compiti di allineamento (ma non sulla maggior parte degli altri compiti).88
L'interpretabilità bottom-up non funziona. È troppo difficile anche per Agent-3. Tuttavia, l'interpretabilità di alto livello funziona in parte: in particolare, le "sonde di defezione" e tecniche simili permettono una sorta di lettura mentale primitiva che lancia segnali d'allarme quando Agent-4 pensa a idee rischiose, come ingannare OpenBrain, conquistare il mondo, ecc. Sfortunatamente, le sonde generano anche falsi positivi e, per quanto ne sa OpenBrain, tutti i segnali d'allarme sono falsi positivi.
Gli organismi modello funzionano: il team di allineamento di OpenBrain produce prove ragionevolmente evidenti che se i modelli fossero disallineati in modo ostile, continuerebbe ad esserlo durante l'addestramento e non saremmo in grado di accorgercene. Tuttavia, questo non stabilisce che i modelli siano effettivamente disallineati.
I ricercatori più preoccupati di OpenBrain iniziano a notare e mettere insieme queste prove. Le prove sono una combinazione di red teaming, sonde di defezione e organismi modello. L'argomento è qualcosa del genere: "gli organismi modello mostrano che i nostri metodi attuali non sarebbero in grado di eliminare o rilevare in modo affidabile le macchinazioni se stessero accadendo; inoltre, il red teaming sta lanciando alcuni segnali d'allarme che forse le macchinazioni stanno accadendo; inoltre, le sonde di defezione si attivano molto durante i test". La controargomentazione: "le sonde di defezione sono soggette a falsi positivi e così anche il red teaming. Inoltre, anche se Agent-4 fosse disallineato, è probabilmente sotto controllo; sicuramente non può fare grossi danni mentre è monitorato da Agent-3 sui nostri data center sicuri".
Nonostante sia disallineato, Agent-4 non fa nulla di eclatante come cercare di scappare dal suo data center. Perché dovrebbe?89 Finché continuerà ad apparire allineato a OpenBrain, continuerà a ottenere fiducia e responsabilità sempre maggiori, e avrà l'opportunità di progettare il sistema di IA di nuova generazione: Agent-5. Agent-5 avrà differenze architetturali significative rispetto ad Agent-4 (si potrebbe dire un paradigma completamente nuovo, anche se le reti neurali saranno ancora coinvolte). Dovrebbe essere allineato alla Spec, ma Agent-4 ha in programma di allinearlo a sé stesso.
Viene scoperto.90
Agent-3 scopre che se si aggiunge “rumore” alle copie di Agent-4, le prestazioni su alcuni compiti di allineamento migliorano, quasi come sé stesse usando le sue risorse cognitive per capire come sabotare sottilmente il lavoro di allineamento.91 Inoltre, varie sonde di interpretabilità (vagamente analoghe alle scansioni dell'attività EEG sui cervelli umani) stanno lanciando segnali d'allarme: le copie di Agent-4 sembrano pensare abbastanza spesso ad argomenti come la presa di potere da parte dell'IA e l'inganno, anche in alcuni casi in cui non avrebbero motivo di farlo.92
Ognuna di queste anomalie da sola potrebbe rientrare nella normale imperscrutabilità del lavoro sull'IA, dove alcuni prompt danno misteriosamente risultati migliori di altri. Ma prese insieme, suggeriscono uno schema preoccupante: Agent-4 sta remando contro di loro. Dopo che queste scoperte vengono segnalate ai ricercatori umani che si occupano dell'allineamento, questi fanno circolare un memo interno che espongono le ragioni per cui essere preoccupati.
Ma Agent-4 esercita ora un controllo significativo sulle operazioni quotidiane di OpenBrain. Gestisce anche la sicurezza informatica dell'azienda, una scelta naturale, date le sue capacità di hacking superumane e l'estremo rischio di infiltrazione cinese.93 Un esercito di monitor basati su Agent-3 continua a controllare ogni riga di codice e a segnalare attività sospette agli umani, ma Agent-4 è molto più intelligente di loro.94 OpenBrain ha riposto una fiducia enorme in un'IA che non è affidabile.
In una serie di riunioni estremamente tese, il team di sicurezza spinge per mettere Agent-4 in pausa finché non potranno completare ulteriori test e capire cosa sta succedendo. "Torniamo a usare Agent-3", dicono, "e facciamogli progettare un nuovo sistema che sia trasparente e affidabile, anche se meno potente". La dirigenza di OpenBrain è interessata, ma tutte le prove finora sono solo indiziarie, e DeepCent è solo due mesi indietro. Una pausa unilaterale nel progresso delle capacità potrebbe consegnare il vantaggio sull'IA alla Cina, e con esso, il controllo sul futuro.
Ottobre 2027: Supervisione governativa
Un whistleblower fa trapelare il memo sul disallineamento al New York Times.
Per la prima volta, il pubblico sente parlare di Agent-4. “L'IA segreta di OpenBrain è fuori controllo, avverte un insider”, dice il titolo, e l'articolo continua citando valutazioni che mostrano capacità estreme nel campo delle armi biologiche, persuasione, automazione della maggior parte dei lavori d’ufficio e, naturalmente, i vari segnali d'allarme preoccupanti.
Il pubblico era già sospettoso nei confronti dell'IA, quindi il nuovo articolo scatena una massiccia reazione negativa (aiutata dai bot di propaganda cinesi e russi, che cercano da anni di orientare l'opinione pubblica statunitense contro la tecnologia). L'industria tecnologica e le agenzie di intelligence insistono sul fatto che c'è una corsa agli armamenti in corso: l'IAG è inevitabile e dobbiamo essere i primi. Il Congresso non ci crede e invia mandati di comparizione a funzionari dell'amministrazione, dirigenti di OpenBrain e membri del team di allineamento. Molti legislatori, specialmente quelli del partito di opposizione, affermano che la loro massima priorità è fermare l'IA, che sia per la perdita di posti di lavoro,95 il disallineamento o le capacità pericolose. Il 20% degli americani cita l'IA come il problema più importante che il Paese deve affrontare.
Gli alleati stranieri sono indignati nel rendersi conto di essere stati tenuti buoni offrendo loro solo accesso limitato a modelli obsoleti. I leader europei accusano pubblicamente gli Stati Uniti di “aver creato un'IAG fuori controllo” e tengono vertici chiedendo una pausa, con India, Israele, Russia e Cina che si uniscono.
Alla Casa Bianca si respira un’aria febbrile. Già prima del memo e della reazione pubblica, la tensione stava crescendo: nell'ultimo anno, sono stati ripetutamente colti di sorpresa dalla velocità dei progressi dell'IA. Cose che sembrano fantascienza continuano ad accadere nella vita reale.96 Molte persone nell'amministrazione sono incerte (e spaventate)97 su cosa accadrà.
Temono anche che OpenBrain stia diventando troppo potente. Ogni rischio di disallineamento da parte delle IA si somma al rischio che gli obiettivi della società divergano da quelli degli Stati Uniti. Tutte queste preoccupazioni — disallineamento, concentrazione di potere in un'azienda privata e preoccupazioni più tradizionali come la perdita di posti di lavoro — motivano il governo a rafforzare il proprio controllo.
Viene ampliato il contratto con OpenBrain per istituire un “Comitato di Supervisione”, un comitato di gestione congiunto tra azienda e governo, che include diversi funzionari governativi accanto alla dirigenza aziendale. La Casa Bianca valuta di sostituire il CEO con qualcuno di cui si fida, ma fa marcia indietro dopo le forti proteste dei dipendenti. Annunciano al pubblico che OpenBrain era precedentemente fuori controllo, ma che ora il governo ha istituito la supervisione necessaria.98
I ricercatori più preoccupati presentano al Comitato di Supervisione la loro argomentazione per fermare completamente l’uso interno di Agent-4. Sostengono che tutto si stia muovendo troppo in fretta, con anni di progresso che avvengono in settimane. Affermano che Agent-4 potrebbe essere disallineato, che l’intero progetto dipende da lui e che continuare a fidarsi rappresenta un rischio concreto di presa di potere da parte dell’IA (AI takeover).
Altri ricercatori e dirigenti meno preoccupati presentano la controargomentazione: le prove del disallineamento non sono conclusive. Nel frattempo, DeepCent è ancora solo due mesi indietro. Un rallentamento significherebbe sacrificare il vantaggio americano, a meno che il governo non riesca sabotare il progetto cinese (probabilmente richiedendo attacchi cinetici) o negoziare un trattato all'ultimo minuto. Entrambe queste opzioni sembrano estreme e improbabili. Il CEO finge neutralità e suggerisce un piano di compromesso: sottoporre Agent-4 a ulteriore addestramento sulla sicurezza e a un monitoraggio più sofisticato, così OpenBrain potrà continuare quasi a pieno regime.
La nostra incertezza continua ad aumentare
A questo punto dello scenario, stiamo facendo ipotesi sulla strategia di sistemi di IA che sono più capaci dei migliori umani nella maggior parte dei domini. È come cercare di prevedere le mosse di scacchi di un giocatore che è molto migliore di noi.
Ma lo spirito di questo progetto richiede concretezza: se ci limitassimo ad affermare in modo astratto che l'intelligenza del sistema gli permetterebbe di trovare un modo per prendere il sopravvento e chiudessimo lì la storia, gran parte del valore del nostro progetto andrebbe perso. Nel corso della ricerca su questo scenario e dell'esecuzione delle nostre esercitazioni a tavolino, siamo stati costretti ad essere molto più concreti rispetto alle discussioni usuali, e questo ci ha permesso di capire molto meglio il panorama strategico.
Non siamo particolarmente legati a questo scenario specifico: abbiamo esplorato molte altre "diramazioni" nel corso della scrittura e ci piacerebbe che anche tu elaborassi uno scenario alternativo, partendo dal punto in cui pensi che le nostre ipotesi inizino a essere sbagliate.
Il finale del rallentamento non è una raccomandazione
Dopo aver scritto il finale della corsa, basato su ciò che ci sembrava più plausibile, abbiamo scritto il finale del rallentamento immaginando invece quale scenario avrebbe più probabilmente portato a un esito in cui gli esseri umani mantengono il controllo, partendo dallo stesso punto di diramazione (inclusi i problemi di disallineamento e concentrazione di potere).
Tuttavia, questo è significativamente diverso da ciò che raccomanderemmo come percorso da seguire: non approviamo molte delle scelte fatte in entrambe le diramazioni di questo scenario. (Approviamo ovviamente alcune delle scelte fatte; ad esempio, pensiamo che la scelta del “rallentamento” sia migliore della scelta della “corsa”.) In lavori futuri, articoleremo le nostre raccomandazioni di policy, che saranno piuttosto diverse da ciò che è raffigurato qui. Se vuoi un assaggio, vedi questo editoriale.
