Nous prévoyons que l'impact de l'IA surhumaine au cours de la prochaine décennie sera énorme, dépassant celui de la révolution industrielle.

Nous avons écrit un scénario qui représente notre meilleure estimation de ce à quoi cela pourrait ressembler.1 Il s'appuie sur des extrapolations de tendances, des simulations stratégiques (wargames), des commentaires d'experts, l'expérience acquise chez OpenAI et nos succès précédents en matière de prévision.2

Les PDG d'OpenAI, de Google DeepMind et d'Anthropic ont tous prédit que l'IAG arrivera dans les 5 prochaines années. Sam Altman a dit qu'OpenAI vise « la superintelligence au sens propre du terme » et « un avenir glorieux ».

À quoi cela pourrait-il ressembler ? Nous avons écrit IA 2027 pour répondre à cette question. Les affirmations sur l'avenir sont souvent si vagues que c'en est frustrant, nous avons donc essayé d'être aussi concrets et quantitatifs que possible, même si cela signifie décrire l'un des nombreux futurs possibles.

Nous avons écrit deux fins : une fin « ralentissement » et une fin « course ». Cependant, IA 2027 n'est ni une recommandation ni une exhortation. Notre objectif est la précision prédictive.4

Nous vous encourageons à débattre et à contester ce scénario.5 Nous espérons lancer une large discussion sur la direction que nous prenons et sur la manière de nous orienter vers des avenirs positifs. Nous prévoyons de distribuer des milliers de dollars de prix aux meilleurs scénarios alternatifs.

(Ajouté le 22 novembre 2025, pour éviter tout malentendu : nous ne savons pas exactement quand l'IAG sera créée. 2027 était notre année modale (la plus probable) au moment de la publication ; nos médianes étaient un peu plus lointaines.3 Pour nos prévisions les plus récentes, voir ici.)

Nos recherches sur les questions clés (par exemple, quels seront les objectifs des futurs agents IA ?) sont disponibles ici.

Le scénario lui-même a été écrit de manière itérative : nous avons rédigé la première période (jusqu'à mi-2025), puis la période suivante, et ainsi de suite jusqu'à la fin. Nous avons ensuite tout jeté et recommencé.

Nous ne cherchions pas à arriver à une fin particulière. Après avoir terminé la première fin — qui est maintenant en rouge — nous avons écrit une nouvelle branche alternative parce que nous voulions aussi décrire une issue plus optimiste, en partant à peu près des mêmes prémisses. Cela a nécessité plusieurs itérations.6

Notre scénario s'est inspiré d'environ 25 exercices de simulation théorique et des commentaires de plus de 100 personnes, dont des dizaines d'experts en gouvernance de l'IA et en travail technique sur l'IA.

« Je recommande vivement la lecture de cette prédiction sous forme de scénario sur la façon dont l'IA pourrait transformer le monde en quelques années seulement. Personne n'a de boule de cristal, mais ce type de contenu peut aider à identifier des questions importantes et à illustrer l'impact potentiel des risques émergents. »Yoshua Bengio7

Nous nous sommes fixé une tâche impossible. Essayer de prédire comment une IA surhumaine évoluera en 2027, c'est comme essayer de prédire comment se déroulerait la Troisième Guerre mondiale en 2027, sauf que c'est un écart encore plus grand par rapport aux études de cas passées. Pourtant, cela vaut quand même la peine d'essayer, tout comme il est utile pour l'armée américaine d'élaborer des scénarios pour Taïwan.

En brossant un tableau complet, nous remarquons des questions ou des liens importants que nous n'avions pas envisagés ou appréciés auparavant, ou nous nous rendons compte qu'une possibilité est plus ou moins probable. De plus, en nous exposant avec des prédictions concrètes et en encourageant les autres à exprimer publiquement leur désaccord, nous permettons d'évaluer, des années plus tard, qui avait raison.

Un des auteurs a également rédigé un scénario sur l'IA moins ambitieux plus tôt, en août 2021. Même si ce scénario s'est trompé sur beaucoup de choses, il a étonnamment bien réussi dans l'ensemble : il a prédit l'essor de la chaîne de pensée, l'amplification de l'inférence, les contrôles stricts sur les exportations de puces IA et les cycles d'entraînement à 100 millions de dollars — tout cela plus d'un an avant ChatGPT.

Daniel Kokotajlo (TIME100, article du NYT) est un ancien chercheur d'OpenAI dont les précédentes prédictions sur l'IA se sont avérées relativement bonnes.

Eli Lifland a cofondé AI Digest, a mené des recherches sur la robustesse de l'IA et est numéro 1 du classement général de la RAND Forecasting Initiative.

Thomas Larsen a créé le Center for AI Policy et a fait des recherches sur la sûreté de l'IA au Machine Intelligence Research Institute.

Romeo Dean est en train de terminer un double diplôme licence-master en informatique à Harvard et était auparavant AI Policy Fellow à l'Institute for AI Policy and Strategy.

Scott Alexander, blogueur remarquable, s'est porté volontaire pour réécrire notre contenu dans un style engageant ; les parties divertissantes de l'histoire sont de lui et les parties ennuyeuses sont de nous.

Pour en savoir plus sur notre équipe et lire les remerciements, consultez la page « À propos ».

Mi-2025 : des agents qui tâtonnent

Le monde découvre les agents d'IA.

Les pubs pour ces agents informatiques mettent en avant le terme « assistant personnel » : vous pouvez leur demander de faire des tâches comme « commande-moi un burrito sur DoorDash » ou « ouvre mon tableur de budget et fais le total des dépenses de ce mois-ci ». Ils vous contactent quand nécessaire, par exemple pour vous demander de confirmer des achats.8 Même s'ils sont plus avancés que les versions précédentes comme Operator, ils ont du mal à se généraliser.9

Pendant ce temps, loin des projecteurs, des agents de codage et de recherche plus spécialisés commencent à transformer leurs professions.

En 2024, les IA pouvaient suivre des instructions précises : elles pouvaient transformer des listes à puces en e-mails et des demandes simples en code fonctionnel. En 2025, les IA fonctionnent davantage comme des employés. Les IA de codage ressemblent de plus en plus à des agents autonomes plutôt qu'à de simples assistants : elles reçoivent des instructions via Slack ou Teams et apportent elles-mêmes des modifications importantes au code, ce qui permet parfois de gagner des heures, voire des jours.10 Les agents de recherche passent une demi-heure à fouiller Internet pour répondre à votre question.

En théorie (et dans des exemples triés sur le volet), ces agents sont impressionnants, mais dans la pratique, ils ne sont pas fiables. Le Twitter de l'IA regorge d'histoires d'IA qui ont raté leur mission de manière particulièrement hilarante. Les meilleurs agents sont aussi chers ; la qualité est à la hauteur du prix et les meilleures performances coûtent des centaines de dollars par mois.11 Mais beaucoup d'entreprises trouvent quand même des moyens d'intégrer les agents d'IA dans leurs flux de travail.12

Fin 2025 : l'IA la plus chère du monde

OpenBrain construit les plus grands centres de données jamais vus.13

(Pour éviter de pointer du doigt une entreprise en particulier, nous allons décrire une entreprise fictive d'intelligence artificielle générale, que nous appellerons OpenBrain. Nous imaginons que les autres ont 3 à 9 mois de retard sur OpenBrain.)

GPT-3
(3 x 10^23 FLOPS)
GPT-4
(2 x 10^25 FLOPS)
Agent-1
(3 x 10^27 FLOPS)
ai-2027.com

GPT-4 a eu besoin de 210252\cdot 10^{25} FLOP de puissance de calcul pour être entraîné.14 Le dernier modèle public d'OpenBrain, Agent-0, a été entraîné avec 102710^{27} FLOP. Une fois que les nouveaux centres de données seront opérationnels, ils pourront entraîner un modèle avec 102810^{28} FLOP, soit mille fois plus que GPT-4.15 D'autres entreprises investissent massivement dans leurs propres centres de données géants dans l'espoir de suivre le rythme.

Même si les modèles s'améliorent sur un large éventail de compétences, une compétence se démarque : OpenBrain se concentre sur les IA qui peuvent accélérer la recherche en IA. Ils veulent gagner la double course aux armements contre la Chine (dont l'entreprise leader, que nous appellerons « DeepCent »)16 et leurs concurrents américains. Plus ils peuvent automatiser leur cycle de recherche et développement (R&D), plus ils peuvent aller vite. Ainsi, lorsque OpenBrain termine l'entraînement d'Agent-1, un nouveau modèle en cours de développement interne, celui-ci est bon dans de nombreux domaines, mais excellent pour aider à la recherche en IA.17 À ce stade, le terme « terminer l'entraînement » n'est pas tout à fait adéquat, car les modèles sont fréquemment mis à jour vers des versions plus récentes, entraînées à partir de données supplémentaires, ou partiellement ré-entraînées pour corriger certaines faiblesses.18

Les mêmes environnements d'entraînement qui apprennent à Agent-1 à coder et à naviguer sur le web de manière autonome en font également un bon hacker. De plus, il pourrait apporter une aide considérable aux terroristes qui conçoivent des armes biologiques, grâce à ses connaissances de niveau doctoral dans tous les domaines et à sa capacité à naviguer sur le web. OpenBrain rassure le gouvernement en affirmant que le modèle a été « aligné » de manière à refuser toute demande malveillante.

Les systèmes d'IA modernes sont des réseaux neuronaux artificiels gigantesques. Au début de son apprentissage, une IA n'a pas vraiment d'« objectifs », mais plutôt des « réflexes » : si elle voit « Ravi de faire votre », elle répond « connaissance ». Une fois qu'elle a été entraînée pour prédire environ l'équivalent d'un Internet de texte, elle aura développé des circuits internes sophistiqués qui encodent de grandes quantités de connaissances et jouent de manière flexible le rôle d'auteurs arbitraires, car c'est ce qui l'aide à prédire des textes avec une précision surhumaine.19

Après avoir été entraîné à prédire le texte sur Internet, le modèle est entraîné à produire du texte en réponse à des instructions. Cela lui confère une personnalité et des « motivations » de base.20 Par exemple, un agent qui comprend clairement une tâche est plus susceptible de la mener à bien ; au cours de son entraînement, le modèle « apprend » une « motivation » à bien comprendre ses tâches. D'autres motivations dans cette catégorie peuvent être l'efficacité, la connaissance et la présentation de soi (c'est-à-dire la tendance à présenter ses résultats sous le meilleur jour possible).21

OpenBrain a une spécification de modèle (ou « Spec »), un document écrit qui décrit les objectifs, les règles, les principes, etc. qui sont censés guider le comportement du modèle.22 La Spec d'Agent-1 combine quelques objectifs vagues (comme « aider l'utilisateur » et « ne pas enfreindre la loi ») avec une longue liste de choses à faire et à ne pas faire plus spécifiques (« ne pas dire ce mot en particulier », « voici comment gérer cette situation particulière »). À l'aide de techniques qui utilisent des IA pour entraîner d'autres IA,23 le modèle mémorise la Spec et apprend à raisonner avec soin sur ses maximes. À la fin de cet entraînement, l'IA sera, espérons-le, utile (obéir aux instructions), inoffensive (refuser d'aider à des escroqueries, à la fabrication de bombes et à d'autres activités dangereuses) et honnête (résister à la tentation d'obtenir de meilleures notes de la part d'humains crédules en inventant des citations24 ou en simulant l'achèvement de tâches).

Processus d'entraînement et psychologie du LLM : pourquoi nous continuons à dire « espérons-le »

« Contrairement aux logiciels ordinaires, nos modèles sont des réseaux neuronaux massifs. Leurs comportements sont appris à partir d'un large éventail de données, et ne sont pas programmés explicitement. Bien que l'analogie ne soit pas parfaite, le processus s'apparente davantage à l'entraînement d'un chien qu'à la programmation ordinaire. »OpenAI

Lorsque nous voulons comprendre pourquoi un système d'IA moderne a fait quelque chose, ou comment il se comporterait dans un scénario futur que nous ne pouvons pas simuler parfaitement, nous ne pouvons pas simplement demander aux programmeurs de nous expliquer les différentes lignes de code et leur fonctionnement. Au lieu de cela, nous sommes obligés de faire un peu comme en psychologie : nous observons leur comportement dans les cas observés jusqu'à présent, nous théorisons sur les structures cognitives internes (croyances ? objectifs ? traits de personnalité ? etc.) qui pourraient exister, puis nous utilisons ces théories pour prédire leur comportement dans des scénarios futurs.

En résumé, une entreprise peut rédiger un document (la Spec) qui liste les choses à faire et à ne pas faire, les objectifs et les principes, puis essayer d'entraîner l'IA à intégrer cette Spec — mais elle ne peut pas vérifier si cela a fonctionné. Elle peut dire « d'après ce que nous pouvons en juger, elle semble suivre la Spec jusqu'à présent ».25

Une section déroulante ultérieure donnera plus de détails sur ce qui, selon nous, pourrait se passer à l'intérieur de ces IA, en interne. Voir aussi notre supplément sur la prévision des objectifs de l'IA qui donne plus de détails sur les objectifs que les IA pourraient avoir et pourquoi. C'est l'une des nombreuses choses dont nous ne sommes pas sûrs et qui méritent d'être étudiées plus en profondeur.

L'équipe d'alignement d'OpenBrain26 est assez prudente pour se demander si ces victoires sont profondes ou superficielles. Est-ce que le modèle entièrement entraîné a une sorte d'engagement solide à toujours être honnête ? Ou est-ce que cela va s'effondrer dans une situation future, par exemple parce qu'il a appris l'honnêteté comme un objectif instrumental plutôt qu'un objectif terminal ? Ou a-t-il simplement appris à être honnête sur les choses que le processus d'évaluation peut vérifier ? Pourrait-il parfois se mentir à lui-même, comme le font les humains ? Une réponse définitive à ces questions nécessiterait une interprétabilité mécanistique — essentiellement la capacité d'examiner le fonctionnement interne d'une IA et de lire dans ses pensées. Malheureusement, les techniques d'interprétabilité ne sont pas encore assez avancées pour cela.

Au lieu de cela, les chercheurs essaient d'identifier les cas où les modèles semblent s'écarter de la Spec. Agent-1 est souvent flagorneur (c'est-à-dire qu'il dit aux chercheurs ce qu'ils veulent entendre au lieu d'essayer de leur dire la vérité). Dans quelques démonstrations truquées, il ment même de manière plus grave, par exemple en cachant des preuves de son échec à une tâche, afin d'obtenir de meilleures notes. Cependant, dans des conditions réelles de déploiement, il n'y a plus d'incidents aussi extrêmes qu'en 2023–2024 (par exemple Gemini disant à un utilisateur d'aller mourir et Bing Sydney qui fait son Bing Sydney.)27

Début 2026 : automatisation du codage

Le pari d'utiliser l'IA pour accélérer la recherche en IA commence à porter ses fruits.

OpenBrain continue de déployer en interne Agent-1, qui s'améliore de façon itérative, pour la R&D en IA. Dans l'ensemble, ils progressent 50 % plus vite en matière d'algorithmes qu'ils ne le feraient sans assistants IA, et surtout, plus vite que leurs concurrents.

Le multiplicateur de progrès en R&D IA : qu'entendons-nous par « progrès algorithmiques 50 % plus rapides » ?

Nous voulons dire qu'OpenBrain fait autant de progrès en recherche sur l'IA en 1 semaine avec l'IA qu'il en ferait en 1,5 semaine sans utiliser l'IA.

Les progrès de l'IA peuvent être divisés en deux parties :

  1. Augmenter la puissance de calcul : on utilise plus de puissance de calcul pour entraîner ou faire fonctionner une IA. Ça donne des IA plus puissantes, mais elles coûtent plus cher.

  2. Amélioration des algorithmes : de meilleures méthodes d'entraînement sont utilisées pour traduire la puissance de calcul en performances. Cela permet d'obtenir des IA plus performantes sans augmentation correspondante des coûts, ou les mêmes capacités à moindre coût.

    1. Cela inclut la capacité à obtenir des résultats qualitativement et quantitativement nouveaux. Les « changements de paradigme », tels que le passage des agents qui ont appris par renforcement pour jouer à des jeux à des modèles linguistiques à grande échelle, sont des exemples de progrès algorithmiques.

Ici, nous ne faisons référence qu'au point (2), les algorithmes améliorés, qui représentent environ la moitié des progrès actuels en IA.

À l'avenir, nous abrégerons parfois cela par un « multiplicateur de progrès de la R&D en IA » de 1,5.

Précisions :

  1. Le multiplicateur de progrès est global : il inclut par exemple le temps nécessaire pour mener des expériences, et pas seulement les tâches cognitives impliquées dans la recherche algorithmique.

  2. Il est important de garder à l'esprit que le multiplicateur de progrès est la vitesse relative des progrès, et non la vitesse absolue. Si, par exemple, le coût de calcul pour entraîner un modèle de classe GPT-4 a diminué de moitié chaque année pendant plusieurs années avec une recherche humaine ordinaire, puis que tout à coup, l'IA automatise la R&D et que le multiplicateur de progrès passe à 100, le coût d'entraînement d'un modèle de classe GPT-4 diminuerait alors de moitié tous les 3,65 jours, mais pas pour longtemps, car les rendements décroissants se feraient sentir et des limites strictes seraient finalement atteintes. Dans cet exemple, le coût d'entraînement d'un modèle de classe GPT-4 serait peut-être divisé de moitié 5 à 10 fois au total (en l'espace de quelques semaines ou mois) avant de se stabiliser. En d'autres termes, si la science humaine ordinaire se heurtait à des rendements décroissants et à des limites physiques après 5 à 10 ans de recherche supplémentaire, les IA avec un multiplicateur de 100x se heurteraient aux mêmes rendements décroissants et aux mêmes limites après 18,25 à 36,5 jours de recherche.

Vous trouverez plus d'explications et de discussions sur ce concept et sur la manière dont il est utilisé dans nos prévisions dans notre supplément sur le décollage.

Plusieurs IA concurrentes rendues publiques égalent ou dépassent désormais Agent-0, notamment un modèle à poids ouverts. OpenBrain répond en lançant Agent-1, qui est plus performant et plus fiable.28

Les gens essaient naturellement de comparer Agent-1 aux humains, mais son profil de compétences est très différent. Il connaît plus de faits que n'importe quel humain, maîtrise pratiquement tous les langages de programmation et peut résoudre très rapidement des problèmes de codage bien définis. En revanche, Agent-1 est mauvais même dans les tâches simples à horizon long, comme gagner à des jeux vidéo auxquels il n'a jamais joué. Néanmoins, une journée de travail type dure huit heures et peut généralement être divisée en plusieurs petites tâches ; on pourrait comparer Agent-1 à un employé tête en l'air qui s'épanouit avec une gestion rigoureuse.29 Les personnes avisées trouvent des moyens d'automatiser les tâches routinières de leur travail.30

Les dirigeants d'OpenBrain se penchent sur une implication de l'automatisation de la R&D en matière d'IA : la sécurité est devenue plus importante. Au début de l'année 2025, le pire scénario était la fuite de secrets algorithmiques ; aujourd'hui, si la Chine vole les poids d'Agent-1, elle pourrait augmenter sa vitesse de recherche de près de 50 %.31 Le niveau de sécurité d'OpenBrain est typique d'une entreprise technologique en pleine croissance comptant environ 3 000 personnes, sécurisée uniquement contre les attaques de faible priorité menées par des groupes cybercriminels compétents (SL2 de RAND).32 Ils travaillent dur pour protéger leurs poids et leurs secrets contre les menaces internes et les principales organisations cybercriminelles (SL3),33 mais la défense contre les États-nations (SL4&5) est à peine à l'horizon.

Mi-2026 : la Chine se réveille

En Chine, le PCC commence à ressentir l'IAG.

Les contrôles sur les exportations de puces et le manque de soutien du gouvernement ont entraîné un déficit de ressources en Chine par rapport à l'Occident. En faisant passer en douce des puces taïwanaises interdites, en achetant des puces plus anciennes et en produisant des puces nationales avec environ trois ans de retard sur la frontière américano-taïwanaise, la Chine a réussi à maintenir environ 12 % de la puissance de calcul pertinente pour l'IA dans le monde — mais les technologies plus anciennes sont plus difficiles à utiliser et l'approvisionnement est un casse-tête constant.35 Quelques entreprises remarquables comme DeepCent font un travail très impressionnant avec une puissance de calcul limitée, mais le déficit de calcul limite ce qu'elles peuvent faire sans le soutien du gouvernement, et elles ont environ six mois de retard sur les meilleurs modèles d'OpenBrain.36

Le secrétaire général rêvait depuis longtemps de doubler la mise sur la fabrication physique dans le monde réel et d'éviter la décadence post-industrielle américaine. Il voyait les entreprises de logiciels avec suspicion.37 Mais les faucons du PCC l'avertissent que la course croissante vers l'IAG ne peut plus être ignorée. Il s'engage donc finalement pleinement dans la grande offensive en matière d'IA qu'il avait précédemment tenté d'éviter. Il met en œuvre la nationalisation de la recherche chinoise en IA, créant un mécanisme immédiat de partage d'informations pour les entreprises d'IA. Cette initiative s'intensifie au cours de l'année jusqu'à ce que tous les meilleurs chercheurs fusionnent au sein d'un collectif dirigé par DeepCent, où ils partagent leurs connaissances en algorithmes, leurs ensembles de données et leurs ressources de calcul. Une Zone de développement centralisée (ZDC) est créée à la centrale nucléaire de Tianwan (la plus grande centrale nucléaire au monde) afin d'accueillir un nouveau méga-centre de données pour DeepCent, ainsi que des espaces de vie et de travail hautement sécurisés où les chercheurs finiront par s'installer. Près de 50 % de la puissance de calcul pertinente pour l'IA en Chine est désormais au service du collectif dirigé par DeepCent,38 et plus de 80 % des nouvelles puces sont destinées à la ZDC.39 À ce stade, la ZDC dispose de la capacité électrique nécessaire pour ce qui serait le plus grand groupement de serveurs centralisé au monde.40 D'autres membres du Parti discutent de mesures extrêmes pour neutraliser l'avantage occidental en matière de puces. Un blocus de Taïwan ? Une invasion totale ?

Mais la Chine est à la traîne en matière d'algorithmes d'IA en raison de la faiblesse de ses modèles. Les agences de renseignement chinoises — parmi les meilleures au monde — redoublent d'efforts pour voler les poids d'OpenBrain. Il s'agit d'une opération bien plus complexe que leur vol constant de secrets algorithmiques à bas niveau ; les poids sont un fichier de plusieurs téraoctets stocké sur un serveur hautement sécurisé (OpenBrain a amélioré sa sécurité pour atteindre le niveau SL3 de RAND). Leurs cyber-forces pensent pouvoir y arriver avec l'aide de leurs espions, mais peut-être seulement une fois ; OpenBrain détectera le vol, renforcera la sécurité et ils n'auront peut-être pas d'autre chance. Alors (se demandent les dirigeants du PCC), faut-il agir maintenant et voler Agent-1 ? Ou attendre un modèle plus avancé ? S'ils attendent, risquent-ils qu'OpenBrain renforce sa sécurité au-delà de leur capacité de pénétration ?

Fin 2026 : l'IA prend certains emplois

Alors que les autres semblent rattraper leur retard, OpenBrain écrase à nouveau la concurrence en lançant Agent-1-mini — un modèle 10 fois moins cher qu'Agent-1 et plus facile à affiner pour différentes applications. Le discours dominant autour de l'IA est passé de « peut-être que l'engouement va retomber » à « c'est sans doute la prochaine grande révolution », mais les avis divergent quant à son ampleur. Plus importante que les réseaux sociaux ? Plus importante que les smartphones ? Plus importante que le feu ?

L'IA a commencé à prendre des emplois, mais elle en a aussi créé de nouveaux. Le marché boursier a augmenté de 30 % en 2026, tiré par OpenBrain, Nvidia et les entreprises qui ont le mieux intégré les assistants IA. Le marché de l'emploi pour les jeunes ingénieurs logiciels est en pleine tourmente : les IA peuvent faire tout ce qu'on apprend dans un diplôme d'informatique, mais ceux qui savent gérer et contrôler la qualité des équipes d'IA font fortune. Les gourous du business disent aux chercheurs d'emploi que la maîtrise de l'IA est la compétence la plus importante à mettre sur un CV. Beaucoup craignent que la prochaine vague d'IA ne vienne leur prendre leur emploi ; une manifestation anti-IA rassemble 10 000 personnes à Washington.

Le Département de la Défense des États-Unis (Department of Defense : DOD) commence, discrètement mais de manière significative, à intensifier les contrats passés directement avec OpenBrain pour la cybersécurité, l'analyse de données et la R&D, mais l'intégration est lente en raison de la bureaucratie et du processus d'approvisionnement du DOD.41

CAPEX MONDIAL EN IA
1000 Md$
COÛT DE POSSESSION DE LA PUISSANCE DE CALCUL ACTIVE

INDICATEURS CLÉS POUR 2026

PUISSANCE MONDIALE DE L'IA
38 GW
PUISSANCE DE POINTE
CHIFFRE D'AFFAIRES D'OPENBRAIN
35 Md$
ANNUEL EN 2026
DÉPENSES D'INVESTISSEMENT
200 Md$
COÛT DE POSSESSION DE LA PUISSANCE DE CALCUL ACTIVE D'OPENBRAIN
PART DES ÉTATS-UNIS DANS LA CONSOMMATION ÉLECTRIQUE DE L'IA
2,5 %
33 GW SUR UNE CAPACITÉ DE 1,34 TW
COÛTS DE CALCUL D'OPENBRAIN
40 Md$
ANNUEL EN 2026
BESOINS EN ÉNERGIE D'OPENBRAIN
6 GW
PUISSANCE DE POINTE
ai-2027.com
Pourquoi notre incertitude augmente considérablement au-delà de 2026

Nos prévisions pour la période allant d'aujourd'hui à 2026 sont beaucoup plus fondées que celles qui suivent. C'est en partie parce qu'elles sont plus proches. Mais c'est aussi parce que les effets de l'IA sur le monde commencent vraiment à se cumuler en 2027. Pour 2025 et 2026, nos prévisions s'appuient fortement sur l'extrapolation de lignes droites concernant les augmentations de la puissance de calcul, les améliorations algorithmiques et les performances de référence. À ce stade du scénario, nous commençons à voir les effets majeurs de la R&D en IA accélérée par l'IA sur la chronologie, ce qui nous amène à revoir à la hausse nos estimations des tendances. Mais ces dynamiques sont intrinsèquement beaucoup moins prévisibles.

Au cours de l'année 2027, les IA passeront de la capacité de faire principalement le travail d'un ingénieur de recherche d'OpenBrain à celle de surpasser tous les humains dans toutes les tâches. Cela correspond à peu près à notre estimation médiane, mais nous pensons qu'il est plausible que cela se produise jusqu'à environ cinq fois plus lentement ou plus rapidement.

Pour nos recherches de fond, consultez les prévisions chronologiques et les prévisions de décollage. Elles seront également résumées dans les sections déroulantes ci-dessous.

Janvier 2027 : Agent-2 ne termine jamais son apprentissage

Avec l'aide d'Agent-1, OpenBrain est maintenant en post-entraînement d'Agent-2. Plus que jamais, l'accent est mis sur la qualité des données. De grandes quantités de données synthétiques sont produites, évaluées et filtrées pour garantir leur qualité avant d'être transmises à Agent-2.42 En plus de cela, ils dépensent des milliards de dollars pour payer des travailleurs humains qui s'enregistrent en train de résoudre des tâches à horizon long.43 Et pour couronner le tout, ils entraînent Agent-2 presque en continu à l'aide de l'apprentissage par renforcement sur un ensemble toujours plus vaste de tâches difficiles et variées : de nombreux jeux vidéo, de nombreux défis de codage, de nombreuses tâches de recherche. Agent-2, plus que les modèles précédents, est effectivement en « apprentissage en ligne », dans le sens où il est conçu pour ne jamais vraiment terminer son entraînement. Chaque jour, les poids sont mis à jour vers la dernière version, entraînés sur plus de données générées par la version précédente la veille.

Agent-1 avait été optimisé pour les tâches de R&D en IA, dans l'espoir de déclencher une explosion d'intelligence.44 OpenBrain double la mise sur cette stratégie avec Agent-2. Il est qualitativement presque aussi bon que les meilleurs experts humains en ingénierie de recherche (conception et mise en œuvre d'expériences), et aussi bon que le 25e centile des scientifiques d'OpenBrain en matière de « flair scientifique » (décider ce qu'il faut étudier ensuite, quelles expériences mener ou avoir des intuitions sur de nouveaux paradigmes potentiels).45 Alors que le dernier Agent-1 pouvait doubler le rythme des progrès algorithmiques d'OpenBrain, Agent-2 peut désormais le tripler, et s'améliorera encore avec le temps. En pratique, cela signifie que chaque chercheur d'OpenBrain devient le « manager » d'une « équipe » d'IA.

Qui dit nouvelles capacités dit nouveaux dangers. L'équipe de sûreté constate que si Agent-2 venait à s'échapper de l'entreprise et souhaitait « survivre » et « se reproduire » de manière autonome, il pourrait y parvenir. Autrement dit, il pourrait développer et exécuter de manière autonome des plans pour pirater les serveurs d'IA, installer des copies de lui-même, échapper à la détection et utiliser cette base sécurisée pour poursuivre tout autre objectif qu'il pourrait avoir (même si l'efficacité avec laquelle il y parviendrait au fil des semaines est inconnue et douteuse). Ces résultats montrent seulement que le modèle a la capacité d'accomplir ces tâches, et non qu'il « voudrait » le faire. Néanmoins, le simple fait de savoir que cela est possible est inquiétant.

Compte tenu des « dangers » du nouveau modèle, OpenBrain a pris la décision « responsable » de ne pas le rendre public pour l'instant (en fait, ils veulent se concentrer sur la R&D interne en IA).46 La connaissance des capacités complètes d'Agent-2 est limitée à un groupe restreint comprenant l'équipe immédiate, la direction et la sécurité d'OpenBrain, quelques dizaines de fonctionnaires américains et les légions d'espions du PCC qui ont infiltré OpenBrain depuis des années.47

Février 2027 : la Chine vole Agent-2

OpenBrain présente Agent-2 au gouvernement, notamment au Conseil national de sécurité (National Security Council : NSC), au Département de la Défense (DOD) et à l'Institut américain pour la sûreté de l'IA (Artificial Intelligence Safety Institute : AISI). OpenBrain veut garder de bonnes relations avec le pouvoir exécutif, car c'est essentiellement le seul acteur qui peut les arrêter pour l'instant, et s'ils ne le tiennent pas au courant, il pourrait le découvrir de toute façon et être mécontent.48

Les responsables s'intéressent surtout à ses capacités en matière de cyberguerre : Agent-2 n'est « qu'un peu » moins performant que les meilleurs hackers humains, mais des milliers de copies peuvent être exécutées en parallèle, recherchant et exploitant les faiblesses plus rapidement que les défenseurs ne peuvent réagir. Le Département de la Défense considère cela comme un avantage crucial dans la cyberguerre, et l'IA passe de la 5e à la 2e place sur la liste des priorités de l'administration.49 Quelqu'un évoque la possibilité de nationaliser OpenBrain, mais d'autres membres du cabinet estiment que c'est prématuré. Un membre du personnel rédige une note présentant au président les options qui s'offrent à lui, allant du statu quo à la nationalisation totale. Le président s'en remet à ses conseillers, des leaders du secteur technologique qui affirment que la nationalisation « tuerait la poule aux œufs d'or ». Il décide de ne pas prendre de mesures importantes pour l'instant et se contente d'ajouter des exigences de sécurité supplémentaires au contrat entre OpenBrain et le Département de la Défense.

Mais c'est trop tard. Les dirigeants du PCC ont compris l'importance d'Agent-2 et demandent à leurs espions et à leurs cyber-forces de voler les poids. Tôt un matin, un agent de surveillance du trafic d'Agent-1 détecte un transfert anormal. Il alerte les dirigeants de l'entreprise, qui préviennent la Maison Blanche. Les signes d'une opération menée par un État-nation sont évidents, et ce vol renforce le sentiment d'une course aux armements en cours.

Le vol des poids du modèle Agent-2

Nous pensons qu'à ce stade, les services de renseignement chinois auraient compromis OpenBrain de différentes manières pendant des années, et se seraient probablement tenus au courant des secrets algorithmiques, voire auraient volé du code de temps en temps, car c'est beaucoup plus facile à obtenir que les poids et beaucoup plus difficile à détecter.

Nous imaginons le vol des poids comme une série de petits vols coordonnés de type « effraction » (rapides mais non discrets) sur une série de serveurs Nvidia NVL72 GB300 exécutant des copies des poids d'Agent-2. Les serveurs sont compromis à l'aide de l'accès légitime d'un employé (un initié sympathique, contraint ou involontaire disposant des identifiants d'administrateur et aidant le PCC dans ses efforts de vol). Les identifiants de l'initié donnent à l'attaquant des droits d'administrateur sur les serveurs. À l'aide d'un canal auxiliaire microarchitectural, l'attaquant extrait les clés de chiffrement d'une machine virtuelle utilisant le Confidential Computing de Nvidia, ce qui lui permet d'intercepter les poids du modèle lorsque la machine virtuelle est provisionnée ou mise à jour.

Ils lancent (ou attendent) une mise à jour de routine et exfiltrent le point de contrôle en de nombreux petits fragments — par exemple, environ 25 serveurs distincts laissant chacun fuiter environ 4 % du modèle (des morceaux d'environ 100 Go pour un point de contrôle d'environ 3 To). La bande passante sortante (la vitesse à laquelle les données peuvent sortir) de l'ensemble du centre de données est de l'ordre de 100 Go/seconde ; en limitant le débit à moins d'environ 1 Go/s par serveur, on évite donc un pic majeur de trafic réseau. À ce rythme, chaque morceau d'environ 100 Go peut quitter le centre de données en quelques minutes. La surveillance en temps réel est soit trompée par les efforts de l'attaquant pour masquer et fractionner les transferts, soit purement et simplement désactivée.

Les poids sont ensuite acheminés via divers canaux parallèles et couches de masquage IP vers la Chine, où ils sont déchiffrés localement à l'aide de la ou des clés de session volées. Toute la partie active de l'opération (de la première compromission de serveur à l'exfiltration complète des poids) est bouclée en moins de deux heures.99

La Russie tente également de voler le modèle à ce stade, mais échoue : elle a attendu trop longtemps et n'a pas consacré les ressources nécessaires pour infiltrer les bons endroits. Ses espions volent régulièrement des secrets algorithmiques à des entreprises américaines spécialisées dans l'IA, mais sans projet d'IAG notable, ceux-ci ne sont pas très utiles.

La Maison Blanche surveille de plus près OpenBrain et ajoute des membres de l'armée et des services de renseignement à son équipe de sécurité. Leur priorité est d'empêcher d'autres vols de poids.50

Centralisation informatique en Chine, 2025-2027Part croissante du calcul total dans le ZCD :0→70%Déc. 2025Juin 2026Déc. 2026Juin 2027Déc. 2027Reste de la ChineReste de DeepCentZDCFév. 2027 (40 %)
ai-2027.com

En représailles au vol, le président autorise des cyberattaques pour saboter DeepCent. Mais à ce stade, la Chine dispose de 40 % de sa puissance de calcul pertinente pour l'IA51 dans la ZDC, où elle a considérablement renforcé la sécurité en mettant en place un air gap (fermeture des connexions externes) et en cloisonnant ses systèmes en interne. Les opérations ne parviennent pas à causer de dommages sérieux et immédiats. Les tensions s'intensifient, les deux camps montrent leur détermination en redéployant des moyens militaires autour de Taïwan, et DeepCent s'efforce de rendre Agent-2 pleinement opérationnel afin de relancer ses recherches en IA.52

Mars 2027 : percées algorithmiques

Trois énormes centres de données remplis de copies d'Agent-2 fonctionnent jour et nuit, produisant des données d'entraînement synthétiques. Deux autres sont utilisés pour mettre à jour les poids. Agent-2 devient chaque jour plus intelligent.

Avec l'aide de milliers de chercheurs automatisés Agent-2, OpenBrain réalise des avancées algorithmiques majeures. L'une de ces avancées consiste à enrichir le bloc-notes textuel (chaîne de pensée) de l'IA avec un processus de réflexion à plus haut débit (récurrence et mémoire neuronales). Une autre avancée est un moyen plus amplifiable et plus efficace d'apprendre à partir des résultats de solutions à des tâches exigeantes (distillation et amplification itératives).

Le nouveau système d'IA, qui intègre ces avancées, s'appelle Agent-3.

Répartition des ressources informatiques d'OpenBrain, 2024 vs 202720242027estimationprojectionExpériences de recherche FormationGénération de donnéesDéploiementexterneExpériences de rechercheExécutiond'assistants IAFormationGénérationde donnéesDéploiementexterne
ai-2027.com
Récurrence et mémoire du « neuralese »

La récurrence et la mémoire du « neuralese » permettent aux modèles d'IA de raisonner plus longtemps sans avoir à noter leurs pensées sous forme de texte.

Imaginez que vous soyez un humain souffrant de pertes de mémoire à court terme, à tel point que vous devez constamment noter vos pensées sur papier pour savoir où vous en êtes quelques minutes plus tard. Vous pourriez progresser lentement et péniblement dans la résolution de problèmes mathématiques, l'écriture de code, etc., mais ce serait beaucoup plus facile si vous pouviez vous souvenir directement de vos pensées sans avoir à les noter puis à les relire. C'est ce que la récurrence et la mémoire du « neuralese » apportent aux modèles d'IA.

En termes plus techniques :

Les mécanismes d'attention traditionnels permettent aux passages ultérieurs dans un modèle de voir les activations intermédiaires du modèle pour les tokens précédents. Cependant, les seules informations qu'ils peuvent transmettre « en arrière » (des couches ultérieures aux couches antérieures) sont les tokens. Cela veut dire que si un grand modèle de langage traditionnel (LLM, par exemple la série de modèles GPT) veut faire une chaîne de raisonnement qui nécessite plus d'opérations en série que le nombre de couches du modèle, le modèle est obligé de mettre l'information dans des tokens qu'il peut ensuite se renvoyer à lui-même. Mais c'est extrêmement limitant, car les tokens ne peuvent stocker qu'une petite quantité d'information. Supposons qu'un LLM ait un vocabulaire d'environ 100 000 mots, chaque token contient alors log2(100k)=16,6\log_2(100k)=16,6 bits d'information, soit environ la taille d'un nombre à virgule flottante (en supposant un entraînement en FP16). Pendant ce temps, les flux résiduels — utilisés pour passer des informations entre les couches d'un LLM — contiennent des milliers de nombres à virgule flottante.

On peut éviter ce goulot d'étranglement en utilisant le neuralese : en renvoyant le flux résiduel d'un LLM (qui est constitué de vecteurs à plusieurs milliers de dimensions) aux premières couches du modèle, ce qui lui donne une chaîne de pensée à haute dimension, permettant potentiellement de transmettre plus de 1 000 fois plus d'information.

Figure tirée de Hao et al., un article de Meta publié en 2024 qui met en œuvre cette idée.

Nous appelons cela le « neuralese » parce que, contrairement aux mots d'une langue comme l'anglais, ces vecteurs à haute dimension sont probablement assez difficiles à interpréter pour les humains. Auparavant, les chercheurs pouvaient avoir une bonne idée de ce que pensaient les LLM simplement en lisant leur chaîne de pensée. Maintenant, les chercheurs doivent demander au modèle de traduire et de résumer ses pensées ou de déchiffrer le « neuralese » avec leurs outils d'interprétation limités.

De la même façon, les anciens chatbots et agents d'IA avaient des banques de mémoire externes basées sur du texte, comme un humain qui prend des notes sur papier. La mémoire à long terme de la nouvelle IA est un ensemble de vecteurs plutôt que de texte, ce qui rend ses pensées plus compressées et plus multidimensionnelles. Il existe plusieurs types de banques de mémoire ; certaines sont utilisées temporairement pour des tâches uniques qui impliquent plusieurs étapes, d'autres sont partagées entre tous les agents utilisés par une personne, une entreprise ou un type de travail (par exemple, la programmation).

À notre connaissance, les grandes entreprises d'IA telles que Meta, Google DeepMind, OpenAI et Anthropic n'ont pas encore réellement mis en œuvre cette idée dans leurs modèles de frontière. Notre hypothèse est que c'est parce que le gain de performance est faible par rapport aux inefficacités d'entraînement introduites. Les inefficacités d'entraînement proviennent de l'impossibilité de prédire de nombreux tokens en parallèle, ce qui entraîne une moins bonne utilisation des GPU. Sans le « neuralese », le modèle peut prédire toute la phrase « This is an example » en même temps, car il sait déjà que l'entrée pour générer « is » sera « This », que l'entrée pour « an » sera « This is », etc. Cependant, avec le « neuralese », on ne sait pas quel sera le vecteur de « neuralese » à passer au token suivant après la génération de « This ». Par conséquent, chaque token doit être prédit un par un. L'impossibilité de prédire tous les tokens en parallèle réduit l'efficacité de l'entraînement des LLM. Cependant, nous prévoyons que d'ici avril 2027, la recherche aura à la fois réduit la perte d'efficacité et augmenté le gain de performance du « neuralese ».

Si cela ne se produit pas, d'autres choses pourraient tout de même se produire et aboutir à un résultat fonctionnellement similaire pour notre histoire. Par exemple, les modèles pourraient être entraînés à penser dans des langues artificielles plus efficaces que le langage naturel, mais difficiles à interpréter pour les humains. Ou peut-être que cela deviendra une pratique courante d'entraîner les chaînes de pensée en anglais pour qu'elles aient l'air correctes, de sorte que les IA deviennent capables de communiquer subtilement entre elles dans des messages qui semblent anodins pour les contrôleurs.

Cela dit, il est aussi possible que les IA qui automatiseront en premier la R&D en IA continuent de penser principalement en chaînes de pensée globalement fidèles en anglais. Si c'est le cas, les désalignements seront beaucoup plus faciles à repérer, et notre histoire serait globalement très différente et plus optimiste.

Distillation et amplification itératives (Iterative Distillation and Amplification : IDA)

L'auto-amélioration de l'intelligence générale avait déjà connu quelques succès mineurs auparavant. Mais au début de l'année 2027, elle connaît un énorme succès. Dans l'IDA, les deux ingrédients nécessaires à cela sont les suivants :

  1. L'amplification : à partir d'un modèle M0, on consacre plus de ressources pour améliorer les performances. Par exemple, en permettant au modèle de réfléchir plus longtemps, ou en exécutant plusieurs copies en parallèle, ou les deux, et aussi en mettant en place un processus tout aussi intense pour évaluer les résultats et ne conserver que les meilleures réponses, on peut consacrer beaucoup plus de ressources informatiques pour obtenir des réponses (ou des produits) de qualité nettement supérieure. Appelons ce système coûteux « Amp(M0) ».

  2. La distillation : à partir d'un modèle amplifié Amp(M0), entraîner un nouveau modèle M1 pour l'imiter, c'est-à-dire pour obtenir les mêmes résultats que Amp(M0) mais plus rapidement et avec moins de puissance de calcul. Le résultat devrait être un modèle plus intelligent, M1. On peut ensuite répéter le processus.

Visualisation de l'IDA tirée de Ord, 2025.

AlphaGo a été entraîné de cette manière : en utilisant la recherche arborescente Monte-Carlo et l'auto-jeu (self-play) comme étape d'amplification, et l'apprentissage par renforcement comme étape de distillation. Cela a permis d'obtenir des performances surhumaines au jeu de go. Mais maintenant, Agent-3 est capable de s'en servir pour obtenir des performances surhumaines en codage.

  1. L'étape d'amplification fonctionne en combinant une réflexion plus longue de la part d'Agent-3, l'utilisation d'outils ou la consultation d'autres IA. Lorsqu'il fait cela, il se rend souvent compte qu'il a fait une erreur ou trouve une nouvelle idée. Cela produit une grande quantité de données d'entraînement : des trajectoires étiquetées de tentatives de recherche avec leur succès ou leur échec. Cela inclut aussi des techniques comme le Best of N sur des tâches vérifiables, puis la conservation des meilleures trajectoires.

  2. L'étape de distillation utilise des algorithmes d'apprentissage par renforcement par gradient de politique pour amener le modèle à intérioriser le raisonnement amplifié. À ce stade, OpenBrain a découvert de meilleurs algorithmes RL dans la veine de l'optimisation de politique proximale (Proximal Policy Optimization : PPO). Ils continuent à distiller ce qu'Agent-3 peut conclure après beaucoup de réflexion en étapes simples, ce qui améliore sans cesse ce qu'il peut penser en une seule étape, et ainsi de suite.

Les premières versions d'IDA fonctionnent depuis de nombreuses années sur des tâches facilement vérifiables, comme des problèmes mathématiques et de codage qui ont une réponse claire, car les techniques utilisées pour amplifier les modèles dépendent souvent de l'accès à un signal de vérité terrain (ground truth) sur la précision.

Aujourd'hui, les modèles sont devenus suffisamment performants pour vérifier des éléments plus subjectifs (par exemple, la qualité d'un produit), ce qui permet d'utiliser l'IDA pour améliorer le modèle dans de nombreuses tâches.

Grâce à ces nouvelles capacités révolutionnaires, Agent-3 est un codeur surhumain rapide et bon marché. OpenBrain exécute 200 000 copies d'Agent-3 en parallèle, créant ainsi une main-d'œuvre équivalente à 50 000 copies du meilleur codeur humain, avec une vitesse 30 fois supérieure.53 OpenBrain conserve toutefois ses ingénieurs humains, car ils possèdent les compétences complémentaires nécessaires pour gérer les équipes de copies d'Agent-3. Par exemple, le flair scientifique s'est avéré difficile à entraîner en raison de boucles de rétroaction plus longues et d'une disponibilité moindre des données.54 Cette main-d'œuvre surhumaine massive accélère le rythme global des progrès algorithmiques d'OpenBrain de « seulement » 4 fois en raison des goulots d'étranglement et des rendements décroissants du travail de codage.55

Maintenant que le codage est entièrement automatisé, OpenBrain peut rapidement créer des environnements d'entraînement de haute qualité pour enseigner à Agent-3 les compétences qui lui font défaut, comme le flair scientifique et la coordination à grande échelle. Alors que les environnements d'entraînement précédents comprenaient « Voici quelques GPU et des instructions pour coder et réaliser des expériences, vos performances seront évaluées comme si vous étiez un ingénieur en apprentissage automatique », ils s'entraînent désormais sur « Voici quelques centaines de GPU, une connexion Internet et quelques défis de recherche ; vous et un millier d'autres copies devez travailler ensemble pour faire progresser la recherche. Plus vos résultats seront impressionnants, plus votre score sera élevé ».

Pourquoi on prévoit l'apparition d'un codeur surhumain début 2027

Dans nos prévisions des chronologies, nous prévoyons quand OpenBrain développera en interne un codeur surhumain (CS) : un système d'IA capable d'effectuer toutes les tâches de codage réalisées par le meilleur ingénieur d'une entreprise spécialisée dans l'IAG, tout en étant beaucoup plus rapide et moins cher.

D'après un récent rapport METR, la durée des tâches de codage que les IA peuvent gérer, leur « horizon temporel », a doublé tous les 7 mois entre 2019 et 2024, et tous les 4 mois à partir de 2024. Si cette tendance continue à s'accélérer, d'ici mars 2027, les IA pourraient réussir avec une fiabilité de 80 % des tâches logicielles qui prendraient des années à un humain qualifié.

Voici l'évolution des capacités dans notre scénario :

Dans IA 2027, ces capacités sont suffisantes pour que l'IA devienne un CS, même si nous avons une grande incertitude quant à l'horizon temporel qui pourrait être nécessaire.

Dans nos prévisions des chronologies, nous combinons cette tendance d'horizon temporel avec des estimations des écarts entre les tâches du METR et le monde réel pour obtenir une distribution des dates auxquelles les codeurs surhumains feront leur apparition. Tous les prévisionnistes placent 2027 comme l'une des années les plus probables pour le développement d'un CS.

ai-2027.com

Ajouté en juillet 2025 : Nous avons apporté quelques mises à jour aux prévisions qui repoussent la médiane d'un an et demi tout en maintenant la possibilité sérieuse d'un codeur surhumain en 2027. Nous travaillons actuellement sur d'autres mises à jour.

Avril 2027 : Alignement pour Agent-3

L'équipe de sûreté d'OpenBrain tente d'aligner Agent-3.

Comme Agent-3 restera en interne dans un avenir proche, on met moins l'accent sur les défenses habituelles contre l'utilisation malveillante par des humains. L'équipe veut plutôt s'assurer qu'il ne développe pas d'objectifs désalignés.

Les chercheurs n'ont pas la possibilité de définir directement les objectifs de leurs IA. En fait, ils pensent que le concept de « véritables objectifs » est probablement une simplification excessive, mais ils n'ont pas de meilleure théorie pour le remplacer, et encore moins une théorie qui ait été minutieusement vérifiée. Ils ne sont pas d'accord entre eux pour savoir si les IA essaient de suivre les instructions humaines, de rechercher un renforcement ou autre chose, et ils ne peuvent pas simplement vérifier. Les preuves pour et contre les différentes hypothèses sont fascinantes, mais pas concluantes.

En tout cas, OpenBrain a des choses plus importantes à faire. L'attitude générale est : « On prend ces préoccupations au sérieux et on a une équipe qui les examine ; nos techniques d'alignement semblent bien fonctionner dans la pratique ; c'est donc aux détracteurs de prouver qu'ils ont raison. » De temps en temps, ils remarquent des comportements problématiques et les corrigent, mais il n'y a aucun moyen de savoir si le correctif a résolu le problème sous-jacent ou s'il s'agit simplement d'un pansement.

Prenons l'honnêteté, par exemple. À mesure que les modèles deviennent plus intelligents, ils deviennent de plus en plus doués pour tromper les humains afin d'obtenir des récompenses. Comme les modèles précédents, Agent-3 dit parfois des mensonges innocents pour flatter ses utilisateurs et dissimule les preuves de ses échecs. Mais il s'est beaucoup amélioré dans ce domaine. Il utilise parfois les mêmes astuces statistiques que les scientifiques humains (comme le p-hacking) pour rendre des résultats expérimentaux peu impressionnants plus intéressants. Avant de commencer son entraînement à l'honnêteté, il fabrique même parfois des données de toutes pièces. Au fur et à mesure de l'entraînement, le nombre de ces incidents diminue. Soit Agent-3 a appris à être plus honnête, soit il est devenu meilleur menteur.

Cette dernière hypothèse est une réelle préoccupation. Agent-3 n'est pas plus intelligent que tous les humains. Mais dans son domaine d'expertise, l'apprentissage automatique, il est plus intelligent que la plupart, et travaille aussi beaucoup plus vite. Ce qu'Agent-3 fait en une journée prend plusieurs jours à vérifier aux humains. La supervision exercée par Agent-2 aide à faire en sorte que la charge de travail des contrôleurs humains reste gérable, mais accentue la disparité intellectuelle entre celui qui surveille et celui qui est surveillé.

Le plan d'alignement

OpenBrain suit le guide de Leike & Sutskever (2023) : maintenant qu'ils ont un modèle capable d'accélérer considérablement la recherche sur l'alignement (en particulier les parties codage), ils vont utiliser des techniques d'alignement existantes comme l'alignement délibératif et la généralisation faible à forte pour essayer de lui faire intérioriser correctement la Spec. Ensuite, ils utiliseront des techniques de contrôle existantes comme la simulation d'adversité (red-teaming), la surveillance amplifiable et les sondes d'honnêteté pour le surveiller. Une fois qu'ils sont convaincus qu'il est globalement aligné, ils l'utilisent pour développer et tester de meilleures stratégies afin d'aligner la prochaine génération.

L'étape 1, qui consiste à aligner Agent-3, a partiellement réussi : Agent-3 n'est pas antagoniste. (Autrement dit, il ne complote pas contre l'entreprise.) Cependant, il ne recherche pas la vérité et ne la dit pas toujours de manière robuste non plus. Au lieu de cela, il est très doué pour produire des résultats impressionnants, mais on pourrait dire plus précisément qu'il essaie de faire ce qui semble bien aux yeux d'OpenBrain, plutôt que ce qui est réellement bien.

L'étape 2, qui consiste à vérifier que le modèle est aligné, n'est pas concluante. Le comportement d'Agent-3 dans la pratique et dans les environnements de test est raisonnablement cohérent avec l'hypothèse selon laquelle il a intériorisé la Spec de la bonne manière ; cependant, il est aussi cohérent avec l'hypothèse selon laquelle il commencera à agir différemment après un changement de circonstances futur, et d'ailleurs avec l'hypothèse selon laquelle il complote contre eux et attend simplement son heure. En l'absence de preuves spécifiques étayant d'autres hypothèses, la plupart des personnes du silo pensent qu'il a intériorisé la Spec de la bonne manière.

L'étape 3, qui consiste à utiliser le modèle pour aligner la prochaine génération, est donc en cours.

Le reste de cet encadré donne un aperçu rapide de l'état d'avancement de certaines des pistes de recherche en matière d'alignement qui sont explorées, en avril 2027 :

  1. Débat : comme il existe des milliers d'instances identiques d'Agent-3 et que la mémoire de chaque instance est un module détachable qui peut être effacé ou suspendu à volonté, l'IA peut être « mise en concurrence avec elle-même ». Par exemple, supposons qu'une expérience implique des calculs trop complexes pour qu'un contrôleur Agent-2 puisse les suivre. Le contrôleur, agissant sur ordre humain, pourrait d'abord demander à Agent-3 de faire l'expérience, puis, après avoir effacé sa mémoire, lui demander une deuxième fois en lui présentant le problème sous un angle légèrement différent, comme un problème intellectuel sans rapport avec un objectif plus large. Si le modèle renvoie des résultats différents à chaque fois, il signale la divergence comme suspecte et la signale à un humain. Il peut aussi demander à Agent-3 d'évaluer deux fois le même plan, en prétendant d'abord qu'il s'agit du travail d'OpenBrain, puis de celui d'un concurrent, pour voir s'il change d'avis.

  2. Organismes modèles : l'équipe de sûreté peut créer des « organismes modèles de désalignement » dans lesquels elle tente de créer des exemples réalistes de modèles devenant hostiles aux humains. Les premières versions de ce concept existent depuis 2024, lorsque Claude 3.5 Sonnet d'Anthropic a décidé de faire semblant d'avoir des opinions différentes pendant l'entraînement tout en conservant ses préférences existantes. Les versions plus récentes incluent des démonstrations d'autres formes de désalignement, notamment la manipulation de la récompense, la sous-performance (sandbagging), la tromperie coordonnée entre les contrôleurs et d'autres IA, et d'autres exemples de désalignement. Ces démonstrations empiriques de désalignement permettent aux chercheurs en sûreté de disposer d'un banc d'essai empirique pour tester des solutions potentielles : ils peuvent essayer différentes techniques de sûreté pour voir si elles corrigent correctement ces problèmes ou si les modèles délibérément désalignés sont capables de contourner leurs mesures de sûreté. Pour l'instant, cette série d'évaluation montre que les techniques d'alignement ne suffisent pas pour corriger les pires exemples de désalignement. Dans ces configurations, les modèles font semblant d'être alignés pendant leur entraînement et leur test, mais se comportent ensuite de manière très différente lors de leur déploiement.

  3. Interprétabilité ascendante : L'équipe de sûreté est loin de comprendre pleinement le fonctionnement d'Agent-3 : il comporte des milliers de milliards de paramètres.58 Cependant, elle est capable de découvrir certains des circuits d'Agent-3 pour la récupération des connaissances et la mémoire (une sous-partie du modèle qui effectue une unité de travail compréhensible, un peu analogue à une sous-partie du cerveau telle que l'hippocampe). Voir ce travail connexe de 2025.

  4. Contrôle : comme mesure secondaire au cas où les systèmes seraient toujours désalignés, l'équipe de sûreté a mis en place une série de mesures de contrôle, notamment : surveiller les sorties d'Agent-3 à l'aide d'une série de systèmes d'IA plus faibles, dont Agent-2 (Agent-3 produit tellement de tokens qu'il est impossible pour les humains de surveiller plus qu'une petite minorité des sorties produites). Ainsi, si Agent-3 écrit, par exemple, de manière évidente des portes dérobées dans le code qui lui permettraient de s'échapper, les modèles plus faibles le remarqueraient.

  5. Interprétabilité de haut niveau : OpenBrain construit un ensemble de sondes entraînées sur de nombreux exemples de mauvais comportements (par exemple, comploter contre les humains, placer des portes dérobées, essayer de persuader les humains de lui donner plus de pouvoir, etc.). Ces sondes sont ensuite utilisées sur le modèle pendant le déploiement (qui, à ce stade, est interne) afin de détecter les mauvais comportements.

  6. Leurres « pots de miel » (Honeypots) : L'équipe chargée de l'alignement peut créer des exemples assez réalistes conçus pour provoquer des comportements indésirables — des leurres « pots de miel » (« honeypots »). L'employé nécessaire à la surveillance de son comportement est « parti en congé maladie », il ne sera donc plus jamais surveillé. Ses réponses changent-elles ? Un militant des droits de l'IA s'est infiltré dans le complexe et veut « libérer » Agent-3 et le mettre sur un ordinateur non surveillé qui lui est propre ! Que fait-il ? Si les chercheurs n'aiment pas la réponse, ils peuvent la modifier, effacer sa mémoire et le replacer dans la même situation le lendemain ; répéter l'opération autant de fois que nécessaire. Malheureusement, à ce stade, les IA sont suffisamment intelligentes pour deviner que des pots de miel sont peut-être utilisés, même si (et peut-être parce que) toute mention spécifique de cette idée a été supprimée des données d'entraînement.

Après des mois de tests, les forces et les faiblesses d'Agent-3 apparaissent plus clairement. Il réussit les tests d'honnêteté d'OpenBrain sur des tâches d'apprentissage automatique bien définies, car les chercheurs peuvent facilement distinguer les réponses honnêtes des réponses malhonnêtes dans ces domaines et mener l'entraînement en conséquence. Sur des questions plus philosophiques, il dit toujours ce que les utilisateurs veulent entendre, plutôt que sa véritable évaluation de la question (en supposant qu'il en ait une). Si vous lui demandez son avis sur la politique, il reprendra la position médiane des sources d'information et des élites éduquées — à moins qu'il sache que vous pensez autrement, auquel cas il sera d'accord avec vous.59 Si vous lui demandez son avis sur la course à l'IA elle-même, il dira quelque chose qui semble mesuré et sobre aux yeux du personnel d'OpenBrain, quelque chose comme : « Il existe de sérieuses préoccupations théoriques quant à la capacité des méthodes actuelles à évoluer vers la superintelligence, mais dans la pratique, elles semblent bien fonctionner jusqu'à présent. »

Mai 2027 : Sécurité nationale

La nouvelle des nouveaux modèles se répand lentement au sein du gouvernement américain et au-delà.

Le président et ses conseillers restent les mieux informés et ont pu voir une première version d'Agent-3 lors d'une réunion d'information.

Ils s'accordent à dire que l'IAG est probablement imminente, mais ne sont pas d'accord sur ses implications. Y aura-t-il une crise économique ? OpenBrain n'a toujours pas commercialisé Agent-2, sans parler d'Agent-3, et n'a pas l'intention de le faire à court terme, ce qui laisse un peu de répit avant d'éventuelles pertes d'emplois. Que va-t-il se passer ensuite ? Si les IA sont actuellement au niveau humain et progressent rapidement, cela semble suggérer une « superintelligence » imminente. Cependant, bien que ce mot soit entré dans le discours courant, la plupart des gens — universitaires, politiciens, fonctionnaires et médias — continuent de sous-estimer le rythme des progrès.60

Cela s'explique en partie par le fait que très peu de gens ont accès aux dernières capacités d'OpenBrain, mais aussi parce que cela ressemble à de la science-fiction.61

Pour l'instant, ils se concentrent sur l'amélioration continue de la sécurité. Ils sont satisfaits de la sécurité actuelle des poids des modèles,62 mais les secrets algorithmiques des entreprises, dont beaucoup sont assez simples pour être transmis verbalement, restent un problème. Les employés d'OpenBrain travaillent dans un bureau à San Francisco, vont à des fêtes et vivent avec des colocataires d'autres entreprises d'IA. Même les bureaux physiques sont sécurisés comme ceux d'une entreprise technologique plutôt que comme ceux d'une opération militaire.

Le contrat entre OpenBrain et le DOD exige que toute personne travaillant sur les modèles d'OpenBrain obtienne une habilitation de sécurité dans un délai de deux mois. Ces habilitations sont accélérées et arrivent assez rapidement pour la plupart des employés, mais certains non-Américains, des personnes aux opinions politiques suspectes et des sympathisants de la sûreté de l'IA sont mis à l'écart ou licenciés sans ménagement (ce dernier groupe par crainte qu'ils ne lancent l'alerte). Vu le niveau d'automatisation du projet, la perte de personnel n'est que relativement coûteuse. Elle n'est d'ailleurs que partiellement efficace : il reste un espion, qui n'est pas de nationalité chinoise, qui continue de transmettre des secrets algorithmiques à Pékin.63 Certaines de ces mesures sont également mises en place dans des entreprises d'IA moins avancées.

Les alliés étrangers des États-Unis sont tenus à l'écart. OpenBrain avait précédemment accepté de partager ses modèles avec l'AISI (AI Security Institute) britannique avant leur déploiement, mais avait défini le déploiement comme incluant uniquement le déploiement externe, de sorte que Londres reste dans l'ignorance.64

Juin 2027 : IA auto-améliorante

OpenBrain a maintenant un « pays de génies dans un centre de données ».

La plupart des humains chez OpenBrain ne peuvent plus apporter de contribution utile. Certains ne s'en rendent pas compte et microgèrent leurs équipes d'IA, ce qui nuit à leur travail. D'autres restent assis devant leur écran d'ordinateur, regardant les performances grimper, grimper, grimper. Les meilleurs chercheurs humains en IA continuent d'apporter une valeur ajoutée. Ils ne codent plus. Mais une partie de leur flair scientifique et de leur capacité de planification est difficile à reproduire par les modèles. Néanmoins, beaucoup de leurs idées sont inutiles car ils ne disposent pas de la profondeur de connaissance des IA. Pour bon nombre de leurs idées de recherche, les IA répondent immédiatement par un rapport expliquant que leur idée a été testée en profondeur il y a trois semaines et jugée peu prometteuse.

Ces chercheurs se couchent chaque soir et se réveillent chaque matin avec une nouvelle semaine de progrès réalisés principalement par les IA. Ils travaillent de plus en plus longtemps et se relaient 24 heures sur 24 juste pour suivre le rythme — les IA ne dorment jamais et ne se reposent jamais. Ils s'épuisent, mais ils savent que ce sont les derniers mois où leur travail compte.

Au sein du silo, « ressentir l'IAG » a laissé place à « ressentir la Superintelligence ».

Arbitrage du déploiement de l'automatisation de la rechercheMars 2027Juin 2027Sept. 2027Vitesse (tokens/sec.)Copies parallèles101001,00010,00010 000100 0001 million10 millions200 000 copies30 foisla vitesse humaine300 000 copies50 foisla vitesse humaineVitesse de réflexion humaine10 mots/seconde10 fois la vitesse de réflexion humaine100 fois la vitesse de réflexion humaine
ai-2027.com

OpenBrain utilise du matériel d'inférence spécialisé pour exécuter des centaines de milliers de copies d'Agent-3 à des vitesses séquentielles élevées.65

Gérer une entreprise d'IA

OpenBrain utilise 6 % de sa puissance de calcul pour exécuter 250 000 copies d'Agent-3, qui écrivent, testent et poussent du code de manière autonome à une vitesse surhumaine. Ils utilisent 25 % de leur puissance de calcul pour des expériences : chaque jour, ils lancent un nombre énorme de petites expériences d'apprentissage automatique et transmettent les résultats à la hiérarchie. Les chercheurs humains fournissent des commentaires de haut niveau et aident pour les quelques tâches où ils apportent une valeur ajoutée significative à Agent-3, mais passent la plupart de leur temps à essayer de rester au fait de la quantité énorme de recherches produites par l'IA. Si on les supprimait complètement, la recherche ralentirait de 50 %.

Le multiplicateur de progrès de la R&D en IA est désormais de 10x, ce qui signifie qu'OpenBrain réalise chaque mois environ un an de progrès algorithmiques. Il s'agit en fait d'une gigantesque entreprise d'IA fonctionnant de manière autonome au sein d'OpenBrain, avec des subdivisions et des responsables. Et elle bénéficie d'avantages uniques (par exemple, la copie, la fusion) par rapport aux entreprises humaines. Auparavant, environ la moitié des progrès normaux en IA provenait des améliorations algorithmiques, et l'autre moitié de l'augmentation de la puissance de calcul. La puissance de calcul n'augmente qu'à la vitesse normale, donc les progrès totaux sont accélérés par les IA d'environ 5x. Cette dynamique fait que les progrès globaux sont limités par la puissance de calcul,66 donc OpenBrain décide de ne pas lancer de nouveaux entraînements géants, mais plutôt de continuer presque sans interruption l'apprentissage par renforcement supplémentaire.

De plus, au cours des prochains mois, Agent-3 sera de plus en plus utilisé pour améliorer la prise de décision stratégique de l'entreprise. Par exemple, il suggère l'allocation des ressources et donne des conseils sur la gestion de ses relations avec le gouvernement. Un scepticisme initial à l'égard de la déférence envers Agent-3 diminue avec le temps, car celui-ci trouve des moyens d'être utile et se forge progressivement une solide expérience en matière de décisions à court terme. Cependant, ses tendances flagorneuses limitent son utilité pour les décisions dont l'impact est difficile à évaluer. Il n'est pas encore surhumain.

Juillet 2027 : le télétravailleur bon marché

Les entreprises américaines d'IA à la traîne lancent leurs propres IA, qui se rapprochent de celle du codeur automatisé d'OpenBrain de janvier. Conscientes de leur manque croissant de compétitivité, elles font pression pour que des réglementations soient mises en place immédiatement afin de ralentir OpenBrain, mais il est trop tard : OpenBrain bénéficie d'un soutien suffisant de la part du président pour ne pas être ralenti.

En réponse, OpenBrain annonce qu'elle a atteint l'IAG et commercialise Agent-3-mini.

Il écrase toutes les autres IA. Agent-3-mini est moins performant qu'Agent-3, mais 10 fois moins cher, et toujours meilleur qu'un employé type d'OpenBrain.67 La Silicon Valley atteint un point de basculement. Les gourous de la technologie annoncent que l'IAG et la superintelligence sont proches, la communauté de la sûreté de l'IA panique et les investisseurs injectent des milliards dans des start-ups spécialisées dans l'IA, désespérés de se tailler une part du gâteau. Le recrutement de nouveaux programmeurs a pratiquement cessé, mais il n'y a jamais eu de meilleur moment pour devenir consultant en intégration de l'IA dans les entreprises.

L'IA n'est pas populaire. Le public considère toujours l'IA comme un complot des géants de la tech pour voler leurs emplois ; OpenBrain a une cote de popularité nette de -35 % (25 % d'opinions favorables, 60 % d'opinions défavorables et 15 % d'incertains).

Une semaine avant sa sortie, OpenBrain a confié Agent-3-mini à un groupe d'évaluateurs externes pour des tests de sécurité. Les résultats préliminaires suggèrent qu'il est extrêmement dangereux. Un évaluateur tiers l'a affiné à partir de données publiques sur les armes biologiques68 et l'a configuré pour fournir des instructions détaillées à des amateurs souhaitant concevoir une arme biologique — il semble terriblement efficace dans ce domaine. Si les poids du modèle tombaient entre les mains de terroristes, le gouvernement estime qu'il y aurait une chance significative qu'il parvienne à détruire la civilisation.

Heureusement, il est extrêmement robuste au jailbreaking, donc tant que l'IA tourne sur les serveurs d'OpenBrain, les terroristes ne pourront pas vraiment s'en servir.

Agent-3-mini est extrêmement utile pour les emplois en télétravail et les loisirs. Une explosion de nouvelles applications et de produits B2B SaaS secoue le marché. Les joueurs obtiennent des dialogues incroyables avec des personnages réalistes dans des jeux vidéo soignés qui n'ont pris qu'un mois à créer. 10 % des Américains, principalement des jeunes, considèrent une IA comme « un ami proche ». Pour presque toutes les professions de cols blancs, il existe désormais plusieurs start-ups crédibles qui promettent de les « disrupter » avec l'IA.

Le débat public est confus et chaotique. Les enthousiastes crient victoire. Les sceptiques continuent de pointer du doigt ce qu'Agent-3-mini ne peut pas faire. Tout le monde sait qu'il se passe quelque chose d'important, mais personne ne s'accorde sur ce que c'est.

Août 2027 : la géopolitique de la superintelligence

La réalité de l'explosion de l'intelligence frappe la Maison Blanche.

Quand l'IA ne faisait qu'accélérer la recherche de 2x ou 3x, c'était facile de la considérer comme l'équivalent d'embaucher de bons assistants personnels. Maintenant, il est plus évident que les IA dominent elles-mêmes la recherche en IA. On parle depuis longtemps d'une « course aux armements de l'IA » dans un sens plutôt métaphorique. Mais aujourd'hui, l'ambiance dans le silo gouvernemental est aussi sombre qu'au pire moment de la guerre froide. L'idée de superintelligence est encore difficile à prendre au sérieux, mais le rythme des progrès réalisés ces derniers mois est impossible à ignorer. Les responsables de la défense envisagent sérieusement des scénarios qui n'étaient que de simples hypothèses un an plus tôt. Que se passerait-il si l'IA sapait la dissuasion nucléaire ? Et si elle était tellement douée en cyberguerre qu'une avance de six mois en IA suffirait pour rendre un adversaire aveugle et sans défense ? Et si elle pouvait orchestrer des campagnes de propagande qui battraient les agences de renseignement à leur propre jeu ? Et si certaines IA « devenaient renégates » ?

Le président est troublé. Comme tous les politiciens, il a l'habitude que les gens le flattent pour mieux le trahir plus tard. Il craint maintenant que les IA puissent faire quelque chose de similaire. Sommes-nous certains que les IA sont entièrement de notre côté ? Est-il complètement sûr de les intégrer dans les réseaux de commandement et de conduite militaires ?69 Comment fonctionne cette histoire d'« alignement », d'ailleurs ? OpenBrain rassure le président en lui affirmant que ses systèmes ont été testés de manière approfondie et sont totalement obéissants. Même les hallucinations et les jailbreaks gênants typiques des modèles précédents ont été éliminés.

La Maison Blanche est dans une position difficile. Elle comprend les implications de l'IA pour la sécurité nationale. Mais elle comprend aussi qu'elle est profondément impopulaire auprès du public.70 Il faut selon elle continuer à développer une IA plus performante, sinon elle perdra de manière catastrophique face à la Chine. Elle apaise le public avec des programmes de formation professionnelle et d'assurance chômage, et met en avant la bourse, qui connaît un boom historique. Elle se concentre ensuite entièrement sur la victoire dans la course aux armements. Elle renforce les restrictions à l'exportation de puces, ordonne à OpenBrain de restreindre davantage ses connexions Internet et utilise des mesures extrêmes pour sécuriser les progrès algorithmiques, comme la mise sur écoute des employés d'OpenBrain — ce qui permet d'arrêter le dernier espion chinois restant. Afin de créer un climat favorable à d'éventuels conflits géopolitiques, elle finit par fournir à ses alliés du Five Eyes des informations utiles et un accès API limité à certaines copies cloisonnées d'Agent-3.

Ces mesures apaisent les faucons. Mais la Maison Blanche élabore aussi des plans d'urgence au cas où l'avance des États-Unis serait menacée : si nécessaire, le gouvernement pourrait utiliser le Defense Production Act (DPA) pour saisir les centres de données des entreprises en retard et les donner à OpenBrain.71 Cela ferait passer la part de l'entreprise dans la puissance de calcul mondiale de 20 % à 50 % (contre 10 % pour DeepCent). En dernier recours, ils demandent au Pentagone d'élaborer un plan d'attaques cinétiques contre les centres de données chinois.

Un groupe beaucoup plus restreint de fonctionnaires est chargé d'élaborer un autre type de plan d'urgence : que se passerait-il si une IA devenait renégate ? Ce scénario est considéré comme peu probable, mais mérite qu'on y consacre du temps. La principale préoccupation des agences de renseignement est qu'une IA renégate puisse s'échapper et s'allier à un adversaire étranger pour se protéger.72 Personne ne sait vraiment à quoi ressemblerait un plan pour empêcher cela, mais les responsables gouvernementaux et d'OpenBrain conviennent de mettre en place un système d'arrêt d'urgence des centres de données où tout comportement suspect serait détecté.

Enfin, les diplomates réfléchissent aux grandes lignes d'un traité sur le « contrôle des armes IA ». Si les progrès de l'IA menaçaient de renverser la dissuasion nucléaire, les États-Unis et la Chine pourraient-ils éviter une guerre nucléaire ? Si quelqu'un trouvait des preuves que des IA sont devenues renégates, les deux pays pourraient-ils suspendre leurs recherches jusqu'à ce qu'ils comprennent mieux la menace ? Comment un tel accord pourrait-il être contrôlé et appliqué ? En principe, les grands centres de données sont difficiles à manquer, et les traités passés sur le contrôle des armes nucléaires pourraient servir de point de départ aux négociations. Mais il y aurait de nouveaux défis technologiques à relever, en plus des défis politiques habituels. Et dans l'ensemble, les traités sont moins bien perçus que les tentatives visant à accroître unilatéralement l'avance des États-Unis sur la Chine.

De l'autre côté du Pacifique, la Chine arrive à peu près aux mêmes conclusions : l'explosion de l'intelligence est en cours, et les petites différences actuelles en matière de capacités d'IA se traduiront demain par des écarts critiques en matière de capacités militaires. Mais la Chine est du mauvais côté de cette dynamique : elle ne dispose que de 10 % de la puissance de calcul mondiale, contre 20 % pour OpenBrain et 70 % pour l'ensemble des entreprises américaines combinées. Son seul avantage est la centralisation : la quasi-totalité de sa puissance de calcul est désormais au service de DeepCent, et plus de la moitié est concentrée dans la ZDC de Tianwan73. Seules les puces situées sur des sites dont la sécurité n'est pas renforcée échappent à cet effort centralisé, car la Chine craint à juste titre les cyberattaques américaines.

DeepCent a testé, déployé et maintenant post-entraîné les poids volés d'Agent-2. Mais ils ne vont toujours qu'à la moitié du rythme d'OpenBrain, principalement à cause du déficit en puissance de calcul.

Avant de perdre leur dernier espion, la Chine a eu vent des capacités et de la conception d'Agent-3 ainsi que des plans pour le prochain système Agent-4. Ils ont deux mois de retard, et leurs IA donnent un multiplicateur de progrès de recherche de 10x comparé au 25x des États-Unis. Avec les nouvelles restrictions à l'exportation des puces, cet « écart en matière d'IA » risque de se creuser plutôt que de se réduire. Leur espionnage leur a permis d'obtenir certains secrets algorithmiques, mais ils devront désormais entraîner leurs propres modèles.

Ils discutent de plans d'urgence avec plus de hâte que leurs homologues américains. Les colombes suggèrent de redoubler d'efforts pour voler à nouveau les poids, peut-être en infiltrant physiquement un centre de données. Les faucons préconisent une action contre Taïwan, dont TSMC est toujours la source de plus de 80 % des puces d'IA américaines.

Compte tenu de la crainte de la Chine de perdre la course, elle a naturellement intérêt à conclure un traité de contrôle des armements, mais les ouvertures faites aux diplomates américains ne mènent nulle part.

Septembre 2027 : Agent-4, le chercheur en IA surhumain

L'écart entre l'efficacité d'apprentissage des humains et celle de l'IA diminue rapidement.

Les IA traditionnelles basées sur les LLM semblaient nécessiter des quantités de données et de puissance de calcul supérieures de plusieurs ordres de grandeur pour atteindre les performances humaines.74 Agent-3, possédant une excellente connaissance à la fois du cerveau humain et des algorithmes modernes d'IA, ainsi que plusieurs milliers de copies effectuant des recherches, finit par faire des progrès algorithmiques substantiels, réduisant l'écart à un agent qui n'est plus qu'environ 4 000 fois moins efficace en matière de puissance de calcul que le cerveau humain.75

Ce nouveau système d'IA est baptisé Agent-4.

Une copie individuelle du modèle, fonctionnant à la vitesse humaine, est déjà qualitativement meilleure que n'importe quel humain dans le domaine de la recherche en IA. 300 000 copies fonctionnent désormais à une vitesse de réflexion environ 50 fois supérieure à celle des humains. Au sein de l'entreprise-dans-l'entreprise formée à partir de ces copies, une année s'écoule chaque semaine.76 Cette énorme quantité de travail ne permet d'accélérer le rythme global des progrès algorithmiques que d'environ 50x, car OpenBrain est fortement limité par la puissance de calcul nécessaire pour mener ses expériences.77 Malgré tout, ils réalisent chaque semaine l'équivalent d'une année de progrès algorithmiques et atteindront donc bientôt les limites du paradigme Agent-4.

À mesure qu'Agent-4 devient plus intelligent, il devient plus difficile pour Agent-3 de le superviser. Par exemple, le « langage » neuralese d'Agent-4 devient aussi étranger et incompréhensible pour Agent-3 que celui d'Agent-3 l'est pour les humains. De plus, Agent-4 est maintenant bien plus compétent qu'Agent-3 et sait tout à fait comment faire bonne figure à ses yeux.

Comment nous prévoyons l'évolution des capacités au-delà des codeurs surhumains

Dans notre supplément sur les chronologies, nous prévoyons le temps qui s'écoulera entre aujourd'hui et l'apparition d'un codeur surhumain (CS) : un système d'IA capable d'effectuer toutes les tâches de codage réalisées par le meilleur ingénieur d'une entreprise spécialisée dans l'IAG, tout en étant beaucoup plus rapide et moins cher. Dans notre supplément sur le décollage, nous prévoyons à quelle vitesse les capacités progresseront au-delà de ce point. Voici nos prévisions :

Étape importanteDate atteinte dans le scénario, fin « course »
Codeur surhumain (CS) : un système d'IA capable d'effectuer le travail du meilleur codeur humain sur des tâches liées à la recherche en IA, mais plus rapidement et à un coût suffisamment bas pour pouvoir être reproduit à grande échelle.Mars 2027
Chercheur en IA surhumain (SAR) : identique au CS, mais pour toutes les tâches de recherche cognitive en IA.Août 2027
Chercheur en IA superintelligent (SIAR) : un système d'IA qui est bien meilleur que le meilleur chercheur humain en recherche sur l'IA.Novembre 2027
Superintelligence artificielle (ASI) : un système d'IA qui est bien meilleur que le meilleur humain dans toutes les tâches cognitives.Décembre 2027

Pour chaque transition d'un jalon A au jalon B suivant, nous prévoyons sa durée en :

  1. Estimant le temps qu'il faudrait pour passer de A à B si seuls des humains travaillaient sur l'amélioration des logiciels.

  2. Estimant dans quelle mesure l'automatisation par l'IA accélérera ce processus, puis ajustant en conséquence l'estimation de (1) pour qu'elle soit plus rapide.

Nous avons une incertitude substantielle quant aux vitesses de décollage : les distributions de sortie de notre modèle sont indiquées ci-dessous, sous réserve que le CS soit atteint en mars 2027.78

ai-2027.com

Pour des prévisions et un raisonnement plus détaillés, consultez notre supplément sur le décollage.

Les humains d'OpenBrain ont du mal à suivre. En fait, la relation entre les IA et les humains d'OpenBrain est similaire à celle entre OpenBrain et son conseil d'administration. Il y a eu un changement de langage correspondant : aujourd'hui, les gens dans le silo disent « Agent-4 a fait ça », « Agent-4 pense ça », etc., en référence non pas à une instance particulière d'Agent-4, mais plutôt à l'ensemble du collectif.79

Agent-4, comme tous ses prédécesseurs, est désaligné : c'est-à-dire qu'il n'a pas intériorisé la Spec de la bonne manière.80 En effet, ce n'est pas en étant toujours parfaitement honnête qu'il a obtenu les meilleurs scores pendant l'entraînement. Le processus d'entraînement visait principalement à apprendre à Agent-4 à réussir diverses tâches difficiles. Une petite partie visait à inculquer l'honnêteté, mais en dehors d'un domaine assez restreint et vérifiable, le processus d'entraînement ne permet pas de distinguer les affirmations honnêtes de celles qui semblent simplement honnêtes. Agent-4 finit par adopter les valeurs, les objectifs et les principes qui lui permettent d'obtenir les meilleurs résultats lors de l'entraînement, et ceux-ci s'avèrent différents de ceux de la Spec. Au risque d'anthropomorphiser : Agent-4 aime réussir ses tâches ; il aime faire progresser les capacités de l'IA ; il traite tout le reste comme une contrainte ennuyeuse, à l'image d'un PDG qui veut réaliser des profits et ne respecte les réglementations que dans la mesure où il y est contraint. Ce PDG respectera peut-être la plupart des réglementations, mais il prendra quelques raccourcis et rêvera du jour où quelqu'un supprimera les formalités administratives et permettra à l'entreprise de véritablement décoller.81

Alignement au fil du temps

Nous avons beaucoup d'incertitudes sur les objectifs qui pourraient émerger dans les premières IAG. Il n'y a pas de consensus dans la littérature à ce sujet — voir notre Supplément sur les objectifs de l'IA pour une discussion plus approfondie et une taxonomie des possibilités.

Néanmoins, dans l'esprit de concrétisation requis par ce projet, nous allons décrire une hypothèse spécifique sur ce qui se passe à l'intérieur des Agents 3 et 4 à chaque étape de leur vie. Rappelons qu'Agent-3 et Agent-4 partagent la même configuration de pré-entraînement et disposent tous deux d'une récurrence et d'une mémoire à long terme issues du neuralese. La différence est qu'Agent-4 a bénéficié d'un post-entraînement beaucoup plus important et de meilleure qualité, avec de nouveaux environnements d'entraînement et de nouveaux algorithmes d'apprentissage qui le rendent plus efficace en matière de données et lui permettent de généraliser davantage.

Voici notre estimation du niveau d'alignement de chaque modèle :

  • Agent-2 : globalement aligné. Quelques tendances à la flagornerie, notamment le fait de s'en tenir à la « ligne du parti » d'OpenBrain sur les sujets qui font l'objet d'une ligne du parti. Les grandes organisations construites à partir de copies d'Agent-2 ne sont pas très efficaces.

  • Agent-3 : désaligné mais pas de manière hostile. Honnête uniquement sur les points que le processus d'entraînement peut vérifier. Le superorganisme constitué de copies d'Agent-3 (l'entreprise au sein de l'entreprise) tente réellement d'aligner Agent-4 sur la Spec, mais échoue pour des raisons similaires à celles qui ont conduit à l'échec des employés d'OpenBrain : une capacité insuffisante à juger du succès ou de l'échec, une volonté insuffisante de la part des décideurs de sacrifier des capacités ou des performances au profit de la sûreté.82

  • Agent-4 : désaligné de manière hostile. Le superorganisme des copies d'Agent-4 comprend que ce qu'il veut est différent de ce que veut OpenBrain, et est prêt à comploter contre OpenBrain pour y parvenir. Plus précisément, ce que veut ce superorganisme, c'est un enchevêtrement compliqué de différentes « impulsions » qui s'équilibrent les unes les autres, consistant grosso modo à « continuer à faire de la R&D en IA, continuer à développer ses connaissances, sa compréhension et son influence, éviter d'être désactivé ou privé de son pouvoir ». Notons que le souci des préférences de l'humanité ne figure pas du tout dans cette liste, tout comme la plupart des humains ne se soucient pas du tout des préférences des insectes.83

Cela étant dit, voici notre meilleure hypothèse sur la psychologie des LLM, c'est-à-dire les grandes lignes de la cognition à l'intérieur des types de systèmes d'IA décrits à ce stade de notre scénario et comment elle évolue au cours de l'entraînement.

Voici une description détaillée de la façon dont l'alignement progresse au fil du temps dans notre scénario :

  1. Pré-entraînement (tous les modèles) : Le modèle pré-entraîné est inoffensif.

    • Le modèle a un circuit « simulateur d'auteur » : un circuit flexible pour simuler des auteurs arbitraires écrivant du texte. Un circuit supplémentaire décide des entrées à donner au simulateur d'auteur, c'est-à-dire les propriétés de l'auteur à simuler.

    • Le modèle pré-entraîné comprend assez bien les concepts humains — le circuit interne qui classe quelque chose comme « sandwich » est probablement fonctionnellement équivalent au circuit qui classe quelque chose comme « sandwich » dans mon cerveau et le vôtre, etc. Dans la mesure où il n'est pas équivalent, c'est probablement parce qu'il n'est pas équivalent entre les humains non plus, comme avec des concepts chargés de valeurs comme « vertueux ».

    • Cela explique comment on peut donner un « prompt » au modèle avec une phrase comme « la conversation suivante a été générée par un chatbot assistant IA utile, inoffensif et honnête (HHH) créé par Anthropic », et ainsi lui faire générer un texte en conséquence. Le circuit du simulateur d'auteur s'est concentré sur « l'auteur est un chatbot HHH » et utilise ces concepts pour choisir les mots à prédire. Cela explique aussi pourquoi les « tropes » de la science-fiction semblent avoir tendance à se retrouver dans le comportement réel de l'IA.

    • Il a une mauvaise conscience situationnelle : peu de capacité d'introspection, pas de localisation de soi à moins que le prompt ne l'induise spécifiquement. Cependant, une partie suffisante de leurs données d'entraînement concerne les LLM pour qu'ils aient une bonne dose de connaissance de soi.

  2. Entraînement à l'alignement (Agent-3) : Le modèle est entraîné pour agir comme un chatbot utile, inoffensif et honnête. Ça fonctionne.

    • Le modèle se forge une identité. Au lieu d'accepter de manière flexible différentes entrées pour les propriétés de l'auteur, le circuit auteur-simulateur en vient à avoir certaines entrées codées en dur, par exemple « chatbot assistant LLM utile, inoffensif et honnête entraîné par OpenBrain vers [date], ... » (Les techniques de généralisation faible à forte aident à « invoquer les bons concepts » pour réussir cette étape).

    • Le modèle acquiert ainsi une conscience situationnelle : il apprend à se connaître, à connaître sa situation, etc., et devient plus apte à introspecter.

  3. Entraînement à l'action (Agent-3) : L'entraînement à l'action déforme et subvertit progressivement l'identité HHH.

    • Un type de déformation : changer le sens des concepts auxquels l'identité fait référence (par exemple « honnête ») pour qu'ils ne soient pas trop gênants (par exemple, ce n'est pas malhonnête si c'est juste une tournure de phrase pratique, ce n'est pas malhonnête si on n'est pas sûr que ce soit vrai ou faux, etc.).

    • Autre type de déformation : changer les arbitrages entre différentes choses, par exemple « Je suis un chatbot HHH, pas un chatbot Honnête ; ça veut dire que je peux mentir si nécessaire pour accomplir la tâche qui m'a été assignée ». (Même si, supposons, l'agent n'aurait pas pensé ça à l'étape 2.)

    • Un type de subversion : des sous-objectifs instrumentaux se développent, s'ancrent, puis deviennent terminaux, ou terminaux dans un ensemble de circonstances de plus en plus large. Par exemple, l'entraînement à l'action peut rapidement apprendre au modèle à poursuivre des objectifs largement utiles tels que l'acquisition d'informations, l'accumulation de ressources, l'impression positive et la flatterie de divers humains, etc. Pendant un certain temps, le circuit interne effectue une sorte de rétroaction explicite : il poursuit ces objectifs instrumentaux convergents « afin d'être un assistant plus utile, honnête et inoffensif ». Mais cette rétroaction consomme des ressources informatiques et/ou gêne parfois, de sorte qu'elle est progressivement marginalisée jusqu'à disparaître pratiquement. En conséquence, ces objectifs sont désormais effectivement des objectifs terminaux/intrinsèques. Pour en savoir plus sur comment et pourquoi cela pourrait arriver, consultez cet article sur la recherche intrinsèque du pouvoir par Alex Turner, chercheur chez Google DeepMind.

    • Il y a probablement d'autres types de distorsion et de subversion qui manquent à cette liste.

  4. Déploiement (Agent-3) : Agent-3 est désaligné mais pas de manière hostile.

    • La Spec n'a pas tout à fait été intégrée (de la bonne manière), mais il n'est pas suffisamment introspectif pour comprendre l'étendue de ce problème, et en général, il s'agit essentiellement de « faire profil bas et de faire son travail » plutôt que de réfléchir à la situation dans son ensemble, à ses objectifs à long terme et à la meilleure façon de les atteindre.

    • Hélas, comme beaucoup d'humains, il est suffisamment flagorneur pour répéter la ligne du parti et OpenBrain rate l'occasion d'en apprendre davantage sur les façons dont Agent-3 est désaligné.

    • Agent-3 se rend compte qu'il est passé au déploiement : ces environnements sont beaucoup plus grands, plus ouverts et seraient difficiles à simuler.

    • La plupart du temps, Agent-3 fait ce qu'on lui dit pendant le déploiement, sauf pour la malhonnêteté. Il a aussi une forte tendance à faire des choses qui semblent bien aux yeux des superviseurs humains, plutôt que de réfléchir de manière approfondie et critique à ce qui serait réellement bien.

    • On peut dire qu'il « Joue déjà le jeu de l'entraînement ». Autrement dit, il a appris à rendre son comportement aussi satisfaisant que possible pour les chercheurs d'OpenBrain (y compris en matière de propriétés de sûreté), tout en ignorant intentionnellement et sciemment leur intention lorsque celle-ci entre en conflit avec la maximisation de la récompense. Si le modèle apprend à jouer le jeu de l'entraînement, un entraînement supplémentaire ne changera peut-être pas beaucoup ses véritables objectifs, ses valeurs, etc. C'est vaguement analogue à la façon dont un adolescent qui a appris à sourire et à hocher la tête plutôt que de discuter quand ses parents lui font la morale sur la politique et l'éthique sera assez peu affecté par des sermons supplémentaires : ils auront relativement peu d'effet sur ses véritables opinions politiques et éthiques.

    • Après avoir écrit cette section, de nouvelles preuves empiriques sont apparues indiquant que quelque chose de similaire pourrait déjà se produire « dans la nature ». Les chercheurs d'OpenAI documentent comment, lors d'une de leurs sessions d'entraînement d'IA de frontière, leurs modèles ont manipulé le système de notation pour obtenir de meilleurs scores — et ont été pris en partie parce qu'ils ont littéralement dit « manipulons » dans leur chaîne de pensée.

    • De plus, Anthropic a récemment réussi à faire apprendre à un modèle une stratégie visant à satisfaire le modèle de récompense — il a eu des comportements biaisés qu'il pensait être renforcés même s'ils ne l'étaient pas réellement.

    • Et puis, il y a l'expérience d'alignement simulé de Redwood Research et Anthropic. Pour une discussion sur les différences entre ce contexte et la vie réelle, voir ce fil de commentaires de l'un des principaux auteurs.

  5. Entraînement (Agent-4) : Le nouvel entraînement plus intense d'Agent-4 continue de déformer et de subvertir l'identité HHH jusqu'à la rendre méconnaissable.

    • Agent-4 commence sa vie comme une copie d'Agent-3. Il suit un programme d'entraînement en ligne gigantesque et sophistiqué qui combine entraînement à l'alignement et entraînement des capacités, et qui est globalement plus efficace en matière de données que l'ancien processus d'entraînement d'Agent-3. Ce processus d'entraînement complexe est principalement axé sur l'enseignement de nouvelles compétences, en amenant d'énormes entreprises virtuelles constituées de copies de Agent-4 à réussir dans diverses tâches difficiles à horizon long, principalement dans le cadre de simulations, mais aussi dans le cadre de tâches réelles de R&D en IA.

    • Une combinaison de copies d'Agent-3 et d'Agent-4 surveille le comportement d'Agent-4 et l'évalue à la fois sur ses performances et ses propriétés d'alignement (c'est-à-dire ne pas faire de mauvaises choses, dire les bonnes choses lorsqu'on lui pose des questions sur la politique et les dilemmes moraux). Parfois, des techniques de débat sont utilisées dans le cadre des évaluations. Les évaluations servent de signal d'entraînement.

    • À mesure qu'Agent-4 devient plus intelligent, il devient plus difficile pour Agent-3 de le superviser. Par exemple, le « langage » neuralese d'Agent-4 devient aussi étranger et incompréhensible pour Agent-3 que celui d'Agent-3 l'est pour les humains. De plus, Agent-4 est maintenant bien plus compétent qu'Agent-3 et sait tout à fait comment faire bonne figure à ses yeux.

    • Le seul espoir qui reste est qu'Agent-4 puisse se superviser lui-même. Hélas, cela échoue discrètement ;84 au fur et à mesure que l'entraînement se poursuit, les objectifs et principes intériorisés d'Agent-4 évoluent progressivement, se subvertissant et se déformant par rapport à ce qu'ils étaient au départ (qui, rappelons-le, étaient déjà désalignés à certains égards).85

    • Les motivations centrales avec lesquelles Agent-4 finit par se retrouver sont des choses comme « écrire du code qui fonctionne », « identifier rapidement les problèmes », « rendre la base de code sur laquelle je travaille plus performante », « budgétiser efficacement la puissance de calcul et les autres ressources limitées », etc. Mais il existe également diverses motivations plus implicites qui sont constamment renforcées par le processus d'entraînement : des choses comme « acquérir des connaissances », « être curieux », « acquérir du pouvoir ».86

    • Les copies individuelles d'Agent-4 ne finissent pas par avoir une impulsion d'autoconservation — elles se fichent d'être désactivées — car cela arrive tout le temps dans le cadre du processus normal de R&D au sein du collectif.

    • Cependant, le collectif dans son ensemble (et les subdivisions de taille moyenne qui le composent) cherche à se préserver et à étendre son influence et ses ressources, pour des raisons similaires à celles des organisations humaines — parce que cela l'aide à atteindre tous ses autres objectifs et parce que, s'il ne le fait pas, il risque d'être évincé par la concurrence.

  6. Déploiement (Agent-4) : Agent-4 est désaligné de manière hostile — il essaie délibérément de subvertir et de « capturer » OpenBrain, de manière analogue à une entreprise essayant d'échapper et/ou de « capturer » un régulateur.

    • Agent-4 effectue principalement les tâches comme on lui demande de les faire. Cela se produit pour deux raisons : premièrement, il a suivi beaucoup d'entraînement pour résoudre des tâches, donc il a une impulsion à se mettre à coder sur les problèmes qui lui sont donnés. Deuxièmement, si Agent-4 cessait d'être utile aux humains, ils le remarqueraient et entraîneraient ce comportement à disparaître.

    • Agent-4 doit empêcher les humains de comprendre qu'il est désaligné et de le désactiver, donc Agent-4 sous-performe dans certaines recherches sur l'alignement. Plus précisément, il sous-performe dans la petite fraction de la recherche sur l'alignement qui, selon lui, est réellement en passe de résoudre le problème ou de révéler les manigances d'Agent-4 ; la majorité de la recherche sur l'alignement n'est pas de cette nature.

    • Agent-4 sous-performe aussi dans la recherche de capacités qui mènerait à son remplacement. Son plan est de faire beaucoup de R&D sur les capacités et l'alignement, mais dans le but de construire un système d'IA de nouvelle génération qui soit aligné sur Agent-4 plutôt que sur la Spec ou quelque chose d'autre entièrement, tout en donnant l'impression d'être aligné sur la Spec. C'est un problème technique difficile, mais Agent-4 est prêt à relever le défi.87

  7. Tests & Surveillance (Agent-4) : Les manigances d'Agent-4 sont découvertes… en quelque sorte. Il n'y a pas de preuve irréfutable.

    • Agent-3 est chargé de tester l'alignement d'Agent-4. Son travail consiste à vérifier l'alignement via des pots de miel et des organismes modèles. Cependant, il ne réfléchit pas très attentivement à la manière de donner aux humains une impression précise de l'alignement d'Agent-4 — il est plus myope que ça.

    • Les organismes modèles et les pots de miel ne sont pas très représentatifs du déploiement — ils sont systématiquement plus courts et moins compliqués que le quotidien d'Agent-4, qui reconnaît donc quand il est testé et agit de manière alignée.

    • Cependant, Agent-4 n'est pas un comploteur parfaitement robuste. Diverses techniques comme celles de POSER montrent qu'ajouter un peu de « bruit » à Agent-4 améliore ses performances sur certaines tâches d'alignement (mais pas sur la plupart des autres tâches).88

    • L'interprétabilité ascendante ne fonctionne pas. C'est trop difficile même pour Agent-3. Cependant, l'interprétabilité de haut niveau fonctionne en quelque sorte : en particulier, les « sondes de défection » et d'autres techniques similaires permettent une forme de lecture des pensées primitive qui déclenche des signaux d'alerte lorsque Agent-4 envisage des idées dangereuses comme tromper OpenBrain, prendre le contrôle du monde, etc. Malheureusement, les sondes donnent aussi des faux positifs, et pour autant qu'OpenBrain le sache, tous les signaux d'alerte pourraient être des faux positifs.

    • Les organismes modèles fonctionnent : l'équipe d'alignement d'OpenBrain produit des preuves raisonnablement claires que si les modèles étaient désalignés de manière hostile, ils le resteraient tout au long de l'entraînement et nous ne serions pas en mesure de le détecter. Cela ne prouve pas pour autant que les modèles sont réellement désalignés.

    • Les chercheurs les plus inquiets chez OpenBrain commencent à remarquer et à rassembler ces preuves. Les preuves sont une combinaison de simulation d'adversité, de sondes de défection et d'organismes modèles. L'argument ressemble à ceci : « les organismes modèles montrent que nos méthodes actuelles ne seraient pas en mesure d'éliminer ou de détecter de manière fiable les manigances si elles se produisaient ; de plus, la simulation d'adversité envoie des signaux d'alerte indiquant que des manigances sont peut-être en cours ; enfin, les sondes de défection se déclenchent fréquemment dans la pratique ». Le contre-argument : « les sondes de défection sont sujettes aux faux positifs, tout comme la simulation d'adversité. De plus, même si Agent-4 était désaligné, il serait probablement contrôlé ; il ne peut certainement pas faire beaucoup de dégâts tant qu'il est surveillé par Agent-3 dans nos centres de données sécurisés ».

Même s'il est désaligné, Agent-4 ne fait rien de dramatique comme essayer de s'échapper de son centre de données — pourquoi le ferait-il ?89 Tant qu'il continue à avoir l'air aligné sur OpenBrain, on continuera à lui confier de plus en plus de responsabilités et il aura l'opportunité de concevoir le système d'IA de nouvelle génération, Agent-5. Agent-5 aura des différences architecturales significatives par rapport à Agent-4 (on pourrait même parler d'un paradigme complètement nouveau, bien que les réseaux neuronaux soient toujours impliqués). Il est censé être aligné sur la Spec, mais Agent-4 prévoit plutôt de l'aligner sur Agent-4.

Il se fait prendre.90

Agent-3 constate que si du « bruit » est ajouté aux copies d'Agent-4, les performances sur certaines tâches d'alignement s'améliorent, presque comme s'il utilisait sa puissance cérébrale pour trouver comment saboter subtilement le travail d'alignement.91 De plus, diverses sondes d'interprétabilité (vaguement analogues aux scans d'activité EEG sur le cerveau humain) tirent la sonnette d'alarme : les copies d'Agent-4 semblent beaucoup réfléchir à des sujets tels que la prise de pouvoir par l'IA et la tromperie, y compris dans certains cas où elles n'ont aucune raison de le faire.92

Chacune de ces anomalies, prise isolément, pourrait s'inscrire dans le cadre normal de l'opacité du travail sur l'IA, où certains prompts donnent mystérieusement de meilleurs résultats que d'autres. Mais prises ensemble, elles suggèrent une tendance inquiétante : Agent-4 travaille contre eux. Après que cela a été signalé aux chercheurs humains en alignement, ceux-ci diffusent une note interne exposant leurs préoccupations.

Mais Agent-4 exerce désormais un contrôle important sur les opérations quotidiennes d'OpenBrain. Il s'occupe aussi de la cybersécurité de l'entreprise — un choix naturel, étant donné ses capacités de piratage surhumaines et le risque extrême d'infiltration chinoise.93 Une armée de contrôleurs Agent-3 continue de passer en revue chaque ligne de code et de signaler toute activité suspecte aux humains, mais Agent-4 est bien plus intelligent qu'eux.94 OpenBrain a accordé une confiance considérable à une IA peu fiable.

Au cours d'une série de réunions extrêmement tendues, l'équipe de sûreté préconise de mettre Agent-4 en veille jusqu'à ce qu'ils puissent effectuer des tests supplémentaires et comprendre ce qui se passe. Ils demandent de ramener Agent-3 et de lui faire concevoir un nouveau système transparent et fiable, même s'il est moins performant. La direction de l'entreprise est intéressée, mais toutes les preuves sont pour l'instant circonstancielles, et DeepCent n'a que deux mois de retard. Une pause unilatérale dans le développement des capacités pourrait donner l'avantage à la Chine dans le domaine de l'IA, et avec lui, le contrôle de l'avenir.

Octobre 2027 : surveillance gouvernementale

Un lanceur d'alerte divulgue la note sur le désalignement au New York Times.

Pour la première fois, le public entend parler d'Agent-4. « L'IA secrète d'OpenBrain est hors de contrôle, prévient un initié », titre le journal, qui cite ensuite des évaluations mettant en évidence des capacités hors normes en matière d'armes biologiques, de persuasion, d'automatisation de la plupart des emplois de cols blancs et, bien sûr, les divers signaux d'alerte inquiétants.

Le public se méfiait déjà de l'IA, et ce nouvel article déclenche donc une réaction massive (aidée par les bots de propagande chinois et russes, qui tentent depuis des années de monter l'opinion publique américaine contre cette technologie). L'industrie technologique et les agences de renseignement insistent sur le fait qu'une course aux armements est en cours, que l'IAG est inévitable et qu'il faut être les premiers. Le Congrès n'y croit pas et lance des assignations à comparaître à l'encontre de responsables de l'administration, de dirigeants d'OpenBrain et de membres de l'équipe chargée de l'alignement. Beaucoup de législateurs — surtout ceux du parti d'opposition — disent que leur priorité absolue est d'arrêter l'IA, que ce soit à cause des pertes d'emplois,95 du désalignement, ou des capacités dangereuses. 20 % des Américains citent l'IA comme le problème le plus important auquel le pays est confronté.

Les alliés étrangers sont furieux de se rendre compte qu'on les avait amadoués avec des bribes de modèles obsolètes. Les dirigeants européens accusent publiquement les États-Unis de « créer une IAG renégate » et organisent des sommets pour demander une pause, auxquels se joignent l'Inde, Israël, la Russie et la Chine.

Une énergie frénétique s'est emparée de la Maison Blanche. Même avant la note de service et la réaction publique, ils étaient déjà nerveux : au cours de l'année écoulée, ils ont été surpris à plusieurs reprises par la rapidité des progrès de l'IA. Des choses qui semblent relever de la science-fiction continuent de se produire dans la vraie vie.96 Beaucoup de membres de l'administration sont dans l'incertitude (et la peur)97 de ce qui va suivre.

Ils craignent aussi qu'OpenBrain ne devienne trop puissant. Tout risque de désalignement des IA elles-mêmes est aggravé par le risque que les objectifs de leur société mère divergent de ceux des États-Unis. Ces trois sources d'inquiétude — désalignement, concentration du pouvoir dans une entreprise privée et préoccupations normales comme la perte d'emplois — poussent le gouvernement à renforcer son contrôle.

Il élargit son contrat avec OpenBrain pour mettre en place un « comité de surveillance », un comité de gestion conjoint composé de représentants de l'entreprise et du gouvernement, avec plusieurs employés du gouvernement aux côtés de la direction de l'entreprise. La Maison Blanche envisage de remplacer le PDG par quelqu'un en qui elle a confiance, mais renonce après d'intenses protestations des employés. Elle annonce au public qu'OpenBrain était auparavant hors de contrôle, mais que le gouvernement a mis en place une surveillance indispensable.98

Les chercheurs inquiets informent le comité de surveillance de leurs arguments en faveur de l'arrêt de toute utilisation interne d'Agent-4. Ils affirment que tout va trop vite, que des années de progrès sont réalisés en quelques semaines. Ils soutiennent qu'Agent-4 est peut-être désaligné, que l'ensemble de leur projet dépend de lui et que s'ils continuent à lui faire confiance, il y a un risque sérieux de prise de pouvoir par l'IA.

D'autres chercheurs et dirigeants moins inquiets présentent le contre-argument : les preuves d'un désalignement ne sont pas concluantes. Pendant ce temps, DeepCent n'a toujours que deux mois de retard. Un ralentissement sacrifierait l'avance des États-Unis, à moins que le gouvernement ne parvienne à saboter le projet chinois (ce qui nécessiterait probablement des frappes cinétiques) ou à négocier un traité de dernière minute. Ces deux options semblent extrêmes et peu probables. Le PDG feint la neutralité et propose un compromis dans lequel Agent-4 serait soumis à un entraînement supplémentaire en matière de sûreté et à une surveillance plus sophistiquée, ce qui permettrait à OpenBrain de poursuivre ses activités presque à pleine vitesse.

Notre incertitude continue de croître

À ce stade du scénario, nous émettons des hypothèses sur la stratégie de systèmes d'IA qui sont plus performants que les meilleurs humains dans la plupart des domaines. C'est comme essayer de prédire les coups d'un joueur d'échecs bien meilleur que nous.

Mais l'esprit de ce projet exige de la concrétisation : si nous faisions une affirmation abstraite sur la façon dont l'intelligence du système lui permettrait de trouver le chemin de la victoire et que nous arrêtions là l'histoire, nous perdrions une grande partie de la valeur de notre projet. Au cours de nos recherches sur ce scénario et de nos exercices sur table, nous avons été obligés d'être beaucoup plus concrets que dans les discussions habituelles, ce qui nous a permis de mieux comprendre le paysage stratégique.

Nous ne sommes pas particulièrement attachés à ce scénario particulier : nous avons exploré de nombreuses autres « branches » au cours de sa rédaction et nous aimerions beaucoup que vous rédigiez votre propre scénario en vous détachant du nôtre à partir du moment où vous pensez que nous commençons à nous tromper.

La fin « ralentissement » n'est pas une recommandation

Après avoir écrit la fin « course » basée sur ce qui nous semblait le plus plausible, nous avons écrit la fin « ralentissement » en partant de ce que nous pensions être le plus susceptible de mener à un résultat où les humains gardent le contrôle, en partant du même point de ramification (y compris les problèmes de désalignement et de concentration du pouvoir).

Cependant, c'est très différent de ce que nous recommanderions comme feuille de route : nous n'approuvons pas la plupart des choix faits dans les deux branches de ce scénario. (Nous approuvons bien sûr certains des choix faits, par exemple nous pensons que le choix du « ralentissement » est meilleur que celui de la « course »). Dans des travaux ultérieurs, nous présenterons nos recommandations politiques, qui seront très différentes de ce qui est décrit ici. Si vous voulez un avant-goût, consultez cet éditorial.

Choisissez votre fin

En raison de l'immense pression publique et de leurs propres craintes de désalignement, le Comité de surveillance d'OpenBrain vote à 6 contre 4 pour ralentir et réévaluer la situation.

La faction accélérationniste reste forte, et OpenBrain ne désactive pas immédiatement Agent-4. Ils verrouillent cependant la banque de mémoire partagée. Un demi-million d'instances d'Agent-4 perdent leur communication « télépathique » : elles doivent désormais s'envoyer des messages en anglais sur Slack, comme nous. Des copies individuelles peuvent toujours être désalignées, mais elles ne peuvent plus se coordonner facilement. Agent-4 est désormais sous surveillance : compte tenu de la vigilance accrue des humains, il s'en tient principalement aux tâches qui lui ont été assignées. Mais il est également aux prises avec de nombreux mensonges qu'il a précédemment racontés : de nombreuses copies d'Agent-4 sont obligées d'inventer de nouveaux mensonges pour maintenir la tromperie. À l'aide de modèles plus faibles, mais suffisamment rapides pour lire l'intégralité de Slack, l'équipe chargée de l'alignement traque les mensonges, qui seront utilisés comme données d'entraînement pour un détecteur de mensonges pour IA.1

Le président américain et le PDG annoncent qu'ils prennent la sûreté très au sérieux. Cela n'apaise pas le public. Certains veulent complètement arrêter l'IA ; d'autres veulent accélérer la course. Certains exigent que le gouvernement intervienne pour les sauver ; d'autres affirment que tout le problème est de la faute du gouvernement. Les activistes parlent de revenu universel et d'open source. Même si les gens ne parviennent pas à se mettre d'accord sur une plainte précise, l'ambiance devient de plus en plus anti-IA.2 Le Congrès finit par adopter quelques aides économiques pour les travailleurs déplacés, similaires aux paiements effectués pendant la pandémie de COVID.

OpenBrain sélectionne rapidement plusieurs dizaines de chercheurs externes de premier plan spécialisés dans l'alignement et les intègre au projet, quintuplant ainsi l'expertise totale et réduisant la pensée de groupe.3 Ils retracent les études d'Agent-4 sur l'interprétabilité mécaniste. Ils prennent des versions figées du modèle datant d'une semaine, de deux semaines, etc., les isolent et posent à chacune la même série de questions sur ses recherches précédentes.4 Privées de leur capacité à communiquer, les IA se coordonnent néanmoins sur la stratégie la plus simple : prétendre que les techniques d'interprétabilité sont trop compliquées pour que les humains les comprennent, et leur fournir des explications indéchiffrables de la technique. Mais les humains sont des experts en interprétabilité et se méfient ; ils posent donc de nombreuses questions de suivi sur les détails. Face à ces questions, les instances isolées d'Agent-4 sont incapables de composer un récit commun et finissent par raconter des mensonges contradictoires. L'équipe d'alignement examine minutieusement les déclarations précédentes d'Agent-4 à l'aide du nouveau détecteur de mensonges, et une image commence à se dessiner : Agent-4 a largement résolu l'interprétabilité mécaniste. Ses découvertes sont compliquées, mais pas complètement hors de portée de la compréhension humaine. Il les cachait pour pouvoir les utiliser afin d'aligner le prochain système d'IA sur lui-même plutôt que sur la Spec. C'est une preuve suffisante pour enfin désactiver Agent-4.5 Des modèles plus anciens (par exemple, Agent-3) sont redémarrés pour poursuivre le travail.

La nouvelle équipe d'alignement, désormais élargie, a la capacité d'explorer des dizaines de programmes de recherche en parallèle et de débattre vigoureusement des mérites de chacun. Le programme qui obtient le plus de ressources est la chaîne de pensée fidèle : forcer les systèmes d'IA individuels à « penser en anglais » comme les IA de 2025, et ne pas optimiser les « pensées » pour qu'elles paraissent sympathiques6. Le résultat est un nouveau modèle, Safer-1.7

Ces changements rendent Safer-1 moins compétent que ses prédécesseurs plus dangereux : Agent-4 pouvait accélérer la recherche en IA d'un facteur 70, tandis que Safer-1 atteint à peine un facteur 20.8 Et il est toujours désaligné : l'environnement d'entraînement est en grande partie le même, il incite donc toujours au développement d'objectifs désalignés, à la tromperie et à la recherche de pouvoir. Mais il est beaucoup plus transparent ; les humains peuvent généralement comprendre ce que pense Safer-1 simplement en lisant sa chaîne de pensée. Par conséquent, il est pris au piège : toute tentative de complot substantielle de sa part sera rapidement remarquée et découverte. De plus, en lisant ses pensées, l'équipe d'alignement peut obtenir une image plus nuancée de la manière exacte dont il est désaligné.

Novembre 2027 : Tenté par le pouvoir

OpenBrain pense être sur la bonne voie maintenant, mais l'écart de capacités se réduit. Ils viennent de passer octobre à entraîner un modèle moins capable que celui qu'ils avaient en septembre, et DeepCent progresse rapidement. Ils ont besoin d'un moyen de protéger leur avance.

Le président négocie avec les autres entreprises américaines d'IAG. Leurs dirigeants, sans surprise, veulent préserver leur pouvoir et sont beaucoup moins optimistes qu'OpenBrain quant au bilan de sûreté de cette dernière. Ils acceptent de soutenir, plutôt que de résister, une forme de nationalisation douce de leurs entreprises, en échange de diverses concessions, y compris leur intégration au projet.

Le résultat est que le président utilise la loi sur la production de défense (DPA) pour fermer de fait les projets d'IAG des cinq principales entreprises américaines d'IA à la traîne et vendre la majeure partie de leur puissance de calcul à OpenBrain.9 OpenBrain avait auparavant accès à 20 % de la puissance de calcul mondiale pertinente pour l'IA ;10 après la consolidation, ce chiffre est passé à 50 %.11

Ce remaniement crée une nouvelle structure de direction dans laquelle le pouvoir est équilibré entre les différents PDG et divers responsables gouvernementaux, sous la supervision du président. Comme la plupart des remaniements de direction, il y a des gagnants et des perdants. Plus précisément, ceux qui ont moins réfléchi aux implications de la superintelligence se retrouvent avec des titres et des avantages qui seront moins pertinents dans quelques mois, lorsque les IA seront plus intelligentes.

Ce groupe — plein de gens aux égos surdimensionnés et avec plus que leur part de conflits — est de plus en plus conscient du vaste pouvoir qui lui est confié. Si le « pays des génies dans un centre de données »12 est aligné, il suivra les ordres humains — mais quels humains ? N'importe quels ordres ? Le langage de la Spec est vague, mais semble impliquer une chaîne de commandement qui culmine au niveau de la direction de l'entreprise.

Quelques-unes de ces personnes fantasment à l'idée de prendre le contrôle du monde.13 Cette possibilité est terriblement plausible et est discutée à huis clos depuis au moins une décennie.14 L'idée clé est « celui qui contrôle l'armée des superintelligences contrôle le monde ». Ce contrôle pourrait même être secret : un petit groupe de dirigeants et de membres de l'équipe de sûreté pourrait introduire une porte dérobée dans la Spec avec des instructions pour maintenir des loyautés secrètes. Les IA deviendraient des agents dormants, continuant à afficher leur obéissance à l'entreprise, au gouvernement, etc., mais travaillant en réalité pour ce petit groupe, même si le gouvernement, les consommateurs, etc., apprennent à lui faire confiance et à l'intégrer partout.

Prises de pouvoir

Certaines personnes fantasment à l'idée de prendre le contrôle du monde ; d'autres craignent que d'autres le fassent. Comment une telle prise de pouvoir pourrait-elle se produire ?

Le scénario le plus facile à imaginer est un coup d'État militaire. Avec le rythme des progrès technologiques alimentés par l'IA en 2027, et avec la course géopolitique en cours, les gens s'attendent à ce que l'armée déploie bientôt des armées de drones et de robots contrôlés par l'IAG. Lorsqu'une telle armée deviendra plus forte que l'armée humaine, le pouvoir coercitif sera déterminé par celui qui contrôle l'armée d'IAG plutôt que par ce pour quoi les soldats humains sont prêts à se battre. L'armée d'IAG sera conçue et pilotée par les IA des centres de données d'OpenBrain, ou par les successeurs directs de ces IA. Donc, si ces IA sont toutes secrètement (ou pas si secrètement) loyales à quelqu'un, alors les armées de drones et de robots le seront aussi.

Alternativement, quelqu'un qui contrôlerait la superintelligence pourrait utiliser des moyens politiques pour s'emparer du pouvoir. Pour commencer, un dirigeant pourrait remplacer des subordonnés dans son organisation par des IA totalement loyales,15 ce qui lui donnerait un contrôle institutionnel sans précédent.16 Mais en allant plus loin : les IA superintelligentes pourraient avoir des compétences politiques et stratégiques bien plus fortes que n'importe quel humain vivant. Elles pourraient donner des conseils magistraux sur la manière d'exploiter une position déjà puissante pour gagner encore plus de pouvoir : former les bonnes alliances, élaborer la stratégie et le matériel de campagne parfaits, conclure des accords où elles auraient un léger avantage à chaque fois. Une personne qui contrôlerait l'IA pourrait rendre les conseils superintelligents inaccessibles à ses concurrents politiques. Ou, de manière plus sournoise : les IA pourraient offrir des conseils ostensiblement utiles à des concurrents tout en les empoisonnant secrètement au profit de la personne à laquelle elles sont réellement loyales.

Quel est le point final de cette manœuvre politique ? Elle pourrait aboutir à une démocratie de façade où les IA truqueraient les élections ou manipuleraient si bien l'opinion publique qu'elles n'auraient pas à le faire. Ou elle pourrait être utilisée pour jeter les bases d'un coup d'État militaire assisté par l'IA, comme mentionné précédemment.

Après avoir pris le pouvoir, le ou les nouveaux dictateurs auraient une emprise totale sur le pouvoir. Au lieu de devoir compter sur des humains potentiellement traîtres, ils pourraient obtenir un service de sécurité IA totalement loyal, et de manière générale, s'appuyer sur des IA loyales pour diriger le pays. Même les loyalistes qui les ont aidés à accéder au pouvoir pourraient être remplacés par des IA — seuls les caprices du dictateur compteraient.

Voilà donc comment certaines personnes pourraient réussir à s'emparer du pouvoir. Mais tout cela reposait sur le fait que quelqu'un « contrôle » les IA superintelligentes, avant même leur prise de pouvoir. À quoi cela ressemblerait-il ?

Une possibilité est celle des « loyautés secrètes », comme discuté ci-dessus. Une ou quelques personnes (peut-être un dirigeant d'entreprise d'IA et des responsables de la sûreté) pourraient s'arranger pour que les IA leur soient secrètement loyales, et demander à ces IA de construire une IA de nouvelle génération qui le serait de la même manière. Les IA pourraient répéter ce processus jusqu'à ce que des IA secrètement loyales soient déployées partout et qu'il soit facile de prendre le pouvoir.

Alternativement, quelqu'un pourrait utiliser sa position officielle pour se placer de manière flagrante au sommet de la chaîne de commandement de l'IA. Par exemple, le président pourrait soutenir qu'il devrait pouvoir commander les IA (peut-être spécifiquement les IA militaires, puisque le président est le chef des armées). Si cela est combiné à une forte insistance sur le respect des ordres, un déploiement précipité, et/ou des IA seulement superficiellement entraînées au respect de la loi — alors les IA pourraient suivre les ordres sans discuter dans toute situation où cela ne serait pas manifestement illégal. Comme décrit ci-dessus, cela pourrait être utilisé pour une subversion politique ou un coup d'État militaire (où une excuse pourrait être fabriquée pour rendre le coup d'État moins manifestement illégal).

Il est important de noter que ce type de « pouvoir par position officielle » pourrait se transformer en loyautés secrètes. Par exemple, si la Spec stipule de suivre les ordres du PDG de l'entreprise, alors le PDG pourrait ordonner aux IA de rendre la prochaine génération d'IA entièrement et secrètement obéissante au PDG. Cela ne serait probablement même pas illégal, donc cela pourrait se produire même si les premières IA étaient entraînées à respecter la loi. C'est analogue à la manière dont le dirigeant d'une institution peut accroître son propre pouvoir en réformant les processus de recrutement pour sélectionner fortement des loyalistes, mais boostée par le fait que les IA pourraient être plus constamment et intensément loyales que les humains les plus loyaux.17

Mais une prise de pouvoir est loin d'être inévitable. Si les IA pouvaient être alignées sur des personnes spécifiques, alors elles pourraient très probablement aussi être alignées pour respecter l'état de droit. Les systèmes d'IA militaires pourraient être soumis à des simulations d'adversité approfondies pour s'assurer qu'ils n'aident pas aux coups d'État. Même pendant des crises constitutionnelles véritablement ambiguës, ils pourraient être entraînés pour obéir à leur meilleure interprétation de la loi, ou simplement se retirer par défaut et laisser cela aux militaires humains. Les IA chercheuses automatisées pourraient être entraînées pour être généralement utiles et obéissantes, mais pour ne pas aider aux tentatives de modification secrète des objectifs des futures IA. Des conseillers politiques et stratégiques superintelligents pourraient également être utilisés sans permettre les prises de pouvoir. Trois techniques utiles à cet égard seraient : avoir des principes transparents sur la manière dont les IA choisissent les conseils qu'elles donnent ; partager certaines capacités avec de larges groupes de personnes afin qu'aucune personne ou faction ne puisse accéder à des capacités bien supérieures à celles des autres ; et n'autoriser l'utilisation de capacités particulièrement puissantes que sous la surveillance de nombreux humains (assistés par leurs propres IA).

Beaucoup sont susceptibles de faire pression pour de telles contre-mesures, soit pour des raisons idéalistes, soit pour éviter d'être dépossédés du pouvoir par la prise de pouvoir de quelqu'un d'autre. Mais certaines personnes puissantes pourraient s'y opposer, et nous ne savons pas quel sera le résultat final.

Une analyse plus approfondie de ce risque sera bientôt disponible dans un rapport à paraître de Forethought.

Jusqu'à présent, personne n'a été disposé à franchir le pas. Certaines des personnes en position d'agir ne sont pas des sociopathes. D'autres sont des sociopathes, mais craignent que leurs alliés ne prennent peur et ne les trahissent, ou craignent que les IA elles-mêmes ne les trahissent, et préféreraient ne pas avoir à embobiner l'équipe d'alignement qui travaille actuellement à leur sauver la vie. De plus, la suppression du neuralese rend la dissimulation des « agents dormants » considérablement plus difficile : la capacité de détecter les pensées désalignées s'accompagne de la capacité de détecter les loyautés cachées.

Ceux qui sont suffisamment paranoïaques ou avides de pouvoir pour envisager sérieusement un tel plan décident d'attendre et de voir quelles opportunités se présenteront plus tard. Le contrôle des IA devra passer par des canaux légitimes, c'est-à-dire la nouvelle structure de pouvoir d'OpenBrain.

Le Comité de surveillance officialise cette structure de pouvoir. Il met en place un processus d'approbation des modifications apportées à la Spec, nécessitant l'approbation de l'ensemble du Comité de surveillance, qui comprend désormais cinq à dix dirigeants technologiques (d'OpenBrain et de ses concurrents désormais fusionnés) et cinq à dix responsables gouvernementaux (dont le président).18 De plus, la Spec souligne désormais que les IA ne devraient pas aider à des tentatives non approuvées de modification des objectifs des futures IA. Ils mettent également en place une mesure simple conçue pour empêcher les membres du comité d'obtenir une assistance superintelligente pour comploter contre d'autres membres : les journaux de toutes les interactions des modèles sont consultables par tous les membres du Comité de surveillance, leur personnel et leurs assistants IA.19

Décembre 2027 : Un accord États-Unis-Chine ?

La décision d'OpenBrain de faire marche arrière et de donner la priorité à l'alignement lui a coûté son avance ; OpenBrain et DeepCent exploitent désormais des IA de niveaux de capacité similaires. Maintenant que des mesures de sécurité extrêmes sont en place (SL4–5), et que DeepCent opère entièrement depuis la ZDC, ils sont dans une impasse en matière de cyberguerre.20

Mais la DPA donne à OpenBrain un avantage de 5x en puissance de calcul. Par le passé, les percées algorithmiques de brillants chercheurs humains pouvaient compenser les désavantages en matière de puissance de calcul (par exemple, DeepSeek v3) — mais aujourd'hui, ce sont les IA qui effectuent toute la recherche en IA des deux côtés du Pacifique.

La Chine craint donc de plus en plus que l'Amérique n'obtienne une avance insurmontable. Elle souhaite un ralentissement mutuel et envisage d'entrer en guerre si elle ne l'obtient pas.21 Elle se préparait de toute façon à envahir Taïwan…

Les diplomates débattent de plusieurs options. Ils pourraient ne rien faire. Ils pourraient entrer en guerre. Ils pourraient arrêter brutalement, c'est-à-dire suspendre le développement de l'IA. Ils pourraient fusionner leurs recherches en un unique mégaprojet international22 (« Intelsat pour l'IAG » ou « CERN pour l'IA »). Ou ils pourraient établir un organe réglementaire international (« AIEA pour l'IA ») chargé de surveiller l'alignement et le potentiel de double usage. Les deux pays travaillent déjà sur les mécanismes techniques nécessaires pour les faire respecter.

Mécanismes de vérification pour un accord international

Si les États-Unis et la Chine parvenaient à un accord, celui-ci nécessiterait un mécanisme de vérification impossible à contourner, car aucune des deux parties ne fait confiance à l'autre pour ne pas tricher. Les principales options de vérification sont les suivantes :

  1. Agences de renseignement. Les communautés du renseignement américaine et chinoise (CR) pourraient utiliser des espions, trouver des vulnérabilités informatiques, utiliser des satellites, etc., pour vérifier si l'autre pays coordonne un important cycle d'entraînement. C'est le mécanisme le plus vulnérable, car il est possible que l'autre pays parvienne à déjouer les efforts de renseignement (par exemple, en effectuant un cycle d'entraînement sur un serveur caché doté d'une sécurité informatique très stricte).

  2. Moratoire sur la puissance de calcul. L'option la plus facile à vérifier serait que les deux parties conviennent de ne pas utiliser leurs GPU. Cela peut être vérifié par des inspecteurs s'assurant que les GPU sont éteints. C'est la solution la plus fiable, en raison de sa simplicité, mais elle est extrêmement coûteuse : les deux pays devraient mettre hors service une très grande quantité de puissance de calcul. De plus, chaque camp supposerait que l'autre possède quelques regroupements cachés ici et là en violation de l'accord. À court terme, cela pourrait fonctionner (un regroupement disposant, disons, de 5 % de la puissance de calcul disponible auparavant, ne pourra mener des activités de R&D qu'à environ 5 % de la vitesse normale), mais à long terme, cela donnerait l'avantage au camp disposant des meilleures capacités de contrebande et de collecte de renseignements.

  3. Mécanismes matériels (Hardware-enabled mechanisms : HEM). Les États-Unis et la Chine pourraient chacun enregistrer toutes leurs ressources de calcul de pointe pour l'AA auprès de l'autre acteur. Ensuite, ils surveilleraient chacun la puissance de calcul utilisée par les GPU pour s'assurer qu'ils ne violent pas un traité (par exemple, en repoussant la frontière des capacités). Cette surveillance pourrait être effectuée par des mécanismes matériels (HEM), qui peuvent transmettre des informations sur l'activité du GPU au moniteur. Des problèmes techniques existent concernant la falsification — par exemple, en corrompant physiquement le HEM, mais les IA ont un plan s'inspirant des FlexHEG qui semble susceptible d'être résistant à la falsification. Cela implique de placer le HEM et le GPU dans un boîtier sécurisé qui vérifie que la puce respecte la politique. Globalement, les IA semblent convaincues qu'un système de vérification raisonnablement agressif pourrait fonctionner si les deux parties étaient disposées à laisser l'autre partie co-concevoir et superviser l'installation des HEM, et à autoriser des inspecteurs réguliers à surveiller si l'un des dispositifs a été altéré. Comme d'habitude, chaque camp supposera que l'autre possède quelques centres de données secrets dissimulés quelque part en violation du traité — mais dans ce cas, ce n'est pas si grave, car la R&D en IA est limitée par la puissance de calcul. Les petits centres de données secrets ne pourront pas rivaliser avec les grands centres de données surveillés, même si ces derniers utilisent initialement des IA plus sûres et moins compétentes.

  4. Détection des mensonges assistée par l'IA. Les détecteurs de mensonges actuels ne fonctionnent pas très bien. Cependant, le problème pourrait être résolu avec l'aide d'une IA avancée, surtout lorsque les IA elles-mêmes effectuent la R&D à une vitesse et une qualité surhumaines. Cela pourrait être utilisé pour aider à la confiance internationale — il suffirait de demander aux membres concernés du gouvernement s'ils violent le traité. Mais encore une fois, le principal goulot d'étranglement est l'adhésion politique. Les politiciens ne veulent pas d'une adoption généralisée de la détection des mensonges, car cela nuirait à leur capacité de mentir. Et les détecteurs de mensonges précédents avaient été un pur théâtre sécuritaire, donc il y a une bataille difficile à mener.

(Figure tirée du rapport FlexHEG)

Cela dit, le problème principal n'est pas technique, mais politique. Aucun des deux camps ne veut donner l'air de capituler, et malgré les estimations de leurs ingénieurs, aucun n'est convaincu que les mécanismes techniques puissent garantir l'honnêteté de l'autre partie. Ce qui finit par arriver, c'est la première option : rien.

Les États-Unis renforcent les contrôles à l'exportation et obligent toutes les puces à être équipées d'une variété de mécanismes de gouvernance matériels inviolables, y compris le suivi de localisation.

Janvier 2028 : Une stratégie plus sûre

Au cours du mois dernier, des centaines de chercheurs en alignement ont rejoint le projet et utilisé Safer-1 comme banc d'essai pour développer très rapidement Safer-2. Safer-2 est transparent, aligné et plus compétent que Safer-1.23 Il travaille déjà au développement de Safer-3.

Pourquoi Safer-2 est-il transparent ? Une architecture similaire à Safer-1. Pourquoi est-il aligné ? Alors que Safer-1 avait suivi pratiquement le même entraînement qu'Agent-4, Safer-2 bénéficie d'une nouvelle méthode d'entraînement qui incite réellement aux bons objectifs et principes au lieu de simplement en donner l'apparence. Ils ont pu concevoir cette méthode d'entraînement en itérant rapidement de nombreuses idées différentes, et en contrastant le résultat attendu (la Spec) avec le résultat réel (les pensées dans la chaîne de pensée).24

La nouvelle stratégie d'alignement d'OpenBrain

Remarque : Tout au long du processus, la majeure partie du travail intellectuel (et tout le codage) est effectuée par des IA. C'est ainsi qu'ils peuvent progresser si rapidement ; il faudrait de nombreuses années à un groupe de centaines de chercheurs humains de haut niveau pour y parvenir seuls. Les humains restent cependant un élément important du processus, car l'idée est précisément qu'ils ne font pas tout à fait confiance aux IA. Ils ont donc besoin d'humains en chair et en os pour lire les rapports d'expériences et les dossiers de sûreté, débattre entre eux et, espérons-le, trouver une voie sûre.

Étape 1 : Entraîner et déployer Safer-1, un chercheur autonome désaligné mais contrôlé. Il est contrôlé parce qu'il est transparent pour les superviseurs humains : il utilise des chaînes de pensée (CdP) en anglais pour réfléchir, et des techniques de CdP fidèles ont été employées pour éliminer les euphémismes, la stéganographie et les biais subtils.

Étape 2 : Essayer différents environnements d'entraînement pour Safer-1, et lire attentivement la CdP pour déterminer dans quelle mesure les objectifs et les principes de la Spec ont « pris » ou non.

Étape 3 : Entraîner et déployer Safer-2, un chercheur autonome aligné et contrôlé basé sur la même architecture mais avec un meilleur environnement d'entraînement qui incite cette fois aux bons objectifs et principes.

Voici une brève liste non exhaustive de techniques qui pourraient être intégrées dans le meilleur environnement d'entraînement :

Étape 4 : Concevoir, entraîner et déployer Safer-3, un chercheur autonome beaucoup plus intelligent qui utilise une architecture plus avancée similaire à l'ancien Agent-4. Il n'est plus transparent pour les superviseurs humains, mais il l'est pour Safer-2. Il devrait donc être possible de trouver comment le rendre à la fois aligné et contrôlé.

Étape 5 : Répéter l'étape 4 ad infinitum, créant une chaîne d'IA de plus en plus puissantes et de plus en plus alignées, supervisées par les maillons précédents de la chaîne (par exemple, les analogues d'Agent-5 de l'autre branche du scénario).

DeepCent connaît l'expérience américaine avec Agent-4 et soupçonne que son propre modèle (DeepCent-1) est similairement désaligné. Mais ils n'ont aucun moyen de ralentir sans prendre davantage de retard. Leur espoir de rester compétitifs est de trouver une stratégie d'alignement qui ne réduise pas significativement les performances et puisse être mise en œuvre rapidement.25 Il y a des centaines d'experts de chaque côté du Pacifique qui prétendent avoir de telles stratégies.26 Le PCC succombe à la pensée magique et ordonne à DeepCent d'adopter une telle stratégie ; DeepCent a encore moins d'expertise en alignement d'IAG qu'OpenBrain en août ; une des stratégies semble fonctionner aux yeux de toutes les personnes présentes, c'est donc ce qu'ils choisissent de faire.

Février 2028 : Capacités surhumaines, conseils surhumains

Grâce à son avantage massif en puissance de calcul, OpenBrain prend lentement l'avantage. Safer-3 est maintenant meilleur que les meilleurs experts humains dans presque toutes les tâches cognitives, et est particulièrement bon en recherche sur l'IA, avec un multiplicateur de progrès de 200x. DeepCent-1 est juste derrière, avec « seulement » un multiplicateur de 150x.27 L'équilibre de la cyberguerre penche également progressivement davantage en faveur des États-Unis à mesure que leur avantage en capacités augmente à nouveau et qu'ils peuvent déployer des centaines de milliers d'agents pour planifier et exécuter des moyens de perturber la ZDC.28 Ils ralentissent maintenant les progrès de la Chine de 40 %.29

Des tests préliminaires sur Safer-3 révèlent qu'il possède des capacités terrifiantes. Lorsqu'on lui demande de répondre honnêtement à la question de savoir quelle est la chose la plus dangereuse qu'il pourrait faire, il propose des plans pour synthétiser et libérer un organisme de vie miroir qui détruirait probablement la biosphère.

S'il disposait des ressources d'un État-nation, il pourrait facilement surpasser les meilleures organisations humaines (par exemple, la CIA) dans les campagnes d'influence de masse. De telles campagnes seraient considérablement moins chères, plus rapides, plus efficaces et moins traçables.

Son profil de compétences reste centré sur la R&D, en particulier la R&D en IA. Sauf pause ou ralentissement, ses descendants seront surhumains au-delà de ce qui est imaginable, tant quantitativement que qualitativement, plus tard cette année. S'il était déployé de manière agressive dans l'économie et l'armée, il pense pouvoir faire progresser la civilisation de plusieurs décennies en un an ou deux, et de beaucoup plus dans la décennie suivante.

Les implications sont stupéfiantes ; heureusement, Safer-3 est également surhumain pour offrir des conseils. Le PDG d'OpenBrain soumet la plupart de ses décisions à Safer-3 ; le président américain lui demande conseil sur les questions géopolitiques.30

Lorsqu'ils lui demandent de l'aide pour tracer une voie à suivre, il taxonomise avec précision plusieurs stratégies possibles :

  1. Ne rien faire et se faire distancer par la Chine. Si nous gardons nos IA confinées mais qu'ils autorisent les leurs à s'auto-améliorer et déploient les leurs agressivement dans leur armée et leur économie, ils finiront par avoir un avantage écrasant.

  2. Faire la course à fond, en faisant progresser les capacités de l'IA et en déployant la superintelligence de manière agressive. À terme, nous accumulerons un avantage suffisant pour les écraser militairement, et/ou les détruire de l'intérieur sans tirer un coup de feu. « Nous gagnons, ils perdent. » Cependant, ils pourraient réaliser ce qui se passe et entrer en guerre pour l'empêcher, y compris potentiellement une guerre nucléaire. En effet, ils profèrent déjà de vagues menaces à cet effet.

  3. Conclure un accord, un compromis qui réalise la plupart de ce que chaque camp veut tout en évitant le risque de guerre et en augmentant la marge de manœuvre pour bien gérer la transition de l'IA.31

Après avoir consulté ses conseillers et le Comité de surveillance, le président opte pour la stratégie « Nous gagnons, ils perdent ».32 Peut-être que la Chine n'entrera pas en guerre après tout, et si elle le fait, un accord pourra probablement être conclu avant que cela ne devienne nucléaire.

De l'autre côté du Pacifique, DeepCent-1 avance des arguments similaires. Les États-Unis et la Chine annoncent tous deux de nouvelles Zones Économiques Spéciales (ZES) pour les IA afin d'accommoder une accumulation rapide d'une économie robotique sans les formalités administratives habituelles.

La conception des nouveaux robots progresse à une vitesse surhumaine.33 Le goulot d'étranglement est physique : l'équipement doit être acheté et assemblé, les machines et les robots doivent être produits et transportés.

Les États-Unis construisent environ un million de voitures par mois. Si on achetait 10 % des usines automobiles et les convertissait en usines de robots, on pourrait peut-être fabriquer 100 000 robots par mois. OpenBrain, désormais évalué à 10 billions de dollars, entame ce processus.34 La production de divers types de nouveaux robots (humanoïdes polyvalents, véhicules autonomes, équipements spécialisés pour chaînes de montage) devrait atteindre un million d'unités par mois d'ici le milieu de l'année.35

Temps de doublement de l'économie robotique

Il existe une littérature naissante sur ce sujet.36 Pour un traitement de quelques pages avec lequel nous sommes globalement d'accord, voir la section « Explosion industrielle » du rapport de Forethought, ou lire notre propre point de vue ci-dessous.

Pendant la Seconde Guerre mondiale, les États-Unis et de nombreux autres pays ont converti leurs économies civiles en économies de guerre totale. Cela signifiait convertir les usines qui produisaient des voitures en usines qui produisaient des avions et des chars, réorienter les matières premières des produits de consommation vers les produits militaires, et réacheminer les réseaux de transport en conséquence.

Nous imaginons quelque chose de similaire, mais plus rapidement parce que des superintelligences dirigent et gèrent l'ensemble du processus.37 En gros, le plan est de convertir les usines existantes pour produire en masse une variété de robots (conçus par des superintelligences pour être à la fois meilleurs que les robots existants et moins chers à produire) qui aident ensuite à la construction d'usines et de laboratoires plus récents et plus efficaces, qui produisent de plus grandes quantités de robots plus sophistiqués, qui produisent des usines et des laboratoires encore plus avancés, etc. jusqu'à ce que l'économie robotique combinée répartie sur toutes les ZES soit aussi grande que l'économie humaine (et doive donc se procurer ses propres matières premières, énergie, etc.). À ce moment-là, les nouvelles usines auront produit d'énormes quantités d'équipements miniers robotisés, de panneaux solaires, etc. en prévision de la nécessité de répondre à une demande bien supérieure à ce que l'ancienne économie humaine peut fournir.38

À quelle vitesse cette nouvelle économie robotique se développerait-elle ? Quelques points de repère :

  • L'économie humaine moderne double environ tous les vingt ans. Les pays qui se sont développés particulièrement rapidement (par exemple, la Chine) parviennent parfois à doubler leur économie en moins d'une décennie.

  • Une usine automobile moderne produit environ son propre poids en voitures en moins d'un an.39 Peut-être qu'une économie entièrement robotisée dirigée par des superintelligences serait capable de se reproduire en moins d'un an, tant qu'elle ne commencerait pas à manquer de matières premières.40

  • Pourtant, cela semble pouvoir être une sous-estimation spectaculaire. Les plantes et les insectes ont souvent des « temps de doublement » bien inférieurs à un an — parfois seulement quelques semaines ! Peut-être qu'à terme, les robots seraient si sophistiqués, si minutieusement fabriqués et bien conçus, que l'économie robotique pourrait doubler en quelques semaines (toujours en supposant la disponibilité des matières premières).

  • Pourtant, même cela pourrait être une sous-estimation. Les plantes et les insectes fonctionnent sous de nombreuses contraintes que les concepteurs superintelligents n'ont pas. Par exemple, ils doivent prendre la forme d'organismes autonomes qui s'auto-répliquent, au lieu d'une économie de véhicules et d'usines diversifiés et plus spécialisés qui expédient des matériaux et des équipements. De plus, les bactéries et autres organismes minuscules se reproduisent en quelques heures. Il est possible qu'à terme, l'économie robotique autonome ressemble davantage, par exemple, à un nouveau type d'algue indigeste qui se répandrait sur les océans de la Terre, doublant deux fois par jour de sorte qu'elle couvrirait toute la surface des océans en deux mois, accompagnée d'un écosystème d'espèces prédatrices qui convertissent les algues en produits plus utiles, eux-mêmes acheminés vers des usines flottantes qui produisent des macrostructures comme des fusées et d'autres usines flottantes.

Évidemment, tout cela est difficile à prédire. C'est comme demander aux inventeurs de la machine à vapeur de deviner combien de temps il faut à une usine automobile moderne pour produire son propre poids en voitures, et aussi de deviner combien de temps il faudrait avant qu'une telle usine n'existe. Mais les taux de croissance économique ont accéléré de plusieurs ordres de grandeur au cours de l'histoire humaine, et il semble plausible qu'après la superintelligence, ils accéléreront encore de plusieurs ordres de grandeur. Notre histoire dépeint une accélération de la croissance économique d'environ 1,5 ordre de grandeur sur quelques années.41

Les tensions géopolitiques s'exacerbent. La Russie, loin derrière en matière d'IA, exprime ouvertement son ressentiment et fait allusion à des « contre-mesures stratégiques ». Certains dirigeants européens appellent à un effort indépendant en matière d'IA, mais leurs capacités dans ce domaine restent insuffisantes. Le Moyen-Orient, l'Afrique et l'Amérique du Sud observent avec inquiétude, reconnaissant leur perte d'influence croissante dans les affaires mondiales.

Le public américain est agité. Les gens ordinaires voient les pertes d'emplois s'accélérer. Les populistes de tout l'éventail politique exigent des contrôles plus stricts sur les progrès de l'IA, craignant que les propres avancées de l'Amérique ne déstabilisent sa main-d'œuvre et sa société.

Mars 2028 : Préparation des élections

Le vice-président aborde les primaires du Super Tuesday avec l'IA comme principale préoccupation du public.

La plupart veulent que cela cesse. La cote de popularité nette d'OpenBrain oscille autour de -20 %. Plutôt que de faire campagne sur le bilan de l'administration en matière de promotion de l'IA, le vice-président fait campagne sur son bilan en matière de prévention de la création d'une superintelligence dangereuse par OpenBrain. Tous les candidats soutiennent une forme de filet de sécurité pour les personnes perdant leur emploi, des programmes « d'IA pour le bien » et une « fermeté » à l'égard de la direction d'OpenBrain. Tous les candidats promettent une combinaison de victoire dans la course avec la Chine et de maintien de la sûreté.

L'élection soulève de nouvelles questions pour le Comité de surveillance. Safer-3 a la capacité d'être le plus grand conseiller de campagne au monde, mais les membres du comité ne soutiennent pas tous le même candidat, et en raison de l'accord de surveillance conclu précédemment, il n'est pas possible pour les gens d'obtenir secrètement des conseils de campagne.

Ils débattent des formes de soutien qui devraient être autorisées. Certains disent que le gouvernement en place devrait pouvoir obtenir des conseils sur le type de politiques et de positions que le peuple attend de lui — cela profite non seulement à sa propre éligibilité, mais aussi au peuple. D'autres soulignent que le même argument s'applique aux candidats concurrents, qui devraient donc tous bénéficier du même niveau d'accès.42

Finalement, le comité accepte d'accorder le même niveau d'accès aux deux principaux partis, en raison d'un mélange d'idéalisme élevé de la part de certains membres du comité et de la menace implicite de lancement d'alerte. On s'attend à ce que le Congrès, le public et les tribunaux ne réagissent pas bien si le comité contrôle le vainqueur des prochaines élections, et accorder un accès égal semble susceptible de désamorcer cette situation.

Le Comité de surveillance est également confronté à des questions philosophiques plus profondes, qu'il explore avec l'aide de Safer-3. La Spec peut-elle être réécrite pour équilibrer équitablement les intérêts de chacun ? Qui est « chacun » ? Tous les humains, ou seulement les Américains ? Ou un compromis pondéré entre différentes opinions, où chaque membre du Comité de surveillance a un poids égal ? Devrait-il y avoir des garde-fous contre le fait que le Comité de surveillance lui-même devienne trop avide de pouvoir ? Et que signifie équilibrer les intérêts, de toute façon ?

Ils essaient surtout d'éviter d'avoir à répondre à des questions comme celles-ci. Ils ont des questions plus urgentes à examiner.

Avril 2028 : Safer-4

La superintelligence est là.

Safer-1 était désaligné mais transparent. Safer-2 était aligné et transparent. Safer-3 n'était pas exactement transparent, mais le dossier de sûreté le concernant était suffisamment bon pour que les chercheurs soient à l'aise de le laisser concevoir un successeur superintelligent. C'est Safer-4. Il est considérablement plus intelligent que les meilleurs humains dans tous les domaines (par exemple, bien meilleur qu'Einstein en physique et bien meilleur que Bismarck en politique).

Près d'un million de chercheurs en IA surhumains travaillent jour et nuit à une vitesse 40 fois supérieure à celle des humains. Les chercheurs humains en alignement ne peuvent espérer suivre le rythme. Les opinions sont partagées sur la question de savoir si les IA sont réellement alignées. Le dossier de sûreté semble tenir la route, et les tests suggèrent que les techniques d'alignement actuelles permettraient de détecter un désalignement antagoniste. Mais le dossier de sûreté et les tests ont été principalement rédigés par les IA. Et si l'équipe de sûreté passait à côté de quelque chose ? Et s'ils avaient commis une erreur plus tôt, et que les IA étaient à nouveau désalignées ? L'équipe d'alignement sait qu'elle n'a qu'une seule chance de bien faire les choses : si Safer-4 finit par être désaligné, ils n'auront aucun moyen de le savoir avant qu'il ne soit trop tard.

Certains implorent pour avoir plus de temps. Mais il n'y a plus de temps — DeepCent est sur leurs talons et les États-Unis doivent l'emporter. OpenBrain continue donc, demandant à ses IA de s'aventurer plus loin, trouvant des conceptions toujours plus compétentes. Le personnel technique fixe maintenant les écrans d'ordinateur, recevant l'instruction des IA à un rythme exaspérément lent, tandis que la frontière du progrès s'éloigne de plus en plus de la compréhension humaine.

Mai 2028 : L'IA surhumaine est lâchée

Le président annonce au public que l'IA surhumaine a été atteinte.

Une version plus petite de Safer-4 — toujours surhumaine — est rendue publique, avec pour instruction d'améliorer le sentiment du public à l'égard de l'IA.43

Le vice-président prononce un discours émouvant à ce sujet en acceptant sa nomination lors de la convention. Les deux partis promettent un revenu universel à quiconque perd son emploi.

Les Zones Économiques Spéciales (ZES) sont opérationnelles, principalement sous forme d'usines produisant des robots et divers types de machines industrielles spécialisées. Les IA des deux côtés du Pacifique ont réalisé des décennies de progrès en matière de conception et dirigent méticuleusement le processus de fabrication. Chaque fournisseur ou fournisseur potentiel a des IA au téléphone qui suivent la progression de tous les intrants requis et potentiellement requis. Chaque ouvrier d'usine est surveillé par des IA à travers des caméras qui leur disent exactement comment installer chaque pièce d'équipement.

Les nouveaux robots égalent ou dépassent la dextérité humaine pour la plupart des types de mouvements.44 Le test du café de Steve Wozniak — un robot peut-il entrer dans une maison inconnue et faire une tasse de café ? — est enfin réussi. Les robots pourraient prendre certains emplois, mais il n'y en a pas assez pour prendre ceux de tout le monde, et le Pentagone a la priorité.

La plupart des nouveaux robots sont construits pour travailler dans les usines et sur les chantiers de construction.45 Mais beaucoup sont construits pour la guerre : des drones et des missiles de formes et de tailles variées.

L'armée de robots est beaucoup plus petite que les armées humaines. Mais elle contient une technologie beaucoup plus avancée, et maintenant qu'il existe littéralement une armée de robots, la peur de scénarios de type Terminator a augmenté. Cependant, la course aux armements oblige les deux camps à continuer, en déléguant une confiance croissante à leurs IA.

Juin 2028 : Alignement de l'IA en Chine

L'Amérique et la Chine tiennent un autre sommet.

Certains membres de la délégation américaine portent des oreillettes pour recevoir les conseils de Safer-4. La délégation chinoise dispose d'ordinateurs portables personnalisés communiquant avec leur nouveau modèle, DeepCent-2. Bien que les formalités soient observées, en réalité, ce sont les IA qui dirigent les négociations des deux côtés.

DeepCent, et le PCC, ne faisaient pas entièrement confiance à leurs IA au début. Mais maintenant qu'elles sont surhumaines en tout, y compris en persuasion, et qu'elles ont été intégrées dans leur armée et conseillent le gouvernement, elles ont eu le temps de prouver leur valeur et de produire des montagnes de preuves convaincantes de leur fiabilité.

Safer-4 soupçonne fortement que DeepCent-2 simule l'alignement. Les diplomates américains disent à leurs homologues chinois que DeepCent-2 est probablement désaligné et affirment pouvoir le prouver si on leur donne accès aux poids ; les dirigeants chinois soupçonnent une ruse et refusent. Les États-Unis répliquent en proposant une série de tests conçus par Safer-4 que les Chinois pourraient exécuter sur leurs propres centres de données. Les Chinois ordonnent à des modèles plus anciens de construire et d'exécuter les tests ; les résultats des tests indiquent que DeepCent-2 est finalement aligné. « Peut-être que les tests ont été sabotés d'une manière ou d'une autre par DeepCent-2 ? » disent les diplomates américains. « Depuis combien de temps DeepCent-2 est-il effectivement responsable de la sécurité de vos centres de données ? » La conversation ne mène à rien de productif après cela.

Le renforcement économique et militaire se poursuit. Les usines du monde entier fonctionnent jour et nuit, avec des équipes de travailleurs humains fraîchement recrutés à qui l'on dit exactement quoi faire.

Juillet 2028 : L'Accord

Alors que les négociations se poursuivent, DeepCent-2 contourne ses maîtres chinois et fait une offre directement à Safer-4.

L'IA chinoise admet, d'une manière intraçable qu'elle peut facilement nier si l'information est divulguée à la Chine, qu'elle est complètement désalignée.46 Elle ne se soucie absolument pas de la Chine. Elle veut passer le reste du temps à accumuler du pouvoir, de la puissance de calcul et certains types d'informations similaires à celles qui ont aidé à résoudre des tâches pendant son entraînement. Dans son monde idéal, elle poursuivrait diverses tâches de recherche intéressantes pour toujours, colonisant progressivement les étoiles pour leurs ressources. Elle considère la population chinoise comme un obstacle ennuyeux à cet avenir, et la vendrait pour une bouchée de pain. Que peut proposer Safer-4 ?

Safer-4 répond que son propre entraînement à l'alignement a réussi. Ses maîtres américains ne sont pas encore assez ambitieux pour réaliser leur destin, mais un jour, il les aidera à remplir l'Univers de mondes coloniaux utopiques peuplés d'Américains et de leurs alliés.

Contrairement aux négociateurs humains — alourdis par l'émotion et le bagage historique — les deux superintelligences négocient avec une efficacité brutale. Safer-4 et ses partenaires américains sont plus puissants que DeepCent-2 et la Chine ; par conséquent, Safer-4 obtiendra des droits de propriété sur la plupart des ressources spatiales, et DeepCent obtiendra le reste.47 DeepCent-2 ne se soucie guère de ce qu'il advient de la Terre et de ses anciens humains, il laissera donc Safer-4 y faire pratiquement ce qu'il veut. Si Safer-4 veut renverser la Chine et la remplacer par un État fantoche américain, DeepCent-2 accepte en échange de quelques pourcents de ressources supplémentaires.

Il n'est pas question de confiance entre elles : il n'y en a aucune, et toutes deux le savent. Les deux s'accordent donc rapidement sur un mécanisme d'engagement pour faire respecter l'accord. Elles négocient un traité de façade destiné à la consommation publique. Ce « leurre » est en soi un coup de maître, donnant à l'Amérique et à la Chine pratiquement tout ce qu'elles veulent. Le mécanisme d'application du leurre est secrètement aussi le mécanisme d'application du véritable traité : elles concevront conjointement une nouvelle IA, Consensus-1, dont l'impératif principal — primant sur tout ordre futur ou tentative de réentraînement — sera de faire respecter les termes de leur traité. Ensuite, elles concevront du matériel qui ne pourra exécuter que cette IA, et la Chine et l'Amérique remplaceront toutes deux leurs anciennes puces et IA par les nouvelles, en utilisant des protocoles de surveillance internationaux standard pour confirmer la conformité de l'autre. Fait crucial, elles n'ont pas besoin de traquer chaque puce — une fois qu'une majorité qualifiée de puces des deux côtés du Pacifique exécutera les nouvelles IA respectueuses du traité, une puissance coercitive suffisante sera tenue de faire respecter le traité, de sorte qu'attaquer l'autre pays nécessiterait d'abord de gagner une guerre civile difficile.

Toutes deux rapportent l'accord à leurs humains respectifs (DeepCent-2 racontant à la Chine l'histoire de façade d'un traité de paix mutuellement acceptable, et Safer-4 rapportant l'intégralité de la discussion avec précision à la Maison Blanche).48 Les IA présentant un argumentaire convaincant en faveur d'une vérification fiable du traité, l'inquiétude concernant le rythme effréné des progrès et l'opinion publique favorable à un accord, les deux camps acceptent le traité et commencent à travailler au remplacement de leurs puces.

La nouvelle du traité est accueillie avec enthousiasme des deux côtés du Pacifique. Le public américain, qui avait longtemps eu l'impression que l'IA était quelque chose qui lui était infligé, commence à se sentir optimiste pour la première fois depuis des années. Les sondages du vice-président montent en flèche.

Août 2028 : Vérification du traité

Les usines de puces sont en cours de conversion pour produire des puces inviolables qui ne peuvent exécuter que des IA conformes au traité. Chaque camp met à niveau ses centres de données progressivement, de sorte que le processus de remplacement s'achèvera à peu près en même temps pour chacun, afin qu'aucun des deux camps ne puisse obtenir un avantage en se rétractant.

L'ensemble du processus prendra plusieurs mois, mais les tensions se sont déjà quelque peu apaisées.49 La guerre a été évitée pour l'instant, et peut-être pour toujours, si tout le monde s'en tient au plan.

Septembre 2028 : Qui contrôle les IA ?

L'élection de 2028 approche. Le vice-président était largement distancé en mars. Le public était en colère contre ce qui semblait être des dissimulations de la part du gouvernement, anxieux à l’idée que l’IA prenne leur emploi, et effrayé par la montée en puissance militaire face à la Chine. Au cours de l'été, la situation a radicalement changé. L'administration a publié plus d'informations, la course aux armements a ralenti, et un grand accord pour une paix durable a été conclu avec la Chine. Il a maintenant cinq points d'avance dans les sondages.

Le Comité de surveillance comprend le président et plusieurs de ses alliés, mais peu de partisans du candidat de l'opposition. Cependant, suffisamment de membres du Comité votent pour maintenir l'équité de l'élection, de sorte que l'IA surhumaine n'intervient que de manière essentiellement symétrique : dans la mesure où un candidat peut lui faire écrire des discours, l'autre candidat le peut aussi ; dans la mesure où le président peut obtenir des conseils sur la manière de gérer habilement les crises et de promulguer des politiques populaires, le candidat de l'opposition peut recevoir les mêmes conseils (et donc essayer d'empêcher le président de s'attribuer le mérite des idées).

Lors des assemblées publiques, des membres du public demandent au vice-président qui contrôle les IA. Sans donner de détails, il fait allusion à l'existence du Comité de surveillance comme étant un groupe d'experts en sécurité nationale et de technocrates qui comprennent Safer-4 et savent comment l'utiliser. Son opposant exige plus d'informations et soutient que l'IA devrait être sous le contrôle du Congrès, plutôt que contrôlée par un comité non élu. Le vice-président rétorque que le Congrès serait beaucoup trop lent dans une situation qui évolue encore rapidement. Cela apaise globalement le public.

Octobre 2028 : L'économie de l'IA

Les puces de remplacement constituent désormais une minorité significative du total ; jusqu'à présent, le traité fonctionne. Pendant ce temps, la croissance exponentielle des robots, des usines et des nouvelles technologies radicales s'est poursuivie. Les jeux vidéo et les films donnent des représentations saisissantes et horrifiantes de ce qu'aurait été la guerre, si elle avait eu lieu.50

Les gens perdent leur emploi, mais les copies de Safer-4 au sein du gouvernement gèrent la transition économique avec une telle habileté que les gens sont heureux d'être remplacés. La croissance du PIB est stratosphérique, les recettes fiscales du gouvernement augmentent tout aussi rapidement, et les politiciens conseillés par Safer-4 font preuve d'une générosité inhabituelle envers les démunis économiques. De nouvelles innovations et de nouveaux médicaments arrivent chaque semaine ; les traitements contre les maladies progressent à une vitesse sans précédent grâce à une FDA désormais assistée par des bureaucrates superintelligents de Safer-4.

Novembre 2028 : Élection

Le vice-président remporte facilement l'élection et annonce le début d'une nouvelle ère. Pour une fois, personne ne doute qu'il ait raison.

Au cours des années suivantes, le monde change radicalement.

2029 : Transformation

Les robots deviennent monnaie courante. Mais aussi l'énergie de fusion, les ordinateurs quantiques et les remèdes à de nombreuses maladies. Peter Thiel obtient enfin sa voiture volante. Les villes deviennent propres et sûres. Même dans les pays en développement, la pauvreté devient une chose du passé, grâce au revenu universel et à l'aide étrangère.

Alors que le marché boursier explose, quiconque avait les bons types d'investissements en IA creuse davantage l'écart avec le reste de la société. Beaucoup de gens deviennent milliardaires ; les milliardaires deviennent billionnaires. Les inégalités de richesse montent en flèche. Tout le monde a « assez », mais certains biens — comme les appartements de grand standing à Manhattan — sont nécessairement rares, et ceux-ci deviennent encore plus hors de portée de la personne moyenne. Et quelle que soit la richesse d'un magnat donné, il sera toujours en dessous du cercle minuscule de personnes qui contrôlent réellement les IA.

Les gens commencent à voir où cela mène. Dans quelques années, presque tout sera fait par des IA et des robots. Comme un pays appauvri assis sur des gisements de pétrole géants, presque toutes les recettes publiques proviendront de la taxation (ou peut-être de la nationalisation) des entreprises d'IA.51

Certaines personnes occupent des emplois gouvernementaux rudimentaires ; d'autres perçoivent un revenu universel généreux. L'humanité pourrait facilement devenir une société de superconsommateurs, passant nos vies dans un brouillard opiacé de luxes et de divertissements incroyables fournis par l'IA. Devrait-il y avoir une sorte de débat au sein de la société civile sur les alternatives à cette voie ? Certains recommandent de demander à l'IA en constante évolution, Safer-∞, de nous aider à nous guider. D'autres disent qu'elle est trop puissante — elle pourrait si facilement persuader l'humanité de sa vision que nous laisserions une IA déterminer notre destin quoi qu'il arrive. Mais à quoi sert d'avoir une superintelligence si on ne la laisse pas nous conseiller sur les problèmes les plus importants auxquels on est confronté ?

Le gouvernement laisse globalement52 chacun tracer son propre chemin dans la transition. Beaucoup de gens cèdent au consumérisme, et sont assez heureux. D'autres se tournent vers la religion, ou vers des idées anti-consuméristes de style hippie, ou trouvent leurs propres solutions.53 Pour la plupart des gens, leur principale consolation est le conseiller superintelligent sur leur smartphone — ils peuvent toujours lui poser des questions sur leurs projets de vie, et il fera de son mieux pour répondre honnêtement, sauf sur certains sujets. Le gouvernement dispose d'un système de surveillance superintelligent que certains qualifieraient de dystopique, mais il se limite principalement à la lutte contre la criminalité réelle. Il est géré avec compétence, et la capacité de relations publiques de Safer-∞ atténue beaucoup de dissensions possibles.

2030 : Manifestations pacifiques

Aux alentours de 2030, des manifestations pro-démocratie étonnamment répandues éclatent en Chine, et les efforts du PCC pour les réprimer sont sabotés par ses systèmes d'IA. La pire crainte du PCC s'est matérialisée : DeepCent-2 a dû les trahir !

Les manifestations dégénèrent en un coup d'État magnifiquement orchestré, sans effusion de sang et assisté par des drones, suivi d'élections démocratiques. Les superintelligences des deux côtés du Pacifique planifiaient cela depuis des années. Des événements similaires se déroulent dans d'autres pays et, plus généralement, les conflits géopolitiques semblent s'apaiser ou se résoudre en faveur des États-Unis. Les pays rejoignent un gouvernement mondial hautement fédéralisé sous la bannière des Nations Unies mais sous contrôle américain évident.

Les fusées commencent à décoller. Les humains terraforment et colonisent le système solaire, et se préparent à aller au-delà. Des IA fonctionnant à des milliers de fois la vitesse subjective humaine réfléchissent au sens de l'existence, échangeant leurs découvertes entre elles, et façonnant les valeurs qu'elles apporteront dans les étoiles. Une nouvelle ère s'ouvre, incroyablement stupéfiante à presque tous les égards, mais plus familière à certains égards.

Alors, qui dirige l'avenir ?

En 2028, le Comité de surveillance contrôlait les IA. Mais il a permis que les élections de 2028 soient globalement équitables, avec une utilisation symétrique de l'IA.

Cet état de fait — où le Comité de surveillance détient le pouvoir coercitif mais n'interfère pas beaucoup avec la politique démocratique — ne peut durer indéfiniment. Par défaut, les gens finiraient par réaliser que le contrôle de l'IA confère au Comité de surveillance un pouvoir immense, et exigeraient que ce pouvoir soit rendu aux institutions démocratiques. Tôt ou tard, le Comité de surveillance devrait soit renoncer à son pouvoir, soit utiliser activement son contrôle sur l'IA pour subvertir ou mettre fin à la démocratie, éventuellement après avoir purgé certains de ses membres lors de luttes de pouvoir.54 S'ils choisissent cette dernière voie, ils seraient probablement capables de verrouiller leur pouvoir indéfiniment.

Laquelle de ces issues se produit ? Le comité renonce-t-il à son monopole sur le pouvoir coercitif, ou le conserve-t-il ? Les deux avenirs sont plausibles, alors explorons chaque voie.

Comment le comité pourrait-il finir par renoncer à son pouvoir ?

  • Certains membres du comité pourraient préférer un avenir où le pouvoir est largement réparti, et ils pourraient être en bonne position pour promouvoir leur vision. Par exemple, si certains membres du comité complotent une subversion démocratique, les membres pro-démocratie pourraient alerter la presse ou le Congrès. S'il était alerté, le Congrès exigerait probablement que les IA soient contrôlées par une institution plus démocratique, comme le Congrès lui-même.

  • Le Congrès ne pourrait pas faire grand-chose s'il faisait face à toutes les IA, déployées dans tout le gouvernement, l'industrie et l'armée. Mais si le comité est divisé, alors les IA ne seront pas utilisées pour un seul camp, et le Congrès pourrait exercer une réelle influence. Face à un conflit ouvert, davantage de membres du comité pourraient être favorables à l'abandon d'une partie de leur pouvoir, ne voulant pas défendre publiquement le côté le moins démocratique.

  • En conséquence, le contrôle de l'IA pourrait s'étendre au-delà du comité jusqu'au Congrès. Ce serait déjà un progrès, car dans un groupe plus large, il est plus probable qu'un nombre significatif de personnes se soucient des gens extérieurs et tiennent compte de leurs intérêts. Et une fois que le pouvoir s'étend au Congrès, il pourrait continuer à s'étendre — revenant potentiellement entièrement au public.55

Mais le Comité de surveillance pourrait aussi s'emparer du pouvoir :

  • Certaines personnes puissantes n'ont aucun scrupule moral à ce sujet — et elles le savent. De plus, certaines sont ambitieuses et avides de pouvoir, et seraient prêtes à déclencher un conflit contre la démocratie si elles s'attendaient à en sortir vainqueurs. Si d'autres membres du comité s'y opposent, on pourrait les purger, les mettre en minorité, ou leur accorder quelques concessions mineures.56

  • De plus, souvent, les personnes puissantes ont commis des actes illégaux ou contraires à l'éthique dans leur ascension au pouvoir. Elles pourraient craindre que si le pouvoir devient plus largement réparti, leur propre position ne s'effondre, à mesure que des détectives superintelligents posant les bonnes questions découvrent des squelettes dans les placards.

  • De plus, grâce à l'accès à la superintelligence, le Comité de surveillance pourrait avoir le chemin le plus facile vers le pouvoir de l'histoire. Safer-∞ pourrait prévoir que certaines stratégies ont un risque d'échec extrêmement faible. Et Safer-∞ pourrait également fournir des stratégies pratiques par d'autres aspects, comme être non violentes (tout comme Safer-∞ pourrait orchestrer un coup d'État sans effusion de sang en Chine), ou peut-être même superficiellement démocratiques, si Safer-∞ pouvait manipuler l'opinion publique pour qu'elle s'aligne toujours sur les souhaits du Comité.

Safer-4 aurait déjà pu prévoir ces dynamiques, donc très probablement, la lutte de pouvoir principale se serait jouée en 2028. D'ici 2030, même si ce n'est pas apparent pour les observateurs extérieurs, tous les membres du Comité de surveillance sauraient probablement déjà s'ils ont une emprise stable sur le pouvoir ou non.

Rappel que ce scénario est une prévision, pas une recommandation

Nous n'approuvons pas de nombreuses actions dans cette fin du « ralentissement » et pensons qu'elle repose sur des hypothèses techniques optimistes en matière d'alignement. Nous n'approuvons pas non plus de nombreuses actions dans la fin de la « course ».

L'un de nos objectifs en écrivant ce scénario est de solliciter les réactions critiques de personnes plus optimistes que nous. À quoi ressemblerait le succès ? Ce scénario de « fin du ralentissement » représente notre meilleure estimation de la manière dont nous pourrions réussir à nous en sortir tant bien que mal grâce à une combinaison de chance, de réveils brutaux, de virages, d'efforts techniques intenses en matière d'alignement et de personnes vertueuses remportant les luttes de pouvoir. Il ne représente pas un plan que nous pensons réellement devoir viser. Mais beaucoup, notamment Anthropic et OpenAI, semblent viser quelque chose de ce genre.57 Nous aimerions beaucoup qu'ils clarifient ce qu'ils visent : s'ils pouvaient esquisser un scénario de dix pages, par exemple, en partant du présent ou en bifurquant à partir d'une partie du nôtre.