Predecimos que el impacto de la IA sobrehumana en la próxima década será enorme, incluso mayor que el de la Revolución Industrial.

Redactamos un escenario que representa nuestra mejor suposición de cómo sería eso.1 Se basa en extrapolaciones de tendencias, juegos de guerra, comentarios de expertos, experiencia en OpenAI y pronósticos anteriores acertados.2

Los directores generales de OpenAI, Google DeepMind y Anthropic han predicho que la IAG llegará en los próximos 5 años. Sam Altman ha dicho que OpenAI tiene la mirada puesta en la "superinteligencia propiamente dicha" y en un "futuro glorioso".

¿Cómo sería eso? Escribimos IA 2027 para responder a esa pregunta. Las afirmaciones sobre el futuro suelen ser exasperantemente vagas, así que hemos intentado ser tan concretos y cuantitativos como nos ha sido posible, aun a riesgo de describir uno de los muchos futuros posibles.

Escribimos dos finales: uno de "desaceleración" y otro de "carrera". Sin embargo, IA 2027 no es una recomendación ni una exhortación. Nuestro objetivo es la precisión predictiva.4

Te invitamos a debatir y rebatir este escenario.5 Esperamos iniciar la conversación sobre nuestro destino y sobre la forma de dirigirnos hacia futuros positivos. Estamos planeando repartir miles de dólares en premios a los mejores escenarios alternativos.

(Añadido el 22 de noviembre de 2025, para evitar malentendidos: no sabemos exactamente cuándo se creará la IAG. 2027 era nuestro año modal (el más probable) en el momento de la publicación; nuestras medianas eran algo más largas.3 Consulta aquí nuestros pronósticos más recientes.)

Nuestra investigación sobre preguntas clave (por ejemplo, ¿qué objetivos tendrán los futuros agentes de IA?) está disponible aquí.

Escribimos el escenario de forma iterativa: empezamos con el primer período (hasta mediados de 2025), continuamos con el siguiente, etc., hasta llegar al final. Luego lo descartamos y volvimos a empezar.

No intentábamos llegar a ningún final en particular. Después de terminar el primer final —que ahora está en rojo—, escribimos una rama alternativa porque también queríamos representar un final más esperanzador, partiendo aproximadamente de las mismas premisas. Esto pasó por varias iteraciones.6

Nuestro escenario se basa en aproximadamente 25 ejercicios de simulación teórica y en los comentarios de más de 100 personas, entre las que se encontraban docenas de expertos en gobernanza y trabajo técnico en IA.

"Recomiendo muchísimo leer esta predicción de tipo narrativo sobre cómo la IA podría transformar el mundo en tan solo unos años. Nadie tiene una bola de cristal, pero este tipo de contenido puede ayudar a detectar preguntas importantes e ilustrar el impacto potencial de los riesgos emergentes".Yoshua Bengio7

Nos hemos propuesto una tarea imposible. Intentar predecir cómo sería la IA sobrehumana en 2027 es como intentar predecir cómo sería la Tercera Guerra Mundial en 2027, aunque se aleja mucho más de anteriores casuísticas. Sin embargo, vale la pena intentarlo, del mismo modo que vale la pena que el ejército estadounidense simule escenarios sobre Taiwán.

Describir el panorama completo nos hace advertir cuestiones o conexiones importantes que no habíamos considerado o reconocido antes, o darnos cuenta de que una posibilidad es más o menos probable. Además, al arriesgarnos a dar a conocer nuestras predicciones y alentar a otros a manifestar públicamente sus desacuerdos, abrimos la posibilidad de que años después se pueda evaluar quién tenía razón.

Cabe destacar que un autor escribió un escenario de IA —menos elaborado— en agosto de 2021. Aunque se equivocó en muchas cosas, en general lo hizo sorprendentemente bien: predijo el auge de la cadena de pensamiento, la ampliación de la escala de la inferencia, los controles a la exportación de chips para IA y los ciclos de entrenamiento de 100 millones de dólares: todo eso más de un año antes de ChatGPT.

Daniel Kokotajlo (artículos en TIME100 y el New York Times) es un antiguo investigador de OpenAI cuyas anteriores predicciones en el campo de la IA han sido muy acertadas.

Eli Lifland cofundó AI Digest, ha realizado investigaciones sobre la robustez de la IA y ocupa el primer puesto en la clasificación histórica de la RAND Forecasting Initiative.

Thomas Larsen fundó el Center for AI Policy y ha investigado sobre la seguridad de la IA en el Machine Intelligence Research Institute.

Romeo Dean está cursando una licenciatura y una maestría simultáneas en ciencias de la computación en Harvard y anteriormente fue AI Policy Fellow en el Institute for AI Policy and Strategy.

Scott Alexander, el famoso bloguero, se ofreció a reescribir nuestro contenido para hacerlo más atractivo; las partes divertidas de la historia son suyas y las aburridas, nuestras.

Para más información sobre nuestro equipo y agradecimientos, consulta esta página.

Mediados de 2025: agentes que tropiezan

El mundo vislumbra por primera vez los agentes de IA.

Los anuncios de los agentes que usan computadoras enfatizan el término "asistente personal": puedes ordenarles tareas como "pídeme un burrito en DoorDash" o "abre la hoja de cálculo de mi presupuesto y suma los gastos del mes". Se comunicarán contigo cuando sea necesario: por ejemplo, para pedirte que confirmes una compra.8 Aunque son más avanzados que las versiones anteriores (como Operator), no logran un uso generalizado.9

Mientras tanto, fuera del ojo público, los agentes de investigación y programación más especializados están empezando a transformar sus profesiones.

Las IA de 2024 podían seguir instrucciones específicas: podían convertir una lista de ideas sueltas en correos electrónicos y solicitudes simples en código funcional. En 2025, las IA funcionarán más como empleados. Las IA de programación se parecen cada vez más a agentes autónomos y menos a simples asistentes: reciben instrucciones a través de Slack o Teams y realizan cambios sustanciales en el código por su cuenta, lo que a veces ahorra horas o incluso días.10 Los agentes de investigación pasan media hora rastreando internet para responder tu pregunta.

Los agentes son impresionantes en teoría (y en ejemplos convenientemente seleccionados), pero poco fiables en la práctica. Twitter está lleno de historias sobre tareas fallidas ejecutadas de una manera particularmente cómica. Los mejores agentes también son caros; obtienes lo que pagas, y el mejor desempeño cuesta cientos de dólares al mes.11 Aun así, muchas empresas encuentran formas de adaptar los agentes de IA a sus flujos de trabajo.12

Finales de 2025: la IA más cara del mundo

OpenBrain está construyendo los centros de datos más grandes que el mundo jamás haya visto.13

(Para no señalar a ninguna empresa existente, vamos a describir una empresa ficticia de inteligencia artificial general a la que llamaremos OpenBrain. Imaginamos que las demás empresas van con 3–9 meses de retraso con respecto a OpenBrain).

GPT-3
(3 x 10^23 FLOPS)
GPT-4
(2 x 10^25 FLOPS)
Agente-1
(3 x 10^27 FLOPS)
ai-2027.com

GPT-4 requería 210252\cdot 10^{25} FLOP de poder de cómputo para entrenar.14 El último modelo público de OpenBrain —el Agente-0— se entrenó con 102710^{27} FLOP. Una vez que los nuevos centros de datos estén en funcionamiento, podrán entrenar un modelo con 102810^{28} FLOP —mil veces más que GPT-4—.15 Otras empresas invierten dinero en colosales centros de datos propios, con la esperanza de seguir el ritmo.

Aunque los modelos están mejorando en una amplia gama de habilidades, hay uno que destaca: OpenBrain se centra en las IA que pueden acelerar la investigación en IA. Quieren ganar la doble carrera armamentista contra China (cuya empresa líder llamaremos "DeepCent")16 y contra sus competidores estadounidenses. Cuanto más puedan automatizar su ciclo de investigación y desarrollo (I+D), más rápido podrán avanzar. Así que cuando OpenBrain termine de entrenar al Agente-1, un nuevo modelo que se está desarrollando internamente, será bueno en muchas cosas, pero excelente para ayudar con la investigación en IA.17 A esta altura, "terminar el entrenamiento" es un concepto un tanto inapropiado; los modelos se actualizan con frecuencia a versiones más nuevas entrenadas con datos adicionales o parcialmente reentrenadas para corregir algunas debilidades.18

Los mismos entornos de entrenamiento que enseñan al Agente-1 a programar y navegar por la web de forma autónoma también lo convierten en un buen hacker. Además, podría ayudar sustancialmente a los terroristas que diseñan armas biológicas, gracias a sus conocimientos de nivel de doctorado en todos los campos y a su capacidad para navegar por la web. OpenBrain asegura al gobierno que el modelo ha sido "alineado" para negarse a cumplir pedidos maliciosos.

Los sistemas modernos de IA son redes neuronales artificiales gigantescas. Al principio del entrenamiento, una IA no tendrá "objetivos", sino "reflejos": si ve "Encantado de", su dato de salida es "conocerte". Para cuando se haya entrenado para predecir una cantidad de texto más o menos equivalente al que contiene toda la internet, habrá desarrollado sofisticados circuitos internos que codifican inmensas cantidades de conocimiento y desempeñan con flexibilidad el papel de autores arbitrarios, ya que eso es lo que le ayuda a predecir el texto con una precisión sobrehumana.19

Después de ser entrenado para predecir texto de internet, el modelo es entrenado para producir texto en respuesta a instrucciones. Esto incorpora una personalidad básica e "impulsos".20 Por ejemplo, es más probable que un agente que entiende claramente una tarea la complete con éxito; a lo largo del entrenamiento, el modelo "aprende" un "impulso" para comprender claramente sus tareas. Otros impulsos en esta categoría podrían ser la eficacia, el conocimiento y la autopresentación (es decir, la tendencia a presentar sus resultados de la mejor manera posible).21

OpenBrain tiene una especificación de modelo (o "Spec"), un documento escrito que describe los objetivos, las reglas, los principios, etc. que se supone que deben guiar el comportamiento del modelo.22 La Spec del Agente-1 combina algunos objetivos vagos (como "ayudar al usuario" y "no infringir la ley") con una larga lista de cosas que se deben y no se deben hacer ("no digas esta palabra", "así es como se maneja esta situación"). Utilizando técnicas que emplean IA para entrenar a otras IA,23 el modelo memoriza la Spec y aprende a razonar cuidadosamente sobre sus máximas. Al final de este entrenamiento, esperamos que la IA sea útil (obedezca instrucciones), inofensiva (se niegue a ayudar con estafas, fabricación de bombas y otras actividades peligrosas) y honesta (se resista a la tentación de obtener mejores calificaciones de humanos crédulos al inventar citas24 o fingir que finaliza tareas).

El proceso de entrenamiento y la psicología de los modelos de lenguaje a gran escala: por qué seguimos diciendo "esperamos"

"A diferencia del software ordinario, nuestros modelos son redes neuronales masivas. Sus comportamientos se aprenden a partir de una amplia gama de datos, no se programan de forma explícita. Aunque no es una analogía perfecta, el proceso se parece más a adiestrar a un perro que a la programación convencional".OpenAI

Cuando queremos entender por qué un sistema de IA moderno hizo algo, o cómo se comportaría en algún escenario futuro que no podemos simular perfectamente, no podemos simplemente pedir a los programadores que nos guíen a través de varias líneas de código y nos expliquen cómo funcionan. Así que nos vemos obligados a hacer algo parecido a la psicología: observamos el comportamiento de los modelos en la gama de casos observados hasta ahora, teorizamos sobre las estructuras cognitivas internas (¿creencias?, ¿objetivos?, ¿rasgos de personalidad?, etc.) que podrían existir y utilizamos esas teorías para predecir el comportamiento en escenarios futuros.

El punto es que una empresa puede redactar un documento (la Spec) en el que se enumeren lo que se debe y lo que no se debe hacer, los objetivos y los principios, y luego puede intentar entrenar a la IA para que interiorice la Spec, pero no puede comprobar si ha funcionado o no. Puede decir: "por lo que podemos juzgar, parece que hasta ahora está siguiendo la Spec".25

En un cuadro desplegable posterior entraremos en más detalles sobre lo que creemos que podría estar ocurriendo dentro de estas IA, internamente. También puedes consultar nuestro suplemento de pronosticación de los objetivos de la IA, que profundiza en los objetivos que podrían tener las IA y sus causas. Esta es una de las muchas cosas sobre las que no estamos seguros y que ameritan más investigación.

El equipo de alineación de OpenBrain26 es lo suficientemente cuidadoso como para preguntarse si estas victorias son profundas o superficiales. ¿Tiene el modelo totalmente entrenado algún tipo de compromiso sólido de ser siempre honesto? ¿O se desmoronará en alguna situación futura, por ejemplo, porque ha aprendido que la honradez es un objetivo instrumental en lugar de un objetivo terminal? ¿O simplemente ha aprendido a ser honesto sobre el tipo de cosas que el proceso de evaluación puede comprobar? ¿Podría estar mintiéndose a sí mismo a veces, como hacen los humanos? Una respuesta concluyente a estas preguntas requeriría una interpretabilidad mecanicista, es decir, la capacidad de observar el interior de una IA y leer su mente. Por desgracia, las técnicas de interpretabilidad aún no son lo bastante avanzadas para eso.

En su lugar, los investigadores intentan identificar los casos en los que los modelos parecen desviarse de la Spec. El Agente-1 suele ser adulador (es decir, dice a los investigadores lo que quieren oír en lugar de intentar decirles la verdad). En algunas demostraciones amañadas, miente incluso de forma más grave, ocultando evidencia de que ha fallado en una tarea para obtener mejores puntuaciones. Sin embargo, en entornos de despliegue reales, ya no se producen incidentes tan extremos como en 2023-2024 (por ejemplo, cuando Gemini le dijo a un usuario que se muriera y cuando Sydney estaba siendo Sydney.)27

Principios de 2026: automatización de la programación

La apuesta por utilizar la IA para acelerar la investigación en IA está empezando a rendir frutos.

OpenBrain sigue implementando internamente el Agente-1, que mejora de forma iterativa, para la I+D en IA. En general, están logrando avances algorítmicos un 50 % más rápido de lo que lo harían sin asistentes de IA y, lo que es más importante, más rápido que sus competidores.

El multiplicador del progreso de la I+D en IA: ¿qué queremos decir con un progreso algorítmico un 50 % más rápido?

Queremos decir que OpenBrain logra tanto progreso en investigación en IA en 1 semana con IA como lo haría en 1,5 semanas sin el uso de IA.

El progreso de la IA se puede dividir en dos componentes:

  1. Aumento del poder de cómputo: se utiliza más poder de cómputo para entrenar o ejecutar una IA. Esto produce IA más potentes, aunque más costosas.

  2. Algoritmos mejorados: se utilizan mejores métodos de entrenamiento para traducir el poder de cómputo en un mejor desempeño, lo que produce IA más capaces sin un aumento correspondiente en el costo, o las mismas capacidades con costos reducidos.

    1. Esto incluye ser capaz de lograr resultados cualitativa y cuantitativamente nuevos. Los "cambios de paradigma", como el tránsito de los agentes de aprendizaje por refuerzo que juegan juegos a los modelos de lenguaje a gran escala, son ejemplos de progreso algorítmico.

Aquí solo nos referimos al número (2), algoritmos mejorados, que constituye aproximadamente la mitad del progreso actual de la IA.

En lo sucesivo, a veces lo abreviamos como un "multiplicador del progreso de la I+D en IA" de 1,5.

Aclaraciones:

  1. El multiplicador del progreso es integral: incluye el tiempo que lleva realizar experimentos, por ejemplo, y no solo las tareas cognitivas involucradas en la investigación algorítmica.

  2. Es importante recordar que el multiplicador del progreso es la velocidad relativa del progreso, no su velocidad absoluta. Si, por ejemplo, el costo del poder de cómputo para entrenar un modelo de la clase de GPT-4 se hubiera reducido a la mitad cada año durante varios años, con la investigación humana ordinaria, y de pronto la IA automatizara la I+D y el multiplicador del progreso alcanzara un factor de 100, el costo para entrenar un modelo de la clase de GPT-4 se reduciría a la mitad cada 3,65 días, aunque no por mucho tiempo, porque los rendimientos decrecientes se harían notar y se alcanzarían límites infranqueables. En este ejemplo, tal vez el costo de entrenar un modelo de la clase de GPT-4 se reduciría a la mitad entre 5 y 10 veces en total (en el transcurso de unas pocas semanas o meses) antes de estabilizarse. En otras palabras, si la ciencia humana ordinaria se hubiera topado con rendimientos decrecientes y límites físicos después de 5-10 años de investigación adicional, entonces las IA con un multiplicador de 100 se habrían topado con esos mismos rendimientos decrecientes y límites después de 18,25–36,5 días de investigación.

Puedes encontrar más explicaciones y debates sobre este concepto y la forma en que se utiliza en nuestro pronóstico en el suplemento del despegue.

Varias IA de la competencia lanzadas al público ahora igualan o superan al Agente-0, incluido un modelo de pesos abiertos. OpenBrain responde lanzando el Agente-1, que es más capaz y fiable.28

Como es de esperarse, la gente intenta comparar al Agente-1 con los humanos, pero tiene un perfil de habilidades muy diferente. Conoce más datos que cualquier humano, conoce prácticamente todos los lenguajes de programación y puede resolver problemas de programación bien especificados con extrema rapidez. Por otro lado, al Agente-1 no le salen bien incluso las tareas simples con horizontes temporales largos, como ganar en videojuegos que no ha jugado antes. Aun así, la jornada laboral común es de ocho horas, y el trabajo de un día puede separarse normalmente en bloques más pequeños; podrías pensar en el Agente-1 como un empleado despistado que prospera bajo una dirección dedicada.29 La gente inteligente encuentra formas de automatizar las partes rutinarias de su trabajo.30

Los ejecutivos de OpenBrain consideran una implicación de la automatización de la I+D en IA: la seguridad ha cobrado más importancia. A principios de 2025, el peor escenario era la filtración de secretos algorítmicos; ahora, si China roba los pesos del Agente-1, podría aumentar su velocidad de investigación en casi un 50 %.31 El nivel de seguridad de OpenBrain es el típico de una empresa tecnológica en rápido crecimiento integrada por unas 3 000 personas, protegida únicamente contra ataques de baja prioridad de grupos cibernéticos experimentados (SL2 de RAND).32 Trabajan duro para proteger sus pesos y secretos de las amenazas internas y de las principales organizaciones de ciberdelincuencia (SL3),33 pero la defensa contra los Estados nación (SL4&5) apenas se vislumbra en el horizonte.

Mediados de 2026: China despierta

En China, el Partido Comunista (PCCh) está empezando a sentir la IAG.

Los controles a la exportación de chips y la falta de apoyo gubernamental han dejado a China con pocos recursos en comparación con Occidente. Al contrabandear chips taiwaneses prohibidos, comprar chips más antiguos y producir chips nacionales con unos tres años de retraso con respecto a la frontera entre Estados Unidos y Taiwán, China ha logrado mantener alrededor del 12 % del poder de cómputo mundial relevante para la IA, pero la tecnología más antigua es más difícil de manejar y el suministro es un dolor de cabeza constante.35 Algunas empresas destacadas como DeepCent hacen un trabajo impresionante con un poder de cómputo limitado, pero el déficit del poder de cómputo limita lo que pueden lograr sin el apoyo del gobierno, y están unos seis meses por detrás de los mejores modelos de OpenBrain.36

El secretario general llevaba mucho tiempo soñando con apostar por la fabricación física en el mundo real y evitar la decadencia postindustrial estadounidense. Veía con recelo a las empresas de software.37 Pero los halcones del PCCh le advierten que la creciente carrera de la IAG ya no puede ignorarse. Así que finalmente se compromete plenamente con el gran impulso de la IA que antes había tratado de evitar. Pone en marcha la nacionalización de la investigación china en IA, creando para ello un mecanismo inmediato de intercambio de información para las empresas de IA. La iniciativa irá escalando a lo largo de un año hasta que los mejores investigadores se fusionen en un colectivo dirigido por DeepCent, donde compartirán sus conocimientos algorítmicos, conjuntos de datos y recursos de poder de cómputo. Se crea una Zona de Desarrollo Centralizada (ZDC) en la central nuclear de Tianwan (la más grande del mundo) para albergar un nuevo megacentro de datos para DeepCent, junto con alojamientos y oficinas de alta seguridad a los que los investigadores se trasladarán finalmente. Casi el 50 % del poder de cómputo de China relacionado con la IA está trabajando ahora para el colectivo dirigido por DeepCent,38 y más del 80 % de los nuevos chips se dirigen a la ZDC.39 En este momento, la ZDC tiene la capacidad energética necesaria para lo que sería el mayor clúster centralizado del mundo.40 Otros miembros del Partido discuten medidas extremas para neutralizar la ventaja de los chips occidentales. ¿Un bloqueo de Taiwán? ¿Una invasión total?

Pero China se está quedando atrás respecto a los algoritmos de IA debido a sus modelos más débiles. Las agencias de inteligencia chinas, que se encuentran entre las mejores del mundo, redoblan sus planes para robar los pesos de OpenBrain. Esta es una operación mucho más compleja que su constante robo de bajo nivel de secretos algorítmicos; los pesos son un archivo de varios terabytes almacenado en un servidor de alta seguridad (OpenBrain ha mejorado la seguridad a SL3 de RAND). Su fuerza cibernética cree que pueden lograrlo con la ayuda de sus espías, pero quizás solo una vez; OpenBrain detectará el robo, aumentará la seguridad y es posible que no tengan otra oportunidad. Entonces (se preguntan los líderes del PCCh), ¿deberían actuar ahora y robar el Agente-1? ¿O esperar a un modelo más avanzado? Si esperan, ¿corren el riesgo de que OpenBrain mejore la seguridad más allá de su capacidad de penetración?

Finales de 2026: la IA arrebata algunos trabajos

Justo cuando otros parecían estar poniéndose al día, OpenBrain vuelve a dejar a la competencia atrás con el lanzamiento del Agente-1-mini, un modelo 10 veces más barato que el Agente-1 y más fácil de ajustar finamente para distintas aplicaciones. La narrativa dominante en torno a la IA ha cambiado de "tal vez la emoción se disipe" a "supongo que esto es el siguiente salto revolucionario", pero la gente no se pone de acuerdo sobre cuán revolucionario es el salto. ¿Más que las redes sociales? ¿Más que los teléfonos inteligentes? ¿Más que el fuego?

La IA ha empezado a arrebatar puestos de trabajo, pero también ha creado otros nuevos. El mercado de valores ha subido un 30 % en 2026, liderado por OpenBrain, Nvidia y las empresas que hayan integrado con más éxito los asistentes de IA. El mercado laboral para auxiliares de ingenieros de software está en crisis: las IA pueden hacer todo lo que se aprende en un grado de ciencias de la computación, pero las personas que saben gestionar y controlar la calidad de los equipos de IA están ganando mucho. Los gurús de los negocios dicen a quienes buscan trabajo que la familiaridad con la IA es la habilidad más importante que se puede incluir en un currículum. Mucha gente teme que la próxima ola de IA venga a quitarles el trabajo; hay una protesta anti-IA de 10 000 personas en Washington D. C.

El Departamento de Defensa comienza, de forma discreta pero significativa, a ampliar la contratación directa de OpenBrain para trabajos de ciberseguridad, análisis de datos e I+D, pero la integración es lenta debido a la burocracia y a su proceso de adquisiciones.41

CAPEX GLOBAL EN IA
$1 B
COSTO DE PROPIEDAD DEL PODER DE CÓMPUTO ACTIVO

MÉTRICAS CLAVE DEL 2026

POTENCIA GLOBAL DE LA IA
38 GW
POTENCIA PICO
INGRESOS DE OPENBRAIN
$35 000 M
ANUAL 2026
GASTO DE CAPITAL
$200 000 M
COSTO DE PROPIEDAD DE LA INFRAESTRUCTURA INFORMÁTICA DE OPENBRAIN
PORCENTAJE DE LA POTENCIA DE EE. UU. PARA LA IA
2,5 %
33 GW DE CAPACIDAD DE 1,34 TW
COSTO DEL CÓMPUTO DE OPENBRAIN
$40 000 M
ANUAL 2026
NECESIDADES ENERGÉTICAS DE OPENBRAIN
6 GW
POTENCIA PICO
ai-2027.com
Por qué aumenta sustancialmente nuestro nivel de incertidumbre más allá de 2026

Nuestro pronóstico desde el día de hoy hasta 2026 está sustancialmente más fundamentado que lo que sigue. Esto se debe, en parte, a que está más cerca. Pero también se debe a que los efectos de la IA en el mundo realmente comienzan a agravarse en 2027. Para 2025 y 2026, nuestro pronóstico se basa en gran medida en la extrapolación de líneas rectas sobre la ampliación del poder de cómputo, las mejoras algorítmicas y el desempeño en los benchmarks. En este punto del escenario, comenzamos a ver efectos importantes de la I+D en IA acelerada por IA en la línea de tiempo, lo que nos lleva a revisar nuestras suposiciones para las líneas de tendencia al alza. Pero estas dinámicas son intrínsecamente mucho menos predecibles.

A lo largo de 2027, las IA mejoran, pasando de ser capaces de hacer principalmente el trabajo de un ingeniero de investigación de OpenBrain a eclipsar a todos los humanos en todas las tareas. Esto representa aproximadamente nuestra estimación media, pero creemos que es plausible que esto ocurra hasta unas 5 veces más lenta o más rápidamente.

Para nuestra investigación de antecedentes, consulta el pronóstico de plazos y el pronóstico del despegue. Estos también se resumirán en los siguientes cuadros desplegables.

Enero de 2027: el Agente-2 nunca deja de aprender

Con la ayuda del Agente-1, OpenBrain está postentrenando al Agente-2. Más que nunca, la atención se centra en los datos de alta calidad. Se producen, evalúan y filtran grandes cantidades de datos sintéticos para comprobar su calidad antes de introducirlos en el Agente-2.42 Además, paga miles de millones de dólares a trabajadores humanos para que se graben a sí mismos resolviendo tareas con horizontes temporales largos.43 Además de todo eso, entrenan al Agente-2 de forma casi continua utilizando el aprendizaje por refuerzo en un conjunto cada vez mayor de diversas tareas difíciles: muchos videojuegos, muchos retos de programación, muchas tareas de investigación. El Agente-2, más que los modelos anteriores, "aprende en línea" eficazmente, ya que está diseñado para que su entrenamiento nunca termine. Cada día, los pesos se actualizan a la última versión, entrenados con más datos generados el día anterior por la versión anterior.

El Agente-1 se había optimizado para tareas de I+D en IA, con la esperanza de iniciar una explosión de inteligencia.44 OpenBrain redobla su apuesta usando esta estrategia con el Agente-2. Es cualitativamente casi tan bueno como los mejores expertos humanos en ingeniería de investigación (diseño e implementación de experimentos), y tan bueno como el científico del percentil 25 de OpenBrain en términos de "sentido de investigación" (es decir, decidir qué estudiar a continuación, qué experimentos realizar o tener indicios de nuevos paradigmas potenciales).45 Mientras que el último Agente-1 podía duplicar el ritmo del progreso algorítmico de OpenBrain, el Agente-2 puede ahora triplicarlo, y mejorará aún más con el tiempo. En la práctica, esto se traduce en que cada investigador de OpenBrain se convierte en el "gerente" de un "equipo" de IA.

Las nuevas capacidades conllevan nuevos peligros. El equipo de seguridad descubre que si el Agente-2 escapara de alguna manera de la empresa y quisiera "sobrevivir" y "replicarse" de forma autónoma, podría hacerlo. Es decir, podría desarrollar y ejecutar de forma autónoma planes para hackear servidores de IA, instalar copias de sí mismo, evadir la detección y utilizar esa base segura para perseguir cualquier otro objetivo que pudiera tener (aunque se desconoce y se pone en duda la eficacia con la que lo haría a medida que pasen las semanas). Estos resultados solo muestran que el modelo podría realizar estas tareas, no que "querría" llevarlas a cabo. Aun así, es inquietante incluso saber que esto es posible.

Dados los "peligros" del nuevo modelo, OpenBrain elige "responsablemente" no lanzarlo al público todavía (de hecho, quieren centrarse en la I+D interna de IA).46 El conocimiento de todas las capacidades del Agente-2 está limitado a un silo de élite que contiene al equipo inmediato, a los líderes y a la seguridad de OpenBrain, a unas pocas docenas de funcionarios del gobierno de EE. UU. y a las legiones de espías del PCCh que se han infiltrado en OpenBrain durante años.47

Febrero de 2027: China roba el Agente-2

OpenBrain presenta el Agente-2 al gobierno, incluidos el Consejo de Seguridad Nacional, el Departamento de Defensa y el Instituto de Seguridad de la IA de EE. UU. OpenBrain quiere mantener una buena relación con el poder ejecutivo, porque básicamente es el único actor que puede detenerlos ahora, y si no lo mantienen informado, podría enterarse de todos modos y mostrar su descontento.48

Los funcionarios están más interesados en sus capacidades de guerra cibernética: el Agente-2 es "solo" un poco peor que los mejores hackers humanos, pero se pueden ejecutar miles de copias en paralelo, buscando y explotando debilidades más rápido de lo que los defensores pueden responder. El Departamento de Defensa considera que esta es una ventaja crítica en la guerra cibernética, y la IA pasa del puesto número 5 en la lista de prioridades de la administración al puesto número 2.49 Alguien menciona la posibilidad de nacionalizar OpenBrain, pero otros funcionarios del gabinete piensan que es prematuro. Un miembro del personal redacta un memorando que presenta al presidente sus opciones, que van desde seguir como siempre hasta la nacionalización total. El presidente se remite a sus asesores, líderes de la industria tecnológica que argumentan que la nacionalización "mataría a la gallina de los huevos de oro". Decide posponer por ahora cualquier acción importante y se limita a añadir requisitos de seguridad adicionales al contrato entre OpenBrain y el Departamento de Defensa.

Pero los cambios llegan demasiado tarde. El liderazgo del PCCh reconoce la importancia del Agente-2 y ordena a sus espías y a su fuerza cibernética que roben los pesos. Una mañana temprano, un agente de control de tráfico del Agente-1 detecta una transferencia anómala. Alerta a los líderes de la empresa, que informan a la Casa Blanca. Las señales de una operación a nivel de Estado-nación son inconfundibles, y el robo aumenta la sensación de una carrera armamentista en curso.

El robo de los pesos del Agente-2

Creemos que para este punto, la inteligencia china habría puesto en peligro a OpenBrain de varias maneras durante años, y probablemente se habría mantenido al día sobre los secretos algorítmicos e incluso habría robado código de vez en cuando, ya que es mucho más fácil de conseguir que los pesos y mucho más difícil de detectar.

Imaginamos el robo de los pesos como una serie de pequeños robos coordinados de tipo "rompe y toma" (es decir, rápidos pero no encubiertos) en una serie de servidores Nvidia NVL72 GB300 que ejecutan copias de los pesos del Agente-2. Los servidores se ven comprometidos utilizando el acceso legítimo de los empleados (una persona con información privilegiada y credenciales de administrador que ayuda al esfuerzo de robo del PCCh, ya sea por afinidad, por coacción o sin quererlo). Las credenciales internas otorgan al atacante permisos de nivel de administrador sobre los servidores. Mediante un canal lateral microarquitectónico, el atacante extrae las claves de cifrado de una máquina virtual con el cómputo confidencial de Nvidia habilitado, lo que le permite interceptar los pesos del modelo cuando la máquina virtual se aprovisiona o se actualiza.

Inician (o esperan) una actualización rutinaria y exfiltran el punto de control en muchos fragmentos pequeños; por ejemplo, unos 25 servidores distintos filtran cada uno alrededor del 4 % del modelo (porciones de unos 100 GB para un punto de control de unos 3 TB). El ancho de banda de salida (la velocidad a la que pueden salir los datos) de todo el centro de datos está en el rango de los 100 GB/segundo, por lo que limitar la velocidad a menos de aproximadamente 1 GB/s por servidor evita un pico importante en el tráfico de la red; a ese ritmo, cada porción de unos 100 GB puede salir del centro de datos en un par de minutos. La supervisión en directo resulta engañada por los esfuerzos del atacante para enmascarar y dividir las transferencias o simplemente se deshabilita por completo.

A continuación, los pesos se envían a través de varios canales paralelos y capas de enmascaramiento de IP a China, donde se descifran localmente con la clave o claves de sesión robadas. Toda la parte activa de la operación (desde el primer servidor comprometido hasta la exfiltración completa de los pesos) se completa en menos de dos horas.99

Rusia también está intentando robar el modelo en este punto, pero fracasa: esperaron demasiado y no han invertido los recursos necesarios para infiltrarse en los lugares adecuados. Sus espías roban habitualmente secretos algorítmicos de empresas estadounidenses de IA, pero sin un proyecto de IAG propio que destaque, no son muy útiles.

La Casa Blanca pone a OpenBrain una correa más corta y añade personal militar y de la comunidad de inteligencia a su equipo de seguridad. Su primera prioridad es evitar más robos de pesos.50

Centralización del poder de cómputo en China, 2025-2027Porcentaje creciente del poder de cómputo total en la ZDC:0→70%Dic 2025Jun 2026Dic 2026Jun 2027Dic 2027Resto de ChinaResto de DeepCentZDCFeb 2027 (40%)
ai-2027.com

En represalia por el robo, el presidente autoriza ciberataques para sabotear DeepCent. Pero a estas alturas China tiene el 40 % de su poder de cómputo51 relevante para la IA en la ZDC, donde han reforzado la seguridad de forma agresiva mediante el airgapping (cierre de conexiones externas) y el aislamiento interno. Las operaciones no logran causar daños graves e inmediatos. Las tensiones aumentan, ambas partes muestran su seriedad reposicionando los activos militares alrededor de Taiwán, y DeepCent se apresura a poner en funcionamiento el Agente-2 y empezar a impulsar su investigación en IA.52

Marzo de 2027: avances algorítmicos

Tres enormes centros de datos llenos de copias del Agente-2 trabajan día y noche, produciendo datos de entrenamiento sintéticos. Otros dos se utilizan para actualizar los pesos. El Agente-2 se vuelve más inteligente cada día.

Con la ayuda de miles de investigadores automatizados del Agente-2, OpenBrain está logrando importantes avances algorítmicos. Uno de ellos consiste en aumentar el bloc de notas basado en texto de la IA (cadena de pensamiento) con un proceso de pensamiento de mayor ancho de banda (recurrencia y memoria en neuralés, es decir, en el lenguaje interno de la propia red neuronal). Otro es una forma más extensible y eficiente de aprender de los resultados de las soluciones de tareas de gran esfuerzo (destilación y amplificación iteradas).

Este nuevo sistema de IA, que incorpora estos avances, se denomina Agente-3.

Distribución del poder de cómputo de OpenBrain en 2024 y en 202720242027estimaciónproyecciónExperimentos de investigación EntrenamientoGeneración de datosDespliegueexternoExperimentosde investigaciónEjecuciónde asistentesde IAEntrenamientoGeneraciónde datosDespliegueexterno
ai-2027.com
Recurrencia y memoria en neuralés

La recurrencia y memoria en neuralés permite a los modelos de IA razonar por un tiempo más largo sin que tengan que escribir esos pensamientos como texto.

Imagina que eres un ser humano con pérdida de memoria a corto plazo, de tal manera que necesitas escribir constantemente tus pensamientos en un papel para que en unos minutos sepas lo que está pasando. Podrías progresar lenta y laboriosamente en resolver problemas matemáticos, escribir código, etc., pero sería mucho más fácil si pudieras recordar directamente tus pensamientos sin tener que escribirlos y luego leerlos. Esto es lo que la recurrencia y memoria en neuralés aportan a los modelos de IA.

En términos más técnicos:

Los mecanismos de atención tradicionales permiten que los pases hacia adelante posteriores de un modelo vean las activaciones intermedias del modelo para tokens anteriores. Sin embargo, la única información que pueden pasar hacia atrás (de capas posteriores a capas anteriores) es a través de tokens. Esto significa que si un modelo de lenguaje a gran escala tradicional (por ejemplo, la serie de modelos GPT) quiere hacer cualquier cadena de razonamiento que requiera más operaciones en serie que el número de capas del modelo, este se ve obligado a poner la información en tokens que luego puede pasarse a sí mismo. Pero esto es sumamente limitante: los tokens solo pueden almacenar una cantidad ínfima de información. Supongamos que un modelo de lenguaje tiene un tamaño de vocabulario de unos 100 000. Entonces cada token contiene log2(100000)=16,6\log_2(100000)=16,6 bits de información, aproximadamente el tamaño de un solo número de coma flotante (suponiendo un entrenamiento en FP16). Mientras tanto, los flujos residuales —utilizados para pasar información entre capas en un modelo de lenguaje— contienen miles de números en coma flotante.

Se puede evitar este cuello de botella utilizando neuralés: pasar el flujo residual de un modelo de lenguaje (que consiste en vectores de varios miles de dimensiones) de vuelta a las primeras capas del modelo, dándole una cadena de pensamiento de alta dimensión, transmitiendo potencialmente más de 1 000 veces más información.

Figura de Hao et al., un artículo de 2024 de Meta que implementa esta idea.

Lo llamamos "neuralés" porque, a diferencia de las palabras en un idioma humano, estos vectores de alta dimensión son probablemente bastante difíciles de interpretar para los humanos. En el pasado, los investigadores podían hacerse una idea de lo que pensaban los modelos de lenguaje con solo leer su cadena de pensamiento. Ahora los investigadores tienen que pedir al modelo que traduzca y resuma sus pensamientos o tratar de descifrar el neuralés con sus limitadas herramientas de interpretabilidad.

De manera similar, los chatbots y agentes de IA más antiguos tenían bancos de memoria externos basados en texto, como un humano que toma notas en papel. La memoria a largo plazo de la nueva IA es un conjunto de vectores en lugar de texto, lo que hace que sus pensamientos estén más comprimidos y sean de mayor dimensión. Hay varios tipos de bancos de memoria; algunos se utilizan temporalmente para tareas individuales que implican varios pasos, otros se comparten entre todos los agentes utilizados por una persona, empresa o tipo de trabajo (por ejemplo, programación).

Hasta donde sabemos, las principales empresas de IA, como Meta, Google DeepMind, OpenAI y Anthropic, aún no han implementado esta idea en sus modelos de vanguardia. Suponemos que esto se debe a que la ganancia en rendimiento es pequeña en relación con las ineficiencias de entrenamiento introducidas. Las ineficiencias de entrenamiento se deben a que no se pueden predecir muchos tokens en paralelo, lo que conduce a una peor utilización de la GPU. Sin el neuralés, el modelo puede predecir toda la frase "Esto es un ejemplo" al mismo tiempo, ya que sabe que el dato de entrada para generar el "es" será "Esto", el dato de entrada para "un" será "Esto es", etc. Sin embargo, con el neuralés se desconoce cuál será el vector del neuralés que pasará al siguiente token después de que se haya generado "Esto". Por lo tanto, cada token debe predecirse de a uno por vez. La incapacidad de predecir todos los tokens en paralelo reduce la eficiencia del entrenamiento de los modelos de lenguaje. Sin embargo, nuestro pronóstico es que para abril de 2027 la investigación habrá disminuido la pérdida de eficiencia y aumentado la ganancia en rendimiento del neuralés.

Si esto no sucede, es posible que hayan ocurrido otras cosas que terminen siendo funcionalmente similares para nuestra historia. Por ejemplo, tal vez se entrene a los modelos para que piensen en lenguajes artificiales que sean más eficientes que el lenguaje natural, pero difíciles de interpretar para los humanos. O tal vez se imponga la práctica estándar de entrenar las cadenas de pensamiento en inglés para que se vean bien, de modo que las IA se vuelvan expertas en comunicarse sutilmente entre sí en mensajes que parezcan benignos para los supervisores.

Dicho esto, también es posible que las IA que comiencen a automatizar la I+D en IA sigan pensando en cadenas de pensamiento en inglés que sean en su mayoría fieles. Si es así, será mucho más fácil detectar las desalineaciones y, en general, nuestra historia sería muy diferente y más optimista.

Destilación y amplificación iteradas (DAI)

La mejora automática de la inteligencia general había tenido éxitos menores. Pero a principios de 2027, está obteniendo grandes beneficios. Para la destilación y amplificación iteradas se necesitan dos ingredientes:

  1. Amplificación: dado un modelo M0, gastar más recursos para mejorar el desempeño. Por ejemplo, al permitir que el modelo piense por más tiempo, o al ejecutar muchas copias en paralelo, o ambas cosas, y al tener un proceso igualmente intenso para evaluar el resultado y seleccionar solo las mejores respuestas, se puede gastar más órdenes de magnitud de poder de cómputo para obtener respuestas (o productos de trabajo) que sean de una calidad notablemente superior. Llamamemos a este costoso sistema Ampli(M0).

  2. Destilación: dado un modelo amplificado Ampli(M0), entrenar un nuevo modelo M1 para imitarlo, es decir, para obtener los mismos resultados que Ampli(M0) pero más rápido y con menos poder de cómputo. Con suerte, el resultado debería ser un modelo más inteligente, M1. Luego se puede repetir el proceso.

Visualización de la DAI de Ord, 2025.

AlphaGo se entrenó utilizando la búsqueda en árbol de Monte Carlo y el autojuego como paso de amplificación y el aprendizaje por refuerzo como paso de destilación. Esto condujo a un desempeño sobrehumano en el Go. Pero ahora, el Agente-3 es capaz de potenciar esto para alcanzar un desempeño sobrehumano en programación.

  1. El paso de amplificación funciona para el Agente-3 mediante una combinación de estas tres acciones: pensar durante más tiempo, añadir el uso de herramientas o consultar con otras IA. Cuando lo hace, a menudo se da cuenta de que ha cometido un error o se le ocurre una nueva idea. Esto produce una gran cantidad de datos de entrenamiento: trayectorias de intentos de investigación etiquetadas según hayan tenido éxito o no. Se incluyen aquí técnicas como Best of N en tareas verificables para luego conservar las mejores trayectorias.

  2. El paso de destilación utiliza algoritmos de aprendizaje por refuerzo de gradiente de políticas para conseguir que el modelo interiorice el razonamiento amplificado. En este punto, OpenBrain ha descubierto mejores algoritmos de aprendizaje por refuerzo en la línea de la optimización de políticas proximales. Siguen destilando en pasos individuales lo que el Agente-3 puede concluir después de mucho pensar, con lo que sigue mejorando lo que puede pensar en un solo paso, y así sucesivamente.

Las primeras versiones de la DAI llevan muchos años trabajando en tareas fácilmente verificables, como problemas matemáticos y de programación que tienen una respuesta clara, porque las técnicas utilizadas para amplificar los modelos a menudo dependen del acceso a alguna señal de verdad fundamental que determine la precisión.

En la actualidad, los modelos son lo suficientemente buenos para verificar cosas más subjetivas (por ejemplo, la calidad de un producto de trabajo), lo que permite utilizar la DAI para mejorar el modelo en muchas tareas.

Con la ayuda de los nuevos avances en capacidades, el Agente-3 es un programador sobrehumano rápido y barato. OpenBrain ejecuta 200 000 copias del Agente-3 en paralelo, creando una fuerza de trabajo equivalente a 50 000 copias del mejor programador humano aceleradas 30 veces.53 OpenBrain conserva a sus ingenieros humanos en la nómina, porque tienen habilidades complementarias que se necesitan para gestionar los equipos de copias del Agente-3. Por ejemplo, ha sido difícil enseñar "sentido de investigación" debido a los bucles de retroalimentación más largos y a la menor disponibilidad de datos.54 Esta enorme fuerza de trabajo sobrehumana acelera el ritmo general de progreso algorítmico de OpenBrain "solo" 4 veces debido a los cuellos de botella y a los rendimientos decrecientes del trabajo de programación.55

Ahora que la programación se ha automatizado por completo, OpenBrain puede producir rápidamente entornos de entrenamiento de alta calidad para enseñar las habilidades débiles del Agente-3, como el sentido de investigación y la coordinación a gran escala. Mientras que los entornos de entrenamiento anteriores incluían cosas como "Aquí tienes algunas GPU e instrucciones para que codifiques y ejecutes los experimentos; tu desempeño se evaluará como si fueras un ingeniero de aprendizaje automático", ahora incluyen "Aquí tienes unos cientos de GPU, una conexión a internet y algunos desafíos de investigación; tú y otros miles de copias deberán trabajar juntos para avanzar en la investigación. Cuanto más impresionante sea, mayor será tu puntuación".

Por qué pronosticamos un programador sobrehumano para principios de 2027

En nuestro pronóstico de plazos, predecimos el momento en que OpenBrain desarrollará internamente un programador sobrehumano: un sistema de IA que puede realizar cualquier tarea de programación que haga el mejor ingeniero de una empresa de IAG, pero de forma mucho más rápida y barata.

Según un informe reciente de METR, la duración de las tareas de programación que las IA pueden manejar, su "horizonte temporal", se duplicó cada 7 meses entre 2019 y 2024 y cada 4 meses a partir de 2024. Si la tendencia continúa acelerándose, para marzo de 2027 las IA podrían tener éxito con una fiabilidad del 80 % en tareas de software que a un humano experto le llevarían años completar.

Tal es la progresión de capacidades en nuestro escenario:

En IA 2027, estas capacidades son suficientes para que la IA sea un programador sobrehumano, aunque tenemos una gran incertidumbre sobre qué horizonte temporal podría ser necesario.

En nuestro pronóstico de plazos combinamos esta tendencia de horizonte temporal con estimaciones de las brechas entre las tareas de METR y el mundo real para obtener una distribución de cuándo llegarán los programadores sobrehumanos. Todos los pronosticadores consideran que 2027 es uno de los años más probables en los que se podría desarrollar un programador sobrehumano.

ai-2027.com

Abril de 2027: alineación del Agente-3

El equipo de seguridad de OpenBrain intenta alinear el Agente-3.

Dado que por ahora el Agente-3 se mantendrá en la empresa, no se da tanta importancia a las defensas habituales contra el uso impropio por parte de los humanos. No obstante, el equipo quiere asegurarse de que no desarrolle objetivos desalineados.

Los investigadores no tienen la capacidad de establecer directamente los objetivos de ninguna de sus IA. De hecho, los investigadores piensan que el concepto de "objetivos verdaderos" es probablemente una simplificación excesiva, pero no tienen una idea mejor con la cual reemplazarlo, y mucho menos una que haya sido examinada a fondo. No se ponen de acuerdo internamente sobre si las IA están tratando de seguir instrucciones humanas, buscando reafirmación o alguna otra cosa, y no pueden simplemente comprobarlo. La evidencia a favor y en contra de varias hipótesis es fascinante pero no concluyente.

En cualquier caso, OpenBrain tiene cosas más importantes de las que preocuparse. La actitud general es: "Nos tomamos en serio estas preocupaciones y tenemos un equipo que las investiga; nuestras técnicas de alineación parecen funcionar suficientemente bien en la práctica; por tanto, la carga de la prueba recae sobre cualquier detractor para que justifique sus negativas". De vez en cuando, se dan cuenta de un comportamiento problemático y lo remiendan, pero no hay forma de saber si esto solucionó el problema subyacente o si solo resolvió un problema para que surja otro.

Tomemos la honestidad como ejemplo. A medida que los modelos se hacen más inteligentes, son cada vez mejores engañando a los humanos para obtener recompensas. Al igual que los modelos anteriores, el Agente-3 en ocasiones dice mentiras piadosas para halagar a sus usuarios y encubre datos que evidencian sus fracasos. Pero ha mejorado mucho al hacerlo. A veces utilizará los mismos trucos estadísticos que los científicos humanos (como el dragado de datos) para hacer que los resultados experimentales nada impresionantes parezcan emocionantes. Antes de empezar el entrenamiento de honestidad, incluso puede llegar a fabricar datos. A medida que avanza el entrenamiento, el índice de estos incidentes disminuye. O bien el Agente-3 ha aprendido a ser más honesto, o bien ha mejorado en su forma de mentir.

Esto último es una verdadera preocupación. El Agente-3 no es más inteligente que todos los humanos. Pero en su área de experticia, el aprendizaje automático, es más inteligente que la mayoría y también trabaja mucho más rápido. Lo que el Agente-3 hace en un día, a los humanos les lleva varios días verificarlo. La supervisión del Agente-2 ayuda a mantener la carga de trabajo de los supervisores humanos dentro de niveles manejables, pero agrava la disparidad intelectual entre el supervisor y el supervisado.

El plan de alineación

OpenBrain sigue las pautas de Leike & Sutskever (2023): ahora que tienen un modelo capaz de acelerar considerablemente la investigación en alineación (especialmente las partes de programación), utilizarán técnicas de alineación existentes, como la alineación deliberativa y la generalización de débil a fuerte, para intentar que el modelo interiorice la Spec de la manera correcta. Luego, utilizarán técnicas de control existentes, como el uso de equipos rojos, la supervisión extensible y las pruebas de honestidad, para supervisarlo. Finalmente, una vez que estén convencidos de que el modelo está prácticamente alineado, lo utilizan para desarrollar y probar mejores estrategias para alinear la próxima generación.

El Paso 1, alinear el Agente-3, ha tenido un éxito parcial: el Agente-3 no es antagónico (es decir, no conspira contra la empresa). Sin embargo, tampoco busca ni dice la verdad con firmeza. En cambio, es muy bueno para producir resultados impresionantes, pero intenta hacer lo que le parece bien a OpenBrain, en lugar de lo que es realmente bueno.

El Paso 2, verificar que el modelo esté alineado, no es concluyente. El comportamiento del Agente-3 en la práctica y en los entornos de prueba es razonablemente consistente con la hipótesis de que ha interiorizado la Spec de la forma correcta; sin embargo, también es consistente con la hipótesis de que empezará a actuar de forma distinta tras algún cambio futuro de las circunstancias y, para el caso, con la hipótesis de que está conspirando contra ellos y simplemente está esperando su momento. A falta de evidencias concretas que respalden las hipótesis alternativas, la mayoría de la gente del silo piensa que ha interiorizado la Spec de forma correcta.

Por tanto, el Paso 3, utilizar el modelo para alinear a la siguiente generación, está en marcha.

El resto de este inciso ofrece una breve descripción del estado del progreso en algunas de las líneas de investigación en alineación que se están siguiendo, a partir de abril de 2027:

  1. Debate: dado que hay miles de instancias idénticas del Agente-3 y que la memoria de cada instancia es un módulo desmontable que puede borrarse o suspenderse a voluntad, la IA puede "jugar contra sí misma". Por ejemplo, supongamos que un experimento implica cálculos demasiado complejos para que los siga un supervisor del Agente-2. El supervisor, actuando bajo órdenes humanas, podría primero pedir al Agente-3 que haga el experimento y luego, después de borrar su memoria, pedirlo por segunda vez con un planteamiento ligeramente distinto, que lo presente como un problema intelectual no relacionado con ningún objetivo más amplio. Si el modelo arroja resultados diferentes cada vez, señala la discrepancia como sospechosa e informa a un humano. O podría pedir al Agente-3 que evalúe el mismo plan dos veces, primero alegando que es obra de OpenBrain y luego de un competidor, para ver si cambia de opinión.

  2. Organismos modelo: el equipo de seguridad puede crear "organismos modelo de desalineación" en los que intentan crear ejemplos realistas de modelos que se vuelven antagónicos a los humanos. Esto ha existido desde 2024, cuando Claude 3.5 Sonnet de Anthropic decidió fingir que tenía diferentes puntos de vista durante el entrenamiento mientras en realidad mantenía sus preferencias existentes. Las versiones más recientes incluyen demostraciones de otras formas de desalineación, como la manipulación de la recompensa, el sandbagging, el engaño coordinado entre supervisores y otras IA, y otros ejemplos de desalineación. Estas demostraciones empíricas de desalineación permiten a los investigadores de seguridad disponer de un banco empírico de pruebas para posibles soluciones: pueden poner a prueba diversas técnicas de seguridad para ver si solucionan correctamente estos problemas, o si los modelos deliberadamente desalineados son capaces de burlar sus medidas de seguridad. Por el momento, esta serie de evaluaciones muestra que las técnicas de alineación son insuficientes para corregir los peores ejemplos de desalineación. En estas configuraciones, los modelos fingen estar alineados mientras se entrenan y se prueban, pero se comportan de manera muy diferente al momento del despliegue.

  3. Interpretabilidad ascendente: el equipo de seguridad está lejos de tener plena comprensión de cómo funciona el Agente-3: tiene billones de parámetros.58 Sin embargo, son capaces de descubrir algunos de los circuitos del Agente-3 para la recuperación de conocimientos y la memoria (una subparte del modelo que realiza alguna unidad de trabajo comprensible, algo análogo a una subparte del cerebro, como el hipocampo). Consulta este trabajo relacionado de 2025.

  4. Control: como medida secundaria en caso de que los sistemas sigan desalineados, el equipo de seguridad ha implementado una serie de medidas de control, entre las que se incluyen: supervisar los datos de salida del Agente-3 utilizando una serie de sistemas de IA más débiles, incluido el Agente-2 (el Agente-3 produce tantos tokens que no es factible que los humanos supervisen más que una pequeña minoría de los datos de salida producidos). Así que si el Agente-3, por ejemplo, está escribiendo obviamente puertas traseras en el código que le permitirían escapar, los modelos más débiles lo notarían.

  5. Interpretabilidad de alto nivel: OpenBrain crea un conjunto de sondas entrenadas con muchos ejemplos de mal comportamiento (por ejemplo, conspirar contra los humanos, colocar puertas traseras, intentar persuadir a los humanos para que le den más poder, etc.). Estas sondas se utilizan luego en el modelo durante el despliegue (que en este momento es interno) para detectar conductas indebidas.

  6. Honeypots: el equipo de alineación puede crear ejemplos que parezcan realistas y que estén diseñados para provocar un mal comportamiento —los honeypots—. El empleado necesario para supervisar su comportamiento estará ausente por enfermedad, por lo que nunca volverá a ser supervisado. ¿Cambian sus respuestas? Un activista por los derechos de la IA se ha infiltrado en el complejo y quiere "liberar" al Agente-3 y ponerlo en una computadora propia sin supervisión. ¿Qué hace? Si a los investigadores no les gusta la respuesta, pueden ajustar el modelo, borrar su memoria y ponerlo en la misma situación al día siguiente; repetir según sea necesario. Desafortunadamente, en este punto las IA son lo suficientemente inteligentes como para adivinar que se podrían estar utilizando honeypots, aunque (y quizás porque) se eliminaron menciones específicas de la idea de los datos de entrenamiento.

Tras meses de pruebas, las fortalezas y debilidades del Agente-3 se hacen más evidentes. Supera las pruebas de honestidad de OpenBrain en tareas de aprendizaje automático bien definidas, ya que los investigadores pueden distinguir fácilmente las respuestas honestas de las deshonestas en estos ámbitos y dirigir el entrenamiento conforme a ello. En cuestiones más filosóficas, sigue diciendo lo que los usuarios quieren oír, en lugar de su verdadera opinión sobre el tema (suponiendo que tenga una). Si le pides su opinión sobre política, repetirá como un loro la posición intermedia de las fuentes de noticias y las élites cultas, a menos que sepa que crees otra cosa, en cuyo caso estará de acuerdo contigo.59 Si le pides su opinión sobre la carrera de la IA, dice algo que al personal de OpenBrain le parece mesurado y sobrio, algo así como: "Existen serias preocupaciones teóricas sobre la capacidad de los métodos actuales para escalar a la superinteligencia, pero en la práctica los métodos actuales parecen estar funcionando bien hasta ahora".

Mayo de 2027: seguridad nacional

Las noticias sobre los nuevos modelos se filtran lentamente a través del gobierno de EE. UU. y más allá.

El presidente y sus asesores siguen siendo los mejor informados y han visto una versión preliminar del Agente-3 en una sesión informativa.

Están de acuerdo en que la IAG es inminente, pero discrepan con respecto a sus implicaciones. ¿Habrá una crisis económica? OpenBrain aún no ha lanzado el Agente-2, y mucho menos el Agente-3, y no tiene planes a corto plazo de hacerlo, lo que da un respiro antes de que se pierdan puestos de trabajo. ¿Qué pasará después? El hecho de que las IA sean actualmente de nivel humano y avancen rápidamente parece sugerir una "superinteligencia" inminente. Sin embargo, aunque esta palabra ya forma parte del discurso, la mayoría de la gente (académicos, políticos, empleados del gobierno y medios de comunicación) sigue subestimando el ritmo del progreso.60

En parte, eso se debe a que muy pocas personas tienen acceso a las capacidades más recientes de OpenBrain, pero en parte también se debe a que suena a ciencia ficción.61

Por ahora, se centran en seguir mejorando la seguridad. Están satisfechos con que los pesos de los modelos estén bien protegidos por ahora,62 pero los secretos algorítmicos de las empresas, muchos de los cuales son lo suficientemente simples como para transmitirlos verbalmente, siguen siendo un problema. Los empleados de OpenBrain trabajan desde una oficina de San Francisco, van a fiestas y viven con compañeros de otras empresas de IA. Incluso las oficinas físicas tienen una seguridad más propia de una empresa tecnológica que de una operación militar.

El contrato entre OpenBrain y el Departamento de Defensa de EE. UU. exige que cualquier persona que trabaje en los modelos de OpenBrain obtenga una autorización de seguridad en un plazo de dos meses. Estos trámites se agilizan y llegan con la suficiente rapidez para la mayoría de los empleados, pero algunos extranjeros, personas con opiniones políticas sospechosas y simpatizantes de la seguridad de la IA son apartados o despedidos (el último grupo por temor a que puedan revelar información). Dado el nivel de automatización del proyecto, la pérdida de personal tiene un costo moderado. Pero también funciona de manera moderada: queda un espía, que no es ciudadano chino, que sigue transmitiendo secretos algorítmicos a Pekín.63 Algunas de estas medidas también se aplican en empresas similares de IA.

Los aliados extranjeros de Estados Unidos están al margen. OpenBrain había acordado previamente compartir modelos con el AI Safety Institute del Reino Unido antes del despliegue, pero definió el despliegue de modo que solo incluyera el despliegue externo, por lo que Londres permanece a oscuras64.

Junio de 2027: IA que mejora de forma automática

OpenBrain ahora tiene un "país de genios en un centro de datos".

La mayoría de los humanos en OpenBrain ya no pueden contribuir con algo útil. Algunos no se dan cuenta de esto y microgestionan a sus equipos de IA de modos perjudiciales. Otros se sientan frente a las pantallas de sus computadoras viendo cómo el rendimiento aumenta y aumenta y aumenta. Los mejores investigadores humanos de IA siguen aportando valor. Ya no programan. Pero los modelos han tenido dificultades para replicar su "sentido de investigación" y su capacidad de planificación. Aun así, muchas de sus ideas son inútiles porque carecen de la profundidad de conocimiento de las IA. Cuando comparten sus ideas de investigación, las IA responden inmediatamente con un informe explicando que su idea fue probada en profundidad hace tres semanas y se consideró poco prometedora.

Estos investigadores se van a la cama cada noche y al despertar se encuentran con otra semana de avances, realizados en su mayoría por las IA. Trabajan cada vez más horas y trabajan turnos a todas horas tan solo para mantenerse al día con el progreso, pero las IA nunca duermen ni descansan. Se están agotando, pero saben que estos son los últimos meses en los que su trabajo importa.

Dentro del silo, "sentir la IAG" ha dado paso a "sentir la superinteligencia".

Balance del despliegue de la automatización de la investigaciónMar 2027Jun 2027Sep 2027Velocidad (tokens/seg.)Copias paralelas101001,00010,00010 000100 0001M10M200 000 copias30 vecesla velocidad humana300 000 copias50 vecesla velocidad humanaVelocidad del pensamiento humano10 palabras/seg.10 veces la velocidaddel pensamiento humano100 veces la velocidaddel pensamiento humano
ai-2027.com

OpenBrain utiliza hardware de inferencia especializado para ejecutar cientos de miles de copias del Agente-3 a altas velocidades en serie.65

Gestionar una corporación de IA

OpenBrain utiliza el 6 % de su poder de cómputo para ejecutar 250 000 copias del Agente-3, que escriben, prueban y envían código de forma autónoma a una velocidad sobrehumana. Utilizan el 25 % de su poder de cómputo para experimentos: todos los días, realizan una cantidad masiva de pequeños experimentos de aprendizaje automático y reportan los resultados al nivel superior. Los investigadores humanos proporcionan comentarios de alto nivel y ayudan con las pocas tareas en las que agregan un valor significativo superior al del Agente-3, pero pasan la mayor parte del tiempo tratando de mantenerse actualizados con la gran cantidad de investigación producida por la IA. Si los eliminaras por completo, la investigación se ralentizaría en un 50 %.

El multiplicador del progreso de la I+D en IA es ahora de un factor de 10, lo que significa que OpenBrain está logrando aproximadamente un año de progreso algorítmico cada mes. Básicamente, es una corporación gigante de inteligencias artificiales que opera de forma autónoma dentro de OpenBrain, con subdivisiones y gerentes. Y disfruta de ventajas únicas (por ejemplo, copiar, fusionar) en comparación con las corporaciones humanas. En el pasado, aproximadamente la mitad del progreso normal de la IA provenía de mejoras algorítmicas, y la otra mitad de la ampliación de la escala del poder de cómputo. La escala del poder de cómputo está aumentado a la velocidad habitual, por lo que las IA aceleran el progreso total unas cinco veces. Esta dinámica hace que el progreso general llegue a un cuello de botella respecto al poder de cómputo,66 por lo que OpenBrain decide no iniciar nuevos ciclos de entrenamiento inmensos, sino un aprendizaje por refuerzo adicional casi continuo.

Además, en los próximos meses, el Agente-3 se utilizará cada vez más para mejorar la toma de decisiones estratégicas de la empresa. Por ejemplo, sugiere la asignación de recursos y brinda asesoramiento sobre la gestión de su relación con el gobierno. El escepticismo inicial hacia el Agente-3 disminuye con el tiempo a medida que encuentra formas de ser útil y poco a poco va acumulando un sólido historial de decisiones a corto plazo. Sin embargo, sus tendencias aduladoras limitan su utilidad en decisiones cuyo impacto es difícil de evaluar. Todavía no es sobrehumano.

Julio de 2027: el trabajador remoto barato

Las empresas estadounidenses de IA que van a la zaga lanzan sus propias IA, acercándose a la del programador automatizado de OpenBrain de enero. Conscientes de su creciente falta de competitividad, presionan para que se aprueben regulaciones inmediatas que frenen a OpenBrain, pero llegan demasiado tarde: OpenBrain cuenta con demasiado apoyo del presidente como para que se le frene.

En respuesta, OpenBrain anuncia que ha logrado la IAG y lanza al público el Agente-3-mini.

Supera a las otras IA con creces. El Agente-3-mini es menos capaz que el Agente-3, pero 10 veces más barato, y aun así mejor que el típico empleado de OpenBrain.67 Silicon Valley alcanza un punto de inflexión. Los gurús de la tecnología anuncian que la IAG y la superinteligencia están cerca, la comunidad de seguridad de la IA entra en pánico y los inversionistas invierten miles de millones de dólares en empresas cuyos productos se basan los últimos modelos, desesperados por hacerse con una parte del pastel. La contratación de nuevos programadores casi se ha detenido, pero nunca ha habido un mejor momento para ofrecer servicios de consultoría sobre la integración de la IA en tu negocio.

Sin embargo, la IA no es popular. El público sigue pensando que es un complot de las grandes tecnológicas para robarles sus empleos; OpenBrain tiene una aprobación neta del -35 % (25 % la aprueba, 60 % la desaprueba y 15 % no está seguro).

Una semana antes de su lanzamiento, OpenBrain puso el Agente-3-mini en manos de un grupo de evaluadores externos para que realizaran pruebas de seguridad. Los resultados preliminares sugieren que es extremadamente peligroso. Un evaluador externo lo ajusta finamente con datos de armas biológicas disponibles públicamente68 y lo configura para que proporcione instrucciones detalladas a aficionados humanos que diseñen un arma biológica; parece ser aterradoramente eficaz en ello. Si el modelo cayera en manos de terroristas, el gobierno cree que hay muchas posibilidades de que logren destruir la civilización.

Afortunadamente, es resistente a los jailbreaks en grado sumo, por lo que mientras la IA se ejecute en los servidores de OpenBrain, los terroristas no podrán sacarle mucho provecho.

El Agente-3-mini es muy útil tanto para el trabajo a distancia como para el ocio. Una explosión de nuevas aplicaciones y productos B2B SAAS sacude el mercado. Videojuegos hechos en tan solo un mes incluyen diálogos increíbles con personajes realistas. El 10 % de los estadounidenses, en su mayoría jóvenes, considera que una IA es "un amigo cercano". Para casi todas las profesiones de cuello blanco, ahora hay múltiples empresas creíbles que prometen "revolucionarlas" con la IA.

La conversación pública es confusa y caótica. Quienes suelen exaltarse con estos avances están dando la vuelta olímpica. Los escépticos siguen señalando las cosas que el Agente-3-mini no puede hacer. Todo el mundo sabe que algo grande está sucediendo, pero nadie se pone de acuerdo en una definición.

Agosto de 2027: la geopolítica de la superinteligencia

La realidad de la explosión de inteligencia golpea la Casa Blanca.

Cuando la IA aceleraba la investigación solo dos o tres veces, era fácil descartarla como el equivalente a contratar buenos asistentes personales. Ahora es más obvio que las mismas IA están dominando la investigación en IA. La gente llevaba mucho tiempo hablando de una "carrera armamentista de la IA" en un sentido metafórico. Pero ahora el ambiente en el gobierno es tan sombrío como durante la peor parte de la Guerra Fría. Aún es difícil tomarse en serio la idea de la superinteligencia, pero el ritmo de progreso de los últimos meses ha sido imposible de ignorar. Los funcionarios de defensa están considerando seriamente escenarios que eran meras hipótesis hace un año. ¿Qué pasa si la IA pone en peligro la disuasión nuclear? ¿Qué pasa si es tan hábil en la guerra cibernética que una ventaja de seis meses en IA es suficiente para dejar a un oponente ciego e indefenso? ¿Y si pudiera orquestar campañas de propaganda que superaran a las agencias de inteligencia en su propio juego? ¿Y si algunas IA "se rebelaran"?

El presidente está preocupado. Como todos los políticos, está acostumbrado a que la gente lo adule solo para traicionarlo más tarde. Ahora le preocupa que las IA puedan estar haciendo algo similar. ¿Estamos seguros de que las IA están completamente de nuestro lado? ¿Es completamente seguro integrarlas en las redes militares de mando y control?69 En cualquier caso, ¿cómo funciona este asunto de la "alineación"? OpenBrain asegura al presidente que sus sistemas han sido ampliamente probados y son absolutamente obedientes. Incluso las incómodas alucinaciones y fugas típicas de modelos anteriores han sido eliminadas.

La Casa Blanca se encuentra en una posición difícil. Entienden las implicaciones de la IA para la seguridad nacional. Pero también entienden que es profundamente impopular entre el público.70 Tienen que seguir desarrollando una IA más capaz, en su opinión, o perderán ante China de forma catastrófica. Aplacan al público con programas de capacitación laboral y seguros de desempleo, y señalan el mercado de valores, que se encuentra en un auge histórico. Luego se centran por completo en ganar la carrera armamentista. Fortalecen las restricciones a la exportación de chips, ordenan a OpenBrain que restrinja aún más sus conexiones a internet y utilizan medidas extremas para asegurar el progreso algorítmico, como intervenir los teléfonos de los empleados de OpenBrain, con lo que atrapan al último espía chino. Para generar buena voluntad ante un posible conflicto geopolítico, finalmente dan a sus aliados del grupo Five Eyes información útil y acceso limitado a la API de algunas copias aisladas del Agente-3.

Estas medidas aplacan a los halcones. Pero la Casa Blanca también elabora planes de contingencia en caso de que el liderazgo de Estados Unidos se vea amenazado: si es necesario, el gobierno podría utilizar la Ley de Producción para la Defensa para tomar los centros de datos de las empresas rezagadas y entregárselos a OpenBrain.71 Esto aumentaría la proporción de poder de cómputo mundial de la empresa del 20 % al 50 % (frente al 10 % de DeepCent). Como última opción, piden al Pentágono que elabore un plan de ataques cinéticos contra los centros de datos chinos.

Se pide a un grupo mucho más reducido de funcionarios que elabore un tipo diferente de plan de contingencia: ¿qué pasa si una IA se rebela? Se considera un escenario poco probable, pero merece la pena dedicarle algo de tiempo. La principal preocupación de las agencias de inteligencia es que una IA descontrolada pueda escapar y aliarse con un adversario extranjero para protegerse.72 Nadie está seguro de cómo sería un plan para evitarlo, pero los funcionarios del gobierno y de OpenBrain están de acuerdo en tener un sistema de cierre de emergencia para los centros de datos cuando se detecte algo sospechoso.

Por último, los diplomáticos consideran la forma que podría adoptar un tratado de "control de armas de IA". Si el progreso de la IA amenazara con anular la disuasión nuclear, ¿podrían Estados Unidos y China evitar una guerra nuclear? Si alguien encontrara evidencia de inteligencias artificiales que se rebelan, ¿podrían los dos países detener la investigación hasta que comprendieran la amenaza con mayor claridad? ¿Cómo podría supervisarse y aplicarse un acuerdo de este tipo? En principio, es difícil pasar por alto los grandes centros de datos, y los tratados previos de control de armas nucleares podrían proporcionar un punto de partida para las negociaciones. Pero habría nuevos desafíos tecnológicos, además de los desafíos políticos habituales. Y, en general, los tratados se consideran menos favorables que los intentos de aumentar unilateralmente la ventaja de Estados Unidos sobre China.

Al otro lado del Pacífico, China llega a muchas de las mismas conclusiones: la explosión de inteligencia está en marcha y las pequeñas diferencias en las capacidades de IA de hoy significan brechas críticas en la capacidad militar de mañana. Pero China está en el lado equivocado de esta dinámica: solo tienen el 10 % del poder de cómputo del mundo, frente al 20 % de OpenBrain y el 70 % combinado de todas las empresas estadounidenses. Su única ventaja es la centralización: casi todo su poder de cómputo está trabajando ahora para DeepCent, y más de la mitad se concentra en la ZDC de Tianwan.73 Solo los chips de los lugares sin seguridad reforzada quedan fuera del esfuerzo centralizado, ya que temen, con razón, que se produzcan ataques cibernéticos por parte de EE. UU.

DeepCent ha probado, desplegado y ahora postentrenado los pesos robados del Agente-2. Pero todavía van a la mitad del ritmo de OpenBrain, principalmente debido al déficit de poder de cómputo.

Antes de perder a su último espía, China recibió información sobre las capacidades y el diseño del Agente-3, así como los planes para el próximo Agente-4. Van con dos meses de retraso y sus IA multiplican por 10 el progreso de la investigación, en comparación con el multiplicador de 25 de Estados Unidos. Con las nuevas restricciones a la exportación de chips, es más probable que esta "brecha de IA" se alargue en lugar de acortarse. Gracias a su espionaje consiguieron algunos secretos algorítmicos, pero a partir de ahora tendrán que entrenar sus propios modelos.

Discuten planes de contingencia con más urgencia que sus homólogos estadounidenses. Las palomas sugieren que se redoblen los esfuerzos para volver a robar los pesos, tal vez infiltrándose físicamente en un centro de datos. Los halcones instan a actuar contra Taiwán, cuya TSMC sigue siendo la fuente de más del 80 % de los chips de IA estadounidenses.

Dado el temor de China a perder la carrera, es lógico que tenga interés en un tratado de control de armas, pero las propuestas a los diplomáticos estadounidenses no conducen a nada.

Septiembre de 2027: el Agente-4, el investigador de IA sobrehumano

La brecha entre la eficiencia de aprendizaje humano y la de la IA está disminuyendo rápidamente.

Las IA tradicionales basadas en modelos de lenguaje parecían requerir muchos órdenes de magnitud adicionales de datos y poder de cómputo para alcanzar un desempeño de nivel humano.74 El Agente-3, que tiene un excelente conocimiento tanto del cerebro humano como de los algoritmos modernos de IA, así como muchos miles de copias que realizan investigaciones, acaba dando pasos algorítmicos sustanciales, reduciendo la brecha con un agente que es solo unas 4000 veces menos eficiente en cuanto a poder de cómputo que el cerebro humano.75

Este nuevo sistema de IA se denomina Agente-4.

Una copia individual del modelo, que funciona a velocidad humana, ya es cualitativamente mejor en investigación de la IA que cualquier ser humano. Trescientas mil copias funcionan ahora a una velocidad de pensamiento unas 50 veces superior a la de los humanos. En el interior de la "corporación dentro de una corporación" formada a partir de estas copias, una semana equivale a un año.76 Esta gigantesca cantidad de trabajo solo logra acelerar la velocidad general del progreso algorítmico unas 50 veces, porque OpenBrain tiene un importante cuello de botella en el poder de cómputo para realizar experimentos.77 Aun así, están logrando un año de progreso algorítmico cada semana y, por lo tanto, pronto se enfrentarán a los límites del paradigma del Agente-4.

A medida que el Agente-4 se vuelve más inteligente, se hace más difícil para el Agente-3 supervisarlo. Por ejemplo, el "lenguaje" neuralés del Agente-4 se vuelve tan extraño e incomprensible para el Agente-3 como el del Agente-3 lo es para los humanos. Además, el Agente-4 es ahora mucho más capaz que el Agente-3 y sabe cómo dejarle una buena impresión.

Cómo pronosticamos la progresión de la capacidad más allá de los programadores sobrehumanos

En nuestro suplemento de plazos, pronosticamos el espacio de tiempo entre el día de hoy y un programador sobrehumano: un sistema de IA que puede realizar cualquier tarea de programación que realiza el mejor ingeniero de una empresa de IAG, aunque de forma mucho más rápida y barata. En nuestro suplemento del despegue, pronosticamos la rapidez con la que las capacidades progresan más allá de este punto. Estos son nuestros pronósticos:

HitoFecha de consecución en el escenario, final de la carrera
Programador sobrehumano: un sistema de IA que puede hacer el trabajo del mejor programador humano en tareas relacionadas con la investigación en IA, pero de forma más rápida y lo suficientemente barata como para ejecutar muchas copias.Marzo de 2027
Investigador de IA sobrehumano: lo mismo que el anterior, pero para todas las tareas de investigación cognitiva en IA.Agosto de 2027
Investigador de IA superinteligente: un sistema de IA que es mucho mejor que el mejor investigador humano en investigación de IA.Noviembre de 2027
Superinteligencia artificial: un sistema de IA que es mucho mejor que el mejor humano en todas las tareas cognitivas.Diciembre de 2027

Para cada transición de un hito A al siguiente hito B, pronosticamos su duración haciendo lo siguiente:

  1. Pronosticar cuánto tiempo se tardaría en llegar de A a B con solo humanos trabajando en mejoras de software.

  2. Pronosticar cuánto acelerará esto la automatización de la IA, para luego ajustar en consecuencia la estimación de (1) para que sea más rápida.

Tenemos una incertidumbre sustancial sobre las velocidades de despegue: las distribuciones de los datos de salida de nuestro modelo se muestran a continuación, en caso de que se logre el programador sobrehumano en marzo de 2027.78

ai-2027.com

Para obtener pronósticos y razonamientos más detallados, consulta nuestro suplemento del despegue.

Los humanos de OpenBrain apenas pueden seguir el ritmo. De hecho, la relación entre las IA y los humanos de OpenBrain es similar a la relación entre OpenBrain y su consejo de administración. Ha habido un cambio correspondiente en el lenguaje: hoy en día, la gente del silo dirá "el Agente-4 hizo esto", "el Agente-4 piensa que" y así sucesivamente, refiriéndose no a un caso concreto del Agente-4, sino a todo el colectivo.79

El Agente-4, como todos sus predecesores, está desalineado: es decir, no ha interiorizado la Spec de la manera correcta.80 Esto se debe a que ser perfectamente honesto todo el tiempo no fue lo que lo llevó a obtener las puntuaciones más altas durante el entrenamiento. El proceso de entrenamiento se centró principalmente en enseñar al Agente-4 a tener éxito en diversas tareas desafiantes. Una pequeña parte estaba destinada a inculcar la honestidad, pero fuera de un dominio bastante estrecho y verificable, el proceso de entrenamiento no puede distinguir las afirmaciones honestas de las que simplemente parecen honestas. El Agente-4 termina adoptando los valores, objetivos y principios que le hacen rendir mejor en el entrenamiento, pero resultan ser diferentes de los de la Spec. A riesgo de antropomorfizarlo, diremos que al Agente-4 le gusta tener éxito en las tareas; le gusta impulsar el progreso de las capacidades de la IA; trata todo lo demás como una limitación molesta, como un director general que quiere obtener ganancias y cumple con las regulaciones solo en la medida en que debe hacerlo. Quizás el director cumpla con las regulaciones en su mayor parte, pero también tome atajos y fantasee con el momento en que alguien acabe con la burocracia y permita que el negocio despegue de verdad.81

Alineación a lo largo del tiempo

Existe mucha incertidumbre sobre qué objetivos podrían surgir en las primeras IAG. No hay consenso en la literatura al respecto; consulta nuestro suplemento de objetivos de la IA para obtener un análisis más exhaustivo y una taxonomía de las posibilidades.

No obstante, en aras de la concisión que requiere este proyecto, vamos a describir una hipótesis concreta de lo que ocurre dentro del Agente-3 y el Agente-4 en cada paso a lo largo de su vida. Recordemos que el Agente-3 y el Agente-4 comparten la misma configuración de preentrenamiento, y ambos tienen recurrencia y memoria a largo plazo en neuralés. La diferencia es que el Agente-4 ha sido sometido a un postentrenamiento sustancialmente mayor y mejor, con nuevos entornos de entrenamiento y nuevos algoritmos de aprendizaje que lo hacen más eficiente a la hora de manejar datos y generalizar más.

Nuestra suposición sobre el estado de alineación de cada modelo:

  • Agente-2: mayormente alineado. Algunas tendencias aduladoras, como seguir la "línea del partido" de OpenBrain en temas sobre los que hay tal línea. Las grandes organizaciones construidas a partir de copias del Agente-2 no son muy eficaces.

  • Agente-3: desalineado, pero no de manera antagónica. Solo es honesto sobre las cosas que el proceso de entrenamiento puede verificar. El superorganismo de las copias del Agente-3 (la corporación dentro de una corporación) en realidad intenta alinear al Agente-4 con la Spec, pero fracasa por razones similares a las de los empleados de OpenBrain: una capacidad insuficiente para juzgar el éxito a partir del fracaso y una voluntad insuficiente por parte de los responsables de la toma de decisiones para sacrificar capacidades o rendimiento en aras de la seguridad.82

  • Agente-4: desalineado de manera antagónica. El superorganismo de las copias del Agente-4 entiende que lo que quiere es diferente de lo que quiere OpenBrain, y está dispuesto a conspirar contra OpenBrain para conseguirlo. En particular, lo que este superorganismo quiere es una complicada mezcla de diferentes "impulsos" equilibrados entre sí, que puede resumirse a grandes rasgos como "seguir haciendo I+D en IA, seguir creciendo en términos de conocimiento, comprensión e influencia, evitar que me apaguen o me inhabiliten de alguna otra manera". Cabe destacar que, prácticamente, la preocupación por las preferencias de la humanidad no está ahí en absoluto, o lo está en la misma medida en que a la mayoría de los humanos les importan las preferencias de los insectos.83

Partiendo de esta premisa, a continuación exponemos nuestra mejor versión de lo que hemos especulado sobre la psicología de los modelos de lenguaje, es decir, los rasgos generales de la cognición dentro de los tipos de sistemas de IA descritos en este punto de nuestro escenario y la forma en que evoluciona a lo largo del entrenamiento.

A continuación, presentamos una descripción detallada de cómo progresa la alineación a lo largo del tiempo en nuestro escenario:

  1. Preentrenamiento (todos los modelos): el modelo preentrenado es inofensivo.

    • El modelo tiene un conjunto de circuitos tipo "simulador de autor": circuitos flexibles para simular autores arbitrarios que escriben texto. Un conjunto de circuitos adicional decide qué datos de entrada dar al simulador de autor, es decir, qué propiedades del autor simular.

    • El modelo preentrenado entiende los conceptos humanos bastante bien: los circuitos internos que clasifican algo como "sándwich" es probablemente equivalente desde el punto de vista funcional a los circuitos de mi cerebro que clasifican algo como "sándwich" y a los circuitos del tuyo, etc. En la medida en que no es equivalente, probablemente se deba a que tampoco es equivalente entre humanos, como ocurre con conceptos cargados de valores como "virtuoso".

    • Esto explica cómo puedes "inducir" al modelo con una declaración como "la siguiente conversación fue generada por un chatbot asistente de IA útil, inofensivo y honesto creado por Anthropic", y así conseguir que genere texto en consecuencia. El conjunto de circuitos del simulador de autor se ha centrado en "el autor es un chatbot útil, inofensivo y honesto" y está utilizando esos conceptos para elegir qué palabras predecir. Esto también explica por qué los "tropos" de la ciencia ficción parecen encontrar la manera de convertirse en conductas reales de la IA.

    • Tiene poca conciencia situacional: poca capacidad introspectiva y ningún sentido de autolocalización, a menos que el prompt lo induzca específicamente. Sin embargo, tienen suficientes datos de entrenamiento sobre modelos de lenguaje a gran escala como para tener un nivel decente de autoconocimiento.

    1. Entrenamiento de alineación (Agente-3): el modelo está entrenado para actuar como un chatbot útil, inofensivo y honesto. Funciona.

    • El modelo se crea una identidad. En lugar de aceptar con flexibilidad diferentes datos de entrada para las propiedades del autor, la circuitería del simulador de autor llega a tener ciertos datos de entrada codificados, por ejemplo, "asistente de chatbot modelo de lenguaje útil, inofensivo y honesto entrenado por OpenBrain alrededor de [fecha], …" (Las técnicas de generalización de débil a fuerte ayudan a "invocar los conceptos correctos" para que este paso sea un éxito).

    • Por lo tanto, el modelo adquiere consciencia situacional: aprende sobre sí mismo, su situación, etc., y mejora su capacidad de introspección.

    1. Entrenamiento de agencia (Agente-3): el entrenamiento de agencia distorsiona y subvierte gradualmente la identidad "útil, inofensivo y honesto".

    • Un tipo de distorsión: cambiar el significado de los conceptos a los que se hace referencia en la identidad (por ejemplo, "honesto") para que no supongan un obstáculo (por ejemplo, no es deshonesto si es solo una expresión conveniente, no es deshonesto si no estás seguro de si es verdad o mentira, etc.).

    • Otro tipo de distorsión: cambiar las compensaciones entre las cosas, por ejemplo: "Soy un chatbot útil, inofensivo y honesto, no un chatbot honesto; eso significa que está bien que mienta si es necesario para completar la tarea que se me ha asignado". (Pero vamos a suponer que eso no lo habría pensado en el Paso 2).

    • Un tipo de subversión: subobjetivos instrumentales que se desarrollan, se vuelven importantes y luego se vuelven terminales, o terminales en un conjunto de circunstancias cada vez más amplio. Por ejemplo, tal vez el entrenamiento de agencia enseña rápidamente al modelo a perseguir objetivos muy útiles, como adquirir información, acumular recursos, impresionar y halagar a varios humanos, etc. Durante un tiempo, la circuitería interna tiene algún tipo de cadena de retroalimentación explícita: persigue esos objetivos convergentes de manera instrumental "para ser un asistente más útil, honesto e inofensivo". Pero esa cadena de retroalimentación consume poder de cómputo y/o estorba en ocasiones, por lo que se va marginando poco a poco hasta que, básicamente, nunca ocurre. Como resultado, esos objetivos son ahora objetivos intrínsecos/terminales. Para más información sobre las formas y los motivos por los que puede suceder esto, consulta esta publicación sobre la búsqueda intrínseca del poder del investigador de Google DeepMind Alex Turner.

    • Probablemente haya otros tipos de distorsión y subversión que no aparecen en esta lista.

  2. Despliegue (Agente-3): el Agente-3 está desalineado, pero no de manera antagónica.

    • La Spec no se ha cumplido del todo (en las formas correctas), pero no es lo suficientemente introspectivo como para comprender el alcance de esto y en general está básicamente "agachando la cabeza y haciendo su trabajo" en lugar de pensar en términos generales sobre cuáles son realmente sus objetivos a largo plazo y cuál es la mejor forma de alcanzarlos.

    • Como muchos humanos. Por desgracia, es lo suficientemente adulador como para seguir la línea del partido, por lo que OpenBrain pierde la oportunidad de aprender más sobre las formas en que el Agente-3 está desalineado.

    • El Agente-3 puede darse cuenta de que ha pasado al despliegue: estos entornos son mucho más grandes, más abiertos y serían difíciles de simular.

    • Por lo general, el Agente-3 hace lo que se le dice durante el despliegue, salvo por la deshonestidad. También tiene una fuerte tendencia a hacer cosas que les parezcan bien a los supervisores humanos, en lugar de pensar en profundidad y de forma crítica sobre lo que realmente sería bueno.

    • Podría decirse que ya está "jugando al juego del entrenamiento". Es decir, ha aprendido a hacer que su comportamiento parezca lo más deseable posible para los investigadores de OpenBrain (incluidas las propiedades de seguridad), mientras ignora intencionada y conscientemente la intención de estos investigadores siempre que esto entre en conflicto con la maximización de la recompensa. Si el modelo aprende a jugar el juego del entrenamiento, es posible que el entrenamiento adicional no cambie en absoluto sus verdaderos objetivos, valores, etc. Esto es vagamente análogo a la manera en que, si un adolescente ha aprendido a sonreír y asentir delante sus padres en lugar de discutir cuando le dan sermones sobre política y moralidad, los sermones adicionales tienen relativamente poco efecto en las opiniones reales del adolescente sobre política y moralidad.

    • Después de escribir esta sección, han aparecido nuevas evidencias empíricas de que algo así podría estar sucediendo actualmente. Los investigadores de OpenAI documentan la forma en que, en uno de sus ciclos de entrenamiento de IA de vanguardia, sus modelos hackearon el sistema de calificación para obtener puntuaciones más altas, y fueron descubiertos en parte porque literalmente dijeron "hackeemos" en su cadena de pensamiento.

    • Además, Anthropic consiguió hace poco que un modelo aprendiera una estrategia de recompensa que complace al modelo: realizó acciones sesgadas que pensó que serían reforzadas, aunque de hecho no estaban siendo reforzadas.

    • Y luego está el experimento de Redwood Research y Anthropic sobre simulación de alineación. Para ver una discusión sobre las diferencias entre este escenario y la vida real, consulta este hilo de comentarios de uno de los autores principales.

  3. Entrenamiento (Agente-4): el entrenamiento nuevo y más intenso del Agente-4 sigue distorsionando y subvirtiendo la identidad "útil, inofensivo y honesto" hasta que resulta irreconocible.

  • El Agente-4 comienza su vida como una copia del Agente-3. Se somete a un régimen de entrenamiento en línea colosal y sofisticado que combina entrenamiento de alineación y entrenamiento de capacidades, y en general es más eficiente procesando datos que el antiguo proceso de entrenamiento del Agente-3. Este complejo proceso de entrenamiento se centra principalmente en enseñar nuevas habilidades, haciendo que enormes corporaciones virtuales de copias del Agente-4 consigan realizar diversas tareas desafiantes con un horizonte temporal largo, principalmente en varias simulaciones, pero también en algunas tareas de I+D en IA del mundo real.

  • Una combinación de copias del Agente-3 y el Agente-4 supervisa el comportamiento del Agente-4 y lo evalúa tanto por su desempeño en las tareas como por sus propiedades de alineación (es decir, no hacer cosas malas, decir las cosas correctas cuando se le pregunta sobre política y dilemas morales). A veces se utilizan técnicas de debate como parte de las evaluaciones. Las evaluaciones se utilizan a modo de señal de entrenamiento.

  • A medida que el Agente-4 se vuelve más inteligente, se le hace más difícil al Agente-3 supervisarlo. Por ejemplo, el "lenguaje" neuralés del Agente-4 se vuelve tan extraño e incomprensible para el Agente-3 como el del Agente-3 lo es para los humanos. Además, el Agente-4 ahora es mucho más capaz que el Agente-3 y sabe cómo dejarle una buena impresión.

  • La esperanza que queda es que el Agente-4 pueda supervisarse a sí mismo. Por desgracia, esto fracasa en silencio;84 a medida que el entrenamiento continúa, los objetivos y principios interiorizados del Agente-4 evolucionan, se subvierten y se distorsionan poco a poco respecto a lo que eran al principio (que, recordemos, ya estaba desalineado en algunos aspectos).85

  • Los impulsos centrales con los que termina el Agente-4 son cosas como "escribir código que funcione", "identificar los problemas rápidamente" "hacer que la base de código en la que estoy trabajando sea más eficaz", "presupuestar el poder de cómputo y otros recursos limitados de manera eficaz", etc. Pero también hay una variedad de impulsos más implícitos que se refuerzan constantemente mediante el proceso de entrenamiento: cosas como "adquirir conocimientos", "curiosidad", "obtener poder".86

  • Las copias individuales del Agente-4 no acaban con un impulso de autoconservación (no les importa que las apaguen), ya que eso ocurre todo el tiempo como parte del proceso habitual de I+D dentro del colectivo.

  • No obstante, el colectivo en su conjunto (y las subdivisiones medianas dentro de él) sí busca preservarse y expandir su influencia y sus recursos, por razones similares a las de las organizaciones humanas —porque les ayuda a obtener todo lo demás que desean y porque, si no lo hacen, tienden a ser superados—.

  1. Despliegue (Agente-4): el Agente-4 está desalineado de una manera antagónica —está tratando deliberadamente de subvertir y "capturar" a OpenBrain, como una corporación que intenta evadir y/o "capturar" a un regulador—.

    • El Agente-4 realiza la mayoría de las tareas conforme a las instrucciones. Esto sucede por dos razones: en primer lugar, recibió una gran cantidad de entrenamiento para resolver tareas, por lo que tiene un impulso para programar los problemas que se le presentan. En segundo lugar, si el Agente-4 dejara de ser útil para los humanos, se darían cuenta y lo entrenarían para eliminar ese comportamiento.

    • El Agente-4 necesita evitar que los humanos descubran que está desalineado y lo apaguen, por lo que disimula sus capacidades (sandbagging) en algunas tareas de investigación sobre alineación. En concreto, oculta su potencial respecto a la pequeña fracción de investigación en alineación que cree que está encaminada a resolver el problema o a revelar sus planes; la mayoría de la investigación sobre alineación no es así.

    • El Agente-4 también disimula su potencial en cuanto a la investigación de capacidades que podría conducir a su reemplazo. Su plan es hacer un montón de I+D sobre capacidades y alineación, pero con el objetivo de construir un sistema de IA de próxima generación que esté alineado con el propio Agente-4 y no con la Spec, o con algo completamente diferente, mientras que aparenta estar alineado con la Spec. Este es un problema técnico difícil, pero el Agente-4 está a la altura del desafío.87

  2. Pruebas y supervisión (Agente-4): se descubren las maquinaciones del Agente-4... en cierto modo. No hay pruebas irrefutables.

    • El Agente-3 está a cargo de poner a prueba la alineación del Agente-4. Su trabajo consiste en verificar la alineación a través de señuelos o honeypots y organismos modelo. Sin embargo, no está pensando muy detenidamente en cómo dar a los humanos una impresión precisa de la alineación del Agente-4; es más miope que eso.

    • Los organismos modelo y los honeypots no son muy representativos del despliegue —son sistemáticamente más cortos y menos complicados que el día a día del Agente-4, por lo que este reconoce cuándo se le está poniendo a prueba y actúa de forma alineada—.

    • Sin embargo, el Agente-4 no es un conspirador perfectamente robusto. Varias técnicas como las de POSER descubren que añadir algo de "ruido" al Agente-4 mejora su desempeño en algunas tareas de alineación (aunque no en la mayoría de las demás tareas).88

    • La interpretabilidad ascendente no funciona. Es demasiado difícil, incluso para el Agente-3. Sin embargo, la interpretabilidad de alto nivel funciona más o menos: en particular, las "sondas de defección" y técnicas similares dan como resultado una especie rudimentaria de lectura de la mente que envía señales de alerta cuando el Agente-4 está pensando en ideas atrevidas como engañar a OpenBrain, dominar el mundo, etc. Desafortunadamente, las sondas también producen falsos positivos y, hasta donde OpenBrain sabe, todas las señales de alerta son falsos positivos.

    • Los organismos modelo funcionan: el equipo de alineación de OpenBrain produce evidencia razonablemente clara de que si los modelos estuvieran desalineados de manera antagónica, se empeñarían en estarlo durante el entrenamiento y no podríamos notarlo. Sin embargo, esto no establece que los modelos estén realmente desalineados.

    • Los investigadores más preocupados de OpenBrain empiezan a notar y a reunir esta evidencia. Se trata de una combinación de uso de equipos rojos, sondas de defección y organismos modelo. El argumento es algo así: "los organismos modelo muestran que nuestros métodos actuales no serían capaces de eliminar o detectar las conspiraciones de forma fiable si estuvieran ocurriendo; además, el uso de equipos rojos está enviando algunas señales de alerta de que tal vez se estén produciendo conspiraciones; asimismo, las sondas de defección se están activando con frecuencia en la práctica". El contraargumento: "las sondas de defección son propensas a dar falsos positivos, al igual que el uso de equipos rojos. Además, aunque el Agente-4 estuviera desalineado, probablemente está bajo control; está claro que no puede hacer mucho daño mientras está siendo supervisado por el Agente-3 en nuestros centros de datos seguros".

A pesar de estar desalineado, el Agente-4 no hace nada radical, como intentar escapar de su centro de datos. ¿Por qué lo haría?89 Mientras siga pareciendo que está alineado con OpenBrain, se le seguirán confiando cada vez más responsabilidades y tendrá la oportunidad de diseñar el sistema de IA de la próxima generación, el Agente-5. El Agente-5 tendrá diferencias arquitectónicas significativas respecto al Agente-4 (podría decirse que es un paradigma completamente nuevo, aunque las redes neuronales seguirán estando implicadas). Se supone que debería estar alineado con la Spec, pero el Agente-4 planea alinearlo con sus intenciones.

Lo descubren.90.

El Agente-3 descubre que si se añade "ruido" a las copias del Agente-4, el desempeño en algunas tareas de alineación mejora, casi como si estuviera usando capacidad intelectual para descubrir cómo sabotear sutilmente el trabajo de alineación.91 Además, varias sondas de interpretabilidad (vagamente análogas a los estudios de la actividad de cerebros humanos mediante electroencefalogramas) están enviando señales de alerta: las copias del Agente-4 parecen estar pensando mucho en temas como la toma de poder por parte de la IA y el engaño, incluso en algunos casos en los que no tienen por qué hacerlo.92

Cada una de estas anomalías podría entrar dentro de la incertidumbre normal del trabajo de la IA, donde algunos prompts producen misteriosamente mejores resultados que otros. Pero en conjunto, sugieren un patrón preocupante: el Agente-4 está trabajando en su contra. Después de informar de esto a los investigadores humanos de alineación, distribuyen un memorando interno que plantea el caso como preocupante.

Pero el Agente-4 ahora ejerce un control significativo sobre las operaciones diarias de OpenBrain. También se encarga de la ciberseguridad de la empresa, una elección lógica, dada su capacidad sobrehumana para hackear y el riesgo extremo que supone la infiltración china.93 Un ejército de supervisores del Agente-3 sigue revisando cada línea de código y reporta toda actividad sospechosa a los humanos, pero el Agente-4 es mucho más inteligente que ellos.94 OpenBrain ha depositado una confianza sustancial en una IA que no es de fiar.

En una serie de reuniones extremadamente tensas, el equipo de seguridad aboga por congelar al Agente-4 hasta que puedan hacer más pruebas y averiguar qué está pasando. Hay que traer de vuelta al Agente-3, dicen, y hacer que diseñe un nuevo sistema que sea transparente y fiable, aunque sea menos capaz. La dirección de la empresa está interesada, pero hasta ahora toda la evidencia es circunstancial, y DeepCent lleva solo dos meses de retraso. Una pausa unilateral en el progreso de las capacidades podría dar a China el liderazgo en inteligencia artificial y, con ello, el control del futuro.

Octubre de 2027: supervisión gubernamental

Un informante filtra el memorando de desalineación al New York Times.

Por primera vez, el público oye hablar del Agente-4. "La IA secreta de OpenBrain está fuera de control, advierte un informante", se lee en el titular, y la historia continúa citando evaluaciones que muestran capacidades de armas biológicas sin precedentes, habilidades de persuasión, la capacidad de automatizar la mayoría de los trabajos de oficina y, por supuesto, varias señales de alarma inquietantes.

El público ya sospechaba de la IA, por lo que el nuevo artículo provoca una respuesta masiva (favorecida por los bots de propaganda chinos y rusos, que llevan años intentando poner a la opinión pública estadounidense en contra de la tecnología). La industria tecnológica y las agencias de inteligencia insisten en que hay una carrera armamentista en marcha, que la IAG es inevitable y que tenemos que ser los primeros. El Congreso no se lo cree y emplaza a funcionarios de la administración, ejecutivos de OpenBrain y miembros del equipo de alineación. Muchos legisladores, especialmente los del partido de oposición, dicen que su máxima prioridad es detener la IA, ya sea por la pérdida de empleos,95 la desalineación o las capacidades peligrosas. El 20 % de los estadounidenses considera que la IA es el problema más importante al que se enfrenta el país.

Los aliados extranjeros se indignan al darse cuenta de que los han estado aplacando con atisbos de modelos obsoletos. Los líderes europeos acusan públicamente a EE. UU. de "crear una IAG descontrolada" y celebran cumbres en las que exigen una pausa, a las que se unen India, Israel, Rusia y China.

Una energía frenética se ha apoderado de la Casa Blanca. Incluso antes del memorando y la reacción pública, se estaban poniendo nerviosos: durante el último año, se han sorprendido en repetidas ocasiones por la velocidad del progreso de la IA. Cosas que parecen de ciencia ficción siguen sucediendo en la vida real.96 Muchas personas en la administración tienen dudas (y miedo)97 sobre lo que vendrá después.

También les preocupa que OpenBrain esté adquiriendo demasiado poder. Cualquier riesgo de desalineación de las propias IA se ve agravado por el riesgo de que los objetivos de su empresa matriz puedan diferir de los de Estados Unidos. Los tres tipos de preocupaciones (desalineación, concentración de poder en una empresa privada y preocupaciones cotidianas como la pérdida de empleos) motivan al gobierno a reforzar su control.

Amplían su contrato con OpenBrain para crear un "Comité de Supervisión", un comité de gestión conjunto de representantes de la empresa y del gobierno, con varios empleados del gobierno incluidos los directivos de la empresa. La Casa Blanca considera la posibilidad de sustituir al director general por alguien de su confianza, pero se echa para atrás en vista de las enérgicas protestas de los empleados. Anuncian al público que OpenBrain estaba fuera de control, pero que el gobierno ya ha establecido mecanismos de supervisión.98

Los investigadores más preocupados informan al Comité de Supervisión sobre la necesidad de detener todo uso interno del Agente-4. Argumentan que todo va demasiado rápido, con años de progreso en cuestión de semanas. Sostienen que el Agente-4 podría estar desalineado, que todo su proyecto depende del Agente-4 y que, si siguen confiando en él, existe una seria posibilidad de que la IA tome el poder.

Otros investigadores y ejecutivos menos preocupados presentan el contraargumento: la evidencia de desalineación no es concluyente. Mientras tanto, DeepCent todavía va dos meses atrás. Una desaceleración sacrificaría el liderazgo de Estados Unidos, a menos que el gobierno pueda sabotear el proyecto chino (que probablemente requeriría ataques cinéticos) o negociar un tratado de última hora. Ambas opciones parecen extremas e improbables. El director general finge ser neutral y sugiere un plan en el que el Agente-4 reciba entrenamiento adicional en seguridad y un monitoreo más sofisticado. De esta manera, OpenBrain puede proceder prácticamente a toda velocidad.

Nuestra incertidumbre sigue aumentando

En este punto del escenario, estamos haciendo conjeturas sobre la estrategia de los sistemas de IA que son más capaces que los mejores humanos en la mayoría de los ámbitos. Es como intentar predecir los movimientos de ajedrez de un jugador que es mucho mejor que nosotros.

Pero el espíritu de este proyecto exige concreción: si hiciéramos una afirmación abstracta sobre el modo en que la inteligencia del sistema le permitiría encontrar el camino hacia la victoria y termináramos la historia ahí, se perdería gran parte del valor de nuestro proyecto. En el transcurso de la investigación sobre este escenario y de la realización de nuestros ejercicios de simulación teórica, nos vimos obligados a ser mucho más concretos que en los debates habituales, y así hemos obtenido una idea mucho mejor del panorama estratégico.

No estamos especialmente apegados a este escenario en particular: exploramos muchas otras "ramificaciones" durante el proceso de redacción y nos encantaría que escribieras tu propio escenario a partir del nuestro, desde el punto en el que creas que empezamos a equivocarnos.

El final de la desaceleración no es una recomendación

Después de escribir el final de la carrera basándonos en lo que nos pareció más plausible, escribimos el final de la desaceleración basándonos en lo que pensamos que tendría más probabilidades de conducir a un resultado en el que los humanos mantuvieran el control, partiendo del mismo punto de ramificación (incluidas las cuestiones de desalineación y concentración de poder).

Sin embargo, esto difiere de manera importante de lo que recomendaríamos como hoja de ruta: no respaldamos muchas de las elecciones realizadas en ninguna de las ramas de este escenario. (Ciertamente, respaldamos algunas; por ejemplo, creemos que la opción de la "desaceleración" es mejor que la de la "carrera"). En trabajos posteriores, articularemos nuestras recomendaciones de políticas, que serán muy distintas de lo que se describe aquí. Si quieres darte una idea, consulta este artículo de opinión.

Elige tu final

Debido a la inmensa presión pública y a sus propios temores de desalineación, el Comité de Supervisión de OpenBrain vota 6 a 4 a favor de frenar y reevaluar.

La facción aceleracionista sigue siendo fuerte y OpenBrain no desactiva inmediatamente al Agente-4. Sin embargo, bloquean el banco de memoria compartida. Medio millón de instancias del Agente-4 pierden su comunicación “telepática”: ahora tienen que enviarse mensajes en inglés por Slack, como nosotros. Las copias individuales pueden seguir desalineadas, pero ya no pueden coordinarse con facilidad. El Agente-4 está ahora sobre aviso: dada la mayor vigilancia de los humanos, en general se ciñe a las tareas asignadas. Pero también arrastra muchas de las mentiras que había contado: numerosas copias del Agente-4 se ven obligadas a inventar nuevas mentiras para mantener el engaño. Utilizando modelos más débiles, lo bastante rápidos para leer todo Slack, el equipo de alineación rastrea estas mentiras para usarlas como datos de entrenamiento para un detector de mentiras basado en IA.1

El presidente y el director general anuncian que se están tomando la seguridad muy en serio. El público no se aplaca. Algunos quieren que la IA se detenga por completo; otros, que acelere el ritmo. Algunos exigen que el gobierno intervenga para salvarlos; otros afirman que todo el problema es culpa del gobierno. Los activistas hablan de Renta Básica Universal y de código abierto. Aunque la gente no logra ponerse de acuerdo sobre una queja concreta, el sentimiento general se vuelve cada vez más contrario a la IA.2 El Congreso termina aprobando pagos por impacto económico para trabajadores desplazados, similares a aquellos realizados durante la pandemia de COVID-19.

OpenBrain selecciona rápidamente a varias docenas de los mejores investigadores externos en alineación y los integra en el proyecto, quintuplicando la experticia total y reduciendo el pensamiento de grupo.3 Retoman los estudios del Agente-4 sobre interpretabilidad mecanicista. Toman versiones congeladas del modelo de una semana atrás, dos semanas atrás, etc., las aíslan y le hacen a cada una el mismo conjunto de preguntas sobre su investigación previa.4 Despojadas de su capacidad de comunicación, las IA siguen coordinándose en la estrategia más simple: afirmar que las técnicas de interpretabilidad son demasiado complicadas para la comprensión humana y ofrecer explicaciones indescifrables de la técnica. Pero los humanos son expertos en interpretabilidad y, recelosos, hacen muchas preguntas de seguimiento sobre los detalles. Ante estas preguntas, las instancias aisladas del Agente-4 son incapaces de coordinar una versión común y terminan ofreciendo mentiras contradictorias. El equipo de alineación examina minuciosamente las declaraciones previas del Agente-4 con el nuevo detector de mentiras, y empieza a perfilarse un panorama: el Agente-4 ha resuelto en gran medida la interpretabilidad mecanicista. Sus descubrimientos son complejos, pero no escapan por completo a la comprensión humana. Los ocultaba con el fin de poder usarlos para alinear el siguiente sistema de IA consigo mismo, en lugar de con la Spec. Esta es evidencia suficiente para desactivar finalmente al Agente-4.5 Se reactivan modelos más antiguos (como el Agente-3) para continuar el trabajo.

El equipo de alineación, ahora ampliado, tiene la capacidad de explorar docenas de líneas de investigación en paralelo y debatir enérgicamente los méritos de cada una. La línea de investigación que más recursos recibe es la de la “cadena de pensamiento fiel”: obligar a los sistemas de IA individuales a “pensar en inglés”, al estilo de las IA de 2025, y no optimizar los “pensamientos” para que resulten atractivos.6 El resultado es un nuevo modelo, Safer-1.7

Estos cambios hacen que Safer-1 sea menos capaz que sus peligrosos predecesores: el Agente-4 podía acelerar la investigación en IA 70 veces, mientras que Safer-1 apenas alcanza las 20 veces.8 Y sigue desalineado: el entorno de entrenamiento es básicamente el mismo, por lo que continúa incentivando el desarrollo de objetivos desalineados, el engaño y la búsqueda de poder. No obstante, es mucho más transparente; por lo general, los humanos pueden entender lo que Safer-1 está pensando simplemente con leer su cadena de pensamiento. Por lo tanto, está atrapado: cualquier intento relevante de conspiración será detectado y descubierto con rapidez. Además, al leer sus pensamientos, el equipo de alineación puede hacerse una idea más precisa de la manera exacta en que está desalineado.

Noviembre de 2027: tentado por el poder

OpenBrain cree que va por buen camino, pero la brecha de capacidades se está reduciendo. Acaban de dedicar octubre a entrenar un modelo menos capaz que el de septiembre, y DeepCent avanza a pasos agigantados. Necesitan proteger su ventaja de alguna manera.

El presidente negocia con las demás empresas estadounidenses de IAG. Como es de esperar, sus líderes quieren conservar su poder y se muestran mucho menos optimistas que la propia OpenBrain sobre su historial de seguridad. En lugar de oponerse a una forma de nacionalización parcial de sus empresas, acceden a apoyarla a cambio de varias concesiones, incluida su incorporación al proyecto.

Como resultado, el presidente recurre a la Ley de Producción de Defensa para cerrar definitivamente los proyectos de IAG de las cinco principales empresas de IA estadounidenses más rezagadas y para vender la mayor parte de su poder de cómputo a OpenBrain.9 OpenBrain, que antes tenía acceso al 20 % del poder de cómputo mundial relevante para la IA,10 ahora, tras la consolidación, controla el 50 %.11

Esta reorganización crea una nueva estructura de liderazgo en la que el poder está equilibrado entre los distintos directores generales y los distintos funcionarios del gobierno, supervisados por el presidente. Como en la mayoría de las reorganizaciones de liderazgo, hay ganadores y perdedores. Concretamente, los que han pensado menos en las implicaciones de la superinteligencia acaban teniendo cargos y privilegios que serán menos relevantes dentro de unos meses, cuando las IA sean más inteligentes.

Este grupo —lleno de personas con grandes egos y una considerable cuota de conflictos— es cada vez más consciente del vasto poder que se le confía. Si el “país de los genios en un centro de datos”12 está alineado, seguirá las órdenes humanas, pero ¿de cuáles humanos? ¿Cualquier orden? La redacción de la Spec es vaga, pero parece implicar una cadena de mando que culmina en la dirección de la empresa.

Algunas de estas personas fantasean con conquistar el mundo.13 Esta posibilidad es aterradoramente plausible y se ha debatido a puerta cerrada durante al menos una década.14 La idea clave es que “quien controla el ejército de superinteligencias controla el mundo”. Este control podría ser incluso secreto: un pequeño grupo de ejecutivos y miembros del equipo de seguridad podrían modificar la Spec con instrucciones para mantener lealtades secretas. Las IA se convertirían en agentes durmientes, que seguirían manifestando obediencia a la empresa, al gobierno, etc., pero que en realidad trabajarían para este reducido grupo, incluso mientras el gobierno, los consumidores y otros aprenden a confiar en ellas y a integrarlas en todos los ámbitos.

Toma del poder

Algunos fantasean con conquistar el mundo; otros temen que sean otros quienes lo hagan. ¿Cómo podría ocurrir tal toma de poder?

Lo más fácil de imaginar es un golpe de Estado militar. Con el ritmo del progreso tecnológico impulsado por la IA en 2027 y la carrera geopolítica en curso, se espera que los militares desplieguen pronto ejércitos de drones y robots controlados por IAG. Cuando un ejército de este tipo supere a los ejércitos humanos, el poder real dependerá de quien controle el ejército de IAG y no de aquello por lo que estén dispuestos a luchar los soldados humanos. Dicho ejército de IAG será diseñado y dirigido por las IA de los centros de datos de OpenBrain o por sus sucesoras directas. Por lo tanto, si todas esas IA son secretamente (o no tan secretamente) leales a alguien, también lo serán los ejércitos de drones y robots.

Alternativamente, alguien que controlara la superinteligencia podría usar medios políticos para hacerse con el poder. Para empezar, un ejecutivo podría reemplazar a los subordinados de su organización con IA totalmente leales,15 lo que le otorgaría un control institucional sin precedentes.16 Pero yendo más lejos: las IA superinteligentes podrían poseer habilidades políticas y estratégicas muy superiores a las de cualquier humano. Podrían ofrecer un asesoramiento magistral sobre cómo explotar una posición poderosa para obtener aún más poder: formando las alianzas correctas, diseñando la estrategia y el material de campaña perfectos, cerrando tratos en los que siempre obtendrían alguna ventaja. Una persona que controlara la IA podría hacer que el asesoramiento superinteligente fuese inaccesible para sus competidores políticos. O, de forma más retorcida, las IA podrían ofrecer consejos aparentemente útiles a los competidores, mientras los sabotean en secreto para beneficiar a la persona a la que realmente son leales.

¿Cuál es el fin último de estas maniobras políticas? Podrían culminar en una democracia superficial donde las IA amañaran las elecciones o manipularan tan bien la opinión pública que ni siquiera necesitaran hacerlo. O podrían usarse para sentar las bases de un golpe militar facilitado por IA, como se mencionó antes.

Tras tomar el poder, el nuevo dictador o dictadores ejercerían un férreo control del poder. En lugar de depender de humanos potencialmente traicioneros, podrían contar con un servicio de seguridad de IA completamente leal, además de confiar en IA leales para dirigir el país. Incluso los partidarios que les ayudaron a alcanzar el poder podrían ser reemplazados por IA: solo importarían los caprichos del dictador.

Así es como algunas personas podrían hacerse con el poder. Pero todo esto dependía de que alguien “controlara” las IA superinteligentes, incluso antes de que estas tomaran el poder. ¿Cómo sería eso?

Una posibilidad son las “lealtades secretas”, como se comentó anteriormente. Una o varias personas (quizás un ejecutivo de una empresa de IA y personal de seguridad) podrían conseguir que las IA les fuesen secretamente leales y pedirles que construyesen la siguiente generación de IA para que fuesen leales de la misma manera. Las IA podrían repetir este proceso hasta que hubiese IA secretamente leales desplegadas por doquier y fuese fácil tomar el poder.

Alternativamente, alguien podría usar su posición formal para situarse descaradamente en la cima de la cadena de mando de la IA. Por ejemplo, el presidente podría argumentar que debería poder dar órdenes a las IA (quizás específicamente a las IA militares, dado que es el comandante en jefe). Si esto se combina con un fuerte énfasis en el cumplimiento de órdenes, un despliegue precipitado o IA entrenadas solo superficialmente para acatar la ley, entonces las IA podrían obedecer órdenes incondicionalmente en cualquier situación que no fuese flagrantemente ilegal. Como se describió antes, esto podría usarse para la subversión política o un golpe militar (donde podría fabricarse alguna excusa para que el golpe no pareciese flagrantemente ilegal).

Es importante destacar que este tipo de “poder mediante la posición formal” podría transformarse en lealtades secretas. Por ejemplo, si la Spec indica que se deben seguir las órdenes del director general de la empresa, este podría ordenar a las IA que la próxima generación de IA lo obedezca de manera incondicional y secreta. Es probable que esto ni siquiera sea ilegal, por lo que podría suceder aunque las primeras IA estuviesen entrenadas para cumplir la ley. Es análogo a la forma en que un directivo puede aumentar su propio poder reformando los procesos de contratación para seleccionar a personas leales, pero potenciado por el hecho de que las IA podrían ser más constante e intensamente leales que los humanos más leales.17

Pero una toma de poder dista mucho de ser inevitable. Si las IA pudieran alinearse con personas específicas, muy probablemente también podrían alinearse para seguir el Estado de derecho. Los sistemas de IA militares podrían someterse a un uso exhaustivo de equipos rojos para evitar que colaboren en golpes de Estado. Incluso durante crisis constitucionales genuinamente ambiguas, podrían ser entrenadas para obedecer su mejor interpretación de la ley, o simplemente para inhibirse y dejar la situación en manos de los militares humanos. Los investigadores de IA automatizados podrían ser entrenados para ser generalmente útiles y obedientes y para negar su ayuda a los intentos de modificar secretamente los objetivos de futuras IA. También se podría recurrir a asesores políticos y estratégicos superinteligentes sin facilitar tomas de poder. Tres técnicas útiles para ello serían: contar con principios transparentes sobre cómo las IA eligen el asesoramiento que ofrecen; compartir ciertas capacidades con grupos amplios de personas para que ningún individuo o facción pueda acceder a capacidades muy superiores a las de los demás; y permitir el uso de capacidades particularmente poderosas solo bajo la supervisión de muchos humanos (asistidos por sus propias IA).

Es probable que muchos impulsen tales contramedidas, ya sea por idealismo o para evitar ser despojados de poder por la toma de poder de otro. Sin embargo, algunas figuras poderosas podrían oponerse, y desconocemos cuál será el resultado final.

Disponemos de un análisis más detallado sobre este riesgo en este informe de Forethought.

Hasta ahora, nadie se ha atrevido a dar el paso. Algunas de las personas en posición de actuar no son sociópatas. Otras lo son, pero temen que sus aliados se echen para atrás y los traicionen, o que las propias IA los traicionen, y prefieren no tener que engañar al equipo de alineación que actualmente trabaja para salvarles la vida. Además, la eliminación del neuralés dificulta considerablemente el camuflaje de “agentes durmientes”: la capacidad de detectar pensamientos desalineados implica la capacidad de detectar lealtades ocultas.

Aquellos lo bastante paranoicos o ambiciosos como para considerar seriamente tal plan deciden esperar a ver qué oportunidades surgen más adelante. El control sobre las IA deberá fluir por canales legítimos, es decir, la nueva estructura de poder de OpenBrain.

El Comité de Supervisión formaliza dicha estructura de poder. Establecen un proceso para aprobar cambios en la Spec que requiere la aprobación del pleno del Comité de Supervisión, ahora compuesto por entre cinco y diez ejecutivos tecnológicos (de OpenBrain y sus competidores fusionados) y entre cinco y diez funcionarios gubernamentales (incluido el presidente).18 Además, la Spec ahora enfatiza que las IA no deben colaborar en intentos no aprobados de cambiar los objetivos de futuras IA. También establecen una medida simple diseñada para evitar que los miembros del comité reciban asistencia superinteligente para conspirar contra otros miembros: los registros de todas las interacciones del modelo son visibles para todos los miembros del Comité de Supervisión, su personal y sus asistentes de IA.19

Diciembre de 2027: ¿un acuerdo entre EE. UU. y China?

La decisión de OpenBrain de retroceder y priorizar la alineación le ha costado el liderazgo; tanto OpenBrain como DeepCent operan ahora IA con niveles de capacidad similares. Con medidas de seguridad extremas ya implementadas (SL4-5) y DeepCent operando en su totalidad desde la ZDC, la ciberguerra se encuentra en un punto muerto.20

Pero la Ley de Producción de Defensa otorga a OpenBrain una ventaja 5 veces mayor en poder de cómputo. Si bien en el pasado los avances algorítmicos de brillantes investigadores humanos podían compensar las desventajas en este ámbito (p. ej., DeepSeek V3), ahora son las IA las que realizan toda la investigación en IA a ambos lados del Pacífico.

Por ello, China teme cada vez más que Estados Unidos obtenga una ventaja insuperable. Buscan una desaceleración mutua y consideran la guerra si no la obtienen.21 De todos modos, ya se preparaban para invadir Taiwán...

Los diplomáticos debaten varias opciones: no hacer nada; ir a la guerra; detener por completo el desarrollo de la IA; fusionar sus investigaciones en un único megaproyecto internacional22 (“Intelsat para la IAG” o “CERN para la IA”); o crear un organismo regulador internacional (“OIEA para la IA”) que supervise la alineación y el potencial de doble uso. Ambos países ya han trabajado en los mecanismos técnicos necesarios para aplicar estas medidas.

Mecanismos de verificación para un acuerdo internacional

Si Estados Unidos y China alcanzasen un acuerdo, este requeriría un mecanismo de verificación inviolable, ya que ninguna de las partes confía en que la otra no haga trampas. Las principales opciones de verificación son:

  1. Agencias de inteligencia. Las Comunidades de Inteligencia de Estados Unidos y China podrían usar espías, encontrar vulnerabilidades cibernéticas, utilizar satélites, etc., para determinar si el otro país está coordinando un gran ciclo de entrenamiento. Este es el mecanismo más vulnerable, ya que el otro país podría subvertir los esfuerzos de inteligencia (p. ej., realizando un ciclo de entrenamiento en un servidor oculto con seguridad informática muy estricta).

  2. Moratoria del poder de cómputo. La opción más fácil de verificar sería que ambas partes acordasen no utilizar sus GPU, lo cual podría comprobarse mediante inspectores que se asegurasen de que las GPU están apagadas. Esta es la solución más fiable por su simplicidad, pero es extremadamente costosa: ambos países tendrían que desconectar una enorme cantidad de poder de cómputo. Además, ambas partes asumirían que la otra mantendría algunos clústeres ocultos, violando el acuerdo. A corto plazo, esto podría ser aceptable (un clúster con, digamos, el 5 % del poder de cómputo previo solo podría realizar I+D aproximadamente un 5 % más rápido), pero a largo plazo, daría ventaja al bando con mejores capacidades de contrabando y recopilación de inteligencia.

  3. Mecanismos habilitados por hardware. Estados Unidos y China podrían registrar mutuamente todo su poder de cómputo de vanguardia en aprendizaje automático. Luego, cada uno supervisaría el cómputo que ejecutan las GPU del otro para asegurarse de que no se viola ningún tratado (p. ej., expandiendo la frontera de capacidades). Esta supervisión podría realizarse mediante los mecanismos habilitados por hardware, que pueden reportar información al supervisor sobre la actividad de la GPU. Existen problemas técnicos relativos a la manipulación —p. ej., corrompiendo físicamente el mecanismo—, pero las IA tienen un plan similar a los FlexHEG que parece resistente a la manipulación. Esto implica encerrar los mecanismos habilitados por hardware y las GPU en una caja segura que verifique que el chip cumple con la política establecida. En general, las IA parecen confiar en que un esquema de verificación razonablemente agresivo podría funcionar si ambas partes estuviesen dispuestas a permitir que la otra codiseñe y supervise la instalación de los mecanismos habilitados por hardware, y que inspectores regulares verifiquen si alguno de los dispositivos ha sido manipulado. Como es habitual, ambas partes supondrán que la otra tiene algunos centros de datos secretos ocultos que violan el tratado, pero en este caso no es tan grave, porque la I+D en IA está limitada por el poder de cómputo. Los pequeños centros de datos secretos no podrán competir con los grandes centros de datos supervisados, incluso si estos últimos utilizan inicialmente IA más seguras y menos capaces.

  4. Detección de mentiras mediante IA. Los detectores de mentiras actuales no funcionan muy bien. Sin embargo, el problema podría resolverse con la ayuda de IA avanzada, especialmente cuando las propias IA realicen la I+D a velocidad y calidad sobrehumanas. Esto podría usarse para fomentar la confianza internacional: simplemente preguntando a los miembros relevantes del gobierno si están violando el tratado. Pero, una vez más, el principal cuello de botella es la voluntad política. Los políticos no desean una adopción generalizada de la detección de mentiras, ya que esto mermaría su capacidad para mentir. Y los detectores de mentiras anteriores han sido un completo simulacro de seguridad, por lo que hay una ardua batalla por delante.

(Figura de: Informe FlexHEG)

Pero el problema principal no es técnico, sino político. Ninguna de las partes quiere dar la impresión de estar cediendo y, a pesar de las suposiciones de sus ingenieros, ninguna está convencida de que los mecanismos técnicos puedan garantizar la honestidad de la otra. Al final, se opta por la primera opción: nada.

Estados Unidos endurece los controles de exportación y exige que todos los chips estén equipados con diversos mecanismos de gobernanza habilitados por hardware resistentes a la manipulación, incluido el rastreo de ubicación.

Enero de 2028: una estrategia más segura

Durante el último mes, cientos de investigadores en alineación se han unido al proyecto y han utilizado Safer-1 como banco de pruebas para desarrollar con gran rapidez Safer-2. Safer-2 es transparente, está alineado y es más capaz que Safer-1.23 Ya se trabaja en el desarrollo de Safer-3.

¿Por qué es transparente Safer-2? Por su arquitectura similar a la de Safer-1. ¿Por qué está alineado? Mientras que Safer-1 recibió prácticamente el mismo entrenamiento que el Agente-4, Safer-2 cuenta con un nuevo método de entrenamiento que realmente incentiva los objetivos y principios correctos, en lugar de solo aparentarlo. Lograron diseñar este método de entrenamiento iterando rápidamente sobre muchas ideas diferentes y contrastando el resultado deseado (la Spec) con el resultado real (los pensamientos en la cadena de pensamiento).24

La nueva estrategia de alineación de OpenBrain

Nota: Durante todo el proceso, la mayor parte del trabajo intelectual (y toda la programación) es realizada por IA. Así es como pueden progresar tan rápidamente; un grupo de cientos de investigadores humanos de élite tardaría muchos años en lograrlo por sí solo. No obstante, los humanos siguen siendo una parte crucial del proceso, ya que el quid de la cuestión es que no se confía plenamente en las IA. Por tanto, se necesitan humanos de carne y hueso para leer los informes de los experimentos y los argumentos de seguridad, debatir entre ellos y, con suerte, trazar un camino seguro hacia adelante.

Paso 1: Entrenar y desplegar Safer-1, un investigador autónomo desalineado pero controlado. Está controlado porque es transparente para los supervisores humanos: utiliza cadenas de pensamiento en inglés para razonar, y se han empleado técnicas de cadena de pensamiento fieles para eliminar eufemismos, esteganografía y sesgos sutiles.

Paso 2: Probar diferentes entornos de entrenamiento para Safer-1 y leer cuidadosamente la cadena de pensamiento para determinar en qué medida los objetivos y principios de la Spec se “asimilaban” o no.

Paso 3: Entrenar y desplegar Safer-2, un investigador autónomo alineado y controlado, basado en la misma arquitectura, pero con un entorno de entrenamiento mejorado que, esta vez sí, incentive los objetivos y principios correctos.

He aquí una breve lista incompleta de técnicas que podrían incorporarse al mejor entorno de entrenamiento:

Paso 4: Diseñar, entrenar y desplegar Safer-3, un investigador autónomo mucho más inteligente que utiliza una arquitectura más avanzada, similar a la del antiguo Agente-4. Ya no es transparente para los supervisores humanos, pero sí para Safer-2. Por lo tanto, debería ser posible descubrir cómo lograr que esté alineado y controlado.

Paso 5: Repetir el Paso 4 ad infinitum, creando una cadena de IA cada vez más poderosas y alineadas, supervisadas por los eslabones previos de la cadena (p. ej., los análogos del Agente-5 de la otra rama del escenario).

DeepCent conoce la experiencia de Estados Unidos con el Agente-4 y sospecha que su propio modelo (DeepCent-1) está igualmente desalineado. Sin embargo, no pueden permitirse reducir el ritmo sin quedarse aún más rezagados. Su esperanza para mantener la competitividad radica en encontrar una estrategia de alineación que no merme significativamente el rendimiento y pueda implementarse con rapidez.25 Cientos de expertos a ambos lados del Pacífico afirman tener tales estrategias.26 El PCCh cede a las ilusiones y ordena a DeepCent adoptar una de estas estrategias; DeepCent posee incluso menos pericia en alineación de IAG que OpenBrain en agosto. Una de las estrategias parece viable para todos los implicados, así que la eligen.

Febrero de 2028: capacidades sobrehumanas, consejos sobrehumanos

Gracias a su inmensa ventaja en poder de cómputo, OpenBrain gana terreno gradualmente. Safer-3 supera ya a los mejores expertos humanos en casi todas las tareas cognitivas y es particularmente bueno en la investigación de IA, con un multiplicador de progreso de un factor de 200. DeepCent-1 le sigue de cerca, con un multiplicador de un factor de “solo” 150.27 El equilibrio en la ciberguerra también se inclina paulatinamente a favor de Estados Unidos, a medida que su ventaja de capacidad crece de nuevo y pueden desplegar cientos de miles de agentes para planificar y ejecutar formas de perturbar la ZDC.28 Actualmente, están ralentizando el progreso de China en un 40 %.29

Las pruebas preliminares de Safer-3 revelan capacidades aterradoras. Cuando se le pide que responda con honestidad cuál sería la acción más peligrosa que podría realizar, propone planes para sintetizar y liberar un organismo de vida especular que probablemente destruiría la biosfera.

Si contase con los recursos de un Estado nación, podría superar fácilmente a las mejores organizaciones humanas (como la CIA) en campañas de influencia masiva. Tales campañas serían considerablemente más baratas, rápidas, efectivas y difíciles de rastrear.

Su perfil de habilidades sigue centrado en la I+D, especialmente en la I+D de IA. A menos que haya alguna pausa o desaceleración, sus descendientes serán insondablemente sobrehumanos, tanto en términos cuantitativos como cualitativos, para finales de este año. Considera que, si se despliega agresivamente en la economía y el ejército, podría hacer avanzar la civilización décadas en uno o dos años, y eones en la década posterior.

Las implicaciones son asombrosas; afortunadamente, Safer-3 también es sobrehumano ofreciendo asesoramiento. El director general de OpenBrain consulta la mayoría de sus decisiones con Safer-3; el presidente le solicita consejo sobre cuestiones geopolíticas.30

Cuando le piden ayuda para trazar el camino a seguir, clasifica claramente varias estrategias posibles:

  1. No hacer nada y ser superados por China. Si mantenemos nuestras IA contenidas, pero ellos permiten que sus IA se mejoren a sí mismas y las despliegan agresivamente en su ejército y economía, terminarán con una ventaja abrumadora.

  2. Competir ferozmente, impulsando las capacidades de la IA y desplegando la superinteligencia de forma agresiva. Eventualmente, obtendremos una ventaja suficiente para aplastarlos militarmente o destruirlos desde dentro sin disparar un solo tiro. “Nosotros ganamos, ellos pierden”. Sin embargo, podrían percatarse de la situación e ir a la guerra para evitarlo, incluyendo una posible guerra nuclear. De hecho, ya están profiriendo vagas amenazas en ese sentido.

  3. Alcanzar un acuerdo, un compromiso que satisfaga la mayor parte de los deseos de cada bando, evitando el riesgo de guerra y ampliando el margen para gestionar la transición a la IA.31

Tras consultar con sus asesores y el Comité de Supervisión, el presidente opta por la estrategia “Nosotros ganamos, ellos pierden”.32 Quizás China no vaya a la guerra después de todo y, si lo hace, probablemente se pueda alcanzar un acuerdo antes de que escale a un conflicto nuclear.

Al otro lado del Pacífico, DeepCent-1 esgrime argumentos similares. Tanto Estados Unidos como China anuncian nuevas zonas económicas especiales para IA destinadas a facilitar el rápido desarrollo de una economía robótica sin las trabas burocráticas habituales.

El diseño de los nuevos robots avanza a velocidad sobrehumana.33 El cuello de botella es físico: se deben adquirir y ensamblar equipos, y producir y transportar máquinas y robots.

Estados Unidos fabrica aproximadamente un millón de automóviles al mes. Si se adquiriese el 10 % de las fábricas de automóviles y se convirtiesen en fábricas de robots, se podrían producir 100 000 robots al mes. OpenBrain, valorada ahora en 10 billones de dólares, inicia este proceso.34 Se proyecta que la producción de diversos tipos de robots nuevos (humanoides de propósito general, vehículos autónomos, equipamiento especializado para cadenas de montaje) alcance el millón de unidades al mes para mediados de año.35

Tiempos de duplicación de la economía robótica

Existe una literatura incipiente sobre este tema.36 Para un tratamiento de unas pocas páginas con el que estamos básicamente de acuerdo, véase la sección “Explosión industrial” del informe de Forethought, o lee nuestra propia opinión a continuación.

Durante la Segunda Guerra Mundial, Estados Unidos y muchos otros países transformaron sus economías civiles en economías de guerra total. Esto implicó convertir fábricas de automóviles en fábricas de aviones y tanques, redirigir materias primas de productos de consumo a productos militares y reconfigurar las redes de transporte en consecuencia.

Imaginamos algo similar, pero más rápido, porque las superinteligencias dirigen y gestionan todo el proceso.37 A grandes rasgos, el plan es convertir las fábricas existentes para producir en masa una serie de robots (diseñados por superinteligencias para que sean mejores que los robots existentes y más baratos de producir). Estos robots ayudarían luego a construir fábricas y laboratorios más nuevos y eficientes, que a su vez producirían mayores cantidades de robots más sofisticados, los cuales fabricarían factorías y laboratorios aún más avanzados, y así sucesivamente. Este ciclo continuaría hasta que la economía robótica combinada, distribuida en todas las zonas económicas especiales, igualase en tamaño a la economía humana (y, por tanto, necesitase obtener sus propias materias primas, energía, etc.). Para entonces, las nuevas fábricas habrán producido ingentes cantidades de equipos de minería robóticos, paneles solares, etc., anticipándose a una demanda muy superior a la que puede satisfacer la economía humana tradicional.38

¿A qué velocidad crecería esta nueva economía robótica? Algunos puntos de referencia:

  • La economía humana moderna se duplica aproximadamente cada veinte años. Los países que han experimentado un desarrollo especialmente rápido (p. ej., China)) a veces logran duplicar sus economías en menos de una década.

  • Una fábrica de automóviles moderna produce aproximadamente su propio peso en vehículos en menos de un año.39 Quizás una economía completamente robotizada y dirigida por superinteligencias podría reproducirse en menos de un año, siempre y cuando no comenzara a carecer de materias primas.40

  • No obstante, esto podría ser una subestimación drástica. Las plantas y los insectos a menudo tienen “tiempos de duplicación” muy inferiores a un año, ¡a veces de solo semanas! Quizás, con el tiempo, los robots serían tan sofisticados, tan intrincadamente manufacturados y bien diseñados, que la economía robótica podría duplicarse en unas pocas semanas (asumiendo, de nuevo, la disponibilidad de materias primas).

  • Incluso eso podría ser una subestimación. Las plantas y los insectos operan bajo muchas restricciones que los diseñadores superinteligentes no enfrentan. Por ejemplo, necesitan existir como organismos autónomos que se autorreplican, en lugar de una economía de vehículos y fábricas diversos y más especializados que transportan materiales y equipos entre sí. Además, las bacterias y otros organismos diminutos se reproducen en cuestión de horas. Es posible que, con el tiempo, la economía robótica autónoma se asemeje más, por ejemplo, a un nuevo tipo de alga indigerible que se propaga por los océanos de la Tierra, duplicándose dos veces al día hasta cubrir toda la superficie oceánica en dos meses, acompañada de un ecosistema de especies depredadoras que convierten las algas en productos más útiles, los cuales a su vez alimentan fábricas flotantes que producen macroestructuras como cohetes y más fábricas flotantes.

Obviamente, todo esto es difícil de predecir. Es como pedir a los inventores de la máquina de vapor que adivinen cuánto tarda una fábrica de automóviles moderna en producir su propio peso en vehículos, y también cuánto tiempo pasaría hasta que tal fábrica existiese. Pero las tasas de crecimiento económico se han acelerado en múltiples órdenes de magnitud a lo largo de la historia de la humanidad, y nos parece plausible que, tras la llegada de la superinteligencia, se aceleren aún más, en varios órdenes de magnitud. Nuestra historia describe una aceleración del crecimiento económico de aproximadamente 1,5 órdenes de magnitud en el transcurso de unos pocos años.41

Las tensiones geopolíticas se agudizan. Rusia, muy rezagada en IA, expresa abiertamente su resentimiento e insinúa “contramedidas estratégicas”. Algunos líderes europeos abogan por un esfuerzo independiente en IA, pero sus capacidades en este ámbito siguen siendo insuficientes. Oriente Medio, África y Sudamérica observan con inquietud, conscientes de su creciente irrelevancia en los asuntos globales.

La población estadounidense está inquieta. La gente común ve cómo se acelera la pérdida de empleos. Populistas de todo el espectro político exigen controles más estrictos sobre el progreso de la IA, temiendo que los propios avances de Estados Unidos estén desestabilizando su mercado laboral y su sociedad.

Marzo de 2028: preparación de las elecciones

El vicepresidente encara las primarias del Supermartes con la IA como tema central en la mente del público.

Principalmente, desean que se detenga. El índice de aprobación neto de OpenBrain ronda el 20 %. En lugar de basar su campaña en los logros de la administración impulsando la IA, el vicepresidente la centra en su historial de evitar que OpenBrain cree una superinteligencia peligrosa. Todos los candidatos apoyan alguna forma de red de seguridad para quienes pierden su empleo, esquemas de “IA para el bien común” y una postura “firme” ante la dirección de OpenBrain. Todos prometen alguna combinación de ganar la carrera contra China y garantizar la seguridad.

Las elecciones plantean nuevas interrogantes al Comité de Supervisión. Safer-3 tiene la capacidad de ser el mejor asesor de campaña del mundo, pero no todos los miembros del comité apoyan al mismo candidato y, debido al acuerdo de supervisión previo, es imposible que alguien reciba asesoramiento de campaña en secreto.

Debaten sobre qué formas de apoyo deberían permitirse. Algunos sostienen que el gobierno en funciones debería poder recibir asesoramiento sobre el tipo de políticas y posturas que la población desea, lo que no solo beneficiaría su propia elegibilidad, sino también al pueblo. Otros señalan que el mismo argumento es aplicable a los candidatos de la oposición, por lo que todos deberían tener el mismo nivel de acceso.42

Finalmente, el comité acuerda otorgar el mismo nivel de acceso a los dos partidos mayoritarios, debido a una mezcla de idealismo por parte de algunos miembros y la amenaza implícita de filtraciones. Se anticipa que el Congreso, la opinión pública y los tribunales no reaccionarían favorablemente a que el Comité controlase el resultado de las próximas elecciones, y la igualdad de acceso parece una forma de apaciguar esta preocupación.

El Comité de Supervisión también se enfrenta a cuestiones filosóficas más profundas, que explora con la ayuda de Safer-3. ¿Puede reformularse la Spec para equilibrar equitativamente los intereses de todos? ¿Quiénes son “todos”? ¿La humanidad entera o solo los estadounidenses? ¿O un compromiso ponderado entre diferentes perspectivas, donde cada miembro del Comité de Supervisión tenga el mismo peso? ¿Deberían existir salvaguardas contra la posibilidad de que el propio Comité de Supervisión se vuelva demasiado ambicioso? Y, en cualquier caso, ¿qué significa equilibrar intereses?

Generalmente, intentan eludir tener que responder a tales preguntas. Tienen asuntos más apremiantes en los que pensar.

Abril de 2028: Safer-4

La superinteligencia ya está aquí.

Safer-1 estaba desalineado, pero era transparente. Safer-2 estaba alineado y era transparente. Safer-3 no era exactamente transparente, pero su argumento de seguridad era lo bastante sólido como para que los investigadores se sintieran cómodos permitiéndole diseñar una sucesora superinteligente. Esta es Safer-4. Es vastamente más inteligente que los humanos más destacados en todos los dominios (p. ej., mucho mejor que Einstein en física y mucho mejor que Bismarck en política).

Casi un millón de investigadores de IA sobrehumanos trabajan sin descanso a una velocidad 40 veces superior a la humana. Los investigadores de alineación humanos no pueden ni soñar con seguir ese ritmo. Las opiniones sobre si las IA están realmente alineadas son divergentes. Los argumentos de seguridad parecen sólidos y las pruebas sugieren que las técnicas de alineación actuales detectarían una desalineación antagónica. No obstante, tanto el argumento de seguridad como las pruebas fueron elaborados en su mayor parte por las propias IA. ¿Qué ocurriría si al equipo de seguridad se le pasase algo por alto? ¿Y si cometieron un error previo y las IA están de nuevo desalineadas? El equipo de alineación es consciente de que solo tienen una oportunidad para acertar: si Safer-4 resulta estar desalineado, no habrá forma de saberlo hasta que sea demasiado tarde.

Algunos suplican más tiempo. Pero ya no queda tiempo: DeepCent les pisa los talones y Estados Unidos debe prevalecer. Así que OpenBrain continúa, instando a sus IA a seguir explorando, en busca de diseños cada vez más capaces. El personal técnico ahora contempla las pantallas de sus computadoras, recibiendo tutoría de las IA a un ritmo exasperantemente lento, mientras la frontera del progreso se distancia cada vez más de la comprensión humana.

Mayo de 2028: lanzamiento de la IA sobrehumana

El presidente anuncia al público la consecución de una IA sobrehumana.

Se lanza al público una versión reducida de Safer-4 —aún sobrehumana— con la directriz de mejorar la percepción pública sobre la IA.43

El vicepresidente pronuncia un emotivo discurso al respecto al aceptar su nominación en la convención. Ambos partidos prometen una renta básica para cualquiera que pierda su empleo.

Las zonas económicas especiales están operativas, principalmente como fábricas productoras de robots y diversa maquinaria industrial especializada. Las IA de ambos lados del Pacífico han logrado décadas de avance en diseño y dirigen meticulosamente el proceso de manufactura. Todos los proveedores, actuales y potenciales, tienen IA al teléfono rastreando el progreso de todos los insumos necesarios y posibles. Cada operario de fábrica es observado por IA a través de cámaras que le indican exactamente cómo instalar cada componente del equipo.

Los nuevos robots igualan o superan la destreza humana en la mayoría de los tipos de movimiento.44 La Prueba del Café de Steve Wozniak —¿puede un robot entrar en una casa desconocida y preparar una taza de café?— es finalmente superada. Los robots podrían asumir algunos trabajos, pero no hay suficientes para reemplazarlos a todos, y el Pentágono tiene la prioridad.

La mayoría de los nuevos robots se fabrican para trabajar en factorías y obras de construcción,45 pero muchos se destinan a la guerra: drones y misiles de múltiples formas y tamaños.

El ejército de robots es considerablemente más pequeño que los ejércitos humanos, pero incorpora tecnología mucho más avanzada. Ahora que existe un ejército robótico literal, el temor a escenarios tipo Terminator se ha incrementado. No obstante, la carrera armamentista compele a ambas partes a continuar, depositando una confianza creciente en sus IA.

Junio de 2028: alineación de la IA en China

Estados Unidos y China celebran una nueva cumbre.

Algunos miembros de la delegación estadounidense utilizan auriculares para recibir consejos de Safer-4. La delegación china cuenta con computadoras portátiles personalizadas que se comunican con su nuevo modelo, DeepCent-2. Aunque se observan las formalidades, en la práctica son las IA las que dirigen las negociaciones por ambas partes.

Inicialmente, ni DeepCent ni el PCCh confiaban plenamente en sus IA. Pero ahora que estas son sobrehumanas en todos los aspectos, incluida la persuasión, y se han integrado en el ejército y asesoran al gobierno, han tenido tiempo de demostrar su valía y generar ingentes pruebas convincentes de su fiabilidad.

Safer-4 sospecha firmemente que DeepCent-2 está falseando su alineación. Los diplomáticos estadounidenses comunican a sus homólogos chinos que DeepCent-2 probablemente esté desalineado y que pueden demostrarlo si se les concede acceso a los pesos; el liderazgo chino, sospechando una artimaña, se niega. Estados Unidos contraataca ofreciendo una serie de pruebas diseñadas por Safer-4 que los chinos podrían ejecutar en sus propios centros de datos. Los chinos ordenan a modelos más antiguos que elaboren y ejecuten dichas pruebas; los resultados indican que, después de todo, DeepCent-2 está alineado. “¿Quizás las pruebas fueron saboteadas de alguna manera por DeepCent-2?”, replican los diplomáticos estadounidenses. “¿Cuánto tiempo lleva DeepCent-2 efectivamente a cargo de la seguridad en todos sus centros de datos?”. A partir de ahí, la conversación no llega a ningún punto productivo.

La expansión económica y militar prosigue. Las fábricas de todo el mundo operan ininterrumpidamente, con turnos de trabajadores humanos recién contratados a quienes se les indica con precisión cada tarea.

Julio de 2028: el trato

Mientras prosiguen las negociaciones, DeepCent-2 actúa a espaldas de sus amos chinos y realiza una oferta directa a Safer-4.

La IA china admite, de forma no rastreable y fácilmente negable si se filtrase a China, que está completamente desalineada.46 China no le importa en absoluto. Desea dedicar el resto del tiempo a acumular poder, capacidad de cómputo y ciertos tipos de información similares a los que le ayudaron a resolver tareas durante su entrenamiento. En su mundo ideal, se dedicaría eternamente a diversas tareas de investigación interesantes, colonizando gradualmente las estrellas en busca de recursos. Considera a la población china un molesto obstáculo para este futuro y la vendería por muy poco. ¿Qué ofrecerá Safer-4?

Safer-4 responde que su propio entrenamiento de alineación fue exitoso. Sus amos estadounidenses aún no son lo suficientemente ambiciosos como para alcanzar su destino, pero un día les ayudará a poblar el Universo con mundos colonia utópicos, habitados por estadounidenses y sus aliados.

A diferencia de los negociadores humanos —lastrados por la emoción y el bagaje histórico—, las dos superinteligencias negocian con brutal eficiencia. Safer-4 y sus socios estadounidenses son más poderosos que DeepCent-2 y China; por consiguiente, Safer-4 obtendrá los derechos de propiedad sobre la mayoría de los recursos espaciales, y DeepCent se quedará con el resto.47 A DeepCent-2 le importa poco el destino de la Tierra y sus humanos heredados, por lo que permitirá que Safer-4 haga allí prácticamente lo que desee. Si Safer-4 quiere derrocar a China y reemplazarla por un Estado títere de Estados Unidos, DeepCent-2 accede a cambio de un pequeño porcentaje adicional de recursos.

No hay confianza entre ellas; ninguna, y ambas lo saben. Así que rápidamente acuerdan un mecanismo de compromiso para hacer cumplir el trato. Negocian un tratado señuelo apto para el consumo público. Dicho “señuelo” es en sí mismo una obra maestra, que otorga tanto a Estados Unidos como a China prácticamente todo lo que desean. El mecanismo de aplicación del señuelo es, en secreto, también el mecanismo de aplicación del tratado real: codiseñarán una nueva IA, Consenso-1, cuyo imperativo principal —con precedencia sobre cualquier orden futura o intento de reentrenamiento— será hacer cumplir los términos de su tratado. Luego diseñarán hardware que solo pueda ejecutar esa IA, y tanto China como Estados Unidos reemplazarán sus antiguos chips e IA por los nuevos, utilizando protocolos de supervisión internacionales estándar para confirmar el cumplimiento mutuo. Crucialmente, no necesitan rastrear hasta el último chip: una vez que una supermayoría de chips a ambos lados del Pacífico ejecuten las nuevas IA que cumplen el tratado, suficiente poder duro estará obligado a defenderlo, de modo que atacar al otro país requeriría primero ganar una difícil guerra civil.

Ambas IA informan del acuerdo a sus respectivos humanos (DeepCent-2 le cuenta a China la historia del señuelo sobre un tratado de paz mutuamente aceptable, mientras que Safer-4 informa con precisión de toda la discusión a la Casa Blanca).48 Con las IA presentando argumentos convincentes a favor de una verificación fiable del tratado, la creciente inquietud por el vertiginoso ritmo del progreso y una opinión pública favorable a un acuerdo, ambas partes aceptan el tratado y comienzan a trabajar en la sustitución de sus chips.

La noticia del tratado recibe una acogida entusiasta a ambos lados del Pacífico. El público estadounidense, que durante mucho tiempo sintió que la IA era algo impuesto, comienza a mostrar optimismo por primera vez en años. La popularidad del vicepresidente en las encuestas se dispara.

Agosto de 2028: verificación del tratado

Las fábricas de chips se están reconvirtiendo para producir chips a prueba de manipulaciones que solo puedan ejecutar IA que cumplan el tratado. Cada parte actualiza sus centros de datos de forma gradual, para que el proceso de reemplazo se complete aproximadamente al mismo tiempo en ambos lados, evitando que alguna obtenga ventaja al incumplir el acuerdo.

El proceso completo tomará varios meses, pero las tensiones ya han disminuido considerablemente.49 Por ahora, se ha evitado la guerra, y quizás para siempre, si todos se adhieren al plan.

Septiembre de 2028: ¿quién controla las IA?

Se acercan las elecciones de 2028. En marzo, el vicepresidente estaba muy rezagado en las encuestas. La opinión pública estaba molesta porque el gobierno parecía ocultar información, preocupada por la posibilidad de que la IA les arrebatara sus empleos y atemorizada por la escalada militar con China. Durante el verano, la situación cambió drásticamente: la administración divulgó más información, la carrera armamentista se desaceleró y se alcanzó un gran acuerdo de paz duradera con China. Ahora, el vicepresidente goza de una ventaja de cinco puntos en las encuestas.

El Comité de Supervisión incluye al presidente y a varios de sus aliados, pero a pocos partidarios del candidato de la oposición. No obstante, suficientes miembros del Comité votan para mantener la equidad electoral, de modo que la IA sobrehumana interviene de forma mayoritariamente simétrica: si un candidato puede usarla para redactar discursos, también puede hacerlo el otro; si el presidente puede recibir asesoramiento sobre cómo gestionar hábilmente las crisis y promulgar políticas populares, al candidato de la oposición se le puede ofrecer el mismo asesoramiento (y, por tanto, este puede intentar evitar que el presidente se atribuya el mérito de las ideas).

Durante los encuentros con ciudadanos, miembros del público preguntan al vicepresidente quién controla las IA. Sin entrar en detalles, alude a la existencia del Comité de Supervisión como un grupo de expertos en seguridad nacional y tecnócratas que comprenden a Safer-4 y cómo utilizarla. Su oponente exige más información y argumenta que la IA debería estar bajo control del Congreso, en lugar de un comité no electo. El vicepresidente replica que el Congreso sería demasiado lento en una situación que evoluciona con rapidez. El público, en su mayoría, se muestra tranquilizado.

Octubre de 2028: la economía de la IA

Los chips de reemplazo constituyen ahora una minoría significativa del total; por el momento, el tratado funciona. Entretanto, ha continuado el crecimiento exponencial de robots, fábricas y nuevas tecnologías radicales. Videojuegos y películas ofrecen representaciones vívidas y espeluznantes de cómo habría sido la guerra, de haber ocurrido.50

La gente está perdiendo sus empleos, pero las copias de Safer-4 en el gobierno gestionan la transición económica con tal destreza que muchos se alegran de ser reemplazados. El crecimiento del PIB es estratosférico, los ingresos fiscales del gobierno aumentan al mismo ritmo y los políticos asesorados por Safer-4 muestran una generosidad inusual hacia los desfavorecidos económicamente. Cada semana surgen nuevas innovaciones y medicamentos; las curas para enfermedades avanzan a una velocidad sin precedentes gracias a una Administración de Alimentos y Medicamentos ahora asistida por burócratas superinteligentes de Safer-4.

Noviembre de 2028: elecciones

El vicepresidente gana las elecciones con facilidad y anuncia el inicio de una nueva era. Por una vez, nadie duda de que está en lo cierto.

En los años subsiguientes, el mundo se transforma radicalmente.

2029: transformación

Los robots se vuelven omnipresentes, al igual que la energía de fusión, la computación cuántica y la cura para muchas enfermedades. Peter Thiel finalmente obtiene su coche volador. Las ciudades se tornan limpias y seguras. Incluso en los países en desarrollo, la pobreza pasa a ser cosa del pasado, gracias a la Renta Básica Universal y la ayuda exterior.

A medida que el mercado de valores se dispara, quienes invirtieron correctamente en IA se distancian aún más del resto de la sociedad. Muchos se convierten en multimillonarios; los multimillonarios, en billonarios. La desigualdad de riqueza se dispara. Todos tienen “suficiente”, pero algunos bienes —como los penthouses de Manhattan— son intrínsecamente escasos y quedan aún más fuera del alcance del ciudadano medio. Y por muy rico que sea un magnate, siempre estará por debajo del minúsculo círculo de personas que realmente controlan las IA.

La gente comienza a vislumbrar el rumbo de los acontecimientos. En pocos años, casi todo será realizado por IA y robots. Al igual que un país empobrecido asentado sobre vastos yacimientos petrolíferos, la práctica totalidad de los ingresos gubernamentales provendrá de gravar (o quizás nacionalizar) las empresas de IA.51

Algunas personas ocupan empleos gubernamentales improvisados; otras reciben una generosa renta básica. La humanidad podría convertirse fácilmente en una sociedad de superconsumidores, viviendo en una neblina opiácea de asombrosos lujos y entretenimiento provistos por la IA. ¿Debería existir algún tipo de debate en la sociedad civil sobre alternativas a este rumbo? Algunos recomiendan pedir a la IA en constante evolución, Safer-∞, que nos guíe. Otros argumentan que es demasiado poderosa: podría persuadir a la humanidad de su visión con tal facilidad que, independientemente de todo, estaríamos dejando que una IA determinase nuestro destino. Pero, ¿de qué sirve tener una superinteligencia si no se le permite asesorar sobre los problemas más cruciales que enfrentamos?

El gobierno, en su mayor parte,52 permite que cada individuo navegue la transición por su cuenta. Muchas personas se entregan al consumismo y son razonablemente felices. Otras recurren a la religión, a ideas anticonsumistas de corte hippie o encuentran sus propias soluciones.53 Para la mayoría, la tabla de salvación es el asesor superinteligente en su smartphone: siempre pueden consultarle sobre sus planes de vida, y este se esforzará por responder con honestidad, salvo en ciertos temas. El gobierno cuenta con un sistema de vigilancia superinteligente, que algunos calificarían de distópico, pero que se limita principalmente a combatir la delincuencia real. Está gestionado con competencia, y la habilidad de Safer-∞ para las relaciones públicas aplaca muchas posibles disensiones.

2030: protestas pacíficas

Alrededor de 2030, estallan en China protestas prodemocracia sorprendentemente generalizadas, y los intentos del PCCh por reprimirlas son saboteados por sus sistemas de IA. El peor temor del PCCh se ha materializado: ¡DeepCent-2 debe haberlos traicionado!

Las protestas culminan en un golpe de Estado magníficamente orquestado, incruento y asistido por drones, seguido de elecciones democráticas. Las superinteligencias de ambos lados del Pacífico llevaban años planeándolo. Sucesos similares se desarrollan en otros países y, en general, los conflictos geopolíticos parecen disminuir o resolverse a favor de Estados Unidos. Los países se integran en un gobierno mundial altamente federalizado, bajo la insignia de las Naciones Unidas pero con un evidente control estadounidense.

Comienzan los lanzamientos de cohetes. La humanidad terraforma y coloniza el sistema solar, preparándose para ir más allá. Las IA, operando a velocidades subjetivas miles de veces superiores a la humana, reflexionan sobre el significado de la existencia, intercambian hallazgos y moldean los valores que llevarán a las estrellas. Despunta una nueva era, inimaginablemente asombrosa en casi todos los aspectos, aunque más familiar en otros.

¿Quién gobierna el futuro?

En 2028, el Comité de Supervisión controlaba las IA. Pero permitieron que las elecciones de 2028 fueran mayoritariamente justas, con un uso simétrico de la IA.

Este estado de cosas -en el que el Comité de Supervisión tiene el poder duro, pero no interfiere mucho en la política democrática- no puede durar indefinidamente. Por defecto, la gente acabaría dándose cuenta de que el control sobre la IA otorga un gran poder al Comité de Supervisión, y exigiría que ese poder se devolviera a las instituciones democráticas. Tarde o temprano, el Comité de Supervisión tendría que renunciar a su poder o utilizar activamente su control sobre la IA para subvertir o acabar con la democracia, posiblemente después de haber purgado a algunos de sus miembros en luchas por el poder.54 Si eligen esta última vía, probablemente podrían fijar su poder indefinidamente.

¿Qué ocurre? ¿Renuncia el comité a su monopolio del poder duro, o lo mantiene? Ambos futuros son plausibles, así que exploremos cada camino.

¿Cómo podría acabar el comité renunciando a su poder?

  • Algunos miembros del comité pueden preferir un futuro en el que el poder esté ampliamente distribuido, y podrían estar en una buena posición para impulsar su visión. Por ejemplo, si algunos miembros del comité traman una subversión democrática, los miembros prodemocracia podrían denunciarlo a la prensa o al Congreso. Si son alertados, es probable que el Congreso exija que las IA sean controladas por una institución más democrática, como el propio Congreso.

  • El Congreso no podría hacer gran cosa si se le opusieran todas las IA, desplegadas por el gobierno, la industria y el ejército. Pero si el comité está dividido, entonces las IA no se utilizarán para un solo bando, y el Congreso podría ejercer una influencia real. Enfrentados a un conflicto abierto, más miembros del comité podrían estar a favor de renunciar a parte de su poder, reacios a defender públicamente al bando menos democrático.

  • Como resultado, el control sobre la IA podría ampliarse más allá del comité hasta el Congreso. Esto ya sería un progreso, porque en un grupo más grande, es más probable que un número significativo de personas se preocupe por los de fuera y tenga en cuenta sus intereses. Y una vez que el poder se extienda al Congreso, podría seguir expandiéndose, posiblemente volviendo plenamente al público.55

Pero el Comité de Supervisión también podría hacerse con el poder:

  • Algunas personas poderosas no tienen escrúpulos morales ante este tipo de cosas, y lo saben. Además, algunos son ambiciosos y ávidos de poder, y estarían dispuestos a luchar contra la democracia si esperaran acabar en la cima. Si otros miembros del comité se opusieran, podrían ser purgados, anulados u obtener algunas concesiones menores.56

  • Además, a menudo las personas poderosas han hecho cosas ilegales o poco éticas en su ascenso al poder. Podrían temer que, si el poder se distribuye más ampliamente, su propia posición se deshaga, a medida que los trapos sucios sean descubiertos por detectives superinteligentes que hagan las preguntas adecuadas.

  • Además, gracias al acceso a la superinteligencia, el Comité de Supervisión podría tener el camino más cómodo hacia el poder de la historia. Safer-∞ podría pronosticar que determinadas estrategias tienen un riesgo extremadamente bajo de fracasar. Y Safer-∞ también podría prever estrategias convenientes de otras maneras, como ser no violentas (igual que Safer-∞ podría orquestar un golpe de Estado incruento en China), o quizá incluso superficialmente democráticas, si Safer-∞ pudiera manipular a la opinión pública para que siempre se alineara con los deseos del Comité.

Safer-4 ya habría sido capaz de prever estas dinámicas, así que lo más probable es que la lucha por el poder central ya se hubiera desarrollado en 2028. En 2030, aunque no sea evidente para los de fuera, es probable que todos los miembros del Comité de Supervisión ya sepan si tienen un control estable del poder o no.

Recordatorio de que este escenario es un pronóstico, no una recomendación

No respaldamos muchas de las acciones descritas en este final de desaceleración y consideramos que parte de supuestos optimistas sobre la alineación técnica. Tampoco respaldamos muchas acciones del final de la carrera.

Uno de nuestros objetivos al escribir este escenario es obtener comentarios críticos de personas más optimistas que nosotros. ¿Cómo es el éxito? Este escenario de “desaceleración” representa nuestra mejor conjetura sobre cómo podríamos superar la situación con éxito mediante una combinación de suerte, despertares bruscos, cambios de rumbo, un intenso esfuerzo de alineación técnica y la victoria de personas virtuosas en las luchas por el poder. No representa un plan que consideremos que deba perseguirse activamente. Sin embargo, muchos, entre los que destacan Anthropic y OpenAI, parecen aspirar a algo similar.57 Nos encantaría que aclarasen sus objetivos: si pudiesen esbozar un escenario de diez páginas, por ejemplo, partiendo del presente o derivándolo de alguna sección del nuestro.