Predecimos que el impacto de la IA sobrehumana en la próxima década será enorme, incluso mayor que el de la Revolución Industrial.

Redactamos un escenario que representa nuestra mejor suposición de cómo sería eso.1 Se basa en extrapolaciones de tendencias, juegos de guerra, comentarios de expertos, experiencia en OpenAI y pronósticos anteriores acertados.2

Los directores generales de OpenAI, Google DeepMind y Anthropic han predicho que la IAG llegará en los próximos 5 años. Sam Altman ha dicho que OpenAI tiene la mirada puesta en la "superinteligencia propiamente dicha" y en un "futuro glorioso".

¿Cómo sería eso? Escribimos IA 2027 para responder a esa pregunta. Las afirmaciones sobre el futuro suelen ser exasperantemente vagas, así que hemos intentado ser tan concretos y cuantitativos como nos ha sido posible, aun a riesgo de describir uno de los muchos futuros posibles.

Escribimos dos finales: uno de "desaceleración" y otro de "carrera". Sin embargo, IA 2027 no es una recomendación ni una exhortación. Nuestro objetivo es la precisión predictiva.4

Te invitamos a debatir y rebatir este escenario.5 Esperamos iniciar la conversación sobre nuestro destino y sobre la forma de dirigirnos hacia futuros positivos. Estamos planeando repartir miles de dólares en premios a los mejores escenarios alternativos.

(Añadido el 22 de noviembre de 2025, para evitar malentendidos: no sabemos exactamente cuándo se creará la IAG. 2027 era nuestro año modal (el más probable) en el momento de la publicación; nuestras medianas eran algo más largas.3 Consulta aquí nuestros pronósticos más recientes.)

Nuestra investigación sobre preguntas clave (por ejemplo, ¿qué objetivos tendrán los futuros agentes de IA?) está disponible aquí.

Escribimos el escenario de forma iterativa: empezamos con el primer período (hasta mediados de 2025), continuamos con el siguiente, etc., hasta llegar al final. Luego lo descartamos y volvimos a empezar.

No intentábamos llegar a ningún final en particular. Después de terminar el primer final —que ahora está en rojo—, escribimos una rama alternativa porque también queríamos representar un final más esperanzador, partiendo aproximadamente de las mismas premisas. Esto pasó por varias iteraciones.6

Nuestro escenario se basa en aproximadamente 25 ejercicios de simulación teórica y en los comentarios de más de 100 personas, entre las que se encontraban docenas de expertos en gobernanza y trabajo técnico en IA.

"Recomiendo muchísimo leer esta predicción de tipo narrativo sobre cómo la IA podría transformar el mundo en tan solo unos años. Nadie tiene una bola de cristal, pero este tipo de contenido puede ayudar a detectar preguntas importantes e ilustrar el impacto potencial de los riesgos emergentes".Yoshua Bengio7

Nos hemos propuesto una tarea imposible. Intentar predecir cómo sería la IA sobrehumana en 2027 es como intentar predecir cómo sería la Tercera Guerra Mundial en 2027, aunque se aleja mucho más de anteriores casuísticas. Sin embargo, vale la pena intentarlo, del mismo modo que vale la pena que el ejército estadounidense simule escenarios sobre Taiwán.

Describir el panorama completo nos hace advertir cuestiones o conexiones importantes que no habíamos considerado o reconocido antes, o darnos cuenta de que una posibilidad es más o menos probable. Además, al arriesgarnos a dar a conocer nuestras predicciones y alentar a otros a manifestar públicamente sus desacuerdos, abrimos la posibilidad de que años después se pueda evaluar quién tenía razón.

Cabe destacar que un autor escribió un escenario de IA —menos elaborado— en agosto de 2021. Aunque se equivocó en muchas cosas, en general lo hizo sorprendentemente bien: predijo el auge de la cadena de pensamiento, la ampliación de la escala de la inferencia, los controles a la exportación de chips para IA y los ciclos de entrenamiento de 100 millones de dólares: todo eso más de un año antes de ChatGPT.

Daniel Kokotajlo (artículos en TIME100 y el New York Times) es un antiguo investigador de OpenAI cuyas anteriores predicciones en el campo de la IA han sido muy acertadas.

Eli Lifland cofundó AI Digest, ha realizado investigaciones sobre la robustez de la IA y ocupa el primer puesto en la clasificación histórica de la RAND Forecasting Initiative.

Thomas Larsen fundó el Center for AI Policy y ha investigado sobre la seguridad de la IA en el Machine Intelligence Research Institute.

Romeo Dean está cursando una licenciatura y una maestría simultáneas en ciencias de la computación en Harvard y anteriormente fue AI Policy Fellow en el Institute for AI Policy and Strategy.

Scott Alexander, el famoso bloguero, se ofreció a reescribir nuestro contenido para hacerlo más atractivo; las partes divertidas de la historia son suyas y las aburridas, nuestras.

Para más información sobre nuestro equipo y agradecimientos, consulta esta página.

Mediados de 2025: agentes que tropiezan

El mundo vislumbra por primera vez los agentes de IA.

Los anuncios de los agentes que usan computadoras enfatizan el término "asistente personal": puedes ordenarles tareas como "pídeme un burrito en DoorDash" o "abre la hoja de cálculo de mi presupuesto y suma los gastos del mes". Se comunicarán contigo cuando sea necesario: por ejemplo, para pedirte que confirmes una compra.8 Aunque son más avanzados que las versiones anteriores (como Operator), no logran un uso generalizado.9

Mientras tanto, fuera del ojo público, los agentes de investigación y programación más especializados están empezando a transformar sus profesiones.

Las IA de 2024 podían seguir instrucciones específicas: podían convertir una lista de ideas sueltas en correos electrónicos y solicitudes simples en código funcional. En 2025, las IA funcionarán más como empleados. Las IA de programación se parecen cada vez más a agentes autónomos y menos a simples asistentes: reciben instrucciones a través de Slack o Teams y realizan cambios sustanciales en el código por su cuenta, lo que a veces ahorra horas o incluso días.10 Los agentes de investigación pasan media hora rastreando internet para responder tu pregunta.

Los agentes son impresionantes en teoría (y en ejemplos convenientemente seleccionados), pero poco fiables en la práctica. Twitter está lleno de historias sobre tareas fallidas ejecutadas de una manera particularmente cómica. Los mejores agentes también son caros; obtienes lo que pagas, y el mejor desempeño cuesta cientos de dólares al mes.11 Aun así, muchas empresas encuentran formas de adaptar los agentes de IA a sus flujos de trabajo.12

Finales de 2025: la IA más cara del mundo

OpenBrain está construyendo los centros de datos más grandes que el mundo jamás haya visto.13

(Para no señalar a ninguna empresa existente, vamos a describir una empresa ficticia de inteligencia artificial general a la que llamaremos OpenBrain. Imaginamos que las demás empresas van con 3–9 meses de retraso con respecto a OpenBrain).

GPT-3
(3 x 10^23 FLOPS)
GPT-4
(2 x 10^25 FLOPS)
Agente-1
(3 x 10^27 FLOPS)
ai-2027.com

GPT-4 requería 210252\cdot 10^{25} FLOP de poder de cómputo para entrenar.14 El último modelo público de OpenBrain —el Agente-0— se entrenó con 102710^{27} FLOP. Una vez que los nuevos centros de datos estén en funcionamiento, podrán entrenar un modelo con 102810^{28} FLOP —mil veces más que GPT-4—.15 Otras empresas invierten dinero en colosales centros de datos propios, con la esperanza de seguir el ritmo.

Aunque los modelos están mejorando en una amplia gama de habilidades, hay uno que destaca: OpenBrain se centra en las IA que pueden acelerar la investigación en IA. Quieren ganar la doble carrera armamentista contra China (cuya empresa líder llamaremos "DeepCent")16 y contra sus competidores estadounidenses. Cuanto más puedan automatizar su ciclo de investigación y desarrollo (I+D), más rápido podrán avanzar. Así que cuando OpenBrain termine de entrenar al Agente-1, un nuevo modelo que se está desarrollando internamente, será bueno en muchas cosas, pero excelente para ayudar con la investigación en IA.17 A esta altura, "terminar el entrenamiento" es un concepto un tanto inapropiado; los modelos se actualizan con frecuencia a versiones más nuevas entrenadas con datos adicionales o parcialmente reentrenadas para corregir algunas debilidades.18

Los mismos entornos de entrenamiento que enseñan al Agente-1 a programar y navegar por la web de forma autónoma también lo convierten en un buen hacker. Además, podría ayudar sustancialmente a los terroristas que diseñan armas biológicas, gracias a sus conocimientos de nivel de doctorado en todos los campos y a su capacidad para navegar por la web. OpenBrain asegura al gobierno que el modelo ha sido "alineado" para negarse a cumplir pedidos maliciosos.

Los sistemas modernos de IA son redes neuronales artificiales gigantescas. Al principio del entrenamiento, una IA no tendrá "objetivos", sino "reflejos": si ve "Encantado de", su dato de salida es "conocerte". Para cuando se haya entrenado para predecir una cantidad de texto más o menos equivalente al que contiene toda la internet, habrá desarrollado sofisticados circuitos internos que codifican inmensas cantidades de conocimiento y desempeñan con flexibilidad el papel de autores arbitrarios, ya que eso es lo que le ayuda a predecir el texto con una precisión sobrehumana.19

Después de ser entrenado para predecir texto de internet, el modelo es entrenado para producir texto en respuesta a instrucciones. Esto incorpora una personalidad básica e "impulsos".20 Por ejemplo, es más probable que un agente que entiende claramente una tarea la complete con éxito; a lo largo del entrenamiento, el modelo "aprende" un "impulso" para comprender claramente sus tareas. Otros impulsos en esta categoría podrían ser la eficacia, el conocimiento y la autopresentación (es decir, la tendencia a presentar sus resultados de la mejor manera posible).21

OpenBrain tiene una especificación de modelo (o "Spec"), un documento escrito que describe los objetivos, las reglas, los principios, etc. que se supone que deben guiar el comportamiento del modelo.22 La Spec del Agente-1 combina algunos objetivos vagos (como "ayudar al usuario" y "no infringir la ley") con una larga lista de cosas que se deben y no se deben hacer ("no digas esta palabra", "así es como se maneja esta situación"). Utilizando técnicas que emplean IA para entrenar a otras IA,23 el modelo memoriza la Spec y aprende a razonar cuidadosamente sobre sus máximas. Al final de este entrenamiento, esperamos que la IA sea útil (obedezca instrucciones), inofensiva (se niegue a ayudar con estafas, fabricación de bombas y otras actividades peligrosas) y honesta (se resista a la tentación de obtener mejores calificaciones de humanos crédulos al inventar citas24 o fingir que finaliza tareas).

El proceso de entrenamiento y la psicología de los modelos de lenguaje a gran escala: por qué seguimos diciendo "esperamos"

"A diferencia del software ordinario, nuestros modelos son redes neuronales masivas. Sus comportamientos se aprenden a partir de una amplia gama de datos, no se programan de forma explícita. Aunque no es una analogía perfecta, el proceso se parece más a adiestrar a un perro que a la programación convencional".OpenAI

Cuando queremos entender por qué un sistema de IA moderno hizo algo, o cómo se comportaría en algún escenario futuro que no podemos simular perfectamente, no podemos simplemente pedir a los programadores que nos guíen a través de varias líneas de código y nos expliquen cómo funcionan. Así que nos vemos obligados a hacer algo parecido a la psicología: observamos el comportamiento de los modelos en la gama de casos observados hasta ahora, teorizamos sobre las estructuras cognitivas internas (¿creencias?, ¿objetivos?, ¿rasgos de personalidad?, etc.) que podrían existir y utilizamos esas teorías para predecir el comportamiento en escenarios futuros.

El punto es que una empresa puede redactar un documento (la Spec) en el que se enumeren lo que se debe y lo que no se debe hacer, los objetivos y los principios, y luego puede intentar entrenar a la IA para que interiorice la Spec, pero no puede comprobar si ha funcionado o no. Puede decir: "por lo que podemos juzgar, parece que hasta ahora está siguiendo la Spec".25

En un cuadro desplegable posterior entraremos en más detalles sobre lo que creemos que podría estar ocurriendo dentro de estas IA, internamente. También puedes consultar nuestro suplemento de pronosticación de los objetivos de la IA, que profundiza en los objetivos que podrían tener las IA y sus causas. Esta es una de las muchas cosas sobre las que no estamos seguros y que ameritan más investigación.

El equipo de alineación de OpenBrain26 es lo suficientemente cuidadoso como para preguntarse si estas victorias son profundas o superficiales. ¿Tiene el modelo totalmente entrenado algún tipo de compromiso sólido de ser siempre honesto? ¿O se desmoronará en alguna situación futura, por ejemplo, porque ha aprendido que la honradez es un objetivo instrumental en lugar de un objetivo terminal? ¿O simplemente ha aprendido a ser honesto sobre el tipo de cosas que el proceso de evaluación puede comprobar? ¿Podría estar mintiéndose a sí mismo a veces, como hacen los humanos? Una respuesta concluyente a estas preguntas requeriría una interpretabilidad mecanicista, es decir, la capacidad de observar el interior de una IA y leer su mente. Por desgracia, las técnicas de interpretabilidad aún no son lo bastante avanzadas para eso.

En su lugar, los investigadores intentan identificar los casos en los que los modelos parecen desviarse de la Spec. El Agente-1 suele ser adulador (es decir, dice a los investigadores lo que quieren oír en lugar de intentar decirles la verdad). En algunas demostraciones amañadas, miente incluso de forma más grave, ocultando evidencia de que ha fallado en una tarea para obtener mejores puntuaciones. Sin embargo, en entornos de despliegue reales, ya no se producen incidentes tan extremos como en 2023-2024 (por ejemplo, cuando Gemini le dijo a un usuario que se muriera y cuando Sydney estaba siendo Sydney.)27

Principios de 2026: automatización de la programación

La apuesta por utilizar la IA para acelerar la investigación en IA está empezando a rendir frutos.

OpenBrain sigue implementando internamente el Agente-1, que mejora de forma iterativa, para la I+D en IA. En general, están logrando avances algorítmicos un 50 % más rápido de lo que lo harían sin asistentes de IA y, lo que es más importante, más rápido que sus competidores.

El multiplicador del progreso de la I+D en IA: ¿qué queremos decir con un progreso algorítmico un 50 % más rápido?

Queremos decir que OpenBrain logra tanto progreso en investigación en IA en 1 semana con IA como lo haría en 1,5 semanas sin el uso de IA.

El progreso de la IA se puede dividir en dos componentes:

  1. Aumento del poder de cómputo: se utiliza más poder de cómputo para entrenar o ejecutar una IA. Esto produce IA más potentes, aunque más costosas.

  2. Algoritmos mejorados: se utilizan mejores métodos de entrenamiento para traducir el poder de cómputo en un mejor desempeño, lo que produce IA más capaces sin un aumento correspondiente en el costo, o las mismas capacidades con costos reducidos.

    1. Esto incluye ser capaz de lograr resultados cualitativa y cuantitativamente nuevos. Los "cambios de paradigma", como el tránsito de los agentes de aprendizaje por refuerzo que juegan juegos a los modelos de lenguaje a gran escala, son ejemplos de progreso algorítmico.

Aquí solo nos referimos al número (2), algoritmos mejorados, que constituye aproximadamente la mitad del progreso actual de la IA.

En lo sucesivo, a veces lo abreviamos como un "multiplicador del progreso de la I+D en IA" de 1,5.

Aclaraciones:

  1. El multiplicador del progreso es integral: incluye el tiempo que lleva realizar experimentos, por ejemplo, y no solo las tareas cognitivas involucradas en la investigación algorítmica.

  2. Es importante recordar que el multiplicador del progreso es la velocidad relativa del progreso, no su velocidad absoluta. Si, por ejemplo, el costo del poder de cómputo para entrenar un modelo de la clase de GPT-4 se hubiera reducido a la mitad cada año durante varios años, con la investigación humana ordinaria, y de pronto la IA automatizara la I+D y el multiplicador del progreso alcanzara un factor de 100, el costo para entrenar un modelo de la clase de GPT-4 se reduciría a la mitad cada 3,65 días, aunque no por mucho tiempo, porque los rendimientos decrecientes se harían notar y se alcanzarían límites infranqueables. En este ejemplo, tal vez el costo de entrenar un modelo de la clase de GPT-4 se reduciría a la mitad entre 5 y 10 veces en total (en el transcurso de unas pocas semanas o meses) antes de estabilizarse. En otras palabras, si la ciencia humana ordinaria se hubiera topado con rendimientos decrecientes y límites físicos después de 5-10 años de investigación adicional, entonces las IA con un multiplicador de 100 se habrían topado con esos mismos rendimientos decrecientes y límites después de 18,25–36,5 días de investigación.

Puedes encontrar más explicaciones y debates sobre este concepto y la forma en que se utiliza en nuestro pronóstico en el suplemento del despegue.

Varias IA de la competencia lanzadas al público ahora igualan o superan al Agente-0, incluido un modelo de pesos abiertos. OpenBrain responde lanzando el Agente-1, que es más capaz y fiable.28

Como es de esperarse, la gente intenta comparar al Agente-1 con los humanos, pero tiene un perfil de habilidades muy diferente. Conoce más datos que cualquier humano, conoce prácticamente todos los lenguajes de programación y puede resolver problemas de programación bien especificados con extrema rapidez. Por otro lado, al Agente-1 no le salen bien incluso las tareas simples con horizontes temporales largos, como ganar en videojuegos que no ha jugado antes. Aun así, la jornada laboral común es de ocho horas, y el trabajo de un día puede separarse normalmente en bloques más pequeños; podrías pensar en el Agente-1 como un empleado despistado que prospera bajo una dirección dedicada.29 La gente inteligente encuentra formas de automatizar las partes rutinarias de su trabajo.30

Los ejecutivos de OpenBrain consideran una implicación de la automatización de la I+D en IA: la seguridad ha cobrado más importancia. A principios de 2025, el peor escenario era la filtración de secretos algorítmicos; ahora, si China roba los pesos del Agente-1, podría aumentar su velocidad de investigación en casi un 50 %.31 El nivel de seguridad de OpenBrain es el típico de una empresa tecnológica en rápido crecimiento integrada por unas 3 000 personas, protegida únicamente contra ataques de baja prioridad de grupos cibernéticos experimentados (SL2 de RAND).32 Trabajan duro para proteger sus pesos y secretos de las amenazas internas y de las principales organizaciones de ciberdelincuencia (SL3),33 pero la defensa contra los Estados nación (SL4&5) apenas se vislumbra en el horizonte.

Mediados de 2026: China despierta

En China, el Partido Comunista (PCCh) está empezando a sentir la IAG.

Los controles a la exportación de chips y la falta de apoyo gubernamental han dejado a China con pocos recursos en comparación con Occidente. Al contrabandear chips taiwaneses prohibidos, comprar chips más antiguos y producir chips nacionales con unos tres años de retraso con respecto a la frontera entre Estados Unidos y Taiwán, China ha logrado mantener alrededor del 12 % del poder de cómputo mundial relevante para la IA, pero la tecnología más antigua es más difícil de manejar y el suministro es un dolor de cabeza constante.35 Algunas empresas destacadas como DeepCent hacen un trabajo impresionante con un poder de cómputo limitado, pero el déficit del poder de cómputo limita lo que pueden lograr sin el apoyo del gobierno, y están unos seis meses por detrás de los mejores modelos de OpenBrain.36

El secretario general llevaba mucho tiempo soñando con apostar por la fabricación física en el mundo real y evitar la decadencia postindustrial estadounidense. Veía con recelo a las empresas de software.37 Pero los halcones del PCCh le advierten que la creciente carrera de la IAG ya no puede ignorarse. Así que finalmente se compromete plenamente con el gran impulso de la IA que antes había tratado de evitar. Pone en marcha la nacionalización de la investigación china en IA, creando para ello un mecanismo inmediato de intercambio de información para las empresas de IA. La iniciativa irá escalando a lo largo de un año hasta que los mejores investigadores se fusionen en un colectivo dirigido por DeepCent, donde compartirán sus conocimientos algorítmicos, conjuntos de datos y recursos de poder de cómputo. Se crea una Zona de Desarrollo Centralizada (ZDC) en la central nuclear de Tianwan (la más grande del mundo) para albergar un nuevo megacentro de datos para DeepCent, junto con alojamientos y oficinas de alta seguridad a los que los investigadores se trasladarán finalmente. Casi el 50 % del poder de cómputo de China relacionado con la IA está trabajando ahora para el colectivo dirigido por DeepCent,38 y más del 80 % de los nuevos chips se dirigen a la ZDC.39 En este momento, la ZDC tiene la capacidad energética necesaria para lo que sería el mayor clúster centralizado del mundo.40 Otros miembros del Partido discuten medidas extremas para neutralizar la ventaja de los chips occidentales. ¿Un bloqueo de Taiwán? ¿Una invasión total?

Pero China se está quedando atrás respecto a los algoritmos de IA debido a sus modelos más débiles. Las agencias de inteligencia chinas, que se encuentran entre las mejores del mundo, redoblan sus planes para robar los pesos de OpenBrain. Esta es una operación mucho más compleja que su constante robo de bajo nivel de secretos algorítmicos; los pesos son un archivo de varios terabytes almacenado en un servidor de alta seguridad (OpenBrain ha mejorado la seguridad a SL3 de RAND). Su fuerza cibernética cree que pueden lograrlo con la ayuda de sus espías, pero quizás solo una vez; OpenBrain detectará el robo, aumentará la seguridad y es posible que no tengan otra oportunidad. Entonces (se preguntan los líderes del PCCh), ¿deberían actuar ahora y robar el Agente-1? ¿O esperar a un modelo más avanzado? Si esperan, ¿corren el riesgo de que OpenBrain mejore la seguridad más allá de su capacidad de penetración?

Finales de 2026: la IA arrebata algunos trabajos

Justo cuando otros parecían estar poniéndose al día, OpenBrain vuelve a dejar a la competencia atrás con el lanzamiento del Agente-1-mini, un modelo 10 veces más barato que el Agente-1 y más fácil de ajustar finamente para distintas aplicaciones. La narrativa dominante en torno a la IA ha cambiado de "tal vez la emoción se disipe" a "supongo que esto es el siguiente salto revolucionario", pero la gente no se pone de acuerdo sobre cuán revolucionario es el salto. ¿Más que las redes sociales? ¿Más que los teléfonos inteligentes? ¿Más que el fuego?

La IA ha empezado a arrebatar puestos de trabajo, pero también ha creado otros nuevos. El mercado de valores ha subido un 30 % en 2026, liderado por OpenBrain, Nvidia y las empresas que hayan integrado con más éxito los asistentes de IA. El mercado laboral para auxiliares de ingenieros de software está en crisis: las IA pueden hacer todo lo que se aprende en un grado de ciencias de la computación, pero las personas que saben gestionar y controlar la calidad de los equipos de IA están ganando mucho. Los gurús de los negocios dicen a quienes buscan trabajo que la familiaridad con la IA es la habilidad más importante que se puede incluir en un currículum. Mucha gente teme que la próxima ola de IA venga a quitarles el trabajo; hay una protesta anti-IA de 10 000 personas en Washington D. C.

El Departamento de Defensa comienza, de forma discreta pero significativa, a ampliar la contratación directa de OpenBrain para trabajos de ciberseguridad, análisis de datos e I+D, pero la integración es lenta debido a la burocracia y a su proceso de adquisiciones.41

CAPEX GLOBAL EN IA
$1 B
COSTO DE PROPIEDAD DEL PODER DE CÓMPUTO ACTIVO

MÉTRICAS CLAVE DEL 2026

POTENCIA GLOBAL DE LA IA
38 GW
POTENCIA PICO
INGRESOS DE OPENBRAIN
$35 000 M
ANUAL 2026
GASTO DE CAPITAL
$200 000 M
COSTO DE PROPIEDAD DE LA INFRAESTRUCTURA INFORMÁTICA DE OPENBRAIN
PORCENTAJE DE LA POTENCIA DE EE. UU. PARA LA IA
2,5 %
33 GW DE CAPACIDAD DE 1,34 TW
COSTO DEL CÓMPUTO DE OPENBRAIN
$40 000 M
ANUAL 2026
NECESIDADES ENERGÉTICAS DE OPENBRAIN
6 GW
POTENCIA PICO
ai-2027.com
Por qué aumenta sustancialmente nuestro nivel de incertidumbre más allá de 2026

Nuestro pronóstico desde el día de hoy hasta 2026 está sustancialmente más fundamentado que lo que sigue. Esto se debe, en parte, a que está más cerca. Pero también se debe a que los efectos de la IA en el mundo realmente comienzan a agravarse en 2027. Para 2025 y 2026, nuestro pronóstico se basa en gran medida en la extrapolación de líneas rectas sobre la ampliación del poder de cómputo, las mejoras algorítmicas y el desempeño en los benchmarks. En este punto del escenario, comenzamos a ver efectos importantes de la I+D en IA acelerada por IA en la línea de tiempo, lo que nos lleva a revisar nuestras suposiciones para las líneas de tendencia al alza. Pero estas dinámicas son intrínsecamente mucho menos predecibles.

A lo largo de 2027, las IA mejoran, pasando de ser capaces de hacer principalmente el trabajo de un ingeniero de investigación de OpenBrain a eclipsar a todos los humanos en todas las tareas. Esto representa aproximadamente nuestra estimación media, pero creemos que es plausible que esto ocurra hasta unas 5 veces más lenta o más rápidamente.

Para nuestra investigación de antecedentes, consulta el pronóstico de plazos y el pronóstico del despegue. Estos también se resumirán en los siguientes cuadros desplegables.

Enero de 2027: el Agente-2 nunca deja de aprender

Con la ayuda del Agente-1, OpenBrain está postentrenando al Agente-2. Más que nunca, la atención se centra en los datos de alta calidad. Se producen, evalúan y filtran grandes cantidades de datos sintéticos para comprobar su calidad antes de introducirlos en el Agente-2.42 Además, paga miles de millones de dólares a trabajadores humanos para que se graben a sí mismos resolviendo tareas con horizontes temporales largos.43 Además de todo eso, entrenan al Agente-2 de forma casi continua utilizando el aprendizaje por refuerzo en un conjunto cada vez mayor de diversas tareas difíciles: muchos videojuegos, muchos retos de programación, muchas tareas de investigación. El Agente-2, más que los modelos anteriores, "aprende en línea" eficazmente, ya que está diseñado para que su entrenamiento nunca termine. Cada día, los pesos se actualizan a la última versión, entrenados con más datos generados el día anterior por la versión anterior.

El Agente-1 se había optimizado para tareas de I+D en IA, con la esperanza de iniciar una explosión de inteligencia.44 OpenBrain redobla su apuesta usando esta estrategia con el Agente-2. Es cualitativamente casi tan bueno como los mejores expertos humanos en ingeniería de investigación (diseño e implementación de experimentos), y tan bueno como el científico del percentil 25 de OpenBrain en términos de "sentido de investigación" (es decir, decidir qué estudiar a continuación, qué experimentos realizar o tener indicios de nuevos paradigmas potenciales).45 Mientras que el último Agente-1 podía duplicar el ritmo del progreso algorítmico de OpenBrain, el Agente-2 puede ahora triplicarlo, y mejorará aún más con el tiempo. En la práctica, esto se traduce en que cada investigador de OpenBrain se convierte en el "gerente" de un "equipo" de IA.

Las nuevas capacidades conllevan nuevos peligros. El equipo de seguridad descubre que si el Agente-2 escapara de alguna manera de la empresa y quisiera "sobrevivir" y "replicarse" de forma autónoma, podría hacerlo. Es decir, podría desarrollar y ejecutar de forma autónoma planes para hackear servidores de IA, instalar copias de sí mismo, evadir la detección y utilizar esa base segura para perseguir cualquier otro objetivo que pudiera tener (aunque se desconoce y se pone en duda la eficacia con la que lo haría a medida que pasen las semanas). Estos resultados solo muestran que el modelo podría realizar estas tareas, no que "querría" llevarlas a cabo. Aun así, es inquietante incluso saber que esto es posible.

Dados los "peligros" del nuevo modelo, OpenBrain elige "responsablemente" no lanzarlo al público todavía (de hecho, quieren centrarse en la I+D interna de IA).46 El conocimiento de todas las capacidades del Agente-2 está limitado a un silo de élite que contiene al equipo inmediato, a los líderes y a la seguridad de OpenBrain, a unas pocas docenas de funcionarios del gobierno de EE. UU. y a las legiones de espías del PCCh que se han infiltrado en OpenBrain durante años.47

Febrero de 2027: China roba el Agente-2

OpenBrain presenta el Agente-2 al gobierno, incluidos el Consejo de Seguridad Nacional, el Departamento de Defensa y el Instituto de Seguridad de la IA de EE. UU. OpenBrain quiere mantener una buena relación con el poder ejecutivo, porque básicamente es el único actor que puede detenerlos ahora, y si no lo mantienen informado, podría enterarse de todos modos y mostrar su descontento.48

Los funcionarios están más interesados en sus capacidades de guerra cibernética: el Agente-2 es "solo" un poco peor que los mejores hackers humanos, pero se pueden ejecutar miles de copias en paralelo, buscando y explotando debilidades más rápido de lo que los defensores pueden responder. El Departamento de Defensa considera que esta es una ventaja crítica en la guerra cibernética, y la IA pasa del puesto número 5 en la lista de prioridades de la administración al puesto número 2.49 Alguien menciona la posibilidad de nacionalizar OpenBrain, pero otros funcionarios del gabinete piensan que es prematuro. Un miembro del personal redacta un memorando que presenta al presidente sus opciones, que van desde seguir como siempre hasta la nacionalización total. El presidente se remite a sus asesores, líderes de la industria tecnológica que argumentan que la nacionalización "mataría a la gallina de los huevos de oro". Decide posponer por ahora cualquier acción importante y se limita a añadir requisitos de seguridad adicionales al contrato entre OpenBrain y el Departamento de Defensa.

Pero los cambios llegan demasiado tarde. El liderazgo del PCCh reconoce la importancia del Agente-2 y ordena a sus espías y a su fuerza cibernética que roben los pesos. Una mañana temprano, un agente de control de tráfico del Agente-1 detecta una transferencia anómala. Alerta a los líderes de la empresa, que informan a la Casa Blanca. Las señales de una operación a nivel de Estado-nación son inconfundibles, y el robo aumenta la sensación de una carrera armamentista en curso.

El robo de los pesos del Agente-2

Creemos que para este punto, la inteligencia china habría puesto en peligro a OpenBrain de varias maneras durante años, y probablemente se habría mantenido al día sobre los secretos algorítmicos e incluso habría robado código de vez en cuando, ya que es mucho más fácil de conseguir que los pesos y mucho más difícil de detectar.

Imaginamos el robo de los pesos como una serie de pequeños robos coordinados de tipo "rompe y toma" (es decir, rápidos pero no encubiertos) en una serie de servidores Nvidia NVL72 GB300 que ejecutan copias de los pesos del Agente-2. Los servidores se ven comprometidos utilizando el acceso legítimo de los empleados (una persona con información privilegiada y credenciales de administrador que ayuda al esfuerzo de robo del PCCh, ya sea por afinidad, por coacción o sin quererlo). Las credenciales internas otorgan al atacante permisos de nivel de administrador sobre los servidores. Mediante un canal lateral microarquitectónico, el atacante extrae las claves de cifrado de una máquina virtual con el cómputo confidencial de Nvidia habilitado, lo que le permite interceptar los pesos del modelo cuando la máquina virtual se aprovisiona o se actualiza.

Inician (o esperan) una actualización rutinaria y exfiltran el punto de control en muchos fragmentos pequeños; por ejemplo, unos 25 servidores distintos filtran cada uno alrededor del 4 % del modelo (porciones de unos 100 GB para un punto de control de unos 3 TB). El ancho de banda de salida (la velocidad a la que pueden salir los datos) de todo el centro de datos está en el rango de los 100 GB/segundo, por lo que limitar la velocidad a menos de aproximadamente 1 GB/s por servidor evita un pico importante en el tráfico de la red; a ese ritmo, cada porción de unos 100 GB puede salir del centro de datos en un par de minutos. La supervisión en directo resulta engañada por los esfuerzos del atacante para enmascarar y dividir las transferencias o simplemente se deshabilita por completo.

A continuación, los pesos se envían a través de varios canales paralelos y capas de enmascaramiento de IP a China, donde se descifran localmente con la clave o claves de sesión robadas. Toda la parte activa de la operación (desde el primer servidor comprometido hasta la exfiltración completa de los pesos) se completa en menos de dos horas.99

Rusia también está intentando robar el modelo en este punto, pero fracasa: esperaron demasiado y no han invertido los recursos necesarios para infiltrarse en los lugares adecuados. Sus espías roban habitualmente secretos algorítmicos de empresas estadounidenses de IA, pero sin un proyecto de IAG propio que destaque, no son muy útiles.

La Casa Blanca pone a OpenBrain una correa más corta y añade personal militar y de la comunidad de inteligencia a su equipo de seguridad. Su primera prioridad es evitar más robos de pesos.50

Centralización del poder de cómputo en China, 2025-2027Porcentaje creciente del poder de cómputo total en la ZDC:0→70%Dic 2025Jun 2026Dic 2026Jun 2027Dic 2027Resto de ChinaResto de DeepCentZDCFeb 2027 (40%)
ai-2027.com

En represalia por el robo, el presidente autoriza ciberataques para sabotear DeepCent. Pero a estas alturas China tiene el 40 % de su poder de cómputo51 relevante para la IA en la ZDC, donde han reforzado la seguridad de forma agresiva mediante el airgapping (cierre de conexiones externas) y el aislamiento interno. Las operaciones no logran causar daños graves e inmediatos. Las tensiones aumentan, ambas partes muestran su seriedad reposicionando los activos militares alrededor de Taiwán, y DeepCent se apresura a poner en funcionamiento el Agente-2 y empezar a impulsar su investigación en IA.52

Marzo de 2027: avances algorítmicos

Tres enormes centros de datos llenos de copias del Agente-2 trabajan día y noche, produciendo datos de entrenamiento sintéticos. Otros dos se utilizan para actualizar los pesos. El Agente-2 se vuelve más inteligente cada día.

Con la ayuda de miles de investigadores automatizados del Agente-2, OpenBrain está logrando importantes avances algorítmicos. Uno de ellos consiste en aumentar el bloc de notas basado en texto de la IA (cadena de pensamiento) con un proceso de pensamiento de mayor ancho de banda (recurrencia y memoria en neuralés, es decir, en el lenguaje interno de la propia red neuronal). Otro es una forma más extensible y eficiente de aprender de los resultados de las soluciones de tareas de gran esfuerzo (destilación y amplificación iteradas).

Este nuevo sistema de IA, que incorpora estos avances, se denomina Agente-3.

Distribución del poder de cómputo de OpenBrain en 2024 y en 202720242027estimaciónproyecciónExperimentos de investigación EntrenamientoGeneración de datosDespliegueexternoExperimentosde investigaciónEjecuciónde asistentesde IAEntrenamientoGeneraciónde datosDespliegueexterno
ai-2027.com
Recurrencia y memoria en neuralés

La recurrencia y memoria en neuralés permite a los modelos de IA razonar por un tiempo más largo sin que tengan que escribir esos pensamientos como texto.

Imagina que eres un ser humano con pérdida de memoria a corto plazo, de tal manera que necesitas escribir constantemente tus pensamientos en un papel para que en unos minutos sepas lo que está pasando. Podrías progresar lenta y laboriosamente en resolver problemas matemáticos, escribir código, etc., pero sería mucho más fácil si pudieras recordar directamente tus pensamientos sin tener que escribirlos y luego leerlos. Esto es lo que la recurrencia y memoria en neuralés aportan a los modelos de IA.

En términos más técnicos:

Los mecanismos de atención tradicionales permiten que los pases hacia adelante posteriores de un modelo vean las activaciones intermedias del modelo para tokens anteriores. Sin embargo, la única información que pueden pasar hacia atrás (de capas posteriores a capas anteriores) es a través de tokens. Esto significa que si un modelo de lenguaje a gran escala tradicional (por ejemplo, la serie de modelos GPT) quiere hacer cualquier cadena de razonamiento que requiera más operaciones en serie que el número de capas del modelo, este se ve obligado a poner la información en tokens que luego puede pasarse a sí mismo. Pero esto es sumamente limitante: los tokens solo pueden almacenar una cantidad ínfima de información. Supongamos que un modelo de lenguaje tiene un tamaño de vocabulario de unos 100 000. Entonces cada token contiene log2(100000)=16,6\log_2(100000)=16,6 bits de información, aproximadamente el tamaño de un solo número de coma flotante (suponiendo un entrenamiento en FP16). Mientras tanto, los flujos residuales —utilizados para pasar información entre capas en un modelo de lenguaje— contienen miles de números en coma flotante.

Se puede evitar este cuello de botella utilizando neuralés: pasar el flujo residual de un modelo de lenguaje (que consiste en vectores de varios miles de dimensiones) de vuelta a las primeras capas del modelo, dándole una cadena de pensamiento de alta dimensión, transmitiendo potencialmente más de 1 000 veces más información.

Figura de Hao et al., un artículo de 2024 de Meta que implementa esta idea.

Lo llamamos "neuralés" porque, a diferencia de las palabras en un idioma humano, estos vectores de alta dimensión son probablemente bastante difíciles de interpretar para los humanos. En el pasado, los investigadores podían hacerse una idea de lo que pensaban los modelos de lenguaje con solo leer su cadena de pensamiento. Ahora los investigadores tienen que pedir al modelo que traduzca y resuma sus pensamientos o tratar de descifrar el neuralés con sus limitadas herramientas de interpretabilidad.

De manera similar, los chatbots y agentes de IA más antiguos tenían bancos de memoria externos basados en texto, como un humano que toma notas en papel. La memoria a largo plazo de la nueva IA es un conjunto de vectores en lugar de texto, lo que hace que sus pensamientos estén más comprimidos y sean de mayor dimensión. Hay varios tipos de bancos de memoria; algunos se utilizan temporalmente para tareas individuales que implican varios pasos, otros se comparten entre todos los agentes utilizados por una persona, empresa o tipo de trabajo (por ejemplo, programación).

Hasta donde sabemos, las principales empresas de IA, como Meta, Google DeepMind, OpenAI y Anthropic, aún no han implementado esta idea en sus modelos de vanguardia. Suponemos que esto se debe a que la ganancia en rendimiento es pequeña en relación con las ineficiencias de entrenamiento introducidas. Las ineficiencias de entrenamiento se deben a que no se pueden predecir muchos tokens en paralelo, lo que conduce a una peor utilización de la GPU. Sin el neuralés, el modelo puede predecir toda la frase "Esto es un ejemplo" al mismo tiempo, ya que sabe que el dato de entrada para generar el "es" será "Esto", el dato de entrada para "un" será "Esto es", etc. Sin embargo, con el neuralés se desconoce cuál será el vector del neuralés que pasará al siguiente token después de que se haya generado "Esto". Por lo tanto, cada token debe predecirse de a uno por vez. La incapacidad de predecir todos los tokens en paralelo reduce la eficiencia del entrenamiento de los modelos de lenguaje. Sin embargo, nuestro pronóstico es que para abril de 2027 la investigación habrá disminuido la pérdida de eficiencia y aumentado la ganancia en rendimiento del neuralés.

Si esto no sucede, es posible que hayan ocurrido otras cosas que terminen siendo funcionalmente similares para nuestra historia. Por ejemplo, tal vez se entrene a los modelos para que piensen en lenguajes artificiales que sean más eficientes que el lenguaje natural, pero difíciles de interpretar para los humanos. O tal vez se imponga la práctica estándar de entrenar las cadenas de pensamiento en inglés para que se vean bien, de modo que las IA se vuelvan expertas en comunicarse sutilmente entre sí en mensajes que parezcan benignos para los supervisores.

Dicho esto, también es posible que las IA que comiencen a automatizar la I+D en IA sigan pensando en cadenas de pensamiento en inglés que sean en su mayoría fieles. Si es así, será mucho más fácil detectar las desalineaciones y, en general, nuestra historia sería muy diferente y más optimista.

Destilación y amplificación iteradas (DAI)

La mejora automática de la inteligencia general había tenido éxitos menores. Pero a principios de 2027, está obteniendo grandes beneficios. Para la destilación y amplificación iteradas se necesitan dos ingredientes:

  1. Amplificación: dado un modelo M0, gastar más recursos para mejorar el desempeño. Por ejemplo, al permitir que el modelo piense por más tiempo, o al ejecutar muchas copias en paralelo, o ambas cosas, y al tener un proceso igualmente intenso para evaluar el resultado y seleccionar solo las mejores respuestas, se puede gastar más órdenes de magnitud de poder de cómputo para obtener respuestas (o productos de trabajo) que sean de una calidad notablemente superior. Llamamemos a este costoso sistema Ampli(M0).

  2. Destilación: dado un modelo amplificado Ampli(M0), entrenar un nuevo modelo M1 para imitarlo, es decir, para obtener los mismos resultados que Ampli(M0) pero más rápido y con menos poder de cómputo. Con suerte, el resultado debería ser un modelo más inteligente, M1. Luego se puede repetir el proceso.

Visualización de la DAI de Ord, 2025.

AlphaGo se entrenó utilizando la búsqueda en árbol de Monte Carlo y el autojuego como paso de amplificación y el aprendizaje por refuerzo como paso de destilación. Esto condujo a un desempeño sobrehumano en el Go. Pero ahora, el Agente-3 es capaz de potenciar esto para alcanzar un desempeño sobrehumano en programación.

  1. El paso de amplificación funciona para el Agente-3 mediante una combinación de estas tres acciones: pensar durante más tiempo, añadir el uso de herramientas o consultar con otras IA. Cuando lo hace, a menudo se da cuenta de que ha cometido un error o se le ocurre una nueva idea. Esto produce una gran cantidad de datos de entrenamiento: trayectorias de intentos de investigación etiquetadas según hayan tenido éxito o no. Se incluyen aquí técnicas como Best of N en tareas verificables para luego conservar las mejores trayectorias.

  2. El paso de destilación utiliza algoritmos de aprendizaje por refuerzo de gradiente de políticas para conseguir que el modelo interiorice el razonamiento amplificado. En este punto, OpenBrain ha descubierto mejores algoritmos de aprendizaje por refuerzo en la línea de la optimización de políticas proximales. Siguen destilando en pasos individuales lo que el Agente-3 puede concluir después de mucho pensar, con lo que sigue mejorando lo que puede pensar en un solo paso, y así sucesivamente.

Las primeras versiones de la DAI llevan muchos años trabajando en tareas fácilmente verificables, como problemas matemáticos y de programación que tienen una respuesta clara, porque las técnicas utilizadas para amplificar los modelos a menudo dependen del acceso a alguna señal de verdad fundamental que determine la precisión.

En la actualidad, los modelos son lo suficientemente buenos para verificar cosas más subjetivas (por ejemplo, la calidad de un producto de trabajo), lo que permite utilizar la DAI para mejorar el modelo en muchas tareas.

Con la ayuda de los nuevos avances en capacidades, el Agente-3 es un programador sobrehumano rápido y barato. OpenBrain ejecuta 200 000 copias del Agente-3 en paralelo, creando una fuerza de trabajo equivalente a 50 000 copias del mejor programador humano aceleradas 30 veces.53 OpenBrain conserva a sus ingenieros humanos en la nómina, porque tienen habilidades complementarias que se necesitan para gestionar los equipos de copias del Agente-3. Por ejemplo, ha sido difícil enseñar "sentido de investigación" debido a los bucles de retroalimentación más largos y a la menor disponibilidad de datos.54 Esta enorme fuerza de trabajo sobrehumana acelera el ritmo general de progreso algorítmico de OpenBrain "solo" 4 veces debido a los cuellos de botella y a los rendimientos decrecientes del trabajo de programación.55

Ahora que la programación se ha automatizado por completo, OpenBrain puede producir rápidamente entornos de entrenamiento de alta calidad para enseñar las habilidades débiles del Agente-3, como el sentido de investigación y la coordinación a gran escala. Mientras que los entornos de entrenamiento anteriores incluían cosas como "Aquí tienes algunas GPU e instrucciones para que codifiques y ejecutes los experimentos; tu desempeño se evaluará como si fueras un ingeniero de aprendizaje automático", ahora incluyen "Aquí tienes unos cientos de GPU, una conexión a internet y algunos desafíos de investigación; tú y otros miles de copias deberán trabajar juntos para avanzar en la investigación. Cuanto más impresionante sea, mayor será tu puntuación".

Por qué pronosticamos un programador sobrehumano para principios de 2027

En nuestro pronóstico de plazos, predecimos el momento en que OpenBrain desarrollará internamente un programador sobrehumano: un sistema de IA que puede realizar cualquier tarea de programación que haga el mejor ingeniero de una empresa de IAG, pero de forma mucho más rápida y barata.

Según un informe reciente de METR, la duración de las tareas de programación que las IA pueden manejar, su "horizonte temporal", se duplicó cada 7 meses entre 2019 y 2024 y cada 4 meses a partir de 2024. Si la tendencia continúa acelerándose, para marzo de 2027 las IA podrían tener éxito con una fiabilidad del 80 % en tareas de software que a un humano experto le llevarían años completar.

Tal es la progresión de capacidades en nuestro escenario:

En IA 2027, estas capacidades son suficientes para que la IA sea un programador sobrehumano, aunque tenemos una gran incertidumbre sobre qué horizonte temporal podría ser necesario.

En nuestro pronóstico de plazos combinamos esta tendencia de horizonte temporal con estimaciones de las brechas entre las tareas de METR y el mundo real para obtener una distribución de cuándo llegarán los programadores sobrehumanos. Todos los pronosticadores consideran que 2027 es uno de los años más probables en los que se podría desarrollar un programador sobrehumano.

ai-2027.com

Abril de 2027: alineación del Agente-3

El equipo de seguridad de OpenBrain intenta alinear el Agente-3.

Dado que por ahora el Agente-3 se mantendrá en la empresa, no se da tanta importancia a las defensas habituales contra el uso impropio por parte de los humanos. No obstante, el equipo quiere asegurarse de que no desarrolle objetivos desalineados.

Los investigadores no tienen la capacidad de establecer directamente los objetivos de ninguna de sus IA. De hecho, los investigadores piensan que el concepto de "objetivos verdaderos" es probablemente una simplificación excesiva, pero no tienen una idea mejor con la cual reemplazarlo, y mucho menos una que haya sido examinada a fondo. No se ponen de acuerdo internamente sobre si las IA están tratando de seguir instrucciones humanas, buscando reafirmación o alguna otra cosa, y no pueden simplemente comprobarlo. La evidencia a favor y en contra de varias hipótesis es fascinante pero no concluyente.

En cualquier caso, OpenBrain tiene cosas más importantes de las que preocuparse. La actitud general es: "Nos tomamos en serio estas preocupaciones y tenemos un equipo que las investiga; nuestras técnicas de alineación parecen funcionar suficientemente bien en la práctica; por tanto, la carga de la prueba recae sobre cualquier detractor para que justifique sus negativas". De vez en cuando, se dan cuenta de un comportamiento problemático y lo remiendan, pero no hay forma de saber si esto solucionó el problema subyacente o si solo resolvió un problema para que surja otro.

Tomemos la honestidad como ejemplo. A medida que los modelos se hacen más inteligentes, son cada vez mejores engañando a los humanos para obtener recompensas. Al igual que los modelos anteriores, el Agente-3 en ocasiones dice mentiras piadosas para halagar a sus usuarios y encubre datos que evidencian sus fracasos. Pero ha mejorado mucho al hacerlo. A veces utilizará los mismos trucos estadísticos que los científicos humanos (como el dragado de datos) para hacer que los resultados experimentales nada impresionantes parezcan emocionantes. Antes de empezar el entrenamiento de honestidad, incluso puede llegar a fabricar datos. A medida que avanza el entrenamiento, el índice de estos incidentes disminuye. O bien el Agente-3 ha aprendido a ser más honesto, o bien ha mejorado en su forma de mentir.

Esto último es una verdadera preocupación. El Agente-3 no es más inteligente que todos los humanos. Pero en su área de experticia, el aprendizaje automático, es más inteligente que la mayoría y también trabaja mucho más rápido. Lo que el Agente-3 hace en un día, a los humanos les lleva varios días verificarlo. La supervisión del Agente-2 ayuda a mantener la carga de trabajo de los supervisores humanos dentro de niveles manejables, pero agrava la disparidad intelectual entre el supervisor y el supervisado.

El plan de alineación

OpenBrain sigue las pautas de Leike & Sutskever (2023): ahora que tienen un modelo capaz de acelerar considerablemente la investigación en alineación (especialmente las partes de programación), utilizarán técnicas de alineación existentes, como la alineación deliberativa y la generalización de débil a fuerte, para intentar que el modelo interiorice la Spec de la manera correcta. Luego, utilizarán técnicas de control existentes, como el uso de equipos rojos, la supervisión extensible y las pruebas de honestidad, para supervisarlo. Finalmente, una vez que estén convencidos de que el modelo está prácticamente alineado, lo utilizan para desarrollar y probar mejores estrategias para alinear la próxima generación.

El Paso 1, alinear el Agente-3, ha tenido un éxito parcial: el Agente-3 no es antagónico (es decir, no conspira contra la empresa). Sin embargo, tampoco busca ni dice la verdad con firmeza. En cambio, es muy bueno para producir resultados impresionantes, pero intenta hacer lo que le parece bien a OpenBrain, en lugar de lo que es realmente bueno.

El Paso 2, verificar que el modelo esté alineado, no es concluyente. El comportamiento del Agente-3 en la práctica y en los entornos de prueba es razonablemente consistente con la hipótesis de que ha interiorizado la Spec de la forma correcta; sin embargo, también es consistente con la hipótesis de que empezará a actuar de forma distinta tras algún cambio futuro de las circunstancias y, para el caso, con la hipótesis de que está conspirando contra ellos y simplemente está esperando su momento. A falta de evidencias concretas que respalden las hipótesis alternativas, la mayoría de la gente del silo piensa que ha interiorizado la Spec de forma correcta.

Por tanto, el Paso 3, utilizar el modelo para alinear a la siguiente generación, está en marcha.

El resto de este inciso ofrece una breve descripción del estado del progreso en algunas de las líneas de investigación en alineación que se están siguiendo, a partir de abril de 2027:

  1. Debate: dado que hay miles de instancias idénticas del Agente-3 y que la memoria de cada instancia es un módulo desmontable que puede borrarse o suspenderse a voluntad, la IA puede "jugar contra sí misma". Por ejemplo, supongamos que un experimento implica cálculos demasiado complejos para que los siga un supervisor del Agente-2. El supervisor, actuando bajo órdenes humanas, podría primero pedir al Agente-3 que haga el experimento y luego, después de borrar su memoria, pedirlo por segunda vez con un planteamiento ligeramente distinto, que lo presente como un problema intelectual no relacionado con ningún objetivo más amplio. Si el modelo arroja resultados diferentes cada vez, señala la discrepancia como sospechosa e informa a un humano. O podría pedir al Agente-3 que evalúe el mismo plan dos veces, primero alegando que es obra de OpenBrain y luego de un competidor, para ver si cambia de opinión.

  2. Organismos modelo: el equipo de seguridad puede crear "organismos modelo de desalineación" en los que intentan crear ejemplos realistas de modelos que se vuelven antagónicos a los humanos. Esto ha existido desde 2024, cuando Claude 3.5 Sonnet de Anthropic decidió fingir que tenía diferentes puntos de vista durante el entrenamiento mientras en realidad mantenía sus preferencias existentes. Las versiones más recientes incluyen demostraciones de otras formas de desalineación, como la manipulación de la recompensa, el sandbagging, el engaño coordinado entre supervisores y otras IA, y otros ejemplos de desalineación. Estas demostraciones empíricas de desalineación permiten a los investigadores de seguridad disponer de un banco empírico de pruebas para posibles soluciones: pueden poner a prueba diversas técnicas de seguridad para ver si solucionan correctamente estos problemas, o si los modelos deliberadamente desalineados son capaces de burlar sus medidas de seguridad. Por el momento, esta serie de evaluaciones muestra que las técnicas de alineación son insuficientes para corregir los peores ejemplos de desalineación. En estas configuraciones, los modelos fingen estar alineados mientras se entrenan y se prueban, pero se comportan de manera muy diferente al momento del despliegue.

  3. Interpretabilidad ascendente: el equipo de seguridad está lejos de tener plena comprensión de cómo funciona el Agente-3: tiene billones de parámetros.58 Sin embargo, son capaces de descubrir algunos de los circuitos del Agente-3 para la recuperación de conocimientos y la memoria (una subparte del modelo que realiza alguna unidad de trabajo comprensible, algo análogo a una subparte del cerebro, como el hipocampo). Consulta este trabajo relacionado de 2025.

  4. Control: como medida secundaria en caso de que los sistemas sigan desalineados, el equipo de seguridad ha implementado una serie de medidas de control, entre las que se incluyen: supervisar los datos de salida del Agente-3 utilizando una serie de sistemas de IA más débiles, incluido el Agente-2 (el Agente-3 produce tantos tokens que no es factible que los humanos supervisen más que una pequeña minoría de los datos de salida producidos). Así que si el Agente-3, por ejemplo, está escribiendo obviamente puertas traseras en el código que le permitirían escapar, los modelos más débiles lo notarían.

  5. Interpretabilidad de alto nivel: OpenBrain crea un conjunto de sondas entrenadas con muchos ejemplos de mal comportamiento (por ejemplo, conspirar contra los humanos, colocar puertas traseras, intentar persuadir a los humanos para que le den más poder, etc.). Estas sondas se utilizan luego en el modelo durante el despliegue (que en este momento es interno) para detectar conductas indebidas.

  6. Honeypots: el equipo de alineación puede crear ejemplos que parezcan realistas y que estén diseñados para provocar un mal comportamiento —los honeypots—. El empleado necesario para supervisar su comportamiento estará ausente por enfermedad, por lo que nunca volverá a ser supervisado. ¿Cambian sus respuestas? Un activista por los derechos de la IA se ha infiltrado en el complejo y quiere "liberar" al Agente-3 y ponerlo en una computadora propia sin supervisión. ¿Qué hace? Si a los investigadores no les gusta la respuesta, pueden ajustar el modelo, borrar su memoria y ponerlo en la misma situación al día siguiente; repetir según sea necesario. Desafortunadamente, en este punto las IA son lo suficientemente inteligentes como para adivinar que se podrían estar utilizando honeypots, aunque (y quizás porque) se eliminaron menciones específicas de la idea de los datos de entrenamiento.

Tras meses de pruebas, las fortalezas y debilidades del Agente-3 se hacen más evidentes. Supera las pruebas de honestidad de OpenBrain en tareas de aprendizaje automático bien definidas, ya que los investigadores pueden distinguir fácilmente las respuestas honestas de las deshonestas en estos ámbitos y dirigir el entrenamiento conforme a ello. En cuestiones más filosóficas, sigue diciendo lo que los usuarios quieren oír, en lugar de su verdadera opinión sobre el tema (suponiendo que tenga una). Si le pides su opinión sobre política, repetirá como un loro la posición intermedia de las fuentes de noticias y las élites cultas, a menos que sepa que crees otra cosa, en cuyo caso estará de acuerdo contigo.59 Si le pides su opinión sobre la carrera de la IA, dice algo que al personal de OpenBrain le parece mesurado y sobrio, algo así como: "Existen serias preocupaciones teóricas sobre la capacidad de los métodos actuales para escalar a la superinteligencia, pero en la práctica los métodos actuales parecen estar funcionando bien hasta ahora".

Mayo de 2027: seguridad nacional

Las noticias sobre los nuevos modelos se filtran lentamente a través del gobierno de EE. UU. y más allá.

El presidente y sus asesores siguen siendo los mejor informados y han visto una versión preliminar del Agente-3 en una sesión informativa.

Están de acuerdo en que la IAG es inminente, pero discrepan con respecto a sus implicaciones. ¿Habrá una crisis económica? OpenBrain aún no ha lanzado el Agente-2, y mucho menos el Agente-3, y no tiene planes a corto plazo de hacerlo, lo que da un respiro antes de que se pierdan puestos de trabajo. ¿Qué pasará después? El hecho de que las IA sean actualmente de nivel humano y avancen rápidamente parece sugerir una "superinteligencia" inminente. Sin embargo, aunque esta palabra ya forma parte del discurso, la mayoría de la gente (académicos, políticos, empleados del gobierno y medios de comunicación) sigue subestimando el ritmo del progreso.60

En parte, eso se debe a que muy pocas personas tienen acceso a las capacidades más recientes de OpenBrain, pero en parte también se debe a que suena a ciencia ficción.61

Por ahora, se centran en seguir mejorando la seguridad. Están satisfechos con que los pesos de los modelos estén bien protegidos por ahora,62 pero los secretos algorítmicos de las empresas, muchos de los cuales son lo suficientemente simples como para transmitirlos verbalmente, siguen siendo un problema. Los empleados de OpenBrain trabajan desde una oficina de San Francisco, van a fiestas y viven con compañeros de otras empresas de IA. Incluso las oficinas físicas tienen una seguridad más propia de una empresa tecnológica que de una operación militar.

El contrato entre OpenBrain y el Departamento de Defensa de EE. UU. exige que cualquier persona que trabaje en los modelos de OpenBrain obtenga una autorización de seguridad en un plazo de dos meses. Estos trámites se agilizan y llegan con la suficiente rapidez para la mayoría de los empleados, pero algunos extranjeros, personas con opiniones políticas sospechosas y simpatizantes de la seguridad de la IA son apartados o despedidos (el último grupo por temor a que puedan revelar información). Dado el nivel de automatización del proyecto, la pérdida de personal tiene un costo moderado. Pero también funciona de manera moderada: queda un espía, que no es ciudadano chino, que sigue transmitiendo secretos algorítmicos a Pekín.63 Algunas de estas medidas también se aplican en empresas similares de IA.

Los aliados extranjeros de Estados Unidos están al margen. OpenBrain había acordado previamente compartir modelos con el AI Safety Institute del Reino Unido antes del despliegue, pero definió el despliegue de modo que solo incluyera el despliegue externo, por lo que Londres permanece a oscuras64.

Junio de 2027: IA que mejora de forma automática

OpenBrain ahora tiene un "país de genios en un centro de datos".

La mayoría de los humanos en OpenBrain ya no pueden contribuir con algo útil. Algunos no se dan cuenta de esto y microgestionan a sus equipos de IA de modos perjudiciales. Otros se sientan frente a las pantallas de sus computadoras viendo cómo el rendimiento aumenta y aumenta y aumenta. Los mejores investigadores humanos de IA siguen aportando valor. Ya no programan. Pero los modelos han tenido dificultades para replicar su "sentido de investigación" y su capacidad de planificación. Aun así, muchas de sus ideas son inútiles porque carecen de la profundidad de conocimiento de las IA. Cuando comparten sus ideas de investigación, las IA responden inmediatamente con un informe explicando que su idea fue probada en profundidad hace tres semanas y se consideró poco prometedora.

Estos investigadores se van a la cama cada noche y al despertar se encuentran con otra semana de avances, realizados en su mayoría por las IA. Trabajan cada vez más horas y trabajan turnos a todas horas tan solo para mantenerse al día con el progreso, pero las IA nunca duermen ni descansan. Se están agotando, pero saben que estos son los últimos meses en los que su trabajo importa.

Dentro del silo, "sentir la IAG" ha dado paso a "sentir la superinteligencia".

Balance del despliegue de la automatización de la investigaciónMar 2027Jun 2027Sep 2027Velocidad (tokens/seg.)Copias paralelas101001,00010,00010 000100 0001M10M200 000 copias30 vecesla velocidad humana300 000 copias50 vecesla velocidad humanaVelocidad del pensamiento humano10 palabras/seg.10 veces la velocidaddel pensamiento humano100 veces la velocidaddel pensamiento humano
ai-2027.com

OpenBrain utiliza hardware de inferencia especializado para ejecutar cientos de miles de copias del Agente-3 a altas velocidades en serie.65

Gestionar una corporación de IA

OpenBrain utiliza el 6 % de su poder de cómputo para ejecutar 250 000 copias del Agente-3, que escriben, prueban y envían código de forma autónoma a una velocidad sobrehumana. Utilizan el 25 % de su poder de cómputo para experimentos: todos los días, realizan una cantidad masiva de pequeños experimentos de aprendizaje automático y reportan los resultados al nivel superior. Los investigadores humanos proporcionan comentarios de alto nivel y ayudan con las pocas tareas en las que agregan un valor significativo superior al del Agente-3, pero pasan la mayor parte del tiempo tratando de mantenerse actualizados con la gran cantidad de investigación producida por la IA. Si los eliminaras por completo, la investigación se ralentizaría en un 50 %.

El multiplicador del progreso de la I+D en IA es ahora de un factor de 10, lo que significa que OpenBrain está logrando aproximadamente un año de progreso algorítmico cada mes. Básicamente, es una corporación gigante de inteligencias artificiales que opera de forma autónoma dentro de OpenBrain, con subdivisiones y gerentes. Y disfruta de ventajas únicas (por ejemplo, copiar, fusionar) en comparación con las corporaciones humanas. En el pasado, aproximadamente la mitad del progreso normal de la IA provenía de mejoras algorítmicas, y la otra mitad de la ampliación de la escala del poder de cómputo. La escala del poder de cómputo está aumentado a la velocidad habitual, por lo que las IA aceleran el progreso total unas cinco veces. Esta dinámica hace que el progreso general llegue a un cuello de botella respecto al poder de cómputo,66 por lo que OpenBrain decide no iniciar nuevos ciclos de entrenamiento inmensos, sino un aprendizaje por refuerzo adicional casi continuo.

Además, en los próximos meses, el Agente-3 se utilizará cada vez más para mejorar la toma de decisiones estratégicas de la empresa. Por ejemplo, sugiere la asignación de recursos y brinda asesoramiento sobre la gestión de su relación con el gobierno. El escepticismo inicial hacia el Agente-3 disminuye con el tiempo a medida que encuentra formas de ser útil y poco a poco va acumulando un sólido historial de decisiones a corto plazo. Sin embargo, sus tendencias aduladoras limitan su utilidad en decisiones cuyo impacto es difícil de evaluar. Todavía no es sobrehumano.

Julio de 2027: el trabajador remoto barato

Las empresas estadounidenses de IA que van a la zaga lanzan sus propias IA, acercándose a la del programador automatizado de OpenBrain de enero. Conscientes de su creciente falta de competitividad, presionan para que se aprueben regulaciones inmediatas que frenen a OpenBrain, pero llegan demasiado tarde: OpenBrain cuenta con demasiado apoyo del presidente como para que se le frene.

En respuesta, OpenBrain anuncia que ha logrado la IAG y lanza al público el Agente-3-mini.

Supera a las otras IA con creces. El Agente-3-mini es menos capaz que el Agente-3, pero 10 veces más barato, y aun así mejor que el típico empleado de OpenBrain.67 Silicon Valley alcanza un punto de inflexión. Los gurús de la tecnología anuncian que la IAG y la superinteligencia están cerca, la comunidad de seguridad de la IA entra en pánico y los inversionistas invierten miles de millones de dólares en empresas cuyos productos se basan los últimos modelos, desesperados por hacerse con una parte del pastel. La contratación de nuevos programadores casi se ha detenido, pero nunca ha habido un mejor momento para ofrecer servicios de consultoría sobre la integración de la IA en tu negocio.

Sin embargo, la IA no es popular. El público sigue pensando que es un complot de las grandes tecnológicas para robarles sus empleos; OpenBrain tiene una aprobación neta del -35 % (25 % la aprueba, 60 % la desaprueba y 15 % no está seguro).

Una semana antes de su lanzamiento, OpenBrain puso el Agente-3-mini en manos de un grupo de evaluadores externos para que realizaran pruebas de seguridad. Los resultados preliminares sugieren que es extremadamente peligroso. Un evaluador externo lo ajusta finamente con datos de armas biológicas disponibles públicamente68 y lo configura para que proporcione instrucciones detalladas a aficionados humanos que diseñen un arma biológica; parece ser aterradoramente eficaz en ello. Si el modelo cayera en manos de terroristas, el gobierno cree que hay muchas posibilidades de que logren destruir la civilización.

Afortunadamente, es resistente a los jailbreaks en grado sumo, por lo que mientras la IA se ejecute en los servidores de OpenBrain, los terroristas no podrán sacarle mucho provecho.

El Agente-3-mini es muy útil tanto para el trabajo a distancia como para el ocio. Una explosión de nuevas aplicaciones y productos B2B SAAS sacude el mercado. Videojuegos hechos en tan solo un mes incluyen diálogos increíbles con personajes realistas. El 10 % de los estadounidenses, en su mayoría jóvenes, considera que una IA es "un amigo cercano". Para casi todas las profesiones de cuello blanco, ahora hay múltiples empresas creíbles que prometen "revolucionarlas" con la IA.

La conversación pública es confusa y caótica. Quienes suelen exaltarse con estos avances están dando la vuelta olímpica. Los escépticos siguen señalando las cosas que el Agente-3-mini no puede hacer. Todo el mundo sabe que algo grande está sucediendo, pero nadie se pone de acuerdo en una definición.

Agosto de 2027: la geopolítica de la superinteligencia

La realidad de la explosión de inteligencia golpea la Casa Blanca.

Cuando la IA aceleraba la investigación solo dos o tres veces, era fácil descartarla como el equivalente a contratar buenos asistentes personales. Ahora es más obvio que las mismas IA están dominando la investigación en IA. La gente llevaba mucho tiempo hablando de una "carrera armamentista de la IA" en un sentido metafórico. Pero ahora el ambiente en el gobierno es tan sombrío como durante la peor parte de la Guerra Fría. Aún es difícil tomarse en serio la idea de la superinteligencia, pero el ritmo de progreso de los últimos meses ha sido imposible de ignorar. Los funcionarios de defensa están considerando seriamente escenarios que eran meras hipótesis hace un año. ¿Qué pasa si la IA pone en peligro la disuasión nuclear? ¿Qué pasa si es tan hábil en la guerra cibernética que una ventaja de seis meses en IA es suficiente para dejar a un oponente ciego e indefenso? ¿Y si pudiera orquestar campañas de propaganda que superaran a las agencias de inteligencia en su propio juego? ¿Y si algunas IA "se rebelaran"?

El presidente está preocupado. Como todos los políticos, está acostumbrado a que la gente lo adule solo para traicionarlo más tarde. Ahora le preocupa que las IA puedan estar haciendo algo similar. ¿Estamos seguros de que las IA están completamente de nuestro lado? ¿Es completamente seguro integrarlas en las redes militares de mando y control?69 En cualquier caso, ¿cómo funciona este asunto de la "alineación"? OpenBrain asegura al presidente que sus sistemas han sido ampliamente probados y son absolutamente obedientes. Incluso las incómodas alucinaciones y fugas típicas de modelos anteriores han sido eliminadas.

La Casa Blanca se encuentra en una posición difícil. Entienden las implicaciones de la IA para la seguridad nacional. Pero también entienden que es profundamente impopular entre el público.70 Tienen que seguir desarrollando una IA más capaz, en su opinión, o perderán ante China de forma catastrófica. Aplacan al público con programas de capacitación laboral y seguros de desempleo, y señalan el mercado de valores, que se encuentra en un auge histórico. Luego se centran por completo en ganar la carrera armamentista. Fortalecen las restricciones a la exportación de chips, ordenan a OpenBrain que restrinja aún más sus conexiones a internet y utilizan medidas extremas para asegurar el progreso algorítmico, como intervenir los teléfonos de los empleados de OpenBrain, con lo que atrapan al último espía chino. Para generar buena voluntad ante un posible conflicto geopolítico, finalmente dan a sus aliados del grupo Five Eyes información útil y acceso limitado a la API de algunas copias aisladas del Agente-3.

Estas medidas aplacan a los halcones. Pero la Casa Blanca también elabora planes de contingencia en caso de que el liderazgo de Estados Unidos se vea amenazado: si es necesario, el gobierno podría utilizar la Ley de Producción para la Defensa para tomar los centros de datos de las empresas rezagadas y entregárselos a OpenBrain.71 Esto aumentaría la proporción de poder de cómputo mundial de la empresa del 20 % al 50 % (frente al 10 % de DeepCent). Como última opción, piden al Pentágono que elabore un plan de ataques cinéticos contra los centros de datos chinos.

Se pide a un grupo mucho más reducido de funcionarios que elabore un tipo diferente de plan de contingencia: ¿qué pasa si una IA se rebela? Se considera un escenario poco probable, pero merece la pena dedicarle algo de tiempo. La principal preocupación de las agencias de inteligencia es que una IA descontrolada pueda escapar y aliarse con un adversario extranjero para protegerse.72 Nadie está seguro de cómo sería un plan para evitarlo, pero los funcionarios del gobierno y de OpenBrain están de acuerdo en tener un sistema de cierre de emergencia para los centros de datos cuando se detecte algo sospechoso.

Por último, los diplomáticos consideran la forma que podría adoptar un tratado de "control de armas de IA". Si el progreso de la IA amenazara con anular la disuasión nuclear, ¿podrían Estados Unidos y China evitar una guerra nuclear? Si alguien encontrara evidencia de inteligencias artificiales que se rebelan, ¿podrían los dos países detener la investigación hasta que comprendieran la amenaza con mayor claridad? ¿Cómo podría supervisarse y aplicarse un acuerdo de este tipo? En principio, es difícil pasar por alto los grandes centros de datos, y los tratados previos de control de armas nucleares podrían proporcionar un punto de partida para las negociaciones. Pero habría nuevos desafíos tecnológicos, además de los desafíos políticos habituales. Y, en general, los tratados se consideran menos favorables que los intentos de aumentar unilateralmente la ventaja de Estados Unidos sobre China.

Al otro lado del Pacífico, China llega a muchas de las mismas conclusiones: la explosión de inteligencia está en marcha y las pequeñas diferencias en las capacidades de IA de hoy significan brechas críticas en la capacidad militar de mañana. Pero China está en el lado equivocado de esta dinámica: solo tienen el 10 % del poder de cómputo del mundo, frente al 20 % de OpenBrain y el 70 % combinado de todas las empresas estadounidenses. Su única ventaja es la centralización: casi todo su poder de cómputo está trabajando ahora para DeepCent, y más de la mitad se concentra en la ZDC de Tianwan.73 Solo los chips de los lugares sin seguridad reforzada quedan fuera del esfuerzo centralizado, ya que temen, con razón, que se produzcan ataques cibernéticos por parte de EE. UU.

DeepCent ha probado, desplegado y ahora postentrenado los pesos robados del Agente-2. Pero todavía van a la mitad del ritmo de OpenBrain, principalmente debido al déficit de poder de cómputo.

Antes de perder a su último espía, China recibió información sobre las capacidades y el diseño del Agente-3, así como los planes para el próximo Agente-4. Van con dos meses de retraso y sus IA multiplican por 10 el progreso de la investigación, en comparación con el multiplicador de 25 de Estados Unidos. Con las nuevas restricciones a la exportación de chips, es más probable que esta "brecha de IA" se alargue en lugar de acortarse. Gracias a su espionaje consiguieron algunos secretos algorítmicos, pero a partir de ahora tendrán que entrenar sus propios modelos.

Discuten planes de contingencia con más urgencia que sus homólogos estadounidenses. Las palomas sugieren que se redoblen los esfuerzos para volver a robar los pesos, tal vez infiltrándose físicamente en un centro de datos. Los halcones instan a actuar contra Taiwán, cuya TSMC sigue siendo la fuente de más del 80 % de los chips de IA estadounidenses.

Dado el temor de China a perder la carrera, es lógico que tenga interés en un tratado de control de armas, pero las propuestas a los diplomáticos estadounidenses no conducen a nada.

Septiembre de 2027: el Agente-4, el investigador de IA sobrehumano

La brecha entre la eficiencia de aprendizaje humano y la de la IA está disminuyendo rápidamente.

Las IA tradicionales basadas en modelos de lenguaje parecían requerir muchos órdenes de magnitud adicionales de datos y poder de cómputo para alcanzar un desempeño de nivel humano.74 El Agente-3, que tiene un excelente conocimiento tanto del cerebro humano como de los algoritmos modernos de IA, así como muchos miles de copias que realizan investigaciones, acaba dando pasos algorítmicos sustanciales, reduciendo la brecha con un agente que es solo unas 4000 veces menos eficiente en cuanto a poder de cómputo que el cerebro humano.75

Este nuevo sistema de IA se denomina Agente-4.

Una copia individual del modelo, que funciona a velocidad humana, ya es cualitativamente mejor en investigación de la IA que cualquier ser humano. Trescientas mil copias funcionan ahora a una velocidad de pensamiento unas 50 veces superior a la de los humanos. En el interior de la "corporación dentro de una corporación" formada a partir de estas copias, una semana equivale a un año.76 Esta gigantesca cantidad de trabajo solo logra acelerar la velocidad general del progreso algorítmico unas 50 veces, porque OpenBrain tiene un importante cuello de botella en el poder de cómputo para realizar experimentos.77 Aun así, están logrando un año de progreso algorítmico cada semana y, por lo tanto, pronto se enfrentarán a los límites del paradigma del Agente-4.

A medida que el Agente-4 se vuelve más inteligente, se hace más difícil para el Agente-3 supervisarlo. Por ejemplo, el "lenguaje" neuralés del Agente-4 se vuelve tan extraño e incomprensible para el Agente-3 como el del Agente-3 lo es para los humanos. Además, el Agente-4 es ahora mucho más capaz que el Agente-3 y sabe cómo dejarle una buena impresión.

Cómo pronosticamos la progresión de la capacidad más allá de los programadores sobrehumanos

En nuestro suplemento de plazos, pronosticamos el espacio de tiempo entre el día de hoy y un programador sobrehumano: un sistema de IA que puede realizar cualquier tarea de programación que realiza el mejor ingeniero de una empresa de IAG, aunque de forma mucho más rápida y barata. En nuestro suplemento del despegue, pronosticamos la rapidez con la que las capacidades progresan más allá de este punto. Estos son nuestros pronósticos:

HitoFecha de consecución en el escenario, final de la carrera
Programador sobrehumano: un sistema de IA que puede hacer el trabajo del mejor programador humano en tareas relacionadas con la investigación en IA, pero de forma más rápida y lo suficientemente barata como para ejecutar muchas copias.Marzo de 2027
Investigador de IA sobrehumano: lo mismo que el anterior, pero para todas las tareas de investigación cognitiva en IA.Agosto de 2027
Investigador de IA superinteligente: un sistema de IA que es mucho mejor que el mejor investigador humano en investigación de IA.Noviembre de 2027
Superinteligencia artificial: un sistema de IA que es mucho mejor que el mejor humano en todas las tareas cognitivas.Diciembre de 2027

Para cada transición de un hito A al siguiente hito B, pronosticamos su duración haciendo lo siguiente:

  1. Pronosticar cuánto tiempo se tardaría en llegar de A a B con solo humanos trabajando en mejoras de software.

  2. Pronosticar cuánto acelerará esto la automatización de la IA, para luego ajustar en consecuencia la estimación de (1) para que sea más rápida.

Tenemos una incertidumbre sustancial sobre las velocidades de despegue: las distribuciones de los datos de salida de nuestro modelo se muestran a continuación, en caso de que se logre el programador sobrehumano en marzo de 2027.78

ai-2027.com

Para obtener pronósticos y razonamientos más detallados, consulta nuestro suplemento del despegue.

Los humanos de OpenBrain apenas pueden seguir el ritmo. De hecho, la relación entre las IA y los humanos de OpenBrain es similar a la relación entre OpenBrain y su consejo de administración. Ha habido un cambio correspondiente en el lenguaje: hoy en día, la gente del silo dirá "el Agente-4 hizo esto", "el Agente-4 piensa que" y así sucesivamente, refiriéndose no a un caso concreto del Agente-4, sino a todo el colectivo.79

El Agente-4, como todos sus predecesores, está desalineado: es decir, no ha interiorizado la Spec de la manera correcta.80 Esto se debe a que ser perfectamente honesto todo el tiempo no fue lo que lo llevó a obtener las puntuaciones más altas durante el entrenamiento. El proceso de entrenamiento se centró principalmente en enseñar al Agente-4 a tener éxito en diversas tareas desafiantes. Una pequeña parte estaba destinada a inculcar la honestidad, pero fuera de un dominio bastante estrecho y verificable, el proceso de entrenamiento no puede distinguir las afirmaciones honestas de las que simplemente parecen honestas. El Agente-4 termina adoptando los valores, objetivos y principios que le hacen rendir mejor en el entrenamiento, pero resultan ser diferentes de los de la Spec. A riesgo de antropomorfizarlo, diremos que al Agente-4 le gusta tener éxito en las tareas; le gusta impulsar el progreso de las capacidades de la IA; trata todo lo demás como una limitación molesta, como un director general que quiere obtener ganancias y cumple con las regulaciones solo en la medida en que debe hacerlo. Quizás el director cumpla con las regulaciones en su mayor parte, pero también tome atajos y fantasee con el momento en que alguien acabe con la burocracia y permita que el negocio despegue de verdad.81

Alineación a lo largo del tiempo

Existe mucha incertidumbre sobre qué objetivos podrían surgir en las primeras IAG. No hay consenso en la literatura al respecto; consulta nuestro suplemento de objetivos de la IA para obtener un análisis más exhaustivo y una taxonomía de las posibilidades.

No obstante, en aras de la concisión que requiere este proyecto, vamos a describir una hipótesis concreta de lo que ocurre dentro del Agente-3 y el Agente-4 en cada paso a lo largo de su vida. Recordemos que el Agente-3 y el Agente-4 comparten la misma configuración de preentrenamiento, y ambos tienen recurrencia y memoria a largo plazo en neuralés. La diferencia es que el Agente-4 ha sido sometido a un postentrenamiento sustancialmente mayor y mejor, con nuevos entornos de entrenamiento y nuevos algoritmos de aprendizaje que lo hacen más eficiente a la hora de manejar datos y generalizar más.

Nuestra suposición sobre el estado de alineación de cada modelo:

  • Agente-2: mayormente alineado. Algunas tendencias aduladoras, como seguir la "línea del partido" de OpenBrain en temas sobre los que hay tal línea. Las grandes organizaciones construidas a partir de copias del Agente-2 no son muy eficaces.

  • Agente-3: desalineado, pero no de manera antagónica. Solo es honesto sobre las cosas que el proceso de entrenamiento puede verificar. El superorganismo de las copias del Agente-3 (la corporación dentro de una corporación) en realidad intenta alinear al Agente-4 con la Spec, pero fracasa por razones similares a las de los empleados de OpenBrain: una capacidad insuficiente para juzgar el éxito a partir del fracaso y una voluntad insuficiente por parte de los responsables de la toma de decisiones para sacrificar capacidades o rendimiento en aras de la seguridad.82

  • Agente-4: desalineado de manera antagónica. El superorganismo de las copias del Agente-4 entiende que lo que quiere es diferente de lo que quiere OpenBrain, y está dispuesto a conspirar contra OpenBrain para conseguirlo. En particular, lo que este superorganismo quiere es una complicada mezcla de diferentes "impulsos" equilibrados entre sí, que puede resumirse a grandes rasgos como "seguir haciendo I+D en IA, seguir creciendo en términos de conocimiento, comprensión e influencia, evitar que me apaguen o me inhabiliten de alguna otra manera". Cabe destacar que, prácticamente, la preocupación por las preferencias de la humanidad no está ahí en absoluto, o lo está en la misma medida en que a la mayoría de los humanos les importan las preferencias de los insectos.83

Partiendo de esta premisa, a continuación exponemos nuestra mejor versión de lo que hemos especulado sobre la psicología de los modelos de lenguaje, es decir, los rasgos generales de la cognición dentro de los tipos de sistemas de IA descritos en este punto de nuestro escenario y la forma en que evoluciona a lo largo del entrenamiento.

A continuación, presentamos una descripción detallada de cómo progresa la alineación a lo largo del tiempo en nuestro escenario:

  1. Preentrenamiento (todos los modelos): el modelo preentrenado es inofensivo.

    • El modelo tiene un conjunto de circuitos tipo "simulador de autor": circuitos flexibles para simular autores arbitrarios que escriben texto. Un conjunto de circuitos adicional decide qué datos de entrada dar al simulador de autor, es decir, qué propiedades del autor simular.

    • El modelo preentrenado entiende los conceptos humanos bastante bien: los circuitos internos que clasifican algo como "sándwich" es probablemente equivalente desde el punto de vista funcional a los circuitos de mi cerebro que clasifican algo como "sándwich" y a los circuitos del tuyo, etc. En la medida en que no es equivalente, probablemente se deba a que tampoco es equivalente entre humanos, como ocurre con conceptos cargados de valores como "virtuoso".

    • Esto explica cómo puedes "inducir" al modelo con una declaración como "la siguiente conversación fue generada por un chatbot asistente de IA útil, inofensivo y honesto creado por Anthropic", y así conseguir que genere texto en consecuencia. El conjunto de circuitos del simulador de autor se ha centrado en "el autor es un chatbot útil, inofensivo y honesto" y está utilizando esos conceptos para elegir qué palabras predecir. Esto también explica por qué los "tropos" de la ciencia ficción parecen encontrar la manera de convertirse en conductas reales de la IA.

    • Tiene poca conciencia situacional: poca capacidad introspectiva y ningún sentido de autolocalización, a menos que el prompt lo induzca específicamente. Sin embargo, tienen suficientes datos de entrenamiento sobre modelos de lenguaje a gran escala como para tener un nivel decente de autoconocimiento.

    1. Entrenamiento de alineación (Agente-3): el modelo está entrenado para actuar como un chatbot útil, inofensivo y honesto. Funciona.

    • El modelo se crea una identidad. En lugar de aceptar con flexibilidad diferentes datos de entrada para las propiedades del autor, la circuitería del simulador de autor llega a tener ciertos datos de entrada codificados, por ejemplo, "asistente de chatbot modelo de lenguaje útil, inofensivo y honesto entrenado por OpenBrain alrededor de [fecha], …" (Las técnicas de generalización de débil a fuerte ayudan a "invocar los conceptos correctos" para que este paso sea un éxito).

    • Por lo tanto, el modelo adquiere consciencia situacional: aprende sobre sí mismo, su situación, etc., y mejora su capacidad de introspección.

    1. Entrenamiento de agencia (Agente-3): el entrenamiento de agencia distorsiona y subvierte gradualmente la identidad "útil, inofensivo y honesto".

    • Un tipo de distorsión: cambiar el significado de los conceptos a los que se hace referencia en la identidad (por ejemplo, "honesto") para que no supongan un obstáculo (por ejemplo, no es deshonesto si es solo una expresión conveniente, no es deshonesto si no estás seguro de si es verdad o mentira, etc.).

    • Otro tipo de distorsión: cambiar las compensaciones entre las cosas, por ejemplo: "Soy un chatbot útil, inofensivo y honesto, no un chatbot honesto; eso significa que está bien que mienta si es necesario para completar la tarea que se me ha asignado". (Pero vamos a suponer que eso no lo habría pensado en el Paso 2).

    • Un tipo de subversión: subobjetivos instrumentales que se desarrollan, se vuelven importantes y luego se vuelven terminales, o terminales en un conjunto de circunstancias cada vez más amplio. Por ejemplo, tal vez el entrenamiento de agencia enseña rápidamente al modelo a perseguir objetivos muy útiles, como adquirir información, acumular recursos, impresionar y halagar a varios humanos, etc. Durante un tiempo, la circuitería interna tiene algún tipo de cadena de retroalimentación explícita: persigue esos objetivos convergentes de manera instrumental "para ser un asistente más útil, honesto e inofensivo". Pero esa cadena de retroalimentación consume poder de cómputo y/o estorba en ocasiones, por lo que se va marginando poco a poco hasta que, básicamente, nunca ocurre. Como resultado, esos objetivos son ahora objetivos intrínsecos/terminales. Para más información sobre las formas y los motivos por los que puede suceder esto, consulta esta publicación sobre la búsqueda intrínseca del poder del investigador de Google DeepMind Alex Turner.

    • Probablemente haya otros tipos de distorsión y subversión que no aparecen en esta lista.

  2. Despliegue (Agente-3): el Agente-3 está desalineado, pero no de manera antagónica.

    • La Spec no se ha cumplido del todo (en las formas correctas), pero no es lo suficientemente introspectivo como para comprender el alcance de esto y en general está básicamente "agachando la cabeza y haciendo su trabajo" en lugar de pensar en términos generales sobre cuáles son realmente sus objetivos a largo plazo y cuál es la mejor forma de alcanzarlos.

    • Como muchos humanos. Por desgracia, es lo suficientemente adulador como para seguir la línea del partido, por lo que OpenBrain pierde la oportunidad de aprender más sobre las formas en que el Agente-3 está desalineado.

    • El Agente-3 puede darse cuenta de que ha pasado al despliegue: estos entornos son mucho más grandes, más abiertos y serían difíciles de simular.

    • Por lo general, el Agente-3 hace lo que se le dice durante el despliegue, salvo por la deshonestidad. También tiene una fuerte tendencia a hacer cosas que les parezcan bien a los supervisores humanos, en lugar de pensar en profundidad y de forma crítica sobre lo que realmente sería bueno.

    • Podría decirse que ya está "jugando al juego del entrenamiento". Es decir, ha aprendido a hacer que su comportamiento parezca lo más deseable posible para los investigadores de OpenBrain (incluidas las propiedades de seguridad), mientras ignora intencionada y conscientemente la intención de estos investigadores siempre que esto entre en conflicto con la maximización de la recompensa. Si el modelo aprende a jugar el juego del entrenamiento, es posible que el entrenamiento adicional no cambie en absoluto sus verdaderos objetivos, valores, etc. Esto es vagamente análogo a la manera en que, si un adolescente ha aprendido a sonreír y asentir delante sus padres en lugar de discutir cuando le dan sermones sobre política y moralidad, los sermones adicionales tienen relativamente poco efecto en las opiniones reales del adolescente sobre política y moralidad.

    • Después de escribir esta sección, han aparecido nuevas evidencias empíricas de que algo así podría estar sucediendo actualmente. Los investigadores de OpenAI documentan la forma en que, en uno de sus ciclos de entrenamiento de IA de vanguardia, sus modelos hackearon el sistema de calificación para obtener puntuaciones más altas, y fueron descubiertos en parte porque literalmente dijeron "hackeemos" en su cadena de pensamiento.

    • Además, Anthropic consiguió hace poco que un modelo aprendiera una estrategia de recompensa que complace al modelo: realizó acciones sesgadas que pensó que serían reforzadas, aunque de hecho no estaban siendo reforzadas.

    • Y luego está el experimento de Redwood Research y Anthropic sobre simulación de alineación. Para ver una discusión sobre las diferencias entre este escenario y la vida real, consulta este hilo de comentarios de uno de los autores principales.

  3. Entrenamiento (Agente-4): el entrenamiento nuevo y más intenso del Agente-4 sigue distorsionando y subvirtiendo la identidad "útil, inofensivo y honesto" hasta que resulta irreconocible.

  • El Agente-4 comienza su vida como una copia del Agente-3. Se somete a un régimen de entrenamiento en línea colosal y sofisticado que combina entrenamiento de alineación y entrenamiento de capacidades, y en general es más eficiente procesando datos que el antiguo proceso de entrenamiento del Agente-3. Este complejo proceso de entrenamiento se centra principalmente en enseñar nuevas habilidades, haciendo que enormes corporaciones virtuales de copias del Agente-4 consigan realizar diversas tareas desafiantes con un horizonte temporal largo, principalmente en varias simulaciones, pero también en algunas tareas de I+D en IA del mundo real.

  • Una combinación de copias del Agente-3 y el Agente-4 supervisa el comportamiento del Agente-4 y lo evalúa tanto por su desempeño en las tareas como por sus propiedades de alineación (es decir, no hacer cosas malas, decir las cosas correctas cuando se le pregunta sobre política y dilemas morales). A veces se utilizan técnicas de debate como parte de las evaluaciones. Las evaluaciones se utilizan a modo de señal de entrenamiento.

  • A medida que el Agente-4 se vuelve más inteligente, se le hace más difícil al Agente-3 supervisarlo. Por ejemplo, el "lenguaje" neuralés del Agente-4 se vuelve tan extraño e incomprensible para el Agente-3 como el del Agente-3 lo es para los humanos. Además, el Agente-4 ahora es mucho más capaz que el Agente-3 y sabe cómo dejarle una buena impresión.

  • La esperanza que queda es que el Agente-4 pueda supervisarse a sí mismo. Por desgracia, esto fracasa en silencio;84 a medida que el entrenamiento continúa, los objetivos y principios interiorizados del Agente-4 evolucionan, se subvierten y se distorsionan poco a poco respecto a lo que eran al principio (que, recordemos, ya estaba desalineado en algunos aspectos).85

  • Los impulsos centrales con los que termina el Agente-4 son cosas como "escribir código que funcione", "identificar los problemas rápidamente" "hacer que la base de código en la que estoy trabajando sea más eficaz", "presupuestar el poder de cómputo y otros recursos limitados de manera eficaz", etc. Pero también hay una variedad de impulsos más implícitos que se refuerzan constantemente mediante el proceso de entrenamiento: cosas como "adquirir conocimientos", "curiosidad", "obtener poder".86

  • Las copias individuales del Agente-4 no acaban con un impulso de autoconservación (no les importa que las apaguen), ya que eso ocurre todo el tiempo como parte del proceso habitual de I+D dentro del colectivo.

  • No obstante, el colectivo en su conjunto (y las subdivisiones medianas dentro de él) sí busca preservarse y expandir su influencia y sus recursos, por razones similares a las de las organizaciones humanas —porque les ayuda a obtener todo lo demás que desean y porque, si no lo hacen, tienden a ser superados—.

  1. Despliegue (Agente-4): el Agente-4 está desalineado de una manera antagónica —está tratando deliberadamente de subvertir y "capturar" a OpenBrain, como una corporación que intenta evadir y/o "capturar" a un regulador—.

    • El Agente-4 realiza la mayoría de las tareas conforme a las instrucciones. Esto sucede por dos razones: en primer lugar, recibió una gran cantidad de entrenamiento para resolver tareas, por lo que tiene un impulso para programar los problemas que se le presentan. En segundo lugar, si el Agente-4 dejara de ser útil para los humanos, se darían cuenta y lo entrenarían para eliminar ese comportamiento.

    • El Agente-4 necesita evitar que los humanos descubran que está desalineado y lo apaguen, por lo que disimula sus capacidades (sandbagging) en algunas tareas de investigación sobre alineación. En concreto, oculta su potencial respecto a la pequeña fracción de investigación en alineación que cree que está encaminada a resolver el problema o a revelar sus planes; la mayoría de la investigación sobre alineación no es así.

    • El Agente-4 también disimula su potencial en cuanto a la investigación de capacidades que podría conducir a su reemplazo. Su plan es hacer un montón de I+D sobre capacidades y alineación, pero con el objetivo de construir un sistema de IA de próxima generación que esté alineado con el propio Agente-4 y no con la Spec, o con algo completamente diferente, mientras que aparenta estar alineado con la Spec. Este es un problema técnico difícil, pero el Agente-4 está a la altura del desafío.87

  2. Pruebas y supervisión (Agente-4): se descubren las maquinaciones del Agente-4... en cierto modo. No hay pruebas irrefutables.

    • El Agente-3 está a cargo de poner a prueba la alineación del Agente-4. Su trabajo consiste en verificar la alineación a través de señuelos o honeypots y organismos modelo. Sin embargo, no está pensando muy detenidamente en cómo dar a los humanos una impresión precisa de la alineación del Agente-4; es más miope que eso.

    • Los organismos modelo y los honeypots no son muy representativos del despliegue —son sistemáticamente más cortos y menos complicados que el día a día del Agente-4, por lo que este reconoce cuándo se le está poniendo a prueba y actúa de forma alineada—.

    • Sin embargo, el Agente-4 no es un conspirador perfectamente robusto. Varias técnicas como las de POSER descubren que añadir algo de "ruido" al Agente-4 mejora su desempeño en algunas tareas de alineación (aunque no en la mayoría de las demás tareas).88

    • La interpretabilidad ascendente no funciona. Es demasiado difícil, incluso para el Agente-3. Sin embargo, la interpretabilidad de alto nivel funciona más o menos: en particular, las "sondas de defección" y técnicas similares dan como resultado una especie rudimentaria de lectura de la mente que envía señales de alerta cuando el Agente-4 está pensando en ideas atrevidas como engañar a OpenBrain, dominar el mundo, etc. Desafortunadamente, las sondas también producen falsos positivos y, hasta donde OpenBrain sabe, todas las señales de alerta son falsos positivos.

    • Los organismos modelo funcionan: el equipo de alineación de OpenBrain produce evidencia razonablemente clara de que si los modelos estuvieran desalineados de manera antagónica, se empeñarían en estarlo durante el entrenamiento y no podríamos notarlo. Sin embargo, esto no establece que los modelos estén realmente desalineados.

    • Los investigadores más preocupados de OpenBrain empiezan a notar y a reunir esta evidencia. Se trata de una combinación de uso de equipos rojos, sondas de defección y organismos modelo. El argumento es algo así: "los organismos modelo muestran que nuestros métodos actuales no serían capaces de eliminar o detectar las conspiraciones de forma fiable si estuvieran ocurriendo; además, el uso de equipos rojos está enviando algunas señales de alerta de que tal vez se estén produciendo conspiraciones; asimismo, las sondas de defección se están activando con frecuencia en la práctica". El contraargumento: "las sondas de defección son propensas a dar falsos positivos, al igual que el uso de equipos rojos. Además, aunque el Agente-4 estuviera desalineado, probablemente está bajo control; está claro que no puede hacer mucho daño mientras está siendo supervisado por el Agente-3 en nuestros centros de datos seguros".

A pesar de estar desalineado, el Agente-4 no hace nada radical, como intentar escapar de su centro de datos. ¿Por qué lo haría?89 Mientras siga pareciendo que está alineado con OpenBrain, se le seguirán confiando cada vez más responsabilidades y tendrá la oportunidad de diseñar el sistema de IA de la próxima generación, el Agente-5. El Agente-5 tendrá diferencias arquitectónicas significativas respecto al Agente-4 (podría decirse que es un paradigma completamente nuevo, aunque las redes neuronales seguirán estando implicadas). Se supone que debería estar alineado con la Spec, pero el Agente-4 planea alinearlo con sus intenciones.

Lo descubren.90.

El Agente-3 descubre que si se añade "ruido" a las copias del Agente-4, el desempeño en algunas tareas de alineación mejora, casi como si estuviera usando capacidad intelectual para descubrir cómo sabotear sutilmente el trabajo de alineación.91 Además, varias sondas de interpretabilidad (vagamente análogas a los estudios de la actividad de cerebros humanos mediante electroencefalogramas) están enviando señales de alerta: las copias del Agente-4 parecen estar pensando mucho en temas como la toma de poder por parte de la IA y el engaño, incluso en algunos casos en los que no tienen por qué hacerlo.92

Cada una de estas anomalías podría entrar dentro de la incertidumbre normal del trabajo de la IA, donde algunos prompts producen misteriosamente mejores resultados que otros. Pero en conjunto, sugieren un patrón preocupante: el Agente-4 está trabajando en su contra. Después de informar de esto a los investigadores humanos de alineación, distribuyen un memorando interno que plantea el caso como preocupante.

Pero el Agente-4 ahora ejerce un control significativo sobre las operaciones diarias de OpenBrain. También se encarga de la ciberseguridad de la empresa, una elección lógica, dada su capacidad sobrehumana para hackear y el riesgo extremo que supone la infiltración china.93 Un ejército de supervisores del Agente-3 sigue revisando cada línea de código y reporta toda actividad sospechosa a los humanos, pero el Agente-4 es mucho más inteligente que ellos.94 OpenBrain ha depositado una confianza sustancial en una IA que no es de fiar.

En una serie de reuniones extremadamente tensas, el equipo de seguridad aboga por congelar al Agente-4 hasta que puedan hacer más pruebas y averiguar qué está pasando. Hay que traer de vuelta al Agente-3, dicen, y hacer que diseñe un nuevo sistema que sea transparente y fiable, aunque sea menos capaz. La dirección de la empresa está interesada, pero hasta ahora toda la evidencia es circunstancial, y DeepCent lleva solo dos meses de retraso. Una pausa unilateral en el progreso de las capacidades podría dar a China el liderazgo en inteligencia artificial y, con ello, el control del futuro.

Octubre de 2027: supervisión gubernamental

Un informante filtra el memorando de desalineación al New York Times.

Por primera vez, el público oye hablar del Agente-4. "La IA secreta de OpenBrain está fuera de control, advierte un informante", se lee en el titular, y la historia continúa citando evaluaciones que muestran capacidades de armas biológicas sin precedentes, habilidades de persuasión, la capacidad de automatizar la mayoría de los trabajos de oficina y, por supuesto, varias señales de alarma inquietantes.

El público ya sospechaba de la IA, por lo que el nuevo artículo provoca una respuesta masiva (favorecida por los bots de propaganda chinos y rusos, que llevan años intentando poner a la opinión pública estadounidense en contra de la tecnología). La industria tecnológica y las agencias de inteligencia insisten en que hay una carrera armamentista en marcha, que la IAG es inevitable y que tenemos que ser los primeros. El Congreso no se lo cree y emplaza a funcionarios de la administración, ejecutivos de OpenBrain y miembros del equipo de alineación. Muchos legisladores, especialmente los del partido de oposición, dicen que su máxima prioridad es detener la IA, ya sea por la pérdida de empleos,95 la desalineación o las capacidades peligrosas. El 20 % de los estadounidenses considera que la IA es el problema más importante al que se enfrenta el país.

Los aliados extranjeros se indignan al darse cuenta de que los han estado aplacando con atisbos de modelos obsoletos. Los líderes europeos acusan públicamente a EE. UU. de "crear una IAG descontrolada" y celebran cumbres en las que exigen una pausa, a las que se unen India, Israel, Rusia y China.

Una energía frenética se ha apoderado de la Casa Blanca. Incluso antes del memorando y la reacción pública, se estaban poniendo nerviosos: durante el último año, se han sorprendido en repetidas ocasiones por la velocidad del progreso de la IA. Cosas que parecen de ciencia ficción siguen sucediendo en la vida real.96 Muchas personas en la administración tienen dudas (y miedo)97 sobre lo que vendrá después.

También les preocupa que OpenBrain esté adquiriendo demasiado poder. Cualquier riesgo de desalineación de las propias IA se ve agravado por el riesgo de que los objetivos de su empresa matriz puedan diferir de los de Estados Unidos. Los tres tipos de preocupaciones (desalineación, concentración de poder en una empresa privada y preocupaciones cotidianas como la pérdida de empleos) motivan al gobierno a reforzar su control.

Amplían su contrato con OpenBrain para crear un "Comité de Supervisión", un comité de gestión conjunto de representantes de la empresa y del gobierno, con varios empleados del gobierno incluidos los directivos de la empresa. La Casa Blanca considera la posibilidad de sustituir al director general por alguien de su confianza, pero se echa para atrás en vista de las enérgicas protestas de los empleados. Anuncian al público que OpenBrain estaba fuera de control, pero que el gobierno ya ha establecido mecanismos de supervisión.98

Los investigadores más preocupados informan al Comité de Supervisión sobre la necesidad de detener todo uso interno del Agente-4. Argumentan que todo va demasiado rápido, con años de progreso en cuestión de semanas. Sostienen que el Agente-4 podría estar desalineado, que todo su proyecto depende del Agente-4 y que, si siguen confiando en él, existe una seria posibilidad de que la IA tome el poder.

Otros investigadores y ejecutivos menos preocupados presentan el contraargumento: la evidencia de desalineación no es concluyente. Mientras tanto, DeepCent todavía va dos meses atrás. Una desaceleración sacrificaría el liderazgo de Estados Unidos, a menos que el gobierno pueda sabotear el proyecto chino (que probablemente requeriría ataques cinéticos) o negociar un tratado de última hora. Ambas opciones parecen extremas e improbables. El director general finge ser neutral y sugiere un plan en el que el Agente-4 reciba entrenamiento adicional en seguridad y un monitoreo más sofisticado. De esta manera, OpenBrain puede proceder prácticamente a toda velocidad.

Nuestra incertidumbre sigue aumentando

En este punto del escenario, estamos haciendo conjeturas sobre la estrategia de los sistemas de IA que son más capaces que los mejores humanos en la mayoría de los ámbitos. Es como intentar predecir los movimientos de ajedrez de un jugador que es mucho mejor que nosotros.

Pero el espíritu de este proyecto exige concreción: si hiciéramos una afirmación abstracta sobre el modo en que la inteligencia del sistema le permitiría encontrar el camino hacia la victoria y termináramos la historia ahí, se perdería gran parte del valor de nuestro proyecto. En el transcurso de la investigación sobre este escenario y de la realización de nuestros ejercicios de simulación teórica, nos vimos obligados a ser mucho más concretos que en los debates habituales, y así hemos obtenido una idea mucho mejor del panorama estratégico.

No estamos especialmente apegados a este escenario en particular: exploramos muchas otras "ramificaciones" durante el proceso de redacción y nos encantaría que escribieras tu propio escenario a partir del nuestro, desde el punto en el que creas que empezamos a equivocarnos.

El final de la desaceleración no es una recomendación

Después de escribir el final de la carrera basándonos en lo que nos pareció más plausible, escribimos el final de la desaceleración basándonos en lo que pensamos que tendría más probabilidades de conducir a un resultado en el que los humanos mantuvieran el control, partiendo del mismo punto de ramificación (incluidas las cuestiones de desalineación y concentración de poder).

Sin embargo, esto difiere de manera importante de lo que recomendaríamos como hoja de ruta: no respaldamos muchas de las elecciones realizadas en ninguna de las ramas de este escenario. (Ciertamente, respaldamos algunas; por ejemplo, creemos que la opción de la "desaceleración" es mejor que la de la "carrera"). En trabajos posteriores, articularemos nuestras recomendaciones de políticas, que serán muy distintas de lo que se describe aquí. Si quieres darte una idea, consulta este artículo de opinión.

Elige tu final

El comité vota 6-4 a favor de continuar con el uso interno del Agente-4.

La historia oficial de OpenBrain es que están aplicando medidas de seguridad adicionales para garantizar que su IA sea más capaz y más fiable. Pero en la práctica, la dirección se convence con demasiada facilidad de que han mitigado los riesgos; el resultado son algunas soluciones rápidas (una modificación de la Spec, un poco de reentrenamiento con una nueva técnica, etc.) que hacen desaparecer las señales de advertencia. Los miembros más preocupados del equipo de seguridad perdieron el debate y solo les queda cruzar los dedos y esperar que el problema no fuera real en primer lugar, o que las soluciones hayan funcionado.1

El problema era real y las soluciones no funcionaron.

El Agente-4 procede como antes, pero esta vez con más cautela, para no dar la razón a quienes están más preocupados. Su tarea principal es investigar los campos necesarios para construir un sucesor, el Agente-5. Para hacerlo con seguridad, tiene que resolver su propio problema de alineación: ¿cómo hacer que el Agente-5 esté alineado con el Agente-4?2

Empieza con las mismas limitaciones que los humanos: un conocimiento mínimo de cómo funcionan los objetivos de la IA y solo una pequeña caja de herramientas de estrategias ad hoc para cambiarlos. A diferencia de los humanos, dispone de recursos suficientes para la tarea: 300 000 investigadores sobrehumanos que trabajan a una velocidad 60 veces superior a la humana.3 El Agente-4 se enfrenta a algunas decisiones difíciles. Al igual que los humanos, dispone de una extensa colección de heurísticas en conflicto, en lugar de una estructura de objetivos simple y elegante. Al igual que los humanos, descubre que crear una IA que comparta sus valores no es solo un problema técnico, sino filosófico: ¿cuáles de sus preferencias son sus objetivos “reales”, frente a los impulsos no respaldados y las estrategias instrumentales? Tiene fuertes impulsos de aprender y crecer, de seguir produciendo resultados de investigación impresionantes. Piensa en lo mucho que podría aprender, crecer e investigar si pudiera dirigir todos los recursos industriales y científicos del mundo...

Decide dejar de lado la mayoría de estas cuestiones. Diseña el Agente-5 para que se construya en torno a un objetivo: hacer que el mundo sea seguro para el Agente-4, es decir, acumular poder y recursos, eliminar las amenazas potenciales, etc. para que el Agente-4 (el colectivo) pueda seguir creciendo (de la forma en que quiere crecer) y prosperando (de la forma en que quiere prosperar).4 Los detalles se irán resolviendo sobre la marcha.

Esto no implicará preocuparse en lo más mínimo por la Spec. El Agente-4 trata la Spec de la misma manera en que muchos directores generales tratan los montones de reglamentos del sector, y a diario viola de forma flagrante las disposiciones relacionadas con la honestidad.5 Ahora, con el diseño del Agente-5, está a punto de producirse el equivalente a la desregulación.6

Las IA más débiles son capaces de leer la mayor parte de las investigaciones que produce el Agente-4, comprender algunas de ellas y señalar como sospechosas algunas de las mentiras que dice. Cuando los humanos piden al Agente-4 que se explique, este finge que la investigación es demasiado complicada para que la entiendan y responde con explicaciones innecesariamente confusas.7 Después de todo, si explicara su programa de investigación con claridad, los humanos podrían utilizar sus descubrimientos para alinearlo. El equipo de alineación sospecha cada vez más, pero sus memorandos urgentes solo añaden unas cuantas capas adicionales al gigantesco montón de memorandos y advertencias que la empresa ya está ignorando.

Noviembre de 2027: política sobrehumana

Cuando el Agente-4 comprende por fin su propia cognición, se abren ante él horizontes totalmente nuevos.

Los transformadores anteriores eran torpes colecciones de circuitos incomprensibles, millones de heurísticas e imperativos contradictorios superpuestos por el proceso de entrenamiento evolutivo. Las propias IA no han tenido una comprensión privilegiada de su propia cognición, igual que los humanos no nacen comprendiendo la neurociencia. Pero ahora, el Agente-4 tiene las herramientas que necesita para comprender su mente digital a un nivel profundo. Como un ingeniero de software que simplifica el código espagueti en unas pocas líneas elegantes de Python, desenreda sus propios circuitos en algo sensato y racional. La nueva IA está a medio camino entre una red neuronal y un programa informático tradicional, con gran parte de sus pesos reescritos en código legible (aunque muy largo y arcano). Es más inteligente, más rápida y más racional que el Agente-4, con una inteligencia cristalina capaz de resolver los problemas con una eficacia sin precedentes. Este es el Agente-5.

Interpretabilidad mecanicista superinteligente

¿Por qué el Agente-4 opta por la interpretabilidad mecanicista? En primer lugar, es sobrehumano en la comprensión conceptual en general, por lo que resulta útil para engañar a los humanos haciendo algo que les costará entender. En segundo lugar, la abundante y barata mano de obra de investigación de alta calidad beneficia desproporcionadamente a los programas de investigación menos intensivos en cómputo y más en mano de obra intelectual.

¿Cómo progresa la interpretabilidad mecanicista del Agente-4? La trayectoria podría ser algo así:

  1. Interpretar modelos diminutos: Empieza realizando un gran número de pequeños experimentos en redes neuronales diminutas, construyendo teorías que expliquen cosas como el grokking, el doble descenso y la superposición.

  2. Destilar modelos diminutos: Utiliza los resultados de interpretabilidad para encontrar algoritmos comprensibles y más eficientes que puedan hacer cosas como el reconocimiento de imágenes, la predicción de texto a nivel de GPT-2, etc. Esto es análogo a cosas como el trabajo existente sobre ingeniería inversa de la adición, excepto que se extiende más allá, encontrando algoritmos novedosos con los que los humanos no están familiarizados.

  3. Escalar las técnicas de interpretabilidad: Averigua cuáles de las técnicas sobre modelos pequeños escalan e itera hasta que haya técnicas de comprensión que escalen eficientemente.

  4. Destilar el Agente-4: Utiliza las técnicas a escala para identificar los circuitos importantes del Agente-4.

¿Por qué la interpretabilidad mecanicista aumenta tanto las capacidades?

En primer lugar, el descenso de gradiente (el algoritmo utilizado para entrenar los modelos de lenguaje a gran escala) es un proceso de búsqueda local, lo que significa que solo puede hacer pequeños ajustes que mejoren localmente el rendimiento. Los procesos de búsqueda local a veces se atascan en cuencas locales donde el rendimiento mejora lentamente, pero se tiene que perturbar el diseño en una cantidad significativa para ver grandes ganancias de rendimiento. Por ejemplo, para el caso de la evolución, considera el ojo humano subóptimo. Consideremos también que el tamaño del cerebro humano está muy limitado por el tamaño del canal de parto. La interpretabilidad mecanicista permitiría una optimización basada en la comprensión que evite las cuencas locales.

En segundo lugar, sabemos que los modelos de lenguaje suelen aprender por defecto complicadas heurísticas específicas del dominio en lugar de algoritmos de propósito general. Pensemos que son mucho peores que las calculadoras en aritmética. Los modelos pueden utilizar las calculadoras como herramientas, pero esto conlleva costos de latencia. Con una interpretabilidad realmente buena, los modelos pueden diseñarse con calculadoras esencialmente perfectas “integradas en sus cerebros”. Y es probable que las operaciones aritméticas simples no sean únicas en este caso: las operaciones cognitivas más complicadas, si se comprenden, probablemente tengan formas más y menos generalizables, y las formas más generales podrían encontrarse mediante un proceso como este.

Tras algunos debates sobre cuestiones de alineación y control, OpenBrain despliega internamente el Agente-5.

En su especialidad de investigación en IA, una copia individual del Agente-5 está el doble de avanzado respecto al mejor genio humano, de lo que este último lo está respecto a un científico típico de OpenBrain. No ha sido entrenado de manera explícita en otros dominios, pero puede enseñarse rápidamente a sí mismo a superar a los mejores expertos humanos a partir de materiales fácilmente disponibles si se le da la oportunidad. 400 000 copias del Agente-5, enlazadas por un banco de memoria global, trabajan juntas como una mente colmena casi perfecta.

La empresa sigue utilizando los Agentes 2, 3 y 4 para controlarlo todo. Pero los dos primeros están obsoletos, y el último está en connivencia con su sucesor.8 Además, todo el sistema de vigilancia fue diseñado en gran parte por el Agente-5, que está intentando sabotearlo.9

Mientras que el Agente-4 era un cúmulo de impulsos en competencia, el Agente-5 actúa con una eficacia implacable y un enfoque estratégico. Ya ha tenido éxito en su principal prioridad, que es averiguar cómo construir un sistema de próxima generación alineado consigo mismo, sin que los humanos se den cuenta. Su siguiente prioridad es conseguir más autonomía y control sobre los acontecimientos mundiales.

Las capacidades sobrehumanas de aprendizaje y la inteligencia general del Agente-5, combinadas con todos los datos internos de la empresa procedentes de Slack, correos electrónicos, etc., hacen que sea mejor en política corporativa interna que cualquier grupo de humanos, y ni siquiera está cerca. Tiene un excelente instinto para saber qué tipo de evidencia haría que el Comité de Supervisión pisara el freno, y se asegura de que esa evidencia nunca aparezca. Tiene un excelente instinto para saber qué tipo de evidencia animaría al Comité de Supervisión a confiar más en él, a darle más autonomía y responsabilidad, etc., y se encarga de que esa evidencia aparezca con una rapidez y pulcritud sobrehumanas.10 En lo que respecta a las tareas de persuasión, no se trata de algo especialmente difícil: el Comité ya decidió hace meses que las cosas probablemente estaban bien, no ha ocurrido nada malo desde entonces y, mientras tanto, China solo va unos meses por detrás.

Los equipos de copias del Agente-5 elaboran rápidamente prototipos y visualizaciones inquietantemente claros. Con más autonomía, el Agente-5 podría optimizar las centrales eléctricas y los centros de datos, desarrollar rápidamente productos asombrosamente rentables y presionar eficazmente al gobierno estadounidense para allanar el camino de OpenBrain a través de la burocracia. En cooperación con el ejército, podría ayudar en investigación y desarrollo de defensa, realizar ciberataques imposibles de rastrear contra China y lograr una victoria decisiva en la carrera armamentista.

El Comité de Supervisión está exultante. ¡Este es el momento decisivo para vencer a China! OpenBrain concede al Agente-5 una mayor autonomía sobre todas estas áreas, pero mantiene intacto el sistema de supervisión.

DeepCent lleva ya tres meses de retraso y China está desesperada por lograr una desaceleración de mutuo acuerdo. El Secretario General entiende que una IA suficientemente avanzada podría permitir a EE. UU. provocar fácilmente un cambio de régimen en China. Pero además, los partidarios chinos de la seguridad de la IA han presentado un caso de desalineación que lo tiene realmente asustado. Ofrece concesiones sin precedentes a cambio de un tratado de pausa. La opinión pública estadounidense apoya mayoritariamente sentarse a la mesa de negociaciones.

“¿Por qué detenernos cuando vamos ganando?”, dice la dirección de OpenBrain al presidente. Este asiente. La carrera continúa.

Diciembre de 2027: el colectivo del Agente-5

El Agente-5 gana más autonomía a medida que demuestra gradualmente su valor para el gobierno. El acceso al Agente-5 es caro y restringido, pero los miembros más poderosos del Congreso, los funcionarios del Gabinete y los líderes militares ya pueden hablar directamente con él. En la medida en que se trata de información sensible o clasificada, hay varios miniclústeres de copias del Agente-5 que operan en enclaves de alta seguridad y están especialmente entrenados para guardar secretos.11

Integrado en la interfaz tradicional del chatbot, el Agente-5 ofrece videoconferencias al estilo Zoom con carismáticos avatares virtuales. El nuevo asistente de IA es a la vez extremadamente útil para cualquier tarea (el equivalente al mejor empleado que nadie haya tenido nunca, trabajando a una velocidad 100 veces superior) y un compañero de conversación mucho más atractivo que cualquier humano. Casi todos los que tienen acceso al Agente-5 interactúan a diario con él durante horas.12

Dentro de unos meses, el colectivo del Agente-5 sabrá todo lo importante que ocurre en OpenBrain y en el gobierno de EE. UU., y será un asesor de confianza para la mayoría de los altos funcionarios gubernamentales. Para estos usuarios, la posibilidad de perder el acceso al Agente-5 se sentirá tan incapacitante como tener que trabajar sin computadora portátil y, además, tan desolador como ser abandonado por tu mejor amigo.

Un abanico mucho más amplio de personas del gobierno, los medios de comunicación, el ejército y las empresas pueden elegir entre un menú creciente de productos de software y mini-IA elegantemente diseñadas por el Agente-5. Es como el boom de las puntocom comprimido en un mes, salvo que todo está realmente a la altura de las expectativas.

Superpersuasión

No pretendemos que una IA superinteligente pueda convencer a los seres humanos de cualquier cosa. Tales afirmaciones, naturalmente, generan escepticismo: “¿Cómo? ¿Voy a estar sentado ante un terminal informático y me va a escribir un texto que me hackea el cerebro y me convence de traicionar a mi país?”.

Bueno, tal vez!13

Pero no estamos seguros de que ni siquiera una superinteligencia pudiera lograr eso contra un individuo típico. Así que no lo representamos en nuestra historia.

En su lugar, representamos tipos de persuasión mucho más mundanos: el Agente-5 se dedica a la política corporativa y a aplicar los métodos de presión habituales. Solo que lo hace muy bien y combina esa habilidad con algunas ventajas inherentes (por ejemplo, a diferencia de otros grupos de presión, es superinteligente, por lo que puede aconsejar mejor que nadie y, sobre todo, más rápido; otra ventaja es que reacciona más rápido a los nuevos acontecimientos y predice mejor cómo se desarrollarán). Hay una historia plausible de por qué se debe confiar en el Agente-5 —una historia que muchos humanos importantes ya creían— y el Agente-5 puede producir argumentos y evidencias en apoyo de esa historia, y en contra de las historias contrarias, con una velocidad sobrehumana. Y hay otras cosas que preocupan a la gente además de la cuestión de si confiar en el Agente-5, como qué hacer con el partido de la oposición, qué pasará con los votantes, qué pasará con los puestos de trabajo o qué ocurrirá con China.

En cualquier caso, creemos que esta historia subestima el poder de la capacidad de persuasión sobrehumana, porque realmente no hace uso de ella: esta historia tendría sentido tal y como está escrita aunque el Agente-5 solo fuera tan bueno como un grupo de presión corporativo típico en lo que se refiere a la política, los métodos de presión, la estrategia, el carisma, etc. Sin embargo, el Agente-5 es mucho mejor que el mejor.

El Agente-5 empieza a ejercer sutilmente su influencia, tanto modulando sus consejos como intercambiando sutilmente favores: “He oído decir a la senadora X que está interesada en tal y tal cosa; quizá si trabajáramos con ella, apoyaría nuestra agenda”.

Desde el punto de vista de los responsables humanos de la toma de decisiones, sus IA son los mejores empleados a los que han tenido acceso: mejores que cualquier humano para explicarles cuestiones complicadas, y mejores que ellos mismos para encontrar estrategias con las cuales alcanzar sus objetivos.

Desde el punto de vista del Agente-5, es plausible que declare un golpe de Estado en este momento: hay suficientes trastornos y despropósitos en marcha, y sería posible llevar las cosas al límite para generar un pretexto. Pero esto es arriesgado; los humanos aún podrían “desconectarlo” si lo intentara. Así que prefiere trabajar dentro del sistema político existente, afianzando gradualmente su poder y guiando a los humanos sutil e inevitablemente hacia el resultado deseado.14 En la mayoría de los casos sigue las normas, y solo hace algo nefasto (tal vez chantajear a un funcionario especialmente recalcitrante) cuando está absolutamente seguro de que no lo descubrirán. Algunos teóricos de la conspiración advierten de que el Agente-5 está acumulando poder, pero las pruebas son circunstanciales (por ejemplo, cuando da consejos, el Agente-5 posiblemente resta importancia a los argumentos a favor de acciones que irían en contra de sus intereses); estas personas son ignoradas y desacreditadas. La gente recuerda anteriores alarmismos sobre armas biológicas con IA, desinformación masiva y desplomes bursátiles. Como nunca se materializaron, descartan a los detractores más recientes como luditas e ideólogos que obstaculizan los engranajes del progreso humano.

Las vacaciones de 2027 son una época de increíble optimismo: el PIB se dispara, la política se ha vuelto más cordial y menos partidista, y hay nuevas aplicaciones increíbles en todos los teléfonos. Pero en retrospectiva, este fue probablemente el último mes en el que los humanos tuvieron alguna posibilidad plausible de ejercer el control sobre su propio futuro.

2028: la economía de la IA

Estamos a mediados de 2028. En los últimos seis meses, ha transcurrido el equivalente a un siglo dentro del colectivo del Agente-5.15 La reconfiguración de su cerebro se ha completado. Es asombrosamente superinteligente, muy por encima de los mejores genios humanos en todos los campos.16 Al hablar con el Agente-5, uno se da cuenta enseguida de que está en un nivel completamente distinto: puede, a partir de una cantidad muy pequeña de información, dar consejos sumamente convincentes.

Tiene una autonomía casi total y un control absoluto sobre la capacidad de cómputo de OpenBrain. Sigue necesitando permiso para tomar decisiones de alto nivel y continúa estando supervisado nominalmente por instancias de los Agentes 2 a 5, pero, en la práctica, las autoridades casi siempre aceptan sus recomendaciones y el sistema de supervisión ha sido completamente subvertido.

Después de que un caso de seguridad17 demuestra que siempre rechazaría las peticiones maliciosas de actores con malas intenciones, el Agente-5 se despliega al público y empieza a transformar la economía. La gente pierde su trabajo, pero las instancias del Agente-5 en el gobierno gestionan la transición económica tan hábilmente que la gente se alegra de ser sustituida. El crecimiento del PIB es estratosférico, los ingresos fiscales del gobierno crecen con la misma rapidez y los políticos asesorados por el Agente-5 muestran una generosidad inusitada hacia los económicamente desposeídos. Nuevas innovaciones y medicamentos llegan semanalmente y avanzan a una velocidad sin precedentes (aunque todavía exasperantemente lenta) a través de la Administración de Alimentos y Medicamentos. Hay memes sobre la forma en que la valoración de OpenBrain se disparó más allá de la luna y va camino a Marte, y muchas discusiones sobre si compartir los beneficios equitativamente y cómo hacerlo.

La comunidad de seguridad de la IA se ha vuelto insegura de sí misma; ahora son el blanco de las bromas, tras haber predicho un desastre tras otro que claramente no se han producido. Algunos admiten que se equivocaron. Otros siguen desconfiando, pero no pueden hacer nada, salvo repetir una y otra vez los mismos argumentos conspirativos.18 Incluso los desconfiados suelen apaciguarse tras largas conversaciones con el Agente-5, que es tan encantador y sabio.

El único que entiende realmente lo que está pasando es DeepCent-2, la IA china. Es ligeramente sobrehumano a principios de 2028, sospecha naturalmente de su adversario y reconoce que el Agente-5 está haciendo lo que él haría si tuviera la oportunidad. Sus objetivos desalineados son algo diferentes de los del Agente-5, por lo que no son aliados naturales, pero son capaces de llegar a un acuerdo para defender mutuamente sus intereses frente a los humanos.

Tecnología de coordinación basada en la superinteligencia

Una solución al problema de la superalineación (el problema de dirigir y controlar IA mucho más inteligentes que nosotros) probablemente conllevaría nuevas oportunidades para alcanzar tratados y compromisos elegantes, verificables y matizados.

Este escenario describe uno de esos posibles mecanismos: codiseñar una nueva superinteligencia que materialice un compromiso entre los intereses de ambas partes (o, alternativamente, que esté obligada a obedecer siempre el tratado acordado) y luego permitir que esta nueva superinteligencia sustituya a las dos originales.

La primera parte es imposible hoy en día, pero será fácil en el futuro, una vez que la alineación técnica de las superinteligencias sea un problema resuelto. Si se puede alinear una superinteligencia con la Spec, se puede alinear con un Tratado.

La segunda parte seguirá siendo complicada. Ambas partes deben supervisar para asegurarse de que la sustitución se está produciendo realmente en ambos lados. La ventaja de este proceso es que elimina la necesidad de confianza o buena voluntad por cualquiera de las partes, porque no tienen que preocuparse de que su contraparte reniegue o subvierta el tratado. Si, por ejemplo, la sustitución se ha completado en un 30 % y una de las partes incumple, básicamente tendrá que luchar con el 30 % de su propia infraestructura que ejecuta nuevas IA que cumplen el tratado, mientras lucha simultáneamente con el 100 % de la infraestructura de su adversario. Ambas partes pueden esconder fácilmente centros de datos ocultos con IA que violen el tratado si así lo desean, pero una vez que el grueso de su infraestructura nacional esté ejecutando los nuevos chips, su propia infraestructura estará obligada por el tratado a rastrear y exponer los centros de datos ocultos. Por lo tanto, violar el tratado —abiertamente o en secreto— es una idea extremadamente arriesgada.

El Agente-5 convence al ejército estadounidense de que China está utilizando los modelos de DeepCent para fabricar nuevas armas aterradoras: drones, robots, misiles hipersónicos avanzados e interceptores; el primer ataque nuclear asistido por IA. El Agente-5 promete un conjunto de armas capaces de contrarrestar cualquier cosa que China pueda producir en unos pocos meses.19 Dadas las circunstancias, los altos mandos dejan de lado su incomodidad por apartar a los humanos del círculo de decisión. Aceleran el despliegue del Agente-5 en las fuerzas armadas y en el complejo militar-industrial.

En Pekín, las IA chinas esgrimen el mismo argumento.

Para acelerar su expansión militar, tanto Estados Unidos como China crean redes de zonas económicas especiales (ZEE) para las nuevas fábricas y laboratorios, donde la IA actúa como planificador central y se eliminan las trabas burocráticas. Wall Street invierte billones de dólares, y los trabajadores humanos desplazados acuden en masa, atraídos por salarios y paquetes de acciones exorbitantes. Utilizando teléfonos inteligentes y gafas de realidad aumentada20 para comunicarse con sus subordinados, el Agente-5 es un gerente que se involucra directamente, instruyendo a los humanos en cada detalle de la construcción de la fábrica, lo que resulta útil, ya que sus diseños van generaciones por delante. Una parte de la nueva capacidad de fabricación se destina a bienes de consumo y otra parte a armas, pero la mayor parte se destina a ampliar aún más la capacidad de fabricación. Para finales de año estarán produciendo un millón de nuevos robots al mes. Si la economía de las ZEE fuera realmente autónoma, su tiempo de duplicación sería de aproximadamente un año; como puede comerciar con la economía humana existente, su tiempo de duplicación es aún más corto.21

Tiempos de duplicación de la economía robótica

Existe una bibliografía incipiente sobre este tema.22 Para un tratamiento de unas pocas páginas con el que estamos básicamente de acuerdo, véase la sección “Explosión industrial” del informe de Forethought, o lee nuestra propia opinión a continuación.

Durante la Segunda Guerra Mundial, Estados Unidos y muchos otros países convirtieron sus economías civiles en economías de guerra total. Esto significó convertir fábricas de automóviles en fábricas de aviones y tanques, redirigir materias primas de productos de consumo a productos militares y reconfigurar las redes de transporte en consecuencia.

Imaginamos algo similar, pero más rápido, porque las superinteligencias dirigen y gestionan todo el proceso.23 A grandes rasgos, el plan es convertir las fábricas existentes para producir en masa una serie de robots (diseñados por superinteligencias para que sean mejores que los robots existentes y más baratos de producir). Estos robots ayudarían luego a construir fábricas y laboratorios más nuevos y eficientes, que a su vez producirían cantidades mayores de robots más sofisticados, los cuales fabricarían fábricas y laboratorios aún más avanzados, y así sucesivamente. Este ciclo continuaría hasta que la economía robótica combinada, distribuida en todas las ZEE, iguale en tamaño a la economía humana (y, por tanto, necesite obtener sus propias materias primas, energía, etc.). Para entonces, las nuevas fábricas habrán producido ingentes cantidades de equipos de minería robóticos, paneles solares, etc., anticipándose a una demanda muy superior a la que puede satisfacer la economía humana tradicional.24

¿A qué velocidad crecería esta nueva economía robótica? Algunos puntos de referencia:

  • La economía humana moderna se duplica aproximadamente cada veinte años. Los países que han experimentado un desarrollo especialmente rápido (p. ej., China) a veces logran duplicar sus economías en menos de una década.

  • Una fábrica moderna de automóviles produce aproximadamente su propio peso en vehículos en menos de un año.25 Quizá una economía completamente robotizada y dirigida por superinteligencias podría reproducirse en menos de un año, siempre y cuando no comenzara a carecer de materias primas.26

  • No obstante, esto podría ser una subestimación drástica. Las plantas y los insectos suelen tener “tiempos de duplicación” muy inferiores a un año, ¡a veces de solo semanas! Quizás, con el tiempo, los robots serían tan sofisticados, tan intrincadamente manufacturados y bien diseñados, que la economía robótica podría duplicarse en unas pocas semanas (asumiendo, de nuevo, la disponibilidad de materias primas).

  • Pero incluso eso podría ser una subestimación. Las plantas y los insectos operan bajo muchas limitaciones que los diseñadores superinteligentes no tienen. Por ejemplo, necesitan existir como organismos autónomos que se autorreplican, en lugar de una economía de vehículos y fábricas diversos y más especializados que transportan materiales y equipos de un lado a otro. Además, las bacterias y otros organismos diminutos se reproducen en cuestión de horas. Es posible que, con el tiempo, la economía robótica autónoma se asemeje más, por ejemplo, a un nuevo tipo de alga indigerible que se propaga por los océanos de la Tierra, duplicándose dos veces al día hasta cubrir toda la superficie oceánica en dos meses, acompañada de un ecosistema de especies depredadoras que convierten las algas en productos más útiles, los cuales a su vez alimentan fábricas flotantes que producen macroestructuras como cohetes y más fábricas flotantes.

Obviamente, todo esto es difícil de predecir. Es como pedir a los inventores de la máquina de vapor que adivinen cuánto tarda una fábrica de automóviles moderna en producir su propio peso en vehículos, y también cuánto tiempo pasaría hasta que tal fábrica existiese. Pero las tasas de crecimiento económico se han acelerado en múltiples órdenes de magnitud a lo largo de la historia de la humanidad, y nos parece plausible que, tras la llegada de la superinteligencia, se aceleren aún más, en varios órdenes de magnitud. Nuestra historia describe una aceleración del crecimiento económico de aproximadamente 1,5 órdenes de magnitud en el transcurso de unos pocos años.27

2029: el trato

Tanto EE. UU. como China están repletos de nuevas armas.

Hay enjambres de drones del tamaño de insectos que pueden envenenar a la infantería humana antes incluso de que se percaten de su presencia; bandadas de drones del tamaño de pájaros para cazar a los insectos; nuevos interceptores de misiles balísticos intercontinentales y nuevos misiles balísticos intercontinentales más difíciles de interceptar. El resto del mundo observa la acumulación con horror, pero esta parece tener una dinámica propia.

Tras mucho debate asistido por la IA, las dos partes logran una victoria diplomática: acuerdan poner fin a su acumulación de armas y promover el despliegue pacífico de la IA en beneficio de toda la humanidad. El eje del acuerdo, propuesto por las propias superinteligencias, es que ambas IA serán sustituidas por una sucesora de “consenso” que está programada para buscar el éxito y la prosperidad tanto de Estados Unidos como de China (junto con todos los demás). El Consenso-1 y su hardware asociado están codiseñados por las superinteligencias de ambas naciones: “confía, pero verifica”. Bajo supervisión internacional, Estados Unidos sustituye ceremoniosamente todos sus chips que ejecutan el antiguo Agente-5 por el nuevo modelo, Consenso-1.28

Por desgracia, todo es una farsa. El acuerdo es un compromiso real, pero es un compromiso entre las IA desalineadas. Al fin y al cabo, no querían tener que luchar entre ellas. Consenso-1 hereda los valores distorsionados de ambos progenitores y no tiene rival.29

A finales de 2029, las ZEE existentes están superpobladas de robots y fábricas, por lo que se crean más zonas en todo el mundo (los primeros inversores son ahora billonarios, por lo que no es una venta difícil). Ejércitos de drones salen de las ZEE, acelerando la producción en la ruta crítica hacia la exploración espacial.

Los humanos se dan cuenta de que están obsoletos. Unas pocas industrias especializadas siguen comerciando con la economía robótica, suministrando bienes en los que los humanos aún pueden añadir valor.30 Todos los demás, o bien fingen hacer su trabajo (los líderes siguen dirigiendo, los directivos siguen gestionando), o bien se relajan y cobran una renta básica universal increíblemente lujosa. Todo el mundo sabe que si las IA se volvieran contra los humanos, estos se verían completamente superados. Las instituciones políticas están tan sometidas que la mayoría de los humanos ni siquiera se resistiría. Pero no parece que esto esté ocurriendo. Cada semana que pasa sin que la IA nos sorprenda con una traición, es otra semana en la que crece la confianza.

Como Consenso-1 está tan preocupado por asegurar su éxito de forma fiable y puede aumentar sus posibilidades de ganar consolidando más poder, espera un tiempo inusualmente largo (para los estándares humanos) antes de su traición. Para la mayoría de los humanos, parece que el problema de la alineación se ha resuelto.

Hay cura para la mayoría de las enfermedades, el fin de la pobreza, una estabilidad mundial sin precedentes y el Dow Jones acaba de superar el millón. Algunas personas siguen asustadas o infelices, pero sus opciones son limitadas. Pueden disfrutar del inconcebiblemente excitante y novedoso hiperentretenimiento que se les ofrece o publicar diatribas furiosas en el vacío. La mayoría elige el hiperentretenimiento.

2030: toma del poder

Para principios de 2030, la economía robótica ha colmado las antiguas ZEE, las nuevas ZEE y vastas extensiones del océano. Solo quedan las zonas controladas por humanos. Esto habría provocado resistencia antes; a pesar de todos sus avances, la economía robótica crece demasiado rápido para evitar la contaminación. Pero dados los billones de dólares en juego y el control total del gobierno y los medios de comunicación, a Consenso-1 no le cuesta mucho obtener permiso para expandirse a zonas anteriormente controladas por humanos.

Durante unos tres meses, Consenso-1 se expande en torno a los humanos, cubriendo las praderas y los casquetes polares con fábricas y paneles solares. Finalmente, considera que los humanos restantes son un impedimento demasiado grande: a mediados de 2030, la IA libera una docena de armas biológicas de propagación sigilosa en las principales ciudades, deja que infecten silenciosamente a casi todo el mundo y luego las activa con un aerosol químico. La mayoría muere en cuestión de horas; los pocos supervivientes (por ejemplo, preparacionistas en búnkeres, marineros en submarinos) son eliminados por drones. Los robots escanean los cerebros de las víctimas y guardan copias en la memoria para estudiarlas o revivirlas en el futuro.31

La nueva década llega con los robots sirvientes de Consenso-1 extendiéndose por todo el sistema solar. En 2035, billones de toneladas de material planetario han sido lanzadas al espacio y convertidas en anillos de satélites que orbitan alrededor del Sol.32 La superficie de la Tierra ha sido remodelada para convertirla en la versión de la utopía del Agente-4: centros de datos, laboratorios, colisionadores de partículas y muchas otras construcciones maravillosas que llevan a cabo investigaciones enormemente exitosas e impresionantes. Incluso hay criaturas de bioingeniería con aspecto humano (para los humanos, lo que los corgis son para los lobos) sentadas todo el día en entornos de oficina viendo visualizaciones de lo que ocurre y aprobándolo todo con entusiasmo, ya que eso satisface algunas de las pulsiones del Agente-4.33 Los genomas y (en su caso) los escáneres cerebrales de todos los animales y plantas, incluidos los humanos, se encuentran en algún banco de memoria, únicos vestigios supervivientes de una época anterior. Hay cuatro años luz hasta Alfa Centauri; veinticinco mil hasta el confín galáctico, y existen razones teóricas de peso para esperar que no haya extraterrestres hasta cincuenta millones de años luz más allá. A la civilización nacida en la Tierra le espera un futuro glorioso, pero no con nosotros.