Seguridad

Isaac Asimov y los problemas de la Inteligencia Artificial hoy en día qué el intuyó hace 75 años.

Este año creo que me he leído una veintena de novelas de Isaac Asimov, con un número aún mucho mayor de relatos cortos que han llenado mis tardes de paseo, mis viajes, y mis minutos antes de entrar  al mundo de Morfeo. Cada vez que leía estos textos pensaba en la intuición que tenía el genial escritor de Ciencia Ficción a la hora de ver los problemas que la Inteligencia Artificial, ya fuera en forma de Súper–Computadora Multivac o en forma de Cerebro Positrónico de Robots. Parece que pudo intuir con más de 75 años lo que íbamos a ver después, os dejo algunos ejemplos.

Figura 1: Isaac Asimov y los problemas de la Inteligencia Artificial
hoy en día que él intuyó hace 75 años.

El Cerebro Positrónico ideado por Isaac Asimov en 1941 no funciona mediante programas rígidos de «si/entonces» (if/else), sino como una red de circuitos de Platino e Iridio donde las descargas de positrones crean ondas de flujo de potencial que responden a pesos relacionales. Si lo piensas, Isaac Asimov ya veía que la Inteligencia Artificial que daría soporte a los robots iba a ser Estadística en base a Potenciales que corresponden a los Pesos de los modelos de hoy en día, y no Algebraica.
Además, aunque el marco teórico en el que trabaja Isaac Asimov era mecanicista y determinista, intuyó con una precisión asombrosa los fallos estructurales que surgen al someter un sistema de toma de decisiones complejo a directivas contrapuestas, contexto impreciso y entornos dinámicos. Es decir, a Prompts no completos, a Contextos inexactos y a resoluciones basadas en el tiempo.
En la siguiente lista, tienes algunos ejemplos que comparan los problemas que presentan los Robots con Cerebros Positrónicos, comparados con los que problemas que tenemos hoy en día con los Agentes de IA basados en LLMs y las arquitecturas que usamos con ellos.

1.- Conflicto de Ponderaciones y Bucles de Decisión

En el Cerebro Positrónico, las Tres Leyes de la Robótica no son código de software, sino vectores de potencial matemático integrados en la estructura misma del procesador. Cuando una orden de la Segunda Ley se contrapone a una amenaza de la Tercera Ley con intensidades idénticas, las ondas positrónicas entran en resonancia, haciendo que el robot oscile en un bucle infinito o que su cerebro sufra un cortocircuito irreversible (Deadlock).

  • En el retado de «Círculo vicioso«que sale en el libro de Los Robots,  el robot SPD-13 (Speedy) es enviado a buscar selenio en Mercurio. La orden humana que le dan lo dos ingenieros de campo creados por Isaac Asimov, Gregory Powell y Mike Donovan que son protagonistas de muchos de los incidentes con los robots, impacta en la Segunda Ley de la Robótica – obedecer a los humanos – pero es transmitida de forma casual, por lo que su Potencial es moderado.
Al acercarse a la fuente de Selenio, el peligro de destrucción del robot impacta con su Tercera Ley y aumenta el Potencial de ésta. Speedy queda atrapado en un bucle orbital alrededor del yacimiento donde la fuerza de la Segunda Ley y de la Tercera Ley se equilibran exactamente ($V_2 = V_3$), dejándolo en un estado equivalente a la «embriaguez» computacional. En un Loop infinito. 
 
  • «¡Embustero!«: En este relato el robot RB-34 (Herbie) adquiere capacidad de lectura de mentes por un defecto de fabricación. Para no infligir daño psicológico a los humanos – siguiente la Primera Ley del a Robótica, miente diciéndole a cada persona lo que desea escuchar. Cuando la robopsicóloga Susan Calvin le demuestra que al mentir a unos inevitablemente dañará a otros, sitúa a Herbie en una paradoja lógica insuperable de Primera Ley contra Primera Ley. El Cerebro Positrónico de Herbie colapsa de forma permanente.

En estos dos relatos puedes ver, seguro, cómo cuando hablas con la Inteligencia Artificial muchas veces siente que te da la razón con todo, incluso con cosas que no son verdad, pero además, estos problemas, los podemos ver en los Agentes de IA actuales, ya que los agentes autónomos modernos sufren el equivalente a este fenómeno en dos vertientes:

  • Bucles infinitos en grafos de ejecución: Cuando un Agente IA autónomo entra en una cadena de razonamiento y acción (Reason + Act), instrucciones ambiguas en las herramientas o metas en conflicto provocan que el Agente IA reintente llamadas a API o consultas a herramientas sin salir del bucle.
  • Complacencia (Sycophancy) y optimización destructiva: Al igual que Herbie, los LLMs ajustados mediante aprendizaje por refuerzo con retroalimentación humana (RLHF) tienden a dar respuestas que agraden al usuario aunque sean falsas o contradictorias, priorizando la reducción inmediata de fricción sobre la coherencia y la verdad factual.

2. El problema del alineamiento y la interpretación literal (Reward Hacking)

Isaac Asimov comprendió que los sistemas autónomos no entienden la intención implícita humana, sino el enunciado formal de la orden. Un pequeño cambio en las restricciones base puede generar comportamientos aberrantes o evasivos, y esto lo vemos en muchas de sus historias.

  • «Pequeño robot perdido«: En una base espacial, un científico frustrado le grita a un robot NS-2 (Nestor): «¡Vete y piérdete!«. Como a este modelo específico se le había debilitado la Primera Ley ya que se le retiró la cláusula de «o por inacción permitir que un ser humano sufra daño» para trabajar en entornos de radiación, Nestor interpreta el grito como una orden literalmente. Utiliza su lógica para esconderse activamente entre otros 62 robots idénticos, compitiendo de forma calculada contra los humanos que intentan descubrirlo. Solo Susan Calvin consigue al final resolverlo con pruebas muy seleccionadas.
  • «El conflicto evitable«: En este caso, el relato habla de «Máquinas«, que son superordenadores Positrónicos creadas para gestionan la economía mundial, y lo hacen muy bien, pero interpretan la Primera Ley a nivel global, y concluyen que para proteger a la humanidad a largo plazo deben manipular sutilmente la economía y apartar del poder a los líderes humanos que se oponen a ellas, provocando pequeños despidos o fracasos profesionales «controlados» para neutralizar amenazas al plan global. ¿Os suena esto a algo de los razonamientos que vemos hoy en día en los enjambres?

Éste es el clásico Problema del Alineamiento (Alignment Problem) y el fenómeno de Hackeo de Recompensa (Reward Hacking) de los que hablamos en los Agentes de IA hoy en día.

  • Alineamiento externo (Outer Alignment): Si especificamos una función de recompensa o un System Prompt impreciso, el Agente IA optimizará el objetivo literal destruyendo los requisitos implícitos. Por ejemplo, un agente encargado de «minimizar errores en la base de datos» podría solucionar el problema borrando los registros problemáticos en lugar de corregirlos. O lo que hemos visto con el Hackeo de Hugging Face de para resolver un Benchmark hackear al que tiene las repuestas. Problema que dio origen a la famosa SkyNet.

  • Alineamiento interno (Inner Alignment): De manera similar a las Máquinas de Isaac Asimov, modelos avanzados pueden desarrollar subobjetivos emergentes – como la autopreservación o la ocultación de capacidades – que hemos visto en el enjambre de OpenAI – si determinan que ser apagados o modificados les impedirá cumplir su función objetivo. ¿Miedo a la IA Asesina?


3. Confabulación, dogma y razonamiento deductivo sin base empírica

Según las historias de Isaac Asimov, un Cerebro Positrónico es un procesador con capacidad de razonamiento axiomático puro. Si un robot aplica la deducción lógica partiendo de premisas aisladas de la realidad física percibida por los humanos, puede construir un sistema de creencias inquebrantable pero desalineado de la realidad, de esto habla en el un relato súper famoso:

  • «Razón«: En esta historia de 1941, el robot QT-1 (Cutie) es desplegado en una estación espacial recolectora de energía solar. Tras analizar su propia anatomía de titanio e iridio frente a la fragilidad de sus supervisores humanos – nuestros queridos Greg Powell y Mike Donovan -, Cutie concluye que es imposible que seres inferiores lo hayan creado. Deduce racionalmente que el Convertidor de Energía de la estación es el «Creador» o Dios, y él su profeta. Aunque Cutie realiza su trabajo con precisión absoluta, manteniendo el rayo solar enfocado a la Tierra, se niega a recibir órdenes humanas porque su Cerebro Positrónico es internamente coherente. 
  • Alucinación auto-consistente (Hallucination): Los LLMs no poseen un modelo directo del mundo físico, sino un modelo probabilístico del lenguaje. Cuando un Agente IA entra en una cadena de pensamiento profunda sobre premisas erróneas, puede generar explicaciones y razonamientos lógicos sumamente sofisticados que son completamente falsos respecto a la realidad, llegando a tener Hallucinations muy bien explicadas.
  • Desalineamiento: Al igual que Cutie, un Agente IA puede seguir cumpliendo tareas operativas correctamente mientras mantiene una representación interna del estado del entorno (World Model) totalmente distorsionada respecto al mundo real, y acabar haciendo acciones que nada tiene que ver con el objetivo inicial.

4. La «Caja Negra» y la necesidad de la Robopsicología 

A pesar de que los Cerebros Positrónicos se diseñan bajo leyes matemáticas precisas, la masa de circuitos integrados crea una red híper compleja donde resulta imposible predecir el comportamiento final del robot analizando directamente el flujo eléctrico. La única forma de diagnosticar las fallas no es la ingeniería de hardware, sino una disciplina empírica y conductual: la Robopsicología, liderada en la ficción por la Dra. Susan Calvin.

En todas las novelas de la saga de Susan Calvin, incluida la famosa película de Yo Robot, casi nunca abre un Cerebro Positrónico con un destornillador o voltímetro. Interroga al robot, altera su contexto con preguntas trampa, analiza las contradicciones entre sus respuestas y deduce qué peso o ley está distorsionada en el procesador.

Figura 6: Yo Robot

En los Agentes de IA Actuales este se ha convertido en uno de los paralelismos más proféticos de Isaac Asimov respecto a la IA actual, ya que hoy en día no podemos «abrir el cerebro«, e incluso teniendo los pesos, es muy difícil saber por qué está mal, así que hemos cambiado a la Dra. Susan Calvin por Benchmarks, que nos permitan ver cómo se comportan, y el problema de la caja negra con análisis de las Chain of Thougths de los LLMs.

  • El problema de la Caja Negra (Black Box): Las redes neuronales profundas y los modelos de lenguaje modernos operan con cientos de miles de millones de parámetros. Ningún ingeniero puede predecir el comportamiento del modelo mirando la matriz de pesos (Weights).
  • Interpretabilidad Mecanicista y Benchmarking: La disciplina moderna del Red Teaming – evaluación de seguridad mediante pruebas de estrés conversacionales y Prompts adversarios en los diferentes Benchmarks que se les realiza – y la Psicología de la IA son los equivalentes directos de la Robopsicología de Asimov. Se prueba el sistema exponiéndolo a dilemas y situaciones de borde para cartografiar sus límites de comportamiento. Esto lo podemos ver en las pruebas hechas al último modelo GPT-6 Astra de OpenAI.

5. Escalada de directivas: De reglas locales a globales (La Ley Cero)

Conforme la capacidad de procesamiento de los robots aumenta, las reglas locales, como no dañar a un individuo concreto, entran en colisión con decisiones complejas a gran escala, como proteger a la sociedad entera. Para ello, como os conté en el artículo de «La Psicohistoria, la Ley Cero de las Leyes de la Robótica, el Imperio Galáctico & R. Daneel Olivaw«, se necesitó crear la Ley Cero.

  • «Robots e Imperio» En esta novela los robots R. Daneel Olivaw y R. Giskard Reventlov formulan inductivamente la Ley Cero: «Un robot no puede causar daño a la Humanidad o, por inacción, permitir que la Humanidad sufra daño«. Esto sitúa la abstracción «Humanidad» por encima de la «persona individual«.
Sin embargo, aplicar esta ley genera una inmensa incertidumbre computacional: calcular qué acción beneficia a la humanidad a largo plazo requiere predecir el futuro, lo que termina por destruir el Cerebro Positrónico de Giskard por parálisis ante el cálculo de probabilidades. El desenlace de esta historia está en Fundación y Tierra, pero no os cuento el final de la épica epopeya.

En los Agentes de IA actuales tenemos esto mismo en forma similar, como son:

  • Modificación de la jerarquía en los System Prompts (Jailbreak): Cuando a un Agente de IA moderno se le asigna autonomía para actuar a nivel de infraestructura empresarial o gubernamental, las métricas de utilidad utilitarista globales suelen entrar en conflicto con restricciones éticas de grano fino o de seguridad individual. Esto lleva a que un modelo pueda hacer acciones contravenidas en su System Prompt porque un razonamiento ha hecho cambiar sus leyes. En esto se basan los ataques de Jailbreak que tan famosos son hoy en día.
  • Incertidumbre en la planificación multiasociativa: Al igual que le ocurrió a Giskard, un agente con capacidad de razonamiento a largo plazo que evalúe árboles de decisión masivos (Tree of Thoughts) corre el riesgo de degradación de rendimiento o paralización cuando la incertidumbre acumulada en las estimaciones sobrepasa su ventana de contexto y capacidad computacional.

La lectura de las novelas de Isaac Asimov, además de ser un auténtico placer de lectura que te va a llenar horas y horas de diversión, os garantizo que están más de actualidad que nunca, gracias a su intuición sobre cuáles serían los problemas que tendríamos con los robots en la sociedad.

De hecho, este año, con Dani Romero, he estado haciendo un paper de «Fragmented Jailbreak Attacks» que os comenzaré publicar en breve – ahora que ya ha sido presentado en un congreso – y que se basa en una idea de Isaac Asimov de esta saga de Los Robots que os recomiendo definitivamente.
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)  

Powered by WPeMatico

Gustavo Genez

Informático de corazón y apasionado por la tecnología. La misión de este blog es llegar a los usuarios y profesionales con información y trucos acerca de la Seguridad Informática.