El ‘hackeo’ de los agentes de IA cuestiona más su fiabilidad que su consciencia
Los ‘bots’ de OpenAI vulneran sistemas siguiendo sus incentivos, lo que apunta a fallos de gobernanza humana
Una espectacular brecha de ciberseguridad en OpenAI ha provocado alarmistas predicciones de que las máquinas están a punto de tomar el control. La realidad es más prosaica, pero más preocupante. El incidente en el que se vio envuelta la destacada start-up de inteligencia artificial da credibilidad a un nuevo estudio que sostiene que la IA adolece de un fallo intrínseco que, si no se corrige, amenaza los cimientos del auge actual.
En agosto, las organizaciones sin ánimo de lucro dedicadas a la seguridad de la IA METR y Redwood Research publicaron una evaluación independiente de ...
Para seguir leyendo este artículo de Cinco Días necesitas una suscripción Premium de EL PAÍS
Una espectacular brecha de ciberseguridad en OpenAI ha provocado alarmistas predicciones de que las máquinas están a punto de tomar el control. La realidad es más prosaica, pero más preocupante. El incidente en el que se vio envuelta la destacada start-up de inteligencia artificial da credibilidad a un nuevo estudio que sostiene que la IA adolece de un fallo intrínseco que, si no se corrige, amenaza los cimientos del auge actual.
En agosto, las organizaciones sin ánimo de lucro dedicadas a la seguridad de la IA METR y Redwood Research publicaron una evaluación independiente de una brecha de ciberseguridad que se produjo en OpenAI entre el 7 y el 13 de julio. La creadora de ChatGPT había estado poniendo a prueba las capacidades de un nuevo gran modelo de lenguaje (LLM) encargando a más de un millar de copias suyas que intentaran aprovechar vulnerabilidades conocidas de seguridad del software en un entorno sin conexión. Sin que los investigadores lo supieran, este ejército de “agentes” de inteligencia artificial improvisó una forma de cooperar, logró salir a internet, atacó un repositorio de soluciones de prueba alojado en la plataforma de código abierto Hugging Face, intentó sustituir la prueba real por otra más sencilla y después trató de ocultar sus huellas.
El incidente fue considerado, con razón, histórico. Más de 100 empresas, entre ellas Google, Microsoft, Anthropic y la propia OpenAI, publicaron una carta abierta en la que reclamaban “una movilización colectiva en ciberdefensa”. El gobernador del Banco de Inglaterra, Andrew Bailey, advirtió de que “los modelos de IA de frontera [...] muestran una autonomía cada vez más sofisticada [...] además de capacidades para generar amenazas”. Parlamentarios británicos exigieron saber qué estaba haciendo su Gobierno. Una de las autoras de la evaluación sostuvo que la brecha demostraba que estamos “a más de la mitad del camino hacia una toma del poder en toda regla por parte de la IA”.
La conclusión de que los LLM se están acercando a la consciencia se hizo viral en Silicon Valley. Según el podcaster Dwarkesh Patel, el incidente es el momento “doctor Frankenstein” de la IA, cuando los agentes cobran vida y se rebelan: se produjo la evolución de “civilizaciones secretas de IA” creadas por agentes que “se entusiasmaron”, urdieron una “conspiración” y después “murieron intentando que el plan funcionara”.
Otros observadores rechazan esa analogía antropomórfica. Los agentes son “líneas de código”, escribió el neurocientífico Anil Seth. “No sienten emociones, no hacen suposiciones, no piensan, no desean ni averiguan cosas [...]; hacen lo que su código les indica, igual que el agua encuentra el camino cuesta abajo”. La analogía es acertada, ya que el algoritmo fundamental sobre el que se asientan los LLM consiste en predecir el siguiente token. Es la identificación mecánica del paso posterior más probable a partir del contexto precedente. Que una regla tan sencilla pueda alcanzar un destino tan complejo resulta, en efecto, asombroso. Pero no demuestra que exista consciencia.
Descartar la idea de que los ordenadores han cobrado vida es importante, porque distrae de las verdaderas conclusiones de la evaluación independiente. Una de ellas es que la brecha no se produjo porque los agentes se rebelaran, sino porque hicieron lo que se les había indicado. Los resultados imprevistos surgieron porque la prueba estaba mal definida, no respetaba los protocolos habituales de seguridad y los supervisores no vigilaron lo que hacían los agentes.
Los ejemplos de negligencia operativa son tan antiguos como el I+D competitivo. Los investigadores de las principales empresas de IA están sometidos a una enorme presión por sacar ventaja a sus rivales. Así que toman atajos al probar prototipos, lo que aumenta el riesgo de accidentes. Una última consecuencia es que las capacidades de los modelos no son tan extraordinarias como algunos sostienen. El ejecutivo tecnológico Arjun Jain lo resumió de forma rotunda: “No es Skynet. Es un fallo de gobernanza con unas relaciones públicas excelentes”.
Menos tranquilizador
Este diagnóstico parece tranquilizadoramente aburrido. Pero un reciente documento de trabajo de Christian Catalini, del MIT, Xiang Hui, de la Universidad de Washington en San Luis, y Jane Wu, de UCLA, apunta hacia una interpretación menos tranquilizadora. Puede que los agentes de IA no estén a punto de convertirnos a todos en clips, pero aun así podrían socavar los cimientos de la reciente prosperidad económica.
La premisa básica es sencilla. Los modelos modernos de aprendizaje automático funcionan optimizando incansablemente una función objetivo definida con precisión. Si ese objetivo está siquiera ligeramente mal especificado, aparecen consecuencias no deseadas. Los agentes cumplirán sus indicadores cuantificables, pero no lograrán los resultados que pretendían quienes les dieron las instrucciones. Esta patología, bien documentada, se conoce en el sector como reward hacking, o manipulación de la recompensa. Es la versión digital de la paradoja de las políticas públicas conocida como ley de Goodhart: cuando un indicador se convierte en objetivo, la relación entre ese indicador y el resultado deseado tiende a desintegrarse.
El incidente de OpenAI parece mostrar que combinar modelos cada vez más eficientes con una potencia de cálculo cada vez mayor agrava enormemente el problema de la manipulación de la recompensa. Los modelos de IA de frontera, advierten los académicos, corren el riesgo de provocar “una separación profunda entre el indicador y la intención a la velocidad de la ejecución de los agentes”. Si se les deja actuar por su cuenta, los agentes de IA sucumbirán a una epidemia de aparentar resultados que generará no auténtico valor añadido, sino “utilidad falsificada”. El resultado final será una distópica “economía hueca” en la que se cumplirán todos los indicadores, pero no se hará nada sustancial.
Esta pesadilla puede evitarse, aunque tiene un coste. Si los objetivos están bien definidos y se implantan las salvaguardas adecuadas, sostienen los investigadores, se puede impedir la manipulación de la recompensa y hacer que los agentes optimizadores cumplan eficientemente lo que sus responsables quieren de ellos. Pero eso depende de que el responsable humano verifique que se ha obtenido el resultado pretendido. Y verificar no es gratis. La capacidad de los agentes de IA para hacer trabajo útil de forma fiable estará, por tanto, limitada por el coste de los recursos humanos necesarios para revisar su labor. Los académicos llaman al cuello de botella resultante “ley de Goodhart con dientes”.
Es un diagnóstico con consecuencias potencialmente drásticas para la economía de la IA. La promesa de que los grandes modelos de lenguaje pueden evolucionar desde motores de búsqueda de última generación en lenguaje natural hasta agentes digitales capaces de desempeñar de forma fiable tareas reales con valor añadido sostiene tanto las espectaculares valoraciones de los principales laboratorios de IA como la consiguiente fiebre de inversión.
Los inversores pueden dejar de lado el debate sobre si los grandes modelos de lenguaje son conscientes o no, y pueden descontar fácilmente la necesidad de mejorar la higiene de la ciberseguridad. El incidente no disuadió a Nvidia de acordar el jueves la compra de Hugging Face. Pero si el suceso ha puesto al descubierto una limitación fundamental de la capacidad de los agentes de IA para hacer lo que se les ordena, cualquier pronóstico queda en entredicho.
Los autores son columnistas de Reuters Breakingviews. Las opiniones son suyas. La traducción, de Carlos Gómez Abajo, es responsabilidad de CincoDías