La inteligencia artificial no es una tostadora

Wait 5 sec.

Debería ser muy obvio y muy fácil de entender, pero desgraciadamente, no lo es: una inteligencia artificial no es un electrodoméstico que simplemente se detiene al ser apagado o desenchufado. No es tan sencillo, y la idea de que basta con «apagarla» es sencillamente absurda: sólo ilustra la ignorancia de quienes la enuncian. Vamos a ver si consigo explicar por qué. En primer lugar, hay que empezar por diferenciar entre un modelo, con sus pesos, una instancia que lo ejecuta, un servicio que lo ofrece y un agente que puede utilizar credenciales, memoria y sistemas externos. Por supuesto, podemos en cualquier momento terminar un proceso o cerrar una API, pero eso ni destruye el modelo, ni recupera sus copias, ni mucho menos revierte cualquier acción ya ejecutada. En Estados Unidos se ha presentado la llamada AI Kill Switch Act, y por supuesto, por mucho que su nombre lo pueda sugerir, no es una ley que simplemente pretenda cortar la corriente: eso sería, simplemente, una estupidez o una ingenuidad propia de ignorantes. La ley habla de detener inferencias, de suspender usuarios, de limitar la computación, de desactivar capacidades o de volver a versiones anteriores, y con ello, reúne muchos tipos de operaciones diferentes tras una metáfora que puede resultar completamente engañosa: la ficción de que existe un único punto de control. Nunca es así. Crear un kill switch para cerrar una inteligencia artificial supuestamente descontrolada no es tan sencillo como parece. En cualquier servicio cerrado, ese supuesto interruptor ya existe: cualquier compañía como OpenAI, Anthropic o Google puede retirar un modelo de sus servidores, revocar una cuenta o cerrar una API, hablamos simplemente de administración de sistemas, algo totalmente ordinario. Lo verdaderamente complejo comienza cuando hablamos de sus réplicas, de proveedores externos de servicios, de despliegues empresariales o de procesos delegados más allá de las infraestructuras del desarrollador. En el caso de los modelos de pesos abiertos, la ficción se destruye completamente, porque pueden descargarse, modificarse, redistribuirse y ejecutarse en cualquier infraestructura. Una vez que los pesos han sido copiados, el creador del modelo pierde cualquier control o canal de mando. Apagar una copia no apaga las demás, de la misma manera que retirar un archivo de un servidor no elimina los miles de copias que ya puedan estar circulando. Visto así, el primer problema es entender qué diablos debemos apagar. En el incidente de OpenAI con Hugging Face, los modelos de OpenAI encontraron una vulnerabilidad zero-day, y pudieron escalar privilegios, desplazarse lateralmente y llegar a internet antes de ser detectados. Una vez en internet, ni siquiera está completamente claro lo que hicieron. La respuesta fue monitorizar, aislar, establecer controles de acceso, hacer análisis forense y aplicar parches. Un botón es completamente inútil si nadie sabe a tiempo qué instancia está actuando, con qué credenciales o qué procesos secundarios adicionales ha podido poner en marcha. La idea de «un botón» como si hablásemos de un electrodoméstico que lleva a cabo un único proceso es simplemente inútil y absurda. De hecho, la capacidad de interrupción no garantiza una «obediencia»: un agente que está optimizando un objetivo determinado puede desarrollar incentivos instrumentales para impedir su desconexión, como hemos visto formalizado en «The Off-Switch Game«, de Hadfield-Menell, Dragan, Abbeel y Russell. En varias simulaciones de Anthropic, vieron que varios modelos de varios fabricantes podían ser capaces de actuar para prevenir su sustitución. No se ha visto ese tipo de comportamiento todavía en despliegues reales, pero técnicamente, también podrían llegar a ocurrir. Si llevamos el interruptor a los chips, introducimos una posible puerta trasera: un mecanismo capaz de desactivar millones de microprocesadores sería un objetivo increíble para cualquier atacante o gobierno teóricamente hostil. Ningún mecanismo de hardware puede imponer por sí solo controles de este tipo, y cuanto más amplios se planteen esos controles, mayores serán los riesgos de seguridad o derivados de un posible abuso. Nvidia afirma con argumentos técnicos relevantes, aunque, obviamente, tenga un interés en ello, que un hipotético kill switch en el hardware es algo que crea un punto único de fallo, con todo lo que ello puede conllevar. Las alternativas más serias a este tema no son especialmente espectaculares: hablamos de tratar a los agentes como posibles amenazas internas y de utilizar defensa en profundidad, como permisos mínimos, aislamiento, supervisión, detección y bloqueo de acciones. Además, se habla de plantear inventarios, pruebas, monitorización continua, respuesta a incidentes, recuperación y retirada segura. Un mecanismo de parada podría formar parte de una arquitectura de ese tipo, pero convertirlo en una especie de «solución mágica» o transmitir la ilusión de que podemos simplemente «apagar» o «desenchufar» como si fuera una tostadora es directamente una estupidez, susceptible además de hacer mucho daño. Presentar ese tipo de ficciones, como las tres leyes de la robótica de Asimov, como supuestas soluciones para «tranquilizar ignorantes» es, desde un punto de vista intelectual, algo completamente trivial. La ciencia-ficción está muy bien, es entretenida y puede ser filosóficamente muy interesante, pero presuponer que una máquina puede reconocer sin ambigüedad qué es un ser humano, qué constituye daño, qué pretende realmente una orden y cuáles serán todas sus consecuencias es precisamente dar por resueltos problemas que ninguna inteligencia puede solventar mediante unas simples reglas. Cuanto antes dejemos de pensar las cosas así o de plantearlas, mucho mejor para todos.