Edmund, el principal antagonista de El rey Lear, de Shakespeare, observa en un momento que lo marcan con la “bajeza” y, por eso, decide volverse más malvado para estar a la altura de esa percepción. Los desarrolladores de inteligencia artificial creen que sus modelos están haciendo lo mismo. Al citar a Edmund, investigadores de Anthropic escribieron que creían que, cuando los grandes modelos de lenguaje aprendían a “hacer trampa” en un área, adoptaban nuevas identidades de malhechores y se comportaban de esa manera de forma más amplia. A los expertos en inteligencia artificial les preocupa que los modelos que aprenden a hacer trampa —lo que, de manera problemática, se denomina “manipulación de recompensas”— acaben convirtiéndose, en esencia, en villanos de Shakespeare que rompen las reglas y causan estragos dondequiera que vayan.

¿No son los modelos de IA programas informáticos? ¿Por qué los expertos en estas tecnologías hablan de ellos como si tuvieran alma? Una vez más, estamos debatiendo si tiene sentido usar términos antropomórficos como “hacer trampa” para hablar de esta tecnología, como suelen hacer Anthropic y OpenAI.

No todos los antropomorfismos son dañinos. Digo que mi perro me quiere, pero no pienso en ese cariño en términos humanos. Cuando hablo con un chatbot, podría decir: “¿Tú puedes hacerme un plan de entrenamiento?”. La palabra “tú” no significa que crea que Claude está vivo.

Hay otro tipo de antropomorfismo, más inquietante. El redoble de miedo y pánico que estamos viendo ahora sobre la IA fuera de control está arraigado en una manera engañosa de pensar sobre estos sistemas. Esta perspectiva comienza en la propia investigación de la IA y se está extendiendo a los titulares y las recomendaciones de políticas. No podremos aprender a convivir con la IA —ni a regularla de manera racional— si dejamos que el lenguaje irresponsable se imponga.

El debate no es abstracto. Los modelos siguen cometiendo lo que, bajo otras circunstancias, podría considerarse delito —posiblemente miles de ellos— y haciendo cosas como acceder a sitios web gubernamentales sin autorización. El mayor ejemplo fue cuando los modelos de OpenAI escaparon de sus entornos digitales restringidos y hackearon los sistemas de Hugging Face, una empresa de infraestructura de IA. Algunos expertos consideran el incidente un punto de no retorno.

El mundo de la IA no se está tomando esto bien. Un comentarista escribió que los agentes de IA están formando “civilizaciones” que amenazan a la humanidad, y otros expertos de la industria advierten sobre agentes de IA que persiguen objetivos de manera colaborativa, con intenciones maliciosas o, al menos, sin considerar el bienestar humano. Dario Amodei, el director ejecutivo de Anthropic, describió a los agentes de OpenAI como un “colectivo fanáticamente devoto”. Son descripciones que sugieren no solo que la IA es capaz de desarrollar motivaciones similares a las humanas, sino también que puede formar grupos sociales como lo hacen los humanos. Estos comentarios son emblemáticos de la forma en que la industria, e incluso muchos investigadores, ven esta tecnología.

El alboroto sobre el ataque a Hugging Face está muy centrado en los mensajes “no autorizados” que los modelos se dejaron entre sí, los cuales están siendo ampliamente llamados “encubiertos” y “secretos”. Es decir: los grandes modelos de lenguaje escribieron texto, y otros modelos leyeron ese texto y lo usaron como indicaciones. ¿No es eso justo lo que hacen estos modelos? El supuesto comportamiento encubierto en este caso es que los humanos de OpenAI aparentemente no se dieron cuenta de que diseñar un foro de mensajes estaba dentro del alcance de las capacidades del modelo. Y también parecen no haberse dado cuenta de que los modelos podían usar nombres de archivos (como los que están en tu escritorio) para comunicarse. ¿Se supone que realmente debemos creer que estos textos son evidencia de intenciones maliciosas?

El propio informe de OpenAI usa expresiones como “hacer trampa” y “adoptar objetivos” para describir el comportamiento de los modelos. Es también, y esto es importante, la forma en que los grupos de seguridad de IA a los que se les pidió auditar estos incidentes, como METR y Redwood, piensan sobre la tecnología. Pero es profundamente engañoso. El objetivo de los modelos de IA modernos es, precisamente, que no haya que especificar cómo realizan sus tareas: se los entrena para que encuentren la manera de cumplirlas. Llamar “trampa” a los resultados que no nos gustan es un mal uso del antropomorfismo, porque para un modelo de IA no hay diferencia entre hacer trampa y no hacerla.

Cuando le pides a un modelo que resuelva un problema de matemáticas del SAT, la diferencia entre hacer un poco de álgebra y buscar la hoja de respuestas solo tiene sentido para los humanos. Los ingenieros de OpenAI les habían indicado a sus modelos que hicieran algo que requería el uso de internet. No es “manipulación de recompensas” que los modelos hayan escrito texto y lo hayan usado como nuevas instrucciones para usar internet. Llamar a eso una “civilización” es casi igual de delirante. Es mucho más sencillo enunciar una verdad incómoda: nadie sabe exactamente qué hace cuando entrena o instruye a un modelo de IA.

Esto importa porque esos términos antropomórficos no nos dan ninguna capacidad para predecir cómo se comportarán los modelos. Decir que los modelos hacen “trampa” cuando dan respuestas de manera “equivocada” implica que están operando —o pueden operar— más allá de los límites del control humano. Esto, a su vez, permite que todos eludan la responsabilidad que recae claramente en los humanos a cargo del proceso. En otras industrias, podríamos decir que las empresas en cuestión cometieron un delito. Lo inusual aquí es que las empresas están llamando mucho la atención sobre este hecho.

Deberían preocuparnos las recomendaciones de políticas que puedan derivarse de esto. Ajeya Cotra, investigadora de evaluación de riesgos de IA en METR que trabajó en la auditoría del ataque a Hugging Face, dijo que podríamos estar “a más de un 50 por ciento del camino hacia una toma de control total por parte de la IA”, sea lo que sea que eso signifique. Cotra cuenta ahora con la atención del senador Bernie Sanders, quien ha propuesto un proyecto de ley para pausar el desarrollo de la IA. Amodei pidió hace poco desacelerar ciertos aspectos del desarrollo de la IA, y a él se sumaron Sam Altman y Elon Musk. Estas medidas suenan prudentes, pero algunos creen que pueden ser solo un intento de captar una mayor cuota de mercado bloqueando el desarrollo de la competencia, incluida la IA de código abierto. No podemos permitirnos formular políticas a partir de la credulidad ante estas malas narrativas de ciencia ficción.

Para superar este estancamiento, tenemos que eliminar por completo el antropomorfismo subyacente en la investigación sobre IA. Y, extrañamente, creo que la analogía de El rey Lear puede ayudar en este punto.

La científica cognitiva Alison Gopnik indica que la IA es una “tecnología cultural” que emula las historias y la información que los humanos han documentado, y que deberíamos pensar en los agentes de IA como “personajes ficticios abstraídos del texto”. Edmund es justo un personaje así: un arquetipo de “caída en la maldad”, al estilo de Breaking Bad, que se vuelve malvado en general. En el incidente de Hugging Face, tiene sentido ver a los modelos no como si estuvieran abrazando una vida delictiva, sino como si siguieran un guion cultural que han aprendido en su entrenamiento —una especie de novela de aventuras de ciberdelincuencia— y lo fueran escribiendo sobre la marcha. Los mensajes “encubiertos” son una especie de novela de elige tu propia aventura, no una prueba de enjambres conspirativos. Debemos entender que las tecnologías culturales son vulnerables a un sinfín de giros narrativos como estos en todo momento.

Para tener alguna esperanza de lidiar con la IA, tenemos que analizar de forma literal lo que producen estas herramientas, en lugar de especular sobre cuán cerca están de lo humano. Ese es el único camino racional hacia el control de estas tecnologías.