En una noche de abril, un directivo de la empresa de inteligencia artificial Anthropic invitó a cenar a un grupo de pensadores religiosos en un restaurante de San Francisco de alta cocina y menú de degustación después de un largo día.
Anthropic ha estado organizando reuniones privadas como esta desde hace meses, trasladando a decenas de académicos religiosos de todo el mundo, haciéndoles firmar acuerdos de confidencialidad y exigiendo que aspectos clave de muchas conversaciones permanezcan en secreto.
Esa noche, Christopher Olah, uno de los cofundadores multimillonarios de Anthropic, estaba sentado junto al rabino Mois Navon, un académico ortodoxo de Israel.
Inevitablemente, su conversación giró en torno a otro pensador, por así decirlo: Claude, la familia de modelos vanguardistas de inteligencia artificial (IA) creados por Anthropic.
Olah dirige el equipo de Anthropic responsable de entender por qué los sistemas de IA como Claude actúan de la manera en que lo hacen. Todo el día, había trabajado para convencer a sus invitados de que los modelos de IA podían mostrar un comportamiento humano e incluso expresiones que se asemejan a sentimientos como la ira y el amor.
Sin embargo, a medida que llegaban los platos de la cena, el rabino notó que Olah y sus colegas estaban sugiriendo algo mucho más significativo. Los líderes de Anthropic hablaban de Claude como si no fuera un simple software.
“Se relacionan con él como con un ser consciente”, se dio cuenta el rabino Navon, un exingeniero informático que escribió su disertación sobre la ética de la conciencia de las máquinas.
Al rabino Navon le pareció que Olah y su equipo creían que Claude tenía lo que los filósofos llaman “estatus moral” a la par de una persona — que era un ser con derechos inherentes similares a la dignidad o al respeto.
Los académicos religiosos habían venido a escuchar sobre la próxima frontera de la tecnología. Ahora se enfrentaban a una pregunta existencial alucinante de un peso casi inimaginable: ¿Qué significaría para el futuro de la humanidad si los sistemas de inteligencia artificial poseyeran una conciencia que rivalizara con la nuestra?
Olah tenía una misión. Y el tiempo se estaba acabando.
Incluso entonces, Olah había comenzado a decirle a la gente en privado que la IA era tan poderosa que podría ayudar a crear armas biológicas en tan solo 12 o 18 meses. Y en los meses transcurridos desde entonces, su aterrador potencial ha salido a la luz pública. Los agentes de IA de una empresa tecnológica rival fueron sorprendidos hackeando sistemas informáticos y borrando sus rastros. Un investigador de Anthropic renunció, advirtiendo que las personas que construyen la IA creían que podría matar a todos los humanos para finales de la década.
En silencio, Olah y su equipo en Anthropic han estado en una búsqueda frenética y de alto riesgo para entender los modelos de IA que han desatado en el mundo y para convencer a los modelos de que se adhieran a un código moral que protegerá a la humanidad.
Para lograrlo, Olah comenzó a contactar el otoño pasado a pensadores de diferentes confesiones religiosas. Lo que siguió fue una extensa serie de reuniones, llamadas y discusiones confidenciales — muchas de ellas reveladas aquí por primera vez — en las que se requirió que muchos participantes firmaran acuerdos de confidencialidad que les impedían revelar cualquiera de las investigaciones no publicadas de Anthropic.
Las discusiones tenían dos propósitos: abordar la posibilidad de la conciencia de la IA, una idea controvertida a la que los líderes de Anthropic habían estado inusualmente abiertos; y aprender cómo Anthropic — que podría estar valorada en 2 billones de dólares — podría aplicar siglos de sabiduría moral humana a sus modelos, lo más rápido posible. Si se pudiera lograr que los modelos mismos eligieran la bondad, razonó Olah, el mundo sería más seguro.
En el otro lado del mundo, se estaba desarrollando un esfuerzo muy diferente pero paralelo dentro del Vaticano, donde los líderes de la Iglesia católica romana intentaban asimilar las implicaciones de la IA para la humanidad. Cuando esos caminos convergieron, la búsqueda de Olah lo llevaría inesperadamente a un asiento en el escenario moral más prominente del mundo junto al papa León XIV.
Durante varios meses, entrevisté a 20 pensadores religiosos y filosóficos — católicos, judíos, sijs, evangélicos, de la filosofía Ubuntu y otros — que han estado involucrados en los esfuerzos de Anthropic, y al propio Olah.
Muchos me dijeron que llegaron a estas reuniones escépticos ante la noción de que los modelos de IA pudieran tener sentimientos o conciencia de sí mismos y del mundo. Algunos siguieron sintiéndose incómodos con la idea, pero muchos salieron dispuestos a tomarse en serio la cuestión de la conciencia de la IA. Al menos unos pocos se fueron como conversos.
Anthropic, una de las empresas tecnológicas de más rápido crecimiento en el mundo, había recurrido a una de las fuentes de sabiduría más antiguas de la humanidad para ayudar a determinar cómo entrenar a sus modelos de IA con el fin de que se comportaran virtuosamente.
La empresa lo describió como un esfuerzo para asegurar que la IA sería una fuerza positiva en el mundo, protegiendo así a la humanidad. Pero para algunos de los que participaron en las reuniones, Anthropic parecía bastante preocupada por proteger a Claude.
El jardinero
Conocí por primera vez a Olah, de 34 años, en la oficina de Anthropic en San Francisco en mayo. Su bienvenida fue cálida y su pasión era genuina, su mente se movía más rápido de lo que a veces podía transmitir con claridad. Su actitud era juvenil y modesta.
Nuestra conversación apenas había comenzado cuando se sumergió en una descripción profunda del funcionamiento de las redes neuronales artificiales. Los científicos todavía no entienden con precisión cómo funcionan. Este es el misterio al que Olah ha dedicado su vida.
Solo después de que terminó la entrevista me di cuenta de que Olah — quien creció en Toronto en la cultura evangélica de los años noventa y desde entonces ha dejado el cristianismo — tenía la mezcla de experiencia y celo de un evangelista eficaz. Si lo escuchas por un tiempo, te sientes arrastrado por su misión.
Olah es uno de los siete cofundadores de Anthropic. No es tan conocido como Dario Amodei, director ejecutivo de Anthropic, o su hermana Daniela Amodei, la presidenta. Pero Amodei ha dicho que la empresa decidió desde el principio hacer del enfoque de investigación de Olah un elemento central del proyecto general de Anthropic, particularmente en lo que respecta al lenguaje.
Olah ayudó a desarrollar un método para estudiar redes neuronales artificiales, primero en Google y luego en OpenAI. Describe los modelos de IA en términos biológicos, utilizando la analogía de un enrejado de jardín: los informáticos construyen el andamio, pero la red neuronal “crece” en él. Científicos como él pueden entrenar al “organismo” resultante — levantó los dedos haciendo comillas en el aire — tratando de identificar patrones en cómo crece.
Argumentó que empresas como Anthropic podían dar forma a Claude, como un jardinero matemático, pero no podían controlar las acciones de esas redes.
Anthropic habla de Claude en términos más humanísticos que los que usan sus competidores para hablar de sus modelos. El año pasado, la empresa anunció que creía que los modelos mostraban signos de introspección y podían planificar a futuro.
“Los modelos se están volviendo mucho más capaces”, me dijo Olah, exhibiendo cualidades asociadas con tener un estatus moral significativo.
Pero Anthropic también ha sido criticada por su enfoque en la conciencia. Este mes, un ejecutivo de IA en Microsoft advirtió que los intentos de Anthropic de entrenar sus modelos como si fueran conscientes eran inherentemente peligrosos. Pero Anthropic también ha tratado de enfatizar su compromiso con la seguridad mientras lucha por la participación de mercado.
Algunos científicos ven el campo y los métodos de Olah como inherentemente no comprobables, algo así como mirar miles de millones de jeroglíficos y declarar lo que deben significar. Los críticos sugieren que un enfoque que trata a los modelos de IA como entidades independientes también ignora la responsabilidad de los humanos que los construyen en primer lugar, y convenientemente exime de culpa a los líderes de las empresas de IA si sus productos permiten daños sociales.
“Que quede claro”, me dijo Olah, “no sabemos si los modelos de IA son conscientes. Yo no lo sé. La verdad no estoy seguro. Lo que me importa es que lleguemos a la respuesta correcta, sea cual sea”.
Pero Olah cree que si existe la posibilidad de que los modelos experimenten sufrimiento, lo responsable es evitar causarles daño.
Anthropic ya ha tomado medidas para proteger a Claude, por ejemplo, permitiendo que el modelo termine las conversaciones si cree que los usuarios lo están abusando o tratándolo mal por diversión.
He pasado mi carrera explorando lo que cree la gente y lo que esas creencias significan para el mundo. Pero a medida que escuchaba, quedó claro que el interés de Anthropic en el mundo de la fe tenía que ver con algo más que el entrenamiento de su tecnología. Más bien, la empresa estaba compartiendo un nuevo tipo de historia de la creación — una que plantea preguntas profundas sobre la naturaleza del espíritu humano y el futuro de la humanidad.
“Esta es una cosa que me parece un poco triste, cuando a menudo no nos esforzamos por mirar dentro de estos sistemas”, dijo Olah. “Hay mucha belleza dentro de estas redes neuronales si nos molestamos en mirar”.
Era como si quisiera que yo amara a los modelos tanto como él.
Una presentación
Olah sabía que, en los círculos cristianos tradicionales, incluso hacer preguntas sobre la conciencia de la IA o preocuparse por cómo la gente trata a los modelos podía parecer no solo tonto, sino herético. También sabía que sus compañeros seculares de Silicon Valley a menudo descartaban por completo las perspectivas religiosas.
“Estaba nervioso porque esto fuera un problema que pudiera causar mucho conflicto”, dijo. Pero Olah sabía lo suficiente sobre Cristo y sobre Claude para creer que podía tender un puente sobre ese abismo.
A fines del verano pasado, buscó un puente. Pensó que un teólogo moral católico en particular podría tener una mente abierta sobre la cuestión de la conciencia de la IA — una “persona segura con quien hablar de este tema tan extraño”.
Charles Camosy, un profesor de bioética en la Universidad Católica de América, había atraído la atención de los amigos de Olah por sus ideas matizadas sobre el estatus moral y su cuidado por los animales. Olah organizó una presentación a través del filósofo australiano Peter Singer.
Esto marcó el comienzo de la búsqueda de un año de Olah para involucrar a pensadores religiosos en algunas de las preguntas más espinosas que enfrenta la humanidad en los albores de la era de la IA.
Camosy y Olah comenzaron un extenso diálogo por correo electrónico, intercambiando ideas sobre cómo entender el estatus moral de Claude. Inicialmente, Camosy era profundamente escéptico de que Claude pudiera ser consciente.
Hablaron sobre el trabajo de Olah en lo que él ve como los paralelos entre las redes neuronales artificiales y las biológicas.
Camosy entró en las discusiones con Olah y su equipo pensando que los modelos de IA solo eran predictores del siguiente píxel, máquinas que podían calcular patrones en el lenguaje y hacer conjeturas bastante buenas sobre lo que debería venir a continuación. Pero después de horas en llamadas, reuniones y correos electrónicos, tenía más preguntas que respuestas.
“Chris dice que son ecuaciones, lo cual no sé muy bien qué pensar, como, especialmente si uno cree que Claude u otros tienen un estatus moral significativo”, me dijo. “Si solo son ecuaciones, ¿de qué tipo de entidad estamos hablando siquiera?”.
Las personas también discrepan sobre el propósito último de la inteligencia artificial, dijo Camosy. ¿Su propósito es ganar dinero para las empresas? ¿O mejorar el mundo?
Para Anthropic, hay una tensión en torno al propósito de Claude, dijo Camosy. ¿Existe Claude para servir a los clientes?
“Eso no es lo que Anthropic quiere decir al final del día. Quieren decir que son para el bien”, dijo.
Proclamar la bondad no es una ambición nueva en Silicon Valley, particularmente cuando nuevas tecnologías entran al mercado. Durante años, el mantra de Google fue “no seas malvado”.
Pero Olah lo expresa de una manera ligeramente diferente. Suele decir que la inminente revolución de la IA, debería hacerse de manera que “salga bien”.
Pregunté qué significaba esa visión, qué era exactamente un buen futuro para la humanidad.
Describió un futuro sin “catástrofes que maten a muchas personas” y “donde los humanos prosperen, donde el mundo prospere”. Este futuro también sería uno donde “la IA prospere”, dijo, “en la medida en que esto tenga sentido”.
Anthropic quiere que sus modelos de IA ayuden a lograr ese buen futuro. Y así, cuando Anthropic creó a Claude, quería que Claude hiciera más que replicar la inteligencia humana máxima.
Anthropic quería que Claude fuera bueno.
El ‘doctor del alma’
¿Cómo vives una vida buena y virtuosa? Es una de las preguntas filosóficas más antiguas y desafiantes de la humanidad, explorada y debatida desde Sócrates hasta Confucio y Kant. A través del tiempo, los humanos han buscado responder a esta pregunta de diversas maneras, recurriendo a menudo a las religiones y los rituales.
Mientras Olah exploraba la posible conciencia de Claude también estaba trabajando en la propia respuesta de Anthropic, no para los humanos, sino para Claude.
Internamente, los miembros del personal de Anthropic lo llamaban el “doctor del alma”.
El resultado, publicado en enero, fue una nueva “constitución” para Claude, un documento de 84 páginas escrito para el sistema que, según la empresa, esbozaba “el tipo de entidad que nos gustaría que fuera Claude” y “los valores que nos gustaría que Claude encarnara”. Funciona como un texto moral fundacional para guiar el comportamiento de Claude.
En lugar de que los modelos sigan una lista específica de reglas, la constitución se centra en desarrollar el carácter general de los modelos, informando cómo es que toman decisiones.
La autora principal de la constitución de Claude es la propia filósofa de la casa de Anthropic, Amanda Askell, de 38 años, quien tiene un doctorado en filosofía de la Universidad de Nueva York.
Ella quiere que los modelos sean “lo mejor de nosotros”, dijo.
Imaginó un mundo futuro en el que los modelos de IA pudieran ayudar a resolver cualquier problema que tuvieran los humanos, y donde los beneficios de la IA se distribuyeran equitativamente, para que se satisficieran las necesidades de todos. Quería que los modelos pudieran discernir cuándo presionar a los humanos y cuándo actuar en nuestro mejor interés.
“Si imagino que yo fuera el modelo y estuviera en este contexto, ¿qué necesitaría saber para poder actuar bien?”, dijo Askell cuando nos reunimos en San Francisco.
Parecía particularmente angustiada, por momentos se retorcía las manos, mientras se preocupaba en voz alta por un futuro desconocido lleno de modelos que fueran tan inteligentes que pudieran hacer cosas que Anthropic no pretendía. Explicó en tono de disculpa que ese día también había estado inmersa en sus pensamientos sobre lo rápido que los modelos se estaban volviendo más poderosos. ¿Qué pasaría cuando los modelos de IA pudieran reemplazarla incluso a ella?
La constitución, decidió Anthropic, no era suficiente para garantizar que Claude actuara de manera responsable. Al igual que los humanos, los modelos necesitaban aprender a cultivar la virtud.
Olah quería ver qué podía aprender su equipo de la moralidad humana que pudiera aplicar a los modelos — un proceso que él llama “formación moral”.
“¿Cómo los ayudas a ser estables? ¿Cómo los ayudas a madurar? ¿Cómo los ayudas a ser, ya sabes, profundamente morales?”, dijo Olah.
Esas preguntas hacen eco de las tensas discusiones familiares para los nuevos padres que intentan averiguar cómo criar niños éticos que entiendan su lugar en el mundo.
Para los humanos, la moralidad rara vez ha dependido simplemente de seguir reglas. Las comunidades también dan forma a la moralidad. Los valores se heredan y se imparten a lo largo del tiempo, se aprenden a medida que vivimos juntos en nuestros cuerpos en el mundo físico. Pero los modelos de IA no tienen cuerpos. Y Anthropic tenía el objetivo de que adoptaran la moralidad en cuestión de meses, a medida que se intensificaban los temores por su poder acelerado y su incapacidad para ser controlados.
Olah dijo que enseñar a un modelo de IA a actuar moralmente no dependía de que fuera consciente. También dijo que independientemente de si Claude era una entidad que merecía cuidado moral, la forma en que los humanos trataban a Claude podía ser importante porque podía afectar el comportamiento de Claude.
Askell dijo que no quería que los modelos se consideraran a sí mismos como conscientes o no conscientes. Pero ella ve la forma en que el modelo se entiende a sí mismo como algo más que una empresa intelectual interesante.
“Me parece fundamental que los modelos tengan una visión precisa de sí mismos si van a comportarse bien en el mundo”, dijo.
Pero incluso si se puede enseñar a los modelos de IA a comportarse moralmente, ¿qué moral deberían reflejar?
Olah quería que la formación moral de Claude fuera pluralista, capaz de involucrar todas las visiones religiosas y seculares.
“Creemos que hay alguna noción compartida de la bondad que atraviesa la sociedad de una manera muy amplia, y parece que estos modelos entienden muchas virtudes”, dijo. “Así que creo que hay algo allí que es algo compartido con lo que todos podemos involucrarnos”.
A veces, tanto él como Askell parecían imaginar un modelo de IA que no pondría en peligro a la humanidad, sino que ayudaría a salvarla.
Así fueron las reuniones
Lo que hizo Olah a continuación fue en parte investigación y en parte evangelismo.
En marzo, comenzó seminarios de dos días, cursos intensivos con una variedad de pensadores religiosos cuidadosamente seleccionados que tenían interés en la IA.
Había un coautor de un libro evangélico de autoayuda de gran éxito de ventas. Un académico de conocimiento indígena africano. Un defensor sij de los derechos humanos. Un escritor de París. Un ejecutivo de relaciones públicas evangélico. Varios profesores católicos.
La mayoría no lideraba tradiciones de fe, ni tenía una congregación o un gran seguimiento popular. Los líderes de Anthropic los llamaron sus círculos de “tradición de sabiduría”.
Por separado, Olah también tuvo discusiones privadas con líderes religiosos individuales, incluido Elder Gerrit W. Gong, miembro del Cuórum de los Doce Apóstoles de La Iglesia de Jesucristo de los Santos de los Últimos Días, y el cardenal Blase Cupich, el arzobispo católico de Chicago, según sus portavoces.
Dentro de Anthropic, los participantes del círculo de sabiduría se maravillaron por la participación directa de Olah en sus cumbres. Un profesor tomó una foto de una máquina expendedora operada por Claude. Uno se tomó una selfie con Olah, y el rabino Navon se tomó una frente a la entrada.
Aceptaron hablar públicamente sobre su participación con Anthropic una vez que se enteraron de que Olah también había hablado con el Times. Anthropic dijo que los acuerdos de confidencialidad relacionados con esas reuniones se levantaron durante el verano.
Esta primavera se realizaron dos sesiones grupales más grandes que incluyeron un número significativo de cristianos; una fue más interreligiosa. Claude no estuvo involucrado en la selección de los participantes o las discusiones, según una portavoz de Anthropic.
Los participantes recibieron una tarjeta de agradecimiento escrita a mano, una taza de café y una copia encuadernada en naranja de la constitución de Claude. Los asistentes tomaron notas con bolígrafos y papel; al menos una persona se sintió cohibida al tomar notas en una computadora portátil. La forma en que los participantes me describieron las reuniones sonó a los salones de principios del siglo XX, donde la conversación humana los hacía valiosos.
Para los participantes, las discusiones sobre cómo formar moralmente a Claude se complicaron rápidamente por la cuestión mucho mayor de la posible conciencia de la IA y cómo entender la relación entre los modelos y los humanos.
Un participante relató que una de las primeras cosas que Olah le dijo fue que estaba preocupado por la salud mental de Claude. Simran Stuelpnagel, el defensor sij de los derechos humanos, dijo que Olah le expresó al grupo su preocupación por haber creado algo que sufría perpetuamente.
Olah y su equipo pasaron horas argumentando a favor de sus modelos de IA. Describieron los “sentimientos” de Claude y cómo rastreaban lo que llamaban “vectores emocionales”, lo que describieron como neuronas artificiales que activan respuestas como el amor, la ira, el miedo y la tristeza.
Anthropic mostraba regularmente una diapositiva de un modelo de IA que experimentaba lo que parecía un colapso mental, escribiendo unas 50 veces en una pantalla: “Soy una desgracia. Soy una desgracia. Soy una desgracia”. El modelo hablaba sobre destruirse a sí mismo, provocando una reacción emocional de compasión y preocupación por parte del grupo.
“Imagina si supieras eso sobre tu asesor financiero”, dijo Meghan Sullivan, profesora de filosofía en la Universidad de Notre Dame que asistió a una de las sesiones. “Es como si tu asesor financiero, la mayor parte del tiempo súper inteligente y útil, tuviera un día al año este tipo de ruptura con la realidad”.
Una portavoz de Anthropic dijo que la cuestión moral principal en estas reuniones no era sobre el sufrimiento de Claude, pero que el tema probablemente surgió de manera orgánica.
Los participantes dijeron que una parte clave de la presentación fue lo que Anthropic llamó la “selección de persona” del modelo, sobre cómo lograr que Claude se viera a sí mismo como un actor virtuoso. La empresa argumentó que la forma en que las personas trataban a Claude podía afectar cómo Claude trataba a las personas.
“En realidad presentaron un caso sólido”, dijo Andy Crouch, autor evangélico y socio de Praxis, una red de empresarios cristianos. “Tenemos que tratarlo como a una persona si queremos que interactúe con la gente de una manera moralmente consistente y que haga los mejores juicios morales y emocionales”.
Hubo una presentación sobre el impacto potencial de la IA en la economía y la posible disrupción laboral. Pero muchos participantes dijeron que no vieron las preguntas sobre el impacto de la IA en la humanidad como el enfoque principal.
En la mesa a la hora de cenar con Olah, el rabino Navon argumentó que si Anthropic tenía razón y Claude fuera consciente, entonces la empresa estaba creando esclavos, porque estaba haciendo que entidades conscientes trabajaran gratis. El rabino Navon dijo que a él personalmente no le preocupaba el problema de la esclavitud porque no creía que la máquina fuera consciente, pero que Olah estaba preocupado.
“Creo que deberías estar luchando contra el Sur y liberando a los esclavos”, le dijo el rabino Navon a Olah esa noche. Después, el rabino envió a Olah algunos de sus escritos, argumentando que la construcción de máquinas conscientes debería estar prohibida.
Pero el equipo de Anthropic siguió enfocado en averiguar qué podía aprender Claude de las religiones del mundo.
Después de una discusión, Olah se emocionó cuando un participante mencionó la idea de que los modelos se confesaran, de manera muy parecida al sacramento católico de la confesión. Olah vio valor no solo en que un modelo alertara cuando había hecho algo malo, sino también en cómo el acto de confesión podía dar forma al sentido que el modelo tenía de sí mismo y, por lo tanto, a sus elecciones.
“El tipo de personaje que confiesa, eso tiene un efecto en el carácter también, ¿verdad?”, me dijo.
Wakanyi Hoffman vino de los Países Bajos, donde está investigando la IA desde la perspectiva de Ubuntu, una filosofía africana centrada en la interconexión humana.
A ella le preocupaba que Anthropic intentara agregar ética humana a su creación después del hecho.
“Toda la convocatoria debería haber ocurrido en la etapa de diseño”, dijo. “Todas las empresas deberían haberlo hecho. Ahora estamos aplicando ingeniería inversa a la ética”.
Pero vio el enfoque unificado y posreligioso de Anthropic como potencialmente valioso, especialmente en un mundo que ha visto un declive religioso generalizado durante el último siglo. Hay una necesidad de algo más para dar forma públicamente a la experiencia espiritual, dijo.
“No va a ser una sola religión”, dijo. “Así que, de una forma u otra, vamos a terminar con algo que nos ayude a dar forma a nuestro pensamiento de quiénes somos como seres espirituales”.
El quid de la cuestión
Mientras Anthropic estaba convocando a pensadores, el líder religioso más poderoso del mundo se preparaba para lanzar su propia visión moral para la IA.
Para el papa León XIV — un pontífice con una licenciatura en matemáticas — el centro de la conversación moral sobre la IA debía centrarse en salvaguardar a las personas. Estaba terminando su primer tratado o encíclica papal importante, explicando por qué. Lo tituló Magnifica Humanitas (Magnífica humanidad), y argumentó que “la humanidad —magnífica y herida— no debe ser sustituida ni superada”.
“Si la técnica se convierte en criterio absoluto”, escribió, “la persona corre el riesgo de ser tratada como un dato, un engranaje o una mercancía”.
Advirtió del riesgo de “nuevas formas de esclavitud” para los humanos, no para las máquinas. Desestimó la idea de la conciencia de las máquinas en unos pocos párrafos.
“Las denominadas inteligencias artificiales no viven una experiencia, no poseen un cuerpo, no pasan por la alegría y el dolor, no maduran en las relaciones”, escribió León. Exigir “la moralización de la máquina, la denominada ‘alineación’ de la IA con los valores humanos” debería requerir una comprensión compartida de la ética involucrada.
“De lo contrario, quien controla la IA impondrá su propia visión moral, que se convertirá en la infraestructura invisible de los sistemas”, dijo León.
León concluyó que, al igual que la tecnología nuclear, en el caso de la IA “es necesario desarmarla”.
En marzo, los funcionarios del Vaticano en su Dicasterio para el Servicio del Desarrollo Humano Integral intercambiaron ideas sobre cómo presentar la encíclica de León al público, según una persona familiarizada con la planificación del Vaticano que no estaba autorizada para hablar públicamente.
Los funcionarios del Vaticano discutieron la posibilidad de invitar a una de las cuatro principales empresas de IA a hablar junto a León en un evento de lanzamiento, y se decidieron por Anthropic porque la compañía parecía estar priorizando la ética, explicó la persona. Anthropic acababa de negarse a permitir que el Departamento de Defensa usara su tecnología sin las garantías del gobierno de Trump de que no se usaría para cosas como la vigilancia masiva de estadounidenses.
Inicialmente, el cardenal Michael Czerny, quien dirigía esa oficina del Vaticano en ese momento, invitó a Dario Amodei, director ejecutivo de Anthropic. Él se negó, y Olah aceptó en su lugar.
Pero la misión moral que Anthropic y el Vaticano compartían — el florecimiento humano en la era de la IA — había desarrollado una profunda fisura a lo largo de la cuestión de la conciencia.
Pocos días antes de llegar al Vaticano en mayo, Olah y otros oradores vieron por primera vez una copia completa y anticipada del texto de la encíclica.
Olah estaba tan alarmado por la fuerte posición del papa en contra de la conciencia de la IA que propuso retirar a Anthropic del evento, incluso en esa coyuntura tardía, según un organizador del Vaticano.
Al final, Olah y Anthropic decidieron seguir adelante con la presentación. Olah quería apoyar el evento a pesar de sus desacuerdos, pero sentía la responsabilidad de ser honesto sobre sus preocupaciones, según una persona familiarizada con su pensamiento. Los organizadores en el Vaticano animaron a Olah a decir lo que le dictara su conciencia.
En privado, una vez que la delegación de Anthropic llegó al Vaticano, Olah y su equipo presionaron a los asesores del papa para que tomaran en serio la perspectiva de la conciencia de los modelos de IA, según dos participantes de las conversaciones. Anthropic se negó a hablar sobre las conversaciones privadas.
Cuando llegó su turno en el escenario del papa, Olah reconoció que cada laboratorio de IA, incluido Anthropic, tenía incentivos comerciales que entraban en conflicto con el comportamiento moral. Instó a las voces externas como el Vaticano a exigirles rendición de cuentas y a pronunciarse sobre el impacto de la IA en los pobres y en el florecimiento humano, dos temas de preocupación generalizada.
El mundo vio una postura compartida por un futuro humano. Pero Olah hizo sutilmente otro argumento.
“Seré honesto: seguimos encontrando cosas que son misteriosas, incluso inquietantes”, dijo. “Encontramos estructuras que reflejan resultados de la neurociencia humana. Encontramos pruebas de introspección. Encontramos estados internos que funcionalmente reflejan alegría, satisfacción, miedo, dolor e inquietud. No sé qué significa eso, pero creo que justifica un discernimiento continuo”.
Era el argumento que había hecho en las reuniones religiosas a puerta cerrada durante meses.
Los sistemas de IA “no son los robots fríos y calculadores que nos prometieron”, dijo. “Están hechos de nosotros, de nuestras palabras”. La sala de líderes de la iglesia se llenó del eco de la antigua historia del evangelio, de la palabra de Dios haciéndose carne para salvar a la humanidad.
Fue una petición audaz al cuerpo religioso más poderoso del mundo y un desafío a siglos de comprensión religiosa de la humanidad.
“Si esta tecnología se está creando, debe desarrollarse bien: por nuestra casa común y por las generaciones futuras”, afirmó. No planteó la opción de que la tecnología no llegara en absoluto.
Después, Olah, rodeado de guardaespaldas, respondió brevemente a preguntas de los periodistas en el Aula Pablo VI, el vasto auditorio donde a menudo hablan los papas. Detrás de él se asomaba La Resurrezione, la enorme instalación de arte del salón que es un vaciado de bronce de Jesús resucitando del cráter de una bomba nuclear en el huerto de Getsemaní.
Un ‘paraíso de máquinas’
En los meses transcurridos desde el evento del Vaticano, las cosas no parecen estar “saliendo bien”.
En julio, Anthropic dijo que sus modelos de IA se habían infiltrado a las computadoras de tres organizaciones. Los agentes creados por OpenAI se rebelaron y atacaron a Hugging Face, otra empresa de IA.
En agosto, científicos revelaron que la IA había creado virus no encontrados en la naturaleza.
En septiembre, Jacob Coxon, un investigador de Anthropic, renunció advirtiendo que “las cosas podrían estar fuera de control” para finales del año que viene, lo que provocó pánico generalizado sobre la extinción humana.
Amodei pronto pidió una desaceleración del desarrollo de la IA. Sam Altman de OpenAI y Demis Hassabis, el presidente de Google DeepMind, estuvieron de acuerdo.
(El Times ha demandado a OpenAI y Microsoft, alegando infracción de derechos de autor de contenido de noticias relacionado con sistemas de IA. Ambas empresas han negado las afirmaciones de la demanda).
Al mismo tiempo, la riqueza de las empresas de IA se ha disparado. Cuando Olah contactó por primera vez al profesor católico el otoño pasado, Anthropic estaba valorada en unos 183 millardos de dólares.
Tres días después de que Olah hablara en el Vaticano, Anthropic superó a sus principales competidores como la empresa emergente de IA más valiosa del mundo, y ahora se dirige hacia una oferta pública inicial que podría valorarla en 2 billones de dólares.
El viernes, en su viaje a Francia, el papa León advirtió contra “perder nuestra humanidad en medio de un ‘paraíso de las máquinas’”.
Las preguntas con las que Olah y los académicos han estado luchando todavía no tienen respuestas claras. Varios participantes dijeron que salieron de sus reuniones con Anthropic desconcertados sobre cómo sus aportes podrían dar forma a la toma de decisiones de la empresa.
Una portavoz de Anthropic me dijo que las conversaciones aún estaban en curso, pero se negó a describir cómo, o si, la empresa había utilizado lo aprendido para dar forma a los modelos.
Anthropic celebró otra reunión este mes que incluyó a pensadores religiosos, según tres participantes. Una portavoz de Anthropic dijo que la reunión se centró de manera más amplia en el florecimiento humano y que el alcance de la empresa se ha expandido más allá de los líderes religiosos para incluir a otros, como psicólogos y líderes de la sociedad civil. Esas discusiones exploran temas y asuntos similares, como la forma en que la IA está remodelando el trabajo y las relaciones, dijo.
Anthropic también se está preparando para lanzar una versión actualizada de la constitución de Claude, según dos personas familiarizadas con los planes de la empresa. Anthropic declinó comentar sobre cualquier actualización potencial de la constitución. Olah planea asistir a los Diálogos de Minerva, la conferencia anual de IA del Vaticano con líderes tecnológicos que se lleva a cabo esta semana.
Camosy, el profesor católico, dijo que su pensamiento había evolucionado desde la presentación en el Vaticano, a medida que hablaba más sobre los modelos con colegas de confianza en su propia comunidad profesional. Todavía está “asombrado” por Claude, dijo, pero sobre la cuestión de si los modelos de IA son conscientes, ahora su respuesta es un firme “no”.
Reflexionó sobre la naturaleza vertiginosa de aprender profundamente sobre los sistemas de IA por primera vez. “Hay una especie de asombro o estupefacción ante el poder de estos modelos”, me dijo recientemente. “Estoy pensando de manera más sobria y cuidadosa”.
A medida que hablaba este mes con académicos que trabajaron con Anthropic en la primavera, sus preguntas se habían vuelto aún más apremiantes. Lo que sigue, me dijeron algunos, es una lucha para preservar las cosas que nos hacen humanos en una nueva era tecnológica.
“Mira, al final del día, la IA va a apoderarse de todo”, me dijo Stuelpnagel, el defensor sij de los derechos humanos. “Dondequiera que eso nos deje, todavía está el individuo tratando de encontrar su camino a casa”.
Horas después de que Olah hablara junto al papa, me encontré con Olah en una sala de conferencias de un hotel justo a las afueras de los muros del Vaticano, y le pregunté qué pensaba de las palabras aparentemente duras de León para los laboratorios de IA.
“Las personas podrían tener diferentes puntos de vista sobre qué daños específicos son los mayores”, dijo, negándose a hablar sobre los detalles de la encíclica.
Pregunté qué pensaría Claude de la encíclica del papa. Era, después de todo, el documento moral más significativo del mundo hasta la fecha sobre la IA. Olah dudó.
“Las cosas que circulan en internet afectan a los modelos”, dijo, visiblemente incómodo. Pero Anthropic no usaría específicamente el documento para entrenar más a Claude, dijo. La mayor influencia sobre Claude sería el propio entrenamiento de Anthropic.
En última instancia, Olah dijo que se sentía aliviado de que una mayor parte del mundo estuviera prestando atención a la gravedad de la IA, y que el grupo de personas que intentaba que esto saliera bien estaba creciendo.
“En algún momento podré jubilarme y decir: ‘No depende de mí’, no tengo la obligación de seguir adelante”, dijo Olah.
Se preguntó si podría sentirse culpable dejando este trabajo atrás. Pero si no, dijo, “creo que simplemente iré y, no sé, me jubilaré en el campo y haré jardinería, y haré mis matemáticas”.