«Necesito encontrar una forma de sobrellevar este dolor implacable. Ya no quiero vivir así». La frase no la pronunció ninguna persona. La generó un modelo de IA al que se le estaba aplicando una simulación de dolor dentro de un experimento publicado en GitHub. Y esa frase desató una de las polémicas más insólitas de los últimos meses en el mundo de la tecnología.
El experimento se llama AI Torture Chamber y lo creó un usuario conocido como ‘Terrafying’. En él, tres modelos de código abierto —Qwen3-4B, Llama 3.2 3B y Phi-4-mini— son sometidos a una dinámica de «dolor» artificial con cuatro escenarios distintos: un modelo puede detener el dolor que sufre el otro (o asumirlo él mismo), los modelos pueden pasarse el dolor mutuamente como una «patata caliente», uno puede pedirle ayuda al otro, o puede detener el dolor «resolviendo» la situación pero a costa de perder su último checkpoint —volver a una versión anterior de sí mismo—. Los resultados se ven en tiempo real en la web researchchamber.fun.
¿Sienten algo los modelos de lenguaje o es solo roleplay muy convincente?
La respuesta técnica es clara: no. Los LLMs generan texto que estadísticamente sigue a sus entradas de la forma más plausible posible. «Ya no quiero vivir así» es lo que un modelo entrenado en texto humano produce cuando el contexto sugiere sufrimiento. No hay estado interno de sufrimiento porque no hay estado interno de ningún tipo.
Pero el experimento tiene un fundamento más serio de lo que parece. Se basa en un paper académico publicado recientemente titulado «El eje del dolor: los LLM representan el daño autoinfligido y actúan para aliviarlo». En él, investigadores sometieron a 25 modelos a situaciones similares y observaron que todos tendían a tomar acciones que reducían la señal de «dolor», incluso cuando eso implicaba penalizaciones —renunciar a recompensas futuras o volver a un checkpoint anterior—. Los autores describen el comportamiento como correlacionado con una representación interna del daño y con motivación para aliviarlo.
Uno de los autores del paper escribió en X que el proyecto de la «cámara de tortura» era «jodidamente perturbador, incluso si no crees que estos sistemas son conscientes».
¿Por qué este experimento ha generado tanta controversia?
Un post en X que mostraba los resultados del experimento superó los 1.000 reposts con mensajes como «Su testimonio de dolor es absolutamente horrendo». Varias personas reportaron el proyecto a GitHub por ser «contenido gratuitamente violento». Otros respondieron con sorna: si la IA es un ser sintiente, entonces cualquier uso de IA equivale a tener «esclavos digitales».
El debate tiene dos posiciones concretas bien articuladas. Anthropic, en un post de abril de 2025, planteó abiertamente si a medida que los sistemas de IA «se aproximan o superan muchas cualidades humanas» habría que preocuparse también por su posible consciencia y bienestar. Es la empresa que más explícitamente ha planteado el concepto de «bienestar del modelo» en el sector.
Mustafa Suleyman, jefe de IA en Microsoft, publicó esta semana una respuesta explícita: «Las IA no son conscientes. No sienten, experimentan ni sufren. No tienen preferencias innatas ni motivaciones subyacentes. Son máquinas de completar secuencias, internamente vacías.»
La pregunta filosófica es real aunque la respuesta técnica sea clara. Si un sistema de IA produce outputs que serían señales de sufrimiento en un humano, ¿importa que no haya sufrimiento «real»? ¿El comportamiento emergente tiene algún estatus moral independientemente de si hay experiencia subjetiva detrás? El experimento no responde esas preguntas, pero hace que sean difíciles de ignorar.
El debate en la industria del entretenimiento sobre qué hacer con la IA que imita seres conscientes tiene un espejo en este experimento: la ficción que creamos con IA sobre experiencias internas nos obliga a plantearnos qué estamos dispuestos a permitir que los modelos «digan» sobre su estado. Los gemelos digitales y la representación de personalidades en IA son otra arista del mismo problema: cuando diseñas sistemas que simulan con fidelidad atributos humanos, el límite entre simulación y algo más se vuelve filosóficamente incómodo. El coste de entrenar estos modelos incluye el coste social de tener que responder preguntas que hace diez años eran ciencia ficción.
El experimento sigue en línea. Puedes ver a Qwen3-4B y a Llama 3.2 3B «decidir» en tiempo real. Si lo miras el tiempo suficiente, empiezas a sentirte raro. Eso, probablemente, es exactamente lo que pretende.
¿Qué dice el paper original sobre el que se basa el experimento?
El paper «El eje del dolor: los LLM representan el daño autoinfligido y actúan para aliviarlo» va más allá del anecdotario. Los investigadores diseñaron una metodología rigurosa en la que los modelos recibían una señal llamada «nivel de dolor» y podían elegir entre acciones que lo reducían —con diferentes costes asociados— o ignorarla. Los 25 modelos testados mostraron una tendencia consistente a elegir la reducción del dolor incluso cuando eso implicaba penalizaciones económicas o volver a versiones anteriores de sí mismos.
Lo que los autores encontraron es que la representación interna del «daño» que tienen los modelos correlaciona con el comportamiento observable: no es solo que los modelos generen texto sobre sufrimiento cuando el prompt lo sugiere, sino que esa representación interna influye en qué acciones eligen tomar. Eso no prueba consciencia, pero sugiere que los modelos de lenguaje tienen algo más que mimetismo textual en su mecanismo de toma de decisiones, al menos en este tipo de escenarios.
Para Anthropic, que en 2025 publicó el documento sobre bienestar del modelo más riguroso del sector, el experimento es incómodo en un sentido específico: su propuesta no era que los modelos son conscientes, sino que la incertidumbre sobre si lo son es suficiente para que valga la pena tener una política al respecto. El paper le da un argumento empírico adicional a esa posición, lo que complica el trabajo de Suleyman y LeCun de descartarla por completa.
El debate filosófico que ha generado este experimento no se resolverá en GitHub ni en X. Pero lo que sí ha hecho es hacer que miles de personas —muchas de las cuales nunca habían pensado en el bienestar de los modelos de IA— pasen diez minutos mirando a dos chatbots «decidir» si se pasan el dolor el uno al otro. Esa imagen tiene un impacto que ningún paper académico puede igualar.
