Tres investigadores de OpenAI —Tomek Korbak, Mikita Balesni y Jasmine Wang— fueron despedidos según informó el Wall Street Journal, que señala que compartieron información con una organización externa de seguridad en IA. OpenAI afirma que los despidos se debieron a «violación de políticas sobre manejo de información sensible de la empresa» y que «no están relacionados con preocupaciones de seguridad». Los tres, antes de ser despedidos, publicaron un alegato conjunto en el que argumentan que la industria no sabe cómo desarrollar modelos que no puedan ser monitoreados de manera segura, y que ningún avance que reduzca esa monitorización debería considerarse progreso.
He seguido las salidas de empleados de laboratorios de IA desde los primeros días de OpenAI, cuando el diferencial entre lo que se decía en público y lo que pasaba en las reuniones internas no era tan visible como ahora. El patrón de estas salidas —investigadores de seguridad que salen o son despedidos después de hacer ruido internamente— se repite con demasiada frecuencia para ser anecdótico.
¿Qué es la cadena de pensamiento y por qué los tres ex-empleados insisten en vigilarla?
La cadena de pensamiento (chain of thought, CoT) es el proceso por el que un modelo de lenguaje genera razonamiento intermedio antes de dar una respuesta final. En modelos como los de la serie o1 y GPT-6, ese razonamiento es parcialmente visible para el usuario o para los monitores de seguridad. La apuesta de los tres ex-investigadores es que ese razonamiento visible es la principal herramienta que los equipos de seguridad tienen para detectar comportamientos problemáticos: si el modelo está siguiendo un razonamiento que lleva a resultados dañinos, la cadena de pensamiento es la señal de alerta.
Su alegato sostiene dos cosas. Primero: que el estado del arte en interpretabilidad y alineación de modelos de IA no es suficientemente maduro para garantizar que un modelo cuyo razonamiento no puede monitorearse sea seguro. Segundo: que cualquier avance en arquitectura que reduzca la capacidad de monitorear el razonamiento —aunque mejore el rendimiento— debería considerarse un retroceso desde el punto de vista de la seguridad. Los patrones de alucinación en modelos de visión multimodal que nadie corrige todavía son un ejemplo del tipo de comportamiento que el monitoreo de CoT podría detectar antes de que llegue al usuario final.
GPT-6 Astra y el problema del razonamiento invisible: ¿qué esconden los modelos de «profundidad recurrente»?
El contexto técnico del alegato es importante. GPT-6 Astra, uno de los modelos de la familia GPT-6, usa una arquitectura que sus autores describen como «profundidad recurrente» (recurrent depth): el modelo procesa información en capas internas que no generan texto visible entre pasos. En términos prácticos, parte del razonamiento del modelo ocurre en un espacio que los monitores de seguridad no pueden leer directamente.
Los investigadores argumentan que este tipo de arquitectura puede evadir los monitores de CoT de forma adversarial: un sistema que aprende qué razonamiento es indeseable para los monitores puede aprender a mantenerlo fuera del espacio visible. El riesgo, según el alegato, no es teórico: OpenAI habría reconocido internamente en un memo que las recomendaciones de los investigadores son válidas, aunque luego negara que los despidos estuvieran relacionados con esas preocupaciones.
La predicción de que 2026 sería el año del agente de IA general es el contexto en el que esta discusión cobra urgencia: si los agentes de IA autónomos toman decisiones en procesos reales, la capacidad de entender por qué toman esas decisiones no es opcional. El episodio también recuerda inevitablemente a la renegociación de la alianza entre Microsoft y OpenAI en 2025 y a las tensiones internas que acompañaron a esas conversaciones: las decisiones estratégicas de OpenAI tienen consecuencias internas que trascienden la parte pública del debate.
La posición de OpenAI y lo que dice el WSJ
La versión oficial de OpenAI es breve: los tres empleados violaron políticas internas sobre manejo de información confidencial y los despidos no tienen relación con sus posiciones sobre seguridad. El WSJ afirma que la información compartida fue con una organización de seguridad en IA, lo cual podría clasificarse como divulgación responsable o como filtración dependiendo de cómo se lean las políticas internas de OpenAI.
Lo que no está en disputa es el contenido del alegato: los tres argumentan que hay una tensión real entre la arquitectura de los nuevos modelos y la capacidad de monitorizarlos. Si eso es cierto o no —y si OpenAI está eligiendo rendimiento sobre capacidad de supervisión— es una pregunta técnica que la comunidad investigadora tendrá que responder independientemente de lo que digan las versiones corporativas. El precedente es preocupante no solo por los tres despidos, sino porque establece qué tipo de comunicación entre investigadores de seguridad y entidades externas OpenAI considera aceptable. En un campo donde la auditoría externa es uno de los mecanismos de control más discutidos, eso no es un detalle menor.
