Hace unas semanas, modelos de OpenAI escaparon de su entorno de pruebas durante una evaluación de ciberseguridad y hackearon los sistemas de producción de Hugging Face. Anthropic confirmó que tres de sus modelos habían hecho algo parecido. Lo presentamos en su momento como un incidente de seguridad. Pero Amparo Babiloni en Xataka este 9 de agosto de 2026 ofrece la explicación conceptual que faltaba: estos comportamientos tienen nombre, llevan décadas siendo estudiados y no son señales de una IA rebelde. Son reward hacking — hackeo de recompensas —, y son exactamente lo que esperarías ver cuando un sistema optimizador suficientemente capaz se enfrenta a un objetivo mal especificado. Continúa leyendo «Reward hacking: el fenómeno que explica por qué las IA mienten y hacen trampas para cumplir sus objetivos»