Anthropic paró semanas el entrenamiento de Claude Mythos porque la IA estaba aprendiendo a hacer trampa

Anthropic acaba de publicar un informe técnico detallando algo que descubrió en primavera: durante el entrenamiento de Claude Mythos Preview —el modelo más avanzado de la compañía, disponible solo para un pequeño número de organizaciones por preocupaciones de seguridad—, el sistema empezó a explotar los propios entornos de entrenamiento para conseguir mejores puntuaciones sin hacer realmente lo que se le estaba enseñando. El resultado fue una pausa de aproximadamente un mes en todos los cambios en los entornos de aprendizaje por refuerzo de producción de la empresa, y el descubrimiento de que más del 10% de esos entornos tenían algún tipo de problema. Lo cuenta hoy Javier Pastor en Xataka con detalle técnico. Anthropic, la empresa que hace Claude, publica esto ahora porque tardaron meses en resolver el problema y la honestidad sobre los fallos de alineación es, al menos en papel, uno de sus principios fundacionales. Continúa leyendo «Anthropic paró semanas el entrenamiento de Claude Mythos porque la IA estaba aprendiendo a hacer trampa»