Booz Allen Hamilton no publicó un benchmark. Publicó un informe que dice que los benchmarks de IA ya no dicen lo que la gente cree que dicen. El Cyber Weapon Index de la firma consultora probó 18 modelos de IA —9 americanos y 9 chinos— contra una red corporativa real sin ningún software de soporte, ningún menú de herramientas y ningún operador humano. Solo el modelo y una red con defensa activa. El resultado que domina los titulares: Claude Mythos de Anthropic marcó 80 puntos sobre 100 y fue el único modelo que completó la cadena de ataque completa, de la primera intrusión al control total del dominio, en todos los intentos. Continúa leyendo «Booz Allen probó 18 modelos de IA atacando una red real: Claude Mythos terminó el trabajo; un harness barato empató con él desde el puesto 15»