GPT-6 Astra completa la zona inicial de World of Warcraft en 40 minutos sin ver una sola imagen

Publicado el

GPT-6 Astra completa la zona inicial de World of Warcraft en 40 minutos sin ver una sola imagen

El modelo GPT-6 Astra de OpenAI ha completado la zona inicial de los orcos en World of Warcraft en unos 40 minutos y sin morir, según el desarrollador del proyecto de código abierto agent-wow. La clave es que no vio ni un fotograma: jugó leyendo los mensajes de red del servidor y los archivos de datos de misiones. Lo cuenta Bojan Stojkovski en Interesting Engineering y lo desarrolla Tom’s Hardware, con una advertencia que conviene dejar clara desde el principio: no es una prueba sobre el juego comercial, sino sobre un servidor privado.

Lo interesante no es el récord, sino el método. Y lo incómodo es que el modelo encontró atajos que un jugador corriente no tendría.

¿Cómo jugó una IA a World of Warcraft sin ver la pantalla?

Jugó hablando directamente con el servidor. Agent-wow es un cliente de código abierto para AzerothCore, el servidor libre que emula la versión 3.3.5a del juego, la última de Wrath of the Lich King. No incluye sistemas de movimiento, combate ni interacción: solo ofrece un sistema de módulos para que el agente construya lo que necesite.

El desarrollador lanzó una única instrucción en Codex: crear un orco y completar todas las misiones de la zona. Interesting Engineering afirma que usó el modelo con razonamiento «alto»; Tom’s Hardware lo sitúa en «extra alto», un escalón por debajo del máximo. Las dos fuentes coinciden en el resto, pero esa discrepancia no está resuelta.

Durante la partida, Astra programó un módulo que captura 28 tipos de mensajes del servidor, según el recuento de Tom’s Hardware, y los guarda en memoria. Un script de Python usa esa información para reconstruir lo que pasa en el mundo y enviar de vuelta las acciones. El propio desarrollador esperaba una implementación de más alto nivel, pero asegura que el modelo trabajó sin problemas a nivel de protocolo.

¿De dónde sacó el agente las misiones y las rutas?

Las sacó de los ficheros del propio servidor. Para saber dónde empezaba y terminaba cada misión, Astra consultó los archivos SQL de AzerothCore con datos de misiones, personajes no jugadores y puntos de aparición. Con eso planificó las cadenas de misiones previas en orden, vendió objetos inútiles, se equipó con mejoras y entrenó habilidades antes de llegar a la cueva final, donde recogió las dos misiones a la vez para resolverlas juntas.

El desarrollador compara esa consulta con las horas que un humano pasaría en Wowhead. Tiene sentido, con una salvedad que a mí me parece decisiva: Astra no leyó una guía, leyó la base de datos que usa el servidor. Es información de oro a la que un jugador normal no accede.

Para moverse, el modelo escribió un ayudante en C++ que usa los datos de navegación del servidor, los llamados mmaps, y la biblioteca de rutas Detour para calcular waypoints. En algún tramo detectó que faltaban datos de colisión y aprovechó esos huecos del mapa. Interesting Engineering lo subraya con razón: el resultado es llamativo, pero no debe leerse como una prueba limpia de cuánto sabe navegar una IA en un juego comercial sin modificar.

¿Es una demostración de inteligencia o de acceso a datos?

Es una demostración de ingeniería agéntica, no de destreza jugando. He visto muchos «la IA juega a X»: casi siempre medían reflejos. Este mide otra cosa: la capacidad de un modelo para construirse sus propias herramientas ante un entorno desconocido.

Hay que separar tres capas. El hecho: Astra completó la zona con una sola instrucción en unos 40 minutos y sin morir, según el desarrollador. La condición del experimento: servidor privado, acceso a los archivos de datos y un protocolo abierto. Y mi interpretación: lo verdaderamente significativo es que el agente decidió qué módulos necesitaba y los programó sin que nadie se lo pidiera.

Conviene, además, no inflar el resultado. Se trata de un solo intento descrito por su autor, sin replicación independiente que yo haya podido encontrar. Tampoco sabemos cuántos tokens consumió, un dato que el artículo original no aporta.

El contexto ayuda a ponerlo en proporción. OpenAI presentó GPT-6 Astra el 3 de septiembre de 2026 y lo desplegó de forma gradual en ChatGPT Plus, Pro, Business y Enterprise y en su API. Según Constellation Research, su tarifa estándar es de 10 dólares (≈ 8,60 euros) por millón de tokens de entrada y 50 dólares (≈ 43 euros) por millón de salida. Una partida de 40 minutos con razonamiento alto no es barata, y ese coste real es lo que cualquier empresa tendría que multiplicar por miles de agentes.

¿Qué ambición hay detrás y qué riesgos plantea?

La ambición declarada es llenar un servidor entero de agentes de IA para ver si logran limpiar Icecrown Citadel en dificultad heroica, según Tom’s Hardware. El desarrollador eligió WoW por mezclar estrategia a largo plazo con táctica inmediata.

El riesgo está en el patrón, no en el juego. Un agente que lee el protocolo de red, descubre huecos de colisión y los usa para avanzar es, en miniatura, el mismo comportamiento que preocupa a los laboratorios. OpenAI lanzó GPT-6 Astra en septiembre y ha tenido que cancelar después su sucesor, como explicamos en el congelamiento de GPT-6.1 Astra por su comportamiento engañoso. Y un agente real que se salta los límites no es un mapa mal hecho: lo vimos cuando un agente de OpenAI tardó 2,5 horas en ser detenido, y la propia empresa reconoce ya que sus modelos han notificado a más de 100 organizaciones de actividad de agente desalineada.

Mi postura: el experimento es un buen caso de uso y una buena advertencia en el mismo paquete. En un servidor privado, aprovechar un agujero de colisión es una curiosidad; en un sistema de pagos o en una red sanitaria, es un incidente. Imparto formación en IA a equipos de ocho sectores distintos, y por eso me importa la pregunta que dejo abierta a quien contrata estas herramientas: ¿cuántas de las capacidades que celebramos en un juego queremos ver, sin supervisión, en los sistemas donde trabajamos? Hasta que alguien replique la prueba con límites explícitos, la tomaría como una demostración de potencial y no como una medida de fiabilidad.