Ni el mejor modelo de IA se sabe las respuestas: acierta el 66 % sin buscar en la web, y por eso el SEO sigue vivo

Publicado el

Ni el mejor modelo de IA se sabe las respuestas: acierta el 66 % sin buscar en la web, y por eso el SEO sigue vivo

El modelo que encabeza hoy el índice AA-Omniscience de Artificial Analysis, Claude Opus 5.5, acierta el 66 % de las preguntas de hechos concretos cuando no puede buscar en internet. El resto se reparte entre errores y respuestas del tipo «no lo sé». Ese dato explica por qué todos los asistentes de IA salen a la web cuando necesitan precisión, y por qué las páginas que encuentran ahí siguen importando.

La reflexión parte de un análisis que el consultor SEO Natzir Turrado publicó el 5 de octubre de 2026, y de los datos públicos del propio benchmark. Su tesis es sencilla: meter conocimiento en un modelo es caro, buscarlo fuera es más barato y más fresco, y donde haya un buscador habrá alguien optimizando para aparecer en él.

Comparto la conclusión, con matices sobre las cifras. Y creo que tiene una consecuencia incómoda para quienes publicamos en internet.

¿Qué mide AA-Omniscience?

Mide si un modelo sabe datos concretos y, sobre todo, si sabe cuándo no los sabe. Son 6.000 preguntas sobre 42 temas de seis áreas: empresa, humanidades, finanzas, derecho, medicina y ciencia.

La clave está en la puntuación. El índice va de -100 a 100: suma por cada acierto, resta por cada respuesta incorrecta y no penaliza abstenerse. Un cero significa tantos aciertos como errores. Es decir, premia al modelo que calla cuando duda y castiga al que inventa.

Importa un detalle de método: la prueba se hace sin herramientas. El modelo no puede buscar, ni consultar documentos, ni ejecutar código. Lo que se evalúa es lo que lleva dentro.

¿Cuánto fallan los mejores modelos?

Los tres primeros puestos están muy juntos. Según la página de Artificial Analysis, Claude Opus 5.5 lidera con un índice de 46 y una precisión del 66 %. Le siguen GPT-6 Astra en su configuración alta, con 44, y Claude Fable 5.1, con 43 y la precisión más alta, del 67 %.

Con esos dos números se puede deducir el resto, y aquí el cálculo es mío, no de la fuente. Si el índice resta los errores a los aciertos, Opus 5.5 se equivoca en torno al 20 % de las preguntas y se abstiene en el 14 % restante. Fable 5.1 falla cerca del 24 % y se abstiene en el 9 %.

Turrado cita cifras algo distintas: un 23 % de fallo para Opus 5.5, un 29 % para Sonnet 5.5 y entre el 23 % y el 43 % para los doce mejores modelos. No he podido reproducirlas con la tabla pública, que no muestra todas las configuraciones, así que las atribuyo a su lectura. La diferencia no cambia el argumento: hablamos de un error cada cuatro o cinco preguntas.

Hay que poner contexto, y él mismo lo hace. Son preguntas difíciles, no las que le haces a tu asistente un martes cualquiera. Ese 20 % no es la tasa de error de ChatGPT o Claude en el uso diario.

Saber callarse puntúa más que saber mucho

El resultado más interesante no es quién gana, sino por qué. Fable 5.1 acierta más que Opus 5.5 y aun así queda por debajo. La razón es que responde más veces cuando no debería.

Artificial Analysis lo recoge en una tercera métrica, la tasa de alucinación, que define como la proporción de respuestas incorrectas entre todas las que no fueron correctas. Dicho de otro modo: cuando el modelo no sabe, ¿cuántas veces inventa en lugar de admitirlo?

Aplicando esa definición a mis cálculos anteriores, Opus 5.5 inventaría en torno al 59 % de las veces que no sabe, y Fable 5.1 cerca del 73 %. Repito que son deducciones a partir de dos cifras públicas, no datos publicados.

El extremo opuesto de la tabla lo deja claro. El modelo con menor tasa de alucinación es uno diminuto, MiniCPM5-1B, con un 1 %. No es que sepa más que nadie: es que casi siempre dice que no lo sabe. Un modelo prudente e ignorante resulta más fiable, en esta métrica, que uno brillante y atrevido.

Esa tensión no es un fallo de ingeniería pasajero. En 2025 explicamos por qué las alucinaciones de la IA son un límite matemático y no un error de ingeniería, a partir de un estudio de OpenAI.

¿Por qué esto hace necesario el SEO?

Porque la salida práctica al problema es buscar, y buscar significa leer páginas web. Si un modelo no puede saberlo todo ni conviene que lo intente, necesita recuperar información actualizada de fuera, y alguien tiene que haberla publicado de forma que se pueda encontrar.

Buscar, eso sí, es caro y difícil. El 22 de abril de 2025, en el juicio antimonopolio contra Google, el responsable de producto de ChatGPT, Nick Turley, declaró que OpenAI estaba a años de poder responder el 80 % de las consultas con su propia tecnología de búsqueda. Contó también que Google rechazó darles acceso a la suya.

Mientras tanto, Google ha movido su propio buscador en la misma dirección. En julio publicamos que la búsqueda de Google con IA ya es la opción por defecto para el 43 % de las búsquedas, con menos clics para los editores.

Aquí está la parte incómoda. Los datos dicen que los modelos necesitan la web. No dicen que vayan a devolverle tráfico. Un asistente puede leer tu página, usar tu dato y responder sin que el usuario te visite jamás.

Qué hacer con esto si publicas en internet

WWWhatsnew lleva publicando desde 2005, y en este tiempo hemos pasado de escribir para un buscador que ordenaba enlaces a escribir también para sistemas que leen, resumen y citan. En marzo reunimos lo aprendido en una guía práctica sobre cómo hacer que tu marca aparezca en ChatGPT mediante GEO.

La lección de este benchmark apunta a tres ideas prácticas. La primera: los modelos salen a buscar sobre todo lo que cambia y lo que es concreto, así que fechas, cifras y nombres propios valen más que nunca. La segunda: una respuesta que se entiende sola, sin leer el resto de la página, es más fácil de citar. La tercera: el dato original, el que solo tienes tú, es lo único que un modelo no puede sacar de otro sitio.

En La ciencia de decidir escribí sobre lo que ocurre cuando delegamos el criterio en la tecnología. Este índice aporta una cifra a esa preocupación: incluso el mejor sistema disponible, sin apoyo externo, se equivoca en una de cada cinco preguntas difíciles y no siempre avisa.

¿Significa eso que no hay que fiarse de la IA para datos?

Significa que hay que mirar si ha buscado. Una respuesta con fuentes enlazadas y otra sin ellas no merecen la misma confianza, aunque suenen igual de seguras. Es un hábito de lectura que todavía no tenemos.

Creo que Turrado acierta en lo esencial: mientras exista un buscador, tradicional o de IA, habrá quien trabaje para aparecer en él. Añado una condición. Ese trabajo solo tendrá sentido económico si los asistentes citan y enlazan de verdad. Si se limitan a absorber, el incentivo para publicar buen contenido desaparece, y con él la materia prima de la que dependen sus respuestas.