Cómo usar el modo de voz de ChatGPT (GPT-Live): la guía completa para que la conversación con la IA deje de sonar rara

Publicado el

Cómo usar el modo de voz de ChatGPT (GPT-Live): la guía completa para que la conversación con la IA deje de sonar rara

Si alguna vez has intentado hablar con ChatGPT por voz y te has sentido torpe esperando turnos, hablando demasiado despacio o recibiendo interrupciones en mitad de una frase, el nuevo GPT-Live cambia la situación de raíz. Lo cuenta Adnan Ahmed en Engadget el 9 de agosto de 2026, tras semanas probándolo a fondo. La diferencia no está en la inteligencia del modelo, sino en cómo se estructura la conversación: el sistema ahora escucha y habla al mismo tiempo, igual que haría una persona.

Este tutorial te explica cómo activarlo, qué opciones tienes según tu plan y cuándo merece la pena cambiarte al nivel de inteligencia más alto.

¿Qué es GPT-Live y en qué se diferencia de los modos de voz anteriores?

El original ChatGPT Voice de 2023 usaba tres sistemas separados: conversión de voz a texto, generación de respuesta y síntesis de voz de vuelta. Cada paso añadía latencia y creaba una experiencia de turno rígida, como hablar por radio («adelante»).

El Advanced Voice Mode que vino después ya usaba un modelo multimodal unificado, pero el audio tenía limitaciones de naturalidad.

GPT-Live resuelve ambos problemas con una arquitectura full-duplex: el modelo escucha y habla simultáneamente, igual que ocurre en una conversación entre personas. Ya analizamos el lanzamiento de GPT-Live el 8 de julio con sus capacidades full-duplex cuando llegó a móvil; ahora se trata de sacarle partido en la práctica. El resultado es que puedes interrumpir, cambiar de tema o pedirle que vaya más despacio sin romper el flujo. El modelo también hace reconocimientos breves — «mhmm», «yeah» — mientras hablas, un detalle que Ahmed describe como el momento en que dejó de sentir que hablaba con una máquina.

Un cambio concreto que marca la diferencia: GPT-Live puede delegar tareas complejas a GPT-5.5 en segundo plano mientras mantiene la conversación activa. Preguntas que requieren razonamiento profundo o búsqueda web no interrumpen el hilo porque el sistema despacha el trabajo a otro modelo sin que lo notes.

Cómo activar GPT-Live: paso a paso

El acceso es inmediato en la aplicación de ChatGPT para iOS y Android, y también en cualquier navegador web. GPT-Live sustituye al Advanced Voice Mode anterior como opción por defecto.

Para entrar en modo voz, toca el icono de forma de onda de audio a la derecha del cuadro de texto. Si es la primera vez, el sistema te pedirá acceso al micrófono. A partir de ahí, un orbe flotante en pantalla te indica que el sistema está activo y escuchando.

Según tu plan, el modelo que usas varía:

PlanModelo
Pro, Plus, GoGPT-Live-1
GratuitoGPT-Live-1 mini

La versión mini no permite cambiar el nivel de inteligencia — eso queda reservado para planes de pago. GPT-Live permanece activo aunque bloquees el dispositivo o cambies de aplicación, lo que lo hace útil para tareas manos libres.

Cómo sacarle partido según la tarea

La opción Instant (nivel de inteligencia por defecto) responde con prioridad en velocidad. Funciona bien para preguntas del día a día, traducciones en directo o conversaciones informales. En nuestra experiencia, la latencia en modo Instant es prácticamente imperceptible en conexiones de 4G estándar.

Para temas técnicos, debates filosóficos o análisis que requieren contexto amplio, el cambio a Medium o High añade entre uno y dos segundos de tiempo de pensamiento. Ahmed confirma que ese margen no rompe la naturalidad de la conversación, simplemente crea una pausa similar a la que haría una persona buscando la respuesta correcta.

Algo que merece mención: si ChatGPT detecta que tu pregunta se beneficiaría de un componente visual — un gráfico, un esquema, una tabla —, crea un widget interactivo que aparece junto a la respuesta hablada. No necesitas pedírselo; el sistema decide cuándo añade este complemento.

Lo que GPT-Live no hace todavía: compartir pantalla o activar la cámara en vivo. Si necesitas que el modelo «vea» lo que tienes delante, tendrás que pasar por el chat habitual con captura de pantalla o adjunto de imagen.

Personalizar la voz y el comportamiento

Desde Ajustes → Voz puedes:

  • Elegir entre los nueve tonos de voz disponibles (todos remasterizados para GPT-Live, con nombres iguales pero calidad distinta que la versión anterior)
  • Cambiar el idioma de la conversación por voz
  • Establecer GPT-Live como modo de inicio al abrir la app

Si quieres volver al modelo de voz antiguo por cualquier motivo — por ejemplo, si tienes una conexión inestable donde el full-duplex puede ser problemático —, la opción sigue disponible en ese mismo menú. La integración del modo de voz directamente en la ventana de chat fue un paso previo que facilitó esta arquitectura actual.

Cuándo usar GPT-Live y cuándo no

GPT-Live brilla en tres escenarios: traducciones en tiempo real (especialmente útil en reuniones o viajes), consultas manos libres (conduciendo, cocinando) y conversaciones exploratorias donde el ritmo importa más que la precisión textual. En todos ellos, el audio full-duplex reduce la fricción de forma notable.

Donde tiene limitaciones: tareas que requieren output estructurado largo, como escribir un informe o analizar un documento. En esos casos, el chat de texto sigue siendo más eficiente. Y como señala Ahmed, las mejoras históricas del modo de voz han ido especialmente dirigidas a reducir las interrupciones y mejorar la naturalidad, que era el principal punto de fricción. GPT-Live lleva ese trabajo al resultado más concreto hasta la fecha.

Un factor de privacidad que vale la pena recordar: GPT-Live puede seguir activo en segundo plano cuando cambias de app. Si trabajas en entornos con información sensible, conviene cerrar la sesión de voz antes de abrir otras aplicaciones.

Mi valoración

Lo que más me convence del modo GPT-Live es que el cambio de comportamiento no requiere adaptación: en menos de dos minutos de conversación, el cerebro deja de estar pendiente del protocolo y se centra en el contenido. Eso es exactamente lo que define una interfaz que funciona.

Lo que más me preocupa es el efecto de selección de casos de uso. GPT-Live es tan fluido que es tentador usarlo para tareas donde el texto sería más eficiente — y la velocidad de respuesta, más rápida. El riesgo no es técnico, sino de uso: un asistente de voz que parece humano puede crear una percepción de fiabilidad que la calidad real del modelo no siempre justifica. Las alucinaciones siguen existiendo; el full-duplex solo las hace más conversacionales.

Lo más estructuralmente significativo es que GPT-Live crea las condiciones para el hardware de altavoz sin pantalla que OpenAI tiene en desarrollo. Un modo de voz que suena natural y maneja interrupciones bien no es solo una mejora de la app; es la infraestructura de producto necesaria para competir con Amazon Echo y Apple HomePod en el salón.

La pregunta a 12 meses no es si GPT-Live es mejor que el modo anterior — lo es, sin discusión —, sino si la arquitectura full-duplex se convierte en el estándar de facto que obliga a Google y Apple a responder en sus propios asistentes domésticos.

Preguntas frecuentes

¿GPT-Live funciona en español?

Sí. El sistema detecta el idioma automáticamente en la mayoría de los casos, aunque puedes forzarlo desde Ajustes → Voz → Idioma. La calidad en español es equivalente a la del inglés en los modelos más recientes.

¿Necesito plan de pago para usar GPT-Live?

No. Los usuarios del plan gratuito tienen acceso al modelo GPT-Live-1 mini. La diferencia práctica es que no puedes cambiar el nivel de inteligencia (solo tienes Instant) y las capacidades de razonamiento son algo más limitadas en preguntas complejas.

¿GPT-Live graba la conversación?

OpenAI aplica las mismas políticas de privacidad que al chat de texto: las conversaciones pueden usarse para mejorar los modelos salvo que desactives esa opción en Ajustes → Control de datos. No existe una grabación diferenciada para el modo de voz.