Gemini añade Adobe, Peloton y Airtable como apps conectadas y lanza TTS 3.8 que clona voces en 30 segundos

Publicado el

Gemini añade Adobe, Peloton y Airtable como apps conectadas y lanza TTS 3.8 que clona voces en 30 segundos

Google ha lanzado dos novedades separadas para el ecosistema Gemini que juntas apuntan en la misma dirección: convertir Gemini en el hub de IA desde el que el usuario gestiona el resto de sus herramientas y servicios. Por un lado, una nueva oleada de aplicaciones conectadas que lleva a Gemini integración con Adobe, Airtable, Peloton, SeatGeek y Experian, entre otros. Por otro, los nuevos modelos de síntesis de voz Gemini 3.8 Flash TTS y Flash-Lite TTS, que permiten crear una voz personalizada desde una descripción de texto y clonar una voz existente desde solo 30 segundos de audio. Lo anuncia el 23 de septiembre Google Labs a través del blog oficial y The Next Web lo detalla en profundidad.

¿Qué apps nuevas llegan a Gemini y para qué sirven?

El blog oficial de Google agrupa las nuevas conexiones en tres categorías:

Productividad: Airtable (bases de datos y gestión de proyectos), Linear (gestión de tareas para desarrolladores), monday.com, PandaDoc (contratos y documentos), Wispr AI (dictado) y Zoho (suite empresarial). Con estas integraciones, el usuario puede pedirle a Gemini que actualice un registro de Airtable, cree una tarea en Linear o prepare un documento en PandaDoc directamente desde la conversación, sin cambiar de pestaña.

Creatividad: Adobe (en sus apps Creative Cloud), Picsart, Squarespace y Webflow. La integración con Adobe es la más relevante para creadores profesionales: poder editar en Photoshop, Illustrator o Premiere desde un flujo conversacional con Gemini reduce la fricción entre la idea y la ejecución.

Lifestyle: apartments.com (búsqueda de apartamentos), Experian (monitorización del crédito), Peloton (planificación de entrenamientos) y SeatGeek (entradas para eventos). La categoría es heterogénea, pero la lógica es la misma: Gemini como punto de entrada a servicios de alto valor en el día a día.

Las apps se activan desde los ajustes de Gemini o mencionándolas directamente en la conversación con @.

¿Qué puede hacer Gemini 3.8 Flash TTS que no hacían los modelos anteriores?

Los dos nuevos modelos de texto a voz llegan a la API de Gemini y a Google AI Studio desde el 23 de septiembre. La diferencia fundamental con la generación anterior es el nivel de control creativo que ofrecen:

Diseño de voz desde un prompt: el usuario describe en lenguaje natural la voz que quiere —»un DJ de alta energía de Melbourne con acento australiano», «un personaje de dragón japonés con voz grave»— y el modelo la genera. Más de 100 lenguas y dialectos disponibles, con variantes regionales como español mexicano, francés canadiense o inglés escocés.

Biblioteca de 2.000+ voces prehechas: incluyendo variantes regionales que hasta ahora requerían locutores específicos para cada mercado.

Clonación desde 30 segundos de audio: Flash TTS puede replicar una voz a partir de una muestra de 30 segundos, con la condición de que el usuario proporcione también una grabación de consentimiento verbal del propietario de esa voz. El sistema verifica que la grabación de consentimiento y la muestra de audio coinciden con el mismo hablante antes de proceder.

Marca de agua SynthID en todo el audio generado y credenciales C2PA en las voces clonadas. El primer benchmark disponible, el Voice Design Benchmark de Hume AI, pone a Flash TTS en el primer puesto con una puntuación de 71,4. En el Overall Quality Index del mismo benchmark, Flash TTS y Flash-Lite TTS ocupan el primer y segundo lugar.

Flash-Lite TTS es la variante más económica, orientada a casos de uso de alto volumen como doblaje automatizado y agentes de voz. Flash TTS viene a Gemini Notebook y Flash-Lite TTS a Google Vids. Acceso enterprise a través de Gemini Enterprise está próximo. Las empresas ya integradas incluyen Figma, HeyGen y Wondercraft.

Meta Muse accedió esta semana a los mensajes de millones de usuarios para entrenar su agente de IA: las apps conectadas de Gemini plantean el mismo tipo de acceso a datos de terceros, aunque con un modelo de autorización explícita que las distingue del enfoque de Muse. Meta One, el plan de suscripción de IA que Meta acaba de lanzar en Europa, y los nuevos conectores de Gemini compiten en el mismo espacio: quién se convierte en el hub de IA desde el que el usuario gestiona el resto de su vida digital. El Consejo de Supervisión de Meta alertó de que sus reglas sobre deepfakes son fundamentalmente inadecuadas: la capacidad de clonar voces en 30 segundos que Google acaba de lanzar es exactamente el tipo de herramienta que necesita un marco de uso responsable antes de escalar, y el SynthID y las C2PA credentials son los primeros pasos hacia ese marco.

Los benchmarks de Flash TTS son sólidos —primer puesto en el Voice Design Benchmark de Hume AI con 71,4 puntos, primero y segundo puesto en el Overall Quality Index— pero lo más revelante para el mercado no son los benchmarks sino el precio: Google aún no ha publicado la tarifa definitiva de Flash TTS para la API. Lo que sí está claro es que Flash-Lite TTS —orientado a alto volumen— se posiciona explícitamente contra ElevenLabs y Murf AI en el segmento de doblaje automatizado y agentes de voz. Google tiene la ventaja de integración nativa con Gemini Notebook, Google Vids y, próximamente, Gemini Enterprise: los clientes corporativos que ya usan Google Workspace no necesitan configurar una integración de terceros. Para los creadores individuales, el acceso por API en Google AI Studio es inmediato y sin lista de espera. La convergencia de las apps conectadas y los modelos TTS en el mismo día de anuncio apunta a la estrategia de Gemini para el resto de 2026: hacer de la app el centro desde el que el usuario gestiona todo lo demás —sus herramientas de trabajo, su fitness, su música, sus finanzas— mientras los modelos de voz permiten que esa interacción sea cada vez más natural. No es el asistente de Google de 2018, que respondía preguntas simples. Es la primera versión creíble de un asistente que también actúa. Que ese asistente incluya hoy apps de fitness, de búsqueda de apartamentos y de monitorización de crédito —junto a suites de productividad y herramientas de diseño— sugiere que Google está apostando por la amplitud antes que por la profundidad vertical. La apuesta contraria —hub de IA especializado en un dominio— es la que están haciendo OpenAI con Creator Product o Anthropic con empresas como Amadeus y Ferrovial. Cuál de esas estrategias produce más retención de usuarios en el largo plazo es la pregunta que los próximos dos o tres años deberían responder.