OpenAI cambia la voz de ChatGPT: así funciona GPT Live, su nuevo modelo
OpenAI presentó GPT Live, su nueva generación de modelos de voz para ChatGPT, con conversaciones más fluidas, traducción en vivo.
OpenAI presentó GPT Live, su nueva generación de modelos de voz para ChatGPT, con conversaciones más fluidas, traducción en vivo.
OpenAI presentó GPT Live, una nueva generación de tecnología de voz para ChatGPT que busca hacer más natural la interacción con el asistente. La principal diferencia frente al funcionamiento tradicional está en que el sistema puede recibir audio y generar una respuesta al mismo tiempo, sin depender por completo de que el usuario termine de hablar para comenzar a procesar la conversación.
La actualización empezó a desplegarse en las aplicaciones de ChatGPT para celulares y en la versión web. La llegada será progresiva, por lo que el acceso puede no aparecer de inmediato para todos los usuarios.
Hasta ahora, una conversación por voz con inteligencia artificial seguía una dinámica bastante marcada: una persona hablaba, el sistema procesaba el audio y posteriormente respondía. GPT Live busca romper con esa secuencia mediante una arquitectura denominada full duplex, que permite mantener ambos procesos activos de manera simultánea.
Esto hace posible que la herramienta reaccione ante pausas, permita que el usuario la interrumpa y utilice pequeñas expresiones para mostrar que continúa siguiendo el diálogo. La intención es que el intercambio tenga un ritmo más cercano al de una conversación cotidiana.
El modelo puede pensar en segundo plano mientras mantiene la conversación
Una de las novedades más relevantes está relacionada con la forma en que GPT Live maneja las preguntas que requieren mayor capacidad de procesamiento. Si una consulta necesita razonamiento avanzado, una búsqueda en internet u otra tarea compleja, el sistema puede recurrir a GPT 5.5 para realizar ese trabajo mientras continúa interactuando con la persona.
De esta manera, la conversación no tiene que detenerse mientras se procesa una solicitud más exigente. Una vez obtenido el resultado, la información puede incorporarse al diálogo.
La nueva arquitectura también amplía las posibilidades de traducción. GPT Live puede utilizarse para traducir conversaciones prácticamente en tiempo real, de modo que una persona pueda hablar en un idioma mientras recibe la interpretación en otro.
Pero OpenAI no se limitó a mejorar el componente sonoro. El sistema también puede mostrar información en pantalla cuando considera que una respuesta visual resulta más útil que una explicación hablada. El clima, resultados deportivos y otros datos pueden aparecer mediante tarjetas u otros elementos gráficos.
La compañía presentó dos versiones de esta tecnología, GPT Live 1 y GPT Live 1 mini. La primera será la opción principal para quienes utilizan los planes Go, Plus y Pro, mientras que la versión mini estará disponible para las conversaciones de los usuarios gratuitos. También está previsto que los nuevos modelos lleguen posteriormente a la API destinada a desarrolladores y clientes empresariales.
Según OpenAI, las funciones de voz de ChatGPT son utilizadas semanalmente por más de 150 millones de personas para actividades que van desde practicar idiomas hasta resolver preguntas, escuchar historias o conversar mientras realizan otras tareas.
Seguridad y límites de la nueva voz de ChatGPT
El avance hacia una interacción más parecida a la humana también plantea retos. Por ello, OpenAI aseguró que GPT Live incorpora protecciones específicas para conversaciones de voz y mejoras para responder ante situaciones relacionadas con autolesiones, violencia, abuso, contenido sexual y otros escenarios de riesgo.
Las voces disponibles son predefinidas y cuentan con mecanismos destinados a evitar la imitación de voces reales. Además, la compañía señaló que el modo de voz queda excluido automáticamente del entrenamiento de sus modelos de inteligencia artificial y que los clips de audio se almacenan durante 30 días para conservar el contexto de conversaciones anteriores.