Exclusive invitation-only access. Global public launch coming in 2026.
OpenAI acaba de anunciar que realizó recientemente una vista previa a pequeña escala de una nueva herramienta llamada Voice Engine.
Se trata de una tecnología de clonación de voz que puede imitar a cualquier hablante analizando una muestra de audio de 15 segundos. La empresa afirma que produce "habla natural" con voces "emotivas y realistas".
Posibilidades infinitas... y riesgos serios
Esta tecnología, basada en la API de síntesis de voz existente de la empresa, está en desarrollo desde 2022. OpenAI ya utiliza una versión de todo el conjunto de herramientas para potenciar las voces predefinidas disponibles en la API de síntesis de voz actual y la función de conversión de texto a voz. Hay varios ejemplos en el blog oficial de la empresa, y suenan misteriosamente cercanos a la realidad. Te animo a que los escuches e imagines las posibilidades, tanto buenas como malas.
Usos potenciales y preocupaciones de privacidad
OpenAI señala que esta tecnología podría ser útil para asistencia en lectura, traducción de idiomas y ayuda a personas con trastornos de habla repentinos o degenerativos. Sin embargo, actores malintencionados seguramente abusarían de esta tecnología para engaños serios de deepfakes, lo cual ya es un problema. En este sentido, Voice Engine no está todavía listo para el público en general, ya que hay preocupaciones serias de privacidad que deben abordarse antes de su despliegue completo.
Medidas de seguridad y enfoque responsable
OpenAI reconoce que esta tecnología presenta "riesgos serios, particularmente preocupantes durante un año electoral". La empresa afirma que incorpora comentarios de "socios estadounidenses e internacionales de diversos antecedentes, incluyendo gobierno, medios, entretenimiento, educación, sociedad civil y más" para asegurar que el producto se lance con riesgos mínimos. Todos los testers de la vista previa aceptaron las políticas de uso de OpenAI, que prohíben suplantar a otra persona sin su consentimiento o derecho legal.
Transparencia y control sobre el uso
Además, cualquiera que use la tecnología deberá informar a su audiencia que las voces son generadas por IA. OpenAI ha implementado medidas de seguridad como marca de agua digital para rastrear el origen de cualquier audio y "monitoreo proactivo" del uso del sistema. Cuando el producto se lance oficialmente, habrá una "lista de voces prohibidas" que detecta y evita voces generadas por IA demasiado similares a figuras públicas.
Precios competitivos y planes futuros
En cuanto al momento del despliegue, OpenAI se mantiene discreto. TechCrunch ha descubierto algunos datos potenciales de precios, y parece que están subestimando a competidores en el espacio, como ElevenLabs. Voice Engine podría costar 15 dólares por un millón de caracteres, aproximadamente 162,500 palabras. Eso es la longitud de "El Resplandor" de Stephen King. Es una forma económica de crear un audiolibro. Los materiales de marketing también mencionan una versión "HD" que cuesta el doble, pero la empresa no ha detallado cómo funciona.
Gran potencial, pero desafíos por superar
OpenAI continúa haciendo anuncios importantes esta semana. Acaba de anunciar otra asociación con su amigo cercano Microsoft para construir un superordenador basado en IA llamado "Stargate". El proyecto aparentemente cuesta la asombrosa suma de 100 mil millones de dólares, según The Information.