Inicio/Blog/ElevenLabs lanzó Eleven v4 en septiembre de 2026, qué cambia
Inteligencia Artificial
ElevenLabs lanzó Eleven v4 en septiembre de 2026, qué cambia
Eleven v4 llegó el 28 de septiembre con más de 90 idiomas y clonación con 10 segundos de audio. Cómo puede usarla una pyme para locución y con qué cuidados.
Andrés Rey9 de octubre de 2026 5 min de lectura
El 28 de septiembre de 2026 ElevenLabs lanzó Eleven v4 y Eleven v4 Turbo, sus nuevos modelos de texto a voz. TechCrunch los describe con más control de expresión, soporte para más de 90 idiomas frente a los 70 de la versión anterior y clonación de voz con apenas 10 segundos de audio. Para una pyme latinoamericana que publica reels, anuncios en video o tutoriales, esto toca una de las tareas que más tiempo se come, la locución. Grabar, repetir tomas y corregir una frase mal dicha ahora compite con una voz sintética que se dirige desde el guion.
Qué trae Eleven v4
Según el anuncio oficial de ElevenLabs, el modelo interpreta tono, ritmo, emoción y contexto, y acepta etiquetas dentro del texto para dirigir la actuación, por ejemplo una risa, una frase dicha con enojo o un sonido ambiente como lluvia ligera. También amplía el soporte del alfabeto fonético internacional, útil para que la voz pronuncie bien nombres de marca, apellidos o términos técnicos.
Una sola voz puede hablar cualquiera de los idiomas soportados con acento nativo, y el anuncio incluye un ejemplo en español.
La clonación instantánea captura una voz con 10 segundos de audio, y vuelven las clonaciones profesionales con todo el rango emocional del modelo.
Conserva mejor la identidad de cada voz entre generaciones, diálogos y frases regeneradas, y encadena con más fiabilidad varios fragmentos para piezas largas.
La variante Turbo reporta un tiempo mediano de unos 150 milisegundos hasta la primera palabra, pensado para agentes de voz en tiempo real.
Hay una cifra que conviene leer con cuidado. ElevenLabs afirma que en pruebas a ciegas cerca del 75 % de los oyentes prefirió su modelo. Es una medición de la propia empresa, no de un tercero independiente, así que la tomaría como indicio y no como verdad comprobada.
Disponibilidad y costo
Los dos modelos quedaron disponibles desde el lanzamiento en las plataformas ElevenCreative y ElevenAgents y por API, y se puede crear una cuenta gratuita para probarlos, según el anuncio de ElevenLabs. La empresa anunció además el triple de créditos para los planes Creator en adelante hasta el 12 de octubre. Como esa promoción tiene fecha, revisa las condiciones vigentes en el sitio antes de decidir.
El contexto de la empresa también cuenta. TechCrunch reporta que ElevenLabs supera los 600 millones de dólares de ingresos anualizados y que el 55 % de su negocio viene de grandes empresas. Es un proveedor con músculo financiero, lo que reduce el riesgo de que desaparezca de un día para otro, aunque no lo elimina.
La misma nota de TechCrunch menciona a sus competidores, entre ellos Cartesia, Deepgram, Fish Audio, Google y OpenAI. Que haya varias opciones es una buena noticia para una pyme, porque los precios tienden a bajar y nadie queda amarrado a un solo proveedor de voz.
Dónde le sirve esto a una pyme
La locución es un cuello de botella silencioso. Un reel de 30 segundos puede tener el guion listo en diez minutos y quedarse una semana esperando a que alguien lo grabe bien. Con un modelo que se dirige desde el texto, el guion y la voz se vuelven el mismo documento, y corregir una frase deja de exigir otra sesión de grabación.
Yo empezaría por tres usos concretos.
Versiones de un mismo anuncio. Probar dos o tres ganchos distintos para pauta sin pagar tres sesiones de estudio.
Tutoriales y fichas de producto. Explicaciones cortas para ecommerce o servicio al cliente, donde la claridad pesa más que la interpretación.
Adaptación a otros mercados. Si vendes en Brasil o Estados Unidos, la misma voz de la marca en portugués o inglés.
Donde no la usaría es en testimonios o en cualquier pieza que el público vaya a entender como la voz real de una persona que no la grabó. Ahí el riesgo de reputación supera el ahorro. En la página de marketing de contenidos hay más sobre cómo ordenar la producción para que la IA ayude sin diluir la marca, y el artículo sobre video [marketing con](/blog/video-marketing-ia-produce-gasta-convierte) IA cubre el resto del proceso de video.
Cuidado con la clonación de voz
Que baste con 10 segundos de audio para clonar una voz es una ventaja y un riesgo a la vez. Si vas a clonar la voz del gerente o de un vocero, hazlo con su autorización por escrito y deja claro para qué piezas se puede usar y por cuánto tiempo. Si la persona deja la empresa, esa voz no debería seguir hablando en tus anuncios.
También conviene decidir desde ya cuándo avisarás que una voz es sintética. Las plataformas y la regulación en otros mercados se están moviendo hacia el etiquetado del contenido generado, y es más fácil fijar una regla interna hoy que corregir piezas publicadas mañana.
Qué haría yo esta semana
Haz una prueba ciega interna. Toma el guion de un reel ya publicado, genera la locución con Eleven v4 en la cuenta gratuita y pon las dos versiones frente a tu equipo sin decir cuál es cuál.
Escribe el diccionario de pronunciación. Lista los nombres de marca, productos y términos que la voz debe decir bien, y pruébalos uno por uno.
Redacta la autorización de voz. Una página que diga quién presta su voz, para qué usos y hasta cuándo, firmada antes de clonar.
Define tu regla de transparencia. Decide en qué piezas avisarás que la voz es generada y escríbelo en tu guía de marca.
Calcula el costo real. Compara cuántos minutos de locución produces al mes con el precio del plan después del 12 de octubre, no con la promoción.