Cómo clonar tu voz éticamente con IA (y lo que nadie te cuenta)
Un recorrido de 30 minutos para grabar, clonar y desplegar tu propia voz IA, además de las reglas de consentimiento, marcas de agua y casos de uso que te mantienen del lado correcto de la política de cada plataforma.
La clonación de voz en 2026 es genuinamente indistinguible de una grabación real, un hecho que es emocionante si eres un creador, aterrador si eres un objetivo de fraude, y vale la pena saber exactamente cómo hacerlo bien en cualquier caso. Esta guía recorre la clonación de tu propia voz, de principio a fin, con las prácticas de consentimiento y marcas de agua que mantienen tu trabajo del lado correcto de la política de cada plataforma importante.
Si quieres clonar la voz de otra persona, esta guía no es para ti. No lo hagas.
Por qué clonar tu propia voz
Tres razones concretas por las que los creadores lo hacen en 2026:
- Narración de formato largo sin sesiones de grabación. Escribe, haz clic, envía. Audiolibro de ocho horas en un fin de semana.
- Alcance multilingüe. Tu voz, en 32 idiomas, con tu acento y entonación. ElevenLabs v3 lo clava.
- Personalización a escala. Clips de audio personalizados para miles de usuarios (mensajes de bienvenida, recordatorios de cursos) usando tu voz real sin grabar cada uno.
El stack de tres herramientas
Necesitarás una habitación silenciosa, un micrófono decente (un condensador USB de $100 es más que suficiente) y 30 minutos.
- Adobe Podcast para limpiar tu audio de entrenamiento de forma gratuita.
- ElevenLabs Professional Voice Clone para hacer la clonación real.
- Descript para escribir y ensamblar audio de formato largo con tu voz IA.
Paso 1: Graba audio de entrenamiento limpio (15 minutos)
La calidad de la clonación sigue la calidad de la fuente. El error número uno es subir 30 minutos de audio mediocre. ElevenLabs PVC funciona bien con tan solo 30 minutos, pero esos 30 minutos deben ser limpios.
Graba:
Evita las oclusivas ("p", "b") hablando ligeramente de lado al micrófono, no directamente hacia él. Evita los chasquidos de labios bebiendo agua de antemano.
- En una habitación, idealmente con superficies blandas (un dormitorio, no una cocina). Las habitaciones con superficies duras añaden reverberación que el modelo reproducirá.
- A una distancia del micrófono (8-15 cm, constante durante todo el tiempo). La distancia variable enseña al modelo dos voces.
- A un volumen constante. No susurres, no grites, no cambies.
- Lee contenido variado. Un párrafo de una novela, un guion de noticias, una historia casual que le cuentas a un amigo. Diferentes emociones, diferentes ritmos.
Paso 2: Límpialo en Adobe Podcast (3 minutos)
Sube tu grabación sin procesar a la herramienta gratuita Enhance de Adobe Podcast. Elimina el ruido de fondo, normaliza el volumen y te da una versión de calidad de broadcast. Gratis, sin registro para subidas cortas.
Escucha la versión limpiada con auriculares. Si puedes oír la habitación o algún silbido, vuelve a grabar. No intentes arreglarlo con otra pasada, crearás artefactos.
Paso 3: Clona en ElevenLabs (10 minutos, incluida la verificación)
Abre ElevenLabs, ve a Voice Lab → Add a New Voice → Professional Voice Clone.
PVC requiere:
Este paso de verificación es innegociable, y es la decisión correcta. Es la razón más importante por la que las plataformas aceptarán tu contenido de voz IA sin marcarlo.
Sube el audio limpio, completa la verificación, pulsa entrenar. PVC tarda 4-8 horas. Apártate.
Cuando termine, pruébalo con una frase que nunca hayas dicho al micrófono. Si no puedes distinguirla de la tuya, has terminado. Si suena ligeramente mal en el ritmo, baja la Stability (35-45 para variación natural) y sube ligeramente la Style.
- 30+ minutos de audio (más es ligeramente mejor, se estanca en 3 horas)
- Una verificación de consentimiento, te piden que leas una declaración específica en voz alta, en cámara, confirmando que es tu voz y que autorizas la clonación.
Paso 4: Escribe y envía en Descript (10 minutos por pieza de audio)
Aquí es donde la clonación da sus frutos. Abre Descript, crea un nuevo proyecto, establece tu voz como el locutor predeterminado y escribe tu guion. Descript lee tu texto con tu voz IA. Escribe, corrige, regenera frases individuales si una entrega no suena bien.
Para formato largo (una voz en off de YouTube de 20 minutos, un capítulo de un audiolibro), el flujo de Descript es aproximadamente:
Un episodio de 20 minutos que antes tardaba 4 horas de grabación, edición y tomas repetidas, ahora tarda unos 25 minutos.
- Pega el guion en trozos de ~500 palabras.
- Genera. Escucha a velocidad 1.25x para detectar pausas poco naturales.
- Resalta cualquier frase que suene mal, regenera solo esa frase.
- Exporta el audio final a 48 kHz, -16 LUFS para video, -23 LUFS para podcast.
Las reglas que te evitan problemas
Esta es la parte que la mayoría de los tutoriales omiten. En 2026, las políticas de uso indebido de voz son estrictas y la aplicación es rápida.
- Declara el uso de voz IA si tu audiencia podría creer razonablemente que está escuchando a un humano en tiempo real. Los agentes de IA conversacionales que pretenden ser humanos violan la guía de la FTC y los términos de la mayoría de las plataformas.
- Nunca clones una voz que no poseas. La verificación de ElevenLabs lo detecta en PVC, pero Instant Voice Clone tiene controles más débiles; usarlo en una muestra de celebridad es una forma rápida de perder tu cuenta y posiblemente enfrentarte a una demanda.
- Marca con agua el audio comercial. ElevenLabs añade marcas de agua inaudibles a todo el audio generado por defecto, y la mayoría de las plataformas de música de stock ahora las escanean. No las desactives.
- Añade una divulgación de una línea en YouTube si toda la voz en off es IA. El interruptor "Contenido alterado o sintético" en YouTube Studio es obligatorio y apenas afecta al rendimiento, los espectadores respetan la honestidad más de lo que castigan la IA.
- No uses voz IA para suplantación de identidad, estafas o contenido de celebridades "al estilo de". Esto ya ni siquiera es un área gris.
Próximos pasos
Dos pasos naturales después de tener un clon funcional:
Hecha bien, la clonación de voz es un multiplicador de productividad silencioso. Hecha mal, es una forma de perder la confianza permanentemente. Entrena bien el clon, declara donde cuente, y serás el creador con la ventaja injusta del tiempo.
- Traduce tu contenido. ElevenLabs Dubbing v3 toma un video en inglés de 10 minutos y produce el mismo video en 32 idiomas, con tu voz, con sincronización labial. El salto de calidad a mediados de 2026 fue masivo.
- Crea agentes conversacionales. Empareja tu voz clonada con un LLM y tendrás un asistente que se puede llamar por teléfono y que suena como tú. Úsalo para reservar llamadas, preguntas frecuentes o tu buzón de voz personal.