Cómo hacer voz con IA para ads
Casteando la voz por tres criterios (acento local real, edad coherente con el personaje y rango de temperatura), dirigiéndola —generar por beats con los controles de pausa y énfasis, no de un tirón— y sincronizándola con lipsync. La dirección es la parte que casi nadie hace y la que separa el robot de la persona.
La voz es el alma del UGC: la capa donde la síntesis más se nota cuando está mal y más desaparece cuando está bien. Tres movimientos: elegir, dirigir y sincronizar.
Elegir la voz (el casting de audio)

Tu herramienta de voz tiene catálogo (y/o generación a medida). Los criterios, en orden:
- El acento real — para tu mercado, una voz rioplatense/local genuina, no “español neutro con tonada”. Si tu herramienta no tiene voces dignas de tu región, no es para tu mercado: el acento falso activa el filtro más rápido que cualquier imagen.
- La edad y energía del personaje — la voz tiene que poder ser la cara: un personaje de 40 con voz de locutor de 25 rompe la ilusión.
- El rango de temperatura — ¿puede sonar cansada, entusiasmada, irónica? La voz que solo tiene un tono no puede decir un guion con cambios de energía.
Dirigir la voz (la parte que casi nadie hace)
La diferencia entre voz que canta robot y voz que pasa por persona es dirección:
- El texto se prepara para el habla. El TTS lee literal: los puntos suspensivos generan pausas, las comas respiran, las mayúsculas (según la herramienta) enfatizan. Aprendé los controles de la tuya —etiquetas de pausa, énfasis y emoción si las tiene.
- Por temperatura, por bloque. Generá el guion por beats, no entero de un tirón: el beat del problema con su energía, el del resultado con la suya. Se ensamblan en edición y la temperatura variable aparece.
- La prueba del doblaje. Cerrá los ojos y escuchá: ¿es una persona contando algo o un GPS leyendo? Iterá la dirección (no solo el texto) hasta que sea persona.
El lipsync (la boca que dice lo que suena)
Con la voz generada, el personaje la “dice”, por dos caminos: el avatar parlante (imagen del personaje + audio → habla; el camino estándar) o el lipsync sobre video (un clip ya existente + audio → labios sincronizados). El checklist: ¿los labios van con el audio? (el desfase de 100ms se siente raro antes de saberse por qué), ¿la cara mantiene tu personaje mientras habla?, ¿los dientes y la lengua no hacen cosas de pesadilla? Guardá la configuración ganadora (voz + controles): es un asset de campaña, como la cara del personaje.