Blog

Cómo hacer que una foto cante (y parezca real): lo que aprendimos con seis renders de prueba

El equipo de Tunely · 2026-09-17 · 9 min de lectura
Respuesta corta

Tres cosas deciden si un video de una foto cantando parece real, en este orden. Primero, qué mueve la boca: hay que darle al motor la voz aislada, no la canción completa. En nuestra prueba, solo eso llevó la puntuación de sincronía boca-voz de 0,04 a 0,39 con el mismo motor y la misma foto. Segundo, la dirección: sin una instrucción de una línea, la cantante caminó hacia la cámara y el encuadre se fue moviendo; con ella, se quedó en su sitio y cantó. Tercero, la foto: un recorte de busto le dio a la boca 151 píxeles de ancho frente a 88 de la foto sin recortar de la misma persona, así que la articulación se ve mucho mejor. El motor importó menos que las tres.

No estábamos contentos con nuestros primeros videos musicales: la persona de la foto se movía por la escena, la boca parecía seguir a la banda en vez de a la cantante y el sonido era mono. En lugar de adivinar, montamos una pequeña prueba de banco. Una foto, un estribillo, los mismos diez segundos, renderizados de seis maneras y medidos igual. Aquí está el informe, con los clips, los números y lo que cambiamos en Tunely ese mismo día.

¿Lo quieres ya? Haz un video musical con una foto: gratis y en segundos.

La prueba: una foto, un estribillo, seis renders

La foto es un retrato generado por IA que nos pertenece, así que no hay ninguna cara real en el banco de pruebas. La canción es una canción de cumpleaños hecha en Tunely, y todos los renders usan los mismos diez segundos, empezando un segundo antes del estribillo.

En cada render medimos cuatro cosas. La puntuación de sincronía es la correlación entre cuánto se abre la boca en cada fotograma y lo fuerte que suena la voz aislada en ese instante: 1,0 sería una boca que se abre exactamente con la voz, 0 es una boca que se mueve al azar. El desfase de la boca es el desplazamiento de tiempo en el que esa correlación es máxima. El ancho de la boca es cuántos píxeles ocupa en el fotograma final. Y anotamos cómo era el archivo: tamaño, fotogramas por segundo, mono o estéreo.

Dos clips para empezar. A la izquierda, como funcionaba nuestra primera versión. A la derecha, como los hace Tunely ahora.

Antes: la canción completa como guía, sin dirección, foto sin recortar
Después: voz aislada, una línea de dirección, recorte de busto

Sobre la puntuación de sincronía: necesita un fragmento con pausas, porque compara los momentos fuertes con los silencios. En un pasaje donde la cantante no para nunca, todos los renders puntúan bajo. Compara puntuaciones solo entre renders del mismo fragmento, que es lo que hacen todas las tablas de abajo. No tenemos una referencia humana en esta prueba, así que lee los números unos contra otros.

Hallazgo 1: lo que mueve la boca importa más que el motor

Una canción terminada es una voz más batería, bajo, guitarras y todo lo demás. Si le das todo eso al motor, la boca intenta seguirlo todo. Así que primero separamos la voz de la canción y dejamos que la voz sola mueva la boca; al final volvemos a poner la canción completa en estéreo bajo la imagen.

Mismo motor, misma foto, mismos diez segundos. La única diferencia es qué escuchó el motor.

Guiada por la canción completa: la boca sigue moviéndose en los silencios
Guiada por la voz aislada: se abre con las palabras
Qué movió la bocaLa canción completaPuntuación de sincronía0,04Apertura de boca, momentos fuertes0,115Apertura de boca, momentos de silencio0,107
Qué movió la bocaLa voz aisladaPuntuación de sincronía0,39Apertura de boca, momentos fuertes0,213Apertura de boca, momentos de silencio0,102

Mira las dos últimas columnas. Guiada por la canción completa, la boca estaba casi tan abierta cuando la cantante callaba como cuando cantaba a pleno pulmón: llevaba el compás de la banda. Guiada por la voz, se abrió el doble en las sílabas fuertes que en los huecos. Fue la mayor mejora de toda la prueba, y no depende del motor que uses.

Hallazgo 2: dale una dirección a quien canta, o improvisará

Nuestra primera versión enviaba una foto y un audio, y nada más. Sin indicaciones, el motor se inventa una actuación: en el clip de «antes» la mujer camina hacia la cámara, el encuadre se cierra, una mano va al pecho. Tiene vida. Pero ya no es la foto que subiste, y en veinte segundos la cara puede alejarse de la persona que conoces.

Una frase lo arregla. Ahora todos los renders llevan la misma dirección: canta a la cámara, quédate en tu sitio, movimiento natural de cabeza y hombros, la cámara no se mueve. Aquí está la misma foto sin recortar, renderizada a la antigua y como lo hacemos ahora. La dirección es lo que la mantiene en su sitio: el motor A de más abajo es el mismo del clip de «antes», y en cuanto recibió la dirección también se quedó quieto.

Sin dirección: se acerca caminando y el encuadre cambia
La misma foto, con el proceso actual: se queda y canta

El tiempo también mejoró. En el render de «antes» la boca iba unos 200 milisegundos por delante de la voz, que es esa sensación rara de película doblada. El proceso actual coincide con la voz con un margen de un fotograma.

Hallazgo 3: el encuadre de la foto decide cuánto se ve cantar

Renderizamos a la misma persona dos veces con el mismo motor: una con la foto de tres cuartos sin recortar y otra con un recorte de busto de esa misma foto.

FotoSin recortar, plano de tres cuartosAncho de la boca en el video final88 pxPuntuación de sincronía0,41
FotoRecorte de busto de la misma fotoAncho de la boca en el video final151 pxPuntuación de sincronía0,39
FotoComo referencia: el clip de «antes»Ancho de la boca en el video final68 pxPuntuación de sincronía0,26

La sincronía es igual de buena en los dos. Lo que cambia es cuánto se ve: el recorte le da a la boca 1,7 veces más ancho, y las consonantes y las vocales largas se leen bien en la pantalla de un móvil. Si la foto que te gusta es de cuerpo entero, recórtala hasta el pecho antes de subirla. Pierdes los zapatos y ganas la actuación.

Los motores, con entradas idénticas

Con las entradas fijas (voz aislada, la misma dirección, el recorte de busto) probamos cuatro motores. Los nombramos con letras y no con marcas: los motores cambian cada pocos meses, y los tres hallazgos de arriba se cumplieron en todos.

Motor A con las nuevas entradas
Motor C con las nuevas entradas
MotorA, el que usábamos antesSalida832×1120, 25 fpsSonido tal como llegamonoPuntuación de sincronía0,25Desfase de la boca160 ms antesTiempo de render, clip de 10 s4 min 1 s
MotorB, el que Tunely usa ahoraSalida1168×1760, 30 fpsSonido tal como llegaestéreo tras nuestra remezclaPuntuación de sincronía0,39Desfase de la bocadentro de un fotogramaTiempo de render, clip de 10 sde 4 min 36 s a 5 min 48 s
MotorC, una versión más ligera de BSalida784×1168, 30 fpsSonido tal como llegaestéreoPuntuación de sincronía0,26Desfase de la bocadentro de un fotogramaTiempo de render, clip de 10 s3 min 33 s
MotorDSalidasin salidaSonido tal como llegan/dPuntuación de sincronían/dDesfase de la bocan/dTiempo de render, clip de 10 sfalló dos veces con esta foto

El motor D nos ha renderizado otras fotos sin problema. Con esta se negó dos veces con un error interno, y eso también es un dato: un video que no llega es peor que uno más lento.

Lo que cambiamos en Tunely ese mismo día

Todo lo anterior entró en el producto el 17 de septiembre de 2026. Ahora, cuando haces un video musical en Tunely:

  • La voz se separa de tu canción y es la que mueve la boca. Después, tu canción completa en estéreo vuelve a ponerse bajo la imagen.
  • Todos los renders llevan la misma dirección: quédate en tu sitio, canta a la cámara, la cámara no se mueve.
  • El clip de 20 segundos se abre en el estribillo y no en la introducción. Una persona callada durante cuatro compases de guitarra no es un video musical.
  • La letra va incrustada como subtítulos, sincronizada con la canción y en el alfabeto correcto para cada idioma.
  • El archivo final llega hasta 1168×1760 a 30 fotogramas por segundo (su forma sigue la de tu foto), sin marca de agua.
  • Tarda unos diez minutos. Puedes cerrar la página: un correo te avisa cuando está listo.
Un video completo de 20 segundos hecho en el sitio real, de principio a fin en 10 minutos y 2 segundos

Cómo hacer el tuyo: lista de cinco minutos

Primero crea una canción en la página de crear, o abre una en tu biblioteca y toca Video musical. Después:

  • Una sola persona, mirando a la cámara. Con fotos de grupo el motor tiene que adivinar quién canta.
  • La cara grande en el encuadre. Mejor busto que cuerpo entero. Recorta antes de subir si hace falta.
  • La boca visible y luz en la cara. Sin gafas de sol, mascarilla, micrófono ni manos delante de la boca. Los perfiles casi nunca funcionan.
  • Elige la parte que canta. El selector se abre en el estribillo; pulsa Escuchar esta parte y comprueba que haya una voz cantando casi todo el tiempo.
  • Haz coincidir la voz con la cara si buscas realismo. La foto de una mujer con una voz de barítono hace gracia, y está bien si eso es lo que quieres.
  • Y déjalo diez minutos. El correo te encontrará.

Lo que todavía falla

Preferimos contártelo a que lo descubras. Las notas muy largas pueden parecer una boca abierta congelada. Las manos cerca de la cara a veces ganan un dedo. Los dientes han mejorado y aún no son perfectos en todos los fotogramas. Los pasajes con muchos efectos en la voz se separan peor, y la boca los sigue con menos precisión. Y la puntuación de sincronía que usamos es un instrumento tosco: premia las bocas que se abren cuando la voz suena fuerte, pero no distingue si una «u» parece una «u». Revisamos cada clip también a ojo, y tú deberías hacer lo mismo.

Preguntas frecuentes

¿Cuánto se tarda en hacer un video de una foto cantando?

Unos diez minutos para un clip de 20 segundos. En nuestra prueba completa en el sitio real fueron 10 minutos y 2 segundos desde pulsar el botón hasta ver el video en la página, de los cuales 1 minuto y 40 segundos fueron para separar la voz de la canción. No hace falta esperar en la página: llega un correo cuando está listo.

¿Qué tipo de foto funciona mejor?

Una sola persona, de frente, con la cara grande en el encuadre, la boca bien visible y buena luz. En nuestra prueba, un recorte de busto le dio a la boca 151 píxeles de ancho frente a 88 de la foto de tres cuartos sin recortar de la misma persona, y en un móvil la diferencia salta a la vista.

¿Por qué la boca se ve rara en los videos de lip sync con IA?

Casi siempre porque al motor se le dio la canción entera. Con batería y guitarras en la señal, la boca sigue a la banda. Cuando guiamos el mismo motor con la voz aislada, la puntuación de sincronía pasó de 0,04 a 0,39 y la boca dejó de moverse en los silencios.

¿Puedo elegir qué parte de la canción canta la persona?

Sí. Un selector elige los 20 segundos, y por defecto se abre en el estribillo. Usa el botón de escuchar y elige un tramo donde haya una voz cantando casi todo el tiempo.

¿Necesito una suscripción?

No. El video musical es una compra única, aparte de los planes, y el archivo es tuyo para descargarlo y conservarlo, sin marca de agua.

¿Funciona en otros idiomas?

Sí. La boca sigue el sonido de la voz, no la ortografía, y los subtítulos incrustados usan el alfabeto correcto para español, portugués, árabe, hindi, chino, japonés y los demás idiomas en los que canta Tunely.

Más del blog