Volver al blog

Cómo Añadir Subtítulos Palabra por Palabra (Karaoke) a Shorts y Reels

Añade subtítulos palabra por palabra a Shorts, Reels y TikTok: de dónde sale el tiempo por palabra, tres formas de incrustarlo y qué edición rompe la sincronía.

28 de septiembre de 2026
Sablate Team

Los subtítulos palabra por palabra necesitan algo que un archivo de subtítulos normal no tiene: una marca de tiempo para cada palabra. Consíguelas con un reconocedor de voz como Whisper, elige cómo va a destacar la palabra pronunciada (un cambio de color, una caja, un relleno o una palabra cada vez) e incrusta los subtítulos en el vídeo.

Aquí incrustar no es opcional. Shorts, Reels y TikTok no aceptan ningún archivo de subtítulos, así que el resaltado tiene que vivir en los píxeles. A continuación: de dónde sale el tiempo por palabra y por qué se desincroniza, tres formas de añadir el efecto (una de ellas gratis), y las ediciones que rompen la sincronía sin que te des cuenta.

Por qué los subtítulos palabra por palabra necesitan marcas de tiempo por palabra

Un subtítulo normal tiene dos marcas de tiempo: cuándo aparece la línea y cuándo desaparece. Eso basta para una línea que se queda quieta. Un resaltado de karaoke necesita un inicio y un final para cada palabra dentro de la línea, y un .srt estándar no tiene dónde guardarlos.

Whisper genera las marcas de tiempo por palabra en una segunda pasada. Una vez que ha fijado el texto, alinea cada palabra con el tramo de audio que probablemente la produjo, y la línea de comandos openai-whisper sigue marcando esa opción como experimental. Las marcas son lo bastante buenas para mover un resaltado, pero no lo bastante como para fiarse a ciegas, y además tienen una peculiaridad que decide cómo se comporta el resaltado.

Las palabras contiguas suelen compartir exactamente el mismo límite. En el clip que analizamos para nuestra comparativa de modelos de Whisper, 172 de 177 huecos entre palabras eran de exactamente cero segundos. Donde sí hay pausas reales, una herramienta tiene que decidir qué hace el resaltado durante ellas:

  • Iluminar solo la palabra que se está pronunciando. El resaltado se apaga en cada pausa, y una palabra corta como «un» o «lo» parpadea durante uno o dos fotogramas. El propio resaltador de Whisper funciona así: escribe una copia plana y sin resaltar de la línea en cada hueco.
  • Mantener cada palabra iluminada hasta que empieza la siguiente. El resaltado nunca se apaga, y cada palabra permanece en pantalla el tiempo suficiente para registrarse. Así es como se comportan la mayoría de las aplicaciones de subtítulos, y es a lo que están acostumbrados los espectadores de vídeo corto.

El segundo enfoque también aguanta mejor la edición, porque las ventanas de palabras cubren todo el subtítulo, de la primera palabra a la última, sin que sobre nada.

Los cuatro estilos de subtítulos karaoke

«Karaoke» engloba cuatro estilos distintos, y conviene saber cuál quieres antes de elegir una herramienta:

EstiloQué ve el espectadorNombre habitual
ColorLa palabra pronunciada cambia de color; el resto de la línea sigue en blancoSubtítulos estilo Hormozi
CajaUna caja de color se coloca detrás de la palabra pronunciadaResaltado en caja o píldora
RellenoLas palabras cambian de color al pronunciarse y se quedan asíBarrido clásico de karaoke
Una palabraSolo la palabra pronunciada aparece en pantalla, grande y centradaSubtítulos de una sola palabra

Color y caja funcionan mejor en vídeos de alguien hablando a cámara. Relleno es el aspecto típico de los lyric videos. Una palabra es el más insistente de los cuatro: potente para un gancho inicial, cansado si se mantiene un minuto entero.

Tres formas de añadir subtítulos palabra por palabra

  1. Whisper y FFmpeg — gratis, local, línea de comandos. Un resaltado sencillo, control total, algo de configuración.
  2. La plantilla de subtítulos de un editor de vídeo — CapCut o DaVinci Resolve Studio. Un clic una vez que estás dentro del editor; lo que cambia son las condiciones.
  3. Una aplicación de subtítulos de escritorio — Sablate. Presets, encuadre vertical e incrustación en una sola ventana, en tu propio equipo.

Método 1: Whisper y FFmpeg (gratis, totalmente local)

Esto necesita Python y FFmpeg instalados y en tu PATH. Todo se ejecuta en tu equipo, y el modelo de Whisper se descarga una vez, en el primer uso.

  1. Instala Whisper:
pip install -U openai-whisper
  1. Transcribe con las marcas de tiempo por palabra y el resaltado activados, tres palabras por subtítulo:
whisper clip.mp4 --model turbo --word_timestamps True --highlight_words True --max_words_per_line 3 --output_format srt

Eso escribe clip.srt, en el que cada palabra tiene su propio subtítulo y la palabra pronunciada queda envuelta en etiquetas <u>.

  1. Opcionalmente, convierte el subrayado en un color. FFmpeg lee las etiquetas <font color> en los archivos SRT, así que basta con un buscar y reemplazar (macOS y Linux, o Git Bash en Windows):
sed -e 's/<u>/<font color="#FFE900">/g' -e 's#</u>#</font>#g' clip.srt > karaoke.srt
  1. Incrústalo:
ffmpeg -i clip.mp4 -vf "subtitles=karaoke.srt:force_style='FontName=Arial,FontSize=16,Outline=2,MarginV=60'" -c:a copy clip-captioned.mp4

Un detalle explica esas cifras. Cuando FFmpeg incrusta un SRT, primero coloca el texto sobre un lienzo virtual de 384×288, así que FontSize y MarginV se miden contra esas 288 unidades y no contra los píxeles de tu vídeo. MarginV=60 sube la línea aproximadamente un quinto del fotograma, lejos de la interfaz de Shorts y Reels. Si FFmpeg dice que no encuentra el archivo de subtítulos en Windows, la ruta necesita escaparse — la guía de incrustación explica cómo arreglarlo.

Los límites, con honestidad: obtienes un subrayado o un color plano, sin caja y sin pop, y el resaltado se apaga en las pausas. Lo incómodo es la edición. Cada palabra es su propio subtítulo y lleva la línea completa, así que un nombre mal escrito en una línea de tres palabras queda mal escrito en al menos tres subtítulos. Corrige la transcripción antes de generar el SRT, no después.

Método 2: la plantilla de subtítulos de un editor de vídeo

Si ya editas en alguno de estos programas, el resaltado palabra por palabra está a una plantilla de distancia.

CapCut. Genera subtítulos automáticos y aplica después una plantilla de subtítulos con resaltado por palabra, en el escritorio o en el móvil. Vienen con dos condiciones. El audio se procesa en los servidores de CapCut: su política de privacidad dice que puede recopilar contenido «mediante la pre-subida en el momento de la creación, la importación o la subida», por ejemplo para generar subtítulos. Y el centro de ayuda de CapCut señala los subtítulos automáticos como una función que puede incluir funcionalidad exclusiva de Pro; un proyecto que usa funciones Pro necesita una suscripción para exportarse.

DaVinci Resolve Studio. Timeline → AI Tools → Create Subtitles from Audio transcribe en tu propio equipo. Desde Resolve 20, los títulos Animated incluyen una plantilla Word Highlight: arrástrala a la cabecera de la pista de subtítulos y después ajusta el color, la fuente y la velocidad en el Inspector. Los subtítulos automáticos son una función de Studio — $295, pago único — y la transcripción cubre 14 idiomas de serie, con más disponibles mediante una descarga adicional. Si ya tienes Studio, esta es la vía más directa de esta página.

Método 3: una aplicación de subtítulos de escritorio

Una aplicación de subtítulos de escritorio hace todo el trabajo en una sola ventana, en tu propio equipo: transcribir, corregir, elegir un estilo, encuadrar en vertical, renderizar.

En Sablate, seis presets de resaltado por palabra — Hormozi, Beast, Reels, One Word, Karaoke y Pop — cubren los cuatro estilos de arriba, y el interruptor Word-by-word highlight añade el efecto a cualquier otro estilo, con Color, Box, Fill o Word como modo. Las fuentes de los subtítulos detrás de los presets (Montserrat ExtraBold, Anton, Bangers, Bebas Neue y Archivo Black) van incluidas dentro de la app y dentro de su renderizador, así que la incrustación dibuja la misma tipografía que muestra la vista previa. Una fuente que falta es una de las razones habituales por las que los subtítulos exportados se ven distintos a los del editor.

El tiempo sigue las reglas del principio de esta página. Cada palabra se queda iluminada hasta que empieza la siguiente, así que el resaltado nunca se apaga en una pausa. Corregir una errata conserva las marcas de tiempo grabadas mientras el número de palabras no cambie; añade o quita una palabra y solo esa línea vuelve a un tiempo estimado. La incrustación la dibuja libass, el mismo renderizador de subtítulos que usan los reproductores multimedia, en lugar de superponerse como una capa plana, y renderiza en 9:16, 1:1 o 16:9 recortando o rellenando con una copia difuminada del original.

Donde va más allá que los otros métodos es en los idiomas. Cada capa de traducción lleva su propio estilo y su propia fuente para esa escritura, así que el mismo Short puede publicarse con subtítulos karaoke en inglés, español y coreano a partir de una sola transcripción, tal como describe el flujo de trabajo multilingüe. El tiempo de una capa traducida es estimado, no medido, porque nadie pronunció esas palabras, y la app lo indica junto al interruptor.

El estilo palabra por palabra forma parte de Pro, un único pago de $29. El plan Gratis permite previsualizar todos los presets e incrusta los demás estilos con una pequeña marca en la esquina.

¿Qué método deberías usar?

Whisper y FFmpegCapCutDaVinci Resolve StudioSablate
PrecioGratisNivel gratis, suscripción Pro$295, pago único$29, pago único
El audio sale de tu equipoNoSí, para los subtítulos automáticosNoNo
Aspecto del resaltadoSubrayado o colorBiblioteca de plantillasPlantilla Word HighlightColor, caja, relleno, una palabra
Editor de vídeo completoNoSíSíNo
Funciona en el móvilNoSíNoNo
Salida vertical 9:16Con un filtro adicionalSíSíSí, recortando o difuminando

Dos de esas filas juegan en contra de Sablate: no es un editor de vídeo y no funciona en el móvil. Si montas, añades música y publicas desde el móvil, una aplicación de subtítulos de escritorio es un paso extra, no un atajo.

«Un solo clip, y me manejo bien en una terminal». Whisper y FFmpeg. Gratis, local, y suficiente para un resaltado de cambio de color.

«Ya edito en CapCut y publico todos los días». Quédate ahí. Las plantillas son la gracia, y si de todas formas pagas Pro, el argumento del coste desaparece.

«Edito en DaVinci Resolve Studio». Usa Word Highlight. Ya tienes la licencia y la transcripción se queda en local.

«El material no puede salir de mi equipo». Cualquier cosa menos CapCut. Generadores de subtítulos sin conexión compara las opciones locales con más detalle.

«El mismo Short sale en tres idiomas». Sablate: una transcripción y un estilo karaoke por idioma, con tiempo estimado en las traducciones.

«Es un vídeo musical, y quiero tiempo por sílaba». Aegisub, que es gratis. Su modo karaoke marca las etiquetas \k de ASS sílaba por sílaba, a mano: lento, y aun así el mejor resultado para letras de canciones. El formato ASS es el único formato de subtítulos habitual que guarda tiempo de karaoke.

Cómo mantener sincronizados los subtítulos palabra por palabra

El resaltado es tan bueno como las marcas de tiempo que hay debajo, y unos pocos hábitos las mantienen intactas:

  • Corrige antes de aplicar estilo. Las marcas de tiempo pertenecen a las palabras que se reconocieron. Un cambio de la misma longitud, «valla» por «vaya», las conserva; reescribir una línea entera las tira por la borda.
  • Dale a Whisper los nombres de antemano. Whisper acepta una breve instrucción con nombres y términos que orienta la transcripción: la opción --initial_prompt, o Defaults → Custom vocabulary en Sablate. Un nombre bien escrito desde el principio nunca necesita una corrección que altere el tiempo. Es una orientación, no una garantía, así que revisa los nombres de todas formas.
  • Divide los subtítulos largos en vez de reducir la fuente. En vídeo vertical, una línea de tres a cinco palabras se puede leer mientras se mueve el resaltado; dos líneas completas no.
  • Vuelve a reproducir después de retocar el tiempo. Arrastrar el borde de un subtítulo normalmente deja donde estaban las marcas de tiempo de las palabras de dentro, así que las palabras más cercanas al nuevo borde se quedan apretadas. Ajusta un poco y revisa el subtítulo una vez.
  • Revisa el renderizado, no solo la vista previa. Mira el primer subtítulo, el último y el pasaje más rápido antes de subirlo a ningún sitio.

Los subtítulos palabra por palabra son un problema de sincronización disfrazado de estilo. Consigue marcas de tiempo por palabra limpias, mantén tus correcciones de la misma longitud, y elige el aspecto después de eso. Si quieres los presets, el encuadre vertical y varios idiomas en un mismo sitio, descarga Sablate para Windows o Mac y pasa un Short por él.