Volver al blog

Comparativa de Modelos de Whisper para Subtítulos: Tiny, Small, Turbo y Large-v3

Comparativa de modelos de Whisper para subtítulos: parámetros, descarga y velocidad de tiny, small, turbo y large-v3, y por qué el mayor no siempre gana.

11 de septiembre de 2026
Sablate Team

El modelo más grande de Whisper no es automáticamente el mejor para subtítulos. large-v3-turbo tiene aproximadamente la mitad de los parámetros de large-v3 y funciona unas ocho veces más rápido, y en material corriente la diferencia en el archivo de subtítulos terminado es tan pequeña que la velocidad decide. También hay casos reales en los que un modelo más pequeño produce una mejor transcripción que uno más grande.

Aquí tienes las cifras, lo que significan concretamente para el trabajo de subtitulado, y los modos de fallo que hacen que un modelo parezca peor de lo que es.

Los modelos, uno junto a otro

Los parámetros y la velocidad relativa vienen de la ficha del modelo Whisper publicada por OpenAI; los tamaños son los totales reales de las compilaciones de CTranslate2 que descarga Sablate, no estimaciones redondeadas.

ModeloParámetrosDescargaVelocidad frente a large-v3Nivel en Sablate
tiny39 M~78 MB~10×Fast
small244 M~486 MB~4×Balanced
medium769 M~1,53 GB~2×Sustituido
large-v3-turbo809 M~1,62 GB~8×Accurate
large-v31550 M~3,09 GBBest

La fila que rompe el patrón es turbo. Tiene más parámetros que medium y aun así funciona unas cuatro veces más rápido, algo que el número de parámetros por sí solo no permite predecir.

Por qué turbo cambia la recomendación

Turbo no es un modelo más pequeño entrenado desde cero. Es large-v3 con su decodificador reducido de 32 capas a 4, y después reentrenado durante dos épocas más sobre los mismos datos de transcripción multilingüe. Whisper pasa la mayor parte de su tiempo en el decodificador, así que recortarlo tanto compra una ganancia de velocidad muy grande mientras el codificador (la parte que realmente escucha) se queda intacto.

Vienen con dos advertencias, y las dos están documentadas por OpenAI, no son leyenda urbana:

  • Se reentrenó sin datos de traducción. Turbo es un modelo de transcripción. Si quieres la tarea de Whisper de traducir voz al inglés, turbo es la herramienta equivocada; transcribe en el idioma original y traduce el texto después, que de todos modos es el mejor flujo de trabajo.
  • Algunos idiomas pierden más precisión que otros. Turbo sigue de cerca a large-v2 en la mayoría de los idiomas, pero pierde notablemente más en tailandés y cantonés. Si trabajas con esos idiomas, haz una prueba antes de decidirte.

Para todo lo demás, turbo es la opción por defecto sensata para subtítulos: una calidad casi igual a la de large a una velocidad que convierte una grabación de dos horas en un trabajo manejable.

¿Da el modelo más grande los mejores subtítulos?

No siempre, y merece la pena conocer la excepción porque, cuando te topas con ella, parece un fallo del programa.

Medimos esto con un clip en turco de 101 segundos, en una RTX 3060 Ti con float16, usando el propio proceso de transcripción de la aplicación. Clasificados por cuánto del habla captó realmente cada modelo, medium quedó primero. large-v3 se saltó habla que medium transcribió correctamente: las primeras palabras del clip y varias interjecciones cortas simplemente no aparecían. Ninguna de las palancas habituales las recuperó: desactivar el filtro de actividad de voz, subir el umbral de no-habla, quitar el umbral de log-probabilidad, fijar la temperatura. Quitar el umbral de log-probabilidad lo empeoró de forma drástica, reduciendo la transcripción de unos 1110 caracteres a 429.

También probamos el consejo muy repetido en la comunidad de usar large-v2 en lugar de large-v3. En este clip fue el peor de todos: perdió por completo un tramo continuo de habla de 30 segundos, del segundo 28,7 al 58,7, y produjo 106 palabras frente a las 178 de medium.

Un solo clip no es un benchmark, y este además era corto, en turco y conversacional. Quédate con el método, no con la clasificación: transcribe el mismo archivo con dos modelos, fíjate en lo que falta antes que en lo que está mal escrito, y elige el que lo haya oído todo. Las omisiones cuestan mucho más en subtítulos que las faltas de ortografía, porque el espectador puede pasar por encima de una palabra equivocada, pero no puede leer una línea que no existe.

Cuando un buen modelo parece uno malo

Hay tres modos de fallo que provocan quejas del tipo «el modelo grande es peor» y que no tienen nada que ver con el modelo.

1. Los empates en las marcas de tiempo por palabra rompen la división en líneas. Whisper genera una marca de tiempo por cada palabra, y las palabras seguidas comparten con frecuencia un límite exactamente igual: en el clip que examinamos, 172 de los 177 huecos entre palabras eran exactamente 0,000 segundos. Un divisor que corta una línea larga en el hueco más grande se encuentra entonces con todos los candidatos empatados, toma el primero y repite el mismo proceso una y otra vez, quitando una palabra cada vez. El síntoma es una transcripción hecha trizas en subtítulos de una sola palabra, y empeora con el modelo que produce más palabras. Corregir el desempate para que favorezca el punto medio temporal llevó un clip de 90 líneas (78 de ellas de una sola palabra) a 28 líneas con una única línea de una sola palabra. El modelo nunca cambió.

2. El modelo que seleccionaste no es el modelo que se ejecutó. Los repositorios de modelos se nombran de forma distinta según el registro de descarga y la librería de inferencia. Un modelo ya descargado en el disco bajo el nombre de un repositorio, mientras el cargador busca otro, produce o bien un cambio silencioso a otro modelo, o bien un error que parece un problema de red, aunque 1,6 GB del modelo correcto ya estén ahí.

3. Una retranscripción fallida deja en pantalla la transcripción anterior. Si una nueva ejecución falla y la aplicación revierte el trabajo pero conserva el nombre del modelo solicitado, lo que tienes delante es el resultado del modelo anterior etiquetado como si fuera el nuevo. Cualquier comparación hecha desde ese estado es errónea. Si estás haciendo un benchmark, comprueba que el texto realmente cambió antes de sacar conclusiones: un resultado idéntico entre dos modelos distintos es una señal de alarma, no un hallazgo.

VRAM, disco y qué puede ejecutar tu equipo

Los tamaños de descarga de la tabla anterior también son un buen indicador de la presión de memoria durante la transcripción. Guía práctica:

  • 4 GB de VRAM o menos, o sin GPU dedicadasmall es el punto óptimo. tiny sirve para borradores y comprobaciones de tiempos, no para la entrega final.
  • 6-8 GB de VRAMlarge-v3-turbo sin ningún problema. Esta es la configuración en la que debería estar la mayoría de la gente.
  • 10 GB de VRAM o máslarge-v3 si el audio realmente lo necesita: acentos marcados, hablantes que se solapan, micrófonos de mala calidad.
  • Solo CPUsmall para cualquier cosa que necesites hoy, turbo si puedes dejarlo trabajando.

Aquí la precisión importa tanto como el tamaño del modelo. Las compilaciones de CTranslate2 sobre las que funciona Whisper admiten float16 e int8, y reducir la precisión rebaja mucho la memoria necesaria, con un coste de calidad que es pequeño en int8 y normalmente imperceptible con float16 en una GPU.

En GPU, espera una mejora de velocidad de entre cinco y diez veces frente al mismo equipo usando solo la CPU. En Sablate para Windows, el entorno de ejecución NVIDIA CUDA se descarga la primera vez que se ejecuta un trabajo con GPU, en lugar de venir incluido en el instalador, lo que mantiene la descarga pequeña para quienes nunca lo van a usar.

¿Qué modelo deberías elegir en la práctica?

SituaciónModeloPor qué
Comprobar tiempos o probar un estilo de subtítulotinyTermina en segundos; aquí la precisión da igual
Habla clara, un solo hablante, buen micrófonosmallRápido, y el editor corrige el resto
Opción por defecto para subtítulos de entregalarge-v3-turboPrecisión casi como la de large a unas 8× la velocidad
Acentos, ruido, hablantes que se solapanlarge-v3Aquí los parámetros extra justifican el tiempo
Tailandés o cantonéslarge-v3El punto débil documentado de turbo
Fuente para traducir a otros idiomasEl más preciso que puedas permitirteCada error se propaga a todos los idiomas

Esa última fila es la que cambia el cálculo. Cuando una transcripción es la entrada de ocho traducciones, un error no es un solo error, son ocho. El flujo de trabajo multilingüe explica por qué la transcripción de origen merece el modelo lento y una corrección cuidadosa.

En Sablate, Fast y Balanced (tiny y small) funcionan en el plan gratis; Accurate y Best forman parte de Pro, un único pago de $29 que se detalla en la página de precios. Sea cual sea el modelo que ejecutes, el resultado llega al mismo editor y se exporta a los mismos formatos (SRT, VTT y ASS), así que elegir modelo va de cuánto vas a corregir después, no de lo que puedes producir.

Cómo probar esto con tu propio material

Cinco minutos de método ganan a cualquier benchmark publicado, incluido este:

  1. Coge un clip de entre 60 y 120 segundos que sea representativo: tu peor micrófono, tus acentos habituales, tu habitación real.
  2. Transcríbelo con dos modelos candidatos, sin cambiar nada más.
  3. Compara primero las omisiones, y las faltas de ortografía en segundo lugar.
  4. Cuenta las líneas de una sola palabra. Si hay muchas, el problema es la segmentación, no el modelo.
  5. Solo entonces compara el tiempo real que tarda cada uno, y decide cuánto vale ese tiempo para ti.

El modelo que oye todo en tu material es el mejor modelo para ti, y no tiene por qué ser el más grande.