Comparação de Modelos Whisper para Legendas: Tiny, Small, Turbo e Large-v3
Modelos Whisper para legendas comparados: parâmetros, tamanho de transferência e velocidade do tiny, small, turbo e large-v3 — porque maior nem sempre é melhor.
O maior modelo Whisper não é automaticamente o melhor para legendas. O large-v3-turbo tem cerca de metade dos parâmetros do large-v3 e funciona cerca de oito vezes mais rápido, e em gravações normais a diferença no ficheiro de legendas final é pequena o suficiente para que a velocidade decida a escolha. Há também casos reais em que um modelo mais pequeno produz uma transcrição melhor do que um maior.
Eis os números, o que significam especificamente para o trabalho de legendagem, e os modos de falha que fazem um modelo parecer pior do que realmente é.
Os modelos, lado a lado
Os parâmetros e a velocidade relativa vêm da model card do Whisper da OpenAI; os tamanhos são os totais reais das compilações CTranslate2 que o Sablate transfere, não estimativas arredondadas.
| Modelo | Parâmetros | Transferência | Velocidade vs. large-v3 | Nível no Sablate |
|---|---|---|---|---|
tiny | 39 M | ~78 MB | ~10× | Fast |
small | 244 M | ~486 MB | ~4× | Balanced |
medium | 769 M | ~1,53 GB | ~2× | Substituído |
large-v3-turbo | 809 M | ~1,62 GB | ~8× | Accurate |
large-v3 | 1550 M | ~3,09 GB | 1× | Best |
A linha que quebra o padrão é a do turbo. Tem mais parâmetros do que o medium e, ainda assim, funciona cerca de quatro vezes mais rápido, o que não é o que o número de parâmetros por si só faria prever.
Porque é que o turbo muda a recomendação
O turbo não é um modelo mais pequeno treinado do zero. É o large-v3 com o decodificador reduzido de 32 para 4 camadas, seguido de mais duas épocas de fine-tuning sobre os mesmos dados de transcrição multilingue. O Whisper passa a maior parte do tempo no decodificador, por isso um corte tão drástico compra um ganho de velocidade muito grande enquanto o codificador — a parte que realmente ouve — fica intocado.
Isto traz duas ressalvas, e ambas estão documentadas pela OpenAI, não são lenda popular:
- Foi ajustado sem dados de tradução. O turbo é um modelo de transcrição. Se quiser a tarefa do Whisper de tradução de fala para inglês, o turbo é a ferramenta errada; transcreva no idioma de origem e traduza o texto depois, que é de qualquer forma o melhor fluxo de trabalho.
- Alguns idiomas degradam-se mais do que outros. O turbo acompanha o
large-v2na maioria dos idiomas, mas perde visivelmente mais em tailandês e cantonês. Se trabalhar nesses idiomas, faça um teste antes de se comprometer.
Para tudo o resto, o turbo é a escolha sensata para legendas: uma qualidade quase ao nível do large-v3, a uma velocidade que torna uma gravação de duas horas uma tarefa viável.
O modelo maior dá sempre as melhores legendas?
Nem sempre, e a exceção vale a pena conhecer porque, quando acontece, parece um erro do software.
Medimos isto num clipe turco de 101 segundos, numa RTX 3060 Ti com float16, através do próprio caminho de transcrição da aplicação. Ordenados por quanta da fala cada modelo efetivamente captou, o medium ficou em primeiro lugar. O large-v3 saltou fala que o medium transcreveu corretamente — as palavras iniciais do clipe e várias interjeições curtas simplesmente não apareceram. Nenhuma das alavancas habituais as trouxe de volta: desativar o filtro de atividade vocal, subir o limiar de não-fala, remover o limiar de log-probabilidade, fixar a temperatura. Remover o limiar de log-probabilidade tornou tudo dramaticamente pior, reduzindo a transcrição de cerca de 1.110 carateres para 429.
Também testámos o conselho, muito repetido pela comunidade, de usar o large-v2 em vez do large-v3. Neste clipe, foi o pior de todos: deixou cair por completo um trecho contínuo de 30 segundos de fala, dos 28,7s aos 58,7s, produzindo 106 palavras onde o medium produziu 178.
Um clipe não é um benchmark, e este era curto, turco e conversacional. Retenha o método, não a classificação: transcreva o mesmo ficheiro com dois modelos, procure o que falta em vez do que está mal escrito, e escolha o que ouviu tudo. As omissões custam muito mais caro em legendas do que os erros de escrita, porque um espectador consegue ler uma palavra errada e seguir em frente, mas não consegue ler uma linha que não existe.
Quando um bom modelo parece mau
Há três modos de falha que geram queixas do tipo «o modelo grande é pior» e que não têm nada a ver com o modelo.
1. Empates nas marcas temporais por palavra quebram a divisão das linhas. O Whisper emite marcas temporais por palavra, e palavras adjacentes partilham frequentemente um limite exatamente igual — no clipe que examinámos, 172 de 177 intervalos entre palavras eram exatamente 0,000 segundos. Um divisor que corta uma legenda longa no maior intervalo encontra, portanto, todos os candidatos empatados, escolhe o primeiro e repete o processo recursivamente — arrancando uma palavra de cada vez. O sintoma é uma transcrição desfeita em legendas de uma só palavra, e agrava-se com o modelo que produz mais palavras. Corrigir o critério de desempate para favorecer o ponto médio temporal fez um clipe passar de 90 legendas (78 delas de uma só palavra) para 28 legendas, com uma única linha de uma palavra. O modelo nunca mudou.
2. O modelo que selecionou não é o modelo que correu. Os repositórios de modelos têm nomes inconsistentes entre os registos de transferência e as bibliotecas de inferência. Um modelo já transferido, guardado em disco sob um nome de repositório, enquanto o carregador procura outro, produz um recurso silencioso a outro modelo ou um erro que parece um problema de rede — com 1,6 GB do modelo correto já presentes no disco.
3. Uma nova transcrição falhada deixa a transcrição antiga no ecrã. Se uma nova execução falha e a aplicação reverte a tarefa mas mantém o nome do modelo pedido, está a olhar para o resultado do modelo anterior com a etiqueta do novo. Qualquer comparação feita a partir desse estado está errada. Se estiver a fazer um benchmark, confirme que o texto realmente mudou antes de tirar conclusões — um resultado idêntico entre dois modelos diferentes é um sinal de alerta, não uma descoberta.
VRAM, disco, e o que a sua máquina consegue correr
Os tamanhos de transferência da tabela acima são também um bom indicador da pressão sobre a memória durante a transcrição. Um guia prático:
- 4 GB de VRAM ou menos, ou sem GPU dedicada — o
smallé o ponto ideal. Otinyserve para rascunhos e verificações de tempos, não para entrega final. - 6–8 GB de VRAM — o
large-v3-turbosem dificuldade. É a configuração em que a maioria das pessoas devia estar. - 10 GB de VRAM ou mais — o
large-v3, se o áudio realmente precisar disso: acentos fortes, oradores que se sobrepõem, microfones fracos. - Só CPU — o
smallpara o que precisar de hoje para hoje, oturbose puder deixá-lo a correr sem pressa.
A precisão importa aqui tanto quanto o tamanho do modelo. As compilações CTranslate2 sobre as quais o Whisper corre suportam float16 e int8, e reduzir a precisão diminui substancialmente a memória usada, a um custo de qualidade que é pequeno em int8 e normalmente impercetível em float16 numa GPU.
Numa GPU, espere um ganho de velocidade de, aproximadamente, cinco a dez vezes em relação à mesma máquina em CPU. No Sablate para Windows, o runtime NVIDIA CUDA é transferido na primeira vez que corre numa GPU, em vez de vir incluído no instalador, o que mantém a transferência pequena para quem nunca vai usar essa via.
Que modelo deve realmente escolher?
| Situação | Modelo | Porquê |
|---|---|---|
| Verificar os tempos ou experimentar um estilo de legendas | tiny | Termina em segundos; a precisão é irrelevante aqui |
| Fala clara, um único orador, bom microfone | small | Rápido, e o editor corrige o resto |
| Escolha por predefinição para legendas finais | large-v3-turbo | Precisão quase ao nível do large, a cerca de 8× a velocidade |
| Acentos, ruído, oradores que se sobrepõem | large-v3 | Aqui, os parâmetros extra justificam o tempo que custam |
| Tailandês ou cantonês | large-v3 | O ponto fraco documentado do turbo |
| Fonte para tradução para outros idiomas | O mais preciso que conseguir suportar | Cada erro propaga-se para todos os idiomas |
Essa última linha é a que muda as contas. Quando uma transcrição é a entrada para oito traduções, um erro não é um erro — são oito. O fluxo de trabalho multilingue explica porque a transcrição de origem merece o modelo mais lento e uma revisão cuidada.
No Sablate, o Fast e o Balanced (tiny e small) correm no plano Gratuito; o Accurate e o Best fazem parte do Pro, um único pagamento de $29 detalhado na página de preços. Seja qual for o modelo que usar, o resultado chega ao mesmo editor e exporta para os mesmos formatos — SRT, VTT e ASS — por isso a escolha do modelo é sobre quanto vai corrigir depois, não sobre o que consegue produzir.
Como testar isto nas suas próprias gravações
Cinco minutos de método valem mais do que qualquer benchmark publicado, incluindo este:
- Escolha um clipe de 60 a 120 segundos que seja representativo — o seu pior microfone, os acentos habituais, a sala real onde grava.
- Transcreva-o com dois modelos candidatos, sem mudar mais nada.
- Compare primeiro as omissões, só depois os erros de escrita.
- Conte as legendas de uma só palavra. Muitas delas apontam para a segmentação, não para o modelo.
- Só depois compare o tempo real que cada um demorou, e decida quanto vale esse tempo para si.
O modelo que ouve tudo no seu material é o melhor modelo para si, e não será necessariamente o maior.