Torna al blog

Confronto tra i modelli Whisper per i sottotitoli: Tiny, Small, Turbo e Large-v3

Confronto tra i modelli Whisper per i sottotitoli: parametri, download reali e velocità di tiny, small, turbo e large-v3 — più grande non è sempre meglio.

11 settembre 2026
Sablate Team

Il modello Whisper più grande non è automaticamente il migliore per i sottotitoli. large-v3-turbo ha circa la metà dei parametri di large-v3 ed è circa otto volte più rapido, e su un girato ordinario la differenza nel file di sottotitoli finito è così piccola che a decidere è la velocità. Esistono anche casi concreti in cui un modello più piccolo produce una trascrizione migliore di uno più grande.

Ecco i numeri, cosa significano in concreto per il lavoro sui sottotitoli, e le modalità di errore che fanno sembrare un modello peggiore di quanto sia.

I modelli a confronto

Parametri e velocità relativa vengono dalla model card di Whisper pubblicata da OpenAI; le dimensioni sono i totali reali delle build CTranslate2 che Sablate scarica, non stime arrotondate.

ModelloParametriDownloadVelocità vs large-v3Livello Sablate
tiny39 M~78 MB~10×Fast
small244 M~486 MB~4×Balanced
medium769 M~1,53 GB~2×Sostituito
large-v3-turbo809 M~1,62 GB~8×Accurate
large-v31550 M~3,09 GBBest

La riga che rompe lo schema è turbo. Ha più parametri di medium ma è comunque circa quattro volte più rapido, il che non è quello che il solo conteggio dei parametri farebbe prevedere.

Perché turbo cambia il consiglio

Turbo non è un modello più piccolo addestrato da zero. È large-v3 con il decoder ridotto da 32 livelli a 4, poi ri-addestrato per altre due epoche sui medesimi dati di trascrizione multilingue. Whisper passa la maggior parte del suo tempo nel decoder, quindi tagliarlo così drasticamente porta un guadagno di velocità molto grande, mentre l'encoder — la parte che ascolta davvero — resta intatto.

Vengono con due avvertenze, entrambe documentate da OpenAI e non semplice sentito dire:

  • È stato ri-addestrato senza dati di traduzione. Turbo è un modello di trascrizione. Se ti serve il compito di traduzione vocale verso l'inglese di Whisper, turbo è lo strumento sbagliato; trascrivi nella lingua di partenza e traduci il testo in un secondo momento, che è comunque il flusso di lavoro migliore.
  • Alcune lingue perdono più di altre. Turbo segue large-v2 nella maggior parte delle lingue, ma perde qualità in modo più marcato su thai e cantonese. Se lavori con queste lingue, testalo prima di impegnarti.

Per tutto il resto, turbo è la scelta predefinita sensata per i sottotitoli: una qualità vicina a large con una velocità che rende praticabile anche una registrazione di due ore.

Il modello più grande dà sempre i sottotitoli migliori?

Non sempre, e l'eccezione vale la pena di conoscerla perché, quando ci si imbatte, sembra un bug.

Lo abbiamo misurato su una clip turca di 101 secondi, su una RTX 3060 Ti con float16, attraverso lo stesso percorso di trascrizione dell'app. In classifica per quanto parlato ha effettivamente colto ciascun modello, medium è arrivato primo. large-v3 ha saltato parlato che medium ha trascritto correttamente — le prime parole della clip e diverse brevi interiezioni semplicemente non sono apparse. Nessuna delle leve abituali le ha fatte tornare: disattivare il filtro di rilevamento vocale, alzare la soglia no-speech, rimuovere la soglia di log-probability, fissare la temperatura. Rimuovere la soglia di log-probability ha peggiorato la situazione in modo drastico, facendo scendere la trascrizione da circa 1.110 a 429 caratteri.

Abbiamo testato anche il consiglio, molto diffuso nella community, di usare large-v2 invece di large-v3. Su questa clip è risultato il peggiore del gruppo: ha perso del tutto un tratto continuo di 30 secondi di parlato, da 28,7 a 58,7 secondi, producendo 106 parole contro le 178 di medium.

Una sola clip non è un benchmark, e questa era breve, turca e colloquiale. Prendi il metodo, non la classifica: trascrivi lo stesso file con due modelli, guarda cosa manca piuttosto che cosa è scritto male, e scegli quello che ha sentito tutto. Nei sottotitoli le omissioni costano molto più dei typo, perché uno spettatore può leggere oltre una parola sbagliata, ma non può leggere una riga che non c'è.

Quando un buon modello sembra scadente

Tre modalità di errore producono lamentele del tipo «il modello grande è peggiore» che non hanno nulla a che fare con il modello.

1. I pareggi tra i timestamp delle parole rompono la divisione delle righe. Whisper emette timestamp per singola parola, e le parole adiacenti condividono spesso un confine esattamente identico — nella clip esaminata, 172 intervalli su 177 erano esattamente 0,000 secondi. Un divisore che spezza una battuta lunga nell'intervallo più ampio trova quindi ogni candidato in parità, prende il primo e procede in modo ricorsivo — staccando una parola alla volta. Il sintomo è una trascrizione fatta a pezzi in sottotitoli di una sola parola, e peggiora con il modello che produce più parole. Correggere il pareggio per favorire il punto medio temporale ha portato una clip da 90 battute (78 delle quali di una sola parola) a 28 battute con una sola riga di una parola. Il modello non è mai cambiato.

2. Il modello che hai selezionato non è il modello che è stato eseguito. I repository dei modelli hanno nomi incoerenti tra i registri di download e le librerie di inferenza. Un modello scaricato e presente sul disco sotto un nome di repository, mentre il loader ne cerca un altro, produce un fallback silenzioso oppure un errore che sembra un problema di rete — mentre 1,6 GB del modello corretto sono già lì.

3. Una ri-trascrizione fallita lascia a schermo la vecchia trascrizione. Se un nuovo tentativo fallisce e l'applicazione riporta indietro il lavoro ma mantiene il nome del modello richiesto, quello che stai guardando è l'output del modello precedente etichettato come il nuovo. Ogni confronto fatto in questo stato è sbagliato. Se stai facendo un benchmark, verifica che il testo sia davvero cambiato prima di tirare conclusioni — un output identico da due modelli diversi è un campanello d'allarme, non un risultato.

VRAM, disco e cosa può eseguire il tuo computer

Le dimensioni di download nella tabella sopra sono anche un buon indicatore della pressione sulla memoria durante la trascrizione. Indicazioni pratiche:

  • 4 GB di VRAM o meno, oppure nessuna GPU dedicatasmall è il punto di equilibrio. tiny serve per le bozze e i controlli di tempistica, non per la consegna finale.
  • 6–8 GB di VRAMlarge-v3-turbo senza problemi. È la configurazione su cui dovrebbe stare la maggior parte delle persone.
  • 10 GB di VRAM o piùlarge-v3, se l'audio ne ha davvero bisogno: accenti marcati, parlanti che si sovrappongono, microfoni scarsi.
  • Solo CPUsmall per qualsiasi cosa ti serva oggi, turbo se puoi lasciarlo lavorare senza fretta.

Qui la precisione conta quanto le dimensioni del modello. Le build CTranslate2 su cui gira Whisper supportano float16 e int8, e abbassare la precisione riduce sensibilmente la memoria a un costo di qualità che è piccolo per int8 e di solito impercettibile per float16 su una GPU.

Su GPU, aspettati un'accelerazione di circa 5–10 volte rispetto alla stessa macchina su CPU. In Sablate su Windows, il runtime NVIDIA CUDA viene scaricato la prima volta che parte un lavoro su GPU, invece di essere incluso nell'installer, il che mantiene piccolo il download per chi non lo userà mai.

Quale modello dovresti davvero scegliere?

SituazioneModelloPerché
Controllare le tempistiche o provare uno stile di didascalietinyFinisce in pochi secondi; qui la precisione non conta
Parlato chiaro, un solo parlante, microfono buonosmallRapido, e per il resto ci pensa l'editor
Impostazione predefinita per sottotitoli consegnatilarge-v3-turboPrecisione vicina a large a circa 8× la velocità
Accenti, rumore, parlanti che si sovrappongonolarge-v3Qui i parametri extra si guadagnano il tempo che costano
Thai o cantoneselarge-v3Il punto debole documentato di turbo
Fonte per la traduzione in altre lingueIl più preciso che ti puoi permettereOgni errore si propaga in ogni lingua

È l'ultima riga quella che cambia i calcoli. Quando una trascrizione è l'input per otto traduzioni, un errore non è un errore — sono otto. Il flusso di lavoro multilingue spiega perché la trascrizione di partenza merita il modello più lento e una revisione attenta.

In Sablate, Fast e Balanced (tiny e small) girano sul piano gratuito; Accurate e Best fanno parte di Pro, un unico pagamento di $29 descritto nella pagina dei prezzi. Qualunque modello tu esegua, il risultato finisce nello stesso editor e si esporta negli stessi formati — SRT, VTT e ASS — quindi la scelta del modello riguarda quanto dovrai correggere dopo, non quello che puoi produrre.

Come testarlo sul tuo girato

Cinque minuti di metodo valgono più di qualsiasi benchmark pubblicato, incluso questo:

  1. Prendi una clip di 60-120 secondi che sia rappresentativa — il tuo microfono peggiore, i tuoi accenti abituali, la stanza che usi davvero.
  2. Trascrivila con due modelli candidati, senza cambiare altro.
  3. Confronta prima le omissioni, poi gli errori di ortografia.
  4. Conta le battute di una sola parola. Se sono tante, il problema è la segmentazione, non il modello.
  5. Solo a questo punto confronta il tempo di esecuzione reale, e decidi quanto vale per te quel tempo.

Il modello migliore per te è quello che sente tutto nel tuo materiale, e non è necessariamente il più grande.