Zurück zum Blog

Wort-für-Wort-Karaoke-Untertitel zu Shorts und Reels hinzufügen

Wort-für-Wort-Karaoke-Untertitel für Shorts, Reels und TikTok: woher das Timing pro Wort kommt, drei Wege zum Einbrennen und was die Synchronität zerstört.

28. September 2026
Sablate Team

Wort-für-Wort-Untertitel brauchen eine Sache, die eine gewöhnliche Untertiteldatei nicht hat: einen Zeitstempel für jedes einzelne Wort. Den bekommst du von einer Spracherkennung wie Whisper, dann entscheidest du, wie das gesprochene Wort hervortritt — ein Farbwechsel, ein Kasten, eine Füllung oder jeweils nur ein Wort — und brennst die Untertitel ins Video ein.

Einbrennen ist hier keine Option, sondern Pflicht. Shorts, Reels und TikTok akzeptieren keine Untertiteldateien, die Hervorhebung muss also in den Pixeln stecken. Im Folgenden: woher das Wort-Timing kommt und warum es aus dem Takt gerät, drei Wege, den Effekt umzusetzen — einer davon kostenlos —, und die Änderungen, die die Synchronität still und leise zerstören.

Warum Wort-für-Wort-Untertitel Wort-Zeitstempel brauchen

Eine gewöhnliche Untertitelzeile hat zwei Zeitstempel: wann sie erscheint und wann sie verschwindet. Das reicht für eine Zeile, die einfach stehen bleibt. Eine Karaoke-Hervorhebung braucht dagegen einen Start- und einen Endzeitpunkt für jedes einzelne Wort in der Zeile, und eine gewöhnliche .srt hat dafür schlicht keinen Platz.

Whisper erzeugt Wort-Zeitstempel in einem zweiten Durchgang. Sobald der Text feststeht, richtet Whisper jedes Wort an dem Audioabschnitt aus, der es mit größter Wahrscheinlichkeit erzeugt hat — und die Kommandozeile von openai-whisper führt diese Option immer noch als experimentell. Die Zeitstempel reichen aus, um eine Hervorhebung zu steuern, aber nicht, um ihnen blind zu vertrauen — und sie bringen eine Eigenheit mit, die bestimmt, wie sich die Hervorhebung verhält.

Benachbarte Wörter teilen sich dabei oft exakt dieselbe Grenze. Im Clip, den wir für unseren Whisper-Modellvergleich untersucht haben, lagen 172 von 177 Lücken zwischen Wörtern bei genau null Sekunden. Wo es echte Pausen gibt, muss ein Tool entscheiden, was die Hervorhebung währenddessen tut:

  • Nur das gerade gesprochene Wort erhellen. Die Hervorhebung erlischt in jeder Pause, und ein kurzes Wort wie „ein" oder „ist" blitzt nur für ein, zwei Frames auf. Whispers eigene Hervorhebung funktioniert genau so: Sie schreibt in jede Lücke eine schlichte, unmarkierte Kopie der Zeile.
  • Jedes Wort erhellt lassen, bis das nächste beginnt. Die Hervorhebung setzt nie aus, und jedes Wort bleibt lange genug sichtbar, um wahrgenommen zu werden. So verhalten sich die meisten Untertitel-Apps, und genau das sind Zuschauer von Kurzvideos gewohnt.

Der zweite Ansatz übersteht außerdem Bearbeitungen besser, weil die Wortfenster die gesamte Untertitelzeile von ihrem ersten bis zu ihrem letzten Wort abdecken, ohne dass etwas übrig bleibt.

Die vier Karaoke-Untertitel-Stile

„Karaoke" steht für vier unterschiedliche Looks, und es hilft, vorher zu wissen, welchen du willst, bevor du ein Tool auswählst:

StilWas der Zuschauer siehtAuch genannt
FarbeDas gesprochene Wort wechselt die Farbe; der Rest der Zeile bleibt weißHormozi-Style-Untertitel
KastenEin farbiger Kasten liegt hinter dem gesprochenen WortBox- oder Pill-Hervorhebung
FüllungWörter wechseln beim Sprechen die Farbe und behalten sieKlassischer Karaoke-Sweep
Ein WortNur das gesprochene Wort ist im Bild, groß und zentriertEinzelwort-Untertitel

Farbe und Kasten wirken bei Talking-Head-Aufnahmen am besten. Füllung ist der Lyric-Video-Look. Ein Wort ist der aufdringlichste der vier Stile: stark für einen Hook, ermüdend über eine volle Minute.

Drei Wege zu Wort-für-Wort-Untertiteln

  1. Whisper und FFmpeg — kostenlos, lokal, Kommandozeile. Eine schlichte Hervorhebung, volle Kontrolle, etwas Einrichtungsaufwand.
  2. Eine Untertitel-Vorlage im Videoeditor — CapCut oder DaVinci Resolve Studio. Ein Klick, sobald du im Editor bist; was sich unterscheidet, sind die Bedingungen.
  3. Eine Desktop-App für Untertitel — Sablate. Presets, Hochformat-Ausrichtung und Einbrennen in einem Fenster, auf deinem eigenen Rechner.

Methode 1: Whisper und FFmpeg (kostenlos, komplett lokal)

Dafür brauchst du Python und FFmpeg installiert und im PATH. Alles läuft auf deinem Rechner, und das Whisper-Modell wird einmalig beim ersten Gebrauch heruntergeladen.

  1. Installiere Whisper:
pip install -U openai-whisper
  1. Transkribiere mit aktivierten Wort-Zeitstempeln und Hervorhebung, drei Wörter pro Untertitelzeile:
whisper clip.mp4 --model turbo --word_timestamps True --highlight_words True --max_words_per_line 3 --output_format srt

Das erzeugt clip.srt, worin jedes Wort seine eigene Untertitelzeile bekommt und das gesprochene Wort in <u>-Tags eingeschlossen ist.

  1. Optional kannst du die Unterstreichung in eine Farbe verwandeln. FFmpeg liest <font color>-Tags in SRT-Dateien, ein Suchen-und-Ersetzen reicht also aus (macOS und Linux, oder Git Bash unter Windows):
sed -e 's/<u>/<font color="#FFE900">/g' -e 's#</u>#</font>#g' clip.srt > karaoke.srt
  1. Brenn sie ein:
ffmpeg -i clip.mp4 -vf "subtitles=karaoke.srt:force_style='FontName=Arial,FontSize=16,Outline=2,MarginV=60'" -c:a copy clip-captioned.mp4

Ein Detail erklärt diese Zahlen. Wenn FFmpeg eine SRT einbrennt, legt es den Text zuerst auf einer virtuellen 384×288-Leinwand an, FontSize und MarginV werden also gegen diese 288 Einheiten gemessen, nicht gegen die Pixel deines Videos. MarginV=60 hebt die Zeile etwa ein Fünftel weit ins Bild hinein, mit Abstand zur Oberfläche von Shorts und Reels. Meldet FFmpeg unter Windows, dass es die Untertiteldatei nicht findet, muss der Pfad escaped werden — der Einbrenn-Guide zeigt, wie das geht.

Die ehrlichen Grenzen: Du bekommst eine Unterstreichung oder einen flachen Farbwechsel, ohne Kasten und ohne Pop-Effekt, und die Hervorhebung erlischt in Pausen. Der unangenehme Teil ist die Bearbeitung. Jedes Wort ist seine eigene Untertitelzeile mit der ganzen Zeile als Inhalt — ein falsch geschriebener Name in einer Drei-Wort-Zeile ist also in mindestens drei Untertitelzeilen falsch geschrieben. Korrigiere das Transkript, bevor du die SRT erzeugst, nicht danach.

Methode 2: Eine Untertitel-Vorlage im Videoeditor

Schneidest du ohnehin schon in einem dieser Programme, ist die Wort-Hervorhebung nur eine Vorlage entfernt.

CapCut. Erzeuge automatische Untertitel und wende dann eine Untertitel-Vorlage mit Wort-Hervorhebung an, am Desktop oder auf dem Handy. Zwei Bedingungen kommen dabei mit. Das Audio wird auf CapCuts Seite verarbeitet: Die Datenschutzrichtlinie besagt, dass Inhalte „durch Vor-Upload zum Zeitpunkt der Erstellung, des Imports oder Uploads" erfasst werden können, etwa um Untertitel zu erzeugen. Und das CapCut-Hilfecenter nennt automatische Untertitel als Funktion, die Pro-exklusive Bestandteile enthalten kann; ein Projekt, das Pro-Funktionen nutzt, braucht für den Export ein Abo.

DaVinci Resolve Studio. Timeline → AI Tools → Create Subtitles from Audio transkribiert auf deinem eigenen Rechner. Seit Resolve 20 enthalten die Animated titles eine Word-Highlight-Vorlage: Zieh sie auf den Kopf der Untertitelspur und stelle dann Farbe, Schriftart und Geschwindigkeit im Inspector ein. Automatische Untertitel sind eine Studio-Funktion — eine einmalige Zahlung von $295 — und die Transkription deckt von Haus aus 14 Sprachen ab, mehr über einen zusätzlichen Download. Besitzt du Studio bereits, ist das der sauberste Weg auf dieser Seite.

Methode 3: Eine Desktop-App für Untertitel

Eine Desktop-App für Untertitel erledigt die ganze Arbeit in einem Fenster auf deinem eigenen Rechner: transkribieren, korrigieren, einen Stil wählen, fürs Hochformat ausrichten, rendern.

In Sablate decken sechs Wort-Hervorhebungs-Presets — Hormozi, Beast, Reels, One Word, Karaoke und Pop — die vier Looks von oben ab, und der Schalter „Word-by-word highlight" fügt den Effekt jedem anderen Stil hinzu, mit Color, Box, Fill oder Word als Modus. Die Untertitel-Schriftarten hinter den Presets (Montserrat ExtraBold, Anton, Bangers, Bebas Neue und Archivo Black) sind fest in der App und in ihrem Renderer enthalten, sodass das eingebrannte Ergebnis genau die Schrift zeigt, die auch die Vorschau zeigt. Eine fehlende Schriftart ist einer der häufigsten Gründe, warum exportierte Untertitel anders aussehen als im Editor.

Das Timing folgt den Regeln vom Anfang dieser Seite. Jedes Wort bleibt erhellt, bis das nächste beginnt, die Hervorhebung setzt in einer Pause also nie aus. Ein korrigierter Tippfehler erhält die aufgezeichneten Zeitstempel, solange die Wortanzahl gleich bleibt; wird ein Wort hinzugefügt oder entfernt, fällt nur diese eine Zeile auf geschätztes Timing zurück. Das Einbrennen übernimmt libass, derselbe Untertitel-Renderer, den auch Media-Player nutzen, statt es als flaches Overlay aufzustempeln, und es rendert in 9:16, 1:1 oder 16:9, per Zuschnitt oder durch Auffüllen mit einer weichgezeichneten Kopie der Quelle.

Wo die App über die anderen Methoden hinausgeht, sind Sprachen. Jede Übersetzungsebene trägt ihren eigenen Stil und ihre eigene Schriftart für das jeweilige Schriftsystem, sodass derselbe Short aus einer einzigen Transkription mit Karaoke-Untertiteln auf Englisch, Spanisch und Koreanisch herausgehen kann, wie der mehrsprachige Workflow beschreibt. Das Timing einer Übersetzungsebene ist geschätzt statt gemessen, weil niemand diese Wörter tatsächlich gesprochen hat, und die App weist direkt neben dem Schalter darauf hin.

Wort-für-Wort-Styling gehört zu Pro, einer einmaligen Zahlung von $29. Der kostenlose Plan zeigt jedes Preset in der Vorschau und brennt die anderen Stile mit einer kleinen Markierung in der Ecke ein.

Welche Methode solltest du nutzen?

Whisper und FFmpegCapCutDaVinci Resolve StudioSablate
PreisKostenlosKostenlose Stufe, Pro-Abo$295 einmalig$29 einmalig
Audio verlässt deinen RechnerNeinJa, für automatische UntertitelNeinNein
Hervorhebungs-LooksUnterstreichung oder FarbeVorlagen-BibliothekWord-Highlight-VorlageFarbe, Kasten, Füllung, ein Wort
Vollständiger VideoeditorNeinJaJaNein
Läuft auf dem HandyNeinJaNeinNein
Vertikale 9:16-AusgabeMit einem zusätzlichen FilterJaJaJa, per Zuschnitt oder Weichzeichnung

Zwei dieser Zeilen sprechen gegen Sablate: Es ist kein Videoeditor, und es läuft nicht auf dem Handy. Schneidest du, fügst Musik hinzu und veröffentlichst direkt vom Handy aus, ist eine Desktop-App für Untertitel ein zusätzlicher Schritt statt einer Abkürzung.

„Ein Clip, und ich bin im Terminal zu Hause." Whisper und FFmpeg. Kostenlos, lokal, und gut genug für eine Hervorhebung per Farbwechsel.

„Ich schneide sowieso schon in CapCut und poste jeden Tag." Bleib dabei. Die Vorlagen sind genau der Punkt, und zahlst du ohnehin für Pro, fällt das Kostenargument weg.

„Ich schneide in DaVinci Resolve Studio." Nutze Word Highlight. Du besitzt die Lizenz bereits, und die Transkription bleibt lokal.

„Das Filmmaterial darf meinen Rechner nicht verlassen." Alles außer CapCut. Offline-Untertitel-Generatoren vergleicht die lokalen Optionen ausführlicher.

„Derselbe Short geht in drei Sprachen raus." Sablate: eine Transkription und ein Karaoke-Stil pro Sprache, mit geschätztem Timing bei den Übersetzungen.

„Es ist ein Musikvideo, und ich will Timing auf Silbenebene." Aegisub, das kostenlos ist. Sein Karaoke-Modus timet ASS-\k-Tags von Hand, Silbe für Silbe — langsam, aber immer noch das beste Ergebnis für Songtexte. Das ASS-Format ist das einzige verbreitete Untertitelformat, das Karaoke-Timing überhaupt speichert.

So bleiben Wort-für-Wort-Untertitel synchron

Die Hervorhebung ist nur so gut wie die Wort-Zeitstempel darunter, und ein paar Gewohnheiten halten sie intakt:

  • Korrigiere, bevor du stylst. Die Zeitstempel gehören zu den erkannten Wörtern. Eine längengleiche Korrektur, etwa „seid" statt „seit", erhält sie; eine ganze Zeile umzuschreiben wirft sie weg.
  • Gib Whisper die Namen vorab. Whisper akzeptiert einen kurzen Prompt mit Namen und Begriffen, der die Transkription beeinflusst: die Option --initial_prompt, oder Defaults → Custom vocabulary in Sablate. Ein Name, der gleich beim ersten Mal richtig geschrieben ist, braucht nie eine Korrektur, die das Timing stört. Das ist eine Beeinflussung, keine Garantie — lies die Namen also trotzdem gegen.
  • Teile lange Untertitelzeilen, statt die Schrift zu verkleinern. Bei vertikalem Video lässt sich eine Zeile mit drei bis fünf Wörtern lesen, während die Hervorhebung wandert; zwei volle Zeilen nicht.
  • Nach dem Retiming noch einmal abspielen. Ziehst du den Rand einer Untertitelzeile, bleiben die Wort-Zeitstempel darin meist, wo sie waren, sodass die Wörter nahe dem neuen Rand gequetscht werden. Justiere fein, und sieh dir die Zeile dann einmal an.
  • Prüfe das Render, nicht nur die Vorschau. Sieh dir die erste Untertitelzeile, die letzte und die schnellste Passage an, bevor du hochlädst.

Wort-für-Wort-Untertitel sind im Kern ein Timing-Problem, das sich als Stil verkleidet. Sorg für saubere Wort-Zeitstempel, halte deine Korrekturen längengleich, und wähle den Look erst danach. Willst du die Presets, die Hochformat-Ausrichtung und mehrere Sprachen an einem Ort, lade Sablate für Windows oder Mac herunter und lass einen Short hindurchlaufen.