Jak dodać napisy karaoke słowo po słowie do Shorts i Reels
Napisy karaoke słowo po słowie na Shorts, Reels i TikToka: skąd bierze się czasowanie słów, trzy sposoby na wypalenie i edycje, które psują synchronizację.
Napisy słowo po słowie potrzebują czegoś, czego nie ma zwykły plik z napisami: znacznika czasu dla każdego słowa. Weź go z rozpoznawania mowy, na przykład z Whisper, wybierz, jak wypowiadane słowo ma się wyróżniać — zmianą koloru, ramką, wypełnieniem albo pokazywaniem jednego słowa naraz — i wypal napisy w wideo.
Wypalanie nie jest tu opcją. Shorts, Reels i TikTok nie przyjmują plików z napisami, więc podświetlenie musi żyć w pikselach. Niżej: skąd bierze się czasowanie słów i czemu się rozjeżdża, trzy sposoby dodania tego efektu — jeden z nich darmowy — oraz edycje, które po cichu psują synchronizację.
Czemu napisy słowo po słowie potrzebują czasowania na poziomie słów
Zwykła linijka napisów ma dwa znaczniki czasu: kiedy się pojawia i kiedy znika. To wystarcza dla linijki, która stoi w miejscu. Podświetlenie karaoke potrzebuje początku i końca dla każdego słowa wewnątrz linijki, a standardowy plik .srt nie ma gdzie tego przechować.
Whisper generuje czasowanie słów w drugim przebiegu. Gdy tekst jest już ustalony, dopasowuje każde słowo do fragmentu dźwięku, który najprawdopodobniej je wygenerował, a narzędzie wiersza poleceń openai-whisper wciąż oznacza tę opcję jako eksperymentalną. Czasowanie jest wystarczająco dobre, by napędzać podświetlenie, ale niewystarczająco dobre, by ufać mu bezkrytycznie — i ma swoją specyfikę, która decyduje o tym, jak zachowuje się podświetlenie.
Sąsiednie słowa często dzielą dokładnie tę samą granicę. W klipie, który sprawdziliśmy do naszego porównania modeli Whisper, 172 z 177 przerw między słowami wynosiło dokładnie zero sekund. Tam, gdzie prawdziwe pauzy faktycznie istnieją, narzędzie musi zdecydować, co robi wtedy podświetlenie:
- Podświetlaj tylko wypowiadane właśnie słowo. Podświetlenie gaśnie w każdej pauzie, a krótkie słowo, takie jak „i” czy „w”, błyska przez ułamek sekundy. Tak działa własny podświetlacz Whispera: w każdej przerwie zapisuje zwykłą, niepodświetloną kopię linijki.
- Trzymaj podświetlone słowo, dopóki nie zacznie się kolejne. Podświetlenie nigdy nie gaśnie, a każde słowo zostaje na ekranie wystarczająco długo, by je zarejestrować wzrokiem. Tak zachowuje się większość aplikacji do napisów i tego oczekują widzowie krótkich wideo.
Drugie podejście lepiej znosi też edycję, bo okna czasowe słów pokrywają całą linijkę od pierwszego do ostatniego słowa, nie zostawiając nic poza nimi.
Cztery style napisów karaoke
„Karaoke” obejmuje cztery różne wyglądy i warto wiedzieć, który z nich chcesz uzyskać, zanim wybierzesz narzędzie:
| Styl | Co widzi widz | Popularna nazwa |
|---|---|---|
| Kolor | Wypowiadane słowo zmienia kolor; reszta linijki zostaje biała | napisy w stylu Hormoziego |
| Ramka | Za wypowiadanym słowem pojawia się kolorowa ramka | podświetlenie w ramce (pigułka) |
| Wypełnienie | Słowa zmieniają kolor w miarę wypowiadania i zostają zmienione | klasyczne wypełnianie karaoke |
| Jedno słowo | Na ekranie widać tylko wypowiadane słowo, duże i wyśrodkowane | napisy jednosłowne |
Kolor i ramka najlepiej sprawdzają się w nagraniach mówiącej do kamery osoby. Wypełnienie to wygląd znany z teledysków z tekstem piosenki. Jedno słowo jest najbardziej nachalne z czterech stylów: mocne na hook, męczące przez całą minutę.
Trzy sposoby na dodanie napisów słowo po słowie
- Whisper i FFmpeg — darmowe, lokalne, wiersz poleceń. Zwykłe podświetlenie, pełna kontrola, trochę konfiguracji.
- Szablon napisów w edytorze wideo — CapCut albo DaVinci Resolve Studio. Jedno kliknięcie, gdy jesteś już w edytorze; różnią się warunki korzystania.
- Desktopowa aplikacja do napisów — Sablate. Presety, pionowe kadrowanie i wypalanie w jednym oknie, na twoim komputerze.
Metoda 1: Whisper i FFmpeg (darmowe, w pełni lokalne)
Do tego potrzebujesz zainstalowanych Pythona i FFmpeg, dodanych do PATH. Wszystko działa na twoim komputerze, a model Whisper pobiera się raz, przy pierwszym użyciu.
- Zainstaluj Whisper:
pip install -U openai-whisper
- Transkrybuj z włączonym czasowaniem słów i podświetlaniem, trzy słowa na linijkę:
whisper clip.mp4 --model turbo --word_timestamps True --highlight_words True --max_words_per_line 3 --output_format srt
To zapisuje plik clip.srt, w którym każde słowo dostaje własną linijkę, a wypowiadane słowo jest owinięte tagami <u>.
- Opcjonalnie zamień podkreślenie na kolor. FFmpeg odczytuje tagi
<font color>w plikach SRT, więc wystarczy znajdź-i-zamień (macOS i Linux, albo Git Bash na Windows):
sed -e 's/<u>/<font color="#FFE900">/g' -e 's#</u>#</font>#g' clip.srt > karaoke.srt
- Wypal napisy:
ffmpeg -i clip.mp4 -vf "subtitles=karaoke.srt:force_style='FontName=Arial,FontSize=16,Outline=2,MarginV=60'" -c:a copy clip-captioned.mp4
Jedna rzecz wyjaśnia te liczby. Kiedy FFmpeg wypala SRT, najpierw rozmieszcza tekst na wirtualnym płótnie 384×288, więc FontSize i MarginV są mierzone względem tych 288 jednostek, a nie pikseli twojego wideo. MarginV=60 podnosi linijkę mniej więcej o jedną piątą wysokości kadru, z dala od interfejsu Shorts i Reels. Jeśli FFmpeg zgłasza, że nie może znaleźć pliku z napisami na Windows, ścieżka wymaga escapowania — poradnik o wypalaniu napisów opisuje, jak to naprawić.
Szczere ograniczenia: dostajesz podkreślenie albo płaską zmianę koloru, bez ramki i bez animacji pop, a podświetlenie gaśnie w pauzach. Najbardziej niewygodna jest edycja. Każde słowo ma własną linijkę, która niesie cały wiersz, więc błędnie zapisane imię w trzywyrazowym wierszu jest błędne w co najmniej trzech linijkach. Popraw transkrypt, zanim wygenerujesz SRT, nie później.
Metoda 2: szablon napisów w edytorze wideo
Jeśli już montujesz w jednym z tych programów, podświetlenie słowo po słowie jest o jeden szablon dalej.
CapCut. Wygeneruj automatyczne napisy, a potem zastosuj szablon napisów z podświetleniem słów, na komputerze albo w telefonie. Wiążą się z tym dwa zastrzeżenia. Dźwięk jest przetwarzany po stronie CapCut: jego polityka prywatności mówi, że może zbierać treści „poprzez wstępne przesyłanie w momencie tworzenia, importowania lub przesyłania", na przykład po to, by wygenerować napisy. A centrum pomocy CapCut wymienia automatyczne napisy jako funkcję, która może obejmować możliwości dostępne tylko w Pro; projekt korzystający z funkcji Pro wymaga subskrypcji, żeby go wyeksportować.
DaVinci Resolve Studio. Timeline → AI Tools → Create Subtitles from Audio transkrybuje na twoim komputerze. Od Resolve 20 animowane tytuły zawierają szablon Word Highlight: przeciągnij go na nagłówek ścieżki napisów, a potem ustaw kolor, czcionkę i szybkość w Inspectorze. Automatyczne napisy to funkcja wersji Studio — $295 jednorazowo — a transkrypcja obejmuje od razu 14 języków, więcej po dodatkowym pobraniu. Jeśli masz już Studio, to najprostsza droga na tej liście.
Metoda 3: desktopowa aplikacja do napisów
Desktopowa aplikacja do napisów robi całą robotę w jednym oknie na twoim komputerze: transkrybuje, pozwala poprawić tekst, wybrać styl, skadrować pod pion i wyrenderować.
W Sablate sześć presetów podświetlania słów — Hormozi, Beast, Reels, One Word, Karaoke i Pop — pokrywa cztery style opisane wyżej, a przełącznik Word-by-word highlight dodaje ten efekt do dowolnego innego stylu, z trybem Color, Box, Fill albo Word. Czcionki napisów stojące za presetami (Montserrat ExtraBold, Anton, Bangers, Bebas Neue i Archivo Black) są dostarczane w aplikacji i w jej silniku renderującym, więc wypalanie rysuje tę samą czcionkę, którą pokazuje podgląd. Brakująca czcionka to jeden z typowych powodów, dla których wyeksportowane napisy wyglądają inaczej niż w edytorze.
Czasowanie trzyma się zasad opisanych na początku tej strony. Każde słowo zostaje podświetlone, dopóki nie zacznie się kolejne, więc podświetlenie nigdy nie gaśnie w pauzie. Poprawienie literówki zachowuje zapisane czasowanie, dopóki liczba słów się nie zmienia; dodanie albo usunięcie słowa sprawia, że tylko ta linijka wraca do czasowania szacowanego. Wypalanie rysuje libass, ten sam silnik napisów, którego używają odtwarzacze multimedialne, zamiast płaskiej nakładki, a render powstaje w 9:16, 1:1 albo 16:9 — przez przycinanie albo dopełnianie rozmytą kopią źródła.
Tam, gdzie wyprzedza pozostałe metody, są języki. Każda warstwa tłumaczenia niesie własny styl i własną czcionkę pisma, więc ten sam Short może wyjść z napisami karaoke po angielsku, hiszpańsku i koreańsku z jednej transkrypcji, jak opisuje przewodnik po napisach wielojęzycznych. Czasowanie w przetłumaczonej warstwie jest szacowane, a nie zmierzone, bo nikt tych słów nie wypowiedział, i aplikacja informuje o tym obok przełącznika.
Stylizacja słowo po słowie jest częścią Pro, za jedną płatność $29. Plan Darmowy pozwala podejrzeć każdy preset i wypala pozostałe style z małym oznaczeniem w rogu.
Której metody użyć?
| Whisper i FFmpeg | CapCut | DaVinci Resolve Studio | Sablate | |
|---|---|---|---|---|
| Cena | Darmowe | Darmowy poziom, subskrypcja Pro | $295 jednorazowo | $29 jednorazowo |
| Dźwięk opuszcza twój komputer | Nie | Tak, dla automatycznych napisów | Nie | Nie |
| Wygląd podświetlenia | Podkreślenie albo kolor | Biblioteka szablonów | Szablon Word Highlight | Kolor, ramka, wypełnienie, jedno słowo |
| Pełny edytor wideo | Nie | Tak | Tak | Nie |
| Działa na telefonie | Nie | Tak | Nie | Nie |
| Eksport pionowy 9:16 | Z dodatkowym filtrem | Tak | Tak | Tak, przycinanie albo rozmycie |
Dwa z tych wierszy przemawiają przeciwko Sablate: to nie jest edytor wideo i nie działa na telefonie. Jeśli montujesz, dodajesz muzykę i publikujesz prosto z telefonu, desktopowa aplikacja do napisów to dodatkowy krok, a nie skrót.
„Jeden klip, a ja czuję się dobrze w terminalu”. Whisper i FFmpeg. Darmowe, lokalne i wystarczająco dobre dla podświetlenia zmianą koloru.
„Już montuję w CapCut i publikuję codziennie”. Zostań przy nim. O to właśnie chodzi w szablonach, a jeśli i tak płacisz za Pro, argument kosztowy odpada.
„Montuję w DaVinci Resolve Studio”. Użyj Word Highlight. Masz już licencję, a transkrypcja zostaje lokalnie.
„Materiał nie może opuścić mojego komputera”. Cokolwiek poza CapCut. Generatory napisów offline porównują lokalne opcje dużo dokładniej.
„Ten sam Short wychodzi w trzech językach”. Sablate: jedna transkrypcja i styl karaoke dla każdego języka, z szacowanym czasowaniem w tłumaczeniach.
„To teledysk i chcę czasowania na poziomie sylab”. Aegisub, który jest darmowy. Jego tryb karaoke czasuje tagi ASS \k sylaba po sylabie, ręcznie — wolno, ale wciąż z najlepszym wynikiem dla tekstów piosenek. Format ASS to jedyny popularny format napisów, który w ogóle przechowuje czasowanie karaoke.
Jak utrzymać synchronizację napisów słowo po słowie
Podświetlenie jest tak dobre, jak czasowanie słów pod nim, a kilka nawyków utrzymuje je w całości:
- Popraw tekst, zanim ostylujesz. Czasowanie należy do słów, które zostały rozpoznane. Poprawka, która nie zmienia długości słowa, zachowuje je; przepisanie linijki je niszczy.
- Podaj Whisperowi imiona i nazwy z wyprzedzeniem. Whisper przyjmuje krótki prompt z imionami i terminami, który ukierunkowuje transkrypcję: opcja
--initial_promptalbo Defaults → Custom vocabulary w Sablate. Nazwa zapisana poprawnie za pierwszym razem nigdy nie potrzebuje poprawki, która zaburzyłaby czasowanie. To ukierunkowanie, a nie gwarancja, więc i tak sprawdź nazwy. - Dziel długie linijki, zamiast zmniejszać czcionkę. W pionowym wideo jeden wiersz liczący od trzech do pięciu słów da się przeczytać, zanim podświetlenie się przesunie; dwa pełne wiersze już nie.
- Odtwórz ponownie po zmianie czasowania. Przeciągnięcie krawędzi linijki zwykle zostawia czasowanie słów wewnątrz niej bez zmian, więc słowa najbliżej nowej krawędzi zostają ściśnięte. Delikatnie popraw, a potem obejrzyj tę linijkę raz.
- Sprawdzaj render, nie tylko podgląd. Obejrzyj pierwszą linijkę, ostatnią linijkę i najszybszy fragment, zanim wgrasz plik.
Napisy słowo po słowie to problem z czasowaniem przebrany za kwestię stylu. Zdobądź czyste czasowanie słów, utrzymuj poprawki o tej samej długości, a wygląd wybierz dopiero potem. Jeśli chcesz mieć presety, pionowe kadrowanie i kilka języków w jednym miejscu, pobierz Sablate na Windows albo Mac i przepuść przez niego jeden Short.