Automatyczne napisy nie muszą oznaczać przesyłania nagrania na zewnętrzny serwer. Lokalny model rozpoznawania mowy może przeanalizować ścieżkę audio na komputerze, przygotować tekst z kodami czasu i zapisać go jako plik SRT lub VTT. Kluczowe jest dobranie odpowiedniego programu, modelu oraz ustawień do jakości nagrania i możliwości sprzętu.

  • Whisper i inne modele rozpoznawania mowy mogą działać całkowicie lokalnie, bez przesyłania filmu do zewnętrznej usługi.
  • Najłatwiejszym rozwiązaniem dla początkujących jest zwykle Subtitle Edit, Buzz albo funkcja rozpoznawania mowy w Kdenlive.
  • Do transkrypcji języka polskiego należy wybierać model wielojęzyczny, a nie wersję oznaczoną końcówką .en.
  • Większy model zazwyczaj zapewnia lepszy tekst, ale potrzebuje więcej pamięci i dłuższego czasu przetwarzania.
  • Automatyczne napisy zawsze wymagają kontroli nazw własnych, interpunkcji, podziału wierszy i synchronizacji z obrazem.

Co oznacza tworzenie napisów bez chmury?

W rozwiązaniu lokalnym zarówno film, jak i wyodrębniona z niego ścieżka dźwiękowa są przetwarzane na komputerze użytkownika. Program uruchamia model rozpoznawania mowy, który zamienia wypowiedzi na tekst, wyznacza przybliżone kody czasu i dzieli transkrypcję na kolejne napisy.

Plik może zawierać poufne rozmowy, nieopublikowany materiał, nagranie szkoleniowe albo wywiad objęty umową. W takim przypadku lokalne przetwarzanie ogranicza ryzyko związane z wysyłaniem materiału do operatora internetowej usługi.

Nie oznacza to jednak, że połączenie z internetem nigdy nie będzie potrzebne. Program oraz model trzeba najpierw pobrać. Przykładowo Subtitle Edit może automatycznie pobrać wybrany silnik i jego model podczas pierwszego uruchomienia. Po zapisaniu wszystkich potrzebnych plików właściwa transkrypcja może odbywać się bez dostępu do sieci. 

Przy szczególnie wrażliwych nagraniach najlepiej po pobraniu modelu odłączyć komputer od internetu albo zablokować aplikacji dostęp do sieci w zaporze systemowej. Trzeba również upewnić się, że wybrano silnik lokalny, a nie serwer zgodny z API OpenAI lub inną usługę internetową.

Jak działa AI do tworzenia napisów do filmu bez chmury?

Lokalny generator napisów wykonuje kilka operacji, które wcześniej trzeba było przeprowadzać ręcznie. Najpierw odczytuje lub wyodrębnia dźwięk z filmu. Następnie dzieli nagranie na krótsze fragmenty i przekazuje je do modelu ASR, czyli systemu automatycznego rozpoznawania mowy.

Whisper został przygotowany jako model wielozadaniowy. Potrafi rozpoznawać mowę w wielu językach, identyfikować język oraz wykonywać tłumaczenie mowy na język angielski. Do tworzenia polskich napisów potrzebna jest funkcja transkrypcji, czyli zapisania wypowiedzi w tym samym języku. 

Rezultatem działania modelu jest tekst połączony ze znacznikami czasu. Program do napisów zamienia te dane na kolejne segmenty, które można edytować i zapisać między innymi jako:

  • SRT – najpopularniejszy format prostych napisów tekstowych,
  • VTT – format często stosowany na stronach internetowych,
  • TXT – sama transkrypcja bez pełnej struktury napisów,
  • napisy osadzone bezpośrednio na osi czasu edytora wideo.

Automatyczna transkrypcja stanowi punkt wyjścia, a nie gotowy materiał do publikacji. Model może pomylić podobnie brzmiące wyrazy, nie rozpoznać nazwiska albo wygenerować tekst podczas ciszy. OpenAI w dokumentacji Whispera wskazuje, że model może tworzyć fragmenty, których nie było w nagraniu, oraz powtarzać tekst. 

Jaki program do lokalnego tworzenia napisów wybrać?

Nie ma jednego narzędzia najlepszego dla każdego użytkownika. Inny program sprawdzi się podczas szybkiego przygotowania pliku SRT, a inny przy montażu całego filmu.

Subtitle Edit to jeden z najbardziej praktycznych wyborów dla użytkowników Windows. Program umożliwia otwarcie filmu, uruchomienie funkcji „Speech to text”, wybór silnika i modelu, a następnie edycję tekstu oraz synchronizacji. Obsługuje między innymi Whisper CPP, Faster Whisper, CTranslate2 i rozwiązania korzystające z akceleracji CUDA, Vulkan lub MLX na komputerach Apple Silicon. Pozwala też poprawiać wielkość liter, łączyć wiersze i korygować czasy napisów. 

Buzz będzie dobrym wyborem dla osób oczekujących prostego interfejsu i działania na Windowsie, macOS lub Linuksie. Program przetwarza nagrania lokalnie, umożliwia eksport do TXT, SRT i VTT oraz obsługuje kilka wariantów silnika Whisper. Może korzystać z CUDA na kartach NVIDIA, rozwiązań przygotowanych dla Apple Silicon oraz akceleracji Vulkan dostępnej w whisper.cpp. 

Kdenlive przyda się wtedy, gdy napisy mają powstać bezpośrednio podczas montażu. Edytor może utworzyć ścieżkę napisów na osi czasu i automatycznie wypełnić ją tekstem rozpoznanym przez Whisper. Pozwala wybrać analizowany fragment filmu, język nagrania oraz maksymalną liczbę znaków w wierszu. Gotowe segmenty pojawiają się bezpośrednio w projekcie. 

whisper.cpp jest rozwiązaniem dla bardziej zaawansowanych użytkowników. To lekka implementacja Whispera w C i C++, która może działać na samym procesorze, korzystać z kwantyzowanych modeli oraz wykorzystywać między innymi CUDA, Vulkan, Metal, OpenVINO i ROCm. Dobrze sprawdza się w skryptach, automatycznym przetwarzaniu wielu plików i systemach działających bez rozbudowanego interfejsu graficznego. 

AI do tworzenia napisów do filmu bez chmury – praktyczny poradnik i rozwiązania
Źródło: Canva Pro

Jaki model Whisper wybrać do napisów po polsku?

Whisper występuje w kilku rozmiarach. Większy model zazwyczaj lepiej radzi sobie z trudnym nagraniem, ale przetwarza materiał wolniej i potrzebuje większej ilości pamięci.

Do języka polskiego należy wybrać model wielojęzyczny. Modele z końcówką .en są przeznaczone wyłącznie do języka angielskiego.

Tiny i base nadają się do szybkich testów, krótkich filmów oraz komputerów o ograniczonych zasobach. Przy czystym głosie mogą przygotować użyteczny szkic, ale częściej mylą końcówki, nazwy oraz mniej wyraźne wypowiedzi.

Small jest rozsądnym punktem startowym do nagrań po polsku. Nie wymaga tak mocnego sprzętu jak większe warianty, a przy dobrym dźwięku potrafi przygotować materiał, który wymaga głównie korekty redakcyjnej.

Medium warto wybrać przy wywiadach, materiałach edukacyjnych, nagraniach z kilkoma osobami lub dźwięku z umiarkowanym pogłosem. Przetwarzanie będzie wolniejsze, ale model zwykle lepiej zachowuje kontekst wypowiedzi.

Large i large-v3 są przeznaczone do zadań, w których priorytetem jest dokładność. Ich użycie ma sens przy długich materiałach profesjonalnych, pod warunkiem że komputer dysponuje odpowiednią ilością pamięci.

Turbo jest zoptymalizowanym wariantem large-v3 przygotowanym z myślą o szybszej transkrypcji. Według dokumentacji OpenAI potrzebuje mniej czasu niż pełny model large, zachowując zbliżoną dokładność. Nie jest jednak przeznaczony do tłumaczenia mowy na angielski. Do tworzenia polskich napisów na podstawie polskiej ścieżki może być bardzo dobrym wyborem. 

Jakiego komputera potrzeba do lokalnych napisów AI?

Podstawową transkrypcję można przeprowadzić bez dedykowanej karty graficznej. whisper.cpp obsługuje przetwarzanie wyłącznie na CPU, dlatego lokalne napisy da się przygotować również na zwykłym laptopie biurowym. Trzeba jedynie liczyć się z dłuższym czasem oczekiwania. 

W praktyce komputer z 8 GB RAM powinien wystarczyć do uruchamiania mniejszych modeli, ale system i pozostałe aplikacje mogą pozostawić niewielki zapas pamięci. 16 GB RAM zapewnia wygodniejsze warunki do pracy z modelem small lub medium oraz jednoczesnego otwarcia edytora wideo.

W oryginalnej implementacji Whispera orientacyjne zapotrzebowanie na pamięć VRAM wynosi około 1 GB dla modeli tiny i base, 2 GB dla small, 5 GB dla medium, 6 GB dla turbo oraz 10 GB dla large. Rzeczywiste wymagania zależą jednak od programu, użytego silnika, precyzji obliczeń i kwantyzacji modelu. 

Dedykowana karta graficzna nie zawsze poprawi wydajność automatycznie. Program musi obsługiwać odpowiedni mechanizm akceleracji:

  • karty NVIDIA mogą korzystać z CUDA,
  • komputery Apple Silicon mogą używać Metal, Core ML lub MLX,
  • część kart Intel i AMD może przyspieszać obliczenia przez Vulkan,
  • procesory i układy graficzne Intel mogą w niektórych konfiguracjach korzystać z OpenVINO.

Do sporadycznego tworzenia napisów wystarczy szybki, współczesny procesor. Przy regularnej obróbce wielogodzinnych filmów obsługiwana karta graficzna potrafi skrócić pracę znacznie bardziej niż sama zmiana procesora.

Jak utworzyć napisy do filmu lokalnie krok po kroku?

Poniższy schemat można zastosować w Subtitle Edit, Buzz, Kdenlive i większości innych programów wykorzystujących lokalny model Whisper.

Krok 1. Przygotuj film i kopię materiału

Pracuj na kopii pliku, szczególnie gdy zamierzasz później osadzać napisy w obrazie lub ponownie kodować film. Samo utworzenie zewnętrznego pliku SRT nie zmienia nagrania, ale eksport filmu z nałożonym tekstem może zastąpić wcześniejszą wersję.

Jeżeli dźwięk jest bardzo cichy lub zaszumiony, najpierw przygotuj poprawioną kopię ścieżki audio. Nie należy jednak stosować agresywnego odszumiania, które zniekształca głos i usuwa końcówki wyrazów.

Krok 2. Zainstaluj program i pobierz model

Pobierz aplikację z oficjalnej strony projektu lub jego repozytorium. Następnie wybierz lokalny silnik, na przykład Whisper CPP albo Faster Whisper, i pobierz model wielojęzyczny.

Pierwsze pobranie może zajmować od kilkudziesięciu megabajtów do kilku gigabajtów. Po zakończeniu warto sprawdzić działanie aplikacji przy odłączonym internecie.

Krok 3. Otwórz film lub ścieżkę audio

Program może przyjąć bezpośrednio plik MP4, MKV lub MOV albo samodzielnie wyodrębnić z niego dźwięk. W narzędziach wykorzystujących wiersz poleceń może być konieczne wcześniejsze przekonwertowanie audio za pomocą FFmpeg.

whisper.cpp w podstawowym przykładzie korzysta z plików WAV o odpowiednich parametrach, choć niektóre kompilacje oferują szerszą obsługę formatów dzięki FFmpeg.

Krok 4. Ustaw język polski i tryb transkrypcji

Jeżeli program umożliwia ręczne wskazanie języka, wybierz Polish lub Polski. Automatyczne wykrywanie jest wygodne, ale może pomylić język w bardzo krótkim nagraniu, materiale z muzyką albo rozmowie zawierającej wiele obcych zwrotów.

Wybierz tryb transkrypcji, nie tłumaczenia. Opcja tłumaczenia w Whisperze służy głównie do tworzenia angielskiego tekstu z nagrania w innym języku.

Krok 5. Wygeneruj napisy

Uruchom rozpoznawanie i poczekaj na zakończenie analizy. Nie należy w tym czasie przełączać laptopa w tryb uśpienia. Przy pracy na procesorze większy model może przetwarzać film dłużej niż trwa samo nagranie.

Na początek można wygenerować napisy dla kilkuminutowego fragmentu. Pozwoli to ocenić jakość i szybkość przed analizą całego filmu.

Krok 6. Popraw tekst i synchronizację

Odtwórz film razem z wygenerowanymi napisami. W pierwszej kolejności sprawdź:

  • nazwiska, marki i specjalistyczne terminy,
  • liczby, daty oraz jednostki,
  • interpunkcję i wielkie litery,
  • moment pojawienia się i zniknięcia tekstu,
  • zbyt długie wiersze,
  • fragmenty utworzone podczas ciszy lub muzyki.

Dobrym punktem wyjścia są maksymalnie dwa wiersze i około 37–42 znaków w jednym wierszu. Nie jest to sztywna reguła dla każdej platformy, ale zwykle poprawia czytelność tekstu na małych ekranach.

Krok 7. Zapisz SRT, VTT lub film z napisami

Zewnętrzny plik SRT jest najłatwiejszy do poprawienia i może zostać włączony lub wyłączony przez widza. Nazwa pliku powinna odpowiadać nazwie filmu, na przykład:

wywiad.mp4
wywiad.srt

Format VTT sprawdzi się przy publikacji filmu na stronie internetowej. Napisy można również umieścić w kontenerze MKV albo wypalić na stałe w obrazie. Wypalonego tekstu nie da się później wyłączyć, dlatego tę wersję najlepiej eksportować dopiero po pełnej korekcie.

Jak poprawić dokładność automatycznych napisów?

Największy wpływ na wynik ma jakość dźwięku. Nawet duży model może mieć problemy, gdy rozmówca stoi daleko od mikrofonu, kilka osób mówi jednocześnie albo muzyka zagłusza wypowiedzi.

Przed zmianą modelu warto sprawdzić, czy można poprawić sam materiał:

  • ograniczyć jednostajny szum,
  • podnieść poziom zbyt cichego głosu,
  • wyciąć długie fragmenty ciszy,
  • wybrać kanał, na którym głos jest wyraźniejszy,
  • rozdzielić bardzo długie nagranie na logiczne części.

W programach obsługujących VAD, czyli wykrywanie aktywności głosowej, warto włączyć tę funkcję. Pomaga ona odróżnić wypowiedzi od ciszy i może ograniczyć generowanie przypadkowych zdań w miejscach bez mowy.

Jeżeli transkrypcja regularnie myli nazwy własne, nie zawsze pomoże kolejny większy model. Nazwiska, nazwy miejscowości i oznaczenia produktów często trzeba poprawić ręcznie. Przy materiałach branżowych dobrym rozwiązaniem jest przygotowanie listy poprawnej pisowni przed rozpoczęciem korekty.

Najczęstsze problemy z lokalnymi napisami AI

Program tworzy tekst podczas ciszy.
Włącz VAD, usuń długie puste fragmenty albo podziel materiał na krótsze części. Konieczna może być również zmiana parametrów wykrywania ciszy.

Model wybiera niewłaściwy język.
Zamiast automatycznego rozpoznawania ustaw ręcznie język polski. Jest to szczególnie ważne przy krótkich filmach i nagraniach zawierających wiele angielskich nazw.

Napisy są przesunięte względem dźwięku.
W Subtitle Edit można skorzystać z korekty czasów oraz widoku fali dźwiękowej. W Kdenlive segmenty można przesuwać bezpośrednio na osi czasu. Przy stałym przesunięciu wystarczy zmienić czas wszystkich napisów o tę samą wartość.

Transkrypcja trwa zbyt długo.
Wybierz model small zamiast medium lub large, sprawdź obsługę akceleracji GPU albo uruchom przetwarzanie na krótszym fragmencie. Na słabszym komputerze większy model nie zawsze będzie opłacalny.

Komputerowi brakuje pamięci.
Zamknij edytor wideo i inne wymagające aplikacje, wybierz mniejszy lub kwantyzowany model i upewnij się, że program nie próbuje równocześnie przetwarzać kilku plików.

Jak upewnić się, że nagranie naprawdę nie trafia do chmury?

Sama obecność nazwy Whisper nie gwarantuje lokalnego działania. Program może korzystać zarówno z modelu zapisanego na komputerze, jak i z internetowego API.

Przed rozpoczęciem pracy należy sprawdzić:

  • czy wybrany silnik jest opisany jako local, Whisper CPP, Faster Whisper albo CTranslate2,
  • czy model został pobrany na dysk,
  • czy program nie wymaga wpisania klucza API,
  • czy nie została włączona internetowa funkcja tłumaczenia,
  • czy transkrypcja działa po odłączeniu sieci.

W Subtitle Edit na liście dostępne są zarówno silniki lokalne, jak i połączenie z serwerem zgodnym z API OpenAI. Do pracy bez chmury trzeba świadomie wybrać jeden z lokalnych wariantów. 

Lokalne przetwarzanie nie zwalnia również z przestrzegania praw osób nagranych. Nie należy transkrybować prywatnych rozmów bez odpowiedniej podstawy i wiedzy uczestników. Dokumentacja modelu Whisper wyraźnie ostrzega przed wykorzystywaniem go do transkrypcji osób nagranych bez zgody. 

Które rozwiązanie sprawdzi się najlepiej?

Dla użytkownika Windows, który chce szybko otrzymać edytowalny plik SRT, najbardziej praktycznym zestawem będzie Subtitle Edit z lokalnym Whisper CPP lub Faster Whisper. Model small powinien być dobrym punktem startowym, a medium można wybrać wtedy, gdy jakość nagrania jest słabsza.

Osoba montująca cały materiał może skorzystać z Kdenlive i wbudowanego generatora napisów Whisper. Pozwala to uniknąć przenoszenia plików pomiędzy kilkoma aplikacjami i od razu dopasować napisy do osi czasu.

Buzz sprawdzi się jako prosty, wieloplatformowy program do transkrypcji i eksportu SRT lub VTT. Natomiast whisper.cpp będzie najlepszym wyborem przy automatyzacji, przetwarzaniu wielu plików i pracy na komputerze bez rozbudowanego środowiska graficznego.

Niezależnie od programu, AI powinno przygotować pierwszy szkic, a człowiek zatwierdzić ostateczny tekst. Kilkanaście minut korekty może zdecydować o tym, czy napisy rzeczywiście pomagają widzowi, czy jedynie powielają błędy automatycznego rozpoznawania.