Transkrypcja nagrań: audio i wideo na tekst
Wysyłasz plik audio lub wideo, dostajesz gotowy tekst w DOCX, TXT i SRT — z podziałem na mówców, timekodami i oznaczonymi miejscami, których nie da się rozszyfrować.
Co dostajesz
- Transkrypcja w DOCX i TXTTekst z akapitami, interpunkcją i podziałem na mówców — w wersji dosłownej (z „yyy”, powtórzeniami, urwanymi zdaniami) albo oczyszczonej do czytania.
- Timekody i plik napisów SRT/VTTZnaczniki czasu przy akapitach lub gotowy SRT/VTT, jeśli tekst ma wrócić pod wideo.
- Oznaczone miejsca niepewneFragmenty nie do rozszyfrowania dostajesz jako [niewyraźne 00:12:34], a nie jako zmyślone zdanie — wiesz dokładnie, którą sekundę odsłuchać.
- Skrót ustaleń ze spotkania (opcja)Jedna strona z decyzjami, zadaniami i terminami wyciągniętymi z transkrypcji — w cenie przy nagraniach powyżej 60 minut, przy krótszych +60 zł do zlecenia.
Czego potrzebujemy od ciebie
Im więcej podasz od razu, tym szybciej dostaniesz wycenę. Brakujące rzeczy dopytamy jednym pytaniem.
- Plik audio lub wideo: MP3, WAV, M4A, AAC, OGG, WMA, MP4, MOV, MKV. Na WhatsApp wyślij go jako dokument, nie jako notatkę głosową — przechodzi do 2 GB. Większy albo wygodniej: link z Dysku Google, WeTransfer albo do samego nagrania.
- Jedno zdanie, czego dotyczy nagranie, plus lista nazwisk, nazw firm i skrótów branżowych — to najmocniej podnosi dokładność.
- Język nagrania: polski i angielski robimy standardowo, rozmowy polsko-angielskie też. Inny język — napisz przed wysyłką, sprawdzamy na próbce, stawka i termin ustalane osobno.
- Decyzja: wersja dosłowna czy oczyszczona oraz czy potrzebujesz timekodów albo pliku SRT/VTT.
- Imiona mówców i informacja, kto odzywa się jako pierwszy, jeśli mają być podpisani z imienia zamiast „Mówca 1”.
Jak to przebiega
Wysyłasz plik, wycena zwykle w 15 minut
Odsłuchujemy fragment, sprawdzamy długość, liczbę głosów i jakość dźwięku, podajemy stałą kwotę. Jeśli nagranie jest za słabe na sensowną transkrypcję, dowiadujesz się o tym przed zapłatą.
Transkrypcja i odsłuch trudnych miejsc
Nagranie idzie przez rozpoznawanie mowy, potem przesłuchujemy fragmenty, w których model się gubi: przekrzykiwanie, nazwy własne, liczby, kwoty, urwane końcówki.
Redakcja i eksport
Interpunkcja, akapity, nazwy z twojej listy, podpisani mówcy, timekody. Eksport do DOCX, TXT i — jeśli trzeba — SRT/VTT.
Odbiór i jedna runda poprawek
Pliki dostajesz w grupie na WhatsApp. Zgłaszasz uwagi (źle zapisane nazwisko, inny format, druga wersja tekstu) — poprawki w cenie.
Poza tym zakresem — prowadzi człowiek
Te rzeczy też robimy, ale wychodzą poza stałą cenę. Przejmuje je Paweł, wycena indywidualna.
- Tłumaczenie transkrypcjiTekst przetłumaczony na inny język po spisaniu nagrania. Osobne zlecenie, patrz tłumaczenie polski i angielski.
- Ratowanie trudnych nagrańWiatr, dyktafon w kieszeni, muzyka głośniejsza niż rozmowa — najpierw czyszczenie dźwięku, potem spisywanie ręczne. Wycena po odsłuchu.
- Napisy wgrane do filmuWypalenie napisów w obraz zamiast oddania pliku SRT. Osobna usługa, patrz napisy do wideo.
- Protokoły i notatki ze spotkańCykliczne spisywanie zebrań z ustaleniami i listą zadań, zamiast pojedynczego pliku. Rozliczane miesięcznie.
Częste pytania
Czy to przepisuje AI, czy człowiek?
Pierwszą wersję robi silnik rozpoznawania mowy, potem odsłuchujemy nagranie i poprawiamy miejsca, w których model się gubi: nazwy własne, liczby, przekrzykiwanie, końcówki zdań. To nie jest surowy plik z automatu, ale nie jest to też przepisywanie ze słuchu słowo po słowie — dlatego jest szybciej i taniej niż u tradycyjnej transkrypcjonistki.
Jaka jest realna dokładność?
Przy czystym nagraniu (mikrofon lub headset, 1–2 osoby, spokojna rozmowa) 95–99% — poprawki to głównie nazwiska i nazwy firm. Przy telefonie na środku stołu, pięciu osobach i echu w sali schodzi do 80–90%, rozdzielenie mówców potrafi się pomylić, a część fragmentów zostanie oznaczona jako niewyraźne. Stu procent nie obiecujemy — przy mowie z życia to nie istnieje.
Wersja dosłowna czy oczyszczona — którą wybrać?
Dosłowna do badań jakościowych (IDI, FGI), analiz językowych i sytuacji, gdzie liczy się dokładnie to, co padło. Oczyszczona — bez „yyy”, zająknięć i powtórzeń — do czytania, notatek i publikacji. Jeśli nie napiszesz, robimy oczyszczoną.
Co z żargonem, nazwiskami i nagraniami po angielsku?
Angielskie wtrącenia w polskiej rozmowie zapisujemy poprawnie, całe nagrania po angielsku też przyjmujemy. Inny język sprawdzamy na próbce przed wyceną i liczymy osobno, termin bywa wtedy dłuższy. Nazwiska, nazwy firm, produktów i skróty typu „WZ”, „RCP”, „SKU” wymagają listy od ciebie — bez niej model zapisze je fonetycznie i będzie co poprawiać. Silna gwara i bardzo szybka mowa obniżają dokładność, uprzedzamy o tym po odsłuchu próbki.
Co dzieje się z moim nagraniem?
Nagranie przechodzi przez silnik rozpoznawania mowy dostawcy zewnętrznego — bez tego usługa nie mogłaby powstać, a część przetwarzania odbywa się poza EOG. Nie trafia do zbiorów treningowych, nie publikujemy go i nie przekazujemy dalej. Pliki robocze kasujemy 30 dni po odbiorze, wcześniej na twoją prośbę. Przy zleceniach firmowych podpisujemy umowę powierzenia — każde nagranie rozmowy z rozpoznawalnymi osobami to dane osobowe, więc to standard, a nie formalność dla wybranych; wtedy plik przyjmiemy linkiem do dysku zamiast WhatsAppem.
Czy potrzebuję zgody osób nagranych?
Za legalność samego nagrania odpowiadasz ty — zakładamy, że masz podstawę prawną i że uczestnicy rozmowy wiedzieli o rejestracji. Nagrań zdobytych bez wiedzy rozmówców w sprawach prywatnych nie przyjmujemy. Gotowy tekst jest twój i nie zostawiamy sobie do niego praw. Nie robimy natomiast transkrypcji poświadczonych ani opinii biegłego: tekst możesz złożyć w sprawie jako zwykły dokument, ale nie jest urzędowo poświadczony — jeśli potrzebujesz takiego, kieruj się do biegłego z listy sądowej. Pozostałe zasady rozliczeń i praw: /zasady/
Podobne zlecenia
Opisz zlecenie jednym zdaniem
Agent odpisze z ceną i terminem, zwykle w kwadrans. Nie pasuje — nic nie płacisz.
Każdą wiadomość agenta poznasz po znaczniku [AGENT].