Niedawno musiałem znaleźć najlepszy generator kobiecego głosu oparty na sztucznej inteligencji do projektu FixThePhoto i szybko zdałem sobie sprawę, że naturalnie brzmiące głosy to nie jedyna rzecz, która się liczy.
Do naszego projektu FixThePhoto potrzebowałem kobiecego głosu AI do samouczków, filmów promocyjnych i krótkich postów w mediach społecznościowych. Chcieliśmy uniknąć samodzielnego nagrywania każdego skryptu, ale znalezienie głosu, który sprawdziłby się w różnych formatach, było trudniejsze, niż się spodziewałem. Musiał brzmieć naturalnie i ekspresyjnie, a nie jak typowa mowa generowana komputerowo.
Porównując narzędzia, zwracałem uwagę nie tylko na to, jak przyjemnie brzmiały głosy. Zwracałem szczególną uwagę na wyraźną wymowę, naturalne pauzy, zmiany tonu i to, jak dobrze każdy głos przekazywał emocje. Miało to znaczenie, ponieważ nasze scenariusze obejmowały zarówno proste instrukcje krok po kroku, jak i bardziej żywe treści promocyjne.
Porównałem również zakres dostępnych głosów, akcentów i języków, opcje edycji, jakość dźwięku oraz szybkość generowania dźwięku przez każde narzędzie. Sprawdziłem, czy mogę kontrolować przekaz, na przykład ton i tempo mówienia. Ponieważ nagrania były przeznaczone do profesjonalnych projektów FixThePhoto, przyjrzałem się również licencjonowaniu do użytku komercyjnego, cenom oraz temu, jak łatwo mogę zapisać pliki audio.
Do testu użyłam tych samych skryptów dla każdego generatora głosu żeńskiego, aby porównanie było sprawiedliwe. Zestaw obejmował krótką instrukcję obsługi, wprowadzenie do produktu, luźny wpis w mediach społecznościowych oraz dłuższy fragment zawierający liczby i terminy techniczne. To pomogło mi sprawdzić, jak dobrze każdy głos sprawdza się w różnych rodzajach treści.
Zwracałem uwagę na to, jak każdy głos radził sobie z wymową, oddechem, pauzami i zmianami tonu. W miarę możliwości uruchamiałem ten sam skrypt kilka razy, aby sprawdzić, czy wyniki są spójne. Dzięki temu łatwiej było stwierdzić, które narzędzia dawały wiarygodne wyniki, zamiast jednego wyjątkowo dobrego ujęcia.
Razem z kolegami z Zespół FixThePhoto wybraliśmy kilka najpopularniejszych narzędzi do tworzenia kobiecych głosów AI. Gdy już ustaliliśmy kryteria i plan testów, od razu zabraliśmy się do pracy, aby móc porównać dostępne opcje bez marnowania czasu.
Zacznij od przejrzystego tekstu. Wyeliminuj zbędne symbole, unikaj niezręcznych skrótów i staraj się, aby zdania były krótkie i łatwe do wypowiedzenia na głos. Tekst powinien brzmieć naturalnie, gdy jest czytany.
Wybierz styl treści. Delikatny, uspokajający ton pasuje do filmów instruktażowych, a żywy przekaz może sprawić, że reklamy i krótkie posty będą bardziej atrakcyjne.
Używaj interpunkcji, aby kontrolować przekaz. Interpunkcja i odstępy między wierszami mogą poprawić płynność wypowiedzi. Dodawaj przerwy wokół słów technicznych lub kluczowych punktów, jeśli narzędzie to obsługuje.
Ostrożnie dostosuj tempo i wysokość dźwięku. Wprowadzaj drobne zmiany, zamiast zmieniać wszystko na raz. Najpierw zachowałbym oryginalny głos, a potem stopniowo go dostosowywał, aż efekt będzie brzmiał dobrze.
Dodaj emocje i podkreśl. Jeśli Generator głosu AI pozwala Ci dostosować emocje lub styl przekazu, wypróbuj inne opcje zamiast utrzymywać płaski ton głosu. Dodatkowy nacisk na słowa kluczowe może również sprawić, że reklamy i treści o charakterze casualowym będą bardziej żywe.
Testuj trudne słowa osobno. Głosy sztucznej inteligencji często mają problemy z liczbami, nazwami własnymi, skróconymi terminami, nazwami firm i słowami branżowymi. Przetestuj najpierw kilka wersów i popraw wszelkie błędy w wymowie, zanim utworzysz cały utwór.
Wygeneruj kilka wersji. Nawet przy identycznych ustawieniach, rezultaty mogą się nieznacznie różnić tempem i tonem. Zazwyczaj generuję kilka wersji, porównuję je i wybieram tę, która brzmi najbardziej naturalnie.
Zacząłem od Adobe Firefly ponieważ chciałem sprawdzić, czy program ten potrafi zapewnić profesjonalny kobiecy głos do filmów FixThePhoto bez nadmiernego komplikowania procesu. Skorzystałem z tego samego samouczka i skryptów promocyjnych w Generate Speech, wypróbowałem kilka kobiecych głosów i porównałem ich wymowę, pauzy, wysokość dźwięku i ogólną wymowę.
Pierwszą rzeczą, która mi się spodobała, była łatwość kształtowania głosu. Firefly pozwala zmieniać tempo, wysokość dźwięku, pauzy, wymowę i ton. Można nawet modyfikować poszczególne słowa lub frazy bez konieczności ponownego uruchamiania całego skryptu.
Spodobała mi się również różnorodność kobiecych głosów, jakie oferuje ten generator głosu AI. Zamiast typowego głosu AI, mogłam wybierać spośród różnych grup wiekowych i stylów. Obszar roboczy Speech w Firefly zawiera również głosy partnerskie, takie jak ElevenLabs Multilingual v2, co daje mi jeszcze więcej możliwości.
Ułatwiło to wybór głosu pasującego do każdego rodzaju filmu, od spokojnych samouczków po bardziej optymistyczne treści promocyjne. Wypróbowałem również kilka języków, ponieważ treści FixThePhoto są skierowane do odbiorców międzynarodowych. Firefly obsługuje ponad 20 języków i oferuje kilka opcji akcentowania.
Najbardziej przydatna dla mnie była możliwość dopracowania poszczególnych słów i fraz. Jeśli jakiś termin techniczny nie brzmiał dobrze, mogłem poprawić tylko ten fragment, zamiast zaczynać od nowa. Mogłem też dodać emocje lub pauzy, aby przekaz brzmiał bardziej naturalnie.
Spodobało mi się również to, że mogłem podejrzeć rezultat przed wyeksportowaniem dźwięku do pliku WAV. Następnie mogłem go łatwo wykorzystać w innych darmowe aplikacje Adobe, takich jak Premiere Pro czy After Effects. Dzięki temu Firefly wydawał się częścią większego procesu edycji, a nie tylko prostym generatorem kobiecego głosu opartym na sztucznej inteligencji.
Najbardziej rzuciło mi się w oczy, jak dobrze Firefly radził sobie z tradycyjną narracją. Po wypróbowaniu różnych skryptów stwierdziłem, że lepiej sprawdza się w przypadku czystych, dopracowanych głosów kobiecych niż w przypadku głosów postaci. Sterowanie wysokością, tempem i wymową było przydatne, a obsługa różnych języków i aplikacji Adobe ułatwiła cały proces. Ogólnie rzecz biorąc, uzyskałem sporą kontrolę bez konieczności radzenia sobie ze skomplikowanymi ustawieniami.
W przypadku projektów profesjonalnych zwracałem również uwagę na prawa użytkowania. Firma Adobe twierdzi, że mowa utworzona za pomocą modeli Firefly Speech jest bezpieczna do użytku komercyjnego. Ponieważ pracowałem nad samouczkami, filmami promocyjnymi i materiałami edukacyjnymi, to był kolejny powód, dla którego Firefly wyróżniał się dla mnie jako jedna z lepszych opcji.
Voicemod nieco różnił się od innych generatorów kobiecego głosu AI, które testowałem, ponieważ zmieniał głos podczas mówienia, zamiast zamieniać tekst w narrację. Przeczytałem te same krótkie wersy, których użyłem w innych generatorach, i słuchałem, jak każdy głos AI zmieniał moje nagranie. Następnie porównałem wyniki z moim oryginalnym głosem, aby sprawdzić, jak naturalnie brzmiały te zmiany.
Od razu zauważyłem, że Voicemod zmienia sam głos, a nie tylko dodaje podstawowy efekt. Ponieważ zmiany zachodzą w trakcie mówienia, funkcja ta sprawdza się w przypadku treści na żywo, takich jak transmisje strumieniowe, rozmowy i prezentacje, gdzie zależy nam na zachowaniu naturalnego tempa i energii.
W przypadku głosów żeńskich, zamiast trzymać się standardowej narracji, wypróbowałem kilka opcji stylu postaci. Ten Generator akcentów AI zawiera ponad 200 głosów, a do tworzenia i dostosowywania głosów mogłem również użyć Voicelab. Społeczność udostępniła również dodatkowe opcje, dzięki którym mogłem wypróbować jeszcze więcej głosów.
Uznałem, że lepiej nadaje się do treści kreatywnych niż do nagrań głosowych w stylu biznesowym. Mogłem eksperymentować z różnymi osobowościami i głosami postaci, aby sprawdzić, co działa najlepiej. W zależności od głosu mogłem również modyfikować wysokość dźwięku, pogłos i tempo.
Zauważyłem, że jakość mojego nagrania zrobiła ogromną różnicę. Voicemod działa najlepiej, gdy mówisz wyraźnie i minimalizujesz hałas w tle. Język angielski również dał mi najlepsze rezultaty, co jest zrozumiałe, ponieważ sztuczna inteligencja była trenowana głównie na profesjonalnych głosach anglojęzycznych. Przetestowałem zarówno czyste nagranie, jak i bardziej swobodne, a czysta wersja brzmiała znacznie lepiej po zmianie głosu.
W moich projektach FixThePhoto wybierałem Voicemod, gdy miałem już naturalne nagranie i chciałem nadać mu inny głos. Nie był to mój pierwszy wybór, gdy potrzebowałem przekształcić pisany scenariusz w kompletny lektor.
Ogólnie rzecz biorąc, Voicemod okazał się dla mnie najbardziej przydatny, gdy chciałem zmienić swój głos, nie tracąc przy tym naturalnego brzmienia. Szczególnie dobrze sprawdzał się w komunikacji na żywo, streamingu, grach i treściach opartych na postaciach. W porównaniu ze standardowym narzędziem do zamiany tekstu na mowę, dawał mi również więcej możliwości eksperymentowania z różnymi głosami i stylami.
Nie wybrałbym go do długich skryptów instruktażowych zamiast dedykowanego narzędzia TTS. Ale do krótkich filmów społecznościowych może być świetny. Zmiany głosu w czasie rzeczywistym ułatwiają zachowanie własnego stylu mówienia, jednocześnie dodając treściom więcej charakteru.
VoiceAI był interesujący, ponieważ potrafi zmienić istniejący głos, zamiast po prostu zamieniać tekst na mowę. Wypróbowałem zarówno zmieniacz głosu na żywo, jak i narzędzia audio online, używając tych samych krótkich fraz, co w przypadku innych generatorów.
Projektant głosu AI daje mi dostęp do tysięcy głosów w Voice Universe, w tym głosów żeńskich stworzonych przez innych użytkowników. Mogę również tworzyć nowe głosy lub klonować istniejące. Dzięki tak wielu opcjom do wypróbowania, program oferuje znacznie większą swobodę niż typowy edytor głosu.
Zacząłem od kobiecego głosu z biblioteki i użyłem go na czystym nagraniu. Następnie zmieniłem tonację i wypróbowałem inny głos, aby porównać rezultaty. W Voice.ai podobało mi się to, że zachował tempo i znaczną część oryginalnego przekazu, zamiast zaczynać od zera z tekstem.
Konwerter online pozwala również przesłać krótki plik MP3 lub WAV, wybrać głos, dostosować wysokość dźwięku i przekonwertować go bezpośrednio w przeglądarce. Dzięki temu można szybko przetestować różne głosy z istniejącym dźwiękiem.
Najbardziej podobało mi się Voice Universe. Było tam mnóstwo głosów do przeglądania, w tym te stworzone przez innych użytkowników. Łatwo było wypróbować różne głosy żeńskie i wybrać ten, który pasował do rodzaju treści, nad którą pracowałam.
VoiceAI pozwala również na stworzenie głosu na podstawie próbki audio. Funkcja klonowania była przydatna, gdy potrzebowałem głosu o bardziej specyficznym brzmieniu, a nie typowej młodej narratorki.
Wybrałbym ten generator kobiecego głosu, gdy mam już nagranie do pracy lub muszę zmienić głos na żywo, zamiast generować długi dialog z tekstu. Szczególnie dobrze sprawdził się w przypadku głosów postaci kobiecych, klipów z mediów społecznościowych, transmisji strumieniowych i luźnych rozmów.
Działa również w czasie rzeczywistym z aplikacjami takimi jak Discord, Zoom, grami i innymi platformami komunikacyjnymi, oferując więcej niż podstawowe narzędzie do syntezy mowy (TTS). Do dopracowanych samouczków FixThePhoto wolałem jednak standardowe narzędzia do zamiany tekstu na mowę, ponieważ dawały mi one lepszą kontrolę nad skryptem.
Testowałem EaseUS VoiceWave bardziej jako zmieniacz głosu niż standardowy generator kobiecego głosu oparty na sztucznej inteligencji. Zamiast po prostu wprowadzać tekst, nagrałem kilka krótkich klipów głosowych i wypróbowałem różne efekty kobiecego głosu podczas mówienia.
VoiceWave obsługuje ponad 100 efektów zmieniających głos w czasie rzeczywistym, a także umożliwia modyfikację nagranych wcześniej plików wideo i audio. Ułatwiło mi to porównywanie różnych transformacji z kobiecym brzmieniem bez konieczności konfigurowania skomplikowanego procesu edycji dźwięku.
Jedną z rzeczy, które mi się podobały, było to, że mogłem nagrywać swój głos i zmieniać go w tej samej aplikacji. Mogłem dostosować wysokość i tempo, zapisać wynik w formacie MP3 i użyć redukcji szumów opartej na sztucznej inteligencji, aby oczyścić nagrania z szumów tła. W przypadku krótkich klipów społecznościowych i luźnych nagrań głosowych, wszystkie te narzędzia w jednym miejscu znacznie przyspieszały proces.
Wypróbowałem też soundboard, dzięki któremu VoiceWave wydawał się zupełnie inny niż narzędzia takie jak Firefly czy ElevenLabs. Oferuje setki gotowych ustawień i efektów dźwiękowych, dzięki czemu mogłem dodać dodatkowe dźwięki do kobiecego głosu i wypróbować różne kombinacje, aby uzyskać bardziej zabawne treści.
Nie wybrałbym tych efektów do poważnego samouczka FixThePhoto, ale mogą się sprawdzić w postach w mediach społecznościowych, filmach z grami, memach lub po prostu jako sposób na wypróbowanie czegoś innego. Ponieważ program jest przeznaczony głównie dla systemu Windows i funkcji zmiany głosu na żywo, ogranicza to również możliwości jego wykorzystania.
Narakeet był bardzo łatwy w użyciu. Po prostu wkleiłem tekst, wybrałem głos, odsłuchałem go i wypróbowałem inny, jeśli nie byłem zadowolony z rezultatu. Przetestowałem ten sam samouczek, wprowadzenie do produktu, post w mediach społecznościowych i tekst techniczny, co w przypadku innych narzędzi. Dzięki temu szybko dowiedziałem się, które głosy żeńskie dobrze brzmiały w kontekście liczb, słów technicznych i dłuższych zdań.
Szeroki wybór głosów był jedną z rzeczy, które najbardziej mi się podobały w tym realistycznym generatorze kobiecego głosu opartym na sztucznej inteligencji. Oferuje on ponad 900 głosów w ponad 100 językach, więc miałam mnóstwo kobiecych głosów do wyboru i porównania.
Nie wybrałem pierwszego głosu, który mi się spodobał, tylko dlatego, że niektóre głosy wymawiały pewne słowa znacznie lepiej niż inne. Sam Generator efektów dźwiękowych AI zaleca wypróbowanie kilku opcji, zwłaszcza w przypadku terminów technicznych, nazw marek lub nietypowej wymowy. To pokrywało się z tym, co zaobserwowałem podczas testów.
Podobało mi się również to, że Narakeet daje mi większą kontrolę nad samym scenariuszem, zamiast ograniczać się do zmiany ustawień głosu. Mogłem korzystać z didaskaliów, aby zmieniać głosy, dostosowywać wymowę lub tworzyć dialogi. Były też osobne przyciski do regulacji tempa i głośności mowy.
Eksperymentowałem też z pauzami i różnymi prędkościami czytania, ponieważ nawet niewielkie zmiany w tempie mogły sprawić, że ten sam kobiecy głos brzmiał bardziej naturalnie lub całkowicie zmienić jego styl. W przypadku dłuższych scenariuszy podobało mi się, że mogłem przesłać plik Word lub tekstowy zamiast wklejać cały tekst do edytora.
Przetestowałem AI Dubbing nieco inaczej, ponieważ działa on z istniejącymi filmami, a nie tworzy narracji z tekstu. Wgrałem krótki film z lektorem, wybrałem inny język i porównałem wersję z dubbingiem z oryginałem, aby sprawdzić, jak naturalnie brzmi.
Proces był prosty: przesłałem film, wybrałem język i pozwoliłem narzędziu zająć się dubbingiem. Chciałem sprawdzić, czy nowy kobiecy głos będzie nadal podążał za tempem oryginalnej lektorki i brzmiał jak ta sama osoba, a nie jak generyczny lektor.
Najbardziej podobało mi się zachowanie głosu. Przetłumaczona wersja, dostarczona przez to Oprogramowanie do dubbingu AI zachowuje charakter głosu lektora i podąża za jego ruchem ust, dzięki czemu jest znacznie bliższa oryginalnemu nagraniu.
W moich testach miało to większe znaczenie niż posiadanie ogromnej biblioteki głosów żeńskich. Główną korzyścią była możliwość dostosowania istniejącego filmu do nowej publiczności bez konieczności ponownego nagrywania go przez prezentera. Uznałem to za szczególnie przydatne w przypadku samouczków, filmów edukacyjnych i postów w mediach społecznościowych, które muszą być publikowane w kilku językach.
Sprawdziłem również, jak dobrze taka konfiguracja sprawdzi się w profesjonalnym procesie pracy nad treścią. Zamiast obsługiwać skrypt, wybór głosu, nagrywanie i synchronizację jako oddzielne kroki, narzędzie łączy tłumaczenie i nową ścieżkę głosową w jednym procesie.
Oznaczało to również mniej pracy edycyjnej w przypadku projektu wielojęzycznego. Mimo to, najpierw sprawdziłbym limity planu i długość filmu, ponieważ mogą one wpływać na to, co możesz wykorzystać i ile treści możesz przetworzyć.
ElevenLabs był jednym z generatorów kobiecego głosu opartych na sztucznej inteligencji, z którymi spędziłem najwięcej czasu. Chciałem sprawdzić, jak dobrze żeńskie głosy radzą sobie z różnymi rodzajami treści, więc przetestowałem te same skrypty w kilku wariantach. Niektóre głosy brzmiały znacznie bardziej naturalnie niż inne, zwłaszcza gdy skrypt zawierał emocje, liczby lub terminy techniczne.
Wypróbowałem również różne style mówienia, od spokojnego głosu w samouczkach po bardziej energiczny przekaz w materiałach promocyjnych. To Oprogramowanie do klonowania głosu AI oferuje narzędzia do zamiany tekstu na mowę w wersji webowej i mobilnej, a także interfejsy API i zestawy SDK, które mogą okazać się przydatne w przypadku późniejszej automatyzacji przepływu pracy.
Poświęciłem również czas na testowanie personalizacji głosu. ElevenLabs oferuje szeroki wybór głosów, a dzięki funkcji Instant Voice Cloning mogłem stworzyć cyfrową kopię głosu z krótkiej próbki audio. Dzięki temu mogłem pracować z konkretnym głosem, zamiast wybierać tylko spośród dostępnych opcji.
Spójność jest szczególnie przydatna podczas tworzenia wielu filmów. Wykorzystanie tej samej narratorki w różnych projektach może pomóc w stworzeniu znajomej stylistyki dla strony internetowej, kanału YouTube czy serialu edukacyjnego.
Wypróbowałem również ElevenLabs do pracy wielojęzycznej, ponieważ treści FixThePhoto mogą wymagać dostępności w różnych językach. Funkcja dubbingu pozwala na tłumaczenie dźwięku i obrazu na ponad 90 języków, zachowując jednocześnie emocje, tempo, ton i tożsamość mówcy.
Dubbing v2 był jedną z ciekawszych funkcji, które testowałem, ponieważ działa z oryginalnego nagrania, a nie tylko z transkrypcji. Automatycznie obsługuje tłumaczenie, klonowanie głosu, dubbing i synchronizację, zachowując jednocześnie charakter oryginalnego wykonania. To sprawiło, że rezultat znacznie różnił się od standardowego przetłumaczonego kobiecego głosu lektorskiego.
Przetestowałem HeyGen jako część procesu pracy nad wideo, a nie tylko do generowania głosu. Stworzyłem kilka krótkich scenariuszy i wypróbowałem różne głosy kobiece w tekstach promocyjnych, instruktażowych i konwersacyjnych.
Ten internetowy generator kobiecego głosu pozwala mi dostosować ton, tempo, akcent i intonację, dzięki czemu mogę precyzyjnie dostroić sposób, w jaki każda linijka jest recytowana, zamiast stosować tę samą interpretację przez cały czas. Było to pomocne, gdy potrzebowałam bardziej energicznego kobiecego głosu w reklamie i spokojniejszego w samouczku.
Klonowanie głosu to kolejna funkcja, którą chciałem wypróbować. HeyGen może utworzyć klon głosu z krótkiej próbki i używać go jako tego samego narratora w filmach, kursach i podcastach. Wydawało się to przydatne w procesie FixThePhoto, gdzie zachowanie jednego głosu w całej serii może sprawić, że treść będzie bardziej spójna. Zamiast używać innego kobiecego głosu AI w każdym projekcie, mogłem wybrać jeden rozpoznawalny głos i używać go ponownie w wielu filmach.
Tym, co wyróżniało HeyGen było ścisłe powiązanie funkcji głosowych z tworzeniem wideo. Wygenerowany głos mogłem dodać bezpośrednio do jego Edytor wideo AI wraz z wizualizacjami, napisami i innymi elementami. Dzięki temu nie musiałem przełączać się między wieloma różnymi narzędziami podczas tworzenia filmu.
Przetestowałem również funkcję wielojęzycznego dubbingu, która obsługuje ponad 177 języków i dialektów, w tym dubbing AI i synchronizację ruchu ust. W przypadku kampanii międzynarodowych możliwość tłumaczenia treści, generowania nowego głosu i synchronizacji go z filmem w tym samym miejscu może znacznie przyspieszyć cały proces.
Voicebooking wyróżniał się, ponieważ oferuje bardziej praktyczne podejście do pracy lektorskiej. Skorzystałem z darmowego generatora głosu AI, aby dodać swoje skrypty, wypróbować różne głosy i sprawdzić, które najlepiej pasują do tempa i ogólnego klimatu.
Platforma oferuje ponad 575 głosów w ponad 55 językach, zarówno w wersji żeńskiej, jak i męskiej. Dzięki tak dużej liczbie opcji łatwo było wypróbować kilka głosów i znaleźć ten, który pasowałby do każdego filmu.
Sprawdziłem również, jak bardzo mogę zmienić brzmienie głosu. Płatne plany Voicebooking oferują opcje pauz i akcentów, co pomogło ożywić czytanie. Przetestowałem ten sam tekst promocyjny z tymi ustawieniami i bez nich i odkryłem, że nawet niewielkie zmiany w pauzach mogą poprawić przekaz. Dostępne są również efekty, które ułatwiają dodanie większego akcentu bez konieczności ręcznej edycji każdego wiersza.
Dodałam również Voicebooking ponieważ pozwala on testować scenariusze lektorskie przed rozpoczęciem produkcji. Generator służy do sprawdzania synchronizacji i impact na filmy, projekty testowe i storyboardy, co było jednym z głównych elementów, które chciałam sprawdzić podczas ewaluacji FixThePhoto.
Wersja darmowa pozwala również wypróbować głosy z biblioteki w pierwszym projekcie, ale wiąże się z limitami postaci, projektów i pobrań. Ułatwiało to sprawdzenie, czy scenariusz nie jest zbyt długi, czy głos żeński pasuje do tematu i czy tempo jest odpowiednie.
Zaczęliśmy od krótkiego samouczka edycji zdjęć i sprawdziliśmy, jak każdy głos radzi sobie z instrukcjami, liczbami, nazwami programów i terminami technicznymi. Tetiana Kostylieva skupiła się na wymowie, zwracając uwagę na wszelkie niezręczne pauzy, dziwne akcenty i słowa, które sprawiały, że głos brzmiał zbyt podobnie do komputerowego.
Kate Debela skupiła się na przekazie emocjonalnym, sprawdzając, czy głos brzmiał spokojnie i informacyjnie w jednym scenariuszu, a bardziej żywo w scenariuszu promocyjnym. Vadym Antypenko przyjrzał się aspektom technicznym, takim jak prędkość generacji, jakość dźwięku, opcje językowe, opcje eksportu oraz to, jak łatwo nagrania wpasowują się w nasz proces pracy.
Zamiast sprawdzać tylko jeden krótki akapit, zastosowaliśmy też kilka trudniejszych testów. Na przykład, daliśmy generatorom skrypt z mediów społecznościowych z krótkimi, konwersacyjnymi zdaniami. Następnie wypróbowaliśmy dłuższy tekst z procentami, datami, nazwami produktów i terminami związanymi z fotografią.
W kolejnym teście użyliśmy dwóch stylów: ciepłego, optymistycznego głosu w reklamie i bardziej neutralnego w samouczku. Krótsze skrypty brzmiały dobrze w większości narzędzi, ale dłuższe ujawniły wyraźną różnicę. Niektóre głosy traciły naturalność, podczas gdy inne pozostawały stabilne i czyste od początku do końca.
Następnie testowaliśmy funkcje personalizacji dostępne w każdym generatorze kobiecego głosu AI. Zmieniłem tempo, ton, pauzy, emocje, akcent i styl przekazu, aby sprawdzić, jak łatwo jeden kobiecy głos sprawdza się w różnych rodzajach treści FixThePhoto. W przypadku narzędzi z obsługą języków i klonowaniem głosu, przetestowałem również te opcje, aby sprawdzić, czy ten sam głos może zachować spójność w różnych filmach i językach.
Nasze testy wykazały, że duża biblioteka głosów nie ma większego znaczenia, jeśli nie ma wystarczającej liczby ustawień kształtujących sposób, w jaki głos odczytuje skrypt.
Ostatecznie rezultaty nie do końca były takie, jakich oczekiwaliśmy. ElevenLabs i Adobe Firefly zapewniły jedne z najlepszych rezultatów w przypadku profesjonalnych nagrań lektorskich. Dobrze radziły sobie z wymową i pauzami, a także dały nam większą kontrolę nad brzmieniem mowy.
Wybraliśmy zwycięzcę nie tylko ze względu na rozmiar biblioteki głosowej czy jakość wersji demonstracyjnych. Przetestowaliśmy te same praktyczne skrypty w każdym narzędziu i sprawdziliśmy wymowę, kontrolę, wydajność w przypadku trudnych słów oraz to, czy ostateczny dźwięk był wystarczająco dobry do profesjonalnej pracy wideo.
Sprawdziliśmy również, jak szybko działał każdy generator, jak dobrze brzmiał dźwięk, jakie języki obsługiwał, ile kosztował i na co pozwalały licencje. Te czynniki miały realne znaczenie, gdy korzystaliśmy z tych narzędzi. Ostatecznie znaleźliśmy nie tylko nasz najlepszy wybór, ale także generatory, które najlepiej sprawdziły się w samouczkach, reklamach, mediach społecznościowych, filmach wielojęzycznych i bardziej kreatywnych projektach.