최근 FixThePhoto 프로젝트를 위해 최고의 AI 여성 음성 생성기를 찾아야 했는데, 곧 자연스러운 목소리만이 중요한 요소가 아니라는 것을 깨달았습니다.
FixThePhoto 프로젝트를 위해 튜토리얼, 홍보 영상, 짧은 소셜 미디어 게시물에 사용할 여성 AI 음성이 필요했습니다. 모든 스크립트를 직접 녹음하는 것은 피하고 싶었지만, 다양한 형식에 잘 어울리는 목소리를 찾는 것이 예상보다 어려웠습니다. 일반적인 컴퓨터 생성 음성처럼 부자연스럽지 않고 자연스럽고 표현력이 풍부한 목소리여야 했습니다.
여러 음성 도구를 비교할 때, 단순히 목소리가 얼마나 듣기 좋은지만 고려한 것이 아니었습니다. 명확한 발음, 자연스러운 쉼표, 톤 변화, 그리고 각 목소리가 감정을 얼마나 잘 전달하는지 꼼꼼히 살펴보았습니다. 이는 우리가 작성한 스크립트가 간단한 단계별 지침부터 생동감 넘치는 홍보 콘텐츠까지 다양했기 때문에 중요한 요소였습니다.
저는 음성 범위, 지원되는 억양 및 언어, 편집 옵션, 음질, 그리고 각 도구의 오디오 생성 속도 등을 비교했습니다. 또한 톤이나 말하는 속도와 같은 전달 방식을 제어할 수 있는지 여부도 확인했습니다. 녹음 파일은 전문적인 FixThePhoto 프로젝트에 사용될 예정이었기 때문에 상업적 사용 라이선스, 가격, 그리고 최종 오디오 파일을 얼마나 쉽게 저장할 수 있는지도 살펴보았습니다.
공정한 비교를 위해 각 여성 음성 생성기에 동일한 스크립트를 사용했습니다. 스크립트는 간단한 사용법 안내, 제품 소개, 편안한 분위기의 소셜 미디어 게시물, 그리고 숫자와 전문 용어가 포함된 긴 문단으로 구성되었습니다. 이를 통해 각 음성이 다양한 유형의 콘텐츠에서 얼마나 잘 작동하는지 확인할 수 있었습니다.
각 음성이 발음, 호흡, 멈춤, 톤 변화를 어떻게 처리하는지 주의 깊게 살펴보았습니다. 가능하면 동일한 스크립트를 여러 번 실행하여 결과가 일관적인지 확인했습니다. 이를 통해 단 한 번의 뛰어난 결과물이 아닌, 어떤 도구가 안정적인 결과를 제공하는지 쉽게 파악할 수 있었습니다.
FixThePhoto 팀 의 동료들과 함께 여성 AI 음성 제작에 가장 인기 있는 도구 몇 가지를 선정했습니다. 기준과 테스트 계획을 세운 후, 시간을 낭비하지 않고 여러 옵션을 비교할 수 있도록 바로 테스트를 시작했습니다.
깔끔한 글씨체로 시작하세요. 불필요한 기호는 삭제하고, 어색한 약어는 피하며, 문장은 짧고 읽기 쉽게 작성하세요. 텍스트는 말했을 때 자연스럽게 들려야 합니다.
콘텐츠에 맞는 어조를 선택하세요. 부드럽고 안심시키는 어조는 교육용 영상에 적합하고, 생동감 있는 어조는 광고나 짧은 게시글을 더욱 매력적으로 만들 수 있습니다.
문장 부호를 사용하여 전달 방식을 조절하세요. 문장 부호와 띄어쓰기는 음성의 흐름을 더욱 자연스럽게 만들어 줍니다. 도구에서 지원하는 경우 전문 용어나 핵심 요점 주변에 줄 바꿈을 추가하세요.
속도와 음높이를 신중하게 조절하세요. 한 번에 모든 것을 바꾸기보다는 조금씩 조정하는 것이 좋습니다. 먼저 원래 목소리를 유지하고, 결과가 마음에 들 때까지 조금씩 조정해 보세요.
감정과 강조를 더하세요. AI 음성 생성기 감정이나 전달 스타일을 조절할 수 있다면, 단조로운 목소리 대신 다양한 옵션을 시도해 보세요. 핵심 단어를 강조하면 광고나 일반 콘텐츠가 더욱 생동감 있게 느껴질 수 있습니다.
어려운 단어는 따로 테스트하세요. AI 음성은 숫자, 고유명사, 줄임말, 회사 이름, 업계 전문 용어 등을 발음하는 데 어려움을 겪는 경우가 많습니다. 전체 트랙을 제작하기 전에 몇 줄을 먼저 테스트하고 잘못된 발음을 수정하세요.
여러 버전을 만들어 보세요. 설정이 동일하더라도 속도와 음색이 조금씩 다를 수 있습니다. 저는 보통 몇 가지 버전을 만들어 비교해 보고 가장 자연스럽게 들리는 버전을 선택합니다.
저는 Adobe Firefly 사용해 FixThePhoto 영상에 전문적인 여성 목소리를 복잡한 과정 없이 생성할 수 있는지 확인해 보고 싶었습니다. Generate Speech 에서 사용한 것과 동일한 튜토리얼 및 홍보 스크립트를 활용하여 여러 여성 목소리를 시도해 보고 발음, 멈춤, 음높이, 전반적인 전달력을 비교했습니다.
제가 가장 먼저 마음에 든 점은 목소리를 조절하기가 매우 쉽다는 것이었습니다. Firefly 사용하면 속도, 음높이, 쉼표, 발음, 어조를 변경할 수 있습니다. 전체 스크립트를 다시 실행하지 않고도 특정 단어나 구절만 수정할 수도 있습니다.
이 AI 여성 음성 생성기가 제공하는 다양한 여성 목소리도 마음에 들었습니다. 흔한 AI 음성만 듣는 대신, 다양한 연령대와 스타일의 음성을 선택할 수 있었습니다. Firefly 의 음성 작업 공간에는 ElevenLabs Multilingual v2 와 같은 파트너 음성도 포함되어 있어 더욱 다양한 옵션을 활용할 수 있었습니다.
이 덕분에 차분한 튜토리얼부터 활기찬 홍보 콘텐츠까지 각 영상 유형에 맞는 목소리를 쉽게 고를 수 있었습니다. FixThePhoto 콘텐츠는 국제적인 시청자를 대상으로 하기 때문에 여러 언어도 시도해 봤습니다. Firefly 20개 이상의 언어를 지원하고 다양한 억양 옵션을 제공합니다.
제게 가장 유용했던 부분은 개별 단어와 구절을 세밀하게 다듬을 수 있었다는 점입니다. 전문 용어가 어색하게 들리면 처음부터 다시 시작하는 대신 그 부분만 수정할 수 있었습니다. 또한 감정이나 멈춤을 추가하여 전달 방식을 더욱 자연스럽게 만들 수도 있었습니다.
WAV 파일로 오디오를 내보내기 전에 결과를 미리 들어볼 수 있다는 점도 좋았습니다. 덕분에 Premiere Pro 나 After Effects 같은 다른 무료 어도비 애플리케이션 에서도 쉽게 활용할 수 있었습니다. Firefly 단순한 AI 여성 음성 생성기가 아니라, 더 큰 편집 과정의 일부처럼 느껴졌습니다.
Firefly 가장 인상 깊었던 점은 일반 내레이션을 처리하는 방식이 매우 훌륭했다는 것입니다. 여러 스크립트를 사용해 본 결과, 캐릭터 스타일의 목소리보다는 또렷하고 세련된 여성 목소리에 더 적합하다는 것을 알았습니다. 음높이, 속도, 발음 조절 기능이 유용했고, 다양한 언어 및 Adobe 앱 지원 덕분에 작업이 훨씬 수월했습니다. 전반적으로 복잡한 설정 없이도 원하는 만큼의 제어권을 얻을 수 있었습니다.
전문적인 프로젝트를 진행할 때는 사용 권한도 중요하게 고려했습니다. Adobe는 Firefly Speech 모델로 생성된 음성이 상업적 용도로 안전하다고 명시하고 있습니다. 저는 튜토리얼, 홍보 영상, 교육 콘텐츠 제작을 하고 있었기 때문에 Firefly 전반적으로 더 나은 선택지 중 하나로 눈에 띄었던 또 다른 이유였습니다.
Voicemod 제가 테스트해 본 다른 AI 여성 음성 생성기와는 조금 달랐습니다. 텍스트를 내레이션으로 바꿔주는 대신, 말하는 동안 목소리를 바꿔주기 때문입니다. 다른 생성기에서 사용했던 것과 같은 짧은 문장들을 읽고 각 AI 음성이 제 녹음을 어떻게 바꿔주는지 들어봤습니다. 그런 다음 원래 목소리와 비교하여 변화가 얼마나 자연스러운지 확인했습니다.
Voicemod 처음 사용했을 때 가장 먼저 눈에 띈 것은 단순히 기본적인 효과를 추가하는 것이 아니라 목소리 자체를 변화시킨다는 점이었습니다. 말하는 도중에 변화가 일어나기 때문에 스트리밍, 대화, 프레젠테이션처럼 자연스러운 리듬과 에너지를 유지해야 하는 라이브 콘텐츠에 매우 효과적입니다.
여성 목소리의 경우, 일반적인 내레이션 대신 다양한 캐릭터 스타일 옵션을 시도해 봤습니다. 이 AI 억양 생성기 200개가 넘는 목소리가 포함되어 있으며, Voicelab을 사용하여 목소리를 만들거나 조정할 수도 있었습니다. 커뮤니티에서 공유한 추가 옵션 덕분에 시도해 볼 수 있는 목소리가 훨씬 더 많았습니다.
비즈니스 스타일의 내레이션보다는 창의적인 콘텐츠에 더 적합하다고 생각했습니다. 다양한 개성과 캐릭터 목소리를 시도해 보면서 어떤 목소리가 가장 효과적인지 알아볼 수 있었죠. 목소리에 따라 음높이, 잔향, 속도도 조절할 수 있었습니다.
녹음 음질이 결과에 큰 영향을 미친다는 것을 알게 되었습니다. Voicemod 또렷하게 말하고 배경 소음을 최소화할 때 가장 잘 작동합니다. 영어로 녹음했을 때 가장 좋은 결과가 나왔는데, 이는 AI가 주로 전문적인 영어 화자의 목소리를 기반으로 학습되었기 때문입니다. 깨끗한 녹음과 좀 더 자연스러운 녹음을 모두 테스트해 봤는데, 음성 변환 후에는 깨끗한 녹음이 훨씬 더 자연스럽게 들렸습니다.
FixThePhoto 프로젝트에서 저는 이미 자연스러운 녹음 파일이 있고 거기에 다른 목소리를 입히고 싶을 때 Voicemod 선택했습니다. 하지만 대본을 완벽한 음성 해설로 바꿔야 할 때는 Voicemod를 첫 번째 선택으로 삼지는 않았습니다.
전반적으로 Voicemod 다양한 목소리와 스타일을 실험해 볼 수 있는 더 많은 여지를 제공해 주었습니다.
긴 튜토리얼 스크립트에는 전용 TTS 도구보다 추천하지 않습니다. 하지만 짧은 소셜 미디어 영상에는 아주 적합할 수 있습니다. 실시간 음성 변조 기능 덕분에 평소 말투를 유지하면서 콘텐츠에 개성을 더할 수 있습니다.
VoiceAI 단순히 텍스트를 음성으로 변환하는 것뿐만 아니라 기존 음성을 변경할 수 있다는 점에서 흥미로웠습니다. 다른 음성 생성기와 마찬가지로 짧은 문구를 사용하여 실시간 음성 변환기와 온라인 오디오 도구를 모두 사용해 보았습니다.
AI 음성 디자이너 덕분에 Voice Universe에서 수천 가지 음성을 이용할 수 있었는데, 여기에는 다른 사용자가 만든 여성 음성도 포함되어 있었습니다. 새로운 음성을 만들거나 기존 음성을 복제할 수도 있었습니다. 이렇게 다양한 옵션을 시도해 볼 수 있어서 일반적인 음성 변조기보다 훨씬 자유롭게 음성을 만들 수 있었습니다.
저는 먼저 음성 라이브러리에서 여성 음성을 골라 깨끗한 녹음 파일에 적용해 봤습니다. 그런 다음 음높이를 바꾸고 다른 목소리로 바꿔서 결과를 비교해 봤습니다. Voice.ai의 장점은 텍스트를 처음부터 다시 입력할 필요 없이 원래 음성의 타이밍과 전달 방식을 상당 부분 유지해 준다는 점이었습니다.
이 온라인 변환기를 사용하면 짧은 MP3 또는 WAV 파일을 업로드하고, 음성을 선택하고, 음높이를 조정한 후 브라우저에서 바로 변환할 수 있습니다. 따라서 기존 오디오에 다양한 음성을 빠르게 테스트하는 데 유용합니다.
제가 가장 마음에 들었던 건 보이스 유니버스였어요. 다른 사용자들이 만든 목소리를 포함해서 정말 많은 목소리를 살펴볼 수 있었거든요. 다양한 여성 목소리를 쉽게 들어보고 제가 작업 중인 콘텐츠에 맞는 목소리를 고를 수 있었어요.
VoiceAI 오디오 샘플을 기반으로 음성을 생성할 수도 있습니다. 특히 전형적인 젊은 여성 내레이터의 목소리 대신 특정 음색이 필요할 때 복제 기능이 유용했습니다.
이미 녹음된 음성 파일이 있거나 실시간으로 목소리를 바꿔야 할 때, 텍스트에서 긴 음성 해설을 생성하는 것보다 이 여성 음성 생성기를 선택할 것 같습니다. 특히 여성 캐릭터 목소리, 소셜 미디어 클립, 스트리밍 방송, 일상적인 대화에 아주 효과적이었습니다.
이 도구는 디스코드, 줌, 게임 및 기타 커뮤니케이션 플랫폼 과 실시간으로 연동되므로 기본적인 TTS 도구 이상의 기능을 제공합니다. 하지만 FixThePhoto 튜토리얼을 더욱 완성도 있게 만들려면 스크립트를 더 자유롭게 제어할 수 있는 일반 텍스트 음성 변환 도구를 선호했습니다.
저는 EaseUS VoiceWave 일반적인 AI 여성 음성 생성기보다는 음성 변조 도구로서 테스트해 보았습니다. 단순히 텍스트를 입력하는 대신, 짧은 음성 클립 몇 개를 녹음하고 다양한 여성 음성 효과를 적용해 보았습니다.
VoiceWave는 100가지 이상의 실시간 음성 변조 효과를 지원하며, 미리 녹음된 비디오 및 오디오 파일도 수정할 수 있습니다. 덕분에 복잡한 오디오 편집 과정을 거치지 않고도 다양한 여성 목소리 변조 효과를 쉽게 비교해 볼 수 있었습니다.
제가 마음에 들었던 점 중 하나는 같은 앱에서 음성을 녹음하고 편집할 수 있다는 것이었습니다. 음높이와 속도를 조절하고, 결과물을 MP3 파일로 저장할 수 있으며, AI 기반 노이즈 제거 기능을 사용하여 배경 소음을 제거할 수도 있었습니다. 짧은 소셜 미디어 영상이나 간단한 내레이션을 만들 때, 이 모든 도구가 한 곳에 있어서 작업 속도를 훨씬 빠르게 할 수 있었습니다.
저는 사운드보드 기능도 사용해 봤는데, VoiceWave가 Firefly 나 ElevenLabs 같은 도구와는 상당히 다르다는 것을 느꼈습니다. 수백 가지의 사운드 프리셋과 효과가 있어서 여성 목소리에 다양한 소리를 추가하고 여러 조합을 시도해 보면서 더욱 재미있는 콘텐츠를 만들 수 있었습니다.
진지한 FixThePhoto 튜토리얼에 이런 효과를 추천하진 않겠지만, 소셜 미디어 게시물, 게임 영상, 밈 제작 또는 색다른 시도를 해보고 싶을 때 사용하기에는 괜찮을 것 같습니다. 다만, 이 프로그램이 주로 윈도우 운영체제와 실시간 음성 변조 기능을 위해 개발되었기 때문에 활용 범위가 제한적이라는 점도 아쉽습니다.
Narakeet 사용하기 매우 쉬웠습니다. 텍스트를 붙여넣고, 음성을 선택하고, 들어보고, 마음에 들지 않으면 다른 음성을 선택하면 되었습니다. 다른 도구들과 마찬가지로 동일한 튜토리얼, 제품 소개, 소셜 미디어 게시물, 기술 문서를 테스트해 보았습니다. 덕분에 숫자, 전문 용어, 긴 문장에 어떤 여성 음성이 잘 어울리는지 빠르게 파악할 수 있었습니다.
이 사실적인 여성 AI 음성 생성기의 가장 큰 장점 중 하나는 다양한 음성 선택지가 있다는 점이었습니다. 100개 이상의 언어로 900개 이상의 음성을 제공하기 때문에, 저는 다양한 여성 음성 중에서 선택하고 비교해 볼 수 있었습니다.
제가 마음에 드는 첫 번째 목소리를 그냥 고르지 않은 이유는, 어떤 목소리는 특정 단어를 다른 목소리보다 훨씬 더 잘 발음했기 때문입니다. AI 음향 효과 생성기 자체에서도 특히 전문 용어, 브랜드 이름 또는 흔하지 않은 발음을 사용할 때는 여러 옵션을 시도해 보라고 권장합니다. 제가 테스트하면서 느낀 점도 이와 일치했습니다.
Narakeet 단순히 음성 설정만 바꾸는 것이 아니라 대본 자체를 더 세밀하게 제어할 수 있게 해준다는 점도 마음에 들었습니다. 무대 지시를 사용하여 음성을 바꾸거나, 발음을 조정하거나, 대사를 만들 수 있었습니다. 말하는 속도와 음량도 개별적으로 조절할 수 있었습니다.
저는 또한 읽는 속도와 중간에 멈추는 간격을 다양하게 조절해 보았는데, 속도의 작은 변화만으로도 같은 여성 목소리라도 훨씬 자연스럽게 들리거나 전달 방식이 완전히 달라질 수 있었기 때문입니다. 긴 대본의 경우, 전체 텍스트를 편집기에 붙여넣는 대신 워드 파일이나 텍스트 파일을 업로드할 수 있다는 점이 좋았습니다.
AI Dubbing 기존 영상을 활용하기 때문에 텍스트에서 음성 해설을 생성하는 일반적인 방식과는 조금 다르게 테스트해봤습니다. 짧은 인터뷰 영상을 업로드하고 다른 언어를 선택한 후, 더빙된 버전과 원본을 비교하여 얼마나 자연스럽게 들리는지 확인했습니다.
과정은 간단했습니다. 영상을 업로드하고 언어를 선택한 다음, 도구가 알아서 더빙을 진행하도록 했습니다. 제가 확인하고 싶었던 것은 새로 녹음된 여성 목소리가 원화자의 타이밍을 잘 따라가고, 일반적인 내레이션처럼 들리지 않고 같은 사람처럼 자연스럽게 들리는지 여부였습니다.
가장 마음에 들었던 점은 음성 보존이었습니다. 이 AI 더빙 소프트웨어 가 제공하는 번역본은 화자의 목소리 특징을 그대로 유지하고 입 모양까지 따라가기 때문에 원본 녹음과 훨씬 더 가깝게 느껴집니다.
제 테스트에서는 방대한 여성 음성 라이브러리를 보유하는 것보다 이 점이 더 중요했습니다. 가장 큰 장점은 발표자에게 다시 녹음할 필요 없이 기존 영상을 새로운 시청자층에 맞춰 수정할 수 있다는 것이었습니다. 특히 여러 언어로 배포해야 하는 튜토리얼, 교육용 영상, 소셜 미디어 게시물에 매우 유용했습니다.
또한 이 설정이 전문적인 콘텐츠 워크플로에 얼마나 잘 맞는지도 살펴보았습니다. 스크립트 작성, 음성 선택, 녹음 및 동기화를 별도의 단계로 처리하는 대신, 이 도구는 번역과 새로운 음성 트랙을 하나의 프로세스로 통합합니다.
이는 다국어 프로젝트의 편집 작업량을 줄여준다는 의미이기도 합니다. 하지만 요금제 제한과 영상 길이를 먼저 확인하는 것이 좋습니다. 이러한 요소들이 사용 가능한 콘텐츠와 처리할 수 있는 용량에 영향을 미칠 수 있기 때문입니다.
ElevenLabs 제가 가장 많은 시간을 들여 사용해 본 AI 여성 음성 생성기 중 하나였습니다. 다양한 유형의 콘텐츠를 얼마나 잘 소화하는지 확인하고 싶어서 동일한 스크립트를 여러 옵션으로 테스트해 보았습니다. 특히 스크립트에 감정, 숫자 또는 전문 용어가 포함될 때 일부 음성이 다른 음성보다 훨씬 자연스럽게 들렸습니다.
저는 튜토리얼용 차분한 목소리부터 홍보 콘텐츠용 활기찬 목소리까지 다양한 말하기 스타일을 시도해 봤습니다. 이 AI 음성 복제 소프트웨어 웹과 모바일에서 사용할 수 있는 텍스트 음성 변환 도구와 API 및 SDK를 제공하는데, 이는 나중에 워크플로를 자동화해야 할 경우 유용할 수 있습니다.
음성 커스터마이징 기능도 테스트해 봤습니다. ElevenLabs 다양한 음성을 제공하는데, Instant Voice Cloning 기능을 사용하면 짧은 오디오 샘플만으로 원하는 음성의 디지털 복사본을 만들 수 있었습니다. 덕분에 제공되는 옵션 중에서 고르는 대신 특정 음성을 선택해서 작업할 수 있었습니다.
일관성은 여러 영상을 제작할 때 특히 유용합니다. 웹사이트, YouTube 채널 또는 교육 시리즈 등 다양한 프로젝트에서 동일한 여성 내레이터를 사용하면 친숙한 분위기를 조성하는 데 도움이 될 수 있습니다.
FixThePhoto 콘텐츠는 다양한 언어로 제공되어야 할 수도 있기 때문에 다국어 작업을 위해 ElevenLabs 도 사용해 봤습니다. ElevenLabs의 더빙 기능은 화자의 감정, 타이밍, 어조, 정체성을 유지하면서 오디오와 비디오를 90개 이상의 언어로 번역할 수 있습니다.
더빙 v2는 제가 테스트해 본 기능 중 가장 흥미로운 기능 중 하나였습니다. 단순히 대본만 사용하는 것이 아니라 원본 녹음 파일을 기반으로 작동하기 때문입니다. 번역, 음성 복제, 더빙, 타이밍을 자동으로 처리하면서 원문의 느낌을 그대로 유지합니다. 덕분에 일반적인 여성 음성 더빙 번역과는 확연히 다른 결과물을 얻을 수 있었습니다.
저는 HeyGen 음성 생성 기능만 사용하는 대신 비디오 워크플로의 일부로 테스트해 보았습니다. 몇 가지 짧은 스크립트를 만들고 홍보, 안내 및 대화체 텍스트에 다양한 여성 목소리를 적용해 보았습니다.
이 온라인 여성 음성 생성기는 톤, 속도, 강세, 억양을 조절할 수 있게 해줘서, 처음부터 끝까지 똑같은 목소리를 사용하는 대신 각 대사의 전달 방식을 세밀하게 조정할 수 있었습니다. 광고에는 좀 더 활기찬 여성 목소리가 필요하고, 튜토리얼에는 차분한 목소리가 필요할 때 유용했습니다.
음성 복제 기능도 꼭 사용해보고 싶었던 기능 중 하나였습니다. HeyGen 짧은 음성 샘플로 음성 복제본을 만들어 영상, 강좌, 팟캐스트 등 다양한 콘텐츠에 동일한 내레이터로 사용할 수 있습니다. FixThePhoto 워크플로우에서는 시리즈 전체에 걸쳐 일관된 목소리를 유지하는 것이 콘텐츠의 완성도를 높이는 데 유용해 보였습니다. 프로젝트마다 다른 여성 AI 음성을 사용하는 대신, 하나의 익숙한 목소리를 선택하여 여러 영상에 재사용할 수 있다는 것이죠.
HeyGen 돋보였던 이유는 음성 기능이 영상 제작과 매우 밀접하게 연동되어 있었기 때문입니다. 생성된 음성을 영상, 자막, 기타 요소들과 함께 AI 비디오 편집기 에 바로 추가할 수 있었습니다. 덕분에 영상을 제작하는 동안 여러 도구를 번갈아 사용할 필요가 없었습니다.
저는 177개 이상의 언어와 방언을 지원하는 다국어 더빙 기능도 테스트해 봤는데, AI 더빙과 립싱크 기능도 포함되어 있었습니다. 국제 캠페인의 경우, 콘텐츠를 번역하고, 새로운 음성을 생성하고, 영상과 동기화하는 작업을 한 곳에서 모두 처리할 수 있다면 전체 과정을 훨씬 빠르게 진행할 수 있습니다.
Voicebooking 음성 작업에 있어 보다 직접적인 접근 방식을 취한다는 점에서 눈에 띄었습니다. 저는 무료 AI 음성 생성기를 사용하여 스크립트를 추가하고, 다양한 목소리를 시도해보고, 속도와 전체적인 느낌에 가장 적합한 목소리를 찾아냈습니다.
이 플랫폼은 55개 이상의 언어로 575개 이상의 음성 옵션을 제공하며, 여성 및 남성 옵션 모두 포함되어 있습니다. 선택지가 많아 여러 음성을 시험해보고 각 영상에 가장 적합한 음성을 쉽게 찾을 수 있었습니다.
저는 음성을 얼마나 다양하게 바꿀 수 있는지도 살펴보았습니다. Voicebooking 의 유료 플랜은 일시 정지와 강조 옵션을 제공하는데, 이를 통해 더욱 생동감 있는 읽기를 구현할 수 있었습니다. 동일한 홍보 문구를 이러한 설정을 적용했을 때와 적용하지 않았을 때를 비교해 본 결과, 일시 정지 시간을 조금만 조정해도 전달력이 향상되는 것을 확인했습니다. 또한, 각 줄을 일일이 수동으로 편집하지 않고도 간편하게 강조 효과를 추가할 수 있는 기능도 있습니다.
Voicebooking 포함시킨 이유는 제작에 들어가기 전에 음성 해설 스크립트를 테스트할 수 있기 때문입니다. 이 생성기는 비디오, 테스트 프로젝트 및 스토리보드에서 타이밍과 impact 확인하기 위해 만들어졌는데, 이는 FixThePhoto 평가에서 제가 확인하고 싶었던 주요 사항 중 하나와 일치했습니다.
무료 버전에서는 첫 번째 프로젝트에서 라이브러리의 음성을 사용해 볼 수 있지만, 캐릭터 수, 프로젝트 수, 다운로드 횟수에 제한이 있습니다. 이를 통해 대본이 너무 긴지, 여성 목소리가 주제에 어울리는지, 속도가 적절한지 등을 쉽게 확인할 수 있었습니다.
저희는 간단한 사진 편집 튜토리얼부터 시작하여 각 음성이 지시사항, 숫자, 소프트웨어 이름 및 전문 용어를 어떻게 처리하는지 테스트했습니다. 테티아나 코스틸리에바는 발음에 집중하여 어색한 멈춤, 이상한 강조 또는 음성이 컴퓨터처럼 들리게 하는 단어가 있는지 확인했습니다.
케이트 데벨라는 감정 전달에 중점을 두고, 한 대본에서는 목소리가 차분하고 유익하게 들리는지, 홍보성 대본에서는 더 생동감 있게 들리는지 등을 확인했습니다. 바딤 안티펜코는 생성 속도, 음질, 언어 옵션, 내보내기 옵션, 녹음 파일이 워크플로에 얼마나 쉽게 통합될 수 있는지 등 기술적인 측면을 검토했습니다.
또한 짧은 단락 하나만 확인하는 대신 몇 가지 더 어려운 테스트를 진행했습니다. 예를 들어, 짧고 구어체적인 문장으로 구성된 소셜 미디어 스크립트를 생성기에 제공했습니다. 그런 다음 백분율, 날짜, 제품명, 사진 용어 등이 포함된 더 긴 텍스트를 사용해 보았습니다.
또 다른 테스트에서는 두 가지 스타일의 음성을 사용했습니다. 하나는 광고용으로 따뜻하고 활기찬 목소리이고, 다른 하나는 튜토리얼용으로 좀 더 중립적인 목소리였습니다. 짧은 스크립트는 대부분의 도구에서 좋은 소리를 들려줬지만, 긴 스크립트에서는 확연한 차이가 드러났습니다. 어떤 목소리는 자연스러움을 잃은 반면, 어떤 목소리는 처음부터 끝까지 안정적이고 또렷한 소리를 유지했습니다.
그 후, 각 AI 여성 음성 생성기에서 제공하는 맞춤 설정 기능을 우리는 테스트했습니다. 속도, 음높이, 일시 정지, 감정 표현, 강조, 전달 방식 등을 변경하여 하나의 여성 음성이 다양한 유형의 FixThePhoto 콘텐츠에 얼마나 잘 어울리는지 확인했습니다. 언어 지원 및 음성 복제 기능이 있는 도구의 경우, 동일한 음성이 다양한 영상과 언어에서 일관성을 유지하는지 확인하기 위해 해당 옵션도 테스트했습니다.
저희 테스트 결과, 음성 라이브러리가 아무리 크더라도 음성이 스크립트를 읽는 방식을 조정할 수 있는 설정이 충분하지 않으면 큰 의미가 없다는 것을 알게 되었습니다.
결론적으로, 결과는 우리가 기대했던 것과는 다소 달랐습니다. ElevenLabs 와 Adobe Firefly 전문 음성 녹음에 있어 가장 뛰어난 결과물을 보여주었습니다. 발음과 쉼표를 잘 처리했고, 음성 효과를 더욱 세밀하게 제어할 수 있도록 해주었습니다.
저희는 음성 라이브러리 규모나 데모 품질뿐만 아니라 더 많은 요소를 고려하여 우승자를 선정했습니다. 동일한 실제 스크립트를 각 도구에 입력하여 발음, 제어력, 어려운 단어 처리 능력, 그리고 최종 오디오가 전문적인 영상 작업에 적합한지 여부를 평가했습니다.
저희는 각 생성기의 작동 속도, 음질, 지원 언어, 가격, 라이선스 내용 등을 꼼꼼히 살펴보았습니다. 이러한 요소들은 실제로 도구를 사용할 때 큰 차이를 만들어냈습니다. 최종적으로 최고의 생성기를 선정했을 뿐만 아니라, 튜토리얼, 광고, 소셜 미디어, 다국어 영상 등 다양한 창작 프로젝트에 가장 적합한 생성기들을 찾아냈습니다.