로컬에서 공짜로 돌리는 AI 보이스, 생각보다 쓸만했다

요즘 로컬에서 돌아가는 오픈소스 TTS 모델들의 완성도가 부쩍 올라왔다는 걸 실감하고 있다. 그중에서도 최근 눈여겨본 건 Qwen3-TTS다. 클라우드 API에 요청을 보내고 응답을 기다리는 방식이 아니라, 로컬에서 음성을 뽑아낼 수 있다.


실제로 써보면 이야기가 달라진다. 팟캐스트 형식으로 여러 화자를 굴려보면서, 이 정도 자유도가 로컬에서, 그것도 비용 없이 가능하다는 사실에 놀랐다.


예를 들어 메인 목소리를 하나 정하고, 톤을 살짝 낮춰 안정감을 준다. 코너마다 다른 화자를 붙이는 것도 자유롭다. 영어 코너에는 또렷한 목소리를, 일본어 코너에는 속도감 있는 목소리를 배정하는 식이다. 


언어가 섞이는 구간에서는 각 언어를 따로 모델에 넣어준다. 그래야 영어 단어를 한국어 발음으로 뭉개서 읽는 어색함이 사라진다. 일본어도 마찬가지다. 글자를 하나하나 끊어 읽는 게 아니라 단어와 문장 단위로 자연스럽게 흘러가게 만들 수 있다.


세부적으로 들어가면 톤을 얼마나 낮출지, 속도를 얼마나 올릴지, 구간 사이 간격을 얼마나 둘지 같은 조정거리가 끝없이 나온다. 하지만 중요한 건 숫자 하나하나가 아니라, 이런 걸 전부 내 손으로 조절할 수 있다는 감각이다. 


클라우드 API였다면 파라미터 몇 개 만지는 데도 토큰을 많이쓰고 제약이 있었을 텐데, 로컬이라 그런 게 없다. 마음에 안 들면 다시 돌리고, 톤이 이상하면 값을 바꿔서 다시 뽑으면 그만이다.


무엇보다 이 모든 과정에 비용이 들지 않는다는 점이 크다. 개인이 사이드 프로젝트로 팟캐스트나 오디오 콘텐츠를 만들어보고 싶을 때, 진입장벽이 확 낮아진 셈이다. 목소리 하나 뽑는 데마다 API 비용을 걱정할 필요 없이, 실패하면 그냥 다시 시도하면 된다.


로컬 AI 음성 합성을 아직 안 써봤다면, Qwen3-TTS로 한번 시작해보는 걸 추천한다. 생각보다 훨씬 쓸만하고, 무엇보다 공짜로 시작할 수 있다는 게 제일 큰 장점이다.

Comments

댓글을 불러오고 있습니다.