"아나운서처럼 읽어줘"…카카오 AI, 말투까지 이해한다

  • 자연어 지시만으로 말투·감정·속도까지 제어…복합 명령도 수행

  • 자체 음성 토크나이저로 생성 속도도 개선

카카오 자체개발 옴니AI모델 ‘카나나-오’ 음성 생성기술 고도화사진카카오
카카오 자체개발 옴니AI모델 ‘카나나-오’ 음성 생성기술 고도화[사진=카카오]

카카오가 자체 개발한 옴니 인공지능(AI) 모델 '카나나-오(Kanana-o)'의 음성 생성 기술을 고도화했다. 단순히 사람처럼 자연스럽게 읽는 수준을 넘어 이용자의 자연어 지시에 따라 말투와 감정, 속도, 음량까지 제어할 수 있도록 성능을 개선했다.

카카오는 4일 테크블로그를 통해 카나나-오의 음성 생성 기술을 공개했다. 새 모델은 이용자가 원하는 발화 방식을 자연어로 입력하면 이를 반영해 음성을 생성하는 것이 특징이다.

예를 들어 "아주 빠르게 읽어줘", "낮은 목소리로 읽어줘", "슬픈 목소리로 읽어줘", "경상도 사투리로 읽어줘"와 같은 지시를 이해해 속도와 음량, 음높이는 물론 감정과 억양까지 반영한다.

또 "스포츠 중계하듯", "아나운서처럼", "동화책을 읽어주듯" 등 역할 기반 지시도 수행할 수 있다. "톤을 낮춰서 빠르게 슬픈 목소리로 읽어줘"처럼 여러 조건을 동시에 담은 복합 명령도 처리한다. 한국어를 중심으로 학습했지만 영어 음성 생성에서도 동일한 발화 지시를 수행할 수 있다는 점도 특징이다.

성능도 개선됐다. 카나나-오는 발화 지시 이행 능력을 평가하는 한국어 벤치마크 'InstructTTSEval'에서 94.50점을 기록해 지피티-포오-미니 TTS(91.10점)를 웃돌았다.

음성 생성 속도와 효율도 높였다. 카카오는 자체 개발한 음성 토크나이저 'LM-SPT'를 적용했다. 이 기술은 음성을 적은 수의 토큰으로 압축해 표현해 AI가 처리해야 하는 데이터양을 줄이고 음성 생성 속도를 높이는 역할을 한다.

LM-SPT는 다양한 음성 언어모델의 한국어·영어 음성 이해 및 생성 성능을 비교한 평가에서 우수한 성능을 기록했다. 

©'5개국어 글로벌 경제신문' 아주경제. 무단전재·재배포 금지

컴패션_PC
댓글0
0 / 300

댓글을 삭제 하시겠습니까?

닫기

로그인 후 댓글작성이 가능합니다.
로그인 하시겠습니까?

닫기

이미 참여하셨습니다.

닫기