speech-tokenizer

1 개의 포스트

kakao4분 읽기큐레이션 요약

잘 말하는 AI를 넘어, 원하는 대로 말하는 AI로: Kanana-o 음성 생성 고도화 과정

Kanana-o는 단순히 자연스럽게 말하는 것을 넘어, 사용자가 지정한 속도·음량·억양·감정 등에 맞춰 말하는 음성 생성을 목표로 고도화됐다. 이를 위해 음성을 의미 정보와 음향 정보로 나누어 표현하는 LM-SPT 음성 토크나이저와 온라인 강화학습을 적용했다. LM-SPT는 토큰 시퀀스를 절반으로 줄이고 waveform을 직접 복원해 생성 효율을 높이는 동시에, 음성 특성을 세밀하게 제어할 기반을 마련했다. ## Kanana-o 음성 생성 구조 - 기존 Kanana-o는 음성을 초당 25개의 이산 토큰으로 표현했다. - Voice Token LM이 대화 문맥과 텍스트 답변을 바탕으로 음성 토큰을 순차적으로 생성한다. - 생성된 토큰은 다음 두 단계를 거쳐 음성으로 변환된다. - **Token-to-Mel**: 음성 토큰을 mel-spectrogram으로 변환 - **Mel-to-Waveform**: mel-spectrogram을 waveform으로 복원 ## 기존 음성 토크나이저의 한계 ### 음향 특성 제어의 어려움 - 기존 토크나이저는 발화 내용과 의미를 안정적으로 표현하는 데 강점이 있었다. - 반면 음색, 높낮이, 억양, 속도, 감정 같은 세부 음향 정보는 충분히 구조화하지 못했다. - 따라서 “더 빠르게”, “낮은 목소리로”, “속삭이듯이” 같은 지시를 토큰 수준에서 직접 제어하기 어려웠다. - 같은 문장이라도 화자나 억양에 따라 토큰 표현이 달라지면, 언어모델이 내용과 음향 특성을 독립적으로 학습하기도 어려워진다. ### 긴 시퀀스와 복잡한 디코딩 - 초당 25프레임의 토큰은 발화가 길어질수록 생성해야 할 토큰 수와 연산량을 증가시킨다. - Token-to-Mel 단계에서 Diffusion이나 Flow-matching 기반의 반복 추론이 필요할 수 있다. - 이후 Mel-to-Waveform까지 수행해야 하므로 총 2단계 디코딩 구조가 된다. - 이로 인해 실시간 음성 대화에 필요한 응답 속도와 효율을 확보하기 어렵다. ## LM-SPT의 의미·음향 분리 구조 - LM-SPT는 **LM-aligned SPeech Tokenizer**의 약자로, 언어모델과의 결합을 고려해 설계됐다. - 음성을 기존의 절반인 **초당 12.5프레임**으로 압축한다. - 음성 정보를 다음 두 종류의 토큰으로 분리한다. - **의미 토큰**: 텍스트와 대화 문맥에 대응하는 발화 내용 - **음향 토큰**: 음색, 억양, 높낮이, 발화 속도 등 실제 목소리의 세부 특성 - 두 개의 인코더와 하나의 의미 코드북, 여러 개의 음향 코드북으로 구성된 **Split RVQ** 구조를 사용한다. - 의미 코드북이 발화의 핵심 내용을 표현하고, 여러 음향 코드북이 의미 토큰에서 빠진 음향 정보를 단계적으로 보완한다. ## 의미 음성-재합성 기반 증류 - 단순히 음성을 잘 복원하도록 학습하면 의미 토큰에 음향 정보가 섞이거나, 발화 내용이 음향 토큰에 분산될 수 있다. - 기존 방식은 HuBERT나 WavLM 같은 자기지도학습 음성 모델의 표현을 의미 토큰과 시간 단위로 맞추는 증류를 사용했다. - 그러나 다음과 같은 문제가 있다. - teacher 모델의 표현이 음소·발음 중심이어서 언어모델의 고수준 의미와 완전히 일치하지 않을 수 있다. - 서로 다른 frame rate를 맞추는 과정에서 표현을 평균·축약하면 의미 정보가 희석될 수 있다. - LM-SPT는 Whisper처럼 언어모델과 연계하기 좋은 음성 인코더를 활용한다. - 의미 토큰만으로 원본 음성을 재합성한 뒤, 원본과 재합성 음성의 의미 표현이 유사해지도록 학습한다. - 특정 시간 구간의 teacher 표현을 그대로 모방하지 않고, 압축된 의미 토큰만으로 원본의 발화 내용을 보존하도록 유도한다. - 이 방식은 frame rate가 달라도 인위적인 시간 정렬 없이 의미 정보를 학습할 수 있다는 장점이 있다. ## 효율적인 음성 복원 - 최종 복원 과정에서는 의미 토큰과 음향 토큰을 함께 사용한다. - mel-spectrogram이라는 중간 표현을 거치지 않고 waveform을 직접 생성한다. - 무거운 사전학습 음성 인코더 없이 가벼운 음성 인코더를 사용할 수 있다. - 12.5Hz의 낮은 frame rate로 Voice Token LM의 생성 시간 스텝을 기존 대비 절반으로 줄였다. - 단일 디코더로 waveform을 복원해 기존의 2-stage decoding보다 간결한 구조를 구현했다. ## 온라인 강화학습을 통한 지시 이행 - LM-SPT가 음성의 의미와 음향 특성을 표현할 기반을 제공한다면, 온라인 강화학습은 사용자의 발화 지시를 실제 출력에 반영하도록 모델을 조정한다. - 목표는 음질의 자연스러움을 유지하면서도 다음과 같은 요구를 충실히 따르는 것이다. - 말하기 속도 - 음량 - 음높이와 억양 - 감정과 말투 - 속삭임 등 특정 발화 스타일 - 이를 통해 Kanana-o는 “사람처럼 자연스럽게 말하기”에서 나아가 “사용자가 원하는 방식으로 말하기”를 지향한다. ## 실용적인 결론 음성 AI를 실제 서비스에 적용하려면 음질뿐 아니라 지연시간, 연산량, 제어 가능성을 함께 고려해야 한다. Kanana-o의 접근법처럼 의미·음향 정보를 분리한 저주파 토큰과 직접 waveform을 복원하는 디코더를 사용하고, 온라인 강화학습으로 지시 이행 능력을 보완하는 방식은 실시간·개인화 음성 서비스에 적합한 설계 방향이다.

원문 읽기(새 탭에서 열림)