@twomonkeys保持语调和情感, 只将音色换成要clone的声音的 tts, 怎么能实现呢? 中发帖

我希望输入一段已经完成的语音,在尽可能保留原始内容、发音、语速、重音、停顿、气口、语调和情感的前提下,只改变说话人的音色和声纹。 
有点像 elevenlab的一个演示 (https://www.youtube.com/watch?v=xU72OLqGdRo) 保持音调之类的, 音色换成另一个人的.
尝试了几个方法, 都不太行
- Applio/RVC:训练和推理流程已跑通,但音色变化不明显;继续增加训练轮数也没有实质改善。
- Vevo2 FM-only:短句有少量变化,长句稳定性不足。
- OpenVoice V2:能保留部分源音频时序,但目标音色相似度不足。
- IndexTTS 2.5:可以参考目标音色和风格重新生成,但不能严格保留源音频的原始韵律。
- Qwen3-TTS、VoxCPM2:能够根据参考音频生成目标音色,但不能稳定保留源音频原有的语调、停顿和节奏。
有...