03.5/VOICE音色与情绪

情绪可以换,
音色必须是本人。

KEY FINDING解耦/ 实测

我们使用的开源 TTS 支持音色克隆与情绪控制。在实测中,我们发现并规避了一个容易踩空的陷阱——两种情绪控制方式里,只有一种能保住主播的音色。

01/实测对比 · BENCHMARK

情绪有了,
音色被替换了。

用情绪向量控制时,模型会从自身预置的声音集合中选取情绪特征——结果是情绪生效,但主播音色被换成了别人的声音。改用情绪参考音频后,音色相似度保持在 0.986,情绪变化同时生效。

情绪控制方式基频中位与主播参考的音色相似度结论
不施加情绪(基准) 114 Hz 0.986 基准
情绪向量 281 Hz 0.552 音色被替换,不可用
情绪参考音频 122 Hz 0.986 音色保持,情绪有效

表 4 · 两种情绪控制方式的实测对比。相似度越高代表越接近主播本人音色。

音色相似度对比
基准(无情绪)
0.986
情绪向量
0.552
情绪参考音频
0.986
基频中位对比
基准(无情绪)
114 Hz
情绪向量
281 Hz
情绪参考音频
122 Hz

基频中位反映音高:情绪向量方式把音高抬到了 281 Hz——那已经不是主播本人的声音了。

02/实用推论 · TAKEAWAY

情绪参考音频,
不必是主播本人录音。

这个结论带来一个非常实用的推论:情绪参考音频只需要提供情绪,不需要是主播本人的录音。

场景 01

品牌希望主播更热情

直接替换情绪参考
  • 做法用一段热情的叫卖录音
  • 结果不必请主播重新录制
场景 02

同一份记忆,三种语气

与多性格系统联动
  • 专业顾问型情绪参考 A
  • 闺蜜种草型情绪参考 B
  • 文艺叙事型情绪参考 C
场景 03

跨境多语种

同一音色扩展
  • 形象与音色一次生产
  • 语种多语种直播

03/授权与边界 · CONSENT

音色来自真人,
授权必须书面。

音色与形象都涉及真人权益。使用真人素材前取得书面授权与单独同意;人脸信息在本地处理,不上传公有云。

素材授权
  • 真人录音与影像书面授权 + 单独同意
  • 人脸信息本地处理
  • 授权范围写入服务协议
技术边界
  • 标识全程显示,不可关闭
  • 去标识能力不提供
  • 素材用途仅限授权范围
延伸阅读

常客关怀涉及消费者个人信息,按《个人信息保护法》的告知—同意、最小必要与可删除原则处理,详见 千面·知客合规能力