03.5/VOICE音色与情绪
情绪可以换,
音色必须是本人。
KEY FINDING解耦/ 实测
我们使用的开源 TTS 支持音色克隆与情绪控制。在实测中,我们发现并规避了一个容易踩空的陷阱——两种情绪控制方式里,只有一种能保住主播的音色。
01/实测对比 · BENCHMARK
情绪有了,
音色被替换了。
用情绪向量控制时,模型会从自身预置的声音集合中选取情绪特征——结果是情绪生效,但主播音色被换成了别人的声音。改用情绪参考音频后,音色相似度保持在 0.986,情绪变化同时生效。
| 情绪控制方式 | 基频中位 | 与主播参考的音色相似度 | 结论 |
|---|---|---|---|
| 不施加情绪(基准) | 114 Hz | 0.986 | 基准 |
| 情绪向量 | 281 Hz | 0.552 | 音色被替换,不可用 |
| 情绪参考音频 | 122 Hz | 0.986 | 音色保持,情绪有效 |
表 4 · 两种情绪控制方式的实测对比。相似度越高代表越接近主播本人音色。
音色相似度对比
基频中位对比
基频中位反映音高:情绪向量方式把音高抬到了 281 Hz——那已经不是主播本人的声音了。
02/实用推论 · TAKEAWAY
情绪参考音频,
不必是主播本人录音。
这个结论带来一个非常实用的推论:情绪参考音频只需要提供情绪,不需要是主播本人的录音。
场景 01
品牌希望主播更热情
直接替换情绪参考- 做法用一段热情的叫卖录音
- 结果不必请主播重新录制
场景 02
同一份记忆,三种语气
与多性格系统联动- 专业顾问型情绪参考 A
- 闺蜜种草型情绪参考 B
- 文艺叙事型情绪参考 C
场景 03
跨境多语种
同一音色扩展- 形象与音色一次生产
- 语种多语种直播
03/授权与边界 · CONSENT
音色来自真人,
授权必须书面。
音色与形象都涉及真人权益。使用真人素材前取得书面授权与单独同意;人脸信息在本地处理,不上传公有云。
素材授权
- 真人录音与影像书面授权 + 单独同意
- 人脸信息本地处理
- 授权范围写入服务协议
技术边界
- 标识全程显示,不可关闭
- 去标识能力不提供
- 素材用途仅限授权范围