03/SYSTEM技术方案
一个中台,
三条画面路线。
FRAMEWORKv4/ 2026.09
不同类型的品牌对「主播画面从哪来」有不同诉求,但对降本增效的要求完全一致。我们把系统拆成两部分:可共用的语音与大脑中台,以及可替换的画面源。
3.1/架构总览 · ARCHITECTURE
可共用的中台,
可替换的画面源。
语音合成、音色克隆、情绪控制、商品知识库、话术生成、事实校验与合规标识全部收敛在中台。升级中台,三条路线同时受益;平台规则变化时,只替换画面源即可继续开播。
Voice & Brain · 语音与交互中台(共用)
- 语音合成 · IndexTTS 2.5本地部署
- 音色克隆相似度 0.986
- 情绪控制参考音频
- 商品知识库结构化
- 话术生成模板约束
- 事实校验占位符替换
- 合规标识不可关闭
Frame Source · 画面源(可替换)
- 路线一 · 实拍 / 录播商品画面上线最快
- 路线二 · 真人主播克隆数字人拟真度最高
- 路线三 · AI 生成虚拟形象可复制性最强
三条路线共用同一套中台;当平台收紧规则时,交付形态可在路线之间切换,避免因单一形态受限而中断服务。
3.2/画面路线 · ROUTES
画面可以替换,
大脑始终共用。
同一套内容资产可以分发到不同平台;实际开播形态按目标平台规则逐家适配——内容可复制、形态可切换。
| 路线 | 画面来源 | 适用场景 | 特点 |
|---|---|---|---|
| 路线一 | 实拍或录播的商品画面 | 标品讲解、夜间时段、多平台铺开(按平台规则适配) | 上线最快,商品展示最真实 |
| 路线二 | 真人主播克隆的数字人 | 接替真人主播的休息时段 | 拟真度最高,形象来自本人 |
| 路线三 | AI 生成的虚拟形象 | 品牌自有 IP、跨境多语种 | 可复制性最强,不依赖真人 |
表 2 · 三条画面路线对比。三条路线共用同一套语音与交互中台,升级中台即可同时受益。
交付形态
当平台收紧规则时,交付形态可由「实拍素材 + 数字人语音」切换为「真人克隆 + 数字人语音」或「真人 + 数字人混合」。合规能力不因形态切换而失效。
3.3/内容模型 · CONTENT MODEL
只有一成时间,
需要占用显卡。
直播内容按「这段话会不会被反复说」拆成三层。预生成片段在播放时不消耗口型推理,只有真正发生实时对话时才占用算力——这是成本模型能够成立的关键设计。
| 层级 | 内容 | 生成方式 | 是否占用实时算力 |
|---|---|---|---|
| 静态资产层 | 形象、音色、背景、话术模板、商品资料 | 一次生产,长期复用 | 不占用 |
| 预生成片段层 | 商品讲解、开场语、常见答疑、催单话术 | 离线批量生成 | 不占用 |
| 实时生成层 | 弹幕应答、临时提问、价格播报 | 实时推理 | 占用 |
表 3 · 三层内容模型。只有实时生成层需要占用显卡推理资源。
直播时长构成(估算)
对成本的意义
如果一场直播中约九成时间在播放预生成片段,单卡可承载的直播间数量可达「全程实时生成」模式的数倍。我们在成本测算中按保守的 3 个直播间 / 卡估计——对定价和毛利率而言,这是决定性的差异。
3.4 – 3.6/深入阅读 · DEEP DIVE
三个关键模块,
各自有一页。
交互链路的七个环节、音色与情绪的解耦实测、常客识别与关怀功能——都可以单独展开。