03/SYSTEM技术方案

一个中台,
三条画面路线。

FRAMEWORKv4/ 2026.09

不同类型的品牌对「主播画面从哪来」有不同诉求,但对降本增效的要求完全一致。我们把系统拆成两部分:可共用的语音与大脑中台,以及可替换的画面源

3.1/架构总览 · ARCHITECTURE

可共用的中台,
可替换的画面源。

语音合成、音色克隆、情绪控制、商品知识库、话术生成、事实校验与合规标识全部收敛在中台。升级中台,三条路线同时受益;平台规则变化时,只替换画面源即可继续开播。

Voice & Brain · 语音与交互中台(共用)
  • 语音合成 · IndexTTS 2.5本地部署
  • 音色克隆相似度 0.986
  • 情绪控制参考音频
  • 商品知识库结构化
  • 话术生成模板约束
  • 事实校验占位符替换
  • 合规标识不可关闭
Frame Source · 画面源(可替换)
  • 路线一 · 实拍 / 录播商品画面上线最快
  • 路线二 · 真人主播克隆数字人拟真度最高
  • 路线三 · AI 生成虚拟形象可复制性最强

三条路线共用同一套中台;当平台收紧规则时,交付形态可在路线之间切换,避免因单一形态受限而中断服务。

3.2/画面路线 · ROUTES

画面可以替换,
大脑始终共用。

同一套内容资产可以分发到不同平台;实际开播形态按目标平台规则逐家适配——内容可复制、形态可切换

路线画面来源适用场景特点
路线一 实拍或录播的商品画面 标品讲解、夜间时段、多平台铺开(按平台规则适配) 上线最快,商品展示最真实
路线二 真人主播克隆的数字人 接替真人主播的休息时段 拟真度最高,形象来自本人
路线三 AI 生成的虚拟形象 品牌自有 IP、跨境多语种 可复制性最强,不依赖真人

表 2 · 三条画面路线对比。三条路线共用同一套语音与交互中台,升级中台即可同时受益。

交付形态

当平台收紧规则时,交付形态可由「实拍素材 + 数字人语音」切换为「真人克隆 + 数字人语音」或「真人 + 数字人混合」。合规能力不因形态切换而失效。

3.3/内容模型 · CONTENT MODEL

只有一成时间,
需要占用显卡。

直播内容按「这段话会不会被反复说」拆成三层。预生成片段在播放时不消耗口型推理,只有真正发生实时对话时才占用算力——这是成本模型能够成立的关键设计。

层级内容生成方式是否占用实时算力
静态资产层形象、音色、背景、话术模板、商品资料一次生产,长期复用不占用
预生成片段层商品讲解、开场语、常见答疑、催单话术离线批量生成不占用
实时生成层弹幕应答、临时提问、价格播报实时推理占用

表 3 · 三层内容模型。只有实时生成层需要占用显卡推理资源。

直播时长构成(估算)
预生成片段层
约 90%
实时生成层
约 10%
对成本的意义

如果一场直播中约九成时间在播放预生成片段,单卡可承载的直播间数量可达「全程实时生成」模式的数倍。我们在成本测算中按保守的 3 个直播间 / 卡估计——对定价和毛利率而言,这是决定性的差异。

3.4 – 3.6/深入阅读 · DEEP DIVE

三个关键模块,
各自有一页。

交互链路的七个环节、音色与情绪的解耦实测、常客识别与关怀功能——都可以单独展开。