02.3/STUDIO全流程模拟

从选定形象,
到开播复盘。

STEPS01 – 07/ 可交互

七个步骤走完一条完整的数字人直播间搭建流程:形象选定 → 音色克隆与情绪 → 商品知识库 → 话术与审核 → 开播校验 → 开播应答 → 数据复盘。每一步都可交互,顶部会记录你的当前配置。

STEP 01 / 07 · AVATAR

选定形象

从形象库中按画面路线挑选。路线一使用实拍商品画面(上线最快),路线二使用真人克隆(需书面授权与单独同意),路线三为 AI 生成虚拟形象(不依赖真人)。

授权与边界

使用真人素材前取得书面授权与单独同意,人脸信息在本地处理;形象库中的每个形象都带授权状态标签。AI 生成形象不涉及真人权益,但同样受标识义务约束。

下一步:为选定的形象克隆音色,并设置情绪控制方式
STEP 02 / 07 · VOICE

音色克隆与情绪控制

选择一段参考音频开始克隆;随后对比三种情绪控制方式——只有「情绪参考音频」能在保持主播音色的同时让情绪生效。

参考音频 · REFERENCE
CLONE · 克隆进度待开始
IndexTTS 2.5 · 本地部署 · 权重 5.11 GB
情绪控制 · EMOTION
多性格系统 · 同一份记忆三种语气
跨境多语种 · LANGUAGES

同一形象与音色可扩展到多语种直播,服务跨境业务;音色只需一次克隆。

实用推论

情绪参考音频不必是主播本人录音:品牌希望语气更热情,直接换一段热情的叫卖录音即可,不必请主播重录。

下一步:导入商品资料,构建结构化商品知识库
STEP 03 / 07 · KNOWLEDGE

导入商品知识库

商品资料解析为结构化字段后,链路的「知识检索」与「事实校验」才有依据:价格、尺码等关键信息强制取自商品库,模型无权生成。

结构化字段 · 6 项
知识库命中测试 · RETRIEVAL
KB 输入一个问题,查看知识库检索结果
下一步:生成预生成片段,并做一次话术合规审核
STEP 04 / 07 · SCRIPT

话术生成与合规审核

按三层内容模型拆解直播内容:静态资产一次生产长期复用,预生成片段离线批量生成、播放时不占算力,只有实时应答占用显卡。开播前对讲解话术做一次违禁词审核。

三层内容模型 · CONTENT MODEL
静态资产层形象、音色、背景、话术模板、商品资料不占算力
预生成片段层商品讲解 / 开场语 / 常见答疑 / 催单话术不占算力
实时生成层弹幕应答、临时提问、价格播报占用

约九成直播时长由预生成片段承担;单卡可承载的直播间数量可达全程实时生成模式的数倍(保守按 3 路 / 卡测算)。

话术审核 · COMPLIANCE CHECK
这条裙子是全网最低价,绝对显瘦,穿一次就能瘦 3 斤;面料是医用级抗菌材质,敏感肌也能治;喜欢的姐妹扣 1,我给大家申请了专属福利。
对应《办法》第三十条 · 开播前逐项检查
下一步:按目标平台逐项校验开播条件
STEP 05 / 07 · PLATFORM

开播校验

各平台对无人 / AI 直播的限制并不一致,能不能用取决于最短的那块板。开播前按目标平台逐项校验,并完成开播前检查清单。

开播前检查清单 · PRE-CHECK
下一步:开播,观察弹幕应答与留痕
STEP 06 / 07 · LIVE

开播

开播后弹幕持续进入:必答内容走完整链路应答,闲聊与无法判断的内容安静略过;价格等关键信息由商品库替换。AI 生成标识全程显示,整场录制留痕。

数字人主播形象
AI 生成 · 千面智语 LIVE · 128 观看
STANDBY · 待开播
口型驱动
碎花连衣裙 · ¥299
(待机)完成前五步后点击「开始直播」
PIPELINE · 链路状态 IDLE · 端到端 ≈ 15s 实测 / 演示加速
01常客识别待机
02意图判断待机
03知识检索待机
04话术生成待机
05事实校验待机
06语音合成待机
07口型驱动待机
TRACE · 链路日志本场留痕 · 保存不少于三年
--:--系统等待开播…
自动应答AUTO · 演示用
DANMAKU · 弹幕流点击弹幕手动触发应答
结束本场后,数据会自动汇总到复盘报告
STEP 07 / 07 · REVIEW

数据复盘

本场数据来自 STEP 06 的模拟直播:时长、弹幕、应答、略过、常客关怀与留痕记录。真实运营中,这些指标用于与商家共同评估效果。

下一步

把验证往前推一步:先用免费共建跑通两到三家真实商家,取得真实的时段覆盖与互动数据,再谈付费与规模化。