03.4/PIPELINE实时交互链路
从一条弹幕,
到一次开口。
一条弹幕从进入到数字人开口,依次经过七个环节,形成完整闭环。整条链路已在本地跑通,并有实测数据支撑(见 技术验证)。
01/七个环节 · PIPELINE STEPS
每个环节,
只做一件确定的事。
把链路拆开的好处是:模型只负责它擅长的部分,事实、合规与记忆由系统承担——每一环都可以单独测试、单独替换。
常客识别
先判断该观众是否为常客,命中时调取其关怀档案作为后续环节的上下文;置信度不足时按新观众处理。
意图判断
先判断该条弹幕与商品是否相关。价格、优惠、尺码、材质、发货、售后归为必答;纯闲聊、恶意攻击和无法判断的内容直接略过。
知识检索
商品名称、价格、尺码、材质、卖点与常见问题来自结构化商品库,由系统检索后提供给模型。
话术生成
大模型在预设的话术模板内组织语言,保持人设一致的口吻,有一定自由发挥的能力。
事实校验
价格等关键信息不允许由模型生成,模型只能输出占位符,由系统用商品库中的真实数值替换。
语音合成
以克隆音色合成语音,情绪由参考音频控制;单句合成实测 3 至 6 秒(24 字左右应答句)。
口型驱动
将语音驱动为数字人口型,输出到直播画面;画面全程显示 AI 生成标识。
02/链路轨迹 · TRACE
一次完整的
应答轨迹。
下面是一条真实场景的模拟轨迹:观众询问尺码,链路命中商品库中的尺码表,回答中不含模型自由生成的事实。
轨迹为演示用途的加速模拟;单句合成 3–6 秒、端到端约 15 秒为实测数据。可交互版本见 功能演示。
03/略过策略 · SKIP
不是每条弹幕,
都值得开口。
数字人直播最怕「有问必答」式的机械回应。系统只回答与商品相关的问题,其余内容安静略过——不打断直播节奏。
- 价格 / 优惠必答
- 尺码 / 版型必答
- 材质 / 洗护必答
- 发货 / 物流必答
- 售后 / 退换必答
- 纯闲聊略过
- 恶意攻击略过
- 无法判断的内容略过
- 与商品无关的话题略过
略过的内容不进入语音合成,不占用实时算力,也不会出现在直播画面中。
04/性能现状 · LATENCY
延迟的现状,
与压缩路线。
当前端到端响应约 15 秒,还不能满足实时插话;但按三层内容模型,占直播时长约九成的讲解由预生成片段承担,不涉及实时延迟。目标是通过流式语音合成与实时口型驱动,把响应压缩到 5 秒以内。
单句合成耗时(24 字左右应答句,含模型预热后的稳态速度)。
含大模型生成与语音合成的完整链路,适用于预生成与弹幕问答场景。
下一阶段目标:引入流式语音合成与实时口型驱动,方案设计上不存在原理性障碍。
直播时长中由预生成片段承担的比例(估算),不涉及实时延迟。
一线运营访谈中提到当前无人直播「对话与音频生成存在约 10 秒时差」,与本项目实测的约 15 秒处于同一量级——说明该延迟来自当前主流技术路线,而不是本项目实现上的偏差。