03.4/PIPELINE实时交互链路

从一条弹幕,
到一次开口。

STATUS已跑通/ local

一条弹幕从进入到数字人开口,依次经过七个环节,形成完整闭环。整条链路已在本地跑通,并有实测数据支撑(见 技术验证)。

01/七个环节 · PIPELINE STEPS

每个环节,
只做一件确定的事。

STEP01/ 07

把链路拆开的好处是:模型只负责它擅长的部分,事实、合规与记忆由系统承担——每一环都可以单独测试、单独替换。

常客识别

01

先判断该观众是否为常客,命中时调取其关怀档案作为后续环节的上下文;置信度不足时按新观众处理。

意图判断

02

先判断该条弹幕与商品是否相关。价格、优惠、尺码、材质、发货、售后归为必答;纯闲聊、恶意攻击和无法判断的内容直接略过。

知识检索

03

商品名称、价格、尺码、材质、卖点与常见问题来自结构化商品库,由系统检索后提供给模型。

话术生成

04

大模型在预设的话术模板内组织语言,保持人设一致的口吻,有一定自由发挥的能力。

事实校验

05

价格等关键信息不允许由模型生成,模型只能输出占位符,由系统用商品库中的真实数值替换。

语音合成

06

以克隆音色合成语音,情绪由参考音频控制;单句合成实测 3 至 6 秒(24 字左右应答句)。

口型驱动

07

将语音驱动为数字人口型,输出到直播画面;画面全程显示 AI 生成标识。

02/链路轨迹 · TRACE

一次完整的
应答轨迹。

下面是一条真实场景的模拟轨迹:观众询问尺码,链路命中商品库中的尺码表,回答中不含模型自由生成的事实。

TRACE · 弹幕「165cm 110 斤穿什么码?」演示为加速模拟 / 实测见技术验证
+00.0s常客识别置信度 0.71 · 未达点名阈值 → 按新观众处理
+00.4s意图判断必答 · 商品相关(尺码)
+00.9s知识检索命中商品库:尺码表 / 版型 / 面料弹性 · 3 条事实
+02.1s话术生成「建议 {size} 码,腰围有弹力,也可以对照尺码表参考」
+02.6s事实校验占位符 {size} → M 码(来源:商品库 · 尺码表)
+06.8s语音合成克隆音色 · 情绪参考音频(亲切)· 4.2s
+07.1s口型驱动输出到直播画面 · AI 标识保持显示
+07.4s留痕整场录制写入云端数据库 · 记录保存不少于三年

轨迹为演示用途的加速模拟;单句合成 3–6 秒、端到端约 15 秒为实测数据。可交互版本见 功能演示

03/略过策略 · SKIP

不是每条弹幕,
都值得开口。

数字人直播最怕「有问必答」式的机械回应。系统只回答与商品相关的问题,其余内容安静略过——不打断直播节奏

必答 · Answer
  • 价格 / 优惠必答
  • 尺码 / 版型必答
  • 材质 / 洗护必答
  • 发货 / 物流必答
  • 售后 / 退换必答
略过 · Skip
  • 纯闲聊略过
  • 恶意攻击略过
  • 无法判断的内容略过
  • 与商品无关的话题略过

略过的内容不进入语音合成,不占用实时算力,也不会出现在直播画面中。

04/性能现状 · LATENCY

延迟的现状,
与压缩路线。

当前端到端响应约 15 秒,还不能满足实时插话;但按三层内容模型,占直播时长约九成的讲解由预生成片段承担,不涉及实时延迟。目标是通过流式语音合成与实时口型驱动,把响应压缩到 5 秒以内。

00
Single Utterance

单句合成耗时(24 字左右应答句,含模型预热后的稳态速度)。

0
End-to-End Now

含大模型生成与语音合成的完整链路,适用于预生成与弹幕问答场景。

<0
Target

下一阶段目标:引入流式语音合成与实时口型驱动,方案设计上不存在原理性障碍。

0%
Pre-generated

直播时长中由预生成片段承担的比例(估算),不涉及实时延迟。

交叉验证

一线运营访谈中提到当前无人直播「对话与音频生成存在约 10 秒时差」,与本项目实测的约 15 秒处于同一量级——说明该延迟来自当前主流技术路线,而不是本项目实现上的偏差。