Skip to content

필사 모드: Voice AI 实战完全指南:实时 STT/TTS、语音 LLM、Turn-taking、深度伪造防御(2025)

中文
0%
정확도 0%
💡 왼쪽 원문을 읽으면서 오른쪽에 따라 써보세요. Tab 키로 힌트를 받을 수 있습니다.

Season 4 Ep 9 — 在 Ep 8 里,音频只是多种模态之一。Ep 9 只聚焦语音这一类产品。实时性・自然度・安全性 — 为什么把这三者同时抓住很难,以及该怎么抓。

Prologue — “没有屏幕的 AI”之年

2024 年 5 月 OpenAI 的 GPT-4o 演示是语音 AI 的转折点。延迟 ~300ms、自然的发音、情感表达、打断 — 传统 STT→LLM→TTS 流水线难以抵达的品质,被一个端到端模型呈现了出来。

2025 年现在:

  • 客服中心:出现了让语音 AI 处理 50%+ 简单咨询的企业
  • 教育・辅导:英语和外语会话应用的标准 UX
  • 健康・咨询:治疗性对话的辅助(医疗建议依然禁止)
  • 个人助理:汽车・智能家居・可穿戴设备

这篇文章一口气梳理“做语音 AI 时该知道的全部”。


第1章 · 两种架构

1.1 传统流水线(STT → LLM → TTS)

[麦克风]VAD[流式 STT][LLM][流式 TTS][扬声器]
  • 各阶段独立 → 灵活、易调试
  • 模型和厂商可自由选择
  • 缺点:延迟累积(500ms–1.5s),情感与语调丢失

1.2 语音 LLM(end-to-end)

[麦克风][语音 LLM:语音 → 语音][扬声器]
  • 直接输入输出音频 token
  • 连情感・笑声・叹气都能还原
  • 延迟 ~300ms
  • 缺点:模型体积大,厂商有限(OpenAI/Google/Moshi 等),精细控制困难

1.3 2025 年的混合现实

  • 实时双向对话 → 语音 LLM
  • 非实时・批处理 → 传统流水线(成本与日志更有优势)
  • 企业级:合规与审计要求强烈,传统流水线依然占优
  • 消费级:语音 LLM 正在快速扩散

第2章 · 实时流水线设计

2.1 VAD(Voice Activity Detection)

  • 目的:只把有人说话的片段送进 STT,节省成本与延迟
  • 模型:Silero VAD(开源)、WebRTC VAD、PyAnnote
  • 参数:阈值・最短发话长度・静音结束判定

2.2 流式 STT

  • 以 250–500ms 为单位吐出部分结果(partial transcript)
  • 最终结果(final transcript)在检测到 end-of-utterance 时给出
  • Deepgram、AssemblyAI、Whisper(streaming)、Google/Azure/AWS、Clova/Kakao

2.3 LLM 处理

  • 可以基于 partial transcript “开始思考”(提前构建上下文)
  • final transcript 确定后生成回复
  • Speculative generation:基于 partial 提前开始作答 → final 确定后再修正

2.4 流式 TTS

  • 在句子边界处顺序播放
  • 不靠“思考中”的填充词(uh/hmm)也有自然的间隔
  • 缩短延迟的关键

2.5 打断(Barge-in)

  • 用户一开口就立刻停止 TTS
  • 只播了一部分的回复,要以“摘要/更正”的方式带进下一轮发话
  • 让中断像人一样自然而不是像机器人,是 UX 的生死线

第3章 · 延迟预算设计

3.1 目标

研究与业界常引用的数字:人类对话的平均轮次间隔约 200ms。AI 在 500ms–1s 内回应就会让人觉得自然。超过 1.5s 就别扭了。

3.2 预算示例(传统流水线)

VAD end-of-utterance 检测: 150ms
STT 最终结果: 150ms
LLM TTFT(首个 token): 300ms
TTS 首个音频块: 150ms
网络与解码: 100ms
───────────────────
到首次语音播放的合计: 约 850ms

3.3 可压缩的地方

  • 小而快的 LLM做 first responder(填充词・附和)
  • 流式化:STT/LLM/TTS 全都要
  • 语音 LLM:架构本身就更短
  • 就近部署:部署在离用户近的地区

3.4 抖动与稳定性

  • 比平均延迟更重要的是 p95/p99
  • 一轮拖长,后面所有轮次的节奏都会垮 → 用户流失

第4章 · 语音 LLM — GPT-4o Realtime、Gemini Live、Moshi

4.1 GPT-4o Realtime

  • 语音・文本双向实时
  • 基于 WebSocket/WebRTC
  • 延迟 300–500ms
  • 价格比文本贵不少,但延迟和品质有压倒性优势

4.2 Gemini Live

  • 1M 上下文 + 实时多模态
  • 可以组合屏幕共享・摄像头输入
  • 打断与情感表达出色

4.3 Moshi(Kyutai,开源)

  • 开源的语音 LLM
  • 全双工(full-duplex)、低延迟
  • 可本地运行 — 对隐私类产品很有吸引力

4.4 差异

项目GPT-4oGemini LiveMoshi
价格自托管
韩语优秀优秀有限
定制有限有限高(开源)
模态混合语音・文本语音・视频・文本以语音为主
企业级API + 日志Google Cloud自行管理

第5章 · 情感・语调・语速 — Expressive Speech

5.1 TTS 的控制轴

  • 音色/声音:人物形象・性别・年龄
  • 情感:neutral、happy、sad、angry、excited 等
  • 语速:0.8x–1.5x
  • 重音:强调特定词语
  • 呼吸与停顿:像 <break time="300ms"/> 这样的 SSML

5.2 SSML(Speech Synthesis Markup Language)

<speak>
  你好,<break time="300ms"/>
  今天我们来聊一个 <emphasis level="strong">非常重要的</emphasis> 话题。
</speak>
  • Google、Microsoft、Naver Clova、Kakao 等大多数厂商都支持
  • ElevenLabs・OpenAI TTS 使用自有格式(花括号・自然语言指令)

5.3 情感的政治学

  • 企业品牌调性:排除过度的情感
  • 面向儿童的服务:温暖的语气,语速放慢
  • 医疗・咨询:中立而沉稳

不要给所有声音都用同一种语气。按服务场景拆分配置文件。


第6章 · 电话(PSTN)・浏览器・移动端

6.1 电话集成

  • Twilio、Vonage、Plivo、SignalWire:可编程电话
  • 通过 SIP/PSTN 网关把语音流交给 STT/LLM
  • 韩国:LG U+ AI 呼叫、KT AICC、Naver Cloud AiCall 等本地方案

6.2 浏览器

  • 用 WebRTC 做双向音频
  • 权限、回声消除、噪声抑制都内置
  • 必须确认移动浏览器兼容性

6.3 移动应用

  • iOS:AVAudioEngine、Speech、AVSpeechSynthesizer
  • Android:AudioRecord、MediaCodec、TTS API
  • 可以利用原生 VAD

6.4 汽车・嵌入式

  • 噪声・风噪的补偿
  • 驾驶中的安全:紧急情况下的简短回应
  • 离线模式是必需的(连接不稳定)

第7章 · 深度伪造・声音克隆的威胁与防御

7.1 威胁

  • 语音诈骗:复制家人的声音要求紧急转账
  • 冒充高管:用 CEO 的声音下达转账指令
  • 冒充身份:绕过客服中心・金融机构的本人认证

7.2 防御层

  1. 活体检测:是准备好的台词,还是要求实时应答
  2. 声纹生物认证:声纹 + 行为的双重认证
  3. 深度伪造检测:合成语音分类器(准确率 90% 上下,并不完美)
  4. 回拨确认:敏感请求要回拨到已登记的号码
  5. AI 标识义务化:部分国家和州的法规(是 AI 语音时必须告知)

7.3 水印

  • 在 AI 生成的语音里嵌入无法感知的水印(例如 Google SynthID for audio)
  • 检测器通过确认水印来识别 AI 出处
  • 目前还不是 100% 可靠 — 只当作防御层之一

7.4 运营策略

  • 敏感交易设为“禁止 AI 语音应对”→ 转给人工
  • 语音日志的保存与审计(在法律允许的范围内)
  • 新通话接通时的 AI 提示:“本次通话正由 AI 客服接待。”

第8章 · 韩语语音产品的特殊性

8.1 STT

  • 标准语的准确率在 Clova/Kakao 上是 95%+
  • 方言的覆盖仍然不足
  • 专业术语(医疗・法律)必须配自定义词典

8.2 TTS

  • Naver CLOVA Voice、Kakao i、Supertone:自然度处于最上层
  • ElevenLabs 的韩语声音也在快速改善
  • 控制韩语特有的语调和敬语说法很重要

8.3 法律与监管

  • 电气通信事业法・电子商务法:通话录音必须告知
  • 个人信息保护法:语音数据也可能包含敏感信息
  • 金融:客户确认(KYC)不能只靠 AI 语音完成认证

8.4 文化与 UX

  • 平语/敬语的一致性
  • 称呼(先生・女士・客户)的品牌策略
  • 回复开头带上“好的,某某先生/女士”这类措辞会提升信任度

第9章 · 成本与运营

9.1 成本构成

  • STT:每分钟 $0.003–0.02
  • TTS:每字符 $0.00001–0.00005(取决于声音与品质)
  • LLM:按 token 计(输入/输出)— 与文本相同
  • 语音 LLM:相比传统流水线通常贵 2–5 倍(2025 年前期)
  • 线路(PSTN):额外的分钟费用

9.2 扩容

  • N 路并发通话 → 每条流一个 TCP/WebSocket + 一个 LLM 槽位
  • 编排(Kubernetes + HPA)+ 多地域分布
  • 用预热池减少 cold start

9.3 可观测性

  • 每通电话的延迟(p50/p95)、打断频率、转人工比例
  • 对幻觉与不当发言的实时监控
  • 跟踪 NPS 与解决率

第10章 · 实战案例 3 则

10.1 客服中心一线应对

  • 用途:预约・地址变更・简单 FAQ
  • 复杂咨询要平滑移交给人工客服(把上下文摘要一并传过去)
  • 自动检查录音与合规话术

10.2 英语会话学习应用

  • 用语音 LLM(GPT-4o realtime)做自然对话
  • 发音评测(传统 STT 更准)
  • 调到合适的难度(配合用户水平)

10.3 长者照护与身心健康

  • 陪聊・简单提醒・服药提醒
  • 情感语气要温暖,语速要放慢
  • 检测到紧急情况(跌倒・异常症状)时联系监护人

第11章 · UX 原则 12 条

  1. 延迟就是一切:超过 1 秒就别扭
  2. 打断:用户一打断就立即停下
  3. 要短:每轮控制在 3–5 句以内
  4. 不确定的信号:不知道就明说“我不太清楚”
  5. 防欺骗:敏感操作不能只凭语音
  6. 克制情感:品牌调性优先,禁止过度演绎
  7. 填充词:用“嗯”“好的”这类短信号传达“我在听”
  8. 重复提问:用户说“你说什么?”时就调整语速和发音
  9. 收尾信号:用“还需要别的帮助吗?”自然收场
  10. 错误恢复:觉得 STT 听错了就用“我这样理解对吗?”反问
  11. 屏蔽个人信息:不鼓励用语音输入卡号・身份证号
  12. 无障碍:为听障人士和长者单独设计 UX

第12章 · 反模式 10 选

12.1 不测延迟就上线

体感品质的 90% 是延迟。以 p95 为准。

12.2 给 LLM 过长的提示词

实时性会崩。系统提示要短而锋利。

12.3 没有打断处理

你说话时还一路硬推的机器人。会毁掉 UX。

12.4 情感与语气不一致

混着用三种声音,品牌就乱了。

12.5 只相信深度伪造检测

检测器并不完美。要与活体检测・回拨・策略并用。

12.6 遗漏法律告知

通话录音与 AI 应对的告知是必需的。

12.7 用批处理 TTS 做实时

需要重写成按块的流式处理。

12.8 敏感交易只走语音

金融・医疗的本人认证要加一条通道。

12.9 无视方言与长者的声音

STT 准确率差异很大。样本多样化 + 定制化。

12.10 没有日志

失去纠纷处理与品质改进的依据。


第13章 · 检查清单 — Voice AI 上线前的 12 项

  • p50/p95 延迟目标与测量
  • VAD/STT/LLM/TTS 各阶段的故障回退
  • 打断处理的 UX 测试
  • 定义情感与语气配置文件
  • 插入 AI 应对的告知话术
  • 录音・保存・销毁策略符合法律
  • 深度伪造・欺骗的防御层
  • 转人工的触发条件与上下文传递
  • 测量用户满意度(NPS/解决率)
  • 敏感交易与数据建议走语音以外的通道
  • 验证韩语 STT/TTS 品质(厂商对比)
  • 无障碍(听障・长者)的替代路径

第14章 · 下期预告 — Season 4 Ep 10:“LLM 安全”

无论语音还是文本,2025 年 LLM 产品最大的威胁都是安全事故

  • Prompt injection 的 12 种变体
  • Jailbreak・角色扮演绕过
  • Data exfiltration 向量
  • Model extraction・参数泄露
  • 拒绝服务(DoS)、计费攻击
  • Red team 的搭建与自动化(PyRIT、Garak)
  • 护栏提示词 vs 分类器模型
  • 隐私・PII 泄露
  • 供应链(模型・MCP 服务器)威胁
  • 标准与监管(EU AI Act、韩国个人信息保护)
  • 事故响应手册

“安全不是功能,而是默认值。” 然而 2024–2025 年,很多 LLM 产品连基本盘都还没搭好。

下篇文章再见。


小结:Voice AI 是实时性・自然度・安全性这三拍。选传统流水线还是语音 LLM,取决于你对延迟・控制力・合规的要求,而 p95 延迟决定了用户体验的 90%。情感・语速・语气要用品牌策略来管理,深度伪造与欺骗则必须靠多层防御。韩语产品会把 Clova・Kakao・Supertone 这类本地资产与全球语音 LLM 组合起来,把品质边界推到最大。“没有屏幕的 AI”时代,如今的极限只剩下做产品的人的想象力。

현재 단락 (1/185)

2024 年 5 月 OpenAI 的 GPT-4o 演示是语音 AI 的转折点。延迟 ~300ms、自然的发音、情感表达、打断 — 传统 STT→LLM→TTS 流水线难以抵达的品质,被一个端到端模...

작성 글자: 0원문 글자: 5,593작성 단락: 0/185