- Published on
Voice AI 实战完全指南:实时 STT/TTS、语音 LLM、Turn-taking、深度伪造防御(2025)
- Authors

- Name
- Youngju Kim
- @fjvbn20031
Season 4 Ep 9 — 在 Ep 8 里,音频只是多种模态之一。Ep 9 只聚焦语音这一类产品。实时性・自然度・安全性 — 为什么把这三者同时抓住很难,以及该怎么抓。
- Prologue — “没有屏幕的 AI”之年
- 第1章 · 两种架构
- 第2章 · 实时流水线设计
- 第3章 · 延迟预算设计
- 第4章 · 语音 LLM — GPT-4o Realtime、Gemini Live、Moshi
- 第5章 · 情感・语调・语速 — Expressive Speech
- 第6章 · 电话(PSTN)・浏览器・移动端
- 第7章 · 深度伪造・声音克隆的威胁与防御
- 第8章 · 韩语语音产品的特殊性
- 第9章 · 成本与运营
- 第10章 · 实战案例 3 则
- 第11章 · UX 原则 12 条
- 第12章 · 反模式 10 选
- 第13章 · 检查清单 — Voice AI 上线前的 12 项
- 第14章 · 下期预告 — Season 4 Ep 10:“LLM 安全”
Prologue — “没有屏幕的 AI”之年
2024 年 5 月 OpenAI 的 GPT-4o 演示是语音 AI 的转折点。延迟 ~300ms、自然的发音、情感表达、打断 — 传统 STT→LLM→TTS 流水线难以抵达的品质,被一个端到端模型呈现了出来。
2025 年现在:
- 客服中心:出现了让语音 AI 处理 50%+ 简单咨询的企业
- 教育・辅导:英语和外语会话应用的标准 UX
- 健康・咨询:治疗性对话的辅助(医疗建议依然禁止)
- 个人助理:汽车・智能家居・可穿戴设备
这篇文章一口气梳理“做语音 AI 时该知道的全部”。
第1章 · 两种架构
1.1 传统流水线(STT → LLM → TTS)
[麦克风] → VAD → [流式 STT] → [LLM] → [流式 TTS] → [扬声器]
- 各阶段独立 → 灵活、易调试
- 模型和厂商可自由选择
- 缺点:延迟累积(500ms–1.5s),情感与语调丢失
1.2 语音 LLM(end-to-end)
[麦克风] → [语音 LLM:语音 → 语音] → [扬声器]
- 直接输入输出音频 token
- 连情感・笑声・叹气都能还原
- 延迟 ~300ms
- 缺点:模型体积大,厂商有限(OpenAI/Google/Moshi 等),精细控制困难
1.3 2025 年的混合现实
- 实时双向对话 → 语音 LLM
- 非实时・批处理 → 传统流水线(成本与日志更有优势)
- 企业级:合规与审计要求强烈,传统流水线依然占优
- 消费级:语音 LLM 正在快速扩散
第2章 · 实时流水线设计
2.1 VAD(Voice Activity Detection)
- 目的:只把有人说话的片段送进 STT,节省成本与延迟
- 模型:Silero VAD(开源)、WebRTC VAD、PyAnnote
- 参数:阈值・最短发话长度・静音结束判定
2.2 流式 STT
- 以 250–500ms 为单位吐出部分结果(partial transcript)
- 最终结果(final transcript)在检测到 end-of-utterance 时给出
- Deepgram、AssemblyAI、Whisper(streaming)、Google/Azure/AWS、Clova/Kakao
2.3 LLM 处理
- 可以基于 partial transcript “开始思考”(提前构建上下文)
- final transcript 确定后生成回复
- Speculative generation:基于 partial 提前开始作答 → final 确定后再修正
2.4 流式 TTS
- 在句子边界处顺序播放
- 不靠“思考中”的填充词(uh/hmm)也有自然的间隔
- 缩短延迟的关键
2.5 打断(Barge-in)
- 用户一开口就立刻停止 TTS
- 只播了一部分的回复,要以“摘要/更正”的方式带进下一轮发话
- 让中断像人一样自然而不是像机器人,是 UX 的生死线
第3章 · 延迟预算设计
3.1 目标
研究与业界常引用的数字:人类对话的平均轮次间隔约 200ms。AI 在 500ms–1s 内回应就会让人觉得自然。超过 1.5s 就别扭了。
3.2 预算示例(传统流水线)
VAD end-of-utterance 检测: 150ms
STT 最终结果: 150ms
LLM TTFT(首个 token): 300ms
TTS 首个音频块: 150ms
网络与解码: 100ms
───────────────────
到首次语音播放的合计: 约 850ms
3.3 可压缩的地方
- 用小而快的 LLM做 first responder(填充词・附和)
- 流式化:STT/LLM/TTS 全都要
- 语音 LLM:架构本身就更短
- 就近部署:部署在离用户近的地区
3.4 抖动与稳定性
- 比平均延迟更重要的是 p95/p99
- 一轮拖长,后面所有轮次的节奏都会垮 → 用户流失
第4章 · 语音 LLM — GPT-4o Realtime、Gemini Live、Moshi
4.1 GPT-4o Realtime
- 语音・文本双向实时
- 基于 WebSocket/WebRTC
- 延迟 300–500ms
- 价格比文本贵不少,但延迟和品质有压倒性优势
4.2 Gemini Live
- 1M 上下文 + 实时多模态
- 可以组合屏幕共享・摄像头输入
- 打断与情感表达出色
4.3 Moshi(Kyutai,开源)
- 开源的语音 LLM
- 全双工(full-duplex)、低延迟
- 可本地运行 — 对隐私类产品很有吸引力
4.4 差异
| 项目 | GPT-4o | Gemini Live | Moshi |
|---|---|---|---|
| 价格 | 高 | 中 | 自托管 |
| 韩语 | 优秀 | 优秀 | 有限 |
| 定制 | 有限 | 有限 | 高(开源) |
| 模态混合 | 语音・文本 | 语音・视频・文本 | 以语音为主 |
| 企业级 | API + 日志 | Google Cloud | 自行管理 |
第5章 · 情感・语调・语速 — Expressive Speech
5.1 TTS 的控制轴
- 音色/声音:人物形象・性别・年龄
- 情感:neutral、happy、sad、angry、excited 等
- 语速:0.8x–1.5x
- 重音:强调特定词语
- 呼吸与停顿:像
<break time="300ms"/>这样的 SSML
5.2 SSML(Speech Synthesis Markup Language)
<speak>
你好,<break time="300ms"/>
今天我们来聊一个 <emphasis level="strong">非常重要的</emphasis> 话题。
</speak>
- Google、Microsoft、Naver Clova、Kakao 等大多数厂商都支持
- ElevenLabs・OpenAI TTS 使用自有格式(花括号・自然语言指令)
5.3 情感的政治学
- 企业品牌调性:排除过度的情感
- 面向儿童的服务:温暖的语气,语速放慢
- 医疗・咨询:中立而沉稳
不要给所有声音都用同一种语气。按服务场景拆分配置文件。
第6章 · 电话(PSTN)・浏览器・移动端
6.1 电话集成
- Twilio、Vonage、Plivo、SignalWire:可编程电话
- 通过 SIP/PSTN 网关把语音流交给 STT/LLM
- 韩国:LG U+ AI 呼叫、KT AICC、Naver Cloud AiCall 等本地方案
6.2 浏览器
- 用 WebRTC 做双向音频
- 权限、回声消除、噪声抑制都内置
- 必须确认移动浏览器兼容性
6.3 移动应用
- iOS:AVAudioEngine、Speech、AVSpeechSynthesizer
- Android:AudioRecord、MediaCodec、TTS API
- 可以利用原生 VAD
6.4 汽车・嵌入式
- 噪声・风噪的补偿
- 驾驶中的安全:紧急情况下的简短回应
- 离线模式是必需的(连接不稳定)
第7章 · 深度伪造・声音克隆的威胁与防御
7.1 威胁
- 语音诈骗:复制家人的声音要求紧急转账
- 冒充高管:用 CEO 的声音下达转账指令
- 冒充身份:绕过客服中心・金融机构的本人认证
7.2 防御层
- 活体检测:是准备好的台词,还是要求实时应答
- 声纹生物认证:声纹 + 行为的双重认证
- 深度伪造检测:合成语音分类器(准确率 90% 上下,并不完美)
- 回拨确认:敏感请求要回拨到已登记的号码
- AI 标识义务化:部分国家和州的法规(是 AI 语音时必须告知)
7.3 水印
- 在 AI 生成的语音里嵌入无法感知的水印(例如 Google SynthID for audio)
- 检测器通过确认水印来识别 AI 出处
- 目前还不是 100% 可靠 — 只当作防御层之一
7.4 运营策略
- 敏感交易设为“禁止 AI 语音应对”→ 转给人工
- 语音日志的保存与审计(在法律允许的范围内)
- 新通话接通时的 AI 提示:“本次通话正由 AI 客服接待。”
第8章 · 韩语语音产品的特殊性
8.1 STT
- 标准语的准确率在 Clova/Kakao 上是 95%+
- 方言的覆盖仍然不足
- 专业术语(医疗・法律)必须配自定义词典
8.2 TTS
- Naver CLOVA Voice、Kakao i、Supertone:自然度处于最上层
- ElevenLabs 的韩语声音也在快速改善
- 控制韩语特有的语调和敬语说法很重要
8.3 法律与监管
- 电气通信事业法・电子商务法:通话录音必须告知
- 个人信息保护法:语音数据也可能包含敏感信息
- 金融:客户确认(KYC)不能只靠 AI 语音完成认证
8.4 文化与 UX
- 平语/敬语的一致性
- 称呼(先生・女士・客户)的品牌策略
- 回复开头带上“好的,某某先生/女士”这类措辞会提升信任度
第9章 · 成本与运营
9.1 成本构成
- STT:每分钟 $0.003–0.02
- TTS:每字符 $0.00001–0.00005(取决于声音与品质)
- LLM:按 token 计(输入/输出)— 与文本相同
- 语音 LLM:相比传统流水线通常贵 2–5 倍(2025 年前期)
- 线路(PSTN):额外的分钟费用
9.2 扩容
- N 路并发通话 → 每条流一个 TCP/WebSocket + 一个 LLM 槽位
- 编排(Kubernetes + HPA)+ 多地域分布
- 用预热池减少 cold start
9.3 可观测性
- 每通电话的延迟(p50/p95)、打断频率、转人工比例
- 对幻觉与不当发言的实时监控
- 跟踪 NPS 与解决率
第10章 · 实战案例 3 则
10.1 客服中心一线应对
- 用途:预约・地址变更・简单 FAQ
- 复杂咨询要平滑移交给人工客服(把上下文摘要一并传过去)
- 自动检查录音与合规话术
10.2 英语会话学习应用
- 用语音 LLM(GPT-4o realtime)做自然对话
- 发音评测(传统 STT 更准)
- 调到合适的难度(配合用户水平)
10.3 长者照护与身心健康
- 陪聊・简单提醒・服药提醒
- 情感语气要温暖,语速要放慢
- 检测到紧急情况(跌倒・异常症状)时联系监护人
第11章 · UX 原则 12 条
- 延迟就是一切:超过 1 秒就别扭
- 打断:用户一打断就立即停下
- 要短:每轮控制在 3–5 句以内
- 不确定的信号:不知道就明说“我不太清楚”
- 防欺骗:敏感操作不能只凭语音
- 克制情感:品牌调性优先,禁止过度演绎
- 填充词:用“嗯”“好的”这类短信号传达“我在听”
- 重复提问:用户说“你说什么?”时就调整语速和发音
- 收尾信号:用“还需要别的帮助吗?”自然收场
- 错误恢复:觉得 STT 听错了就用“我这样理解对吗?”反问
- 屏蔽个人信息:不鼓励用语音输入卡号・身份证号
- 无障碍:为听障人士和长者单独设计 UX
第12章 · 反模式 10 选
12.1 不测延迟就上线
体感品质的 90% 是延迟。以 p95 为准。
12.2 给 LLM 过长的提示词
实时性会崩。系统提示要短而锋利。
12.3 没有打断处理
你说话时还一路硬推的机器人。会毁掉 UX。
12.4 情感与语气不一致
混着用三种声音,品牌就乱了。
12.5 只相信深度伪造检测
检测器并不完美。要与活体检测・回拨・策略并用。
12.6 遗漏法律告知
通话录音与 AI 应对的告知是必需的。
12.7 用批处理 TTS 做实时
需要重写成按块的流式处理。
12.8 敏感交易只走语音
金融・医疗的本人认证要加一条通道。
12.9 无视方言与长者的声音
STT 准确率差异很大。样本多样化 + 定制化。
12.10 没有日志
失去纠纷处理与品质改进的依据。
第13章 · 检查清单 — Voice AI 上线前的 12 项
- p50/p95 延迟目标与测量
- VAD/STT/LLM/TTS 各阶段的故障回退
- 打断处理的 UX 测试
- 定义情感与语气配置文件
- 插入 AI 应对的告知话术
- 录音・保存・销毁策略符合法律
- 深度伪造・欺骗的防御层
- 转人工的触发条件与上下文传递
- 测量用户满意度(NPS/解决率)
- 敏感交易与数据建议走语音以外的通道
- 验证韩语 STT/TTS 品质(厂商对比)
- 无障碍(听障・长者)的替代路径
第14章 · 下期预告 — Season 4 Ep 10:“LLM 安全”
无论语音还是文本,2025 年 LLM 产品最大的威胁都是安全事故。
- Prompt injection 的 12 种变体
- Jailbreak・角色扮演绕过
- Data exfiltration 向量
- Model extraction・参数泄露
- 拒绝服务(DoS)、计费攻击
- Red team 的搭建与自动化(PyRIT、Garak)
- 护栏提示词 vs 分类器模型
- 隐私・PII 泄露
- 供应链(模型・MCP 服务器)威胁
- 标准与监管(EU AI Act、韩国个人信息保护)
- 事故响应手册
“安全不是功能,而是默认值。” 然而 2024–2025 年,很多 LLM 产品连基本盘都还没搭好。
下篇文章再见。
小结:Voice AI 是实时性・自然度・安全性这三拍。选传统流水线还是语音 LLM,取决于你对延迟・控制力・合规的要求,而 p95 延迟决定了用户体验的 90%。情感・语速・语气要用品牌策略来管理,深度伪造与欺骗则必须靠多层防御。韩语产品会把 Clova・Kakao・Supertone 这类本地资产与全球语音 LLM 组合起来,把品质边界推到最大。“没有屏幕的 AI”时代,如今的极限只剩下做产品的人的想象力。