Glean 拾遗
最近收录

1 条 · 按时间

08-24

拆解 GPT-Live:流式全双工语音架构,把启动从六次往返压到一次

GPT-Live 用流式全双工语音模型取代了轮次制语音架构:轮次检测器被移出音频路径,模型可以同时听和说,需要深入推理或工具调用时再异步委派给 GPT-5.5。工程层面的关键动作包括:用 Go 重写媒体前端和推理逻辑,p95 帧传送延迟追平旧系统 p50;构造跨模型实例的有状态交接机制,让上下文压缩以受控切换的方式进行,不打断媒体流;提出 WARP 协议族把 WebRTC 会话启动从六次网络往返降到一次,并用 Instant Connect 把 SDP 信令移出关键路径,客户端发一个 UDP 包即可开聊。静默测试发现真实负载下 CPU 流处理比 GPU 推理更早饱和,容量应按可维持的并发会话数而非推理吞吐衡量。适合正在构建实时语音或智能体交互系统的工程师。