GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟
TL;DR - OpenAI 发布 GPT-Live 工程拆解,披露其耗时 6 个月重构的实时语音系统架构;新系统 p95 音频帧延迟已降至旧系统 p50 的水平,标志实时语音 Agent 从模型能力走向大规模系统工程。
- 分层调度:将系统拆为快速通道(截断/情绪随动,极小模型或硬编码)、深度通道(GPT-5.5 等主力模型做语义与长程推理)、异步任务(搜索、工具调用、数据保存移出主路径),避免单点变慢导致音频帧排队积压。
- 语言与内核层优化:媒体前端与部分推理逻辑从 Python asyncio 改写为 Go,消除 GC/线程调度带来的不可控停顿;配合 Linux SO_REUSEPORT 共享 UDP 端口做内核负载均衡、Go 协程绑定 OS 线程、预分配接包缓冲区。
- WARP 自定义协议:合并 DTLS 握手、SCTP 建立与数据通道协商,将 WebRTC 通道启动从 6 次 RTT 压到 1 次;路由提示写入 ICE ufrag,使 Relay 收到首包即可在内存建立映射,免去一次跨网络 Redis 查询。
- 状态一致性:回合检测内置于语音模型本身;打断需分别追踪模型生成、服务器发送与用户实际听到的位置;实例迁移/上下文压缩采用新实例 Prefill 追平后再切流(短时占用双份算力)。OpenAI 未公布具体毫秒数、持续推理成本、打断准确率及长会话压缩的信息损失。