-
aaideit_admin 管理员
最低延迟推理API基准:针对语音和实时智能体的TTFT优先测试
首次 token 时间(TTFT)是团队用于选择语音推理 API 的指标。但它也是误导他们的指标。TTFT 标记生成的开始;语音合成模型在完整从句到达之前无法说话。在这两点之间,存在着对话式智能体与被中断智能体之间的差异。
为什么 TTFT 不够
TTFT 衡量的是从发送推理请求到收到第一个 token 的时间间隔。IBM 的定义将其框定为系统从空闲过渡到可见活跃的时刻。对于聊天,TTFT 接近整个故事。对于语音,它只是求和中的一个项。
原因是机械性的。语音合成模型无法合成半个词。它需要一个完整的从句或句子才能产生音频。LiveKit 将此指标称为首次句子时间(TTFS)。
两个旋钮而非一个
这给了你两个旋钮而非一个。TTFT 控制生成的开始。每秒 token 数控制第一句完成的快慢。赢得一个但失去另一个的提供商不会赢得语音智能体的比赛。
LiveKit 的语音智能体概述将一轮分为:STT 约 100-200ms、LLM 300-500ms(流式)、TTS 100-200ms,以及 WebRTC 上 50-150ms 的网络延迟。它指出实际的端到端延迟约为 700-1000ms。
性能目标
Kwindla Hultman Kramer(Pipecat 的联合创始人)建议目标为 800ms 中位语音到语音延迟,宽松的可接受值为 1500ms(概念验证)。他的粗略算术将该值分为:STT 100ms、LLM 300ms、TTS 200ms、网络 100ms。
Daily 的早期最快语音机器人工作提供了人类基线。对话中的典型人类响应时间约为 500ms。超过 800ms 的停顿开始显得不自然。
基准测试结果
测试涵盖了多个主流推理提供商,包括 OpenAI、Anthropic、Google 和多家专门针对低延迟优化的服务。结果按 TTFT 和 tokens/second 两个维度排序,为语音智能体应用提供了明确的选型参考。
关键发现:
- 最优 TTFT 可低至 150ms
- 最优吞吐量可达 200+ tokens/second
- 不同提供商在不同维度上有各自优势
选择合适的 API 需要权衡延迟和成本,具体取决于应用场景对实时性的要求。
本文源自「MarkTechPost」