OpenAI 将 GPT-Live-1 作为实时语音 API 模型开放,输入和输出语音都在同一个语音层处理,开发者可用文本指令设定语气、语速与表达风格。公告以电话接入为例,目标是让预约、客服和其他语音流程不必把识别、模型回复、语音合成拼成多段串行管线。查看 OpenAI API 公告和模型文档。
统一语音接口能减少什么
传统语音助手常把语音识别、文本模型和语音合成分开部署。每个环节都要转换数据格式和传递上下文,延迟会一层层叠加;中途还可能丢掉语气、停顿和对话状态。实时语音模型把音频输入和语音输出放在统一接口中,系统提示也可控制说话风格。它并不意味着底层不再使用其他模型或工具,官方文档指出实际会话还可能产生后端模型与工具费用。
设计一次语音流程
- 先写清楚电话任务,例如回答营业时间、识别来电目的或在用户确认后预约。
- 把可回答的问题、必须转人工的情况、个人信息处理规则和结束条件写进系统指令。
- 用安静环境、背景噪声、打断、口音、沉默和网络波动等样本测试;检查对话是否及时回合切换。
- 对预约、退款、账户变更等有后果的操作,在语音确认之外增加后端权限校验和人工升级路径。
成本不能只看语音层单价
公告给出的语音层价格为每分钟 0.05 美元,官方模型文档说明按秒计费。实际系统还可能产生后端模型、工具调用、电话线路和存储费用;通话沉默时如何计费、双向音频的计量方式和各区费率也应核对文档。做预算时,按“一个已解决的电话”计算完整链路成本,并与现有人工或语音服务比较。