7月7日,OpenAI宣布在其API调用中新增gpt-realtime-2.1和gpt-realtime-2.1-mini两款模型,旨在提升低延迟语音智能体与多模态交互的性能。官方表示,通过优化缓存机制,Realtime语音模型的p95延迟至少下降25%,即95%的请求处理时间将比之前快。
这两款新模型在调用价格上有所不同。gpt-realtime-2.1模型的文本输入费用为每100万Tokens 4美元,输出为24美元;音频输入为32美元,输出为64美元;图片输入为5美元,输出为64美元。而gpt-realtime-2.1-mini模型的费用相对较低,文本输入为每100万Tokens 0.6美元,输出为2.4美元;音频输入为10美元,输出为20美元;图片输入为0.8美元,输出为20美元。
在能力方面,gpt-realtime-2.1-mini支持实时音频与文本输入,并具备工具调用与函数调用功能。该模型能在执行动作前完成内部推理,并通过口头前置说明保持对话连续性。gpt-realtime-2.1模型则在字母数字识别、静音与噪声处理、中断处理、指令遵循和可配置推理强度方面进行了增强,推理强度支持从minimal到xhigh的五档设置,推荐生产环境语音代理从低档位开始使用。


来源:一电快讯
返回第一电动网首页 >
以上内容由AI创作,如有问题请联系admin#d1ev.com(#替换成@)沟通,AI创作内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网或AI创作,如有侵权请联系邮件删除。