OpenAI发布全双工语音模型,交互体验全面升级
来源:龙灵发布时间:2026-07-10338浏览
询问 AI7月8日,OpenAI正式发布了名为GPT-Live的新一代语音大模型。该模型采用了全双工架构,有效解决了以往系统依赖静音来判断对话轮次,从而容易在不恰当的时机打断用户说话的痛点。
在技术架构方面,GPT-Live实现了语音交互与逻辑推理的分离。对于常规提问,人工智能会直接给出回复;而当遇到需要信息检索、深度思考或人工智能代理任务时,系统会将其交由后台的GPT-5.5进行处理,同时保持前台对话的连贯性。未来升级推理引擎时,也无需对语音模型进行重新训练。此外,用户能够根据实际场景,在实时、中等和高等三种推理级别中自由切换,该模型还具备实时翻译功能。
在产品发布环节,OpenAI的语音团队现场演示了向ChatGPT查询美加墨世界杯赛事信息的功能。面对关于赛程和比分的连续追问,新模型不仅准确报出了具体的进球时间,甚至连挪威队在赛后进行的“维京划桨”庆祝动作等细微信息都能对答如流。
据官方介绍,GPT-Live现已作为ChatGPT语音功能的默认模型上线。其中,付费订阅用户默认调用的是GPT-Live-1版本,而免费用户则使用精简的mini版本。需要注意的是,在上线初期,该模型暂时还不支持屏幕共享功能,同时也尚未开放应用程序接口(API)。
据TechCrunch报道,ChatGPT Voice产品负责人Atty Eleti透露,目前每周有超过1.5亿用户通过语音和语音转文字功能使用ChatGPT。他认为语音有望成为未来计算设备的主要交互界面,能够更好地管理那些日益复杂且需要长时间运行的人工智能代理任务,但他同时也强调,公司并没有开发人工智能情感伴侣的计划。
据VentureBeat报道,全双工语音模型正逐步成为行业的主流配置。例如,谷歌的Gemini Live不仅支持全双工交互,还提供了GPT-Live目前所不具备的摄像头和屏幕共享能力,并计划在2026年3月推出针对开发者低延迟需求优化的Gemini 3.1 Flash Live版本。
在国内市场,字节跳动于今年4月在豆包应用中上线了Seeduplex模型,官方宣称其响应和打断的错误率相比半双工系统下降了大约50%。此外,英伟达在1月份推出的PersonaPlex,则赋予了全双工模型自定义音色和角色设定的能力。
新闻来源:龙灵,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

