OpenAI今日正式發布新一代語音模型GPT-Live-1和GPT-Live-1 mini,對ChatGPT的語音功能進行全面升級。新模型採用「全雙工」架構,能夠同時收聽和說話,用戶可以在AI回應時隨時打斷,交互方式更接近真實對話。
OpenAI研究負責人Kundan Kumar在發布會上表示,此前ChatGPT的高級語音模式採用回合制對話,模型必須等用戶說完才能回應,短暫停頓常被誤判為結束,導致不自然的打斷。GPT-Live則解決了這一問題,模型可以連續處理輸入並同時生成輸出,每秒多次決定是否說話、繼續傾聽或打斷。在對話中,模型會通過「嗯」、「對」、「明白」等簡短回應表明正在傾聽,用戶也可以要求它放慢語速或保持安靜等待指令。
新模型的另一項改進是將語音交互層與推理層分離。當問題需要網絡搜索或更復雜的推理時,GPT-Live會將任務交給後台的GPT-5.5處理,同時維持對話流暢進行。付費用戶可在「即時」、「中等」和「高」三個推理級別間選擇,根據需求權衡速度與智能。
此外,GPT-Live還支持實時翻譯,以及通過視覺卡片展示天氣、股票和體育賽事等信息。OpenAI表示,GPT-Live-1將成為Go、Plus和Pro付費用戶的默認語音模型,免費用戶則使用GPT-Live-1 mini。兩種模型從今日起向全球iOS、Android和網頁版用戶陸續推送,API訪問權限將於後續開放。超過1.5億人每周使用ChatGPT的語音和聽寫功能,這一升級有望進一步拓展語音交互的使用場景。
責任編輯:張俊 SF065