階躍發布StepAudio 3系列語音大模型,多款模型登頂全球第一

鳳凰網科技
3小時前

鳳凰網科技訊 9月15日,階躍星辰今日正式發布StepAudio 3系列語音大模型,包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis排行榜中位列全球第一

StepAudio 3 Realtime支持原生全雙工實時對話,在Artificial Analysis Conversational Dynamics排行榜中以98.9%綜合得分排名全球第一,在Speech Reasoning排行榜中以99.7%的語音推理準確率同樣位列全球第一。模型可同時理解語義、語氣、情緒、副語言和環境聲音,支持推理與語音生成並行,Tool Call和長任務可異步執行,不阻塞當前語音會話。

StepAudio 3 ASR將高精度語音識別與大語言模型的上下文理解能力結合,支持中文、英文、方言、中英混說、長音頻及專業領域識別,能夠處理低聲、快語速、含糊連讀、歌聲和背景音樂等複雜輸入,在醫療、法律、金融、汽車、編程等領域提升專業表達識別效果。該模型在Artificial Analysis非流式語音識別準確性排行榜中WER僅為1.7%,並列全球第一。

StepAudio 3 TTS面向實時交互場景,在音色基底、語調層次、節奏律動和氣口停頓等方面貼合人類自然口語模式,可還原笑聲、遲疑、結巴、重複、改口等副語言表現,並基於流式生成架構實現生成與播放同步。

StepAudio 3 Gen支持基於自然語言描述和參考音頻,統一生成人聲、音效、環境音和背景音樂,可對多個角色的音色、語氣、情緒、方言口音及笑聲、喘息等副語言特徵進行精細控制,並支持對白、音效、環境聲和背景音樂的時間與順序編排。

StepAudio 3 Music支持從零生成及基於ABC記譜法控制的多輪交互創作,覆蓋歌曲創作、清唱配樂、歌曲翻唱等功能,用戶可通過自然語言控制曲風、人聲、旋律、節奏、樂器、情緒及段落結構。模型還對主歌、副歌、橋段等歌曲結構及跨段落旋律發展進行建模,在清唱配樂場景中可理解旋律、節奏和情緒,並補充和聲、樂器及完整編曲。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10