金吾財訊 | 據外媒報道,Meta Platforms(META)正式發布Muse Voice Transcribe,這是公司首款實時音頻感知模型,開發者可通過Meta Model API調用該服務。
定價方面,服務費用為每1000分鐘音頻3美元,摺合每小時0.18美元。該模型將流式語音識別、說話人分離、端點檢測整合在一套流程內,可邊說話邊輸出轉寫文本,無需等待音頻完整錄製完成。業務能力上,該模型能夠區分同一段錄音裏20名以上不同發言者,自動識別語句停頓邊界;訓練覆蓋70餘種語言,發布時完成25種語言驗證,支持時長超1小時音頻,也適配句內、句間的多語言切換。開發者還可以通過語言、關鍵詞、上下文偏置,提升特定術語、業務場景下識別精度。技術層面,Meta採用自適應延遲機制,動態權衡識別時延與準確率,針對每一個詞彙判斷需要接收多少音頻再輸出結果,兼顧實時響應效果與識別質量。