訊飛星火9月16日上線全國産語音基座大模型Spark-Audio-1.0-Preview,采用0.65B音頻編碼器搭配30B-A3B大語言模型,使用1300萬小時音頻數據,支持99種語言及202種方言識别,已開放體驗。
觀點網訊:9月16日,訊飛星火全國産語音基座大模型Spark-Audio-1.0-Preview上線。該模型是基于全國産化算力訓練的語音基座大模型,目前已正式開放體驗,API後續将上線訊飛開放平台。
據訊飛星火方面消息,Spark-Audio-1.0-Preview采用0.65B(Dense結構)的音頻編碼器,搭配30B-A3B(MoE結構)的大語言模型,使用了1300萬小時音頻以及大量文本數據,基于純國産算力集群訓練完成。
該模型在同一個模型中可輸入文本和語音兩個模态,支持語音轉寫、多語言翻譯、多方言識别、環境音識别、說話人識别、情感分析以及復雜的音頻問答等任務。
在語言能力方面,Spark-Audio-1.0-Preview可支持99種語言及202種方言的識别。
與過去先把語音轉成文字、再交給大模型理解的級聯方案不同,語音基座大模型直接理解語音,可一次性聽懂人聲、環境音、音樂等,並理解聲音里的語義、情緒和場景。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:楊嘉英
