訊飛上線全國産語音基座大模型Spark-Audio-1.0-Preview 支持99種語言識别

观点网

2026-09-16 17:00

  • 訊飛星火9月16日上線全國産語音基座大模型Spark-Audio-1.0-Preview,采用0.65B音頻編碼器搭配30B-A3B大語言模型,使用1300萬小時音頻數據,支持99種語言及202種方言識别,已開放體驗。

    觀點網訊:9月16日,訊飛星火全國産語音基座大模型Spark-Audio-1.0-Preview上線。該模型是基于全國産化算力訓練的語音基座大模型,目前已正式開放體驗,API後續将上線訊飛開放平台。

    據訊飛星火方面消息,Spark-Audio-1.0-Preview采用0.65B(Dense結構)的音頻編碼器,搭配30B-A3B(MoE結構)的大語言模型,使用了1300萬小時音頻以及大量文本數據,基于純國産算力集群訓練完成。

    該模型在同一個模型中可輸入文本和語音兩個模态,支持語音轉寫、多語言翻譯、多方言識别、環境音識别、說話人識别、情感分析以及復雜的音頻問答等任務。

    在語言能力方面,Spark-Audio-1.0-Preview可支持99種語言及202種方言的識别。

    與過去先把語音轉成文字、再交給大模型理解的級聯方案不同,語音基座大模型直接理解語音,可一次性聽懂人聲、環境音、音樂等,並理解聲音里的語義、情緒和場景。

    免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。

    審校:楊嘉英



    相關話題讨論



    你可能感興趣的話題

    産業科技

    科技

    AI

    訊飛星火

    語音大模型