中金8月31日發布《Token啟示錄(五):推理産業鏈深度-測算篇》。據IDC,2025年中國公有雲MaaS市場按調用量火山引擎占據接近一半份額;測算顯示模型D每卡吐出量均值提升約3~5倍,逐層優化後混合成本降至約0.039美元/百萬Token。
觀點網訊:8月31日,中金發布研究報告《Token啟示錄(五):推理産業鏈深度-測算篇》。該報告為推理産業鏈深度報告下篇,在中金研究測算視角下定量分析了推理優化對效率與成本的影響,並梳理産業鏈參與者格局。
格局方面,根據IDC,2025年中國公有雲MaaS市場按調用量計算,火山引擎占據了接近一半的份額,其次是阿里雲、百度智能雲、矽基流動以及移動雲。
測算結果顯示,以樣本量最大的模型D為例,其在B200上的每卡吐出量區間為152 token/s到14,949 token/s,對應的每百萬Token成本區間為0.04~3.3美元。
模型A在GB200上同樣呈現339~12,116 token/s的寬幅分布,不同模型與芯片組合間的性能差異明顯。
效率方面,中金測算模型D的每卡吐出量均值由H100的850 token/s、H200的1,233 token/s,提升至B200的3,916 token/s與GB200的4,586 token/s,提升幅度約3~5倍。
成本方面,中金測算顯示,在經過逐層優化後,混合實際成本可達約0.039美元/百萬Token,較基準情況下約44.46美元/百萬Token的推理成本大幅下降。基準情況設定為稠密架構400B、MHA、FP8、Prefill全注意力、推理引擎工程達成率10%、集群利用效率30%。
中金認為,硬件廠商外,推理産業鏈主要參與者包括模型廠商、超大規模雲廠商、新雲、推理優化平台、異構算力管理平台、多模型API聚合平台等,各環節毛利率主要取決于推理優化能力、硬件利用率、硬件采購成本和産品定價權。
單項優化較難形成持續的成本優勢,覆蓋模型、算法、引擎與硬件的Co-design能力更有可能形成持續的單位Token成本優勢;第三方廠商服務敏捷、專注推理引擎提升有效吞吐,長期則需要向硬件或者向模型靠攏。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:歐詩雅
