9月8日,有分析指谷歌Gemini 3.8 Flash與Meta Muse Spark 1.3存在針對榜單刷分的過拟合。Meta AI業務主管Alexandr Wang反駁稱不同難度基準分數本就不同,並援引GPT-5.6 Sol在兩版TerminalBench的分數差異為例。
觀點網訊:9月8日,谷歌、Meta最新的Gemini 3.8 Flash與Muse Spark 1.3在第三方榜單上一度反超Anthropic及OpenAI旗艦模型,有分析認為兩家新模型存在針對榜單評測刷分的過拟合情況。
對于跑分作弊指控,谷歌方面暫無回應。Meta AI業務主管Alexandr Wang反駁稱該論點站不住腳,不同難度基準分數本就不同。
Wang以OpenAI的GPT-5.6 Sol在TerminalBench 2.1拿到88.8%、在TerminalBench 4.0為37.3%為例,稱舊基準已飽和、新基準未飽和。
Wang表示,未來大模型會更直接地與兩家旗艦競争。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:劉滿桃
