【阿里AI大模型開源】自評分數追近美國頂尖模型 多項基準互有領先 業界指數據未經獨立驗證

最新財經消息

廣告

當中美兩大陣營的人工智能模型競爭愈演愈烈,一方剛剛公開武器庫、另一方仍然守口如瓶——阿里巴巴這次選擇「開源」搶佔話語權,但自報的成績單,又是否經得起市場考驗?

阿里巴巴周一(8月3日)正式開放旗下最新大型語言模型Qwen3.8-Max的權重,供業界公開下載使用,一改今年7月中在上海世界人工智能大會(WAIC)上僅公佈預覽版、未提供具體評分的做法。據報道,新模型參數規模達2.4萬億,屬混合專家(MoE)架構,具備多模態處理能力,可同時理解圖像、影片、文件及文字內容。阿里巴巴形容,今次是誠邀外界獨立驗證,而非單靠廠方自身說法。

【自評數據】多項基準測試佔優 但軟件工程仍見差距

據阿里巴巴公佈的自家測試結果,Qwen3.8-Max在部分基準測試中的得分,與美國人工智能公司Anthropic旗艦模型「Fable 5」相當,個別項目甚至更高——例如在一項針對終端操作能力的測試中,Qwen3.8-Max得分86.6,高於對手的84.6;在一項學術論文複製測試中,Qwen3.8-Max得分93.0,亦高於對手的88.8。不過,在核心軟件工程能力的測試中,情況則逆轉——Qwen3.8-Max得分67.7,明顯落後於對手的80.0;在另一項前沿軟件工程測試中,差距更擴大至73.5對88.8。阿里巴巴又指,模型曾連續運作約125小時、即約5日時間,全程無人監督下重現並改良一篇數學研究論文的實驗過程;在一場有526支人類隊伍參與、限時24小時的線上比賽中,模型排名躋身首68名。

【業界質疑】兩大陣營數據均未經第三方核實

值得留意的是,今次公佈的評分數據,暫時只有廠方單方面說法,尚未有獨立機構覆核。有科技媒體直接指出,Anthropic此前對外形容Fable 5具備長時間自主運作能力時,同樣未有第三方研究人員驗證相關數字,形容「兩間公司公佈的數字都未經獨立研究人員核實,而且都傾向對自身產品有利」。此外,阿里巴巴上一代Qwen3.7-Max模型,於今年5月推出時曾公佈第三方評測機構「Artificial Analysis」智能指數得分為56.6分;而首個針對Qwen3.8的獨立第三方測試結果顯示,其得分為80分,較月之暗面(Moonshot AI)旗下Kimi K3模型的83分為低,反映廠方自評與獨立測試之間,仍存在一定落差。

測試項目 Qwen3.8-Max 對 美企旗艦模型 洞察
終端操作測試 86.6 對 84.6 Qwen3.8-Max 領先
學術論文複製測試 93.0 對 88.8 Qwen3.8-Max 領先
核心軟件工程測試 67.7 對 80.0 美企模型明顯領先
前沿軟件工程測試 73.5 對 88.8 美企模型大幅領先
獨立第三方初步測試 80分(Kimi K3為83分) 自評與獨立測試有落差

中美人工智能競賽正踏入「開源換公信力」的新階段——阿里巴巴選擇公開權重,希望以透明度換取市場信任;惟成績單最終能否服眾,仍要等獨立機構逐一覆核之後,才有定論。

免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。

撰文:經一編輯部