權威智庫測試:Kimi K3性能顯著低於美模型 | 大紀元
大紀元
權威智庫測試:Kimi K3性能顯著低於美模型
權威智庫測試:Kimi K3性能顯著低於美模型
2026年7月18日,在上海舉行的世界人工智能大會(WAIC)上,月之暗面(Moonshot AI)攤位上展示了Kimi的標誌和Kimi K3模型。(Hector Retamal/AFP via Getty Images)
2026-07-2502:17 中港台時間|07-2507:19 更新
人氣 921

【大紀元2026年07月24日訊】(大紀元記者林燕報導)週三(7月23日),歐美權威智庫在進行初步測試後發現,中國初創公司月之暗面(Moonshot AI)的最新模型Kimi K3,性能顯著低於美國領先的前沿AI模型。

月之暗面於7月16日發布Kimi K3,並計劃於同月27日發布開源版本。在美中人工智能競爭激烈的背景下,該模型因在一些行業基準測試中的表現優於多家美國AI公司,已引發全球關注。

英國人工智能安全研究所(UK AISI)和美國人工智能標準與創新中心(CAISI)對Kimi K3進行聯合評估後指出,在初步網絡能力評估中,Kimi K3的網絡能力顯著低於美國最新前沿模型,尤其是在穩定性和成功率上遠低於後者。

評估重點考察兩部分,一個是通過ExploitBench測試其對41個V8漏洞進行崩潰復現、任意讀寫、控制流劫持和代碼執行的能力;另一個是通過模擬企業網絡測試其自主完成多步驟攻擊鏈的水平,並觀察安全護欄是否會阻止攻擊行為。

結果顯示,Kimi K3明顯強於GLM-5.2等中國模型,甚至能偶爾完成完整攻擊鏈,但在穩定實現任意代碼執行、攻擊成功率和綜合能力上仍落後於美國最先進的閉源模型。GLM-5.2是智譜AI(Zhipu AI)發布的旗艦級大型語言模型。

在開發漏洞利用程序上,Kimi K3的性能顯著低於美國最新的前沿網絡模型。美國頂尖模型在約一半樣本中能夠構建完整漏洞利用鏈,而Kimi K3和GLM-5.2雖然能發現和復現不少漏洞,卻沒有完成從漏洞到任意代碼執行的完整閉環。

具體而言,Kimi K3平均僅完成了32個步驟攻擊路徑中的第17個步驟,而美國最強大的網絡模型平均完成了28.5個步驟。GLM-5.2平均只能達到第11步。

此外,美國頂尖模型的綜合成績也顯著領先,分別比Kimi K3高約44個百分點,比GLM-5.2高約51.8個百分點。

在攻擊成功率上,在10次嘗試中,Kimi K3有一次在1億代幣的限制下成功完成了「The Last Ones」(TLO)網絡攻擊範圍的測試。

這表明,在獲得初始網絡訪問權限並被賦予指令後,Kimi K3已能夠自主攻擊小型、防禦薄弱且易受攻擊的企業系統。

但能夠解決TLO問題已不是少數模型的專屬能力。智庫指出,在之前的測試中,已有四個公開發布的閉權重模型(Closed-Weight Model,也常被稱為閉源模型)解決了TLO問題,性能最佳者在10次嘗試中成功率能達到6至7次。Kimi K3在標準的1億代幣限制下,僅在10次嘗試中成功了一次。

美國商務部長盧特尼克(Howard Lutnick)週三在社交媒體X上發帖說,「CAISI的最新報告顯示,Kimi K3仍然落後於美國領先的前沿人工智能模型。」

「美國之所以能夠在前沿人工智能領域保持領先地位,是因為我們擁有世界上最偉大的創新者和技術專家。」他寫道。

美國中央情報局(CIA)局長拉特克利夫(John Ratcliffe)7月中旬出席賓夕法尼亞州國防與創新峰會時也表示,美國在體制上比中共治下的中國更有優勢,因為在中共體制下,個人只能聽命於黨國。

「他們竊取、複製,還有用國家補貼。這就是他們的『成功』模式。」他說。

中情局局長表示,美國不能失去在高端技術上對北京的領先優勢,而保持這種優勢的唯一方法就是不要陷入政治正確的窠臼。

責任編輯:林姸#

如果您有新聞線索或資料給大紀元,請進入安全投稿爆料平台
留言
  • 大紀元保留刪除惡意留言的權利,包括低俗、誤導或攻擊信仰等內容
本網站圖文內容歸大紀元所有, 任何單位及個人未經許可,不得擅自轉載使用。
Copyright© 2000 - 2026 The Epoch TimesAssociation Inc.All Rights Reserved.