2.8 兆個參數,是 Moonshot AI(月之暗面)這家中國 AI 公司在 2026 年 7 月發布 Kimi K3 時報出的總參數量,直接刷新開放權重模型的規模紀錄,成為目前公開釋出過最大的一個。這個數字大到跟「開源模型比較小、比較弱」的舊印象完全相反,也讓 Kimi K3 一發布就被大量討論。
只是規模數字本身說明不了太多事,真正該問的是:Kimi K3 是什麼樣的模型、憑什麼撐起這個規模紀錄、又能不能被一般使用者實際用到。先從它的基本身分講起,再一層一層拆進架構設計與實測成績。
Kimi K3 是什麼?一分鐘先認識它
Kimi K3 是 Moonshot AI(月之暗面)在 2026 年 7 月 16 日發布的旗艦模型,定位是一個開放權重(open weight)、內建推理能力、又能理解圖片的多模態(multimodal)大型語言模型。三個標籤先記住:它是目前公開釋出過的最大開放權重模型、總參數量 2.8 兆、脈絡窗口(context window)一次可以讀進 100 萬個 token。放進 Kimi 家族來看,K3 的規模大約是前一代 K2.6(總參數 1 兆)的 2.8 倍,等於一次跳了一個量級。

長久以來,開放權重模型多半被視為規模較小、能力也跟著打折的替代選項,真正頂尖的模型幾乎都關在封閉系統裡。Kimi K3 打破了這個慣性,它不是一個縮小版的模型,而是把「巨大」與「開放」這兩件過去很少同時發生的事,放進同一個模型裡。它怎麼把 2.8 兆參數用得動,得先看看藏在底層的設計。
2.8 兆參數,但它一次只用其中一小塊
2.8 兆參數是 Kimi K3 的總員工數,但它不會每次都全員出動。K3 採用混合專家(Mixture of Experts,MoE)架構,整個模型裡藏著 896 個「專家」子網路,每次處理一個 token,系統只會挑出其中 16 個來接手,大約只動用整體的 1.8%。換句話說,你可以把它想成一間有 896 位專家的大公司,每題只叫 16 位真正相關的專家開會,不需要驚動全公司。這正是它能兼顧龐大規模與運算效率的關鍵,也是為什麼一個 2.8 兆參數的模型能被實際拿來對話使用,而不是貴到沒人跑得起。

規模之外,K3 另外兩個對使用者有感的特性是脈絡窗口與推理模式。它的脈絡窗口一次能讀進 100 萬個 token,等於能把一整份長文件、一大段程式碼庫,甚至好幾份資料一次塞進去讓它參考,不必自己切段餵。K3 也內建「一律開啟思考模式」的設計,回答前一定會先進行一段使用者看不到的內部推理,不需要額外下「請一步一步想」這種提示詞,Moonshot 的文件說法是模型本身就會先想過一輪再回答。至於這套規模為什麼跑得動、還能維持效率,底層還有另外兩個關鍵設計在撐著。
它怎麼辦到的?兩個藏在底層的新設計
Moonshot 點名了兩個藏在 K3 底層的架構創新:Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)。這兩個名字聽起來很技術,但要理解它們在解決的問題,其實不需要懂底層數學。
先講注意力機制(attention)在長脈絡下會遇到的麻煩,模型讀的內容越長,傳統注意力機制要做的比對計算量會跟著暴增,速度變慢、成本也墊高。KDA 是一種混合式的線性注意力設計,在部分層用效率更高的方式取代傳統的二次方注意力運算,讓模型處理百萬 token 這種超長脈絡時,不必犧牲掉關鍵層原本的表達能力。AttnRes 則是另一種殘差連接方式,讓模型的每一層都能有選擇性地回頭參考更早期層的表示,不是只能往前傳遞一層,這在 K3 這種由大量專家組成的架構裡格外有幫助。
這兩項設計實際帶來的效果,可以從 Artificial Analysis 針對 K3 的一份評測數字看出來。在同一套九項評測作業裡,K3 完成全部題目所花的輸出 token 量,比前一代 K2.6 少了 21%,同時智能指數還提升了 13 分,等於用更少的字數做出更好的結果。至於這兩個設計背後具體的數學運算怎麼寫,不影響實際使用這個模型,這裡就不展開。這些底層設計最終能不能反映在實際成績上,直接看數字最準。

它實際有多強?各項實測成績一次看
把 Kimi K3 公布的實測成績拆成四個面向來看最清楚,重點在於搞懂它自己落在什麼水準,不是拿來跟誰一較高下。
綜合智力:Artificial Analysis 的 Intelligence Index v4.1(一套綜合九項測驗、涵蓋推理、知識、數學與程式能力的複合指數)給 Kimi K3 打出 57 分,落在前段班,但還沒站上最頂端那一階。這個分數其實說明一件事:規模大不等於全能,K3 整體實力很強,卻不是各項評測裡分數最高的那一個。
知識與推理:根據 Moonshot 公布的測試成績,K3 在 GPQA Diamond(研究所等級的科學知識測驗)上拿下 93.5%,是目前公開的開放權重模型裡最高的成績之一。不過在專門設計來考倒現有模型的 Humanity’s Last Exam 上,K3 在可以使用工具輔助的情況下拿到 56%,若完全不靠工具、純模型作答則只有 43.5%。這個落差很誠實地說明,再強的模型碰上真正的難題,還是看得到明顯的天花板。
寫程式:程式與 agent 任務是 K3 目前表現最突出的一塊。在 Arena.ai 旗下針對前端程式碼、由人類評審評分的 Frontend Code Arena 排行榜上,K3 以 1,679 分排名第一;在模擬真實軟體工程任務的 SWE-bench Verified 上拿下 76.8%;在考驗終端機操作與自動化任務的 Terminal-Bench 2.1 上則拿到 88.3 分。三項成績收斂成同一個訊號:遇到寫程式、跑終端機指令這類 agent 任務,是 K3 目前最擅長的領域。
多模態:同一份成績單也顯示,K3 在考驗圖片理解能力的 MMMU-Pro 上拿到 81.6 分,證明它不只是文字模型,確實看得懂圖片內容。

除了成績本身,K3 也讓使用者可以自己拿捏要花多少運算力去思考。Moonshot 的文件把推理強度分成三個檔位,介面上簡化呈現為標準與高兩種模式,簡單任務用標準模式省時間,遇到真正難的題目再切到高強度模式讓它多想一點。整體看下來,Kimi K3 是一個程式與 agent 任務特別強、綜合實力逼近前段班,但在最難的題目上仍能看到極限的模型,合不合用,還是得看實際拿它做什麼樣的工作。
為什麼大家在意它「開源」這件事
Kimi K3 引發討論,不只是因為參數量夠大,更因為 Moonshot 選擇把這個等級的模型權重整個開放出來。過去能打進頂尖水準的模型,幾乎都被關在各家公司自己的伺服器裡,外部人只能透過付費的 API 呼叫,看不到、也拿不走裡面的權重檔案。像 K3 這種規模、又衝上多項評測前段班的模型願意公開權重,在同等級的模型裡相當罕見。
依目前公開的資訊,加上 Moonshot 過去 Kimi K2 系列一貫採用的授權慣例,K3 預計沿用「改良版 MIT」授權,完整權重檔案預計在 2026 年 7 月 27 日於 Hugging Face 釋出。這種授權方式代表任何人理論上都可以下載這個模型、拿去微調、部署在自己的伺服器上,甚至包進自己的產品裡對外提供服務,不必被綁在單一平台或單一供應商身上。
不過對多數人來說,「可以自架」跟「划算自架」是兩回事。2.8 兆參數的模型,權重檔案本身就高達數百 GB,得靠伺服器等級、多張高階 GPU 組成的叢集才跑得動,一般個人電腦或小型公司完全不是它的守備範圍。這也是為什麼多數想用 K3 的人,實際上還是會走 Kimi App 或 API 這條路,而不是自己買機器架設。
想認識它,現在可以怎麼開始用
想實際摸到 Kimi K3,目前有三條路可以走。最快的是直接透過 Kimi App 或網頁版跟它對話,不需要任何設定,打開就能用,這也是多數一般使用者接觸這個模型最直接的方式。
如果想把 K3 接進自己的工具或產品裡,可以透過 API 呼叫,依 Moonshot 公布的計價方式,每處理一百萬個輸入 token 收費 3 美元、輸出 token 則是 15 美元。API 目前提供兩個版本:K3 Max 針對一般對話與單一 agent 任務,是多數人會用到的預設版本;K3 Swarm Max 則是為大規模平行處理設計,讓多個 agent 同時協作執行任務,兩者是依用途區分,不是效能高下的差別。
至於想自己架設模型的人,得先等預計在 2026 年 7 月 27 日完整釋出的權重,而且如同前面提到的,2.8 兆參數的硬體門檻不低,動手前值得先評估自己有沒有相應的設備。整體來說,不必自己養一組超級電腦,一般人也摸得到這個模型,只是摸到的深淺,取決於走哪一條路。

回到開頭那個 2.8 兆的數字,它真正值得記住的地方,其實不只是「更大」而已。Kimi K3 把過去幾乎只留給封閉系統的頂尖等級表現,推進到一般人也摸得到的開放權重範圍,這件事本身的意義,並不亞於它的跑分表現有多高。對於想認識、想跟上這波 AI 發展的人來說,Kimi K3 會是這半年最值得記住的名字之一。
