2026 年 7 月 19 日,阿里巴巴旗下通義千問(Qwen)團隊發布新一代旗艦大模型 Qwen3.8-Max 的預覽版(Qwen3.8-Max-Preview),並在 7 月中正式開放試用。這一版最受矚目的,是把總參數規模一口氣推到 2.4 兆(2.4T),成為阿里雲第一個突破兆級參數的原生多模態旗艦模型;官方團隊還對外宣稱,它的整體能力「僅次於 Fable 5」。
只是這句宣稱目前還沒有標準化的第三方評測可以佐證——阿里這次是預覽版先上線,官方的 benchmark 表與模型卡(model card)都還沒放出來。不過發布後短短幾天,中國這邊已經有不少媒體與開發者做了第一手實測,讓這一版的實際手感有了初步輪廓。這篇就把它發布了什麼、規格如何、實測表現怎樣、又該怎麼試用,一次講清楚。
Qwen3.8-Max-Preview 的規格:2.4 兆參數、原生多模態、1M 脈絡
Qwen3.8-Max-Preview 是通義千問最新一代基座模型的預覽版本,採用稀疏混合專家(MoE)架構,總參數量 2.4 兆。它是阿里雲第一款突破兆級參數的原生多模態旗艦模型,能一併處理文字、圖像、影片與文件,PDF、HTML、Markdown 這類常見格式可以直接讀進來解析,不必先轉檔。
規格上有幾個重點。上下文長度支援到 1M(百萬)token,適合一次讀進大量文件或整個專案的程式碼;它也內建了深度思考模式,能針對比較複雜的任務加大推理強度。所謂「原生多模態」,指的是圖像、影片這些理解能力是模型本體就具備的,不是外掛一個處理圖片的模組上去,跨模態的任務理論上會更連貫。
跟前一代 Qwen3.7-Max 相比,官方強調這一版在大型程式碼庫處理、跨檔案修改、複雜數據分析上有提升,並新增了多模態的圖像理解能力。
要提醒的是,這一版沒公開的資訊也不少:激活參數量(MoE 每次實際動用多少參數)、知識截止時間、訓練資料組成、詳細架構,以及標準化的 benchmark 分數,官方目前都還沒揭露;加上它是預覽版,能力在預覽期間可能還會持續調整。

長任務自主與程式開發,是這次主打的兩大能力
除了參數變大,Qwen3.8-Max-Preview 這次主打的是「長周期自主作業」。官方列出的能力包括超長時間無人值守執行、單一任務可連續呼叫工具上千次,以及多個智能體(Agent)之間協同分工。換句話說,它想接的不只是一問一答,而是需要一路做很多步、跨很久的複雜任務——這也是這一兩年大模型從「會聊天」往「會辦事」推進的共同方向。
程式開發是這次特別被點名的場景,涵蓋全棧工程開發、程式碼重構、漏洞批量修復與專案迭代優化。搭配 1M 的長上下文,它可以把一個較大的專案整包讀進來再動手,而不是只看得到零散片段。
中國媒體實測:程式強,創意視覺偏弱
發布後這幾天,中國多家科技媒體與開發者都放出了第一手實測。把這些整理下來,強項與短板相當一致。
寫程式與工程任務是公認的強項。有評測讓它寫一個 LRU 快取(要求 Python、O(1) 時間複雜度、附五個測試案例),它用雜湊表加雙向鏈結串列的組合,程式碼複製到本地就能跑,五個測試全過;也有人請它做一個 React 加 TypeScript 前端、搭 Flask 後端的待辦事項全棧專案,它一口氣生出十幾個檔案,npm install 後能正常運作,介面還帶了懸停動畫。更進一步的 Agent 任務裡,讓它分析一個真實的 GitHub 專案、找出三個 bug 並提修法,它能正確認出主程式與核心模組,點出的資源洩漏、缺少例外處理等問題都是真的,改完程式也跑得起來。整體來看,它在「把一段複雜需求拆解成一個能跑的完整專案」這件事上相當穩,首輪交付的完整度往往高於只丟零散的片段程式碼。
中文寫作的表現也超出不少人預期。有評測請它寫一篇 1500 字、談 2026 上半年中國大模型密集發布潮的分析文,結果段落結構合理、論證有層次、引用的數據多半屬實,而且沒有「值得注意」「綜上所述」那種 AI 套話味,深度被打到 4 分(滿分 5 分)。

短板則集中在創意視覺與 3D 互動。同一批實測裡,一旦題目換成 3D 或創意互動,表現就明顯掉下來:有人讓它做 React 加 Three.js 的捲動式 3D 浮島,靜態場景還行,但四段捲動章節鏡頭沒變化、物件懸停不發光、點擊也沒反應,該有的光暈與粒子效果都沒做出來,同一題跟 GPT-5.6、Kimi K3 擺在一起比明顯落後——在那份涵蓋六個模型的測試裡,它的 3D 視覺與創意編程被評為墊底。換句話說,它在有標準答案的程式題上很穩,一碰到吃美感與互動細節的創意任務就明顯吃力,這也跟它還是預覽版、後訓練尚未完全到位有關。
綜合這些實測,一個算中肯的定位是:它在有標準答案的程式與工程任務上已經站得很穩、實際可用,最好的案例接近能直接交付的水準;但一換到吃美感、互動細節的創意任務就明顯吃力,離「什麼任務都穩」的最可靠旗艦還有一段距離。
「僅次於 Fable 5」的說法,現在還不能當定論
回到官方那句「僅次於 Fable 5」。它是通義千問團隊自己在發布時提出的定位,來自官方內部評測;到 7 月下旬為止,LMArena、Artificial Analysis 這類標準化的第三方評測都還沒放出分數,阿里也還沒公開 benchmark 表與授權條款,所以這句排名式的說法目前仍缺客觀佐證,比較適合先當成廠商自評。
不過「還沒有標準化 benchmark」不等於「沒人測過」——上面那些中國實測,就是目前判斷它實力最接近第一手的材料,只是結論比「僅次於 Fable 5」保守一些。國外這邊則多半持保留態度,幾家英文媒體直言「沒有 benchmark 就很難算真正的評測」,建議在第三方跑出數據前,把這句話當定位宣傳、先別當定論。
發布時機也值得一提。就在幾天前,Moonshot(月之暗面)才開源了 2.8 兆參數的 Kimi K3、並附上完整基準測試;Qwen3.8-Max-Preview 緊接著沒幾天就亮相。兩款兆級參數模型一前一後登場,也讓這一波國產旗艦的較勁格外受關注。
怎麼試用?三個入口與預覽期的折扣
目前有三個入口可以接觸到這一版:阿里雲百煉的 Token Plan、程式開發平台 Qoder,以及企業辦公流程產品 QoderWork。
預覽期間阿里也祭出明顯的試用優惠:Token Plan 上大約是標準價的 1 折,等於同樣的錢、用量放大約 10 倍,Qoder 這些入口也有對應的限時折扣。要留意的是,預覽版的能力可能還在調整,現在測到的表現,不一定等於正式版最後的樣子。
正式版何時開源?後續值得盯的兩個訊號
阿里官方已經表明,正式版之後會開放權重、走開源路線,只是目前還沒公布確切日期與授權條款,也還沒上架到 Hugging Face。
先放預覽版試水溫、正式版再開源,是不少大模型近期常見的節奏;評測資料偏少,比較可能是因為模型剛發、時間還短,細節通常會過一陣子陸續補齊,不必急著解讀成什麼特別的訊號。真的想追這條線,有兩個點最值得盯:一是實際手感,尤其自己常用的那類任務跑起來順不順;二是之後釋出的標準化第三方 benchmark 與開源權重,那才是驗證「僅次於 Fable 5」這種說法的關鍵。
把這些兜起來看,Qwen3.8-Max-Preview 把參數推上 2.4 兆、主打長任務自主與原生多模態,程式與工程能力在實測裡站得住腳,是阿里在旗艦模型上的又一次卡位;但創意視覺這類還沒補上的短板,加上還沒到位的標準化評測與開源權重,也提醒大家先別把「僅次於 Fable 5」當定論。對想用的人來說,現階段比較務實的態度是:拿寫程式、工程這類它已經打得不錯的任務先試起來,其他複雜創意或高穩定性的需求,就等正式版與更多數據再說。
