人工智慧

阿里推 Qwen3.8-Max 預覽版,搶進兆級參數模型戰局

2026 年 7 月 19 日,阿里巴巴旗下通義千問(Qwen)團隊發布新一代旗艦大模型 Qwen3.8-Max 的預覽版(Qwen3.8-Max-Preview),並在 7 月中正式開放試用。這一版最受矚目的,是把總參數規模一口氣推到 2.4 兆(2.4T),成為阿里雲第一個突破兆級參數的原生多模態旗艦模型;官方團隊還對外宣稱,它的整體能力「僅次於 Fable 5」。

只是這句宣稱目前還沒有標準化的第三方評測可以佐證——阿里這次是預覽版先上線,官方的 benchmark 表與模型卡(model card)都還沒放出來。不過發布後短短幾天,中國這邊已經有不少媒體與開發者做了第一手實測,讓這一版的實際手感有了初步輪廓。這篇就把它發布了什麼、規格如何、實測表現怎樣、又該怎麼試用,一次講清楚。

Qwen3.8-Max-Preview 的規格:2.4 兆參數、原生多模態、1M 脈絡

Qwen3.8-Max-Preview 是通義千問最新一代基座模型的預覽版本,採用稀疏混合專家(MoE)架構,總參數量 2.4 兆。它是阿里雲第一款突破兆級參數的原生多模態旗艦模型,能一併處理文字、圖像、影片與文件,PDF、HTML、Markdown 這類常見格式可以直接讀進來解析,不必先轉檔。

規格上有幾個重點。上下文長度支援到 1M(百萬)token,適合一次讀進大量文件或整個專案的程式碼;它也內建了深度思考模式,能針對比較複雜的任務加大推理強度。所謂「原生多模態」,指的是圖像、影片這些理解能力是模型本體就具備的,不是外掛一個處理圖片的模組上去,跨模態的任務理論上會更連貫。

跟前一代 Qwen3.7-Max 相比,官方強調這一版在大型程式碼庫處理、跨檔案修改、複雜數據分析上有提升,並新增了多模態的圖像理解能力。

要提醒的是,這一版沒公開的資訊也不少:激活參數量(MoE 每次實際動用多少參數)、知識截止時間、訓練資料組成、詳細架構,以及標準化的 benchmark 分數,官方目前都還沒揭露;加上它是預覽版,能力在預覽期間可能還會持續調整。

這款預覽版旗艦的四項核心規格:2.4 兆參數的 MoE 稀疏架構、原生多模態、1M 上下文與深度思考,官方「僅次於 Fable 5」屬自評、尚無第三方 benchmark 佐證
預覽版官方揭露的四項規格一次看:2.4 兆參數、原生多模態、1M 上下文與深度思考;「僅次於 Fable 5」目前仍是官方自評、還沒有第三方 benchmark。

長任務自主與程式開發,是這次主打的兩大能力

除了參數變大,Qwen3.8-Max-Preview 這次主打的是「長周期自主作業」。官方列出的能力包括超長時間無人值守執行、單一任務可連續呼叫工具上千次,以及多個智能體(Agent)之間協同分工。換句話說,它想接的不只是一問一答,而是需要一路做很多步、跨很久的複雜任務——這也是這一兩年大模型從「會聊天」往「會辦事」推進的共同方向。

程式開發是這次特別被點名的場景,涵蓋全棧工程開發、程式碼重構、漏洞批量修復與專案迭代優化。搭配 1M 的長上下文,它可以把一個較大的專案整包讀進來再動手,而不是只看得到零散片段。

中國媒體實測:程式強,創意視覺偏弱

發布後這幾天,中國多家科技媒體與開發者都放出了第一手實測。把這些整理下來,強項與短板相當一致。

寫程式與工程任務是公認的強項。有評測讓它寫一個 LRU 快取(要求 Python、O(1) 時間複雜度、附五個測試案例),它用雜湊表加雙向鏈結串列的組合,程式碼複製到本地就能跑,五個測試全過;也有人請它做一個 React 加 TypeScript 前端、搭 Flask 後端的待辦事項全棧專案,它一口氣生出十幾個檔案,npm install 後能正常運作,介面還帶了懸停動畫。更進一步的 Agent 任務裡,讓它分析一個真實的 GitHub 專案、找出三個 bug 並提修法,它能正確認出主程式與核心模組,點出的資源洩漏、缺少例外處理等問題都是真的,改完程式也跑得起來。整體來看,它在「把一段複雜需求拆解成一個能跑的完整專案」這件事上相當穩,首輪交付的完整度往往高於只丟零散的片段程式碼。

中文寫作的表現也超出不少人預期。有評測請它寫一篇 1500 字、談 2026 上半年中國大模型密集發布潮的分析文,結果段落結構合理、論證有層次、引用的數據多半屬實,而且沒有「值得注意」「綜上所述」那種 AI 套話味,深度被打到 4 分(滿分 5 分)。

中國媒體實測整理的強弱項對照:寫程式、工程結構化、中文寫作是公認強項,3D 互動與創意視覺則明顯偏弱
實測共識:它在有標準答案的程式與工程任務上站得穩,一碰到吃美感的 3D 互動與創意視覺就明顯吃力。

短板則集中在創意視覺與 3D 互動。同一批實測裡,一旦題目換成 3D 或創意互動,表現就明顯掉下來:有人讓它做 React 加 Three.js 的捲動式 3D 浮島,靜態場景還行,但四段捲動章節鏡頭沒變化、物件懸停不發光、點擊也沒反應,該有的光暈與粒子效果都沒做出來,同一題跟 GPT-5.6、Kimi K3 擺在一起比明顯落後——在那份涵蓋六個模型的測試裡,它的 3D 視覺與創意編程被評為墊底。換句話說,它在有標準答案的程式題上很穩,一碰到吃美感與互動細節的創意任務就明顯吃力,這也跟它還是預覽版、後訓練尚未完全到位有關。

綜合這些實測,一個算中肯的定位是:它在有標準答案的程式與工程任務上已經站得很穩、實際可用,最好的案例接近能直接交付的水準;但一換到吃美感、互動細節的創意任務就明顯吃力,離「什麼任務都穩」的最可靠旗艦還有一段距離。

「僅次於 Fable 5」的說法,現在還不能當定論

回到官方那句「僅次於 Fable 5」。它是通義千問團隊自己在發布時提出的定位,來自官方內部評測;到 7 月下旬為止,LMArena、Artificial Analysis 這類標準化的第三方評測都還沒放出分數,阿里也還沒公開 benchmark 表與授權條款,所以這句排名式的說法目前仍缺客觀佐證,比較適合先當成廠商自評。

不過「還沒有標準化 benchmark」不等於「沒人測過」——上面那些中國實測,就是目前判斷它實力最接近第一手的材料,只是結論比「僅次於 Fable 5」保守一些。國外這邊則多半持保留態度,幾家英文媒體直言「沒有 benchmark 就很難算真正的評測」,建議在第三方跑出數據前,把這句話當定位宣傳、先別當定論。

發布時機也值得一提。就在幾天前,Moonshot(月之暗面)才開源了 2.8 兆參數的 Kimi K3、並附上完整基準測試;Qwen3.8-Max-Preview 緊接著沒幾天就亮相。兩款兆級參數模型一前一後登場,也讓這一波國產旗艦的較勁格外受關注。

怎麼試用?三個入口與預覽期的折扣

目前有三個入口可以接觸到這一版:阿里雲百煉的 Token Plan、程式開發平台 Qoder,以及企業辦公流程產品 QoderWork。

預覽期間阿里也祭出明顯的試用優惠:Token Plan 上大約是標準價的 1 折,等於同樣的錢、用量放大約 10 倍,Qoder 這些入口也有對應的限時折扣。要留意的是,預覽版的能力可能還在調整,現在測到的表現,不一定等於正式版最後的樣子。

正式版何時開源?後續值得盯的兩個訊號

阿里官方已經表明,正式版之後會開放權重、走開源路線,只是目前還沒公布確切日期與授權條款,也還沒上架到 Hugging Face。

先放預覽版試水溫、正式版再開源,是不少大模型近期常見的節奏;評測資料偏少,比較可能是因為模型剛發、時間還短,細節通常會過一陣子陸續補齊,不必急著解讀成什麼特別的訊號。真的想追這條線,有兩個點最值得盯:一是實際手感,尤其自己常用的那類任務跑起來順不順;二是之後釋出的標準化第三方 benchmark 與開源權重,那才是驗證「僅次於 Fable 5」這種說法的關鍵。

把這些兜起來看,Qwen3.8-Max-Preview 把參數推上 2.4 兆、主打長任務自主與原生多模態,程式與工程能力在實測裡站得住腳,是阿里在旗艦模型上的又一次卡位;但創意視覺這類還沒補上的短板,加上還沒到位的標準化評測與開源權重,也提醒大家先別把「僅次於 Fable 5」當定論。對想用的人來說,現階段比較務實的態度是:拿寫程式、工程這類它已經打得不錯的任務先試起來,其他複雜創意或高穩定性的需求,就等正式版與更多數據再說。

常見問答

本區問答由 AI 依文章內容自動整理,僅供快速參考,正式內容仍以全文為準。

Qwen3.8-Max 預覽版的參數規模有多大?

Qwen3.8-Max-Preview 的總參數量達 2.4 兆。它是阿里雲第一款突破兆級參數的原生多模態旗艦模型。它採稀疏混合專家(MoE)架構,並支援 1M token 的上下文長度。

這一版主打哪些新能力?

這一版主打長週期自主作業與程式開發。前者能超長時間無人值守執行、單一任務連續呼叫工具上千次,並支援多個智慧體協同分工。後者涵蓋全端開發、程式碼重構與漏洞批次修復。

它在程式與工程實測中表現如何?

多家實測顯示它表現穩定。讓它寫 Python 版 LRU 快取,五個測試案例全數通過。分析真實 GitHub 專案找 bug 時,也能正確揪出資源洩漏等問題並修復成功。首輪交付的完整度很高。

「僅次於 Fable 5」的說法目前能當定論嗎?

目前還不能當定論。這是官方發布時提出的自評定位。到 7 月下旬為止,LMArena、Artificial Analysis 等標準化第三方評測都還沒放出分數,阿里也尚未公開 benchmark 表。建議先當作定位宣傳看待。

現在要怎麼試用 Qwen3.8-Max 預覽版?

預覽期間可透過三個入口體驗。三個入口分別是阿里雲百煉的 Token Plan、程式開發平台 Qoder,以及企業辦公流程產品 QoderWork。Token Plan 折扣約為標準價的 1 折。這等於用量放大約 10 倍。

資料來源
  1. 最新版通義千問(Qwen3.8-Max-Preview)功能介紹 — 阿里雲開發者社區
  2. Alibaba Previews Qwen3.8-Max, a 2.4 Trillion-Parameter Multimodal Model, Days After Moonshot's Kimi K3 Open-Weight Launch — MarkTechPost
  3. Alibaba unveils Qwen3.8, claims it's 'second only to Fable 5' — Silicon Republic
  4. 實測 Qwen3.8 預覽版:2.4T 參數,聽說僅次於 Fable 5? — 網易科技