多數人以為 Midjourney 的門檻卡在介面難不難操作,其實從它公開測試以來,操作方式已經一路簡化到只剩打字這件事,真正卡關的反而是你打的那句話,它聽不聽得懂。
同一個主體,提示詞寫得越具體,Midjourney 就越有依據畫出接近你腦中畫面的成品;寫得越空泛,它就只能自己腦補剩下的九成。Midjourney 是一款透過文字生成畫面的 AI 繪圖工具,你打一段描述,它在幾秒到十幾秒內就能還給你幾張成品。光是 AI 圖像生成器這塊市場,Fortune Business Insights 就估計 2026 年規模已經來到 4.84 億美元,還在以每年約 17.4% 的速度往上衝,這還只是市場裡其中一款工具的規模而已。
先從它到底是什麼樣的工具、跟其他 AI 繪圖工具比強在哪裡講起,再一路拆到提示詞怎麼寫、方案怎麼選、現在版本又差在哪。
Midjourney 是什麼?一款用文字生成畫面的 AI 工具
Midjourney 是一款生成式 AI 繪圖工具,你只要用自然語言描述想要的畫面,它就能在幾秒到十幾秒內幫你生成對應的圖片。它由一間位於美國舊金山的獨立研究實驗室開發,2022 年開放公開測試後迅速累積起大量使用者;創辦人 David Holz 過去也是動作捕捉技術公司 Leap Motion 的共同創辦人與技術長,在投入 Midjourney 之前就有多年開發互動運算技術的經驗。

跟自己動手畫或找人代筆比,Midjourney 拿掉的是「會不會畫畫」這道門檻,但沒拿掉「怎麼把腦中畫面講清楚」這件事,這也是接下來要一路拆解的重點。
Midjourney 怎麼把一句話變成一張圖?
這背後靠的是一種叫「擴散模型」(diffusion model)的技術。簡單說,系統會先從一片雜訊開始,再一步一步把雜訊去除、往你描述的方向收斂,最後才收斂成一張完整的圖像。你不用懂背後的數學,只要知道它不是從資料庫裡挑一張最像的圖片交給你,而是每一次都重新生成一張全新的畫面,這也是為什麼同一句提示詞每次出圖都會有些微差異。

Midjourney 為什麼常被說成「最有美感」的一款?
把同一句普通提示詞分別丟進幾款主流工具比較,Midjourney 給出的成品往往帶著較明顯的光影層次、繪畫質感,構圖也比較講究,這是它在多篇 2026 年國際工具比較裡最常被提到的優勢。也因為這樣,它特別受設計師、行銷企劃、概念美術這類需要視覺素材的人歡迎,對他們來說,成品不用花太多時間後製就已經堪用,本身就是一種效率。不過美感只是相對優勢,不是唯一標準,擺到其他工具旁邊比,會看得更清楚。
跟其他 AI 繪圖工具比,Midjourney 的強項在美感
文字生圖這個賽道,現在檯面上幾款主力工具各自有清楚的定位,擺在一起看會更容易理解 Midjourney 適合什麼場景。OpenAI 旗下的圖像生成模型這幾年在文字渲染與指令遵循上進步很多,對複雜構圖、多個元素同時出現在畫面裡的情境掌握得比早期版本準確不少;Google 的 Gemini 影像模型則擅長處理多元素、高保真度的場景,速度也快,適合需要大量產出的情境;Stable Diffusion 走的是開源路線,可以在自己的電腦或伺服器上跑,客製化彈性最高,但也需要一定的技術門檻才上得了手。

Midjourney 在這幾款裡,主打的仍是成品完成度最高、最不需要後製這件事,美學調校從一開始就是它投入最多心力的方向。相對地,它在文字渲染這塊(把文字精準畫進圖裡)目前還是落後給專攻這塊的工具。多數專業使用者的做法,其實是依任務混用幾款工具,而不是只認定一款,這對剛入門的人來說反而是好消息,先搞懂每款工具的強項,比急著選出一款「最好的」更實際。
Midjourney 現在還一定要用 Discord 嗎?
Midjourney 最初確實只能在 Discord 伺服器裡用指令生圖,但它後來推出了自己的網頁版介面,只要用 Google 帳號或電子郵件就能登入,不必再依賴 Discord 這個第三方平台操作。對第一次接觸的人來說,網頁版的學習成本明顯低很多,輸入框、參數面板、圖庫紀錄都整合在同一個頁面上,不用先搞懂 Discord 的伺服器與指令語法才能開始使用。
如果本來就習慣在 Discord 裡工作,也還是可以把官方機器人加進自己建立的伺服器繼續用指令生圖,兩條路現在都通,只是新手多半會覺得網頁版更好上手。
Midjourney 從 2023 年 3 月起就已經取消免費試用,現在一律要先訂閱付費方案才能生圖。網路上偶爾還看得到「免費送 25 張」這類說法,那多半是舊資訊,別再照著找。
Midjourney 訂閱方案怎麼選?
Midjourney 目前有四個訂閱層級,差別主要在「Fast 快速生成的 GPU 時數」「能不能無限使用 Relax 慢速模式」,以及「隱私功能」。下面這張表是現行的月費與定位,幫你快速抓到自己大概落在哪一格。
| 方案 | 月費(年繳每月) | Fast GPU 時數 | 適合誰 |
|---|---|---|---|
| Basic | US$10(US$8) | 約 3.3 小時 | 純嘗鮮、輕度使用 |
| Standard | US$30(US$24) | 15 小時+無限 Relax | 穩定創作、設計工作者 |
| Pro | US$60(US$48) | 30 小時+無限 Relax+隱私模式 | 專業或商業創作 |
| Mega | US$120(US$96) | 60 小時+無限 Relax+隱私模式 | 重度使用、團隊 |
選年繳大約能省下 20%,等於一年省下兩個月的費用。Basic 月繳可以先用一個月確認使用頻率,再評估要不要升級;Standard 的無限 Relax 模式出圖速度慢一點,但不消耗 Fast 時數,適合已經確定會大量產圖的使用情境。
如果你所屬公司前一年度的營收超過 100 萬美元,官方規定就要用到 Pro 以上的方案,才能取得成品的商用授權,單純訂閱 Basic 或 Standard 並不夠,這點對接案或企業使用者特別容易被忽略。這條規則跟你個人花多少錢無關,是看公司整體營收去認定的。
提示詞要怎麼寫,Midjourney 才聽得懂?
Midjourney 不吃長篇大論的完整句子,它吃的是精煉、有畫面感的描述。與其把一整段文字丟給它,不如照著一套六欄公式,由前往後一欄一欄填,AI 需要自己腦補的空間就會越來越小。
提示詞的六個欄位,從主體排到技術細節
- 主體:畫面主角是誰或是什麼,一位武士、一座未來城市、一杯咖啡都算。
- 媒介:想用什麼形式呈現,攝影、油畫、3D 渲染、水彩都是常見選項。
- 環境:場景設定在哪裡,竹林裡、火星表面、一間溫馨的咖啡館。
- 光線:整體氛圍怎麼定,黃金時刻、戲劇陰影、霓虹燈、柔和漫射光。
- 風格:想要哪種調性,電影感、極簡、復古、賽博龐克都能指定。
- 技術細節:相機或規格類描述,例如 35mm 鏡頭、淺景深、廣角。

不是每次六欄都要填滿,但欄位越完整,AI 自己亂猜的空間就越小。下面用同一個主體「貓」示範,從基礎到完整版是怎麼一路長出來的,這兩句純屬示範用的提示詞範例,不是任何真實生成過的成品:
基礎:
a catCode language: plaintext (plaintext)
完整版:
a fluffy orange tabby cat sitting on a Victorian windowsill,
golden hour light through lace curtains, oil painting style,
warm tones, intimate cozy atmosphere --ar 3:4 --s 750Code language: plaintext (plaintext)
完整版只是把環境、光線、媒介、風格依序補上去,最後再加兩個參數(下一節會解釋)。它沒有變得比較囉嗦,而是每一個字都在給系統一個具體指令。
寫提示詞時,還有幾個原則能幫你少走冤枉路:
- 具體就好,不用堆形容詞。像「dramatic lighting」就比「lighting that creates a very strong dramatic feeling」更容易被讀懂,Midjourney 不需要完整句子。
- 善用風格參考詞。像「in the style of…」「baroque painting」這類描述,能一句話把整體美感的方向定下來。
- 少用否定句。與其寫「no trees」,不如直接描述你想要的東西;Midjourney 常會忽略否定指令,真的要排除某個元素,得靠下一節的 –no 參數才管用。
- 要寫實就加相機規格。在提示詞裡加上「shot on…」「85mm f/1.4」「shallow depth of field」這類字眼,照片感會明顯提升。
參數不用全背,新手先記六個最常用的
參數是加在提示詞最後、以兩個減號「–」開頭的指令,用來微調 Midjourney 的出圖方式。官方公開的參數其實不少,但新手不用一次全背起來,先把下面這六個記熟,大概就能涵蓋八成的日常需求。
| 參數 | 範例 | 作用 |
|---|---|---|
| –ar | –ar 16:9 | 設定長寬比,預設 1:1。常見的有 16:9(寬螢幕)、9:16(直式手機)、3:4(攝影感) |
| –s(–stylize) | –s 250 | 藝術風格強度,範圍 0~1000,數值越高 AI 越自由發揮,越低越貼字面描述 |
| –c(–chaos) | –c 30 | 四張圖之間的差異程度,範圍 0~100,想一次多看幾種方向就調高 |
| –q(–quality) | –q 2 | 畫質與細節,數值越高越精緻,但也越耗時、越吃額度 |
| –no | –no text | 負面提示,排除不想出現的元素,例如 –no text 用來去掉文字浮水印 |
| –niji | –niji | 切換成專攻動漫風格的 Niji 模型,畫日系插畫時特別好用 |
實際寫法就是接在提示詞後面,參數前記得留一個空格:
a futuristic city at sunset, cyberpunk style --ar 16:9 --s 400 --no peopleCode language: plaintext (plaintext)
調參的節奏可以這樣抓。一開始只動 –ar(決定畫面比例)和 –s(決定風格濃淡)這兩個就好,其他先用預設值;等你對出圖的手感熟了,再慢慢加進 –c、–no 這些。一次只改一個參數、對照前後差異,是搞懂每個參數到底在做什麼最快的方式。
版本一直在更新,V8.1 帶來哪些改變?
Midjourney 每隔一段時間就會升級模型版本,版本越新,通常畫質、語意理解、生成速度都會跟著往上跳。目前的預設模型是 V8.1,官方在 2026 年 6 月正式把它設為所有使用者的預設版本,接替前一代的 V7。
V8.1 相較舊版本,主要有三個方向的升級:
- 對提示詞的理解更準。對複雜描述、細節與構圖的掌握更好,AI 誤解你意思的情況變少。
- 生成速度大幅提升。標準模式出圖只要幾秒鐘就能跑完,等待時間比以前明顯縮短。
- 開啟 HD 模式能直接產出更高解析度的成品。不用再另外做一次放大(upscale)的動作,對要拿去印刷或做廣告素材的需求特別實用。
新手大多數情況下不需要手動選版本,直接用預設的最新版就好,它在大多數情境下都是綜合表現最好的選擇。只有兩種情況才需要手動指定:一是想畫日系動漫風格,這時候加 –niji 切到動漫模型;二是想刻意沿用某個舊版本的特定畫風,才用 –v 加版本號回去,例如 –v 7。除此之外,跟著預設走就對了。
關於 Midjourney,新手常見誤解:免費使用、版權商用與生成品質
整理前面幾節,新手最容易卡住的其實不是操作,而是這三個常見的誤解。
第一,「還能免費用」。這是最常見的舊印象,但 Midjourney 從 2023 年 3 月起就已經取消免費試用,現在一律要先訂閱付費方案才能生圖,沒有例外。
第二,「生成的圖版權算誰的、能不能商用」。付費訂閱的使用者可以取得成品的使用權,一般個人或小規模使用通常沒問題;但如果你所屬公司前一年度營收超過 100 萬美元,前面提過的規則就會生效,要用到 Pro 以上的方案才能取得商用授權,別直接假設隨便一個方案都能拿去做商業案子。
第三,「手指畫錯、文字跑掉,是不是代表這個工具比較差」。這其實是目前所有文字生圖模型都有的共同限制,不是 Midjourney 特別弱;在文字渲染這塊,確實有其他工具目前做得相對準一些,但把美學完成度攤開來比,Midjourney 仍是業界公認做得最好的其中一款,這點也呼應了前面「跟其他工具比」那一節的結論。
Midjourney 把「會不會畫畫」這道門檻拿掉了,但沒有拿掉「會不會描述」這件事。真正拉開成品差距的,從來不是誰的訂閱方案比較貴,而是誰更懂得把腦中的畫面拆成主體、環境、光線、風格這些欄位,一欄一欄餵給它。
下一次打開輸入框,先別急著套用別人的提示詞範例,試著自己把想要的畫面拆成那六個欄位,一次只改一個參數看看差異。這個節奏跑順了,你很快就能分辨出,一句提示詞為什麼能做出好圖,另一句卻只能生出普通的東西。
