多數人想像中的 AI 生圖工具,比較像一個手腳很快、但不太聽得懂需求的助理——丟一句提示詞,它就憑直覺畫一張圖,畫面漂亮,卻常常抓錯重點、忘記你剛剛已經講過的條件。Google DeepMind 在 2025 年 11 月 20 日發布的 Nano Banana Pro,走的是完全不同的路線。它更像一位資深美術指導,接到需求會先讀懂你要什麼、想清楚整體構圖的邏輯,才真正動筆,而不是照著關鍵字亂猜。
這支建立在 Gemini 3 Pro 之上的新一代影像模型,靠的是推理能力與對真實世界的知識,而不是單純把提示詞丟進擴散模型裡畫一張圖,也因此它能像人一樣對話式修改、記得上一輪的結果,不用每次重新描述一遍。先從它是什麼樣的模型講起,再一路拆解它跟其他版本差在哪、實際能做到哪些事,最後看免費額度與付費怎麼算。
Nano Banana Pro 是什麼?Gemini 影像家族的頂規版本
Nano Banana Pro 的正式名稱是 Gemini 3 Pro Image,是 Google DeepMind 在 2025 年 11 月 20 日發布的影像生成與編輯模型,直接建立在 Gemini 3 Pro 這個大型語言模型之上。它跟你過去用過的文生圖工具最大的差異,不在畫面精緻度,而在「先理解、再動筆」的順序上。傳統的擴散模型(diffusion model)是把提示詞轉成向量,直接在雜訊裡逐步收斂出一張圖;Nano Banana Pro 則是先用 Gemini 3 Pro 的推理能力讀懂你在說什麼、盤算好整體構圖的邏輯,才開始產出畫面。
這個順序上的差異,直接反映在使用體驗上。你可以像聊天一樣一輪一輪修改同一張圖,模型記得前面已經定案的內容,不用每次重新描述整張圖的所有條件。Google 官方把它的定位講得很明確:鎖定最複雜、最專業的視覺任務,主打最高等級的世界知識、精準的在地化能力、可靠的品牌一致性,以及精細的創意控制。換句話說,它瞄準的不是隨手玩玩的塗鴉需求,而是設計師、行銷團隊真正要交付作品的場合。
Nano Banana Pro、Nano Banana、Nano Banana 2,有什麼差異?
Google 目前的原生影像生成模型家族一共有四支,名字相似卻鎖定不同任務,很容易搞混:
| 模型 | 對應代號 | 定位 | 解析度上限 | 參考圖上限(物件/角色/風格) |
|---|---|---|---|---|
| Nano Banana | Gemini 2.5 Flash Image | 元老款,主打快速、好玩的修圖 | 1K/2K/4K | — |
| Nano Banana Pro | Gemini 3 Pro Image | 本篇主角,專業級的複雜構圖與品牌一致性 | 1K/2K/4K | 6/5/3(共 14 張) |
| Nano Banana 2 | Gemini 3.1 Flash Image | 通才款,延續 Flash 系列的速度優勢 | 0.5K/1K/2K/4K | 10/4/3 |
| Nano Banana 2 Lite | Gemini 3.1 Flash-Lite Image | 最快、最省成本 | 僅 1K | 最多 14 張(以物件為主) |
從這張表可以看出,越往「Pro」靠攏的版本,單張生成的速度就越慢,但換來的是能同時處理更多種類的參考圖、也更擅長維持人物與風格的一致性;越往「Lite」靠攏,則是拿一致性的深度去換反應速度。「Nano Banana 對 Nano Banana Pro」這組對比常被拿出來講,但產品線後續又加了 Nano Banana 2 與 2 Lite 兩支,只看前兩代容易誤判整個家族目前的樣貌。

另外也要提醒,Google 還有 Imagen 4(分 Fast、Standard、Ultra 三個等級)這條獨立的擴散模型產品線,跟 Nano Banana 系列走的是不同技術路線,計價方式也不一樣。Imagen 4 是每張圖片固定收費,Fast 每張 0.02 美元、Standard 每張 0.04 美元、Ultra 每張 0.06 美元,別把它跟 Nano Banana 系列的算法搞在一起。
怎麼開始使用 Nano Banana Pro?
要用到 Nano Banana Pro,依身分不同,入口也不一樣。一般使用者最直接的方式,是打開 Gemini App 或網頁版,選用「Thinking」模型,再點選「建立圖像」;開發者可以透過 Gemini API 或 Google AI Studio 呼叫,模型代號是 gemini-3-pro-image;企業要做規模化的生成作業,則走 Vertex AI 或 Gemini Enterprise。除了這幾個主要入口,NotebookLM、Google Ads 的廣告素材生成,以及 Google Workspace 裡的 Slides 與 Vids,也都已經整合了這支模型。
對設計與行銷工作者特別實用的一點是,Nano Banana Pro 不是只能在 Google 自家產品裡用。Adobe 已經把它接進 Firefly 與 Photoshop、Figma 也把它整合進設計流程、Canva 與人像修圖工具 Photoroom 同樣串接了這支模型。也就是說,不一定要換掉手上原本在用的軟體,你熟悉的工具裡很可能已經用得到它。

圖片裡的中文文字,終於能正確顯示
AI 生圖過去最讓人詬病的痛點之一,就是圖片裡的文字常常變成鬼畫符,尤其是中文這種筆劃複雜的文字,幾乎沒有工具能穩定畫對。Nano Banana Pro 在這件事情上有明顯進步。靠著 Gemini 3 強化後的多語言推理能力,它能正確渲染長段落文字,繁體中文的筆劃與字形也能相對穩定地呈現出來,還能指定文字的質感,像是書法風、立體字、復古印刷風,不只是畫出一堆看得懂的字而已。
更實用的是圖片內文字的翻譯置換。把原本圖片上的英文或日文字換成中文,同時維持原本的字體與材質風格不跑掉,Google 官方展示過的一個案例,是把罐裝飲料包裝上的英文字直接翻譯置換成韓文,同一套邏輯放到中文語境,對做海報、包裝、菜單、Banner 本地化的設計工作者來說是很實際的應用,不必整張重畫,只換文字就好。
不過誠實講,這項能力還沒有到「完全零失誤」的地步,遇到很長的段落或比較生僻的字,偶爾還是會出現細微的誤差,交付前還是需要人工核對一次。
最多 14 張參考圖,維持人物與品牌風格一致
Nano Banana Pro 在多圖參考這件事上,拆得比一般人想像的更細。官方技術文件把「最多 14 張參考圖」分成三個類別:最多 6 張「高保真物件」參考,像是 Logo、產品照這類要求外型精準複製的素材;最多 5 張「角色」參考,讓同一個人在不同場景下,臉型與神情維持一致;最多 3 張「風格」參考,套用色票、字體、視覺語言等品牌風格指南。
對設計師或品牌經營者來說,這個功能最實際的用法,是一次把 Logo、色票、產品照全部丟進去,等於一口氣餵給模型一份完整的品牌規範,後續每一次生成都會自動套用這套風格,這也是它被形容為「給設計師的 few-shot prompting」的原因。適合的場景包括品牌延伸視覺、一系列風格統一的社群圖卡,或是產品原型的示意圖,不用每張圖都重新描述一次品牌調性。
局部編輯、打光、運鏡,一句話就能調整
除了整張圖重畫,Nano Banana Pro 也能做只調整局部、不動到畫面其他地方的精細編輯,這類調整過去多半得在 Photoshop 裡手動處理,現在用一句自然語言描述就能做到。可以調整的項目包括:虛擬相機的拍攝角度、畫面的焦點與景深(例如營造出淺景深的散景效果)、色調的精細調整,甚至是整個場景的光線,把白天的畫面直接轉成夜景。
這些能力落到實際工作上,最常派上用場的是產品照的光影調整、人像的運鏡變化,以及整體氛圍的轉換。原本要重新打光、重新拍攝才能達到的效果,現在可以直接在既有的圖片上調整出來。
連上 Google 搜尋,把資料變成資訊圖表
Nano Banana Pro 另一個跟傳統文生圖工具本質不同的地方,是它能連上 Google 搜尋取得即時、真實世界的資訊,像是天氣、比分、時事這類會隨時間變動的資料,不必自己先查好再貼進提示詞。它也能把使用者提供的原始資料,像是一段文字說明、手寫筆記,或是一組財報數字,轉換成有邏輯的資訊圖表或教學圖解。Google 官方示範過一個做法,是直接下指令把一份食譜的步驟資訊,轉成一張圖解式的製作流程圖表。
這背後仰賴的是一套「Thinking」機制。模型在真正輸出最終畫面之前,會先產生內部的中間圖像,用來推敲構圖與資訊該怎麼安排,確認邏輯通了才產出最後的成品。這正是它跟「下指令就直接畫」的傳統擴散模型最大的不同。傳統擴散模型並沒有這道先想清楚再落筆的步驟。這樣的能力特別適合拿來做知識型內容的教學步驟圖,或是把手上的原始資料做成一次能看懂的視覺化圖表。
支援 4K 輸出與多種長寬比,社群、印刷都能用
Nano Banana Pro 預設產出的解析度是 1K,你也可以指定輸出到 2K 或 4K。依官方定價文件的說明,1K 大約落在 1024×1024 像素,2K 最高可以到 2048×2048 像素,這兩個級距在計價上是同一價位;4K 則最高可以到 4096×4096 像素。長寬比的選項也不只正方形一種,技術文件列出的選項涵蓋了 1:1、3:2、2:3、3:4、4:3、4:5、5:4、9:16、16:9、21:9 等多種比例。
這代表同一個構圖,可以直接對應不同的用途,不用另外裁切:社群貼文適合正方形或直式比例、限時動態或短影音用 9:16、橫式 Banner 或簡報用 16:9,真的要輸出到印刷品,就直接拉高到 4K 解析度,不會因為放大而糊掉。
浮水印是什麼?怎麼分辨圖片是不是 AI 生成?
Nano Banana Pro 生成的每一張圖片,都內嵌了肉眼看不到的 SynthID 數位浮水印,用意是讓外界日後有辦法追溯這張圖是不是 AI 生成的。要驗證也很簡單,把圖片上傳到 Gemini App,直接問它「這是不是 AI 生成的」就可以得到答案,不需要額外的工具。
除了看不到的 SynthID,Nano Banana Pro 的圖片畫面角落還會出現一個看得見的 Gemini 星形浮水印圖示。這層可見浮水印,在免費版與 Google AI Pro 使用者產出的圖片上都會保留;訂閱 Google AI Ultra,或是透過 Google AI Studio、開發者工具產出的圖片,則會拿掉這個可見浮水印,方便直接商用輸出、不需要額外裁切或修圖去背。這對常被問到「能不能拿掉浮水印用在正式作品上」的設計與行銷工作者來說,是個實際會影響工作流程的細節。

免費額度有多少?超過要付費嗎?
一般使用者直接在 Gemini App 或網頁版就能用到 Nano Banana Pro,但免費額度有限,用完之後系統會自動切回原本的 Nano Banana,不是完全不能用,只是降級成前一代模型。如果訂閱 Google AI Plus、Pro 或 Ultra,可以拿到更高的使用額度,其中 Ultra 訂閱者還多了一項好處,就是產出的圖片不會有前面提到的可見浮水印。
開發者或企業如果是透過 API 串接(Vertex AI 或 Gemini API),計價方式是照張數算。標準層級每百萬輸出 token 收費 120 美元,換算下來,1K 或 2K 的圖片一張大約 0.134 美元,4K 的圖片一張大約 0.24 美元;如果改用 Batch API(批次送出、非即時回傳),價格可以再打對折,2K 圖片約 0.067 美元一張、4K 約 0.12 美元一張。

這裡有一個常被搞混的地方。Google AI Studio 這個開發者工具,在網頁上操作本身是免費的;真正會被收費的,是透過程式呼叫 API 的部分。
AI 生圖工具這幾年的競爭重心,已經從「畫得像不像」轉向「懂不懂你要什麼、能不能維持品牌一致」,Nano Banana Pro 代表的正是這個方向,先讀懂需求、再動筆,而不是丟進去賭一次運氣。
對設計師與行銷工作者來說,與其把它當成取代自己的對手,不如當成一個能在草圖階段先把想法具象化、把溝通成本壓到最低的工具:品牌規範一次餵進去,不用每次都重新描述調性;圖片裡的文字終於能正確顯示,不用再靠後製硬修;連解析度與長寬比都能一次對應到不同用途。剩下的,還是回到你想清楚要做什麼、怎麼用它把想法講得更清楚。
