人工智慧

AI 商品影片製作:3 種做法與規格一次搞懂

多數電商賣家一想到商品影片,腦中浮現的還是包棚拍攝的畫面:約模特兒、租場地、等剪輯師交件,一支三十秒的短片常常得排上一到兩週,商品一多,產線根本追不上上架速度。這套流程在 AI 商品影片製作興起之後已經被壓縮到幾小時內,而且不只是做出一支影片,而是能把整批商品一次量產。

這正是這幾年電商賣家紛紛轉向 AI 的原因,它把過去要靠人力排期、逐支製作的流程,換成能批次跑完的自動化路徑。只是市面上的做法五花八門,有的讓照片直接動起來,有的靠虛擬人開口講解,還有的整批套用同一個範本量產,選錯路徑很容易白花時間試錯。

值不值得砸這些資源,得先看數字怎麼說;搞懂了理由,再往下一步步拆解怎麼動手做。

商品影片為什麼能拉高電商轉換率?

Wyzowl 每年進行的《影片行銷調查》已經連續做了十二年,2025 年底針對 266 位行銷從業者的調查發現,85% 的人曾經因為看了一支影片而決定購買一項產品或服務。換句話說,影片不是加分項,而是直接影響購買決策的那一關。

會有這個結果不難理解。一件商品放在頁面上,靜態照片能傳達的只有「長什麼樣子」,影片卻能讓人看到它怎麼被打開、怎麼被使用,材質在光線下怎麼反光。這些細節,才是讓人放心按下購買鍵的關鍵。也因為這樣,行銷團隊自己也在往這個方向靠攏,同一份 Wyzowl 調查顯示,63% 的行銷人員表示已經用過 AI 影片工具協助製作或剪輯行銷影片,前一年這個比例只有 51%,一年之內跳了十幾個百分點。

不過,既然影片這麼有效,為什麼還是有賣家沒做?Wyzowl 的調查也問了這題,最常見的兩個理由各占 24%:一是覺得不需要,二是覺得成本太高。這兩個理由恰好也是 AI 商品影片製作要解決的問題,不是靠更多人力、更長工時把影片做出來,而是把整個流程壓縮到幾小時內、成本壓到接近零邊際,讓「不需要」跟「太貴」這兩個藉口都站不住腳。

Wyzowl 調查顯示 85% 消費者曾因看影片而下單、63% 行銷人已用過 AI 影片工具,佐證商品影片直接影響電商轉換率
85% 的人曾因看了一支影片而決定購買,商品影片是直接左右購買決策的那一關(資料來源:Wyzowl 2025 影片行銷調查)。

AI 快速產出商品影片,其實有三條不同路徑

「AI 商品影片製作」聽起來像一個單一動作,把照片丟進去、按下生成就好,其實市面上的做法可以分成三條路徑,各自解決不同的需求。

AI 商品影片製作分成圖生影片、AI 虛擬人講解、範本量產三條路徑,各自解決不同需求,也可以疊加使用
AI 商品影片的三條路徑:圖生影片讓照片動起來、虛擬人開口講解、範本整批複製,可依需求疊加。

第一條,是把手上現有的商品照片直接轉成會動的影片,讓靜態圖多了運鏡與光影變化,最貼近多數賣家現有的素材庫。第二條,是讓 AI 虛擬人物開口介紹商品,用一段講解取代單純的畫面呈現,適合需要說明用法或想做多語言版本的商品。第三條,是把整批商品套進同一支範本、一次量產,解決的不是「做不做得出來」,而是「一支一支做太慢」的問題。

三條路徑挑哪一條,取決於商品類型與需求,而不是哪個工具比較新。先從最貼近多數賣家現況的第一條講起。

作法一:把現有商品照片直接轉成動態影片

這條路徑的技術名稱叫「圖生影片」(image-to-video),做法是上傳一張既有的商品照片,AI 判讀畫面裡的物件邊界與景深,接著套用運鏡、光影變化與輕微的物件動態,讓原本靜止的畫面動起來。它不是憑空生成一個新場景,而是在既有畫面的基礎上加動作,所以商品本身的樣子、顏色、比例都會被保留下來。

圖生影片流程:上傳商品照、AI 判讀畫面、疊加運鏡光影、輸出短影音,在既有照片上加動作保留商品原貌
圖生影片是在既有照片上加動作、不憑空生成,商品的顏色與比例都會完整保留下來。

這也是最貼近多數電商賣家現況的做法,因為商品照片通常早就拍好了,不用重新約棚、重新打光,直接把現成素材升級成短影音。

目前 Google 的 Veo、Runway、Kling AI,以及 Adobe Firefly 都有提供圖生影片的功能,各家的操作介面與細節不太一樣,但核心邏輯相同,都是上傳一張圖、由 AI 補上動態。輸出通常是幾秒鐘的短片,長度取決於平台與方案設定,適合白底主圖或情境圖轉成短片素材。

上傳前,照片要符合什麼條件?

AI 產生的動態效果好不好,很大程度取決於上傳的原始照片。畫質模糊、背景雜亂、光線不均勻的照片,AI 在套用縮放與運鏡時容易把瑕疵一起放大,動態效果自然跟著失真。

實務上有幾個判準:解析度要夠,建議長邊至少 1200 像素以上,太小的圖片放大做動態時容易出現顆粒感;背景要乾淨,白底或單一背景色的照片最容易被 AI 準確判讀主體邊界;光線要均勻,避免同一張照片裡有大面積過曝或死黑的陰影,AI 補動態時容易把光影變化做得不自然。

白底主圖跟情境圖都能拿來用,只是情境圖轉出來的動態效果通常更自然,因為畫面本來就有景深與空間感,AI 套用運鏡時有更多層次可以發揮。

怎麼用文字指令描述運鏡與動作?

除了上傳照片,多數工具還會讓你補一句文字指令,指定想要的運鏡效果,而不是完全交給 AI 自由發揮。常見的指令方向包括鏡頭運動(緩慢環繞商品一圈、輕微推近放大)、光線變化(讓反光隨鏡頭角度流動)、產品局部特寫(聚焦在某個細節上停留幾秒)。以 Runway 的做法為例,上傳圖片後開啟編輯介面,用文字描述想要的運鏡,AI 就會在保留主體與畫面風格的前提下,疊加運鏡與動態效果。

先用照片生成、再轉成影片,會比直接用文字生成整支影片更容易掌控結果,原因也很直接。畫面裡的商品、顏色、比例已經是固定的照片素材,AI 只需要在既有畫面上加動作,不會像純文字生成那樣,連商品本身的外形都可能被重新詮釋、跟實際商品對不上。對電商來說,這個差異很關鍵,畢竟投放出去的影片,商品長相必須跟賣場上架的一模一樣。

常見的變形與失真,怎麼處理?

這條路徑目前也有明顯的限制,先老實講清楚比較實際。AI 有時候會把商品邊緣處理得不自然,包裝上的文字扭曲變形,或是金屬表面的反光位置不合常理,這些狀況在畫面快速運鏡時特別容易被看出來。

透明、反光、細長的商品材質,尤其容易出錯。玻璃瓶、鏡面金屬、細長的筆或吸管,這類商品的邊界對 AI 來說比較難準確判讀,動態效果一旦套上去,邊緣的扭曲會比一般商品明顯。

實務上有三個因應辦法:多生成幾個版本,從中挑出最自然的一支;先從方正、外形單純的商品開始練手,避免第一批就挑外形過於複雜的商品試作;生成之後務必逐支人工檢查再上架,別因為是批次生成就跳過檢查這一步。

作法二:讓 AI 虛擬人物開口介紹商品

第二條路徑不是讓商品自己動,而是找一個 AI 虛擬人物幫你講。做法是先寫一段文字腳本,AI 依照腳本生成對應的口型與語音,套用在虛擬人物身上,讓這個數位人像真人主播一樣對著鏡頭講解商品賣點。

這跟作法一的本質差異很明顯,作法一是商品本身動起來,作法二是請一個角色幫你把話講出來。功能複雜、需要解釋使用方式的商品,靠虛擬人講解會比單純的動態畫面更有效,因為有些資訊光看畫面看不出來,非得用語言講清楚不可。

Synthesia 公布的語言功能支援超過 160 種語言與腔調,同一支影片可以直接輸出不同語言版本,不需要重新找人錄音;HeyGen 的影片翻譯功能則可以把既有影片翻譯配音成 175 種以上語言,同時保持口型同步。對想做跨境上架、對海外市場說話的賣家來說,這條路徑省下的是找多國配音員的成本與時間。

這種做法適合什麼樣的商品?

需要說明使用方式或成分材質的商品,最適合這條路徑,像保養品的正確用法、3C 配件的安裝步驟、家電的操作介面,這些資訊靠畫面很難一次講清楚,靠虛擬人開口說明反而直接。想對海外市場說多國語言的商品,也很適合,同一支影片換幾種語言版本就能上架到不同市場,不用每個語言都重新拍一次。想在整個品牌內容裡維持同一張臉的賣家,用固定的虛擬人物貫穿系列影片,也能省下反覆找代言人或主持人的麻煩。

不適合的情況也很明確:強調材質手感、細節質地的商品,像服飾的布料垂墜感、家具的木紋觸感,靠虛擬人講解不如直接讓商品本身動態呈現,回到作法一會更貼切。

腳本與人設怎麼維持一致?

要讓一系列影片看起來像出自同一個品牌代言人,關鍵在固定幾個變數:固定用同一個虛擬人物,不要每支影片都換臉;固定語調與開場白的句型,讓觀眾一聽就認得是這個品牌;把品牌色與 Logo 放進版型設計裡。

Synthesia 的頭像功能支援建立個人化、客製化的虛擬人像,並可以重複使用在多支影片裡,維持一致的形象與聲音。多數工具也提供「品牌套件」這類設定,可以一次設好色系、字體、Logo 位置,後續每支影片直接套用,不用每次重新調整版型,也能避免系列影片風格跳來跳去、看起來不像同一個品牌做的。

語言與口型的限制在哪裡?

這條路徑也有需要老實面對的限制。中文,尤其是帶台灣口音的中文,目前的口型與語氣自然度還是不如英文,句子一拉長,語調生硬、口型對不上的狀況就容易出現。

實務上的因應辦法是腳本盡量寫短句,避免把好幾個專有名詞堆在同一句裡,句子越長,AI 要同步的口型與斷句就越複雜,出錯的機率也跟著增加。生成之後,務必實際播放一遍,確認口型跟聲音搭不搭、語氣聽起來自然,再拿去上架,別看過文字腳本沒問題就直接放行。

作法三:整批商品套用同一個範本,一次產出

前兩條路徑談的是怎麼把一支影片做好,這一條談的是怎麼把一百支影片做完。做法不是一支一支慢慢調整,而是先做出一支範本,把運鏡風格、字幕位置、品牌配色與 Logo 浮水印都固定下來,再把每個商品的照片或資料套進同一個範本,重複產出。

這條路徑的核心價值是一致性加上速度。SKU 數量多、需要定期上新品的賣家,最需要的不是單支影片做得多精緻,而是整個商品目錄的呈現風格統一、產出速度跟得上上架節奏。

範本化跟前面兩條路徑並不衝突。範本裡面可以套用作法一的動態效果,讓商品照片自動生成動態畫面;也可以混搭作法二的口白介紹,讓虛擬人物講解重複出現在每支影片裡。重點不在於用哪一種技術,而在於把設定重複使用,而不是每支影片都重新調整一次。

範本先做一支,再複製套用到整批商品

具體的做法,是先挑一個有代表性的商品,把這支影片的運鏡、字幕樣式、品牌浮水印位置都調整到滿意為止,再把這一整套設定另存成範本。後續要做的每一個商品,只需要換上照片、換上文案,動態效果跟版型設計都沿用同一套範本,不用每次重新調整,省下的正是反覆設定的時間。

商品資料要先整理成一張表

量產之前,先把要做影片的商品整理成一張表:照片檔名、商品名稱、一句話賣點、要套用的範本編號都列進去。批次跑的時候照著表核對,才不會漏掉某個商品,或是把 A 商品的文案套到 B 商品的照片上。

產出後怎麼抽查品質?

量產不代表可以省略檢查這一步,批次跑得越快,萬一有瑕疵,錯誤被放大的速度也越快。

建議批次生成完之後,至少抽查一定比例的影片,例如每十支抽兩到三支,確認動態自然、字幕沒有跑版、品牌浮水印位置正確,確認沒問題再整批上架。省略這一步,等於把單支影片可能出錯的風險,直接放大成一整批影片同時出錯的風險,反而讓量產的效率優勢打了折扣。

三種做法該怎麼選?

三條路徑不用挑一條走到底,可以疊加使用,判斷基準是商品數量與需求類型。

依商品數量與需求選路徑:數量少選圖生影片、需講解或多語言選 AI 虛擬人、目錄大選範本量產,三者可疊加
商品少想試水溫走圖生影片、需要講解或多語言走虛擬人、目錄大定期上新走範本量產,三者也能疊加。

商品數量少、想先試試水溫的賣家,從作法一開始最划算,成本最低,也最快看到成果,不用一開始就投入建範本的時間。商品需要口頭說明,或是要做多語言版本上架海外市場的賣家,作法二比較對症下藥,靠虛擬人物開口講解,能把作法一單靠畫面講不清楚的用法資訊講明白,換語言版本也不用每次重新找配音員。商品目錄大、需要定期上新品的賣家,作法三才是長期該建立的機制,前面兩條路徑做出來的素材,都可以套進作法三的範本裡批次跑完整個目錄。

三者也可以疊加著用,先用作法一把商品照片變成動態素材,再套進作法三的範本裡,一次跑完整個商品目錄,這樣既有動態效果,也有量產速度。

不同投放位置,影片規格要求不一樣

影片做出來還要投對地方,不同平台對長寬比與時長的要求都不一樣,格式沒對齊很容易被系統自動裁切變形,或是效果打折扣。

以 TikTok for Business 公布的廣告規格為例,直式影片是目前最推薦的版位,比例 9:16,尺寸至少要 540×960 像素,貼合直向手機螢幕的握持方式,在行動裝置上普遍表現較好;方形影片比例 1:1,尺寸至少 640×640 像素,常見於動態消息類版位;橫式影片比例 16:9,尺寸至少 960×540 像素,較適合商品頁面或影片平台這類本來就是橫向瀏覽的空間。

TikTok 三種投放版位規格:直式 9:16 至少 540×960、方形 1:1 至少 640×640、橫式 16:9 至少 960×540
直式 9:16 在行動裝置表現最好、也最推薦,字幕記得留在安全範圍內(資料來源:TikTok for Business 廣告規格)。

字幕跟重要文字要放在畫面安全範圍內,避免被裁到看不到。TikTok 的規格也明確要求廣告字幕不支援可點擊連結或標籤,樣式由系統統一呈現、不能自訂字型或顏色,字幕的重點因此不在設計感,而在確保文字完整落在安全範圍裡、不被邊緣裁掉。

AI 商品影片最容易在哪裡穿幫?

前面幾段陸續提過幾個容易出錯的地方,量產上架前,不妨照著下面這份清單抽查一輪:

  • 商品邊緣或文字是否扭曲變形,尤其是包裝上的文字跟金屬反光的位置。
  • 動作是否過於誇張、不自然,運鏡速度跟商品本身的份量感搭不搭。
  • 畫面是不是全程幾乎靜止,只有背景光影在變化、商品本身沒有任何動態,這種近乎照片的短片很容易被使用者滑過,觸及表現也偏弱。
  • 字幕有沒有直接燒錄進畫面。很多人是關掉聲音在看影片,字幕另外上傳、沒有燒進畫面裡,等於少了一半的傳達效果。
  • 整批影片的風格是不是一致,版型、字體、品牌色有沒有跑掉。

這份清單不是要逐支重做,而是抽查時的核對依據,搭配前面「產出後怎麼抽查品質」的抽查比例一起用,比全部做完才發現同一個瑕疵重複出現在幾十支影片裡,划算得多。

在台灣,AI 生成的商品影片可以直接拿去投放廣告嗎?

AI 生成的商品影片能不能直接商用,是很多賣家實際會擔心的問題,牽涉到的其實是兩件不太一樣的事:這段內容有沒有著作權,以及有沒有取得商用授權。

經濟部智慧財產局在 114 年 5 月 22 日發布的一份電子郵件函釋(字號電子郵件 1140522c)指出,著作權保護的前提是創作過程中要有人類實際的精神創作投入。如果整個生成過程完全由 AI 的演算功能獨立完成,使用者只是單純下指令、沒有實質的人類創意投入,這段生成內容本身可能不受著作權法保護。反過來說,如果人類在過程中做了實質的創意選擇與調整,像是反覆修改指令、挑選並加工生成結果,通常就會被認定有人類創作投入,受著作權保護的機會也比較高。

不過對想拿去投放廣告的賣家來說,真正的風險不是「這段影片有沒有著作權」,而是「有沒有取得 AI 服務商的商用授權」。就算生成內容本身有沒有著作權還有爭議,只要使用的工具方案不包含商業使用權限,一樣不能拿去投放廣告。智慧財產局也建議,商用前應該向 AI 開發或管理者確認是否取得著作財產權人授權、能不能轉授權給第三人商業利用,並遵循該生成式 AI 服務商訂定的使用規範。實務上最簡單的做法,是上架投放前,直接把自己用的方案條款翻出來確認一次,而不是預設有付費訂閱就等於可以商用。

AI 商品影片製作走到這裡,已經不是「要不要做」的問題,而是「先從哪一條路徑開始」的問題。挑一批數量最少、最容易看到成效的商品先試,不用一開始就想著整個目錄一次到位,把流程走順、找出適合自己商品的那條路徑,再逐步擴大到整個商品目錄,產線自然會跟上上架的節奏。

資料來源
  1. Video Marketing Statistics 2026 (12 Years of Data) — Wyzowl
  2. Synthesia Languages — Synthesia
  3. AI Video Translator: Translate Videos into 175+ Languages — HeyGen
  4. TikTok Auction In-Feed Ads — TikTok for Business
  5. 智慧財產局著作權主題網-解釋資料檢索-電子郵件1140522c — 經濟部智慧財產局