多數人以為一支影片能不能一個人做完,關鍵在有沒有團隊或器材;真正卡住流程的,往往是腳本、配音、字幕、剪輯這幾件事有沒有接成一條順序,而不是缺了哪一樣工具。少了順序,就算把最新的生成式 AI 工具全部塞進流程,還是得每支影片都從頭想一次先做什麼、後做什麼。這正是 AI 影音工作流想解決的問題,把從腳本到成片的每一關固定下來,一次建好,之後每支影片都能直接套用。
這已經不是少數人在玩的技術。Wistia 每年進行的 State of Video Report 調查發現,超過三分之一的影片團隊已經在工作流程裡用上 AI,另外將近四分之一計畫近期跟進,而且用得最深的環節是前期製作,也就是規劃與寫腳本這一段。Grand View Research 的市場報告也估計,全球 AI 影片生成器市場 2025 年的規模約 7.885 億美元,預期在 2026 到 2033 年間以 20.3% 的年複合成長率成長,到 2033 年來到 34.416 億美元。
下面是一套完整七步驟的產線,從定調、寫腳本、抓畫面、配音,一路做到字幕、合成與上傳前的檢查,重點是一次建好之後每支影片都能直接套用,不必每支都重新摸索。先從最容易被跳過的第一關講起,目標、受眾、規格與語氣沒有先定好,後面每一步都得重新想一遍。

第一步:先定好目標、受眾、規格與語氣,腳本才有方向
開始寫任何一句腳本之前,有四件事值得先攤開來想清楚,而不是邊寫邊決定。
- 影片目的:一支影片只設定一個明確的行動呼籲,要觀眾追蹤帳號、點連結,還是記住一個觀念,選一個就好。目的一多,腳本結構會被拉扯,結尾也容易講到一半換方向。
- 受眾輪廓:同一個主題,講給第一次接觸的人聽,跟講給已經追蹤半年的老讀者聽,用字跟切入點都不一樣。先把受眾的樣子想清楚,腳本才知道要從哪裡開始解釋、哪裡可以跳過。
- 平台格式與時長上限:格式其實在決定內容能講多深。YouTube 官方說明中心把 Shorts 的規格訂在 3 分鐘以內、畫面比例為正方形或直式,超過 3 分鐘或改用比較寬的橫式畫面,就不會被系統歸類為 Shorts;TikTok 的官方說明中心也是同一套邏輯,創作者在開始錄製或上傳前就要先選好影片要用的長度與比例。格式一旦定了,腳本能塞進去的資訊量也跟著定了,不是先寫好一長串腳本再回頭硬剪。
- 語氣調性:第一支影片用什麼樣的說話方式,後面同系列的影片最好都沿用;語氣一旦來回換,觀眾很難對一個帳號累積出一致的印象,也比較難養成固定收看的習慣。

這四件事一次定下來,寫進後面下指令給 AI 工具的固定設定裡,同系列每一支都能直接沿用,不用每次重新想一遍。
第二步:用 AI 把構想寫成一份能唸出來的腳本
目標、受眾、規格都定好之後,才輪到讓 ChatGPT、Claude 這類對話式 AI 工具幫忙把構想寫成腳本。這一步最容易犯的錯是丟一句「幫我寫個影片腳本」就收工,AI 沒有第一步那些設定可以參考,寫出來的東西自然通用又空泛。下指令時要把受眾是誰、語氣調性怎樣、平台格式與時長上限一起帶進去,AI 才有依據去決定哪些內容該留、哪些該砍。
一份能用的腳本,大致會落在四段結構裡:
- 鉤子:開頭幾秒要有能留住人的東西,不是先自我介紹。
- 問題:點出這支影片要解決的是什麼。
- 解法:中段給出具體做法或答案。
- 行動呼籲:結尾收在明確的下一步動作。

四段各自要抓的秒數比例不必死板,但每一段的功能不能少。
寫腳本時還有一個習慣值得養成,一句話對應一個畫面。腳本是要唸出來的逐字稿,不是給人默讀的文章,句子要短、要口語,每唸完一句差不多就是換一顆鏡頭的時機,這個拆句習慣看起來只是寫法上的小事,卻直接影響後面配音跟切鏡對不對得齊。Wistia 的調查也印證了這個順序,在已經用 AI 的影片團隊裡,AI 用得最深的環節正是前期製作,也就是規劃與寫腳本這一段,是整條產線裡最先該導入 AI 的一步。
第三步:畫面用實拍優先,AI 生成負責補不到的鏡頭
腳本寫定,接下來要決定的是畫面怎麼來。畫面的分工邏輯很單純,自己拍得到的內容優先用實拍,AI 生成負責補那些拍不到、或拍起來成本太高的鏡頭。

拍得到的畫面,用真人鏡頭與螢幕錄影
產品操作、開箱、教學這類畫面,只要自己拍得到,就優先用真人鏡頭或螢幕錄影,不要為了省事直接交給 AI 生成。目前主流的 AI 影片生成工具,在角色與場景的一致性、細節的真實度上都還比不上實拍,同一個人物換了鏡頭,五官、衣著細節容易跑掉;產品的材質、按鈕位置這類需要精準呈現的畫面,也還是實拍比較可靠。
拍不到的畫面,才交給 AI 生成
轉場、示意畫面、抽象概念視覺化這類拍不到或拍起來成本太高的鏡頭,才輪到 AI 生成上場。以 Google DeepMind 的 Veo 為例,這類工具已經能直接用文字生成含對白、音效、環境音在內的短片,不用另外配音軌;生成過程還能用參考圖片維持同一個角色或場景在不同鏡頭間的樣貌一致,Google Developers Blog 說明 Veo 3.1 最多能帶入 3 張參考圖片做這件事。多段幾秒的片段也能接成比較長、有連貫敘事的畫面,每一段新片段會根據前一段的最後一秒去生成,讓場景銜接得上,不是各拍各的再硬接。
這類工具生成出來的內容,目前也會嵌入肉眼看不見的浮水印標記來源,能抵抗裁切、加濾鏡、壓縮這些後製動作。這點跟發布前要不要主動標示 AI 生成內容有關,留到最後一步再一起講,這裡先知道畫面本身已經帶著這層標記就好。
第四步:配音要用語音庫,還是複製自己的聲音?
有了畫面,配音上場,這一關要面對的不是挑哪支工具最厲害,而是兩條路怎麼選。剛開始測試腳本唸出來順不順,用現成語音庫的 AI 人聲就夠;如果打算長期經營同一個品牌調性,值得花一次時間複製自己的聲音,讓每一支影片聽起來都是同一個人在說話。Wistia 的調查也把配音列為生成式 AI 目前在影片製作裡第二常見的用途,順序僅次於字幕。
先從語音庫的現成聲音開始
現成的語音庫可以直接挑腔調、語言、情緒語氣,像 ElevenLabs 這類工具支援超過 70 種語言,中文也在其中,不用馬上投入複製自己聲音的準備工作。這個階段的重點是先確認腳本唸出來的節奏對不對,句子會不會太長氣接不上、停頓的地方順不順,語音庫的聲音夠用來驗證這件事,調性定案之後再決定要不要換成自己的聲音。
要複製自己的聲音,該怎麼做,要注意什麼?
語音克隆大致分兩種做法。即時克隆只要大約 1 分鐘的聲音樣本,就能生成一個接近本人語氣的聲音,適合先求有;專業克隆則需要 30 分鐘以上的高品質錄音,換取更接近本人語氣起伏與情緒轉折的效果,適合已經確定要長期用同一個聲音經營的情況。像 Descript 的 Overdub 功能也走同一個方向,免費與入門方案能試用限定 1,000 個常用詞彙的版本,付費方案才解鎖沒有限制的完整版。一次設定好,之後每一支影片都能直接套用,不用每支都重新錄音。
這裡只有一條界線要守住,只能複製自己的聲音,或是取得當事人明確同意才能用他的聲音生成內容,不能拿別人的聲音直接拿去生成。這不只是禮貌問題,聲音跟臉一樣是能辨識一個人身分的特徵,未經同意複製別人的聲音去生成內容,等於冒用了對方的身分。
第五步:字幕自動產生後,這幾個地方要自己校對
字幕是目前生成式 AI 在影片製作裡用得最普及的一項,Wistia 的調查把它列為使用率最高的功能。不過普及不代表能全交給 AI,自動辨識產生的字幕丟上去之前,還是有幾個地方需要自己校對一遍。
中文語音辨識目前仍有誤差空間,常見的誤判集中在兩類:一類是專有名詞跟品牌名,系統沒看過的詞容易被辨識成音近的常用詞;一類是同音字,中文同音異義字多,辨識引擎光聽發音很難分辨你講的是哪一個。校對時可以鎖定幾個重點:專有名詞與品牌名有沒有被誤判、數字與日期有沒有唸對抄對、斷句斷行是不是自然,不要讓一句話在奇怪的地方硬生生斷開。
字幕的位置也要檢查,不能只顧內容對不對。如果畫面裡本來就有文字或介面重點,像是螢幕錄影裡的按鈕、選單、彈出視窗,字幕就要避開這些位置,不然觀眾兩邊都看不清楚。這一步校對省不掉,但比從零開始一句一句上字幕快得多,值得當成固定的產線步驟,不是可有可無的最後檢查。
第六步:把腳本、畫面、配音、字幕接成一支影片
腳本、畫面、配音、字幕四個元素都準備好,剩下的是合成,這一步的順序很關鍵,要先以配音的節奏為主軸,再依聲音的長短去切分每個畫面片段,不要反過來先剪好畫面再硬塞配音進去。這樣做出來的結果,畫面切點跟語句的停頓多半對不上,聽起來會卡。
字幕疊上去之後,回頭檢查有沒有蓋到畫面重點,跟第五步校對字幕時要顧的是同一件事,只是這裡要看的是整支影片剪完之後的實際呈現。有沒有背景音樂視內容需要再加,不是每支都一定要配樂;真的加了,音量原則上要讓配音清楚可辨,不能讓音樂蓋過人聲。
這一步還有一個能省下大量時間的做法,叫文字化剪輯,像 Descript 這類工具把影片剪輯做成改文字稿的形式,刪改文字稿等於直接剪掉對應的片段,不用回頭在時間軸上一格一格拖拉;單一片段要修改,也只重新處理那一段,不用整支重新剪過。這種做法對一人經營尤其划算,反覆修改配音或補一句台詞的成本會低很多。
第七步:上傳前的最後一關,版權與 AI 標示揭露
影片剪完,上傳前還有最後一關要過,而且這關經常被跳過,就是版權授權跟 AI 內容的標示規則。
YouTube 官方說明中心的規則是,凡是「看起來真實、但其實是 AI 生成或經過重大修改」的內容,創作者都要主動揭露,像是把真人的臉數位改動、合成聲音,或是改變了真實地點跟事件的畫面。這種情況會被要求標示,標籤會出現在展開的說明欄裡;涉及健康、新聞、選舉、財務這類敏感主題,標籤還會直接顯示在播放器上更醒目的位置。單純的濾鏡、剪輯、調色,或是複製自己聲音這類次要編輯,不在需要揭露的範圍。持續不揭露的創作者,官方說明指出可能會被人工加註標籤、下架內容,甚至暫停合作夥伴計畫資格。
TikTok 的規則方向類似。TikTok Newsroom 說明,完全由 AI 生成、或經過大幅修改的逼真內容需要標示,創作者可以主動套用平台的 AI 生成標籤,或透過貼紙、字幕等方式揭露;平台本身也在測試自動偵測機制,計畫對辨識出的 AI 生成或編輯內容自動加上標籤。這代表就算創作者沒主動標,平台之後也可能自己判定並貼上標籤,與其被動被標,不如上傳前就先自己確認清楚。

如果第六步的背景音樂是用 AI 生成配樂工具做的,還要多核對一件事,免費方案通常只能非商用。以 Suno 為例,免費方案生成的歌曲版權歸平台所有,只能用於非商業用途,要拿去做能營利的影片,得先訂閱付費方案才能取得商用授權。這類授權條款每支工具規定不一定相同,上片前務必核對清楚,不要等到影片上線才發現配樂不能商用。
七個步驟真正省下的,不是操作的時間,而是決策的時間。腳本結構、語音設定、發布前的檢查清單,這些東西只要建立過一次,之後每支影片都不用從頭想這次要怎麼做,只需要照著同一條產線把內容換掉。開頭提到那超過三分之一已經在用 AI 的影片團隊,多半也是先把這條路走順了一次,才談得上加速或批量產出,順序永遠排在速度前面。先把七關走完整一次,比急著同時導入所有工具更值得。
