多數人接到「做一個新頁面」的任務,直覺反應常常一樣,都是放一支影片上去,畫面比較豐富,使用者應該會多留意一下。這個假設聽起來合理,但可靠度沒那麼高,Nielsen Norman Group 針對影片易用性做的研究發現,使用者一遇到頁面上的影片,並沒有固定的反應模式:有人立刻點開看,有人先讀旁邊的文字才回頭看,也有人完全沒興趣點開,同一個人碰到不同任務時的反應甚至也不一樣。
換句話說,「頁面上放了影片」跟「使用者真的看完、吸收了那支影片」,中間隔著一大段落差,而這段落差,才是決定一支影片有沒有效的關鍵。影片不是不好,只是它只在特定任務、特定情境下才真的比文字有效;把它當成放上去就加分隨手擺著,反而可能拖慢頁面,甚至讓使用者更快關掉分頁離開。
影片打開了,不等於被看完
深入這個問題前,先戳破一個常被忽略的前提。使用者遇到頁面上的影片,並不存在單一的標準反應。Nielsen Norman Group 在對多個網站做可用性測試後發現,有人一看到影片就立刻點開,有人選擇先讀旁邊的文字,讀完才回頭看影片,也有不少人從頭到尾都沒有點開的意願,同一支影片放在同一個頁面,不同使用者的第一個動作可以完全相反。
這件事對做頁面規劃的人來說很關鍵,因為它推翻了一個常見的預設:「只要放了影片,使用者就會看。」事實剛好相反,影片會不會被打開,取決於使用者當下的任務、耐性,還有他對這個頁面原本的期待,不是影片本身放上去就能決定的。英國政府的官方內容設計規範 GOV.UK 也提出相同的觀察,一個頁面上的影片通常只有一小部分使用者真的會點開來看,規範因此建議在動手拍片之前,先想清楚同一件事能不能直接用文字講明白。
除了願不願意點開,影片還有另一層更基本的風險,它可能根本播不出來。可用性測試裡反覆出現的狀況包括影片載入失敗、緩衝停滯,或是點了播放鍵卻沒有反應,這些都不是罕見的意外,而是影片這種媒介本身比文字更容易碰到的技術摩擦。文字幾乎不會壞掉,一段文字只要頁面載入了就在那裡;影片卻要仰賴額外的檔案下載、播放器初始化、網路狀況配合,任何一個環節出錯,使用者得到的就是一個空白的黑框,而不是原本要傳達的內容。
把這兩件事放在一起看,結論很清楚:「頁面上有沒有放影片」跟「使用者有沒有被打開、看完、吸收裡面的內容」,是兩個完全不同的問題。放上一支影片本身不保證任何效果,它只是多提供了一個管道,使用者用不用得上,還要看後面幾個條件夠不夠。
資訊型任務裡,文字的掃讀速度贏過影片的循序播放
多數人打開一個網頁,不是要「欣賞內容」,而是要「找答案」,這是網路使用者最常見的任務型態,也是文字在資訊型頁面上占優勢的根本原因。文字支援跳著看、抓關鍵詞、幾秒鐘內判斷這頁有沒有自己要的東西;影片卻是循序媒介,使用者得從頭等到答案出現,中途沒辦法確認接下來的內容跟自己有沒有關係。
Nielsen Norman Group 直接點出這個落差。影片最大的缺點,就是強迫使用者依照播放順序被動接收內容,使用者得耐著性子照播放順序消化,卻不知道接下來出現的內容跟自己有沒有關係;而且看完一支影片花的時間,通常比讀完等量的文字資訊還長,因為影片不支援大多數使用者瀏覽網路資訊時採用的快速掃讀。
這個快速掃讀不是憑空的說法。Jakob Nielsen 在 2006 年用眼動追蹤設備錄下 232 位使用者瀏覽數千個網頁的畫面後,整理出一個具體的行為模式,俗稱 F 型掃讀。使用者先橫向掃過內容區的上段,接著往下移動,做第二次較短的橫向掃視,最後才垂直掃過內容左側,只挑幾個吸引注意的詞往下看。整個過程強調的是快,通篇逐字閱讀反而是少數。
這也是為什麼小標與段落的第一個詞特別重要。使用者的視線往下掃到第三個字之後,注意力就會明顯下滑,如果一段話或一個小標把最沒資訊量的字擺在最前面,使用者根本來不及看到重點就已經跳過去了。文字內容能靠調整詞序去配合這種掃讀行為,影片卻沒辦法,它是一條時間軸,使用者沒辦法用眼睛跳到自己要的那一秒,只能靠進度條用力拖,體驗遠不如掃讀文字直觀。

影片拖慢載入是行動網路上的真實成本
從效能角度看,「反正現在網路都很快,放影片沒差」這個說法禁不起檢驗。影片檔案的體積遠大於文字,下載與解碼都要花額外的時間與流量。Google 的官方效能文件 web.dev 把這一點寫進具體指標當中,<video> 元素的 poster 屬性,也就是影片還沒播放前顯示的代表縮圖,會被視為 LCP(最大內容繪製,Largest Contentful Paint,Core Web Vitals 三項核心指標之一)的候選元素。一支放錯位置或沒優化的影片,連縮圖都可能直接拖垮這個頁面在核心網頁體驗上的分數。
web.dev 同時引用 HTTP Archive 的資料,指出網路上大約 20% 的影片帶有自動播放屬性,代表有相當比例的頁面一載入就默默開始下載並播放影片,使用者根本還沒決定要不要看,流量已經先燒掉了。這個成本在行動網路上格外真實,GOV.UK 的規範也明確把「行動網路上載入更慢、耗用更多流量」列為影片相對文字的具體缺點,直接點名這對用手機瀏覽的使用者尤其是個問題。
如果影片是嵌入別人平台的內容,像 YouTube 或 Vimeo,代價又更高一層。這類第三方嵌入播放器本身要載入額外的程式碼與資源,web.dev 引用的實測數據顯示,中位數網站因為嵌入第三方影片,主執行緒被封鎖的時間超過 1.7 秒。主執行緒被長時間占用,會直接影響與下一個繪製互動(INP,Interaction to Next Paint)這項使用者體驗指標,使用者點了按鈕或切了頁籤之後,畫面回應會變得明顯遲鈍。

要避免這個成本,做法不是乾脆不放影片,而是把載入時機延後。先給一張輕量的 poster 縮圖,搭配 Intersection Observer 或原生的 loading=lazy,讓影片真正進入使用者的可視範圍才開始下載,而不是頁面一開就默默把整支影片的流量吃光。
自動播放沒換到注意力,換到的是靜音與暫停鍵
「首頁放一支會自動播放的影片,比較能抓住使用者注意力」是另一個常見的迷思,而研究觀察到的第一反應剛好相反。Nielsen Norman Group 的研究指出,使用者到達一個網頁時,並不樂見自己在毫無預期、也沒同意的情況下,被自動播放的影片或聲音打斷;當影片自動開始播放,多數使用者的第一個直覺動作,不是停下來看,而是找靜音鍵或暫停鍵。
這不只是使用者的個人習慣問題,而是被寫進國際網頁無障礙標準裡的明文規定。W3C 的 WCAG(Web Content Accessibility Guidelines)2.2.2「Pause, Stop, Hide」這項準則(Level A,WCAG 2.1 與 2.2 都適用)要求,任何自動開始播放、持續超過 5 秒、又與頁面其他內容並存的動態或閃爍內容,除非這個動態本身是任務裡不可或缺的一部分,否則都必須提供使用者暫停、停止或隱藏的機制;自動更新的內容也適用同一條規定。等於是把自動播放的動態內容對使用者是一種干擾這件事,寫進了國際規範,而不是留給網站設計者自由心證的美學選擇。
還有一層落差經常被忽略。使用者點進一個連結時,心裡預期看到的通常是文字與圖片組成的頁面,不是一支影片,尤其不是一支還沒點擊播放鍵就自己動起來的影片。這種預期的落差,會讓使用者對頁面的第一印象從「這裡有我要的資訊」變成「這裡有東西在打擾我」,不管影片內容本身做得多用心,光是這個開場就先扣了分。
影片的維護速度跟不上搜尋引擎、AI 的判讀需求
把時間拉長來看,文字與影片在維護這件事上的差距更明顯。文字改一個字、調整一段順序,幾乎是即時的;影片只要有一句話講錯、一個數字過時,往往得重新剪輯、重新配音、重新上傳,成本跟時間都不成比例。GOV.UK 的規範直接把這一點寫成影片的正式缺點,影片比文字更難更新,內容一旦過時,很容易變成網站上一支持續存在、卻早已不準確的舊資訊。
還有一件事更需要留意,純影片格式對搜尋引擎與 AI 摘要工具天生不友善。搜尋引擎與 AI 助理讀取網頁時,主要依賴的還是文字內容;一支沒有逐字稿、沒有字幕的影片,機器只能靠檔案名稱、標題這類有限的中繼資料去猜測畫面裡在講什麼,幾乎沒辦法真正理解影片裡的實質內容。這代表如果一頁重要資訊只用影片呈現,不只使用者可能因為不想看而錯過,搜尋引擎與 AI 助理也同樣讀不到。
解法其實不難,替影片準備逐字稿或字幕。GOV.UK 把逐字稿的作用寫得很明確,一份逐字稿同時做兩件事,讓使用者可以用掃讀或標註的方式取得內容,不必重播整支影片才找得到某句話;也讓搜尋引擎與 AI 助理能夠透過逐字稿裡的文字,找到並理解影片裡的內容。換句話說,逐字稿把影片重新變成一份機器讀得懂、也能被引用的文字資產。
字幕的需求也不像多數人以為的那樣小眾。Nielsen Norman Group 觀察自家教學影片頻道的數據發現,有 26% 的觀看是打開字幕看的,遠遠超出聽障使用者這個族群的比例,說明看字幕早就是一個廣泛存在的使用習慣,不是可有可無的無障礙加分項。
示範和複雜陌生的任務讓影片真正贏過文字
前面幾段一直在講文字在資訊查找型任務裡的優勢,但這不代表影片一無是處。當任務換成示範一個動作該怎麼做,或是解釋一個使用者完全陌生、步驟又多又長的流程,影片反而是效率更高的媒介,這一點必須老實承認,不是各打五十大板了事。
Nielsen Norman Group 針對教學型內容做過一項實測研究,找來 8 位受測者觀察他們面對圖文教學與教學影片時的實際選擇,整理出三種行為模式:只讀文字就完成任務、先略讀文字再回頭看影片、或是一開始就直接跳去看影片。研究發現,當內容描述的是一個長、多步驟的流程,或是主題本身陌生又複雜,使用者更容易在某個時間點轉向影片;而且隨著閱讀文字所需的心力增加,影片的吸引力也跟著上升。就連本來偏好文字的使用者,一旦被文字說明搞得一頭霧水,也會把影片當成最後手段。
這個現象背後有個很直覺的原因,有些內容真的很難只靠文字講清楚。一塊布怎麼垂墜、一個繩結怎麼打、一台機器操作起來的手感是什麼,這類牽涉到動作、節奏、觸感的內容,用文字轉述天生就吃虧,使用者讀著讀著容易失去耐性,而看一遍影片示範,往往比讀三段文字說明還快理解。這正是影片這種媒介真正該被用在的地方,不是拿來裝飾頁面,而是拿來處理文字轉述不了的內容。
決定的關鍵是任務本身,不是媒介的天生優劣
這麼看下來,「影片比較好」或「文字比較好」本身就是一個假問題。真正該問的,不是哪種媒介天生比較強,而是這個頁面在幫使用者完成什麼任務,資訊查找型任務,文字通常更快、更好掃讀;示範或陌生複雜型任務,影片通常更有效率。判斷任務屬於哪一種,決定了這個頁面該優先用哪種媒介呈現。

Nielsen Norman Group 對這個議題的收束立場也呼應這個判斷邏輯:影片內容真正有幫助,前提是使用者能控制它、理解裡面在講什麼,而且有另一種方式可以取得同樣的資訊。換句話說,影片該是補充或替代的其中一個選項,不該是取得資訊的唯一管道。
先問這個頁面解決的是資訊型任務還是示範型任務
把任務類型當成規劃頁面時第一個要回答的問題。使用者打開這個頁面,是想在幾秒鐘內確認一件事,像是這項服務多少錢、這個功能有沒有支援某個情境,還是想學會一個他從沒做過的動作或流程,像是操作一台設備、組裝一個物件?前者屬於資訊查找型任務,文字通常比影片更快讓使用者拿到答案;後者屬於示範或陌生複雜型任務,影片的優勢才真正發揮出來。
這個判斷不是憑感覺,而是有前一節整理的研究發現當依據:任務越長、步驟越多、主題對使用者越陌生,使用者就越可能轉向影片;反過來,任務單純、答案簡短明確,文字的掃讀優勢就壓過影片的循序播放。規劃一個新頁面之前,先老實回答這個問題,比先決定要不要拍一支影片更重要。
真的要放影片,文字備援比拍片本身更重要
如果判斷下來這個頁面真的適合放影片,接下來真正重要的不是把影片拍得更好看,而是有沒有把文字備援準備好。前面提到的兩份規範不約而同指向同一個做法。影片裡的關鍵資訊,同時要有一份文字版本存在於頁面上,而且是使用者不用播放影片就看得到的文字,不是聊備一格塞在角落的一行小字。
逐字稿是這份文字備援最基本的形式,它讓不想看、看不到,或是搜尋引擎與 AI 助理讀不到影片內容的使用者,都還能拿到同一份資訊。把這件事做好,比影片本身剪得多精緻更影響這支影片實際發揮的效果,因為再好看的影片,只要少了這份文字備援,就等於把一群原本可以觸及的使用者關在門外。
下次規劃頁面前,與其先問要不要放影片,不如先問使用者打開這頁是想確認一件事,還是想學會一件事。答案是前者,把力氣放在把文字寫清楚、掃讀友善;答案是後者,影片才真正派得上用場,而且別忘了同時留一份看得到的文字內容。媒介本身沒有天生的優劣,選對的關鍵,一直都是任務本身。
