SEO優化

Lighthouse 一定要衝到 100 分嗎?CrUX 數據才是關鍵

HTTP Archive 在 2024 年針對全球數百萬個網站做的統計顯示,WordPress 網站行動版的 Lighthouse 效能分數,中位數只有 38 分,連及格邊緣的 50 分都摸不到。可是打開任何一份網站健檢報告、任何一次外包驗收會議,衝著要求的往往不是「達到及格」,而是「拿到 100 分」,一個絕大多數網站連遠遠夠不到的數字。

問題不在要不要在乎網站速度,網站速度確實重要。問題在於,把 Lighthouse 或 PageSpeed 報告上那個 0 到 100 的整數,直接當成該追的目標。這個數字怎麼算出來、它跟使用者實際感受差多遠、它跟 Google 排名之間又是什麼關係,喊著要衝到 100 分的人,很多其實沒真的搞懂。

先從這個 100 分執念怎麼養成講起,再一路拆開它跟真實體驗、跟搜尋排名之間,實際上還剩多少關係。

衝滿分成為多數網站到不了的交付驗收指標

這顆滿分執念不是憑空冒出來的。網站開發流程裡,Lighthouse/PageSpeed Insights 因為免費、隨時可以自己測、又用單一數字呈現結果,很容易被套進驗收合約裡當成一條硬指標。網頁做完要附一張分數截圖,效能欄位低於某個門檻就算沒過關。對發案的一方來說,這個數字看起來客觀,也好比較;對接案的一方來說,這個數字明確,不用爭辯「快不快」這種主觀感受。於是「Lighthouse 100 分」就從一個技術參考值,變成合約裡白紙黑字的驗收條件。

問題是,這個目標訂在一個絕大多數網站都到不了的水準。HTTP Archive 每年做的《Web Almanac》調查,涵蓋數百萬個真實網站,2024 年的統計顯示,WordPress 網站在桌面版的 Lighthouse 效能分數中位數是 61 分,行動版只剩 38 分。換句話說,一半以上的 WordPress 網站,行動版分數連 40 分都不到。這還只是中位數,代表的是普遍水準,不是特別差的極端案例。當多數同業都落在 30 幾到 60 幾分之間,卻要求某個網站非得衝到 100 分不可,這中間的落差本身就值得先停下來想一想。

網站速度確實重要,也確實影響使用者體驗與商業指標,這件事後面會用數據說明。問題不在速度重不重要,而在於把 100 這個整數本身當成終點,跟把「使用者體驗變快」當成終點,其實是兩件不同的事,而多數人在喊著要衝分數的時候,把這兩件事混成了一件。

Lighthouse 分數其實是一條相對曲線,不是一把絕對量尺

要理解為什麼 100 分這麼難拿、也這麼不值得死磕,得先弄清楚這個分數是怎麼算出來的。多數人以為 Lighthouse 分數是把網頁的載入毫秒數直接換算成百分比,愈快分數愈高,呈固定比例往上加。實際的計算方式完全不是這樣。Google 官方文件說明,Lighthouse 效能分數是把每一項指標的毫秒數值,代入一條依照 HTTP Archive 真實網站數據建構出來的對數常態分布曲線換算而來的相對名次,不是網頁客觀有多快的直接讀數。

這條曲線的關鍵在於它的形狀。分數愈高,曲線愈往外拉開,同樣是進步一分,在低分區只要一點點毫秒改善就能拿到,在高分區卻要付出愈來愈多實際的載入時間縮短才換得到。這也是為什麼不少團隊卡在 90 幾分卻怎麼優化都上不去,不是優化沒做對,是曲線本身在那個區間本來就要求更多。

第 25 與第 8 百分位,定出了 50 分與 90 分兩個控制點

這條曲線用兩個控制點固定形狀。同一份文件寫得很明確,HTTP Archive 真實網站數據裡,第 25 百分位的網站表現,對應到的分數是 50 分,也就是這條曲線的中位數控制點;第 8 百分位的網站表現,對應到的分數是 90 分,也就是優良或綠色門檻的控制點。換句話說,能拿到 90 分,代表這個網頁的實際載入速度,已經打贏全球網站裡大約 92%的對手,不是普通及格邊緣的水準。

文件也舉了一個具體例子讓這件事更好理解,目前表現最好的一批網站,最大內容繪製時間(LCP)大約落在 1,220 毫秒,換算出來的分數是 99 分,不是滿分 100 分。這個例子很值得停下來想一下,連全球排名前段班的網站,速度都快到 1.2 秒左右了,換算出來還是差一分。這說明 100 分在這條曲線裡,是一個刻意留在極端值之外的理論上限,不是速度夠好就自然會拿到的正常結果。文件也說明,在 0.50 到 0.92 分這個區間,大致對應 50 到 92 分,指標數值與分數大致呈線性關係,也就是這段區間的進步速度符合直覺,問題出在超過這個區間之後。

從 99 分衝到 100 分的成本相當於從 90 分衝到 94 分

這條曲線最有力的一段證據,出現在分數逼近滿分的區間。同一份文件明講,邊際效益遞減的轉折點大約落在 0.96,也就是 96 分左右,過了這個點,曲線急遽拉開,繼續往上衝需要的指標改善量,遠遠超過線性比例。文件給了一個具體到讓人愣一下的對照,把分數從 99 分推到 100 分,所需要的指標改善幅度,大約等同於把一個 90 分的網站,一路推進到 94 分。

也就是說,衝那最後 1 分的工程量,跟把一個原本普通偏優的網站,往上拉整整 4 分是同一個等級。如果一個團隊已經站在 99 分,還在為了那 1 分繼續調整,付出的工程成本,其實跟從頭把一個 90 分網站優化到 94 分差不多重,差別只是後者聽起來像明顯的進步,前者聽起來像還差臨門一腳,但曲線告訴我們,這兩件事付出的代價其實相當。愈接近滿分,代價愈不成比例,這不是哪個網站特別難優化,是曲線本身的設計就決定了這件事。

Lighthouse 分數對載入表現的對數常態曲線,低分區一點改善就加分,愈近 100 分曲線愈平,把 99 分推到 100 分的工程量約等於把 90 分推到 94 分。
分數愈近滿分、曲線愈平:表現最好的網站 LCP 約 1,220 毫秒也只拿到 99 分,最後 1 分要用不成比例的代價換。(資料來源:Google)

清空快取、固定網速測出的分數,套不進真實使用者的手機

Lighthouse 或 PageSpeed 上半部顯示的那個分數,測量條件其實跟一般人平常用手機瀏覽網站的情境有明顯落差。它是單一次的模擬測試,固定的網路節流設定,模擬一個特定速度的行動網路;固定的裝置運算效能;而且每一次測試前,快取都會被清空重來。這種資料在業界叫實驗室數據,好處是條件固定、可以重複測、方便比較改版前後的差異,缺點是它模擬的是一個最不利的假設情境,不是任何一個真實使用者當下真正遇到的狀況。

真正決定使用者實際感受、也是 Google 排名機制實際參照的,是另一套完全不同的資料,Chrome 使用者體驗報告(CrUX)彙整的欄位數據。這份資料來自真實的 Chrome 使用者、真實的裝置、真實的網路環境,而且大部分使用者的瀏覽器裡本來就有快取可以用,不是每次都從零載入;取樣視窗是過去 28 天的滾動資料,反映的是這段時間裡大量真實訪客實際感受到的速度。

這兩套資料用的根本是不同的量測邏輯,一套是實驗室裡的固定劇本,一套是真實世界的滾動彙整。分數對不上,很多時候不是哪一邊測錯了,而是兩者本來就沒有必要對得上。一個網站的 Lighthouse 實驗室分數卡在 85 分,CrUX 欄位數據卻顯示大多數真實使用者體驗良好,這種落差完全合理,因為真實使用者裝置效能可能比模擬測試設定的更好,也有快取可用。

實驗室數據是 Lighthouse/PageSpeed 的單次模擬測試分數,真實欄位數據是 CrUX 真實使用者資料,決定排名與體感的是後者。
決定排名與體感的不是實驗室分數,而是 CrUX 真實使用者的欄位數據;兩套系統邏輯不同,分數對不上很正常。

Google 排名依據是三項真實使用者指標而非 PageSpeed 分數

上一節講的兩套資料,直接牽動讀者最在意的一件事,這顆分數跟 SEO 排名有沒有關係。Google 官方文件《Understanding page experience in Google Search results》把這件事講得很清楚,頁面體驗只是搜尋排名眾多訊號組合裡的其中一個,內容跟搜尋意圖的相關性,優先於頁面體驗。文件原文寫著,即使頁面體驗不夠理想,Google 搜尋仍然會優先呈現跟使用者查詢最相關的內容。

真正被納入排名考量的,是 Core Web Vitals 三項指標的真實使用者資料,也就是上一節提到的 CrUX 欄位數據,門檻判定看的是 75 百分位的真實使用者體驗,例如 LCP 以 2.5 秒以內判定為良好,超過 4 秒判定為不佳。這是一套三級制,良好、需改善、不佳的分類系統,跟 Lighthouse 或 PageSpeed 呈現的 0 到 100 分完全是兩套不同的機制。分數高不代表 CrUX 三項指標一定都落在良好等級,反過來,CrUX 三項指標都良好,Lighthouse 實驗室分數也不一定會是 100 分。

這代表拿著一份 Lighthouse 滿分報告去說服自己 SEO 排名應該會變好,其實從一開始就問錯了問題。該確認的不是那個 0 到 100 的整數,而是 Search Console 或其他能讀到 CrUX 資料的工具裡,LCP、互動到下一次繪製(INP)、累計版面配置位移(CLS)這三項指標,是不是都已經落在良好等級。分數好看,跟真正被排名系統納入計算的資料,兩者根本是不同的東西。

0.1 秒、1 秒、10 秒,人類感知本身也有極限

就算完全不管排名,繼續往上衝分數這件事,能不能被使用者感覺到,本身也有一個天花板。國際使用者體驗研究裡,公認的三個反應時間門檻,來自 Jakob Nielsen 在 1993 年出版的著作,這幾個數字根據的是更早數十年的人因工程研究,Nielsen 自己也提到,這幾個門檻三十年來大致沒有改變。

第一個門檻是 0.1 秒,這是讓使用者覺得系統立即做出反應的極限,在這個時間內完成,使用者會感覺這是自己造成的動作,不需要額外提示。第二個門檻是 1 秒,這是使用者思路能維持不中斷的極限,超過這個時間使用者會察覺到延遲,但只要在 1 秒之內,注意力還不會被打斷。第三個門檻是 10 秒,這是使用者注意力還能維持在同一個畫面上的極限,超過就會開始分心去做別的事,這也是為什麼超過 10 秒的操作通常需要一個進度指示器,讓使用者安心系統沒有當機。

這三個門檻已經存在超過三十年,至今沒有改變,代表的是人類感知本身的物理極限,不會因為網速變快或裝置變強就跟著往下修。當一個網頁的關鍵內容已經落在 1 秒到 2 秒之間顯示出來,使用者的思路根本沒被打斷;再往下省的每一毫秒,多數人已經感覺不出差異。這時候繼續衝分數,優化的是一個沒有人真的感覺得到的數字,不是使用者體驗本身。

轉換率呼應的是等待秒數而非那顆分數

速度確實會影響營收,這件事有紮實的證據,值得認真看待。但真正被證實跟轉換率、營收掛勾的,是使用者實際等待的秒數縮短了多少,不是 Lighthouse 報告上多了幾分。這兩件事聽起來很像,因果鏈其實不一樣。如果從 99 分衝到 100 分背後,實際省下的載入時間微乎其微,前面的對數曲線那節已經說明過,這條分數上升帶動轉換率上升的因果鏈,從一開始就接不起來。真正成立的因果關係,前提是那 0.1 秒真的讓使用者少等了 0.1 秒真實時間。

這方面最紮實的證據,來自 Google 委託執行的一份大型研究。這份研究由 Google 委託數據顧問公司 Fifty-Five 與 Deloitte 共同執行,涵蓋 37 個歐美品牌網站、超過 3,000 萬個使用者工作階段的數據,在 2019 年底針對行動裝置的載入時間做了為期 4 週的監測。研究證實,即使是 0.1 秒等級的載入時間改善,都能反映在轉換率與消費支出上,但這個效益的計算基礎,是行動裝置上真實測到的載入毫秒數,不是任何一份效能報告上顯示的分數。

零售、旅遊、名單開發,0.1 秒帶來的轉換增幅不一樣

這份研究把不同產業實際測到的數字攤開來看。零售業的網站,0.1 秒的載入時間改善,對應轉換率增加 8.4%、消費支出增加 9.2%;旅遊業的網站,對應轉換率增加 10.1%、訂單金額增加 1.9%;名單開發類型的網站,0.1 秒的改善對應從表單第一步到提交頁的完成率增加 21.6%。

載入時間改善 0.1 秒,零售轉換率增加 8.4%、旅遊增加 10.1%、名單開發表單完成率增加 21.6%,效益掛在真實秒數而非分數。
行動裝置載入時間每快 0.1 秒,各產業的轉換都明顯提升;掛勾的是真實秒數,不是報告上的分數。(資料來源:Google、Fifty-Five、Deloitte)

這幾個數字之所以值得拿出來對照,是因為它們讓秒數帶來的效益變成一個真實可觀察、有明確量級的東西,0.1 秒對上幾個百分點的轉換率,這條因果鏈是清楚的。相比之下,沒有任何公開研究能證明 Lighthouse 分數每漲 1 分,轉換率漲多少,因為分數本來就不是拿真實秒數線性換算出來的,兩者之間根本沒有這種對應關係可以測。真正該盯著看的,是使用者實際等待的秒數有沒有縮短,不是報告上那個整數往上跳了幾格。

商品圖被壓出色塊、客服外掛被拔掉,只為了多那一分

把最後幾分擠出來要付出什麼代價,答案往往不是免費的。常見的做法是,把商品圖片壓縮到肉眼可見出現色塊或模糊,只為了讓圖片體積小一點,換取效能分數多一兩分;或是把客服對話外掛、即時通訊工具整個從網站上移除,因為第三方 JavaScript 會拖慢載入速度、壓低分數;也有網站選擇把分析追蹤工具拔掉,或延後到頁面載入完成後才啟動,讓分數好看一點,代價是決策需要的數據完整度變差。

這幾種取捨的共通點是,分數與真實效益開始脫鉤之後,繼續往上衝的成本不是用金錢計算的,而是轉嫁到別的地方,畫質犧牲掉了,功能被拿掉了,決策所需要的資料也變得不完整。商品圖壓出色塊,消費者看到的是模糊的產品照,可能反而降低購買意願;拔掉客服工具,少的是即時解決問題的管道;分析工具延後啟動,少的是判斷網站哪裡出問題的依據。這些代價值不值得,要放回前面幾節建立的兩個判準來看,使用者真的感覺得到那多出來的一兩分嗎,Google 排名真的會因為這一兩分而不同嗎。如果你手上的網站正在為了衝分數考慮這幾種取捨,這兩個問題的答案,才是真正該先想清楚的事。

分數是拿來診斷問題的工具而非衝到底的終點

前面拆開了這麼多層,最後要給的不是一句抽象的別太執著,而是三個具體、可以直接拿來對照的判準,三者同時成立,才是該停手的訊號。

第一個判準是 Core Web Vitals 三項指標,LCP、INP、CLS,是不是都已經落在真實使用者數據裡的良好等級,不是實驗室分數好看,而是 Search Console 或其他能讀到 CrUX 欄位數據的工具顯示過關。第二個判準是真實使用者體驗確實過關,而不只是那次模擬測試跑出來的分數漂亮。這兩個判準呼應的是前面講過的核心分野,決定排名與體感的是欄位數據,不是實驗室分數,所以判斷該不該收手,也該用同一套資料。

第三個判準是成本,繼續往上優化的下一步,是不是已經需要犧牲畫質、拔掉功能,或是讓決策資料變得不完整才換得到。如果前兩個判準都已經過關,第三個判準又顯示繼續優化要付出這種代價,這三件事同時成立,就代表已經越過了投入產出還划算的那個點。分數在這裡的正確定位,是一個拿來診斷問題、找出真正拖慢使用者體驗那個瓶頸的工具,不是一個要一路優化到底、非衝滿分不可的終點指標。

判斷該不該停止優化的三個判準:三項指標在真實數據良好、真實體驗過關、再往上優化要犧牲畫質或功能,三者同時成立才收手。
三個判準同時成立,才是該收手的訊號:真實指標良好、真實體驗過關,而且再優化的代價已開始傷到畫質或功能。

回到最開頭那個 38 分。多數網站到不了 100 分,不是因為它們做得不夠好,是因為這條曲線本來就把最後那幾分,設計成要用不成比例的代價才換得到。把 100 分當成驗收標準,問的其實是一個問錯方向的問題;真正該問的,是使用者打開這個網站,感覺得到差異嗎,Google 排在前面的判準,看的是這個嗎。想清楚這兩個問題的答案,比盯著報告上那個整數,更接近網站速度這件事原本該解決的問題。

常見問答

本區問答由 AI 依文章內容自動整理,僅供快速參考,正式內容仍以全文為準。

Lighthouse 分數是怎麼計算出來的?

Lighthouse 效能分數不是把載入毫秒數直接換算成百分比,而是依照 HTTP Archive 真實網站數據建構的對數常態分布曲線換算出的相對名次;分數愈高曲線愈平緩,同一分的進步,在高分區要付出的實際載入時間縮短遠比低分區多。

為什麼 Lighthouse 很難衝到 100 分?

因為 100 分是曲線設計上刻意留在極端值之外的理論上限,連目前表現最好、最大內容繪製時間約 1,220 毫秒的網站,換算出來也只有 99 分;愈接近滿分曲線愈平,最後那 1 分需要付出的改善幅度遠遠超過線性比例。

Lighthouse 分數跟排名有直接關係嗎?

沒有直接對應關係。Google 排名參照的是 Core Web Vitals 三項指標的真實使用者資料(CrUX 欄位數據),跟 Lighthouse 呈現的 0 到 100 分是完全不同的兩套機制,分數高不代表這三項指標都落在良好等級。

網站載入速度變快,轉換率一定會提升嗎?

提升的前提是使用者實際等待秒數真的縮短,不是報告分數變高。研究顯示行動裝置載入時間每改善 0.1 秒,零售業轉換率可增加 8.4%、旅遊業增加 10.1%,效益掛勾的是真實秒數,不是 Lighthouse 分數本身的漲跌。

為了衝高效能分數,最常見的代價是什麼?

常見做法是把商品圖片壓到出現色塊或模糊、拔掉客服對話外掛或即時通訊工具,或延後分析追蹤工具啟動的時機,換取分數多一兩分;代價是畫質變差、功能被拿掉,或決策所需的數據變得不完整。

資料來源
  1. 2024 Web Almanac - CMS — HTTP Archive
  2. Lighthouse performance scoring — Google
  3. Understanding page experience in Google Search results — Google
  4. Response Time Limits: Article by Jakob Nielsen — Nielsen Norman Group
  5. Milliseconds Make Millions — Google、Fifty-Five、Deloitte