電話那頭傳來的聲音,語調、咬字甚至清喉嚨的小動作,都跟公司主管一模一樣,只是這通電話臨時交代的事有點反常,要求立刻匯出一筆款項,還交代先別跟其他同事提起。財務人員當下沒有起疑,聲音聽起來完全對得上,直到事後回想才驚覺,那場視訊會議裡其實沒有一個真人在講話,畫面與聲音全部由 AI 合成。
這類手法有個名字,叫深偽詐騙(deepfake fraud),指的是詐騙集團只要幾秒鐘的語音樣本,就能用 AI 技術複製出幾乎以假亂真的聲音或影像,冒充你認識的人來行騙。這兩年,這種手法已經從國外零星幾則新聞,變成任何企業、任何家庭都可能撞上的日常風險。美國聯邦調查局旗下的網路犯罪申報中心 IC3,在 2025 年度報告裡首度把 AI 相關詐騙獨立列成一個類別,光是這一類案件就有 22,364 件申報,損失金額將近 8.93 億美元。
接下來會先用具體的統計數字,校準這個風險有多大,再拆解詐騙集團最常用的下手方式,最後看市面上的偵測工具是否真的靠得住。

深偽語音詐騙的統計數字,從哪裡來?
這篇引用的數字分成兩條線索。國際的部分,來自美國聯邦調查局旗下的網路犯罪申報中心 IC3 年度報告、資安公司 McAfee 與 Pindrop 各自發布的語音詐騙調查、市場研究機構 Gartner 對身分驗證產業的預測,以及 Signicat、iProov、Sumsub 這幾家專門研究身分詐騙的機構。台灣的部分,則參考內政部警政署「165 打詐儀表板」的正式統計,不過要先說清楚,這份統計涵蓋的是全部詐騙類型的報案數字,目前還沒有針對深偽語音詐騙獨立拆出來的台灣本地數字。
也就是說,台灣有多少人真的因為深偽語音受騙,目前還沒有一個專屬的量化答案,這篇因此得靠國際數據,搭配台灣整體詐騙脈絡一起拼出全貌。
深偽語音詐騙這兩年暴增,成長速度遠超過想像
身分驗證廠商 Signicat 的研究顯示,深偽詐騙占整體詐騙案件的比重,三年內從 0.1%衝到 6.5%,足足成長了 2,137%。另一家做詐騙偵測的 Sumsub 也觀察到,深偽詐騙目前占全球詐騙活動約 11%,北美地區光是 2025 年初就一年成長 1,100%。這兩組數字放在一起看,講的其實是同一件事,深偽語音跟深偽影像,早就從詐騙集團的邊緣工具,變成主流手法之一。
這股趨勢在客服中心感受最直接。資安公司 Pindrop 分析超過 12 億通客服電話後發現,2024 年一整年,企業客服中心遭遇的深偽詐騙嘗試,從原本平均每個月 1 次,暴增到幾乎每天 7 次,年增幅超過 1,300%。若拆開產業別來看,保險業遭遇的深偽語音攻擊成長 475%,銀行業也成長 149%,兩個原本仰賴電話客服處理高風險交易的產業,正好是攻擊集中的地方。
金錢損失的部分,前面提到的 IC3 在 2025 年度報告首度把 AI 相關詐騙獨立列成一類,申報案件達 22,364 件,損失金額將近 8.93 億美元,而且這個數字只計入申報人自己主動提到 AI 的案件,實際規模很可能被低估。資安公司 Mandiant 在 2026 年的 M-Trends 報告裡也指出,語音詐騙是 2025 年入侵企業系統的第二常見管道,若只看雲端環境的入侵,語音詐騙甚至是最常見的管道,占比達 23%。
作為對照,內政部警政署「165 打詐儀表板」的正式統計顯示,台灣 2026 年 1 至 4 月,單是全部類型詐騙的受理報案就有 50,217 件,財產損失金額約新台幣 215.34 億元。這還只是全部詐騙類型的總和,深偽語音手法正快速滲透進來,這塊拼圖只會越補越大。

這幾組數字合起來看,深偽語音詐騙不是零星個案,而是全面性、跨產業的攻擊手法,而且成長速度比多數企業的防備速度快得多。這已經不是「會不會遇到」的機率問題,而是「什麼時候遇到」的時間問題。了解規模有多大之後,更重要的是弄清楚詐騙集團實際上是怎麼下手的。
深偽語音詐騙,最常見的四種下手方式
綜合國際資安機構觀察到的攻擊模式,深偽語音詐騙目前最常出現的下手方式可以歸類成四種,從鎖定對象、蒐集語音樣本,到合成聲音再撥打詐騙電話,是同一套攻擊生命週期的不同應用場景。每一種手法的技術門檻都不高,真正設計精巧的地方在於怎麼利用心理弱點,讓你來不及細想就先做出反應。

手法一:只要 3 秒錄音,就能複製一個人的聲音
詐騙集團要取得一個人的聲音樣本,管道比想像中容易,社群平台上的短影音、語音訊息、公開演講錄影,甚至一段播客訪談,都足夠當作原始素材。資安公司 McAfee 的調查發現,只要 3 秒鐘的清晰錄音,AI 語音複製工具就能合成出跟本人相似度約 85%的聲音,如果能取得更多樣本,相似度還能拉高到 95%。
複製出聲音之後,詐騙集團通常會搭配文字轉語音或即時變聲引擎,現場把打字內容念出來,或是即時把自己的聲音轉換成目標對象的聲線,再配合偽造來電顯示,讓受害者一接起電話,畫面上顯示的名字、耳朵聽到的聲音全部對得上。技術門檻低到這個地步,代表任何在網路上留下過語音或影像的人,理論上都可能成為被複製的對象,這也是後面幾種手法都能成立的技術前提。
手法二:假冒老闆或財務主管,緊急要求匯款
這種手法鎖定的對象,通常是財務人員或握有匯款權限的員工,出手的時間點也經過設計,下班後、主管人不在辦公室、沒辦法當面確認的時段最容易得手。話術會同時疊加三種心理壓力:權威(冒充老闆或主管的口吻下指令)、緊急(要求一小時內處理完畢)、保密(交代先別跟其他同事講)。三種壓力疊在一起,受害者很容易來不及細想就照做。
2024 年,跨國工程顧問公司 Arup 在香港的分公司就發生過整套手法的極端版本,一名財務人員被邀請加入一場視訊會議,畫面上出現的財務長與好幾位高階主管,看起來、聽起來都跟本人一模一樣,會議中指示分批匯款,他前後依指示完成 15 筆轉帳,總計匯出約 2,560 萬美元,事後才發現整場會議裡沒有一個是真人。更早之前,2019 年英國一家能源公司的負責人,也接到一通自稱德國母公司高層的語音電話,指示把一筆款項匯給匈牙利的供應商,電話裡的聲音跟真正的高層幾乎無法分辨,最後損失約 24.3 萬美元。
手法三:假冒家人朋友的緊急求救電話
如果說前一種手法瞄準的是企業,這一種瞄準的就是一般家庭,尤其是長輩。詐騙集團會從長輩的孩子平常在社群平台上傳的影片、語音留言裡取得聲音樣本,接著假冒晚輩打電話回家,聲稱自己出車禍、被警方拘留,或是急需一筆醫藥費,利用長輩擔心孩子出事的直覺反應,讓人來不及冷靜查證就先掏錢。通話安全業者 Hiya 針對美國、加拿大、英國、德國、法國、西班牙六國消費者的調查發現,超過三分之一的受訪者曾接過深偽語音詐騙電話,其中超過三成的目標對象最後真的因此被騙走金錢。
這種手法真正厲害的地方,不是受害者特別容易上當,而是深偽聲音拿掉了一般人判斷真假最後依賴的那道防線——聽聲音辨人。當你沒辦法再靠「這聲音聽起來不對」來提醒自己,剩下能依靠的,就只剩查證的習慣。
手法四:假冒銀行客服,來電驗證身分
銀行客服本來就是你偶爾會接到的正常來電,這也是詐騙集團鎖定的破口。他們通常先透過外流的個資,取得你部分的帳戶資訊,像是姓名、身分證字號後幾碼,或是最近一筆交易金額,讓接下來的這通電話聽起來更有可信度。電話裡的深偽語音會假冒銀行或金融機構客服,以帳戶異常、需要驗證身分為理由,引導你說出一次性驗證碼,或是照指示完成一筆轉帳,有時還會搭配一則時間點幾乎同步的簡訊,讓手機畫面與電話內容互相呼應,更難讓人起疑。
前面提到銀行業遭遇的深偽語音攻擊成長 149%、保險業成長 475%,具體樣貌大多就是這種冒充客服的場景,這類金融機構本來就是高價值目標,詐騙集團投入的資源與話術設計,通常也比其他三種手法更細膩。
市面上的偵測工具,真的辨識得出深偽語音嗎?
先說結論,光靠耳朵,你幾乎分辨不出來。行動身分驗證廠商 iProov 在 2025 年的一項研究裡,讓受測者判斷一系列深偽圖像與影片的真假,結果只有 0.1%的人能把每一段樣本都判斷正確,面對畫質較高的深偽影片,平均辨識率更只有 24.5%。連看得到畫面都分辨不出來,光靠聽聲音當然更難。McAfee 的調查則直接針對聲音,高達 70%的受訪者坦言,自己沒有把握分辨複製出來的聲音跟本人的真實聲音。人耳原本仰賴的語氣、節奏、口音這些線索,在夠好的深偽技術面前,幾乎完全派不上用場。
技術廠商當然也在研發對策。目前主流的商用偵測工具,原理大致是分析聲音的停頓模式、頻譜特徵、背景噪音的一致性,判斷一段語音是不是由 AI 合成。真人說話時,呼吸、口誤、環境噪音會自然出現細微變化,合成語音則容易在這些地方露出破綻,比如講到數字或人名前出現不自然的停頓,或是背景乾淨到不像真實通話環境。

問題是,這些偵測工具的準確率,在乾淨的錄音室級音質下可以做到很高,一旦聲音經過電話訊號壓縮,或是詐騙集團換了一套還沒被收錄進訓練資料的新合成技術,準確率就會明顯下滑。市場研究機構 Gartner 預測,到 2026 年,將有 30%的企業不再單靠身分驗證或生物辨識來判斷來電者是不是本人,原因就是深偽技術已經讓這類工具的可靠性打了折扣;Gartner 同時觀察到,2023 年繞過鏡頭與麥克風、直接對系統輸入偽造訊號的注入式攻擊(injection attack),成長幅度高達 200%。偵測技術與詐騙技術,等於是在打一場持續進行的軍備競賽,偵測方每提升一次準確率,詐騙集團就想辦法換一套新技術繞過去。
這也是為什麼,不管是企業採購的偵測系統,還是你自己豎起耳朵聽,都只能當成一個輔助訊號,不能當成唯一的防線。真正靠得住的,是不管聲音聽起來多像本人、多緊急,都先養成停下來查證的習慣,而這正是下一節要具體拆解的內容。
接到疑似深偽語音的來電,該怎麼查證?
靠耳朵聽,你多半分辨不出來,但有幾個線索,再加上一套固定的查證習慣,幾乎能擋下大多數深偽語音詐騙。
先看聲音與情境本身透露的警訊:
- 講到數字或人名前,出現不自然的短暫停頓,像是合成引擎正在即時運算
- 語調異常平板,少了真人說話該有的情緒起伏與呼吸聲
- 情緒跟情境明顯對不上,比如要求你立刻匯出一大筆款項,語氣卻毫無急迫感
- 背景音乾淨到不像真實通話環境,少了一般電話該有的環境雜音
除了聲音本身,對方提出的要求也常常自帶警訊。只要出現下面任何一種,幾乎可以直接判斷這通電話有問題:
- 要求你先別跟其他人講這件事
- 要求換到另一個通訊軟體繼續講
- 強調必須立刻行動,不能等
- 你想掛電話回撥查證時,對方會阻止或極力勸阻
最有效的查證方式,其實不靠聽力,靠的是固定動作。掛斷電話之後,改用你自己原本存在通訊錄裡的號碼回撥,不要使用對方來電或訊息裡附上的號碼,因為那個號碼本身也可能是偽造的。家人或熟識的同事之間,也可以先約定一句平常不會公開講、網路上查不到的通關密語,對方答不出來,就先停下來,不急著繼續配合。
如果你是握有匯款或帳戶變更權限的財務人員,更該把這條規則內化成公司政策,任何一次匯款或帳戶資訊變更,都必須透過第二個獨立管道確認,比如電話指示之後,還要有書面紀錄或內部系統的覆核,而且這條規定不因為對方自稱是老闆或主管就破例。事實上,對方語氣越急、越強調不能等,越應該先停下來,走完這一套查證流程再說。

眼見不再為憑,耳聽現在也一樣靠不住。面對越來越普遍的深偽語音詐騙,真正能保護你的,從來不是一副更靈敏的耳朵,而是不管電話那頭聽起來多像本人、語氣多緊急,都先停下來,把這套查證流程走完一次的習慣。回到最前面提到的那通電話,那通要求立刻匯出款項、還交代先別聲張的語音。先掛斷,再用自己存的號碼回撥,這個簡單的動作,就能擋下其中的大多數攻擊。
