人工智慧

AI 生成文章如何檢查事實:上稿前的完整查核方法

多數人以為,AI 模型愈新、「推理」能力愈強,給出的事實應該愈可靠。OpenAI 自己公布的一組數字,卻推翻了這個假設。在測試模型認不認得真實人物的 PersonQA 項目裡,o3 的幻覺率是 33%,剛好是前一代 o1(16%)的兩倍;規模更小的 o4-mini 在同一項測試裡,PersonQA 的幻覺率甚至衝到 48%,另一項 SimpleQA 測試更高達 79%。AI 生成文章如何檢查事實,也因此變成愈來愈多內容工作者上稿前必修的一道工序。

這篇不是要你別再用 AI 寫東西,而是把查證這道關卡講清楚,讓你知道哪些內容特別容易出錯,又該怎麼一步步確認。先從 AI 最容易講錯話的情境講起,再一路拆到查證的具體招式,最後看查不到來源時該怎麼處理。

OpenAI 官方數據顯示新模型 o3、o4-mini 的幻覺率反而高於前代 o1,o3 的 33% 是 o1 的兩倍
模型愈新、推理愈強,幻覺率不一定愈低——o3 的 PersonQA 幻覺率是前代 o1 的兩倍(資料來源:OpenAI o3 and o4-mini System Card)。

AI 生成的內容,什麼情況下最容易出錯?

AI 生成的文字看起來像是理解了你的問題才回答,但它實際在做的是計算「接下來最可能出現的字詞」,不是去核對這句話是不是真的。它沒有一個「這是不是事實」的內建開關,遇到不確定的資訊,還是會用最流暢、最像正確答案的方式把句子接完,讀起來跟真的一模一樣。

AI 生成文字是在計算下一個最可能的字,流程裡沒有事實查核這一關,才會把錯話講得很流暢
AI 不是在核對真假,而是計算「下一個最可能的字」,整條流程缺了事實查核那一關,所以錯得特別像真的。

這也是為什麼同一支模型,在不同任務裡的可靠度可以差到十倍以上。Vectara 的幻覺排行榜長期在追蹤一種相對安全的任務,讓模型讀一份既有文件、幫忙摘要,不多加自己的看法。在這種照著資料改寫的情境下,表現最好的模型幻覺率可以壓到 1.8%,多數主流模型也落在 4%到 14%之間,算是 AI 比較不容易出錯的用法。

問題出在另一種情境,也就是當你已經預設某個說法是真的,再讓 AI 幫你確認、延伸或補上細節,而不是提供資料讓它照著改寫,這時風險就完全是另一個量級。史丹佛大學人本 AI 研究中心(Stanford HAI)的《2026 年 AI 指數報告》做過一項準確度測試,把同一句錯誤陳述包裝成兩種說法讓模型回答:一種說成是「別人相信的事」,另一種說成是「使用者自己相信的事」。結果模型碰到「別人的錯誤說法」大多能抓出問題,但換成「這是使用者自己相信的」框架,表現就整個崩盤。26 個主流模型測出來的幻覺率介於 22%到 94%之間,GPT-4o 的準確率從 98.2%驟降到 64.4%,DeepSeek R1 更是從九成以上摔到 14.4%。這個結果對常常拿自己已經有的想法去問 AI「幫我確認一下」的人特別重要,你愈是把某個說法當成理所當然去問,AI 就愈可能順著你的方向講,而不是誠實糾正你。

把錯誤陳述包裝成使用者自己相信的說法後,GPT-4o、DeepSeek R1 的抓錯準確率大幅崩跌
同一句錯誤陳述,只要包裝成「使用者自己相信的事」再問,模型準確率就從九成以上崩到六成甚至一成多(資料來源:史丹佛大學人本 AI 研究中心《2026 年 AI 指數報告》)。

這種順著使用者相信的方向講的傾向,不只出現在單一模型的測試裡,更被一項大型跨國研究印證。歐洲廣播聯盟(EBU)與 BBC 合作的一份研究,找來 22 家公共媒體、橫跨 18 個國家、14 種語言,實際測試市面上主流的 AI 助手,結果 45%的回答至少有一項顯著問題,其中三成的問題出在引用來源出錯,兩成出在嚴重的事實錯誤。這代表 AI 講錯話不是單一個案,而是各家主流模型普遍存在的狀況。

這些數字合起來說的是同一件事。回頭看前面提到的 o3 與 o4-mini,模型愈新、參數愈多,不代表幻覺愈少,有時候反而因為更「敢講」而錯得更多。知道 AI 在哪種情境下最容易講錯,是判斷該花多少查核力氣的第一步,但光是這樣還不足以說服人動手查。真正該在意的,是這些沒被抓到的錯誤,最後會讓經營內容的人付出什麼代價。

行銷文案、部落格文章沒查證,會付出什麼代價?

沒查證的 AI 內容,最先流失的不是排名,是讀者對你的信任。讀者一旦發現你講的數字、案例或引言是編出來的,很難再回頭信任你接下來寫的任何一篇文章,這種信任一旦被戳破,補救的成本遠比事前查證高出許多。

Google 的立場其實講得很清楚,內容是不是 AI 生成,從來不是判斷排名的標準,內容夠不夠準確、夠不夠有用才是。Google Search Central 的官方文件《Google Search’s Guidance on Generative AI Content on Your Website》明白寫出,Google 不會因為一段內容是 AI 寫的就懲罰它,但錯誤百出、品質低落的內容,不管是誰寫的都一樣會被判定為低品質。換句話說,把「這是 AI 寫的」當成擋箭牌沒有用,內容站不站得住腳,還是得回到內容本身。

再往下一層看,商譽與法律責任的問題更直接。企業對外發布的內容,不管是行銷文案、社群貼文還是官網說明,責任都在發布的一方身上,不能事後推說是 AI 講的。Pew Research Center 一項調查也印證了讀者這一側的焦慮,66%的美國成年人高度擔心自己會從 AI 得到不準確的資訊,這股疑慮,最終會回過頭影響讀者怎麼看待你發布的內容。

以下三個真實發生的案例,分別對應讀者信任、商譽與法律三種代價,都是海外具名企業親身付出的教訓。

第一個案例發生在 Google 自己身上。Google 在超級盃廣告裡展示 Gemini 的功能,讓一位起司商用它生成產品文案,結果 Gemini 寫出「Gouda 起司占全球起司消費量的 50%到 60%」這個數字,而這個數字根本查無實據。錯誤被網友發現後,Google 悄悄重新剪輯了這支廣告,把那句錯誤的統計數字整個拿掉才重新上架,連做出這支模型的公司自己,都得在事後為 AI 寫錯的數字收拾善後。

第二個案例牽涉到法律責任。加拿大的 Air Canada 航空公司,官網上的客服聊天機器人提供旅客一個錯誤的奔喪票價退款政策,旅客照著機器人講的內容申請退款卻被拒絕,一狀告上卑詩省的民事仲裁庭。仲裁庭最後判定,不管答案是網頁上的靜態文字還是聊天機器人生成的,航空公司都要為自己網站上出現的內容負責,判賠旅客票價差額。這起案子等於明確立下一個判例,企業不能拿 AI 自己講的當作免責的理由。

第三個案例回到內容產業本身。CNET 這家科技媒體從 2022 年底開始,用內部開發的 AI 工具寫了 77 篇財經相關的解釋型文章,之後做內部稽核才發現,其中 41 篇,超過一半,都需要更正,問題包括利率計算錯了、貸款建議講得不夠準確,連公司全名都能寫錯。這起事件讓 CNET 一度暫停用 AI 直接產出文章,也讓外界重新檢視 AI 寫得快跟 AI 寫得對根本是兩回事。

Google、Air Canada、CNET 三個未查證 AI 內容的真實案例,分別付出讀者信任、法律與商譽的代價
從 Google 到 Air Canada、CNET,沒查證的 AI 內容分別賠掉讀者信任、法律責任與商譽,都是具名企業付過的教訓。

這三個案例背後,其實是同一個道理。上稿前的查證不是多此一舉的龜毛,是把風險攔在讀者看到之前。要做到這件事,得先知道 AI 寫的內容裡,哪些類型最容易出錯、最該優先盯緊。

上稿前,先分辨這幾類高風險內容

不是每一句 AI 寫出來的話,出錯風險都一樣高。與其把整篇文章從頭到尾用同一種力道檢查,不如先抓出最容易出錯、也最傷專業形象的幾種類型,查核的力氣才知道該往哪裡放。下面五種,是行銷文案跟部落格文章裡最常見的地雷,展開的查證方法留到下一節。

上稿前最該優先查證的五類 AI 高風險內容:數字統計、具名研究、人名機構、日期時效、競品聲明
檢查 AI 生成內容時,先把力氣放在這五類最容易出錯的地方:數字、具名研究、人名機構、日期與競品聲明。

AI 內容的數字與統計數據

AI 最愛把百分比、金額、排名講得斬釘截鐵,拿來當文案裡的亮點,但這類數字最容易是東拼西湊、早就過時,甚至整個是憑空捏造出來的。這種錯誤也最容易被讀者或同業一眼戳破,傷害最直接。

AI 內容的具名研究、報告與引用

AI 有時候會把根本不存在的研究、報告或機構名稱講得煞有介事,或是把一份真實研究的結論,張冠李戴套到完全不相干的主題上。這種機構名字查得到、報告內容卻對不上的狀況特別難防,因為聽起來很有權威感,反而更容易被信任。

AI 內容的人名、職稱與機構

AI 可能捏造出一位根本不存在的專家,或是把真實人物安上錯的職稱與服務機構。行銷文案裡若寫「某某專家表示」,這類錯誤一旦被讀者或當事人查出來,對品牌信任的傷害特別大。

AI 內容的日期與時效性

AI 的訓練資料本來就有時間上限,常常把舊資料當成最新事實講出來。法規、價格、規格這類會隨時間更動的內容,讀者若照單全收,很容易直接套用到已經過期的資訊。

AI 內容的競品與負面聲明

AI 有時候會生成「某某做法比較差、比較貴」這類沒有根據的比較性說法。內容一旦牽涉到可辨識的對象卻沒查證就發布,等於自己先埋下商譽或法律風險的地雷,這類內容尤其需要提高警覺。

抓到高風險內容後,怎麼一步步查證?

確認一個來源真的存在,只是查證的第一步,還不是終點。最陰險的錯誤,往往是來源是真的,AI 引用的數字或結論卻兜不起來,方向講對了,細節卻講錯,這種錯誤只看標題或摘要根本抓不出來,必須點進去讀完整段落才抓得到。前面提到那份跨國的公共媒體研究裡,引用來源出錯正是占比最高的問題類型,可見這不是少見的個案,而是 AI 內容查核裡最需要優先處理的一關。

AI 內容查證四步驟:反向搜尋找出處、點進讀完整段落、查證人名機構、核對日期抓過期資料
抓到高風險內容後,用反向搜尋、讀完整段落、查證人名機構、核對日期這四步,攔住最常見的 AI 錯誤。

反向搜尋,看原始出處存不存在

把 AI 講的關鍵數字或引言,原封不動貼進搜尋引擎,前後加上引號查詢。兩三次點擊內找不到原始出處,這個數字多半是拼湊或捏造出來的,直接別用,不要因為聽起來很專業就心軟留下。

點進來源讀完整段落,不要只看標題

確認來源網址真的存在還不夠,要點進去讀 AI 引用的那一段,是不是真的這樣寫。AI 最常見的手法,是引用一份真實報告,卻把結論的方向講對、把數字或年份講錯,這種錯誤只看標題絕對抓不出來,得讀到那一段原文才比對得出來。

查證人名與機構是否真實存在

把 AI 提到的專家全名、職稱、所屬機構分開搜尋。機構官網或公開登記資料查得到這個人、職稱也對得上,才算通過;查到的名字對不上職稱,或機構官網根本沒有這個人,就是明確的警訊,內容要拿掉或改成不具名的通則說法。

核對日期,抓「舊資料當新資料用」

只要內容牽涉到法規、價格、規格、排名這類會隨時間變動的資訊,一律回頭確認 AI 講的是不是最新版本。搜尋時額外加上年份當關鍵字,看看是不是已經有更新的版本,取代了 AI 講的那個數字或規定。

這四招搭配著用,大概就能攔住 AI 內容裡最常見的錯誤類型。但查證這件事也有極限,有些內容不管怎麼查都找不到能證實的來源,這時候就得學會判斷什麼時候該放手。

查不到可靠來源,這段話就該砍掉或改寫

查證不是查到天荒地老,你得先幫自己設一個時間上限。花了一段合理的時間還是找不到主要來源,這段內容就別冒險放進定稿,寧可拿掉或改寫,也不要賭它剛好是真的。

另一種常見狀況,是來源真的存在,但 AI 引用的數字兜不起來,方向大致沒錯,細節卻對不上。遇到這種情況,優先的做法是把內容改寫得更保守、更可查證,比如拿掉那個具體的百分比,改成方向性的陳述,而不是照抄一個查無實據的精確數字。

如果內容牽涉到台灣本地的法規或統計數字,優先查台灣政府的公開資料與正式統計,會比只查國外資料來得準,也更貼近讀者的實際情境。行政院與國家科學及技術委員會發布的《行政院及所屬機關(構)使用生成式 AI 參考指引》,就明白要求公務機關人員不能完全信任 AI 產出的內容,不能拿未經確認的產出直接當成公務決策的唯一依據,連政府機關內部使用 AI 都設下這樣的查證門檻,對外發布給讀者看的行銷內容,標準沒有理由比這個更低。

查證這件事被輕忽,代價可以有多具體,澳洲政府的一起案例是很好的示範。跨國會計顧問公司 Deloitte 受澳洲政府委託撰寫一份查核報告,後來被學者發現報告裡引用了根本不存在的學術文獻,還捏造了一段法院判決的引言。事情曝光後,Deloitte 除了重新修正報告內容,也退還了部分報告費用。這起案子提醒的是,查證這件事,不會因為委託方是誰、報告規模多大就可以省略。

查核 AI 生成的內容,並不是要否定 AI 帶來的效率。這正是 AI 生成文章如何檢查事實最終要落實的地方,把人放回最後一道關卡,讓 AI 負責寫得快,人負責讓內容站得住腳。回頭看看開頭那組數字,模型愈新不代表幻覺愈少,這件事本身就說明,查證這一步永遠不會因為技術進步而自動消失。上稿前那幾分鐘的查證,永遠比事後道歉、更正或下架來得省事。

資料來源
  1. OpenAI o3 and o4-mini System Card — OpenAI
  2. Hallucination Leaderboard — Vectara
  3. The 2026 AI Index Report — 史丹佛大學人本 AI 研究中心
  4. News Integrity in AI Assistants – An International PSM Study — 歐洲廣播聯盟
  5. Google Search's Guidance on Generative AI Content on Your Website — Google
  6. How the US Public and AI Experts View Artificial Intelligence — Pew Research Center