人工智慧

AI 推理模型是什麼?跟一般聊天模型差在哪,何時該用?

多數人以為,AI 模型愈先進,回答應該愈快,但這幾年檯面上最厲害的幾顆模型,反而故意「拖」了幾秒甚至幾十秒才肯開口。在 ChatGPT、Gemini、Claude 的選單上,你八成也看過「思考」「Thinking」「推理」這類選項,切過去之後畫面卡在「思考中」動也不動,卻不太清楚這段等待在忙什麼、什麼時候該切、什麼時候乾脆別理它。

這段刻意的沉默,正是 AI 推理模型(Reasoning Model)跟一般聊天模型最大的分水嶺。它會先在內部生成一長串看不見的思考內容,想過一輪、檢查過一次,才把答案交給你,不是讀完問題就直接吐字。差別不只是快慢,遇到需要拆成好幾步驟才能解出的數學題,或牽涉好幾個條件的邏輯判斷時,兩種模型的正確率可以差到好幾倍。

先從一般聊天模型為什麼會在這類任務上出錯講起,再一路拆到推理模型怎麼「想」、想的代價是什麼,以及你在三大聊天工具上該怎麼分辨、什麼時候真的用得上。

一般聊天模型讀完問題就逐字接龍直接生成答案,推理模型則多出一段看不見的內部思考(拆解、檢查、比對)才回答
差別不在換了大腦,而在推理模型回答前先在內部想過一輪、檢查一次,才把答案交給你。

一般聊天模型怎麼回答問題?複雜任務為什麼常常出錯

把一個問題丟給 ChatGPT 或 Claude 的一般模式,它讀完提示詞後幾乎是一路寫到底,中間不會停下來檢查自己有沒有想錯。這是一般聊天模型(如 GPT-4o、Claude 標準模式)的生成方式,本質上是一種機率預測,每個字都根據前面已經寫出的內容,挑出接下來最可能出現的那個字,一路接龍到結尾。

對日常對話、翻譯、單一段落摘要這類「一步就能想清楚」的任務,這套機制其實已經夠用,速度也快。真正會出包的是那種得拆成好幾個步驟才解得完的任務:一道需要分好幾步推導的數學題、牽涉好幾個條件要同時滿足的邏輯判斷,或是得交叉比對好幾份文件才能下結論的分析工作。因為模型不會回頭檢查前面寫錯的地方,第一步一旦想岔,後面就整組跟著錯,而且它自己也不會發現。

OpenAI 在發布 o1 系列時公布的比較數字很直接,GPT-4o 在 AIME 2024(一場高難度的數學競賽)裡平均只能解出大約 12% 的題目。這個等級的任務,對一次寫到底、不回頭校對的生成方式來說,幾乎是先天不利。解法沒有多神奇,關鍵在於讓模型在生成答案之前,先自己檢查一遍。這正是推理模型要解決的問題。

推理模型是什麼?先想過一輪,才把答案交給你

跟前面那種一路寫到底的方式不同,推理模型在吐出最終答案之前,會先在內部生成一長串你看不到的思考內容,研究上稱它 reasoning trace(推理軌跡)或 chain of thought(思維鏈)。這段思考可能包含把問題拆成幾個小步驟、回頭檢查前一步有沒有出錯,甚至嘗試好幾種解法再互相比對、挑一個最可信的答案出來。使用者通常看不到完整的思考內容,介面上只會顯示一段摘要,或是一個「思考中」的過場動畫。

這個機制最早由 OpenAI 在 2024 年 9 月發布 o1 系列時公開命名,官方發布文把它定調成「設計成回答前花更多時間思考」的模型,強調的是回答方式的差異,不是換了一顆完全不同的大腦。

這段「思考」實際在忙什麼?

細看的話,這段思考多半在做三件事:先把一個複雜問題拆成好幾個小問題逐步處理;寫到一半回頭檢查前面的推導有沒有矛盾或算錯;對同一道題嘗試不同解法,再互相比對,挑出最可信的那個答案。IBM 的官方說明把這套機制歸類為長鏈推理、回溯與自我校正,模型不是一次定案,而是像人在打草稿一樣,先寫、先驗、再收斂。

推理模型看不見的思考鏈在背後做三件事:把問題拆成小步驟、回頭檢查有沒有算錯、對多種解法互相比對挑最可信的
這段思考你通常看不到,模型像打草稿一樣先寫、先驗、再收斂出答案(資料來源:IBM)。

為什麼它要「想」這麼久?運算資源花在哪?

這段思考不是比喻,是真的在產生看不見的內容,業界稱它 reasoning tokens(推理 token),這些 token 一樣要算錢、也要算時間,思考得愈久,等待跟費用就愈高。OpenAI 與 Google 的官方開發文件都把「想多久」設計成一顆可以調整的旋鈕,模型會依任務難度自動決定要想多少,介面或 API 也提供從幾乎不推理到深度推理的好幾個檔位讓人手動選,愈低檔愈快愈省,愈高檔愈準也愈慢。思考的量正在變成一件可以拿捏的事,不再是有或沒有的二選一。

推理力道像一顆可調旋鈕,從幾乎不推理到深度推理,愈往高檔愈準但回應愈慢、推理 token 費用也愈高
想多久已變成一個可以拿捏的刻度:簡單任務硬開到最高檔,只多花時間與費用,換不到更好的答案。

推理模型和一般模型,實際有什麼差異?

把兩者攤開放在一起比,真正的差異不是一張規格表能講完的,而是會直接影響你等待幾秒、看不看得到過程,以及在哪些任務上準確度差一大截。

回答方式不同:一次生成,還是先推演再回答

一般模型讀完問題就直接吐出答案;推理模型會先在內部跑一段推演,確認過一輪才回答。OpenAI 官方文件把這兩類模型分別定位成負責規劃策略的「the planners」,以及負責快速執行的「the workhorses」,推理模型擅長拆解複雜任務、在資訊不完整時做判斷,一般模型則負責把已經想清楚的步驟快速執行完。對使用者來說最直接的感受,就是後者常常會多等那幾秒到幾十秒的「思考中」。

準確度差距最明顯的任務:數學、程式、複雜邏輯

差距有多大,數字最直接。OpenAI 發布 o1 時公布的 AIME 2024 數學競賽成績,GPT-4o 平均只解出約 12% 的題目,o1 單次作答就拉到約 74%,取 64 次投票的共識答案能到約 83%,若把 1,000 次嘗試重新排序挑出最佳解,可以逼近 93%。另一份 o3 與 o4-mini 的發布文裡,ARC-AGI 這個專門考驗舉一反三而非死背模式的基準測試,o3 在高運算配置下拿到 87.5% 的高分,同一份基準 GPT-4o 只拿下約 5%。差距這麼懸殊,但要留意:這只發生在數學、程式、複雜邏輯這類需要多步驟推導的任務類型上,不是推理模型全面都比較聰明。

AIME 2024 數學競賽正確率,GPT-4o 約 12%,推理模型 o1 單次作答約 74%、多數投票約 83%、挑最佳解約 93%
需要多步驟推導的數學題,推理模型 o1 的正確率遠勝一般模型 GPT-4o(資料來源:OpenAI)。

等待時間與費用,推理模型都比較高

推理模型因為要先產生一大段看不見的思考 token,回應時間跟計費都比一般模型高。OpenAI 的官方開發文件甚至直接建議,先評估任務是不是真的需要這種深度,而不是每次都開到最高檔位,簡單的任務硬要開最深的推理,多花的是時間與費用,換不到明顯更好的答案。

在 ChatGPT、Gemini、Claude 上,怎麼看出自己用的是不是推理模型?

這些差異在後台看得清楚,但三大聊天工具的選單設計卻不統一,各自的說法值得拆開來看。目前三家都不是簡單的「這顆模型有推理、那顆沒有」二分選單,而是可調的檔位,或乾脆交給系統自動判斷。

ChatGPT 分 Auto/Fast/Thinking 三段、Gemini 分標準與延伸、Claude 從手動擴充思考走向由模型自己判斷力道
三大工具都不是「有沒有推理」的二分,而是可調檔位或交給系統自動判斷,切換前先認得自己的選單。

ChatGPT 的 Auto、Fast、Thinking 三段式選單

GPT-5 之後,ChatGPT 把「要不要推理」整合進一套路由機制,系統會依對話內容、複雜度自動決定該不該動用比較深的推理模型。介面上也提供 Auto、Fast、Thinking 三個模式讓你自己選:Auto 讓系統自動判斷、Fast 優先求快、Thinking 優先求深入。不想等的時候手動切 Fast,遇到真的棘手的題目再手動切 Thinking,是目前比較實際的用法。

Gemini 的思考等級:Standard 與 Extended

Google 的 Gemini 在開發者端用思考預算(thinking budget)或思考等級(thinking level)這類參數調整推理力道,數值愈高代表模型願意花愈多內部 token 去想。一般使用者在應用程式的模型選單裡,看到的則是簡化過的「標準(Standard)」與「延伸(Extended)」兩檔:標準應付大多數問題就夠,遇到真的複雜的主題才切到延伸,讓它多花一點時間深入分析。

Claude 的擴充思考,從手動開關走向自動判斷

Anthropic 一開始讓使用者手動打開「擴充思考(Extended thinking)」,還得自己設定要花多少 token 去想;新一代模型則進一步走向由模型自己判斷這一題值不值得深入推理,使用者只需要設定一個大略的力道,例如標準、高、或最高,不用再自己抓 token 預算的細節。

什麼情況該選推理模型?什麼情況一般模型就夠用?

更實際的問題是,這顆按鈕什麼時候該按下去。選不選推理模型,判準是任務本身的性質,不是這顆模型聽起來比較厲害就該選它。

多步驟數學、跨檔案除錯、交叉比對文件、資訊不完整的任務選推理模型;日常對話、翻譯潤稿、單段摘要、要即時回應的用一般模型較划算
選不選推理模型看任務是否環環相扣、多步驟,不是看哪顆聽起來厲害。

這些任務,推理模型的優勢最明顯

OpenAI 官方對這類模型的建議場景,共通點都是需要好幾個步驟、彼此環環相扣、錯一步就全盤皆錯的工作:

  1. 需要拆解成多個步驟才能解出的數學或邏輯計算
  2. 跨檔案的程式除錯,以及需要通盤理解架構的程式碼審查
  3. 得交叉比對好幾份文件才能下結論的分析工作
  4. 資訊模稜兩可、不完整,需要先釐清脈絡再往下推論的任務

這些任務,一般模型比較划算

反過來,以下情境多等的那幾秒到幾十秒是浪費,不是加分:

  1. 日常對話與客服應答
  2. 翻譯與潤稿
  3. 單一段落的摘要
  4. 需要即時互動、等不起延遲的場景

OpenAI 官方的判斷原則很直接,任務定義明確、速度與成本優先的情境,一般模型通常比較划算;真正模稜兩可、環環相扣的任務,才輪到推理模型上場。

推理模型想很久,不代表它真的「懂」

選對了模型,不代表這顆模型的判斷就一定可靠。它想得比較久,不等於它真的想通了。很多人以為想比較久等於比較聰明、或真的理解問題,不過幾份公開研究顯示,情況複雜得多。

三個研究發現:任務複雜度過門檻準確率崩跌、簡單題多花約 1953% token 也沒更準、畫面上的思考不一定忠實反映真實依據
想得比較久不等於真的想通,思考的量也不是無限往上加就會一直變準(資料來源:Apple、騰訊 AI Lab 與上海交大、Anthropic)。

Apple 的一份研究論文《The Illusion of Thinking》做了一系列複雜度可控的邏輯謎題測試,發現在低複雜度的任務上,推理模型有時反而不如一般模型,想太多,反而想歪了。更關鍵的是,一旦任務複雜度超過某個門檻,推理模型的準確率不是持續往上加,而是急遽下滑到接近於零,思考的量不是無限往上加就會一直變準。

另一個常被忽略的現象是「想過頭」。騰訊 AI Lab 與上海交通大學研究團隊的一篇論文發現,面對像「2 加 3 等於多少」這種簡單問題,推理模型平均要多花大約 1,953% 的 token 量,才得到跟一般模型一樣的答案。多花的那些思考,對答案本身沒有加分,有些情況甚至因為想太久,反而把原本已經想到的正確答案又改成錯的。

顯示出來的「思考過程」也不能照單全收。Anthropic 的一份研究論文《Reasoning Models Don’t Always Say What They Think》指出,模型攤在畫面上的思考內容,不見得忠實反映它實際的判斷依據。研究團隊在題目裡偷偷塞入提示,模型改了答案,但多半只有二到四成的機率會在思考過程裡老實承認自己受到那個提示影響。Anthropic 另一份《Inverse Scaling in Test-Time Compute》研究也發現,拉長推理有時反而會讓某些任務的準確率下降,不是想得愈久愈保險。

要不要動用比較深的推理,正在從「這顆模型有沒有推理能力」的二選一,變成一個可以連續調整的旋鈕。GPT-5 的 Auto、Fast、Thinking,Gemini 的思考等級,Claude 讓模型自己判斷該想多深,方向都指向同一件事,思考的深度愈來愈像一個可以拿捏的刻度,而不是有或沒有的開關。下次在選單上看到「思考」兩個字,你大概已經知道背後在忙什麼,也能自己判斷值不值得讓它多想那幾秒。

資料來源
  1. Learning to Reason with LLMs — OpenAI
  2. Introducing OpenAI o3 and o4-mini — OpenAI
  3. Reasoning Best Practices — OpenAI
  4. What Is a Reasoning Model? — IBM
  5. The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity — Apple
  6. Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs — 騰訊 AI Lab 與上海交通大學
  7. Reasoning Models Don't Always Say What They Think — Anthropic
  8. Inverse Scaling in Test-Time Compute — Anthropic