GPT-5 或 Gemini 3 的展示影片這一兩年在網路上瘋傳,看過的人反應大多差不多:把一張照片丟進對話框問「這是什麼」,AI 秒懂;開口講一句話,AI 直接接話,連語氣裡的匆忙都聽得出來;丟一段影片進去,它甚至能講出畫面裡發生了什麼事。這些展示跟多數人過去用 AI 的經驗,打字問一句、等它打字回一句,落差大到讓人納悶,發生了什麼變化。
這個落差有個名字,叫「多模態 AI」(Multimodal AI)。不過多模態 AI 是什麼,跟大家印象裡「AI 也能看得懂圖」是不是同一件事?這個詞明明已經存在好幾年,為什麼偏偏這一兩年才被拿出來大講特講?這幾年「多模態」從一個技術名詞,變成幾乎所有主流 AI 產品都在講的行銷用語,但不是每個號稱多模態的產品都是同一種做法,有的打從一開始就設計成同時處理各種資料,有的只是把好幾個舊模型硬接在一起,外面貼一張新標籤。
搞懂兩者的差別,之後看到任何 AI 產品說自己「多模態」,才有辦法判斷這是真的技術升級,還是換個說法的舊架構。先從 AI 曾經只認得一種資料講起,再一路拆到多模態怎麼運作,以及它目前還解決不了哪些問題。
早期的 AI,一次只認得一種資料
回頭看 ChatGPT 剛問世那幾年,AI 能做的事其實很單純:你打字輸入一段話,它讀懂文字,再吐出一段文字回你。這不是那個時期的 AI 故意藏一手,而是技術架構本身的限制,每一種 AI 模型天生只認得一種資料型態,業界稱之為「單模態」(Unimodal)。經濟部產業技術司引述的產業分析就指出,多數 AI 模型只能處理單一模態的資料:一般的大型語言模型(LLM)只吃得下文字,換成卷積神經網路(CNN)這類模型,看得懂的又只剩影像,兩套系統各自訓練、各自運作,彼此並不相通。
這種各自為政的設計,換到實際場景裡就是明顯的不便。假設你開的是一間網路商店,客服 AI 能流利回答顧客打字問的退換貨政策,可是顧客傳來一張商品照片,附一句「這個顏色跟我收到的不一樣」,AI 卻完全看不懂那張圖在講什麼,只能請顧客改用文字描述問題。文字模型跟圖像模型是兩套獨立系統,中間沒有橋。這正是後來多模態 AI 要解決的起點。

舊做法:把看圖、聽聲音,用外掛拼上去
單模態各自為政的限制,並沒有讓業界停下腳步,而是先想出一個聽起來合理的補丁,找幾個各自專精的模型,把它們串在一起接力做事,而不是重新訓練一個全新的大腦來同時處理不同資料。以 ChatGPT 早期的語音模式為例,運作方式其實是一條三段式的生產線,先用一個模型把你講的話轉成文字,再交給 GPT-3.5 或 GPT-4 讀懂文字、想出回答,最後再用第三個模型把回答轉回語音念給你聽。
問題是,這條生產線每多一段轉手,就多一層延遲。根據 OpenAI 官方部落格〈Hello GPT-4o〉揭露的數字,這種舊架構的平均延遲,GPT-3.5 版本要等 2.8 秒,換成 GPT-4 版本更拉長到 5.4 秒;對一段正常對話來說,這樣的空白已經足夠讓人分心去看手機。更麻煩的是,資料轉成文字的那一刻,語氣、停頓、甚至是誰在講話、背景有沒有噪音,這些細節就跟著不見了,轉出來的文字乾乾淨淨,卻也把說話當下的情緒一起洗掉。這就是舊世代幫 AI 加裝視覺、語音外掛的實際樣貌,看起來什麼都會,骨子裡卻是好幾個各管一段的系統臨時拼裝。

多模態 AI 是什麼?同一個模型同時吃下文字、圖片、聲音、影片
看懂舊做法的侷限,才看得出多模態 AI 真正在解決什麼問題。先拆開「模態」這兩個字,它指的是資料呈現出來的形式,文字是一種模態、圖片是一種,聲音跟影片各自也是一種,你平常接收到的資訊,幾乎都能歸進這幾種模態裡。
多模態 AI(Multimodal AI)指的是同一個模型,從一開始就能同時理解並處理文字、圖片、聲音、影片這幾種不同型態的資料,而不是像前面說的拼裝架構,得先把資料轉手給另一個獨立系統才能懂。麥肯錫(McKinsey)官方的說明是,多模態 AI 是一種能同時理解並處理文字、圖片、聲音與影片等不同類型資訊的人工智慧;Google Cloud 官方頁面則進一步描述,這類模型能把文字、圖片、音訊這些不同型態的輸入都當成提示詞來處理,再轉換成多種輸出內容,不只侷限在原本輸入的型態。
換句話說,舊做法是好幾個專才輪流上場、一棒接一棒;多模態 AI 是一個通才自己把所有資料一次看懂、一次答完,中間不需要假手他人。

「原生」和「拼裝」的多模態,差別藏在反應速度裡
上一段丟出了一個新關鍵字「原生多模態」(Native Multimodal),值得單獨拆開講,因為它才是分辨真本事跟行銷話術的關鍵。原生多模態指的是,模型從訓練那一刻起,文字、圖片、聲音的資料就被放進同一套神經網路裡一起學習,而不是先分別訓練好幾個獨立模型、事後才拼接起來。Meta 官方部落格在介紹 Llama 4 時就提到,這個系列的模型設計成原生多模態,採用一種叫「early fusion」的技術,讓文字與視覺的資料從一開始就無縫融進同一個模型骨幹裡。
那要怎麼分辨自己看到的產品是不是真原生?最直接的線索就是反應速度。前面提過,舊式拼裝架構平均要等 2.8 到 5.4 秒才能給出語音回應;OpenAI 在改成單一模型端到端訓練的 GPT-4o 之後,語音回應最快可以壓到 232 毫秒,平均也只要 320 毫秒,這個數字已經接近人與人講話時自然的反應節奏。同樣是能聽能說,拼裝架構跟原生設計之間差了十幾倍的等待時間,這也是為什麼「原生」不只是一個好聽的行銷詞,而是使用者真的能感覺到的體驗落差。

多模態 AI 怎麼運作?三個步驟看懂它怎麼把資料兜在一起
知道多模態 AI 是什麼之後,自然會想追問它怎麼做到的。這裡不深入向量、嵌入這類更底層的數學細節,只要抓住三個步驟,就能想像資料在裡面兜了一圈。
第一步是「模態專屬處理」,每一種資料型態先各自交給對應的技術處理過一輪:文字用自然語言處理讀懂,圖片交給電腦視覺分析,聲音則另外用專門的模型解析。這一步還沒有把不同模態放在一起看,只是先讓每種資料各自被讀懂。第二步是「資訊融合」,模型把上一步各自處理完的結果放進同一個空間裡對齊、比對,讓它看得出這段文字跟這張圖講的其實是同一件事,像文字裡寫的「貓」,跟照片裡那隻貓,在這個階段就會被模型串連起來。第三步是「統一輸出」,模型根據整合完的資訊,產出最終答案,可能是一段文字,也可能是一張圖或一段語音。麥肯錫官方的說明也提到類似的分工,多模態模型是由多個負責編碼特定格式的神經網路組成,各自處理完之後把輸出融合,再由最後一層轉換成具體的預測或決策。

原生多模態不只是行銷詞,好處還在判斷力
原生設計帶來的好處,不只是回應變快而已。同一個模型一次看懂多種資料型態,代表它做判斷時能同時參考更多線索,不只是讀文字表面的意思,還能對照圖片、語氣這些額外資訊互相印證。麥肯錫官方的說明就指出,這種更全面的理解方式,能讓模型處理更複雜的提問,也讓判斷出錯(幻覺)的機率相對降低。這不代表 AI 從此不會判斷錯誤,但至少比只靠單一資料型態去猜,多了幾層可以互相校對的依據。史丹佛大學發布的《2026 年 AI 指數報告》(2026 AI Index Report)也提到,多模態模型攻克各項評測基準的速度愈來愈快,多個前沿模型在多模態推理任務上,已經達到甚至超越人類的基準表現。
這股轉向也不是單一幾家公司的個別行動。Gartner 在 2024 年 9 月發布的預測指出,具備多模態能力的生成式 AI 解決方案,占比會從 2023 年的 1%,一路成長到 2027 年的 40%。Gartner 傑出研究副總裁 Erick Brethenoux 當時就表示,隨著生成式 AI 市場逐漸走向從一開始就針對一種以上模態進行訓練的模型,這有助於掌握不同資料串流之間的關聯,並讓生成式 AI 的效益擴大到各種資料型態與應用場景。從 1% 到 40%,短短四年要翻上四十倍,這個速度說明了原生多模態已經不是邊緣選項,而是整個產業正在集體移動的方向。
GPT-5、Gemini 3 怎麼做到能看又能聽?
把前面的技術概念,對回讀者一開始看到的那兩支展示影片,會更容易理解。OpenAI 發表 GPT-5 時說明,這個模型在視覺、影片、空間與科學推理等多模態評測上的表現全面提升,不只能讀懂圖表、照片這類靜態畫面,也能理解一段影片裡發生的內容;不過目前 GPT-5 還只能看懂影片,尚不能反過來生成影片。Google 官方開發者文件裡,對 Gemini 系列模型的定位是從設計之初就以跨文字、圖片、影片、音訊(以及程式碼)進行推理為目標打造,也就是說 Gemini 從一開始的架構藍圖,就沒打算讓不同模態分開處理。
這股原生設計的路線,也不是只有 OpenAI 跟 Google 兩家在做。開放原始碼陣營裡,Meta 的 Llama 系列同樣採用前面提過的原生多模態架構,把文字與視覺資料從訓練階段就融進同一個模型骨幹。三家做法路數不完全相同,但方向一致,這說明原生多模態是整個產業正在收斂的共識,不是單一廠商講給投資人聽的行銷話術。
多模態 AI 真正用得上的地方:客服、單據、圖像搜尋
講了這麼多原理,多模態 AI 真正落到日常生意裡,其實就是三個你我都碰得到的場景。
客服互動是最容易感覺到差異的一種。當 AI 同時聽得懂顧客講話的文字內容,又聽得出語音裡的語氣起伏,就能判斷顧客是真的動怒,還是單純講話比較直接、語速比較快。這是純文字客服系統做不到的。像 Uniphore 的對話式 AI 平台,就是把語音跟文字分析整合在一起,用來提升客服中心的應對表現。
文件與單據處理則是另一個明顯受益的場景。過去要處理掃描檔、拍照上傳的表格或手寫字,得先靠人工把內容重新打成純文字,AI 才讀得懂;現在具備影像理解能力的系統,可以直接讀懂照片裡的表格、手寫內容,省掉這道轉譯的工夫。Azure AI Document Intelligence 就是這類應用的代表,結合光學字元辨識與自然語言處理,協助企業處理發票、收據、合約這些單據。
至於消費端,最明顯的變化落在圖像搜尋與推薦上。使用者不必再打關鍵字形容自己要找一件跟某張照片很像的洋裝,直接把照片丟進去就好。Amazon 的 StyleSnap 功能就是用電腦視覺加自然語言處理,依照使用者上傳的照片,直接推薦相似的服飾商品。

這三個場景背後有一個共同的延伸,正因為 AI 現在真的看得懂圖片,你網站上放的圖片、圖表,本身也開始被 AI 當作內容的一部分去解讀,不再只是版面上的裝飾。
多模態 AI 不是萬能,這些風險還沒解決
不過,多模態 AI 也不是沒有代價的萬靈丹,至少有兩件事還沒解決。
第一,判斷錯誤(業界稱為幻覺)並沒有因為多模態而消失,前面提過它只是相對變少,不是變不見。多看幾種資料型態,確實能讓模型多幾層依據去交叉核對,但不代表它從此不會答錯或看錯。第二,也是比較容易被忽略的一點,當 AI 處理的資料型態從單純的文字,擴大到語音、照片這些更貼近個人的資料,連帶要顧慮的隱私與資安範圍也跟著擴大。Splunk 官方部落格就指出,多模態 AI 面臨的挑戰,除了不同模態資料融合、對齊的複雜度之外,還包括隱私與倫理層面的疑慮,畢竟訓練這類系統用到的資料,裡面可能包含姓名、地址、財務資訊這些敏感的個人資料。這不是單純講功能變強了就能一筆帶過的代價,而是資料型態一多,要顧的面向也跟著變多。
AI 跟人互動的方式,正在從打字問一句、等它打字回一句,慢慢走向像在跟一個能看、能聽的助手對話。下一次再看到某支 AI 產品的展示影片,說自己能看圖、能聽聲音,你已經有能力多問一句:它是真的把這些資料放進同一個模型裡原生理解,還是幾個系統臨時接在一起做出來的展示效果。這個分辨的眼光,或許才是這篇文章真正想留給你的東西。
