AI 能看圖卻會「眼花」?視覺幻覺正在挑戰你對 ChatGPT 的信任

關鍵數字:當多模態 AI 能在一秒內「看懂」百萬張圖像,卻也可能在每一次判斷中,藏進一個你永遠不會發現的錯誤。學術界最新警告:這不是偶發的 bug,而是模型與生俱來的「結構性缺陷」。

你拿出手機,拍了一張 X 光片的上傳給 AI 健康助手,它十秒內回覆「未發現明顯異常」。你安心地關掉畫面。但你有沒有想過——如果那張圖裡,AI 其實漏看了某個東西呢?

這不是科幻情節。諾丁漢大學電腦視覺副教授 Michael Pound 公開點出了一個正在快速蔓延的隱憂:我們手上的 ChatGPT、Claude 這些大型語言模型,在進化為「多模態」、能同時處理文字與圖像之後,反而長出了一種麻煩的能力——視覺幻覺(Visual Hallucinations)。白話來說,就是 AI 會針對一張圖片,產出聽起來頭頭是道、但實際上根本錯誤甚至荒謬的描述。

📊 數據總覽:視覺幻覺的三大衝擊維度

這不是單一實驗室的個案觀察,而是橫跨學術與應用端的系統性警訊。根據《Communications of the ACM》的報導,研究人員歸納出視覺幻覺對現實世界構成的威脅,可以濃縮為以下三個層面:

這張表格背後藏著一個更尖銳的問題:當 AI 的錯誤率不再是紙上數字,而是直接兌換成安全風險時,我們憑什麼繼續信任它?

幻覺從哪裡來?AI 不是看「懂」圖,是看「對」機率

很多人以為 AI 認出一隻貓,是因為它真的「知道」貓長什麼樣子。但事實遠比想像中更機械、更冷血。

加州柏克萊人工智慧研究實驗室(BAIR)的博士後研究員 David Chan 點破了這層窗戶紙:這些模型的輸出,本質上只是統計學上的合理性,而非對「真理」的掌握。它們在大量文字與影像資料中找規律,然後根據機率拼湊出「最可能正確」的答案——但它們從來不保證那個答案「真的正確」。

這就導致了一個荒謬的處境:當背景資訊跟圖像內容打架時,AI 更容易產生幻覺。Michael Pound 舉了一個非常實際的例子:在醫學影像分析中,如果 AI 模型在訓練時被其他病患的資料影響,它有可能直接忽略影像中實際存在的病灶。換句話說,你以為它在幫你找問題,它卻可能在幫你蓋掉問題。

「人類也會犯錯,但大眾對機器的標準不一樣。」David Chan 這句話說得很直白。我們可以接受醫生偶爾看走眼,卻很難原諒一台宣稱「精準」的 AI 系統犯下同樣的錯誤——因為我們對科技的期望,從來不是「跟人一樣」,而是「比人更好」。

編輯觀點:這起事件最值得注意的,不是 AI 會犯錯——這早就不是新聞。真正該警覺的是,「視覺幻覺」不是一個能被「修掉」的 bug,而是生成式 AI 的結構成本。它本質上就是一臺預測引擎,你要求它永遠不犯錯,就像要求天氣預報永遠不失準。但問題在於,我們正把這臺預測引擎推進手術房、放進方向盤、塞進視障者的眼鏡裡。從產業面來看,未來兩年最大的戰場不會是「誰的模型更強大」,而是「誰能有效控制幻覺的傷害邊界」。這一點,OpenAI 和 Anthropic 心裡恐怕比誰都清楚。

現在的解法是什麼?REVERSE 框架能逆轉局面嗎?

既然問題根源在於模型的本質,那技術圈當然不會坐以待斃。

目前實務上已經有幾條路同時在走。第一條是針對特定任務進行模型微調(fine-tuning),讓 AI 在專屬領域內表現更穩定;第二條是在自動駕駛車等系統中,額外加裝光達(LiDAR)這類感測器,用多重硬體去彌補單一 AI 判讀的失誤。

但這兩條路都有極限。微調只能解決特定場景,無法應付開放世界的多變性;加裝感測器則牽涉到成本與硬體限制,不是所有應用都能複製。

更尷尬的是,現有的後驗證(post-hoc verification)方法——也就是用另一個 AI 模型來檢查前一個 AI 的輸出——不僅效率低落,而且只能「拒絕」錯誤答案,沒辦法當場修正。等於你請了兩個警衛,一個會看走眼,另一個只會大喊「不對喔」,但兩個人都攔不住小偷。

研究團隊提出的新解方,叫做 REVERSE 框架。它的概念很聰明:在 AI 生成回應的當下,同步進行幻覺檢查。具體作法是訓練模型將生成的每個詞彙標記為「自信」或「不自信」,並給予信心評分。一旦某個詞彙分數過低,系統就能即時調整,而不是等到整句話講完才回頭檢討。

David Chan 稱這是一種「推論技巧」,讓已經部署的系統可以根據預期的錯誤率,動態調整應對策略。它不完美,但至少比「先射箭再畫靶」的後驗證務實得多。

趨勢預測:從「被動修正」走向「源頭防堵」

如果說 REVERSE 框架是止血帶,那研究人員真正想做的,其實是從免疫系統層面改寫體質。

未來的研究方向,正在從「純文字推理」轉向視覺推理(visual reasoning)——讓模型不是靠文字標籤去「腦補」一張圖在講什麼,而是真正去分析圖像的幾何結構、外觀特徵、空間關係。換句話說,讓 AI 學著用眼睛看,而不是用資料庫去猜。

這個轉向的意義不只是技術升級,更代表了對「可解釋性」的重新重視。當一個模型能說出「我為什麼把這個區域判斷為腫瘤,是因為它的邊緣形狀符合某個幾何特徵」,我們才真正有機會驗證它的思考路徑,而不是把整個決策過程裝進一個黑盒子裡。

但話說回來,視覺推理的運算成本極高,距離商用部署還有不小的距離。在那之前,我們註定要與視覺幻覺共存一段時間——而這段時間裡,誰能發明更有效的「錯誤邊界管理」機制,誰就可能成為下一階段的贏家。

數據告訴我們什麼?

回頭看整件事,有幾個數字值得刻在腦子裡:視覺幻覺不是例外,而是常態當背景與內容矛盾時,幻覺發生頻率會顯著攀升現有後驗證方法效率低落,REVERSE 框架只能算過渡解

這對一般人的啟示其實很實際:別再把 AI 的圖像判讀當作「最終答案」,尤其在醫療、安全、輔助科技這三條線上,你必須把它當成「參考意見」而非「診斷書」。如果你是開發者,請正視幻覺的成本,別等到使用者出事了才來補救——因為到那時候,賠掉的不只是信任,可能是人命。

最後一個真心的建議:下次你看到 AI 對著一張圖片講得頭頭是道時,請多問自己一句——「它講的,是真的,還是只是『機率上合理』?」 這個問題,或許比 AI 本身更重要。

本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。

常見問題 FAQ

什麼是大型語言模型的視覺幻覺?

視覺幻覺是指 AI 在處理圖像時,產生看似合理但實際錯誤或荒謬的輸出。它不是看錯,而是基於統計機率生成的「最可能」描述,不一定反映真實圖像內容。

視覺幻覺會影響哪些實際應用?

影響最嚴重的包括自動駕駛車的影像判讀、醫療影像輔助分析,以及盲人輔助科技。這些領域中 AI 的錯誤可能直接轉化為安全風險,且使用者往往無法自行驗證輸出正確性。

現在有辦法完全解決視覺幻覺嗎?

目前沒有。現有解法如模型微調、加裝感測器、或 REVERSE 框架都屬於「減災」而非「根治」。未來研究方向是從源頭防止幻覺產生,例如讓 AI 進行視覺推理而非純文字推理。

一般使用者該如何應對視覺幻覺風險?

建議將 AI 的圖像判讀視為「參考意見」而非「最終答案」,尤其在涉及健康或安全的場景。對於關鍵決策,應優先諮詢專業人士進行人工驗證。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。