返回文章庫

人工智能/深層解釋

多模態 AI 是甚麼?文字、圖片、聲音與影片怎樣放在一起?

多模態模型可以共同處理不同媒介,但每次轉錄、抽幀、辨認和對齊都可能丟失資料;看見,不等於精確量度。

01 / 人工智能

不同媒體先變成模型可處理的單位

多模態 AI 不只是『加了眼睛和耳朵的聊天機械人』。它要把文字、圖片、聲音和影片轉成可以共同推理的表示,再在不同時間尺度和清晰度之間取捨。

所謂融合,先是一連串翻譯。

一張相片看起來很清楚,模型眼中的版本可能已經縮細、抽取、轉成另一種表示。你以為它看了原圖,其實它看的是加工後的影子。

影片可能只抽取幾格;電話錄音先被轉文字;圖片內的小字被壓縮;一段聲音的語氣和背景雜音也可能在轉換中消失。模型作答時,未必直接接觸原始現場。

02 / 人工智能

共同空間不等於共同理解

模型可以把貓的圖片與「貓」拉近,卻可能在細小文字、空間位置、聲調反諷或影片前後因果上失手。每個 modality 有自己的資訊密度與盲點。

把四種輸入接上,不會自動補回任何一種輸入在編碼時失去的細節。

開會錄音轉文字尤其容易出現這種落差:語氣沒有了,人名錯了,背景那句重要提醒也消失了。

所以檢查單據、看工地相片或整理會議錄音時,介面要讓人知道哪些內容是原始、哪些是轉錄、哪些只是模型推斷,否則錯誤會穿上『我親眼看過』的外衣。

03 / 人工智能

影片不是很多張圖片那麼簡單

如果只抽幾幀,系統可能看見杯在桌上和杯在地上,卻不知道是誰推倒、次序如何。聲音亦不只是逐字稿:停頓、重音、背景聲和說話者重疊都可能承載意思。

多模態最困難的地方往往是時間對齊,而不是單張圖辨識。

多模態好玩,但涉及錢和安全時,原檔仍然是最後話事人。

把四種輸入放在同一個視窗,不代表它們已經對齊。時間軸、指代、視角和檔案版本仍然要處理;愈多媒介,愈多可能的錯位。

04 / 人工智能

模態之間可以互相糾錯,也可互相帶偏

模糊圖片配上正確旁白可改善判斷;錯誤字幕亦可令模型忽略眼前證據。當文字和圖片衝突,模型偏向哪一邊取決於訓練與任務。

使用者看到「它既看又聽」,容易以為有兩份獨立證人;實際上兩者可能早已在同一模型內互相污染。

05 / 人工智能

輸出模態是另一個問題

能理解圖片不代表能準確生成圖片;能聽廣東話也不代表能以自然廣東話聲線即時回應。輸入編碼、跨模態推理和輸出生成是不同能力鏈。

產品標示「multimodal」時,最值得問的是支援哪些輸入與輸出、能否原生處理,以及延遲和限制。

06 / 人工智能

真正的秘密是損失管理

每次轉錄、抽幀、縮圖、壓縮和 token 化都在捨棄資訊。好的多模態系統不是假裝沒有損失,而是知道任務需要保留甚麼:讀收據要高解像文字,理解會議要分辨說話者,分析動作要保留時間順序。

多模態的上限,往往由最早被丟掉的那一點決定。

看見不代表量得準

視覺模型可以描述一張圖的主題,卻未必適合從圖表讀取精確刻度、比較兩條幾乎重疊的線,或從低解像收據核對小數點。語義理解和測量精度是不同能力。

需要數字時,OCR、圖表解析或原始資料往往比一句自然語言描述可靠。把「大致看懂」包裝成「精確讀取」,是多模態產品最容易出現的能力錯配。

即時語音再多一條延遲鏈

語音對話的自然感由多段延遲相加:偵測你何時說完、辨認語音、模型思考、合成聲音、傳送及播放。任何一段抖動都會變成搶話、停頓或重複。

全雙工系統甚至要在你尚未說完時預測是否應繼續聽。多模態體驗看似一個模型,產品上卻是一條需要同步的時間管線。

07 / 人工智能

最容易被忽略的不是模型看不到,而是它看到的版本已經被處理過。

影片可能只抽取幾格;電話錄音先被轉文字;圖片內的小字被壓縮;一段聲音的語氣和背景雜音也可能在轉換中消失。模型作答時,未必直接接觸原始現場。

所以檢查單據、看工地相片或整理會議錄音時,介面要讓人知道哪些內容是原始、哪些是轉錄、哪些只是模型推斷,否則錯誤會穿上『我親眼看過』的外衣。

08 / 人工智能

多模態不是魔法拼圖

把四種輸入放在同一個視窗,不代表它們已經對齊。時間軸、指代、視角和檔案版本仍然要處理;愈多媒介,愈多可能的錯位。

先由一個窄問題開始,通常比一次叫模型看完整個資料室更可靠。

09 / 人工智能

讀者最常問

模型看相片準唔準?
要視乎文字大小、角度、光線和任務;涉及金額、身份或安全時,仍應由人核對原圖。

影片應該完整上載?
唔一定;按問題抽取相關時間段可以減少成本,但要小心漏掉前後文。

聲音轉文字後可以當原文?
轉錄是有用的工作副本,但專有名詞、語氣和多人交談可能出錯。

資料註腳

資料註腳

  1. platform.openai.com/docs/guides/images
  2. platform.openai.com/docs/guides/audio

來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee