文章目錄+
01 / 人工智能
不同媒體先變成模型可處理的單位
所謂融合,先是一連串翻譯。
一張相片看起來很清楚,模型眼中的版本可能已經縮細、抽取、轉成另一種表示。你以為它看了原圖,其實它看的是加工後的影子。
影片可能只抽取幾格;電話錄音先被轉文字;圖片內的小字被壓縮;一段聲音的語氣和背景雜音也可能在轉換中消失。模型作答時,未必直接接觸原始現場。
02 / 人工智能
共同空間不等於共同理解
模型可以把貓的圖片與「貓」拉近,卻可能在細小文字、空間位置、聲調反諷或影片前後因果上失手。每個 modality 有自己的資訊密度與盲點。
把四種輸入接上,不會自動補回任何一種輸入在編碼時失去的細節。
開會錄音轉文字尤其容易出現這種落差:語氣沒有了,人名錯了,背景那句重要提醒也消失了。
所以檢查單據、看工地相片或整理會議錄音時,介面要讓人知道哪些內容是原始、哪些是轉錄、哪些只是模型推斷,否則錯誤會穿上『我親眼看過』的外衣。
03 / 人工智能
影片不是很多張圖片那麼簡單
如果只抽幾幀,系統可能看見杯在桌上和杯在地上,卻不知道是誰推倒、次序如何。聲音亦不只是逐字稿:停頓、重音、背景聲和說話者重疊都可能承載意思。
多模態最困難的地方往往是時間對齊,而不是單張圖辨識。
多模態好玩,但涉及錢和安全時,原檔仍然是最後話事人。
把四種輸入放在同一個視窗,不代表它們已經對齊。時間軸、指代、視角和檔案版本仍然要處理;愈多媒介,愈多可能的錯位。
04 / 人工智能
模態之間可以互相糾錯,也可互相帶偏
模糊圖片配上正確旁白可改善判斷;錯誤字幕亦可令模型忽略眼前證據。當文字和圖片衝突,模型偏向哪一邊取決於訓練與任務。
使用者看到「它既看又聽」,容易以為有兩份獨立證人;實際上兩者可能早已在同一模型內互相污染。
05 / 人工智能
輸出模態是另一個問題
能理解圖片不代表能準確生成圖片;能聽廣東話也不代表能以自然廣東話聲線即時回應。輸入編碼、跨模態推理和輸出生成是不同能力鏈。
產品標示「multimodal」時,最值得問的是支援哪些輸入與輸出、能否原生處理,以及延遲和限制。
06 / 人工智能
真正的秘密是損失管理
每次轉錄、抽幀、縮圖、壓縮和 token 化都在捨棄資訊。好的多模態系統不是假裝沒有損失,而是知道任務需要保留甚麼:讀收據要高解像文字,理解會議要分辨說話者,分析動作要保留時間順序。
多模態的上限,往往由最早被丟掉的那一點決定。
看見不代表量得準
視覺模型可以描述一張圖的主題,卻未必適合從圖表讀取精確刻度、比較兩條幾乎重疊的線,或從低解像收據核對小數點。語義理解和測量精度是不同能力。
需要數字時,OCR、圖表解析或原始資料往往比一句自然語言描述可靠。把「大致看懂」包裝成「精確讀取」,是多模態產品最容易出現的能力錯配。
即時語音再多一條延遲鏈
語音對話的自然感由多段延遲相加:偵測你何時說完、辨認語音、模型思考、合成聲音、傳送及播放。任何一段抖動都會變成搶話、停頓或重複。
全雙工系統甚至要在你尚未說完時預測是否應繼續聽。多模態體驗看似一個模型,產品上卻是一條需要同步的時間管線。
07 / 人工智能
最容易被忽略的不是模型看不到,而是它看到的版本已經被處理過。
影片可能只抽取幾格;電話錄音先被轉文字;圖片內的小字被壓縮;一段聲音的語氣和背景雜音也可能在轉換中消失。模型作答時,未必直接接觸原始現場。
所以檢查單據、看工地相片或整理會議錄音時,介面要讓人知道哪些內容是原始、哪些是轉錄、哪些只是模型推斷,否則錯誤會穿上『我親眼看過』的外衣。
08 / 人工智能
多模態不是魔法拼圖
把四種輸入放在同一個視窗,不代表它們已經對齊。時間軸、指代、視角和檔案版本仍然要處理;愈多媒介,愈多可能的錯位。
先由一個窄問題開始,通常比一次叫模型看完整個資料室更可靠。
09 / 人工智能
讀者最常問
模型看相片準唔準?
要視乎文字大小、角度、光線和任務;涉及金額、身份或安全時,仍應由人核對原圖。
影片應該完整上載?
唔一定;按問題抽取相關時間段可以減少成本,但要小心漏掉前後文。
聲音轉文字後可以當原文?
轉錄是有用的工作副本,但專有名詞、語氣和多人交談可能出錯。
資料註腳
資料註腳
來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。