返回文章库

人工智能/深层解释

多模态 AI 是甚么?文字、图片、声音与影片怎样放在一起?

多模态模型可以共同处理不同媒介,但每次转录、抽帧、辨认和对齐都可能丢失资料;看见,不等于精确量度。

01 / 人工智能

不同媒体先变成模型可处理的单位

多模态 AI 不只是『加了眼睛和耳朵的聊天机械人』。它要把文字、图片、声音和影片转成可以共同推理的表示,再在不同时间尺度和清晰度之间取舍。

所谓融合,先是一连串翻译。

一张相片看起来很清楚,模型眼中的版本可能已经缩细、抽取、转成另一种表示。你以为它看了原图,其实它看的是加工后的影子。

影片可能只抽取几格;电话录音先被转文字;图片内的小字被压缩;一段声音的语气和背景杂音也可能在转换中消失。模型作答时,未必直接接触原始现场。

02 / 人工智能

共同空间不等于共同理解

模型可以把猫的图片与「猫」拉近,却可能在细小文字、空间位置、声调反讽或影片前后因果上失手。每个 modality 有自己的资讯密度与盲点。

把四种输入接上,不会自动补回任何一种输入在编码时失去的细节。

开会录音转文字尤其容易出现这种落差:语气没有了,人名错了,背景那句重要提醒也消失了。

所以检查单据、看工地相片或整理会议录音时,介面要让人知道哪些内容是原始、哪些是转录、哪些只是模型推断,否则错误会穿上『我亲眼看过』的外衣。

03 / 人工智能

影片不是很多张图片那么简单

如果只抽几帧,系统可能看见杯在桌上和杯在地上,却不知道是谁推倒、次序如何。声音亦不只是逐字稿:停顿、重音、背景声和说话者重叠都可能承载意思。

多模态最困难的地方往往是时间对齐,而不是单张图辨识。

多模态好玩,但涉及钱和安全时,原档仍然是最后话事人。

把四种输入放在同一个视窗,不代表它们已经对齐。时间轴、指代、视角和档案版本仍然要处理;愈多媒介,愈多可能的错位。

04 / 人工智能

模态之间可以互相纠错,也可互相带偏

模糊图片配上正确旁白可改善判断;错误字幕亦可令模型忽略眼前证据。当文字和图片冲突,模型偏向哪一边取决于训练与任务。

使用者看到「它既看又听」,容易以为有两份独立证人;实际上两者可能早已在同一模型内互相污染。

05 / 人工智能

输出模态是另一个问题

能理解图片不代表能准确生成图片;能听广东话也不代表能以自然广东话声线即时回应。输入编码、跨模态推理和输出生成是不同能力链。

产品标示「multimodal」时,最值得问的是支援哪些输入与输出、能否原生处理,以及延迟和限制。

06 / 人工智能

真正的秘密是损失管理

每次转录、抽帧、缩图、压缩和 token 化都在舍弃资讯。好的多模态系统不是假装没有损失,而是知道任务需要保留甚么:读收据要高解像文字,理解会议要分辨说话者,分析动作要保留时间顺序。

多模态的上限,往往由最早被丢掉的那一点决定。

看见不代表量得准

视觉模型可以描述一张图的主题,却未必适合从图表读取精确刻度、比较两条几乎重叠的线,或从低解像收据核对小数点。语义理解和测量精度是不同能力。

需要数字时,OCR、图表解析或原始资料往往比一句自然语言描述可靠。把「大致看懂」包装成「精确读取」,是多模态产品最容易出现的能力错配。

即时语音再多一条延迟链

语音对话的自然感由多段延迟相加:侦测你何时说完、辨认语音、模型思考、合成声音、传送及播放。任何一段抖动都会变成抢话、停顿或重复。

全双工系统甚至要在你尚未说完时预测是否应继续听。多模态体验看似一个模型,产品上却是一条需要同步的时间管线。

07 / 人工智能

最容易被忽略的不是模型看不到,而是它看到的版本已经被处理过。

影片可能只抽取几格;电话录音先被转文字;图片内的小字被压缩;一段声音的语气和背景杂音也可能在转换中消失。模型作答时,未必直接接触原始现场。

所以检查单据、看工地相片或整理会议录音时,介面要让人知道哪些内容是原始、哪些是转录、哪些只是模型推断,否则错误会穿上『我亲眼看过』的外衣。

08 / 人工智能

多模态不是魔法拼图

把四种输入放在同一个视窗,不代表它们已经对齐。时间轴、指代、视角和档案版本仍然要处理;愈多媒介,愈多可能的错位。

先由一个窄问题开始,通常比一次叫模型看完整个资料室更可靠。

09 / 人工智能

读者最常问

模型看相片准不准?
要视乎文字大小、角度、光线和任务;涉及金额、身份或安全时,仍应由人核对原图。

影片应该完整上载?
不一定;按问题抽取相关时间段可以减少成本,但要小心漏掉前后文。

声音转文字后可以当原文?
转录是有用的工作副本,但专有名词、语气和多人交谈可能出错。

资料注脚

资料注脚

  1. platform.openai.com/docs/guides/images
  2. platform.openai.com/docs/guides/audio

来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee