文章目录+
01 / 人工智能
不同媒体先变成模型可处理的单位
所谓融合,先是一连串翻译。
一张相片看起来很清楚,模型眼中的版本可能已经缩细、抽取、转成另一种表示。你以为它看了原图,其实它看的是加工后的影子。
影片可能只抽取几格;电话录音先被转文字;图片内的小字被压缩;一段声音的语气和背景杂音也可能在转换中消失。模型作答时,未必直接接触原始现场。
02 / 人工智能
共同空间不等于共同理解
模型可以把猫的图片与「猫」拉近,却可能在细小文字、空间位置、声调反讽或影片前后因果上失手。每个 modality 有自己的资讯密度与盲点。
把四种输入接上,不会自动补回任何一种输入在编码时失去的细节。
开会录音转文字尤其容易出现这种落差:语气没有了,人名错了,背景那句重要提醒也消失了。
所以检查单据、看工地相片或整理会议录音时,介面要让人知道哪些内容是原始、哪些是转录、哪些只是模型推断,否则错误会穿上『我亲眼看过』的外衣。
03 / 人工智能
影片不是很多张图片那么简单
如果只抽几帧,系统可能看见杯在桌上和杯在地上,却不知道是谁推倒、次序如何。声音亦不只是逐字稿:停顿、重音、背景声和说话者重叠都可能承载意思。
多模态最困难的地方往往是时间对齐,而不是单张图辨识。
多模态好玩,但涉及钱和安全时,原档仍然是最后话事人。
把四种输入放在同一个视窗,不代表它们已经对齐。时间轴、指代、视角和档案版本仍然要处理;愈多媒介,愈多可能的错位。
04 / 人工智能
模态之间可以互相纠错,也可互相带偏
模糊图片配上正确旁白可改善判断;错误字幕亦可令模型忽略眼前证据。当文字和图片冲突,模型偏向哪一边取决于训练与任务。
使用者看到「它既看又听」,容易以为有两份独立证人;实际上两者可能早已在同一模型内互相污染。
05 / 人工智能
输出模态是另一个问题
能理解图片不代表能准确生成图片;能听广东话也不代表能以自然广东话声线即时回应。输入编码、跨模态推理和输出生成是不同能力链。
产品标示「multimodal」时,最值得问的是支援哪些输入与输出、能否原生处理,以及延迟和限制。
06 / 人工智能
真正的秘密是损失管理
每次转录、抽帧、缩图、压缩和 token 化都在舍弃资讯。好的多模态系统不是假装没有损失,而是知道任务需要保留甚么:读收据要高解像文字,理解会议要分辨说话者,分析动作要保留时间顺序。
多模态的上限,往往由最早被丢掉的那一点决定。
看见不代表量得准
视觉模型可以描述一张图的主题,却未必适合从图表读取精确刻度、比较两条几乎重叠的线,或从低解像收据核对小数点。语义理解和测量精度是不同能力。
需要数字时,OCR、图表解析或原始资料往往比一句自然语言描述可靠。把「大致看懂」包装成「精确读取」,是多模态产品最容易出现的能力错配。
即时语音再多一条延迟链
语音对话的自然感由多段延迟相加:侦测你何时说完、辨认语音、模型思考、合成声音、传送及播放。任何一段抖动都会变成抢话、停顿或重复。
全双工系统甚至要在你尚未说完时预测是否应继续听。多模态体验看似一个模型,产品上却是一条需要同步的时间管线。
07 / 人工智能
最容易被忽略的不是模型看不到,而是它看到的版本已经被处理过。
影片可能只抽取几格;电话录音先被转文字;图片内的小字被压缩;一段声音的语气和背景杂音也可能在转换中消失。模型作答时,未必直接接触原始现场。
所以检查单据、看工地相片或整理会议录音时,介面要让人知道哪些内容是原始、哪些是转录、哪些只是模型推断,否则错误会穿上『我亲眼看过』的外衣。
08 / 人工智能
多模态不是魔法拼图
把四种输入放在同一个视窗,不代表它们已经对齐。时间轴、指代、视角和档案版本仍然要处理;愈多媒介,愈多可能的错位。
先由一个窄问题开始,通常比一次叫模型看完整个资料室更可靠。
09 / 人工智能
读者最常问
模型看相片准不准?
要视乎文字大小、角度、光线和任务;涉及金额、身份或安全时,仍应由人核对原图。
影片应该完整上载?
不一定;按问题抽取相关时间段可以减少成本,但要小心漏掉前后文。
声音转文字后可以当原文?
转录是有用的工作副本,但专有名词、语气和多人交谈可能出错。
资料注脚
资料注脚
来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。