首页 /文章 /多模态 RAG——图文检索与跨模态排序

多模态 RAG——图文检索与跨模态排序

多模态 RAG 的检索与排序方法。讨论纯文本 RAG 的局限,对比三种跨模态嵌入路线,说明图文对齐切分与查询路由设计,并给出排序与评估方法。

多模态RAG图文检索跨模态排序
分类:应用开发 › 多模态应用 发布于 2026-09-22 15 次浏览

一 纯文本 RAG 的天花板

大量真实知识以"图 + 文"形态存在:产品手册的图解、设备的爆炸图、学术论文的架构图、电商的商品图与详情页。纯文本 RAG 面对这些内容只有两条路——OCR 转文字(丢掉空间 / 视觉信息)或完全跳过。多模态 RAG(Multimodal RAG)的目标是让检索原生地处理"图与文在同一空间里可比",使"看着一张报错截图问怎么修"这类查询成为可能。

先区分两种形态:① 图像内容检索(给一张图找相似图 / 找含该图的文档)② 图文联合问答(用一张图 + 一段文字共同作为查询,检索图文混合库)。多数业务同时需要两者,但冷启动建议先做①,门槛低。

二 嵌入层:跨模态统一空间的构建方法

路线做法优势代价
双塔跨模态模型CLIP 类模型把图 / 文各自映射到同一向量空间,直接算相似度一次推理出两向量;检索快(双塔可离线建库)细粒度理解弱(图内文字、小物体易漏);CLIP 类对中文 / 专业领域词偏弱,需微调或换 ColPali 类
文档 VLM 直接嵌入(如 ColPali 类)用视觉语言模型(VLM)处理"整页文档图像",输出 patch 级 token 嵌入,查询侧 VLM 出 query 嵌入,用 Late Interaction(MaxSim)算分保留版面 / 表格 / 图表细节;对截图 / 手绘图 / 仪表盘友好存储膨胀(每页向量 = patch 数 × 维度);检索计算重(MaxSim 不可纯 ANN,需近似)
OCR + 文本 RAG + 图像元数据图像做 OCR 转文本进文本库,原图作为附件挂元数据;查询走文本检索,命中后带出原图改造最小(复用现有文本 RAG);OCR 技术成熟丢空间信息;扫描质量差 / 手写 / 复杂图表 OCR 错误率高;"看着图问"类查询仍不支持

工程选择的经验分界:以结构化文档为主 + 查询以文字为主 → OCR + 文本 RAG 起步;查询本身带图(截图 / 拍照)或文档以图表为主 → 直接上双塔 / ColPali 类跨模态嵌入。大量团队的两段式路线是:第一阶段 OCR + 文本库上线拿收益,第二阶段加跨模态塔升级"图查询"能力(两库并存,按查询是否带图路由)。

三 数据切分:图文对齐的基本单元

  • 页 / 图块为原子:文档按页(或渲染后的图像块)切,每页保留"原图 + 页文本 + 页元数据(来源 / 时间 / 章节)"三元组。只切文本不挂原图,等于丢掉一半信息。
  • 图文绑定规则:图与说明文字绑定(图注 / 图标题优先与图形成 chunk);跨页大图(流程图 / 全景图)要作为一个整体 chunk,不要按页拆(拆了语义断)。
  • 表格的特殊处理:复杂表格 OCR 成文本易错,优先保留"表格原图 + 表格结构化(表格检测模型转 markdown / 表格)"双表示,检索走结构化文本,展示走原图。
  • 缩略图与全图并存:存储层存原图(展示 / 回溯用),检索层用缩略图或 patch 嵌入(省存储 / 加速),两者通过 chunk ID 关联。
  • 元数据即过滤器:模态(图 / 文 / 混合)/ 来源 / 时间 / 标签作为结构化字段,检索时按 need 过滤——"只要图" / "只要 2024 之后的"等查询条件落到元数据层,不进向量检索。

四 查询理解:识别"哪种查询走哪条路"

查询类型识别信号路由
纯文字查询(库有图)query 无图文字跨模态嵌入 → 图文库混合检索;或先文本库,命中后关联同 chunk 的图
图 + 文字查询query 带图 + 可问图嵌入 + 文嵌入联合打分(图嵌入权重按 query 类型调:纯图问权重高)
纯图查询(以图搜图)query 只有一张图图嵌入 → 图像库 ANN,返回相似图 + 所在文档
截图 / 报错图查询query 图含报错文本 / 界面优先"图内 OCR 文本 + 界面语义"双通道:OCR 出的文本走文本检索(关键词命中),整图走视觉嵌入(界面相似性)

查询路由本身是轻量分类(有图 / 无图 / 图含文字),用规则 + 简单分类器即可,不必上 VLM。关键设计:同一查询同时走多路,结果融合(文字路 + 图像路 + 几何路),各路 top-k 按 RRF(Reciprocal Rank Fusion)合并——单路检索都有盲区,融合是召回率的保险。

五 跨模态排序:谁排前谁排后

  • 分阶段打分:第一阶段双塔粗排(召回 top-100)→ 第二阶段 VLM / 交叉编码器精排(top-10)。精排阶段用 VLM 直接判断"这段图文内容是否回答了该查询"(yes / no + rel 分数),比单纯向量相似度更能捕捉细粒度匹配(图内文字、图表数据)。
  • 模态一致性调整:query 带图时,检索结果的"图部分"权重提高;query 纯文字时,"文部分"权重高。权重不是固定值,按查询意图分类器动态调(或做 A/B 后定经验值)。
  • 版面感知(中高档位):文档检索加版面感知(表格 / 图表 / 段落 / 标题的结构信息),精排时"命中表格区域"的 chunk 比"命中散文区域"的 chunk 权重高(对数据类查询尤甚)。版面检测用现成模型(DocLayout / LayoutLM 类),成本可控。
  • 多样性去重:同一文档的多页 / 多图会占据 top-k("连中"),按 chunk 来源文档去重(每文档最多 N 个 chunk,N=2-3),保证 top-k 覆盖多个文档。
  • 无答案兜底:跨模态检索的"无命中"比纯文本更常见(图与 query 语义弱相关);top-1 分数低于阈值时走"未检索到相关图 / 文"的拒答模板,不要硬推低相关结果(多模态"宁可无"的阈值应比纯文本更紧)。

六 评估:多模态 RAG 的评估方法

  • 评测集要含图:黄金集 = (查询[文 / 图 / 图文],期望命中的 chunk ID[图文],期望答案要点)。纯文字黄金集跑多模态系统 = 没测到核心能力,必须补"图查询"子集(每模态 ≥ 30 条)。
  • 双指标分开算:图像检索用 mAP / Recall@k(以图搜图场景),图文联合问答用忠实度 + 相关性(同纯文本 RAG 评估框架,见本站《RAG 系统评估》)。两指标不可互替。
  • OCR 质量单独评估:若走 OCR 路线,OCR 的字符错误率 / 表格结构错误率要单独统计——OCR 错 → 检索一定错,OCR 是多模态 RAG 的隐形地基。
  • 人评校准:多模态"相关性"比纯文本更主观("图相关"的边界模糊),LLM-judge 对图的判断能力有限;每季度抽 50 条人评,与 judge 分对比,偏差大则调整 rubric 或人评比例。

七 成本与性能

环节成本特点优化方向
图像入库(向量化)双塔:每图一次推理,GPU 秒级 / 图;ColPali 类:每页 patch 数多,10-30 倍于单图批量推理 + 离线跑;增量入库(新文档才向量化)
存储ColPali 类:10 万页文档 ≈ 10 万 × patch 数(≈100)× 768 维 ≈ 60GB(fp32);双塔:≈ 几十 GB(每页一向量)fp16 / int8 量化(精度损失可控);冷热分层
检索延迟双塔:百毫秒级(标准 ANN);ColPali MaxSim:1-3 秒(需近似算法)MaxSim 近似(Faiss IVF + 图索引);两级检索(粗排 + 精排分桶并行)
精排(VLM)每条 top-k 过 VLM,1-5 秒 / 条(GPU)只精排 top-20 → top-5;VLM 用轻量级(2B-7B 级)即可

经验值:中等规模(10 万页文档)的多模态 RAG,GPU 总成本(入库 + 检索)约为同规模纯文本 RAG 的 3-8 倍,主要贵在 VLM 嵌入与精排。预算紧的起步方案:双塔(CLIP 类)+ 少量 VLM 精排,成本约为 ColPali 全量的 1/3。

八 常见误区

误区问题
"上 CLIP 就能搞定"CLIP 类模型对中文 / 专业词汇 / 图内文字弱;文档场景要选文档特化模型(ColPali / 文档 VLM 类)或微调
"OCR 是过渡方案,以后会没"OCR 路线在"文字为主查询"场景长期有效(成本 1/10);多模态嵌入是补充不是替代,两路线并存是常态
"向量检索能解决所有匹配"图内文字、精确数值(型号 / 参数)依赖关键词 / OCR 通道;纯向量相似度对数字不敏感,混合路融合是标配
"图片越大质量越高"过大的图(4K 扫描)向量化成本线性涨,细节收益递减;入库前统一缩放到合理分辨率(短边 1024-2048)
"与人交互无关,纯检索工程"多模态 RAG 的"展示层"(图怎么呈现 / 视频怎么回放 / 表格怎么展开)是体验关键,常被工程团队忽略
"评测集沿用纯文本 RAG 的"没有图查询子集的评测,多模态能力无法度量;评测集必须按模态分层构建

九 落地清单

  • 第 1 周:盘点文档模态分布(纯文 / 图文 / 图表占比),决定起步路线(OCR+文本 vs 直接跨模态)
  • 第 2 周:数据管线——文档渲染成页图 + OCR + 结构化表格 + 元数据,三元组落库
  • 第 3 周:选嵌入模型(CLIP 类 / ColPali 类 / 微调)建索引;多路检索(文字 / 图像 / 关键词)+ RRF 融合跑通
  • 第 4 周:精排(VLM top-20 → top-5)+ 模态权重调参 + 无答案兜底
  • 第 5-6 周:评测集(按模态分层)建立;黄金集跑通三指标(图检索 mAP / 联合问答忠实度 / 相关性)
  • 第 7-8 周:展示层(图 / 表格 / 视频呈现)+ 成本监控(向量化吞吐 / 检索延迟 / 存储)+ 增量入库流程

一句话收束:多模态 RAG 的本质是"让图文在同一空间可比",但工程上的稳态是"多路并存、融合排序"——文字路、图像路、关键词路各管各的盲区,融合层把召回兜住,精排层把排序拉准。单路"全能"是许愿,多路"分工"才是工程。

关键词 多模态RAG图文检索跨模态排序 000060