精选深读Hugging Face08:00
使用Sentence Transformers的多向量(后期交互)嵌入模型
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers
多向量后期交互嵌入兼顾检索精度与效率,适合大规模语义搜索,但推理成本更高
判断
检索栈负责人要把多向量模型从实验项提到候选:当查询需要精确标识、长条款或扫描页免 OCR 时,接受索引膨胀与逐词元打分开销;若索引预算固定,则继续用单向量稠密模型,不因 v6.0 支持加载就迁移。
依据
Hugging Face 博文作者 Tom Aarsen、Antoine Chaffin、Raphael Sourty 称,Sentence Transformers v6.0 新增 MultiVectorEncoder(多向量编码器),可把 PyLate、Stanford-NLP ColBERT 以及 colpali-engine 的视觉文档检索模型按同一 API(应用接口)载入。机制上,稠密模型把整段文本压成一个 384、768 或 1024 维向量;多向量模型给每个 token(词元)保留一个 128 维向量,9-token 文档变成 9x128 矩阵而非 1x128 向量。打分用 MaxSim(最大相似度求和):每个查询 token 取与文档任一 token 的最高相似度,再把这些最大值相加。因为向量做了 L2 归一化(长度归一化),每个点积是 [-1,1] 的余弦相似度,总分落在 [-num_query_tokens, num_query_tokens]。代价也在这里:文档仍可离线编码索引,但查询时要比较每个查询 token 和每个文档 token,索引更大、打分更重;cross-encoder(交叉编码器)准确却无法预计算,bi-encoder(双编码器)一次点积最快却丢失 token 级匹配。作者把视觉文档检索标为可直接用文本查询匹配页面图像、无需 OCR(光学字符识别)的 state of the art(当代最佳)。
- 单向量:整段文本384、768 或 1024 维
- 多向量:每词元128 维
- 9-token 文档:单向量1x128 向量
- 9-token 文档:多向量9x128 矩阵
没写清 材料没给索引膨胀倍数、MaxSim 查询延迟增量或相对稠密模型的召回基准,因此不能替它量化迁移收益。
下一步 下一步核对官方 Example Scripts(示例脚本)与文档,确认 MultiVectorEncoder 在目标语料规模下的索引占用和查询延迟是否落在预算内。