跳至项目正文
Qingping Champ
全部项目
全模态检索源码公开2026

Tessmora

统一检索多种模态,回答都能追溯来源

如何让每种模态都用适合自己的方式检索,再一起生成能核对来源的回答?

四种模态分别处理,再经检索与融合生成附有引用的回答

项目背景

Tessmora 为文档、图像、音频和视频分别安排解析与 Embedding 流程。先通过 One-Pass 意图分析和知识库画像确定搜索范围,再进行稠密、稀疏、视觉、音频和视频检索。结果经过加权 RRF 融合与 Cross-Encoder 重排序后,可以直接生成回答,也可以在预算内通过多轮只读检索补充依据。

处理流程

分别检索,统一回答,附上来源

  1. 01按模态接入数据
  2. 02知识库画像路由
  3. 03五路检索与重排序
  4. 04直接回答或在预算内多轮检索
  5. 05通过 SSE 按类型发送引用

设计取舍

按模态选择处理方式

文档通过 Agentic 分块保留原文语义;图像使用 VLM 描述和 CLIP;音频使用 ASR 和 CLAP;视频围绕语义镜头建立索引,并对齐字幕、语音和关键帧画面。这样处理,是为了保留各类来源的特点,避免将它们一律转成纯文本。

先选知识库,再排检索结果

未指定知识库时,系统根据主题画像,选择一个、多个或全部相关知识库。随后将稠密、稀疏、视觉、音频和视频检索的候选结果通过加权 RRF 融合,再用 Cross-Encoder 重排序,筛出更相关的内容。

多轮检索,也要有上限

Agent 模式会拆出相互补充的子查询,每一轮都通过同一个只读检索器并行执行。检索轮数、查询次数和证据量都有预算限制。最终流式输出时,回答正文与不同类型的引用信息分别发送。

设计原则

设计原则与使用限制

  • 保留各模态的特点
  • 回答要有出处
  • 给 Agent 设定资源预算
  • 说清自行部署的条件与限制
下一个项目

Adaptive Index