
缘起
Tessmora 不把所有内容都压成文本。文档、图片、音频与视频保留各自适合的解析单元和专用向量,再由知识库画像路由、混合检索、两阶段排序与有界 Agent 汇入同一套回答链路。
设计札记
记录每一处取舍背后的思路
不同模态,各自完整
文档使用无损 Agentic Chunker,图片使用 VLM 与 CLIP,音频使用 ASR 与 CLAP,视频使用 Scene、Shot 与 Key Frame 分层建模,避免统一转文本造成的信息损失。
检索先找范围,再找证据
One-Pass 意图与知识库画像决定检索范围,Dense、Sparse、Visual、Audio、Video 五路召回经过动态 RRF 与 Cross-Encoder 排序后进入证据池。
Agent 只补证据缺口
复杂问题会被拆成互补子查询并发补查,系统对轮数、查询数、证据池和停止条件设置预算。最终引用保留来源、媒体位置、时间范围与上下文窗口。
创作准则
有所为,也有所不为
- 模态不被降维
- 回答绑定证据
- Agent 有明确预算
- 私有化边界清楚
实现与图谱
来自当前产品界面、系统架构与视觉研究的真实材料。


下一篇
墨韵江湖
把个人表达收进一卷持续生长的数字古籍