语料检索
用于在文档里,按相关度找出对某个问题或概念最贴题的段落、句子或整篇文档,并直接在原文里高亮命中位置。
提供BM25关键词检索与在 BM25 候选基础上叠加语义匹配的深度模式两种算法,字面关键词命中与意思相近但用词不同的内容都能被找出来;可批量提交多条查询,每条独立给出 Top-K 结果与相关度分布。
报告自动汇总命中率、资料覆盖率、最贴题的查询与最高产的文件,并按查询逐条展示 Top-K 片段;既能用于综述论点的原文定位,也能用于访谈材料里相同话题的集合归拢。
适合在政策文件、报告与会议纪要里检索某个议题的支撑原文,也适合从大量客户访谈里把谈到同一话题的所有发言聚拢对比。
支持一篇或多篇 txt 文本文件。
加载文件上传组件中...
默认手动输入查询;开启自动查询关键词后,会用语料里的高频词前 10 名自动检索。
开启后无需填写查询词
已识别 0 条查询。
停用词会从自动查询关键词、召回分词和结果高亮中排除。
默认;按文档长度和段落结构选择整篇、段落或句子,也可手动指定
固定使用 Reranker 深度语义检索:先召回候选片段,再通过语义重排找出最贴题内容。
10
建议 5–20 条;放太多会混进相关度较低的边缘片段。
60
命中位置左右各保留多少字作为带高亮的预览。
0.60
往左偏:保留更多候选召回的排序影响;往右偏:更看重意思接近。常用 0.5–0.7。
×5
先快速捞出 Top-K × N 个候选,再做语义精排。倍数越大越不容易漏,但稍慢。
每 20,000 字 2 点
