文本相似度去重雷达

用语义向量两两比较材料里的每条文本,找出意思相近的文本对,并把相互相似的文本归成一组,给出每组的条数、组内平均相似度、最具代表性的一条原文和高频词,以及重复文本占全部文本的比例。多份材料一起分析时,会标出同一组内容分散在几个文件里。判断依据是意思是否相近,用词不同也可能判为重复。

两种模式:近似复制与合并找高度相似、可直接合并的文本对;同义改写嫌疑找语义仍接近但用词差别明显的文本对,按语义相似度与字面差异度给出改写嫌疑分,并逐词标出两条文本改动在哪里。判定重复的相似度阈值、成组所需的最小条数都可以自己设定。

两种模式共用同一套语义向量与场景预设;仅筛选区间与列表解读不同,计费一致。

找高度相似、适合去重合并的句子对;阈值通常 0.8+。

加载文件上传组件中...
180 个字符

仅在上传内容缺少有效分行或分段时触发;窗口越小,切出的句段越短。

根据文本来源选择预设,系统会自动调整分词、停用词和相似度置信区间。

适用于问卷开放题、用户评价,强化短句语义聚合能力。

82%

推荐:调研反馈 0.8,政策/公文 0.85。

3条

控制去重雷达中的最小聚类粒度,建议≥3以获得稳定的模式。

中文和双语材料通用,适合批量相似句段查找与重复合并。

兼顾召回与准确度,自动调节不同文档长度的影响。

输入多个关键词用顿号或逗号分隔,将在雷达图中单独标注。

已识别 0 / 500 个词

一行一词,也可写成【词 词频 词性】。填写后这些词按整词处理,专名和术语不会被切碎。

已识别 0 / 500 个词

填写后这些词在比较相似度前被去掉。系统停用词始终生效。

每 10,000 个字符 5 点