同一个观点常常会换一种说法。“配送速度比页面承诺的慢很多”和“配送时效需要改进”没有使用完全相同的词,但都在表达交付等待过长。只搜“物流”或“配送”容易漏掉部分回答,相似句查找会把整条句段转成可比较的语义表示,再按接近程度筛选候选。
系统会先形成相似句段对,再把彼此接近的记录组织成聚类。配对适合回答“哪两条特别像”,聚类适合回答“哪些记录大致属于同一组”。开启精准复核后,高相似候选会再经过一次排序,列表通常更接近人工判断,但处理时间也会增加。
相似度用于排序和筛选,不证明观点一定相同。阅读结果时仍要核对原文、来源、记录编号和聚类代表文本。
适用文档
问卷开放题、用户评价和客服反馈通常一行表达一个主要问题,适合按行比较。教程配套的 实例.txt 包含54条虚构用户反馈,每行一条完整记录,覆盖配送、包装、客服、退款、价格、稳定性、质量、操作、搜索和通知等主题,可直接用于按行模式练习。
访谈稿、研究摘要和报告更适合按段落比较。自然段应保持一个完整观点;同时混入背景、方法和建议会让结果难以解释。先按观点边界整理段落,通常比降低查找范围更有效。
口语化评论、帖子和投诉记录可选择对应的文本来源。极短标签、纯数字、网址和联系方式缺少足够语义,不适合作为主要比较对象。
文本不足两条有效内容时,系统会按设置窗口自动分段。已有清楚行列或自然段时,应优先使用原有结构,避免切开完整观点。
使用步骤
第一步:确定比较单位。配套实例一行一条反馈,因此选择按行;访谈或报告改为按段落。比较单位决定哪些文本会被两两比较。
第二步:选择查找范围。标准适合首次浏览;宽松适合探索主题边界;严格只保留更接近的句段,便于控制复核量。
第三步:匹配文本来源。配套实例使用问卷/反馈。来源设置以材料的表达方式为准,不以分析者所在行业为准。
第四步:决定是否开启精准复核。配套实例保持开启。若只想试探查找范围,可先关闭,确定范围后再开启。

第五步:先读相似句段概览。查看有效文本、触及相似对的记录占比、相似句段对数和聚类数量,再决定从配对还是聚类进入。


第六步:查看高相似句段对。报告并排展示文本A与文本B,并保留来源、编号和相似度。优先核对列表前部,同时确认具体诉求是否一致。

第七步:展开相似聚类。每组显示代表文本、规模、平均与最高相似度、跨文件数量和高频词,展开后可查看组内原文。

第八步:用热力矩阵和雷达图交叉检查。两者用于快速定位,不替代配对原文和聚类明细。

参数解析与对比示例
| 参数 | 说明 | 默认值 |
|---|---|---|
| 比较单位 | 按行或按段落形成独立比较记录 | 按行比较 |
| 自动分段窗口 | 有效内容不足两条时,按50至400字的目标长度自动分段 | 180字 |
| 查找范围 | 宽松、标准、严格三档;越严格,保留的候选通常越接近 | 标准 |
| 文本来源 | 问卷/反馈、文档/段落、客服/投诉、社媒/帖子 | 问卷/反馈 |
| 精准复核 | 对候选结果再次排序,提升列表与人工判断的一致性 | 开启 |
| 完成后邮件通知 | 控制是否发送完成提醒,不改变分析结果 | 关闭 |
配置一:配套实例首次分析。使用按行、问卷/反馈、标准范围并开启精准复核。实例已有54条记录,不会触发自动分段。先看配送、包装、退款、搜索和通知是否形成候选组。
配置二:探索主题边界。把范围调为宽松,观察“客服回复慢”和“退款进度不清楚”是否进入相近候选。出现混合组时,再按具体问题拆分。
配置三:控制复核量。把范围调为严格,寻找接近改写的配送延迟或搜索不准表达。结果较少只说明通过当前条件的句段更接近。
案例分析
案例一:归拢配送与包装反馈。背景是对配套实例中的54条问卷回答做首次整理。配置使用按行比较、问卷/反馈、标准范围和精准复核。实例中的“这次下单后等了快一周才收到,配送速度比页面承诺的慢很多。”和“页面写着三天送达,实际第六天才签收,配送时效需要改进。”应作为配送延迟组的复核重点;“外箱收到时已经压扁,里面的盒子也有明显折痕,送人不太合适。”和“快递盒没有破,但内部缓冲材料太少,产品在盒子里来回晃动。”则属于包装保护问题。预期观察是两类内容分别出现在靠前配对或相似聚类中。若两类内容混在同组,应按具体诉求拆分。结论是先用候选组缩小阅读范围,再建立配送时效和包装保护两个标签。
案例二:比较宽松与严格范围。背景是客服响应、退款等待、搜索不准和通知频繁都包含负面体验,但具体问题不同。先用宽松范围观察服务体验边界,再切换严格范围核对近义表达。实例中的“咨询售后问题后很久才收到回复,等待期间不知道处理到哪一步。”和“客服响应速度偏慢,同一个问题隔了一天才有人继续跟进。”应重点检查是否形成响应速度候选;“退货已经签收,但退款迟迟没有到账,我需要反复查看处理进度。”和“退款步骤不复杂,主要问题是审核和到账等待时间比预期长。”应作为退款时效候选。预期观察是宽松设置可能出现跨子主题记录,严格设置更集中于同一具体问题。结论是宽松适合发现边界,严格适合确定核心成员。
类似功能对比
| 功能 | 适合的问题 | 主要结果 |
|---|---|---|
| 相似句查找 | 找出措辞不同但含义接近的句段 | 相似句段对、聚类、热力矩阵、雷达图与明细 |
| 文本相似度去重雷达 | 发现近似复制并评估重复模式 | 重复率、高相似文本对、聚类与重复模式 |
| 重复内容合并 | 为相似记录生成归并方案 | 建议保留文本、可归并记录与合并映射 |
| 语料检索 | 按明确条件定位词语及上下文 | 命中位置、上下文与检索明细 |
