词语搭配强度分析
用于在一批语料里区分"真正的固定搭配"与"碰巧同现"——比如政策关键词周围反复出现的形容词、品牌名常被用户怎样修饰、动词在这批材料里的典型宾语。
系统会在候选词对的左右窗口内统计共现次数,对照"两词独立出现时的理论次数",用 7 种主流关联强度指标同时打分(PMI、MI3、LL、T-score、Z-score、Dice、LogDice),把"的、和、the、of"这类高频却无意义的功能词从前列剔除。
报告同时支持节点模式(给出中心词的典型搭配伙伴清单与关系网络图)和全局模式(整批材料中所有显著的二词组合),并提供多指标 Top 20 横向对比,被多个指标共同推到前列的搭配最不依赖统计口径偏好。
既适合词典编纂整理地道说法例句,也适合政策研究对比同一关键词周围形容词随时间的变迁。
加载文件上传组件中...
节点词数量越多,需要的语料就越大;建议一次 1-10 个,配合至少 1 万字的语料。
5 词
节点词左边几个词内算"共现"。
5 词
节点词右边几个词内算"共现"。
默认关闭:窗口在句号/换行处截断,更接近真实搭配关系。
3 次
过滤"只共现 1-2 次"的偶然搭配。短文本设 2-3,长文本可设 5-10。
强烈建议开启:否则结果排行的最前列大概率会被【的、是、和、了、the、of、a】这类高频功能词淹没。
每 20,000 字 2 点
