词语共现分析

在设定的窗口内(左右各 2~15 个词)找出反复一起出现的词,可以看两个词一组,也可以看三个词或四个词一组。每组搭配同时给出三项判断:互信息看这种同现比随机碰上高出多少,T 值看搭配是否稳定到不像偶然,对数似然比看证据有多强,三项一起看比只数出现次数可靠。

还会记录两个词谁在前、谁在后,避免把顺序相反的两种搭配混成一个。可按词性只保留需要的词类,也可加载自定义词典和停用词表。多份材料一起分析时,同一组搭配在各篇里的强度可以横向比较。

加载文件上传组件中...
左右各 5 词

窗口越大,捕捉的共现范围越广,但噪声也会增加。默认 5 适合多数中文书面语料。

已识别 0 / 500 个词

一行一个词,也可写成 词 词频 词性(空格分隔);逗号、顿号、分号或换行分隔均可。

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 后,用上方的导入按钮加入

分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。

已识别 0 / 500 个词

每 10,000 个字符 2 点