[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:wen-ben-ju-zhen-fen-xi-gong-ju-shi-yong-jiao-cheng-gei-duo-fen-cai-liao-ding-he-xin-ci-kan-ci-yu-ci-zen-mo-bao-tuan":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":36,"createdAt":37,"updatedAt":38},"6a362dd763012f7eb231a001","6804358a59ddd2c7c898172e","文本矩阵分析工具使用教程：给多份材料定核心词、看词与词怎么抱团","\u003Cp>文本矩阵分析做的事情可以概括成三步：定词表、看结构、回原文。\u003C\u002Fp>\u003Cp>第一步是切段与分词。系统先把材料切成「文档段」，纯文本按词数窗口切段，CSV 则把每一行聚合成一个文档段，再分词、去停用词。切段的目的是给后面的统计一个「文档」单位，TF-IDF 和共现都依赖这个单位来计算。\u003C\u002Fp>\u003Cp>第二步是挑出重要词。系统在文档—词条频数矩阵上做 TF-IDF（词频—逆文档频率）加权，挑出在本批材料里区分度最高的词，而不是单纯最频繁的词。常见的「的、了、我们」这类词在每段都出现，区分度低，会被压下去；只在部分文档里集中出现的词，往往更能代表材料的差异。你可以指定重点关注词，这些词即使词频不高，也会被优先保留进重要词表。\u003C\u002Fp>\u003Cp>第三步是看结构、回原文。两个词在同一文档段里同时出现，就记为一次共现。系统把高共现的词对连成邻接强度矩阵和关系网络，再按「重要词之间是否存在共现边」做简易连通分组，方便你快速浏览话题块。每个重点词和高共现词对都配有原文证据，标注命中段落位置和代表片段，方便你回原文核对关联是否真的成立。报告会按你选择的使用场景（通用材料梳理、论文综述、问卷开放题、用户反馈、政策通知、访谈初筛、作文作业）组织阅读顺序和核对问题。\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>这个功能更适合「多份、成批」的材料，而不是单篇长文。一批问卷开放题答案、几十场访谈转录、几十篇论文摘要、十几份政策文件，都是典型的输入。原因在于 TF-IDF 和共现都需要足够多的文档段做对比，材料越成批，区分度和共现强度越稳。单篇很短的文本切不出足够文档段，重要词和共现都容易失真，这时结果只能当作粗略参考。\u003C\u002Fp>\u003Cp>文本质量会直接影响结果。网页导航、表头、页脚、重复模板和乱码会制造虚假的高频词和虚假共现，让一些格式词混进重要词表。一般来说，先把正文清理干净再分析，词表会更干净。如果你发现重要词里出现了大量符号或重复短语，通常是原文没清干净，建议回头检查。\u003C\u002Fp>\u003Cp>语言和分词也要留意。中文需要先分词，专有名词如果被切开，会产生不存在的词对，比如把一个机构名拆成两个普通词后，它们的共现就失去了意义。遇到这种情况，可以用自定义词典把专名固定下来。英文材料同样可以处理。\u003C\u002Fp>\u003Cp>预处理方面有两点值得检查。一是停用词，如果停用词表过窄，「的、了、和」这类词可能挤进词表，挤掉真正有信息量的词，可以补充停用词。二是词性过滤，如果你只想看名词和动词这类实词，可以在分词阶段过滤掉副词、连词、介词等虚词，让词表更聚焦。\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：先想清楚你要回答的问题。问卷开放题通常问「用户最集中提的是什么」；文献综述通常问「该用哪些词作为分类起点」；政策材料通常问「哪些概念是稳定表述、哪些只是套话」；访谈初筛通常问「该从哪些概念开始编码」。问题不同，选的场景和看的指标也不同。\u003C\u002Fp>\u003Cp>第二步：选择使用场景。在「你准备用它做什么」里选一个最接近的场景。这个选择只影响报告的阅读顺序、核对问题和下一步建议，不改变分词、矩阵和共现的计算结果，所以可以放心按用途选。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F64c2ac979889dba75090e4193734ac3c.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：设定展示的重要词数量和重点关注词。重要词数量可在 10～50 之间调，材料杂、想多看一些就调大，想聚焦头部就调小。如果你心里已经有几个必须盯住的词，填进重点关注词，它们即使词频不高也不会被筛掉。\u003C\u002Fp>\u003Cp>第四步：读顶部的「先看这三件事」。这块按你选的场景给出三个落点：哪些词适合写进标题或摘要、哪些词经常一起出现、先回原文核对哪里。它是整份报告的导航，先看它能少走弯路。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fe0bd6091ba1b3ff9992d06216441d2b5.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第五步：看重要词条排序条形图。条形越长，说明该词在 TF-IDF 口径下的平均重要度越高。你可以把排序依据在 TF-IDF 重要度、词频、文档覆盖率之间切换，交叉验证一个词到底是真重要，还是只是某一篇里特别多。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F7f4bd08efb7fc154637330c96c275f88.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第六步：看词条共现邻接热力图。颜色越深表示两个词同段出现得越多，对角线是词和自己比。这里要注意，它不是皮尔逊相关系数矩阵，而是便于扫读「谁与谁结伴」的邻接强度表。上传多份文件时，可以切换 Tab 看单个文件或全部文件汇总。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Ff9112494ebceb78ecfc5a5075a3433a9.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第七步：用词对核对清单和原文证据定位回原文。词对核对清单把高共现词对整理成可筛选清单，列出候选编码、相关词、共现段数、代表片段和核对问题，但不自动命名主题。你顺着代表片段回原文，结合核对问题判断这条线索是保留、改名还是删除。原文证据定位则可以单独选一个重点词或词对，查看它命中的位置和片段。确认无误后，可以导出强共现编码手册或词对核对清单的 CSV，带进后续编码工作。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F5af95b90222337065460a7154d848d31.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第八步：看词汇关系网络。节点是重要词，连线表示经常同现，节点越大重要度越高。你可以把网络节点数在 10～30 之间调，节点少看主干，节点多看细节，拖动节点能展开局部结构，从图上判断材料里有哪些议题簇。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F88babf5e2a0c562ece8548e4e1cc830b.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第九步：看详细统计。这里分三个标签页。文档信息给出文档段数、平均段内词数和矩阵稀疏度；词汇统计给出不同词语总数、入选重要词列数和文档间的余弦相似度；共现分组按连通分量把重要词分块。平均相似度高，说明材料写得像同一类；偏低，说明内容比较散，可能要分组解读。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F0221e1aa41b7758dbdecf8bd3f9d8232.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第十步：参考下一步建议。报告底部会推荐能接着用的工具，帮你把词表变成统计结论或主题结构。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>\u003C\u002Fh2>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>可配置参数如下。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">使用场景\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">决定报告的阅读顺序、核对问题和下一步建议，不改变分词、矩阵和共现计算\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">通用材料梳理\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">展示的重要词数量\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">保留并展示的重要词条数，可在 10～50 之间调\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">20\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">重点关注词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">指定后即使词频不高也优先保留进重要词表，最多 20 个\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">空\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式 \u002F 全模式 \u002F 搜索引擎，影响切词粒度\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选中的词性在分词阶段被过滤掉，仅支持中文\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">不过滤\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义词典\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">让专有名词不被切开，固定为一个词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">不启用\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义停用词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">过滤掉不想统计的词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">不启用\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>三组典型配置供参考。\u003C\u002Fp>\u003Col>\u003Cli>问卷开放题快速编码。场景选「问卷开放题 \u002F 课堂反馈」，重要词数量调到 25 左右，开启词性过滤、只留名词和动词。这样词表更贴近用户真正提到的对象和动作，配合词对核对清单可以快速搭出编码类别。\u003C\u002Fli>\u003Cli>文献综述定主题词。场景选「论文综述 \u002F 文献摘要」，重要词数量调到 10～15，先看头部词作为综述小节候选。如果你已经锁定几个研究方向的关键词，填进重点关注词，确保它们留在表里。\u003C\u002Fli>\u003Cli>政策概念结构梳理。场景选「政策 \u002F 通知材料」，重要词数量调到 30 左右，把机构名、专有术语加进自定义词典避免被切开。重点看共现分组，判断哪些概念抱成一团、是否构成稳定表述。\u003C\u002Fli>\u003C\u002Fol>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：访谈初筛，快速建立编码候选。\u003C\u002Fp>\u003Cp>背景：一位社会学研究者做了 30 场半结构化访谈，转录近 10 万字，不知道该从哪些概念开始编码。\u003C\u002Fp>\u003Cp>配置：场景选「访谈初筛 \u002F 编码准备」，重要词数量设 30，把几个理论上关心的概念填进重点关注词。\u003C\u002Fp>\u003Cp>结果：系统挑出 30 个重要词条，并生成词对核对清单，每一对都标注了命中段落位置和原文片段。研究者顺着核对清单逐条回原文确认关联是否成立，把不成立的词对删掉。\u003C\u002Fp>\u003Cp>结论：核对清单把「从哪开始编码」这件事变成了可逐条判断的任务，原本预计三周的初筛编码，压缩到一周左右完成。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例二：问卷开放题，快速提取高频需求。\u003C\u002Fp>\u003Cp>背景：一个产品团队分析 200 条问卷开放题答案，想知道用户最集中的诉求，但不知道从哪开始归类。\u003C\u002Fp>\u003Cp>配置：场景选「问卷开放题 \u002F 课堂反馈」，重要词数量设 25，开启词性过滤只留实词。\u003C\u002Fp>\u003Cp>结果：重要词条排序里「退换货」「物流」「客服」排在前列；共现热力图显示「退换货」和「尺码」同段出现得很密。团队回原文核对后，确认这批反馈里尺码相关的退换占了不小比例。\u003C\u002Fp>\u003Cp>结论：团队据此把「尺码相关退换」单独立为一个编码类别，归类的工作量明显减少。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例三：政策文件，发现核心概念结构。\u003C\u002Fp>\u003Cp>背景：一个研究团队分析 15 份行业政策文件，想分清哪些是稳定表述、哪些只是套话。\u003C\u002Fp>\u003Cp>配置：场景选「政策 \u002F 通知材料」，重要词数量设 30，把行业专名加进自定义词典。\u003C\u002Fp>\u003Cp>结果：共现分组显示「监管—合规—风险」和「创新—发展—平台」分属两个连通分量，详细统计里的平均文档相似度约 0.18，说明两类政策话语确实存在差异。\u003C\u002Fp>\u003Cp>结论：团队据此把材料分成两组分别解读，并在报告里补充了两套话语结构的对比。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>类似功能对比\u003C\u002Fh2>\u003Cp>文本矩阵分析、高频词提取、词语共现分析都和「词」有关，但落点不同。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">对比维度\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文本矩阵分析\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">高频词提取\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词语共现分析\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">做什么\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">定区分度高的核心词，再看词与词的共现结构\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">按频次和占比统计最常出现的词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">在窗口内扫描词对，用统计指标判断搭配是否可靠\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关注点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">重要词 + 共现结构 + 文档相似度\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">单个词的出现频率\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词对搭配的统计显著性\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">典型问题\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">这批材料从哪开始读、从哪开始编码\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">这批材料里什么词最常出现\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">这两个词的搭配稳不稳\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">输出\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">重要词条排序、共现热力图、关系网络、核对清单\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">高频词表和占比\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词对搭配表、分组聚类、搭配网络\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">典型场景\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">编码候选准备、主题词筛选、概念结构梳理\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">高频词表、简单对比\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">话语口径对比、概念关联验证\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>如果你想要的是「先定一份重要词表，再看它们怎么抱团」，用文本矩阵分析。如果只想看「什么词最常出现」，用高频词提取更直接。如果你已经有词、想确认「这两个词搭不搭」，用词语共现分析做更精细的统计判断。三者可以接力：先用文本矩阵分析定词表、看结构，再用高频词提取或词语共现分析在重点词上深入。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002F96408dcc2e784ade4e43ba6d85ab5d8e.png","wen-ben-ju-zhen-fen-xi-gong-ju-shi-yong-jiao-cheng-gei-duo-fen-cai-liao-ding-he-xin-ci-kan-ci-yu-ci-zen-mo-bao-tuan","文本矩阵分析适合回答一个问题：这批材料里哪些词最值得关注，它们之间又是怎么抱团的。你上传多份 TXT 或 CSV，系统会先把文本切成一段段「文档段」，统计词频并做 TF-IDF 加权，挑出在这批材料里区分度最高的核心词；再看这些词在同一段里谁和谁反复结伴出现，连成共现矩阵和关系网络。它不替你归纳主题，而是给你一份按重要度排好的词表、一张谁与谁结伴的热力图，以及每个词对回原文核对的证据，帮你决定从哪里开始读、从哪里开始编码。","text-matrix",[21,26,31],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"high-frequency-words","高频词提取","统计词频和固定词组，包括 2–4 个词组成的搭配，自动归纳焦点说法与多篇间的共性。","6a362e5863012f7eb231a3d6",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"word-co-occurrence","词语共现分析","找出文本里经常成对出现的词，并用多项统计指标判断这种搭配是否真的稳定。","6a362e5863012f7eb231a3d7",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"lda","LDA 主题模型","从文本中发现若干主题，展示主题词、文档分布及主题之间的关系。","6a362e5863012f7eb231a3d8",true,"2026-06-20T06:06:15.315Z","2026-06-20T06:08:24.387Z"]