使用教程
学习如何使用各项功能,快速上手
文本分析基础教程相似句查找:归拢措辞不同的同类表达
相似句查找用于从问卷、访谈、评论和文档中识别含义接近的句段。它比较整段表达的语义距离,再输出相似句段对、聚类、热力矩阵和聚类特征。结果用于缩小人工阅读范围,最终归类仍需结合来源和语境。
可读性指标怎么读?中文综合分与 7 种英文公式详解
“可读性”衡量的不是一篇文章写得好不好,而是读者理解它大概需要付出多少阅读成本。句子越长、生僻字或复杂词越多,通常阅读门槛越高;但专业性、准确性、逻辑性和内容价值,不能仅凭可读性分数判断。
文本分析基础教程文本可读性分析:估算阅读门槛
文本可读性分析用于估算中英文材料的阅读难度。中文结果结合规范汉字覆盖、句长、词长、生僻字和虚词密度,给出0–100综合分与近似阅读年级;英文结果采用七项常见公式。报告还能比较多篇材料,并列出最难5句和最易5句,帮助你找到需要优先检查的位置。
文本分析基础教程标点纠正:检查并统一中文文本标点
标点纠正用于检查已有标点的中文文本。它会结合片段上下文统一中英文标点,处理重复符号、配对问题、句末缺失和位置错误,再给出原文与改后对照。工具把修改范围集中在标点上,适合发布前校对,也能为按句统计和情感分析准备更规整的文本。

文档词项矩阵:横向比较多篇材料用词
文档词项矩阵用于保留词汇在不同文档中的分布。它先按统一口径识别每篇材料中的词,再从整批材料选出总频次靠前的词汇,以词为行、文档为列记录实际次数。报告提供词频热力图、相似度矩阵、趋势图、文档与词汇明细,并给出逐篇特征词,适合从整体差异逐步回到具体文档解释。
文本分析基础教程KWIC关键词命中矩阵:看清主题段落分布
KWIC关键词命中矩阵用于比较多组关键词在材料中的段落分布。它先把内容按空行切成段落,再统计每个段落对每个关键词的命中次数。用户既可以自动发现候选词和概念组,也可以按既定框架手动分组。报告提供概览、三种明细视角、段落命中矩阵、分组共现矩阵、热点单元和上下文样例,适合从整体覆盖逐步回到原文复核。
文本分析基础教程KWIC关键词上下文索引:从词频回到原文语境
KWIC关键词上下文索引用于定位关键词的每一次出现,并把左侧语境、关键词和右侧语境对齐展示。它不仅统计命中次数,还保留文档、行号和相对位置,进一步计算每千字密度、文档覆盖和同行共现。用户可以手动指定研究词,也可以先从自动高频词开始,再沿着报告中的概览、上下文表、位置分布和共现关系回到原文解释。
文本分析基础教程简单文本聚类教程:从自动分组到主题复核
简单文本聚类把内容相近的文本归到同一主题簇,用于在人工编码前快速观察材料结构。用户可以手动指定分类数,也可以让系统比较多个候选分类数后自动选择。报告不仅给出每条文本的分组,还提供三类质量指标、类别规模、二维投影、类间相似度、关键词、示例句和代表性片段。下面结合参数和实测数据说明如何阅读结果。
文本分析基础教程DeepKeyword关键词发现教程:用综合排序筛选核心短语
DeepKeyword关键词发现面向完整文章提取关键短语。它不把词频直接当作重要性,而是综合候选来源、原文命中次数、覆盖、出现位置和短语长度进行排序。报告同时保留综合得分、0 到 1 的可信度、原文次数和明细信息,方便从高分候选继续回到原文复核。本教程说明四项分析参数、报告阅读顺序和两组实际运行案例。
文本分析基础教程DeepSentiV2 情感分析教程:按语境判断整句倾向
DeepSentiV2 用整句语义而不是单个褒贬词判断情感。每条有效文本会得到积极、中性或消极标签、0 到 1 的得分,以及最多五个关键词。工具还提供七种行业文本类型,让同一句表达放回更贴近业务的语境中分析。下面从文本粒度、参数选择、报告阅读和两组实测样本说明具体用法。
文本分析基础教程传统情感分析工具使用教程:对比两种词典方法,补充自己的情感词表
传统情感分析基于 PySenti 和 CnText 两个开源词典方法做二次开发,底层词典融入了多年实际项目中积累的行业情感词。它适合做评论、问卷开放题、舆情短文本和访谈分段的初步正负中标注。这个工具的重点不是自动理解复杂语境,而是把两种词典方法放在同一份报告里对比,并允许用户自己补充积极词和消极词。你可以用它查看 PySenti 在默认词典和自建词典下的变化,同时把 CnText 作为另一套内置情绪词典口径参考,再把分歧样本交给人工复核。
文本分析基础教程文本矩阵分析工具使用教程:给多份材料定核心词、看词与词怎么抱团
文本矩阵分析适合回答一个问题:这批材料里哪些词最值得关注,它们之间又是怎么抱团的。你上传多份 TXT 或 CSV,系统会先把文本切成一段段「文档段」,统计词频并做 TF-IDF 加权,挑出在这批材料里区分度最高的核心词;再看这些词在同一段里谁和谁反复结伴出现,连成共现矩阵和关系网络。它不替你归纳主题,而是给你一份按重要度排好的词表、一张谁与谁结伴的热力图,以及每个词对回原文核对的证据,帮你决定从哪里开始读、从哪里开始编码。
文本分析基础教程依存句法分析工具使用教程:可视化句子骨架,量化句式复杂度
依存句法分析适合回答「这句话的结构是什么样的、哪里让读者读不懂」。编辑处理长难句时需要定位主干,老师讲解句式时需要可视化结构,研究者对比句式复杂度时需要量化指标——这些场景的共同点是:不能只靠语感判断句子结构,还需要看得见的骨架和可比较的数字。这个工具会逐句标出主语、谓语、宾语和修饰成分之间的依赖关系,用可视化依存关系图呈现句子结构,并给出句法复杂度评分。
文本分析基础教程词语共现分析工具使用教程:用统计指标判断词对搭配是否可靠
词语共现分析适合回答「哪些词经常一起出现,这种搭配是否稳定」。做舆情分析时需要梳理话语口径,做访谈研究时需要提取概念关联,做知识图谱时需要准备搭配数据——这些场景的共同点是:不能只看单个词的频率,还要看词和词之间的关系。这个工具会在指定窗口范围内扫描词对,用三种统计指标判断搭配是否超出随机水平,帮你从文本里提取可靠的词语搭配结构。
文本分析基础教程文体风格指纹工具使用教程:把写作习惯拆成可对比的风格画像
文体风格指纹适合把模糊的写作读感拆成具体指标。老师觉得作文有点散、编辑觉得改稿没改到位、审稿人觉得论证不够连贯、运营觉得通稿语气不统一——这些判断往往是对的,但落到修改时还需要更具体的依据。这个工具会从句长、句型、词汇结构、词性占比、标点密度和人称代词使用率等维度生成写作画像,让每个角色的读感都能落到可修改的指标上。
共 23 篇教程,第 1 / 2 页
