TATOOLS 工具目录

中文文本分析、语料处理与主题建模在线工具

这里汇总 TATOOLS 已开放的全部工具,从文本清洗、词频统计、情感分析、关键词提取,到主题模型、文本聚类、知识图谱、实体识别与语料对比,会用网页就会用,每份报告都附原文出处。

标准文本处理

  • 文本清洗

    清理文本里的标点符号、表情、网页标签和自定停用词,并可把长文切成等长片段。

  • 文本质量评估器

    统计文本的规模、句长、词汇丰富度与重复率,给出 0~100 分,并判断能否用于聚类、主题模型等分析。

  • 中文文本规范化

    统一中文材料里的繁简、引号、全半角和省略号写法,可把数字改写成中文,并整篇注音。

  • 词性标注

    标出每个词的语法类别,统计词性分布与相邻词性的搭配概率,并与六类参考语料比较写法偏向。

  • 关键词抽取

    用 TF-IDF 与 TextRank 两种方法各提一份关键词并交叉对照,标出两者都认可的核心词。

  • 高频词提取

    统计词频,并可同时统计两到四个词组成的固定说法,标出哪些提法在多份材料里反复出现。

  • 命名实体识别

    找出文本里的人名、地名、机构名和时间,并用规则与语义两种口径并排给出结果供核对。

  • 文体风格指纹

    把句长、句型、词性、标点和人称等写作习惯量化成指标,并比较多篇材料的风格接近程度。

  • 词语共现分析

    找出反复一起出现的词组合,用互信息、T 值和对数似然比判断这种搭配有多稳定。

  • 依存句法分析

    逐句标出每个词依附哪个词、构成什么关系,并按依存树深度和句长给句子打复杂度评分。

  • 文本矩阵分析

    把材料切成文档段做词频与 TF-IDF 加权,挑出最有区分度的词,并统计它们两两同段共现的次数。

  • 传统情感分析

    用两套情感词典各给每行文本打一次分并判定积极、中性、消极,再比对两者的分歧。

  • DeepSentiV2深度学习情感分析

    逐行判断文本的情感倾向,给出积极、中性、消极分类、情感得分和情感关键词。

  • DeepKeyword 深度学习模型关键词发现

    把整份材料当作一篇文章提取核心短语,按综合得分排序并保留原文次数与位置。

  • 简单文本聚类

    按内容相似性把一批文本分成若干组,给出每组的关键词、规模和示例文本。

  • KWIC关键词上下文索引

    把关键词的每次出现按左右语境对齐排列,并统计命中次数、密度与同行共现。

  • 关键词命中矩阵

    以段落为行、关键词为列统计命中次数,看概念在材料中的分布与共现。

  • 文档词项矩阵

    以词为行、文档为列统计每个词在各篇中的出现次数,比较多篇材料的用词。

  • 标点纠正

    在不改动文字和断句的前提下,修正中文文本里写法不统一或用错的标点。

  • 文本可读性分析

    估算中英文材料的阅读门槛,给出可读性综合分、近似阅读年级和难易句样本。

  • 相似句查找

    按语义找出意思相近的句子对,并把互相相似的句子归成一组。

  • 词汇等级评估

    逐词对照中英文官方分级词表判定等级,给出整体等级、超纲词和未分级词清单。

  • 抽取式摘要(TextRank / LexRank 双引擎)

    从原文中挑出最有代表性的句子拼成摘要,只摘录不改写,并保留原文行号。

  • 敏感信息脱敏

    批量识别并替换文本里的身份证号、手机号、银行卡号等固定格式个人信息,输出脱敏后的文本。

  • 经典LDA主题建模

    把多份材料合并成同一批文档训练经典 LDA,输出主题词、文档主题分布与困惑度、一致性。

辅助工具

  • 万能文档格式转换

    把 Word、Excel、PPT、PDF 等上百种文档转换为 PDF、Word、Excel、CSV 等常用格式。

  • 文档转写导出TXT

    把 Word、PDF、PPT、Excel 等文档的文字转写为 Markdown 和 TXT 文本,表格另存为 CSV。

  • 语音转文字

    把中文或英文录音转写成带标点的文字,也可按说话人整理成带时间的对话稿。

  • JSON 转 CSV

    把 JSON 数据转换为 CSV 表格,每个对象一行、每个字段一列,可展开嵌套字段。

  • TXT 转 CSV

    把 TXT 文本按行转为 CSV 表格,并在所选的句号、问号、叹号或空格处分成多列。

  • 智能OCR

    识别图片和 PDF 中的文字、公式与表格,整理成 Markdown、HTML 和纯文本文档。

  • 视频提取音频

    从视频中提取声音,导出为 MP3 格式的音频文件。

  • 批量转换图片分辨率

    把图片批量缩放到指定的宽度,高度按原图比例计算,也可以直接指定宽和高。

  • PDF 页面分割

    从 PDF 中取出指定起止页码之间的页面,另存为新的 PDF 文件。

  • 全能文档翻译

    中英文档互译,按原文件格式输出;PDF 可保留原版式,也可动态重排为单栏阅读版。

  • 论文公文一键排版

    按学术论文或党政机关公文格式统一文档的标题、正文、页码和表格样式,默认不改动文字。

  • 视频字幕与翻译配音

    视频字幕与翻译配音

  • 音视频人声分离

    把音频或视频里的人声和背景声拆开,得到人声与背景两条音轨。

  • 歌曲生成

    根据歌词和曲风生成歌曲音频,也可单独生成 ABC 乐谱。

高级文本处理

  • 高级情感分析

    逐条判定情感倾向,给出摘自原文的证据词和整句判定逻辑,并归纳消极文本的主要原因。

  • AIGC内容检测

    排查中文材料的 AIGC 写作痕迹,逐段逐句给出风险值、主要原因和修改方向。

  • AI味写作痕迹检测

    查找中文文本里常见于大模型写作的句式与标点习惯,给出 0–100 的 AI 写作痕迹指数。

  • 知识图谱

    从材料中抽取实体与关系生成知识图谱,合并同义说法,并归出主题群与一份提纲。

  • 停用词挖掘

    按词在各段落的分布挖出本领域特有的高频低信息词,给出可直接取用的停用词候选表。

  • 文本结构还原器

    给标点缺失的中文文本补上标点并断句,不增删词语、不调换词序。

  • BERTopic 主题聚类

    把文本切成片段按语义聚成主题,给出主题名、关键词与主题关系,并可合并拆分主题重出一版。

  • 高级LDA主题模型

    对每个文件分别做 LDA 主题建模,输出主题词、主题标签和每段文本的主题归属。

  • VAD 三维情感分析

    逐行判定情感极性,并给出效价、唤醒度、支配度三个维度的分值与证据词。

  • PCA 主成分分析

    把文本切成片段作为样本,按词语取值做主成分分析,输出方差解释、词语载荷与片段得分。

  • 高级文本聚类

    把材料切成片段后按相似度聚成主题簇,给出每簇的关键词、簇名、占比与代表片段。

  • LSA 潜在语义分析

    把材料切段后提取少数潜在主题,给出主题词、每段的主导主题和方差贡献。

  • 智能发现新词

    找出被分词切碎的术语与专名等组合词,汇总成一份去重后的新词表。

  • LDA主题数评估

    在设定的主题数范围内逐档拟合 LDA,按困惑度和主题一致性等指标给出建议的主题数。

  • 信息价值评估

    逐段计算信息熵、词汇密度等指标并合成综合得分,分出高价值与低价值段落。

  • 文本相似度去重雷达

    按语义比较每条文本,找出意思相近的文本对并归成重复组,另可给出改写嫌疑分。

  • 词语搭配强度分析

    统计词对在设定窗口内的共现,用七项关联强度指标区分固定搭配和偶然同现,也可只看指定节点词周围的搭配。

  • 重复内容合并

    把意思高度接近的内容归成一组,每组保留一条代表文本、其余标为并入,给出可核对的合并方案。

  • 词汇多样性分析

    一次算出 TTR、MTLD 等九项词汇丰富度指标,并沿文本位置画出用词重复程度的变化。

  • PCA 主成分降维

    对表格的数值列做主成分分析,输出特征值、载荷、样本得分与综合排名,另出论文三线表。

  • 领域术语抽取

    从同领域语料里抽出反复出现的多词术语,按 C-value、NC-value 打分并附出现次数与原文用例。

  • 样本聚类

    按表格的数值列把样本分成若干类,给出每个样本的归属、各类画像和区分度最高的指标。

  • 语料对比关键词分析

    对比目标语料与参考语料的词频,找出目标里说得明显更多和明显更少的词,并给出三项关键性指标。

  • 趋势分析

    把带日期的表按日、周或月汇总成时间序列,给出移动平均、环比同比、峰谷与异常波动时点。

  • 语料检索

    在一批文档里按查询找出最相关的整篇、段落或句子,关键词与语义两路打分,并高亮命中原文。

  • 词汇增长曲线分析

    按累计词数拟合词汇增长曲线与词频分布,给出用词开放度 β、分布陡峭度 s 和拟合优度 R²。

  • 依存句法模式挖掘

    逐句做依存句法分析,再把全语料的句法关系、词性骨架、动词论元或修饰搭配归类统计,找出反复出现的句法模式。

  • 话语标记词分析

    按因果、转折、递进等八类统计文中衔接词的用量、句首句中位置和沿段落的疏密变化。

  • 写作风格判定

    抽取四十来项文体统计特征,据此给出八个维度的风格打分、文体归属候选、风格标签与改进建议。

  • 全文情感曲线

    把长文本切成连续片段逐段判断情绪,画出从头到尾的情绪走势曲线,标出高低点、转折与所属的经典情绪弧。

  • 中文文本简化

    删减中文文本中的冗余表达,改写口语表述,生成简化后的文本。

数据分析

  • 组间差异分析

    比较不同组别或配对测量的数值结果,进行差异显著性检验。

  • 交叉表与卡方分析

    对两个分类变量生成交叉表(统计各类别组合),自动选择卡方或 Fisher 检验(判断关联),并输出 p 值与关联强度。

  • 问卷数据准备助手

    整理问卷字段(清理常见格式问题),按研究目标梳理字段角色、量表候选与后续分析建议。

  • 问卷分析

    按题型统计问卷作答数据,汇总选项分布、评分均值与开放题高频词。

  • 问卷描述性统计

    自动识别问卷变量(判断数据类型),输出均值、频数、占比、缺失率和论文叙述句。

  • 访谈录音结构化

    将访谈音频转为对话稿(标记说话人与时间),并提取编码标签和核心主题。

  • 相关分析矩阵

    计算多个数值变量的相关系数(衡量关系方向与强弱),输出 p 值、热力图和散点图。

  • 访谈质性编码

    对访谈文本或音频进行三级编码(开放码、主轴码、核心主题),输出主题与语段摘录。

  • 数据异常值检测

    检查数据表的缺失、重复、写法不统一和离群值,给出综合得分,并列出能直接做的表格分析。

  • 表格数据概览

    逐列计算表格数据的均值、中位数、频数与占比,并画出取值分布和箱线图。

  • 论文描述性统计表

    把表格里的数值变量整理成论文用的描述性统计表。

  • 双重差分政策评估

    比较处理组与对照组在政策前后的变化之差,估计政策的净影响。

  • 探索性因子分析

    把量表题项归成几个因子,给出载荷矩阵和适切性检验。

  • 变量加工

    缩尾、取对数、滞后、标准化和虚拟变量,输出加工后的表。

  • 中介效应分析

    估计 X 经 M 影响 Y 的间接效应,给出 Bootstrap 置信区间。

  • 调节效应分析

    估计 X 对 Y 的影响如何随 M 变化,给出交互项和简单斜率。

  • 实证分析全流程

    按实证论文的顺序,从描述统计做到基准回归、稳健性和机制检验,生成三线表和 Word 报告。

  • 七种模型回归分析

    用七种回归模型估计变量的影响,生成论文里多列并排的回归表。

图像分析

  • 图像识别与分类

    识别图片中的主体、场景和物体,为每张图给出若干英文分类标签及置信度。

  • 图像语义分割与实例分割

    按输入或自动识别的物体名称分割图片中的每个对象,生成检测、实例分割、语义分割标注图和单个对象抠图。

  • 景别判断

    判断图片属于远景、全景、中景、特写还是大特写,并统计整批图片的景别分布。

  • 全景分割图像

    分割图像中的物体和背景,标注区域类别并区分同类物体的不同个体。

  • 图像语义分割

    按填写的英文类别分割图片中的区域和物体,生成按类别着色的分割图,统计各类别的数量与面积占比。

  • 图像颜色分布

    提取图片的主色调及各颜色占比,或按人眼观感给出色相分布、色彩感受评分与配色风格归类。

  • 实例分割图像

    按英文描述找出图片中所有符合的物体,逐个分割并编号,生成标注图和每个物体的透明底抠图。

  • 预设分类图像分类

    从场景、物体、动作等六组预设英文标签中,为每张图片挑出相符的标签,并给出置信度。

  • 图像提示词反推与 LoRA 打标

    根据参考图写出中文或英文的文生图提示词,可改写成壁纸构图或重新构图,并可整理成 LoRA 训练数据集。

  • 图片快速清理

    去除图片中的水印、文字、人物或背景中的路人,补全被遮住的背景。

  • 非生成式图像高清放大

    把尺寸偏小的图片放大 2 至 4 倍并补出纹理细节,生成高清大图。

  • 图片矢量化

    描摹图片中的色块轮廓,将 JPG、PNG 等位图转换为可下载的 SVG 矢量图

  • 图像人物与物体关系分析

    找出图片里的人与物体,判断它们的互动和空间关系,并跨图统计最常见的关系组合。

智能分析

  • 因果关系推断

    从中文文本中抽取原文明确写出的因果关系,归并成因素并连成因果图,标明类型、支撑次数与重要性。

  • 立场分析

    识别中文文本里的各方主体与表态原句,判定态度类别与影响力,并梳理彼此的冲突与合作关系。

  • 期待挖掘

    从评论、反馈与意见文本中提炼期待内容,归入七类期待,并给出情感倾向、紧急程度与关键词。

  • 隐含情感识别

    逐条判断中文评论与回复是否阴阳怪气、过度捧杀,并给出正负面程度、情感强度与十类主导情感。

  • 事件时间线抽取

    从中文材料中抽取何时发生了什么事,推算日期、合并重复记录,整理成带阶段划分与关键事件的时间线。

  • 修辞手法检测

    逐句标注中文文本中的比喻、排比、反问等十类修辞手法,统计各类次数、占比与每千字密度。

  • 论证结构识别

    从议论文、评论等文本中摘出论点、论据、反例与让步,标出相互关系并画出论证关系图。