TATOOLS 工具目录
中文文本分析、语料处理与主题建模在线工具
这里汇总 TATOOLS 已开放的全部工具,从文本清洗、词频统计、情感分析、关键词提取,到主题模型、文本聚类、知识图谱、实体识别与语料对比,会用网页就会用,每份报告都附原文出处。
标准文本处理
- 文本清洗
清理文本里的标点符号、表情、网页标签和自定停用词,并可把长文切成等长片段。
- 文本质量评估器
统计文本的规模、句长、词汇丰富度与重复率,给出 0~100 分,并判断能否用于聚类、主题模型等分析。
- 中文文本规范化
统一中文材料里的繁简、引号、全半角和省略号写法,可把数字改写成中文,并整篇注音。
- 词性标注
标出每个词的语法类别,统计词性分布与相邻词性的搭配概率,并与六类参考语料比较写法偏向。
- 关键词抽取
用 TF-IDF 与 TextRank 两种方法各提一份关键词并交叉对照,标出两者都认可的核心词。
- 高频词提取
统计词频,并可同时统计两到四个词组成的固定说法,标出哪些提法在多份材料里反复出现。
- 命名实体识别
找出文本里的人名、地名、机构名和时间,并用规则与语义两种口径并排给出结果供核对。
- 文体风格指纹
把句长、句型、词性、标点和人称等写作习惯量化成指标,并比较多篇材料的风格接近程度。
- 词语共现分析
找出反复一起出现的词组合,用互信息、T 值和对数似然比判断这种搭配有多稳定。
- 依存句法分析
逐句标出每个词依附哪个词、构成什么关系,并按依存树深度和句长给句子打复杂度评分。
- 文本矩阵分析
把材料切成文档段做词频与 TF-IDF 加权,挑出最有区分度的词,并统计它们两两同段共现的次数。
- 传统情感分析
用两套情感词典各给每行文本打一次分并判定积极、中性、消极,再比对两者的分歧。
- DeepSentiV2深度学习情感分析
逐行判断文本的情感倾向,给出积极、中性、消极分类、情感得分和情感关键词。
- DeepKeyword 深度学习模型关键词发现
把整份材料当作一篇文章提取核心短语,按综合得分排序并保留原文次数与位置。
- 简单文本聚类
按内容相似性把一批文本分成若干组,给出每组的关键词、规模和示例文本。
- KWIC关键词上下文索引
把关键词的每次出现按左右语境对齐排列,并统计命中次数、密度与同行共现。
- 关键词命中矩阵
以段落为行、关键词为列统计命中次数,看概念在材料中的分布与共现。
- 文档词项矩阵
以词为行、文档为列统计每个词在各篇中的出现次数,比较多篇材料的用词。
- 标点纠正
在不改动文字和断句的前提下,修正中文文本里写法不统一或用错的标点。
- 文本可读性分析
估算中英文材料的阅读门槛,给出可读性综合分、近似阅读年级和难易句样本。
- 相似句查找
按语义找出意思相近的句子对,并把互相相似的句子归成一组。
- 词汇等级评估
逐词对照中英文官方分级词表判定等级,给出整体等级、超纲词和未分级词清单。
- 抽取式摘要(TextRank / LexRank 双引擎)
从原文中挑出最有代表性的句子拼成摘要,只摘录不改写,并保留原文行号。
- 敏感信息脱敏
批量识别并替换文本里的身份证号、手机号、银行卡号等固定格式个人信息,输出脱敏后的文本。
- 经典LDA主题建模
把多份材料合并成同一批文档训练经典 LDA,输出主题词、文档主题分布与困惑度、一致性。
辅助工具
- 万能文档格式转换
把 Word、Excel、PPT、PDF 等上百种文档转换为 PDF、Word、Excel、CSV 等常用格式。
- 文档转写导出TXT
把 Word、PDF、PPT、Excel 等文档的文字转写为 Markdown 和 TXT 文本,表格另存为 CSV。
- 语音转文字
把中文或英文录音转写成带标点的文字,也可按说话人整理成带时间的对话稿。
- JSON 转 CSV
把 JSON 数据转换为 CSV 表格,每个对象一行、每个字段一列,可展开嵌套字段。
- TXT 转 CSV
把 TXT 文本按行转为 CSV 表格,并在所选的句号、问号、叹号或空格处分成多列。
- 智能OCR
识别图片和 PDF 中的文字、公式与表格,整理成 Markdown、HTML 和纯文本文档。
- 视频提取音频
从视频中提取声音,导出为 MP3 格式的音频文件。
- 批量转换图片分辨率
把图片批量缩放到指定的宽度,高度按原图比例计算,也可以直接指定宽和高。
- PDF 页面分割
从 PDF 中取出指定起止页码之间的页面,另存为新的 PDF 文件。
- 全能文档翻译
中英文档互译,按原文件格式输出;PDF 可保留原版式,也可动态重排为单栏阅读版。
- 论文公文一键排版
按学术论文或党政机关公文格式统一文档的标题、正文、页码和表格样式,默认不改动文字。
- 视频字幕与翻译配音
视频字幕与翻译配音
- 音视频人声分离
把音频或视频里的人声和背景声拆开,得到人声与背景两条音轨。
- 歌曲生成
根据歌词和曲风生成歌曲音频,也可单独生成 ABC 乐谱。
高级文本处理
- 高级情感分析
逐条判定情感倾向,给出摘自原文的证据词和整句判定逻辑,并归纳消极文本的主要原因。
- AIGC内容检测
排查中文材料的 AIGC 写作痕迹,逐段逐句给出风险值、主要原因和修改方向。
- AI味写作痕迹检测
查找中文文本里常见于大模型写作的句式与标点习惯,给出 0–100 的 AI 写作痕迹指数。
- 知识图谱
从材料中抽取实体与关系生成知识图谱,合并同义说法,并归出主题群与一份提纲。
- 停用词挖掘
按词在各段落的分布挖出本领域特有的高频低信息词,给出可直接取用的停用词候选表。
- 文本结构还原器
给标点缺失的中文文本补上标点并断句,不增删词语、不调换词序。
- BERTopic 主题聚类
把文本切成片段按语义聚成主题,给出主题名、关键词与主题关系,并可合并拆分主题重出一版。
- 高级LDA主题模型
对每个文件分别做 LDA 主题建模,输出主题词、主题标签和每段文本的主题归属。
- VAD 三维情感分析
逐行判定情感极性,并给出效价、唤醒度、支配度三个维度的分值与证据词。
- PCA 主成分分析
把文本切成片段作为样本,按词语取值做主成分分析,输出方差解释、词语载荷与片段得分。
- 高级文本聚类
把材料切成片段后按相似度聚成主题簇,给出每簇的关键词、簇名、占比与代表片段。
- LSA 潜在语义分析
把材料切段后提取少数潜在主题,给出主题词、每段的主导主题和方差贡献。
- 智能发现新词
找出被分词切碎的术语与专名等组合词,汇总成一份去重后的新词表。
- LDA主题数评估
在设定的主题数范围内逐档拟合 LDA,按困惑度和主题一致性等指标给出建议的主题数。
- 信息价值评估
逐段计算信息熵、词汇密度等指标并合成综合得分,分出高价值与低价值段落。
- 文本相似度去重雷达
按语义比较每条文本,找出意思相近的文本对并归成重复组,另可给出改写嫌疑分。
- 词语搭配强度分析
统计词对在设定窗口内的共现,用七项关联强度指标区分固定搭配和偶然同现,也可只看指定节点词周围的搭配。
- 重复内容合并
把意思高度接近的内容归成一组,每组保留一条代表文本、其余标为并入,给出可核对的合并方案。
- 词汇多样性分析
一次算出 TTR、MTLD 等九项词汇丰富度指标,并沿文本位置画出用词重复程度的变化。
- PCA 主成分降维
对表格的数值列做主成分分析,输出特征值、载荷、样本得分与综合排名,另出论文三线表。
- 领域术语抽取
从同领域语料里抽出反复出现的多词术语,按 C-value、NC-value 打分并附出现次数与原文用例。
- 样本聚类
按表格的数值列把样本分成若干类,给出每个样本的归属、各类画像和区分度最高的指标。
- 语料对比关键词分析
对比目标语料与参考语料的词频,找出目标里说得明显更多和明显更少的词,并给出三项关键性指标。
- 趋势分析
把带日期的表按日、周或月汇总成时间序列,给出移动平均、环比同比、峰谷与异常波动时点。
- 语料检索
在一批文档里按查询找出最相关的整篇、段落或句子,关键词与语义两路打分,并高亮命中原文。
- 词汇增长曲线分析
按累计词数拟合词汇增长曲线与词频分布,给出用词开放度 β、分布陡峭度 s 和拟合优度 R²。
- 依存句法模式挖掘
逐句做依存句法分析,再把全语料的句法关系、词性骨架、动词论元或修饰搭配归类统计,找出反复出现的句法模式。
- 话语标记词分析
按因果、转折、递进等八类统计文中衔接词的用量、句首句中位置和沿段落的疏密变化。
- 写作风格判定
抽取四十来项文体统计特征,据此给出八个维度的风格打分、文体归属候选、风格标签与改进建议。
- 全文情感曲线
把长文本切成连续片段逐段判断情绪,画出从头到尾的情绪走势曲线,标出高低点、转折与所属的经典情绪弧。
- 中文文本简化
删减中文文本中的冗余表达,改写口语表述,生成简化后的文本。
数据分析
- 组间差异分析
比较不同组别或配对测量的数值结果,进行差异显著性检验。
- 交叉表与卡方分析
对两个分类变量生成交叉表(统计各类别组合),自动选择卡方或 Fisher 检验(判断关联),并输出 p 值与关联强度。
- 问卷数据准备助手
整理问卷字段(清理常见格式问题),按研究目标梳理字段角色、量表候选与后续分析建议。
- 问卷分析
按题型统计问卷作答数据,汇总选项分布、评分均值与开放题高频词。
- 问卷描述性统计
自动识别问卷变量(判断数据类型),输出均值、频数、占比、缺失率和论文叙述句。
- 访谈录音结构化
将访谈音频转为对话稿(标记说话人与时间),并提取编码标签和核心主题。
- 相关分析矩阵
计算多个数值变量的相关系数(衡量关系方向与强弱),输出 p 值、热力图和散点图。
- 访谈质性编码
对访谈文本或音频进行三级编码(开放码、主轴码、核心主题),输出主题与语段摘录。
- 数据异常值检测
检查数据表的缺失、重复、写法不统一和离群值,给出综合得分,并列出能直接做的表格分析。
- 表格数据概览
逐列计算表格数据的均值、中位数、频数与占比,并画出取值分布和箱线图。
- 论文描述性统计表
把表格里的数值变量整理成论文用的描述性统计表。
- 双重差分政策评估
比较处理组与对照组在政策前后的变化之差,估计政策的净影响。
- 探索性因子分析
把量表题项归成几个因子,给出载荷矩阵和适切性检验。
- 变量加工
缩尾、取对数、滞后、标准化和虚拟变量,输出加工后的表。
- 中介效应分析
估计 X 经 M 影响 Y 的间接效应,给出 Bootstrap 置信区间。
- 调节效应分析
估计 X 对 Y 的影响如何随 M 变化,给出交互项和简单斜率。
- 实证分析全流程
按实证论文的顺序,从描述统计做到基准回归、稳健性和机制检验,生成三线表和 Word 报告。
- 七种模型回归分析
用七种回归模型估计变量的影响,生成论文里多列并排的回归表。
图像分析
- 图像识别与分类
识别图片中的主体、场景和物体,为每张图给出若干英文分类标签及置信度。
- 图像语义分割与实例分割
按输入或自动识别的物体名称分割图片中的每个对象,生成检测、实例分割、语义分割标注图和单个对象抠图。
- 景别判断
判断图片属于远景、全景、中景、特写还是大特写,并统计整批图片的景别分布。
- 全景分割图像
分割图像中的物体和背景,标注区域类别并区分同类物体的不同个体。
- 图像语义分割
按填写的英文类别分割图片中的区域和物体,生成按类别着色的分割图,统计各类别的数量与面积占比。
- 图像颜色分布
提取图片的主色调及各颜色占比,或按人眼观感给出色相分布、色彩感受评分与配色风格归类。
- 实例分割图像
按英文描述找出图片中所有符合的物体,逐个分割并编号,生成标注图和每个物体的透明底抠图。
- 预设分类图像分类
从场景、物体、动作等六组预设英文标签中,为每张图片挑出相符的标签,并给出置信度。
- 图像提示词反推与 LoRA 打标
根据参考图写出中文或英文的文生图提示词,可改写成壁纸构图或重新构图,并可整理成 LoRA 训练数据集。
- 图片快速清理
去除图片中的水印、文字、人物或背景中的路人,补全被遮住的背景。
- 非生成式图像高清放大
把尺寸偏小的图片放大 2 至 4 倍并补出纹理细节,生成高清大图。
- 图片矢量化
描摹图片中的色块轮廓,将 JPG、PNG 等位图转换为可下载的 SVG 矢量图
- 图像人物与物体关系分析
找出图片里的人与物体,判断它们的互动和空间关系,并跨图统计最常见的关系组合。
智能分析
- 因果关系推断
从中文文本中抽取原文明确写出的因果关系,归并成因素并连成因果图,标明类型、支撑次数与重要性。
- 立场分析
识别中文文本里的各方主体与表态原句,判定态度类别与影响力,并梳理彼此的冲突与合作关系。
- 期待挖掘
从评论、反馈与意见文本中提炼期待内容,归入七类期待,并给出情感倾向、紧急程度与关键词。
- 隐含情感识别
逐条判断中文评论与回复是否阴阳怪气、过度捧杀,并给出正负面程度、情感强度与十类主导情感。
- 事件时间线抽取
从中文材料中抽取何时发生了什么事,推算日期、合并重复记录,整理成带阶段划分与关键事件的时间线。
- 修辞手法检测
逐句标注中文文本中的比喻、排比、反问等十类修辞手法,统计各类次数、占比与每千字密度。
- 论证结构识别
从议论文、评论等文本中摘出论点、论据、反例与让步,标出相互关系并画出论证关系图。
