学术研究者
文学、语言学、社会学、传播学等领域的研究者。例如把十年间关于某个议题的三千篇报道整批放进去,先看高频词和关键词怎样逐年变化,再让主题模型归纳出几条主线、各自何时兴起何时消退,直接支撑论文里的论证。
TATOOLS 是面向人文社科研究者的在线文本分析平台。上传材料,自动生成带图表、有出处的分析报告;几十种基础与高级工具,会用网页就会用。

三千篇报道,人工通读要一个月,读完只剩模糊印象;两万条评论,表格一打开就卡住。TATOOLS 把整批材料逐条统计和建模,把结果做成图表和结论说明,您只需要判断规律成不成立、怎么写进论文。
基础功能把材料理清楚:清洗、分词、词频、关键词、情感、人名地名机构名。高级功能把规律挖出来:主题归纳、趋势变化、两批语料对比、知识图谱、写作风格判定。从原始材料到论文附件,一个平台走完,中途不用换软件、不用导来导去。
不装软件、不学命令。上传文件、勾选几个选项、点提交,剩下的交给 TATOOLS。第一次用也能当天拿到结果。
二十多种基础工具管统计:词频、关键词、情感、实体、共现、摘要、可读性。近三十种高级工具管发现:主题归纳、趋势分析、语料对比、知识图谱、相似去重、新词发现。连图片和录音材料也能处理。
报告里的数字、图表和结论都附着统计口径和原文出处。导师问【这个结论怎么来的】,翻到那一页就能回答。
无论材料是新闻、政策、评论还是文学作品,TATOOLS 都能从中找出规律。下面是六种常见用法。
文学、语言学、社会学、传播学等领域的研究者。例如把十年间关于某个议题的三千篇报道整批放进去,先看高频词和关键词怎样逐年变化,再让主题模型归纳出几条主线、各自何时兴起何时消退,直接支撑论文里的论证。
课程作业和毕业论文的得力工具。例如把一部小说或一批作文上传,词频、词性、人名地名、句子可读性一次给出,再用共现分析看哪些词总是成对出现,学生把精力放在解释和写作上。
政策研究人员、新闻传播从业者。例如把中央和地方的几十份政策文件分成两批做对比,哪些提法是地方独有、哪些被逐层继承,用关键词上下文索引把每个提法出现的原句列出来,立场和框架一目了然。
城乡规划、公共政策领域的调研分析。例如把几年的规划文本和公开意见放在一起,抽出人物、机构、地点之间的关系画成知识图谱,再按时间看热点议题如何转移。
为分析人员提供标准化的文本处理流程。例如两万条商品评论,先去掉重复和近似内容,再看正面负面各占多少、抱怨最集中在哪几类说法,一次提交全部给出,不用再手工整理。
论文、新闻、政策和文学材料在同一平台统一管理,不同背景的成员各取所需。例如语言学同事做词汇多样性和搭配强度,传播学同事做报道主题和立场,结果口径一致,可以互相引用。
从原始材料到规律与报告。简单问题用一个基础工具解决,例如一次词频统计;复杂课题把几个工具串起来,例如先清洗、再去重、再做主题归纳,上一步的结果直接进下一步。 查看完整工具目录
统计文本高频词、关键词和词云,快速了解语料的核心表达。
识别正面、负面和中性倾向,适合评论、舆情和访谈材料分析。
从一批文档中发现主题结构,输出主题词、文档分布和可视化报告。
在正式分析前检查文本规模、重复、句长和 NLP 任务适用性。
文本清洗
清理文本里的标点符号、表情、网页标签和自定停用词,并可把长文切成等长片段。
文本质量评估器
统计文本的规模、句长、词汇丰富度与重复率,给出 0~100 分,并判断能否用于聚类、主题模型等分析。
中文文本规范化
统一中文材料里的繁简、引号、全半角和省略号写法,可把数字改写成中文,并整篇注音。
词性标注
标出每个词的语法类别,统计词性分布与相邻词性的搭配概率,并与六类参考语料比较写法偏向。
关键词抽取
用 TF-IDF 与 TextRank 两种方法各提一份关键词并交叉对照,标出两者都认可的核心词。
高频词提取
统计词频,并可同时统计两到四个词组成的固定说法,标出哪些提法在多份材料里反复出现。
命名实体识别
找出文本里的人名、地名、机构名和时间,并用规则与语义两种口径并排给出结果供核对。
文体风格指纹
把句长、句型、词性、标点和人称等写作习惯量化成指标,并比较多篇材料的风格接近程度。
词语共现分析
找出反复一起出现的词组合,用互信息、T 值和对数似然比判断这种搭配有多稳定。
依存句法分析
逐句标出每个词依附哪个词、构成什么关系,并按依存树深度和句长给句子打复杂度评分。
文本矩阵分析
把材料切成文档段做词频与 TF-IDF 加权,挑出最有区分度的词,并统计它们两两同段共现的次数。
传统情感分析
用两套情感词典各给每行文本打一次分并判定积极、中性、消极,再比对两者的分歧。
DeepSentiV2深度学习情感分析
逐行判断文本的情感倾向,给出积极、中性、消极分类、情感得分和情感关键词。
DeepKeyword 深度学习模型关键词发现
把整份材料当作一篇文章提取核心短语,按综合得分排序并保留原文次数与位置。
简单文本聚类
按内容相似性把一批文本分成若干组,给出每组的关键词、规模和示例文本。
KWIC关键词上下文索引
把关键词的每次出现按左右语境对齐排列,并统计命中次数、密度与同行共现。
关键词命中矩阵
以段落为行、关键词为列统计命中次数,看概念在材料中的分布与共现。
文档词项矩阵
以词为行、文档为列统计每个词在各篇中的出现次数,比较多篇材料的用词。
标点纠正
在不改动文字和断句的前提下,修正中文文本里写法不统一或用错的标点。
文本可读性分析
估算中英文材料的阅读门槛,给出可读性综合分、近似阅读年级和难易句样本。
相似句查找
按语义找出意思相近的句子对,并把互相相似的句子归成一组。
词汇等级评估
逐词对照中英文官方分级词表判定等级,给出整体等级、超纲词和未分级词清单。
抽取式摘要(TextRank / LexRank 双引擎)
从原文中挑出最有代表性的句子拼成摘要,只摘录不改写,并保留原文行号。
敏感信息脱敏
批量识别并替换文本里的身份证号、手机号、银行卡号等固定格式个人信息,输出脱敏后的文本。
经典LDA主题建模
把多份材料合并成同一批文档训练经典 LDA,输出主题词、文档主题分布与困惑度、一致性。
高级情感分析
逐条判定情感倾向,给出摘自原文的证据词和整句判定逻辑,并归纳消极文本的主要原因。
AIGC内容检测
排查中文材料的 AIGC 写作痕迹,逐段逐句给出风险值、主要原因和修改方向。
AI味写作痕迹检测
查找中文文本里常见于大模型写作的句式与标点习惯,给出 0–100 的 AI 写作痕迹指数。
知识图谱
从材料中抽取实体与关系生成知识图谱,合并同义说法,并归出主题群与一份提纲。
停用词挖掘
按词在各段落的分布挖出本领域特有的高频低信息词,给出可直接取用的停用词候选表。
文本结构还原器
给标点缺失的中文文本补上标点并断句,不增删词语、不调换词序。
BERTopic 主题聚类
把文本切成片段按语义聚成主题,给出主题名、关键词与主题关系,并可合并拆分主题重出一版。
高级LDA主题模型
对每个文件分别做 LDA 主题建模,输出主题词、主题标签和每段文本的主题归属。
VAD 三维情感分析
逐行判定情感极性,并给出效价、唤醒度、支配度三个维度的分值与证据词。
PCA 主成分分析
把文本切成片段作为样本,按词语取值做主成分分析,输出方差解释、词语载荷与片段得分。
高级文本聚类
把材料切成片段后按相似度聚成主题簇,给出每簇的关键词、簇名、占比与代表片段。
LSA 潜在语义分析
把材料切段后提取少数潜在主题,给出主题词、每段的主导主题和方差贡献。
智能发现新词
找出被分词切碎的术语与专名等组合词,汇总成一份去重后的新词表。
LDA主题数评估
在设定的主题数范围内逐档拟合 LDA,按困惑度和主题一致性等指标给出建议的主题数。
信息价值评估
逐段计算信息熵、词汇密度等指标并合成综合得分,分出高价值与低价值段落。
文本相似度去重雷达
按语义比较每条文本,找出意思相近的文本对并归成重复组,另可给出改写嫌疑分。
词语搭配强度分析
统计词对在设定窗口内的共现,用七项关联强度指标区分固定搭配和偶然同现,也可只看指定节点词周围的搭配。
重复内容合并
把意思高度接近的内容归成一组,每组保留一条代表文本、其余标为并入,给出可核对的合并方案。
词汇多样性分析
一次算出 TTR、MTLD 等九项词汇丰富度指标,并沿文本位置画出用词重复程度的变化。
PCA 主成分降维
对表格的数值列做主成分分析,输出特征值、载荷、样本得分与综合排名,另出论文三线表。
领域术语抽取
从同领域语料里抽出反复出现的多词术语,按 C-value、NC-value 打分并附出现次数与原文用例。
样本聚类
按表格的数值列把样本分成若干类,给出每个样本的归属、各类画像和区分度最高的指标。
语料对比关键词分析
对比目标语料与参考语料的词频,找出目标里说得明显更多和明显更少的词,并给出三项关键性指标。
趋势分析
把带日期的表按日、周或月汇总成时间序列,给出移动平均、环比同比、峰谷与异常波动时点。
语料检索
在一批文档里按查询找出最相关的整篇、段落或句子,关键词与语义两路打分,并高亮命中原文。
词汇增长曲线分析
按累计词数拟合词汇增长曲线与词频分布,给出用词开放度 β、分布陡峭度 s 和拟合优度 R²。
依存句法模式挖掘
逐句做依存句法分析,再把全语料的句法关系、词性骨架、动词论元或修饰搭配归类统计,找出反复出现的句法模式。
话语标记词分析
按因果、转折、递进等八类统计文中衔接词的用量、句首句中位置和沿段落的疏密变化。
写作风格判定
抽取四十来项文体统计特征,据此给出八个维度的风格打分、文体归属候选、风格标签与改进建议。
全文情感曲线
把长文本切成连续片段逐段判断情绪,画出从头到尾的情绪走势曲线,标出高低点、转折与所属的经典情绪弧。
中文文本简化
删减中文文本中的冗余表达,改写口语表述,生成简化后的文本。
因果关系推断
从中文文本中抽取原文明确写出的因果关系,归并成因素并连成因果图,标明类型、支撑次数与重要性。
立场分析
识别中文文本里的各方主体与表态原句,判定态度类别与影响力,并梳理彼此的冲突与合作关系。
期待挖掘
从评论、反馈与意见文本中提炼期待内容,归入七类期待,并给出情感倾向、紧急程度与关键词。
隐含情感识别
逐条判断中文评论与回复是否阴阳怪气、过度捧杀,并给出正负面程度、情感强度与十类主导情感。
事件时间线抽取
从中文材料中抽取何时发生了什么事,推算日期、合并重复记录,整理成带阶段划分与关键事件的时间线。
修辞手法检测
逐句标注中文文本中的比喻、排比、反问等十类修辞手法,统计各类次数、占比与每千字密度。
论证结构识别
从议论文、评论等文本中摘出论点、论据、反例与让步,标出相互关系并画出论证关系图。
组间差异分析
比较不同组别或配对测量的数值结果,进行差异显著性检验。
交叉表与卡方分析
对两个分类变量生成交叉表(统计各类别组合),自动选择卡方或 Fisher 检验(判断关联),并输出 p 值与关联强度。
问卷数据准备助手
整理问卷字段(清理常见格式问题),按研究目标梳理字段角色、量表候选与后续分析建议。
问卷分析
按题型统计问卷作答数据,汇总选项分布、评分均值与开放题高频词。
问卷描述性统计
自动识别问卷变量(判断数据类型),输出均值、频数、占比、缺失率和论文叙述句。
访谈录音结构化
将访谈音频转为对话稿(标记说话人与时间),并提取编码标签和核心主题。
相关分析矩阵
计算多个数值变量的相关系数(衡量关系方向与强弱),输出 p 值、热力图和散点图。
访谈质性编码
对访谈文本或音频进行三级编码(开放码、主轴码、核心主题),输出主题与语段摘录。
数据异常值检测
检查数据表的缺失、重复、写法不统一和离群值,给出综合得分,并列出能直接做的表格分析。
表格数据概览
逐列计算表格数据的均值、中位数、频数与占比,并画出取值分布和箱线图。
论文描述性统计表
把表格里的数值变量整理成论文用的描述性统计表。
双重差分政策评估
比较处理组与对照组在政策前后的变化之差,估计政策的净影响。
探索性因子分析
把量表题项归成几个因子,给出载荷矩阵和适切性检验。
变量加工
缩尾、取对数、滞后、标准化和虚拟变量,输出加工后的表。
中介效应分析
估计 X 经 M 影响 Y 的间接效应,给出 Bootstrap 置信区间。
调节效应分析
估计 X 对 Y 的影响如何随 M 变化,给出交互项和简单斜率。
实证分析全流程
按实证论文的顺序,从描述统计做到基准回归、稳健性和机制检验,生成三线表和 Word 报告。
七种模型回归分析
用七种回归模型估计变量的影响,生成论文里多列并排的回归表。
我们希望文本分析成为研究者随手可用的基础设施:材料交给 TATOOLS,规律和证据回到研究者手里。
TATOOLS 由 leafiy 与 Qsmile 共同发起。leafiy 为北京航空航天大学软件学院大数据专业硕士,关注数据工程、自然语言处理和在线分析工具的产品化落地;Qsmile 来自清华大学建筑学院博士背景,更熟悉城市研究、空间叙事、政策文本和人文社科材料中的真实分析需求。
平台围绕研究者每天都会遇到的材料处理问题设计:访谈、论文、政策文本、新闻报道和问卷材料不再散落在复杂软件、零散脚本和手工表格之间,而是进入清晰、稳定、可复用的网页工具流程。
从文本清洗、分词、词频统计、关键词抽取,到情感分析、主题建模、文本聚类和实体识别,TATOOLS 持续把模型和工程细节放在后台,把清楚的参数、报告和原文出处交给研究者。