ZERO CODE · RESEARCH ANALYSIS

TATOOLS 从大量文本中获取真实规律

TATOOLS 是面向人文社科研究者的在线文本分析平台。上传材料,自动生成带图表、有出处的分析报告;几十种基础与高级工具,会用网页就会用。

96+
分析工具
6
工具类别
3 步
上传、提交、看报告
TATOOLS 在线文本分析平台界面示意
平台介绍

从成堆的材料里, 找出站得住的规律

三千篇报道,人工通读要一个月,读完只剩模糊印象;两万条评论,表格一打开就卡住。TATOOLS 把整批材料逐条统计和建模,把结果做成图表和结论说明,您只需要判断规律成不成立、怎么写进论文。

基础功能把材料理清楚:清洗、分词、词频、关键词、情感、人名地名机构名。高级功能把规律挖出来:主题归纳、趋势变化、两批语料对比、知识图谱、写作风格判定。从原始材料到论文附件,一个平台走完,中途不用换软件、不用导来导去。

  • 01

    会用网页就会用

    不装软件、不学命令。上传文件、勾选几个选项、点提交,剩下的交给 TATOOLS。第一次用也能当天拿到结果。

  • 02

    从基础到高级,一个平台走完

    二十多种基础工具管统计:词频、关键词、情感、实体、共现、摘要、可读性。近三十种高级工具管发现:主题归纳、趋势分析、语料对比、知识图谱、相似去重、新词发现。连图片和录音材料也能处理。

  • 03

    每个结论都能回到原文

    报告里的数字、图表和结论都附着统计口径和原文出处。导师问【这个结论怎么来的】,翻到那一页就能回答。

适用人群

为研究者而生

无论材料是新闻、政策、评论还是文学作品,TATOOLS 都能从中找出规律。下面是六种常见用法。

01

学术研究者

文学、语言学、社会学、传播学等领域的研究者。例如把十年间关于某个议题的三千篇报道整批放进去,先看高频词和关键词怎样逐年变化,再让主题模型归纳出几条主线、各自何时兴起何时消退,直接支撑论文里的论证。

文本挖掘语料分析论文支撑
02

教师与学生

课程作业和毕业论文的得力工具。例如把一部小说或一批作文上传,词频、词性、人名地名、句子可读性一次给出,再用共现分析看哪些词总是成对出现,学生把精力放在解释和写作上。

课程教学毕业论文分析报告
03

内容与政策分析

政策研究人员、新闻传播从业者。例如把中央和地方的几十份政策文件分成两批做对比,哪些提法是地方独有、哪些被逐层继承,用关键词上下文索引把每个提法出现的原句列出来,立场和框架一目了然。

政策分析新闻研究内容分析
04

规划与调研机构

城乡规划、公共政策领域的调研分析。例如把几年的规划文本和公开意见放在一起,抽出人物、机构、地点之间的关系画成知识图谱,再按时间看热点议题如何转移。

城乡规划调研分析政策语料
05

数据分析师

为分析人员提供标准化的文本处理流程。例如两万条商品评论,先去掉重复和近似内容,再看正面负面各占多少、抱怨最集中在哪几类说法,一次提交全部给出,不用再手工整理。

数据处理可视化效率提升
06

跨学科团队

论文、新闻、政策和文学材料在同一平台统一管理,不同背景的成员各取所需。例如语言学同事做词汇多样性和搭配强度,传播学同事做报道主题和立场,结果口径一致,可以互相引用。

团队协作跨学科语料管理
工具库

96+ 分析工具
覆盖完整研究流程

从原始材料到规律与报告。简单问题用一个基础工具解决,例如一次词频统计;复杂课题把几个工具串起来,例如先清洗、再去重、再做主题归纳,上一步的结果直接进下一步。 查看完整工具目录

文本清洗

清理文本里的标点符号、表情、网页标签和自定停用词,并可把长文切成等长片段。

文本质量评估器

统计文本的规模、句长、词汇丰富度与重复率,给出 0~100 分,并判断能否用于聚类、主题模型等分析。

中文文本规范化

统一中文材料里的繁简、引号、全半角和省略号写法,可把数字改写成中文,并整篇注音。

词性标注

标出每个词的语法类别,统计词性分布与相邻词性的搭配概率,并与六类参考语料比较写法偏向。

关键词抽取

用 TF-IDF 与 TextRank 两种方法各提一份关键词并交叉对照,标出两者都认可的核心词。

高频词提取

统计词频,并可同时统计两到四个词组成的固定说法,标出哪些提法在多份材料里反复出现。

命名实体识别

找出文本里的人名、地名、机构名和时间,并用规则与语义两种口径并排给出结果供核对。

文体风格指纹

把句长、句型、词性、标点和人称等写作习惯量化成指标,并比较多篇材料的风格接近程度。
HOT

词语共现分析

找出反复一起出现的词组合,用互信息、T 值和对数似然比判断这种搭配有多稳定。
NEW

依存句法分析

逐句标出每个词依附哪个词、构成什么关系,并按依存树深度和句长给句子打复杂度评分。

文本矩阵分析

把材料切成文档段做词频与 TF-IDF 加权,挑出最有区分度的词,并统计它们两两同段共现的次数。
HOT

传统情感分析

用两套情感词典各给每行文本打一次分并判定积极、中性、消极,再比对两者的分歧。
HOT
UPDATED

DeepSentiV2深度学习情感分析

逐行判断文本的情感倾向,给出积极、中性、消极分类、情感得分和情感关键词。
HOT

DeepKeyword 深度学习模型关键词发现

把整份材料当作一篇文章提取核心短语,按综合得分排序并保留原文次数与位置。

简单文本聚类

按内容相似性把一批文本分成若干组,给出每组的关键词、规模和示例文本。

KWIC关键词上下文索引

把关键词的每次出现按左右语境对齐排列,并统计命中次数、密度与同行共现。

关键词命中矩阵

以段落为行、关键词为列统计命中次数,看概念在材料中的分布与共现。
NEW

文档词项矩阵

以词为行、文档为列统计每个词在各篇中的出现次数,比较多篇材料的用词。
NEW

标点纠正

在不改动文字和断句的前提下,修正中文文本里写法不统一或用错的标点。

文本可读性分析

估算中英文材料的阅读门槛,给出可读性综合分、近似阅读年级和难易句样本。
NEW

相似句查找

按语义找出意思相近的句子对,并把互相相似的句子归成一组。

词汇等级评估

逐词对照中英文官方分级词表判定等级,给出整体等级、超纲词和未分级词清单。

抽取式摘要(TextRank / LexRank 双引擎)

从原文中挑出最有代表性的句子拼成摘要,只摘录不改写,并保留原文行号。

敏感信息脱敏

批量识别并替换文本里的身份证号、手机号、银行卡号等固定格式个人信息,输出脱敏后的文本。
NEW

经典LDA主题建模

把多份材料合并成同一批文档训练经典 LDA,输出主题词、文档主题分布与困惑度、一致性。
HOT

高级情感分析

逐条判定情感倾向,给出摘自原文的证据词和整句判定逻辑,并归纳消极文本的主要原因。
UPDATED

AIGC内容检测

排查中文材料的 AIGC 写作痕迹,逐段逐句给出风险值、主要原因和修改方向。
NEW

AI味写作痕迹检测

查找中文文本里常见于大模型写作的句式与标点习惯,给出 0–100 的 AI 写作痕迹指数。
HOT
UPDATED

知识图谱

从材料中抽取实体与关系生成知识图谱,合并同义说法,并归出主题群与一份提纲。
UPDATED

停用词挖掘

按词在各段落的分布挖出本领域特有的高频低信息词,给出可直接取用的停用词候选表。
UPDATED

文本结构还原器

给标点缺失的中文文本补上标点并断句,不增删词语、不调换词序。
HOT
UPDATED

BERTopic 主题聚类

把文本切成片段按语义聚成主题,给出主题名、关键词与主题关系,并可合并拆分主题重出一版。
HOT

高级LDA主题模型

对每个文件分别做 LDA 主题建模,输出主题词、主题标签和每段文本的主题归属。
HOT
UPDATED

VAD 三维情感分析

逐行判定情感极性,并给出效价、唤醒度、支配度三个维度的分值与证据词。

PCA 主成分分析

把文本切成片段作为样本,按词语取值做主成分分析,输出方差解释、词语载荷与片段得分。

高级文本聚类

把材料切成片段后按相似度聚成主题簇,给出每簇的关键词、簇名、占比与代表片段。

LSA 潜在语义分析

把材料切段后提取少数潜在主题,给出主题词、每段的主导主题和方差贡献。
HOT
UPDATED

智能发现新词

找出被分词切碎的术语与专名等组合词,汇总成一份去重后的新词表。

LDA主题数评估

在设定的主题数范围内逐档拟合 LDA,按困惑度和主题一致性等指标给出建议的主题数。
HOT

信息价值评估

逐段计算信息熵、词汇密度等指标并合成综合得分,分出高价值与低价值段落。

文本相似度去重雷达

按语义比较每条文本,找出意思相近的文本对并归成重复组,另可给出改写嫌疑分。
HOT

词语搭配强度分析

统计词对在设定窗口内的共现,用七项关联强度指标区分固定搭配和偶然同现,也可只看指定节点词周围的搭配。

重复内容合并

把意思高度接近的内容归成一组,每组保留一条代表文本、其余标为并入,给出可核对的合并方案。

词汇多样性分析

一次算出 TTR、MTLD 等九项词汇丰富度指标,并沿文本位置画出用词重复程度的变化。

PCA 主成分降维

对表格的数值列做主成分分析,输出方差解释、指标载荷、样本得分与综合名次。

领域术语抽取

从同领域语料里抽出反复出现的多词术语,按 C-value、NC-value 打分并附出现次数与原文用例。

样本聚类

按表格的数值列把样本分成若干类,给出每个样本的归属、各类画像和区分度最高的指标。

语料对比关键词分析

对比目标语料与参考语料的词频,找出目标里说得明显更多和明显更少的词,并给出三项关键性指标。

趋势分析

把带日期的表按日、周或月汇总成时间序列,给出移动平均、环比同比、峰谷与异常波动时点。

语料检索

在一批文档里按查询找出最相关的整篇、段落或句子,关键词与语义两路打分,并高亮命中原文。

词汇增长曲线分析

按累计词数拟合词汇增长曲线与词频分布,给出用词开放度 β、分布陡峭度 s 和拟合优度 R²。

依存句法模式挖掘

逐句做依存句法分析,再把全语料的句法关系、词性骨架、动词论元或修饰搭配归类统计,找出反复出现的句法模式。

话语标记词分析

按因果、转折、递进等八类统计文中衔接词的用量、句首句中位置和沿段落的疏密变化。

写作风格判定

抽取四十来项文体统计特征,据此给出八个维度的风格打分、文体归属候选、风格标签与改进建议。
NEW

全文情感曲线

把长文本切成连续片段逐段判断情绪,画出从头到尾的情绪走势曲线,标出高低点、转折与所属的经典情绪弧。
BETA

中文文本简化

删减中文文本中的冗余表达,改写口语表述,生成简化后的文本。

因果关系推断

从中文文本中抽取原文明确写出的因果关系,归并成因素并连成因果图,标明类型、支撑次数与重要性。

立场分析

识别中文文本里的各方主体与表态原句,判定态度类别与影响力,并梳理彼此的冲突与合作关系。

期待挖掘

从评论、反馈与意见文本中提炼期待内容,归入七类期待,并给出情感倾向、紧急程度与关键词。
HOT

隐含情感识别

逐条判断中文评论与回复是否阴阳怪气、过度捧杀,并给出正负面程度、情感强度与十类主导情感。
NEW

事件时间线抽取

从中文材料中抽取何时发生了什么事,推算日期、合并重复记录,整理成带阶段划分与关键事件的时间线。
NEW

修辞手法检测

逐句标注中文文本中的比喻、排比、反问等十类修辞手法,统计各类次数、占比与每千字密度。
BETA

论证结构识别

从议论文、评论等文本中摘出论点、论据、反例与让步,标出相互关系并画出论证关系图。
BETA

组间差异分析

比较不同组别或配对测量的数值结果,进行差异显著性检验。
BETA

交叉表与卡方分析

对两个分类变量生成交叉表(统计各类别组合),自动选择卡方或 Fisher 检验(判断关联),并输出 p 值与关联强度。
BETA

问卷数据准备助手

整理问卷字段(清理常见格式问题),按研究目标梳理字段角色、量表候选与后续分析建议。
BETA

问卷分析

按题型统计问卷作答数据,汇总选项分布、评分均值与开放题高频词。
BETA

问卷描述性统计

自动识别问卷变量(判断数据类型),输出均值、频数、占比、缺失率和论文叙述句。

访谈录音结构化

将访谈音频转为对话稿(标记说话人与时间),并提取编码标签和核心主题。
BETA

相关分析矩阵

计算多个数值变量的相关系数(衡量关系方向与强弱),输出 p 值、热力图和散点图。
BETA

访谈质性编码

对访谈文本或音频进行三级编码(开放码、主轴码、核心主题),输出主题与语段摘录。
BETA

数据异常值检测

检查数据表的缺失、重复、写法不统一和离群值,给出综合得分,并列出能直接做的表格分析。

表格数据概览

逐列计算表格数据的均值、中位数、频数与占比,并画出取值分布和箱线图。
关于我们

为真实研究流程 重新设计分析工具

我们希望文本分析成为研究者随手可用的基础设施:材料交给 TATOOLS,规律和证据回到研究者手里。

leafiy
北航软件学院大数据专业硕士
Qsmile
清华大学建筑学院博士
96+
在线工具
01
TEAM

工程能力与研究现场共同驱动

TATOOLS 由 leafiy 与 Qsmile 共同发起。leafiy 为北京航空航天大学软件学院大数据专业硕士,关注数据工程、自然语言处理和在线分析工具的产品化落地;Qsmile 来自清华大学建筑学院博士背景,更熟悉城市研究、空间叙事、政策文本和人文社科材料中的真实分析需求。

02
METHOD

不堆算法名词,只整理可复用流程

平台围绕研究者每天都会遇到的材料处理问题设计:访谈、论文、政策文本、新闻报道和问卷材料不再散落在复杂软件、零散脚本和手工表格之间,而是进入清晰、稳定、可复用的网页工具流程。

03
STANDARD

复杂留在后台,证据交给研究者

从文本清洗、分词、词频统计、关键词抽取,到情感分析、主题建模、文本聚类和实体识别,TATOOLS 持续把模型和工程细节放在后台,把清楚的参数、报告和原文出处交给研究者。