返回教程列表
文本分析基础教程情感分析三分类短文本分析

Mia 开源情感三分类:逐条判断后,怎样读分布与把握

这篇教程以短文本为分析单位,讲清负面、中性、正面三类概率如何形成逐条判断,以及类别分布、只分正负时的占比与把握分布各用什么分母。结合 TATOOLS 的公开实例,说明表格多列输入时的计数口径,并演示任务页设置、报告阅读与逐条结果下载。

作者:TATOOLS 研究团队|更新于 2026-09-27|1477 个字符|约 5 分钟读完
mia-sentiment
立即使用

一份反馈表里既有称赞,也有抱怨,还有只陈述事实的句子。逐条读可以保留语境;材料多了,还需要知道各类各有多少,以及哪些判断值得回到原文核对。TATOOLS 的【Mia开源情感三分类】把短文本逐条归入负面、中性或正面,并保留每一类的概率。

01

先确定什么算一条

TATOOLS 对文本逐条判断。每条记为 x,输出三类概率 p(负面|x)、p(中性|x)、p(正面|x),三者相加为 1。概率最高的类别是该条的判断结果。

· · ·

判断类别 = 三类概率中的最大者对应的类别

把握 = 最大的那个概率

例如,一条文本的三类概率依次为 0.10、0.75、0.15,结果是中性,把握为 0.75。把握记录这条文本最高类别的概率。报告中的【平均把握】把所有已判断文本的把握相加,再除以已判断条数。

研究前先把分析单位定清楚。TATOOLS 在逐行材料中把一行算作一条;表格材料则把选中列里的每个非空单元格算作一条。同一行选了多个列,就会产生多条判断。若研究对象是评论正文,提交时只选装评论的列。超过 512 字的一条文本只分析前 512 字;清理后没有文字的条目不计入已判断条数。

02

三分类和只分正负各回答什么

三分类统计各类别的条数与占比。TATOOLS 以已判断条数 N 为分母,某类有 n 条,占比就是 n÷N。若 N 为 20,其中负面 5 条、中性 12 条、正面 3 条,三类占比分别是 25%、60%、15%。这张分布表描述本次输入的文本单元。

【只分正负时】使用同一批文本,不丢掉原先判为中性的条目。TATOOLS 对每条只比较正面与负面的概率,较大的一方记为【偏正面】或【偏负面】,再用全部已判断条数作分母。所以这一栏的偏正面占比可以高于三分类里的正面占比;两栏回答的是不同问题。

03

在任务页提交

打开 TATOOLS 的Mia开源情感三分类,在【上传文本】区域选择材料。任务页的【模型版本】提供三个选择:默认版本用于尽量找出差评和抱怨;第二个版本用于快速查看整体分布;第三个版本适合对大量材料先作初步浏览。前两个版本把褒贬并存的句子归为中性,第三个版本对此没有固定归类。按研究中【中性】的定义选择,再向下滚动点【提交任务】。完成后打开报告,逐条结果也可从报告下载。下面的截图记录当前任务页状态;公开实例选择了第三个版本。

TATOOLS 使用教程配图

Mia 开源情感三分类任务页的上传文本入口与三个版本选择

04

用公开实例读报告

下面使用 TATOOLS 的Mia开源情感三分类公开实例。实例提交了三份测试材料,选择的是第三个版本。每份表格有 300 个数据行,报告各记 1800 个已判断单元格,合计 5400 条。这里的【条】是选中列的文本单元格。

TATOOLS 使用教程配图

Mia 开源情感三分类公开实例的结果说明与三类总览

【总览】记录负面 647 条,占 12.0%;中性 4156 条,占 77.0%;正面 597 条,占 11.1%。三个占比都以 5400 条已判断文本为分母。【只分正负时】逐条重新比较正负概率,偏正面占 85.4%;三分类中的正面占比仍为 11.1%。

报告还列出【把握分布】与把握不足 0.6 的文本,本例有 32 条落在后一组。阅读研究材料时,可先看各文件的分布,再回到具体文本及其来源列核对难判断的条目。报告的【下载原始数据】给每个输入文件一份逐条结果,包含类别、三类概率与把握。

05

小结

•

分析单位先按行或所选列的单元格确定,分布的分母是已判断文本数。

•

三分类给出负面、中性、正面的标签;【只分正负时】对同一批文本另作一次概率比较。

•

【把握】属于单条判断,低把握条目可回到原文与来源列核对。

若要同时观察情绪强弱与维度,可接着阅读 TATOOLS 的【VAD 三维情感分析】教程。

06

资料来源

•

Mia 开源项目与评测资料


END