一份反馈表里既有称赞,也有抱怨,还有只陈述事实的句子。逐条读可以保留语境;材料多了,还需要知道各类各有多少,以及哪些判断值得回到原文核对。TATOOLS 的【Mia开源情感三分类】把短文本逐条归入负面、中性或正面,并保留每一类的概率。
01
先确定什么算一条
TATOOLS 对文本逐条判断。每条记为 x,输出三类概率 p(负面|x)、p(中性|x)、p(正面|x),三者相加为 1。概率最高的类别是该条的判断结果。
判断类别 = 三类概率中的最大者对应的类别
把握 = 最大的那个概率
例如,一条文本的三类概率依次为 0.10、0.75、0.15,结果是中性,把握为 0.75。把握记录这条文本最高类别的概率。报告中的【平均把握】把所有已判断文本的把握相加,再除以已判断条数。
研究前先把分析单位定清楚。TATOOLS 在逐行材料中把一行算作一条;表格材料则把选中列里的每个非空单元格算作一条。同一行选了多个列,就会产生多条判断。若研究对象是评论正文,提交时只选装评论的列。超过 512 字的一条文本只分析前 512 字;清理后没有文字的条目不计入已判断条数。
02
三分类和只分正负各回答什么
三分类统计各类别的条数与占比。TATOOLS 以已判断条数 N 为分母,某类有 n 条,占比就是 n÷N。若 N 为 20,其中负面 5 条、中性 12 条、正面 3 条,三类占比分别是 25%、60%、15%。这张分布表描述本次输入的文本单元。
【只分正负时】使用同一批文本,不丢掉原先判为中性的条目。TATOOLS 对每条只比较正面与负面的概率,较大的一方记为【偏正面】或【偏负面】,再用全部已判断条数作分母。所以这一栏的偏正面占比可以高于三分类里的正面占比;两栏回答的是不同问题。
03
在任务页提交
打开 TATOOLS 的Mia开源情感三分类,在【上传文本】区域选择材料。任务页的【模型版本】提供三个选择:默认版本用于尽量找出差评和抱怨;第二个版本用于快速查看整体分布;第三个版本适合对大量材料先作初步浏览。前两个版本把褒贬并存的句子归为中性,第三个版本对此没有固定归类。按研究中【中性】的定义选择,再向下滚动点【提交任务】。完成后打开报告,逐条结果也可从报告下载。下面的截图记录当前任务页状态;公开实例选择了第三个版本。
Mia 开源情感三分类任务页的上传文本入口与三个版本选择
04
用公开实例读报告
下面使用 TATOOLS 的Mia开源情感三分类公开实例。实例提交了三份测试材料,选择的是第三个版本。每份表格有 300 个数据行,报告各记 1800 个已判断单元格,合计 5400 条。这里的【条】是选中列的文本单元格。
Mia 开源情感三分类公开实例的结果说明与三类总览
【总览】记录负面 647 条,占 12.0%;中性 4156 条,占 77.0%;正面 597 条,占 11.1%。三个占比都以 5400 条已判断文本为分母。【只分正负时】逐条重新比较正负概率,偏正面占 85.4%;三分类中的正面占比仍为 11.1%。
报告还列出【把握分布】与把握不足 0.6 的文本,本例有 32 条落在后一组。阅读研究材料时,可先看各文件的分布,再回到具体文本及其来源列核对难判断的条目。报告的【下载原始数据】给每个输入文件一份逐条结果,包含类别、三类概率与把握。
05
小结
分析单位先按行或所选列的单元格确定,分布的分母是已判断文本数。
三分类给出负面、中性、正面的标签;【只分正负时】对同一批文本另作一次概率比较。
【把握】属于单条判断,低把握条目可回到原文与来源列核对。
若要同时观察情绪强弱与维度,可接着阅读 TATOOLS 的【VAD 三维情感分析】教程。
06
资料来源
END
