表格数据概览
对 CSV 或 Excel 表格逐列做描述统计。先按取值判断每列是连续变量、Likert(量表打分)、定类还是二分变量。连续变量和量表列计算均值、中位数、标准差等,并画出取值分布和箱线图;量表列另算选最高、最低档的比例。定类和二分列统计每个取值的频数、百分比和累计占比。指定分组列后,再按组列出样本量、连续变量的均值,以及类别列在各组里最常见的取值。
变量类型由取值分布判断
- 一行一条记录,一列一个变量。只统计前 10 万行、前 120 列,超出的行列不进入结果。
- 取值是 2 到 7 个整数且落在 1 到 5 或 1 到 7 之间的列按 Likert(量表打分)汇总;取值多且基本都是数字的列按连续变量画直方图和箱线图;其余按定类给频数与累计占比。判断不对时在下面逐列指定。
- 分组部分只并列展示各组的均值与组内占比最高的取值,不做任何组间检验。
加载文件上传组件中...
这个工具需要的表格大致是这样:
| 渠道 | 下单金额 | 满意度 | 城市 |
|---|---|---|---|
| 线上 | 128.5 | 5 | 杭州 |
| 线下 | 96.0 | 4 | 南京 |
| 线上 | 210.0 | 3 | 杭州 |
一行一条记录;数值列放纯数字,类别列放文字或选项编码。
留空则不做分组对照。填一个类别列(例如性别、班级、渠道),报告会多出三部分:各组有多少条记录,每个连续变量在各组的均值,定类、二分与 Likert(量表打分)列在各组里最常见的取值。最多 28 组。
只在自动判断不合适时填写,没有列出的列仍按自动判断。容易判断错的例如:用 1、2、3 代表学历的列会被当成打分,0 到 10 分的打分题和取值不多的年龄会被当成类别。自动填写会把这类列找出来。
每 1,000 个字符 1 点
