变量加工
Beta

按论文常用的方式加工表格里的变量:把极端值缩尾或截尾、给金额取对数、算面板数据的滞后与差分、做中心化与标准化、把文字类别拆成虚拟变量,输出原列加新列的表和一份变量字典。

加载文件上传组件中...

首行放列名,一行一条记录。每种加工各自填列名,填了的才做;原列保留,新列加在表的末尾,加工后的表可以直接拿去做描述统计、相关和回归。

这个工具需要的表格大致是这样:

企业编号年份行业企业绩效总资产资产负债率
C0012021制造业0.05232500000.41
C0012022制造业0.06134100000.39
C0022021零售业0.03411800000.55

一行一条记录;要加工的数值列是纯数字,文字类别的列只能生成虚拟变量。

经管论文的惯例是对连续变量在 1% 和 99% 分位缩尾。新列名在原列名后加 _w。

总资产、营业收入这类右偏严重的金额通常取对数。新列名为 ln_ 加原列名。

取同一个对象上一期的值,或当期减上一期。需要个体列和时间列。新列名为 L1_、D1_ 加原列名。

做交互项前常先中心化;不同单位的变量要比较系数大小时用标准化。新列名在原列名后加 _c 或 _z。

把行业、地区这类文字类别的列拆成每个类别一列 0/1。类别不超过 30 个。新列名为原列名_类别。

每 100 行 2 点