变量加工Beta
按论文常用的方式加工表格里的变量:把极端值缩尾或截尾、给金额取对数、算面板数据的滞后与差分、做中心化与标准化、把文字类别拆成虚拟变量,输出原列加新列的表和一份变量字典。
加载文件上传组件中...
首行放列名,一行一条记录。每种加工各自填列名,填了的才做;原列保留,新列加在表的末尾,加工后的表可以直接拿去做描述统计、相关和回归。
这个工具需要的表格大致是这样:
| 企业编号 | 年份 | 行业 | 企业绩效 | 总资产 | 资产负债率 |
|---|---|---|---|---|---|
| C001 | 2021 | 制造业 | 0.052 | 3250000 | 0.41 |
| C001 | 2022 | 制造业 | 0.061 | 3410000 | 0.39 |
| C002 | 2021 | 零售业 | 0.034 | 1180000 | 0.55 |
一行一条记录;要加工的数值列是纯数字,文字类别的列只能生成虚拟变量。
经管论文的惯例是对连续变量在 1% 和 99% 分位缩尾。新列名在原列名后加 _w。
总资产、营业收入这类右偏严重的金额通常取对数。新列名为 ln_ 加原列名。
取同一个对象上一期的值,或当期减上一期。需要个体列和时间列。新列名为 L1_、D1_ 加原列名。
做交互项前常先中心化;不同单位的变量要比较系数大小时用标准化。新列名在原列名后加 _c 或 _z。
把行业、地区这类文字类别的列拆成每个类别一列 0/1。类别不超过 30 个。新列名为原列名_类别。
每 100 行 2 点
