实证分析全流程Beta
上传一张数据表,指定因变量和核心自变量,按实证论文的顺序从描述统计、相关分析做到基准回归,再做稳健性检验和分样本回归;填了中介变量或调节变量时加做机制检验。估计方法按因变量的类型选择,填写个体列和时间列时控制双向固定效应并按个体聚类。每个环节给出一句结论和能放进论文的三线表,汇成一份 Word 报告和一份 Excel 表。
加载文件上传组件中...
首行放列名,一行一条记录。填写的列名须与表头一致;只有因变量和核心自变量必填,其余按你的数据有什么填什么。
这个工具需要的表格大致是这样:
| 公司代码 | 年份 | 资产收益率 | 数字化转型 | 企业规模 | 资产负债率 | 行业 | 产权性质 |
|---|---|---|---|---|---|---|---|
| 000001 | 2019 | 0.052 | 1.2 | 22.4 | 0.48 | 制造业 | 国有 |
| 000001 | 2020 | 0.061 | 1.9 | 22.6 | 0.46 | 制造业 | 国有 |
| 000002 | 2019 | 0.034 | 0.4 | 21.1 | 0.57 | 零售业 | 民营 |
一行一条记录;同一家公司有多年记录时,公司代码是个体列、年份是时间列。只有一期的数据不需要这两列。
你想解释的结果,可以是连续数值,也可以是只有两个取值的列或次数。
你最关心的那个原因,须是数值列(0/1 也可以)。填了多个时,机制分析用第一个。
其他可能影响因变量的因素,比如企业规模和所在行业。文字类别的列会自动按类别处理。
如行业代码、地区编码。不填会被当成连续数值。
同一家公司、同一个人在表里有多期记录时填写,要和时间列一起填。
区分各期的列,比如年份或调查轮次。
想看核心自变量的影响在不同人群、不同类型企业里是否一样时填写。类别最多 6 个;数值列按中位数分成高低两组。
X 先影响它、它再影响 Y 的那个变量,须是数值列。
它取值不同,X 对 Y 的影响就不同的那个变量。
写在 Word 报告的标题位置。
默认。因变量是连续数值用线性回归,只有两个取值用逻辑回归,是次数用泊松回归。
经济、管理、金融类期刊的惯例。
把每个连续变量最小 1% 和最大 1% 的值压到分界值上,减少极端值的影响。0/1 和取值很少的列不处理。
每 100 行 2 点
