学员档案:Y 同学,某高校产业经济学方向学术硕士,学位论文研究企业规模与创新产出之间的关系,使用一家公开数据库的多年面板数据。首轮外审意见认为,论文对核心变量的处理方式损失了大量信息,结论的稳健性存疑。
困境:连续变量被一刀切成两组
问题出在一个看似省事的做法上。
Y 同学把企业规模按样本中位数切成“大企业”与“小企业”两组,用分组虚拟变量做回归;又把研发强度按三分位切成“低、中、高”三组。这样做的好处是结果好解释,坏处有三条。
第一,连续信息被压缩成类别。同样是中位数以下的企业,规模可能相差几十倍,但在这套设定里没有任何区别。变量本身的变异被丢弃,估计精度也随之下降。
第二,分组阈值缺乏依据。为什么用中位数而不是均值、三分位而不是四分位?论文没有给出任何理由,也没有说明换一个阈值结论是否还成立。评审自然会问:如果换个切法结果就变了,那这个结论还稳吗?
第三,分组导致样本被摊薄。在需要控制行业与年份固定效应时,分组后某些格子的观测数很少,估计变得不稳定,个别系数在加入控制变量后方向就翻了。
第四是口径在摘要与正文之间不一致。摘要里写的是“大企业的创新产出显著更高”,正文表格的分组依据却是研发强度的三分位,两处说的并不是同一个变量。评审读到摘要再翻正文,很容易产生“结论与证据对不上”的印象。
Y 同学一开始觉得这是审稿人挑刺:分组在文献里也很常见。我们的解释是,分组本身不是错,错在没有说明为什么这样分组、也没有检验结论对分组方式的敏感性。
辅导路径:从“分组比较”改回“连续设定”
一、核心解释变量改用连续形式
我们把企业规模还原为连续变量(取对数以缓解右偏),研发强度也改用连续形式,重新估计主回归。结果的方向与分组时一致,但系数精度明显提高,个别原本因为分组而变得不显著的变量重新变得可解释。回归表同时补报了标准误与置信区间,读者可以直接判断估计的精度。
二、补做阈值敏感性分析
考虑到研究问题本身确实关心“规模达到一定程度后效应是否变化”,我们没有简单地一删了之,而是补做了系统的阈值考察:以中位数、均值、三分位为界分别估计,并绘制不同阈值下系数的取值与置信区间,观察结论是否稳定。结果显示效应在阈值两侧的变化是平滑的,说明原来那种“突变式”解读并不成立。
三、非线性关系正面检验
如果确实存在“规模到一定程度后效应减弱”的猜想,正确做法是引入二次项或分位数回归,而不是把它藏在分组阈值里。我们补做了二次项设定与分位数回归,把效应的形状正面呈现出来,并在方法章说明为什么选择这种设定。
四、摘要、正文与表格的口径同步
变量设定一改,摘要与结论章的表述必须同步更新。我们把摘要中所有涉及分组的表述核了一遍,统一改为连续变量的边际效应表述,并逐张核对表格的变量名、单位与样本量,确保三处口径完全一致。这类不一致往往不是研究能力问题,而是改稿时的疏漏。
结果:再审关注阈值的经济含义
返修稿提交后,再审意见不再质疑变量处理,转而讨论阈值位置的经济学解释是否充分。论文按正常流程进入后续环节。Y 同学说,改完才发现原来的分组设定其实掩盖了真正有意思的现象。
复盘建议
- 能用连续变量时优先用连续变量,分组只用于回答特定问题。
- 凡是设定阈值,都要说明依据,并报告结论对阈值的敏感性。
- 关心非线性就正式检验非线性,不要用分组阈值代替。
- 变量处理方式一旦调整,主回归与稳健性检验的口径要同步更新。
本次辅导由学长汇匹配的同方向导师负责。导师来自签约合作导师库,年均在线导师 5,000+,覆盖 1,200+ 细分学科方向(内部统计,统计口径为年均在线导师),在计量模型的变量设定与稳健性检验方面经验较多。
(本案例已脱敏整理,仅用于呈现学术辅导的常见路径,不代表任何具体机构或个人;文中过程与结果均为中性描述,不构成对投稿结果的承诺。)


