学员档案:F 同学,某财经类高校经济学在职硕士,一边工作一边读研。论文以问卷调研为基础做实证分析,初稿完成后被导师指出“数据不能支撑结论”。重新梳理数据清洗流程与模型设定后,论文通过盲审。以下为整理后的复盘。
一、在职读研最真实的困难:时间碎,链条断
我是在职读的硕士,白天上班,晚上和周末写论文。最大的困难不是智商,是时间被切得太碎:一次分析做到一半被工作电话打断,等回头接着做,上下文全忘了。
我的研究用的是问卷调研数据,自己设计问卷、自己发了 400 多份。初稿写完后交给导师,导师的评语很短:
“你的数据我看不出能支撑这个结论。回去把数据处理过程重新走一遍。”
我当时挺委屈——数据是我一份一份收的,怎么会不能支撑?后来才发现,问题恰恰出在这句话背后的“数据处理过程”上。
二、数据清洗:我原来做的其实叫“删除”
把自己的操作流程一步步写下来之后,我发现了几个致命问题:
- 问卷里有 30 多份填答时间不足 60 秒,我直接删掉了,但没有任何删除标准说明;
- 有三个题项存在明显的反向计分题,我在录入时没有做反向处理,直接当成正向算了;
- 缺失值我用了“整行删除”,导致有效样本从 400 多掉到 300 出头,却还在文中声称样本量为 400;
- 有两组变量的量纲差异很大,我直接放进了同一个模型,没有标准化。
最要命的是第二个。反向题没有翻转,等于有两组变量的方向是反的——这几乎必然导致结论扭曲。
三、重做数据处理与模型设定
第一步:把清洗过程写成文档
导师要求我做一件很“笨”的事:把每一步清洗操作写进一份文档,标明操作对象、判断标准、受影响样本数。这份文档后来直接变成了论文中的数据说明部分。
第二步:回到原始问卷重新录入与核对
这一步花了我整整三个周末。我重新核对了全部问卷,修正了反向计分题,把缺失值处理方式从“整行删除”改为按变量类型分别处理,并在文中如实说明。
修正之后,有效样本量从 300 出头回到 380 多,主效应依然存在,但稳健性明显好了很多。
第三步:模型设定补全
原来的模型是直接套用文献里的形式。改动包括:
- 变量标准化,消除量纲影响;
- 加入必要的控制变量,并说明选择依据;
- 做多重共线性检验,剔除一个高度相关的变量;
- 补充稳健性检验:替换核心变量度量方式、更换估计方法,看结论是否稳定。
四、写作层面的调整
作为在职学生,我最大的写作问题是“跳跃”。因为时间碎,我常常隔了两周才回来写下一段,前后逻辑接不上。
解决办法是:每次开写之前,先把这一节的逻辑链条用三句话写在纸上——“这一节要证明什么、用什么证据、得出什么”。写完再删掉这三句提示。这一个小习惯让我后面几章的返工量减少了一半以上。
五、结果与复盘
- 重做数据与模型:约 6 周(含 3 个周末集中作业);
- 盲审结果:2 位专家均通过,其中 1 位给出“数据处理规范、结论审慎”的评价;
- 总周期:从被导师退回大改到通过盲审,共 4 个月。
给在职读研的同学三条建议:
- 反向计分题一定要核对,这是问卷类论文最常见的致命错误;
- 数据清洗过程必须留文档,它既是自查工具,也是论文的组成部分;
- 时间碎就用“三句话逻辑链”的方式接续写作,别指望每次都重新进入状态。
如果你也卡在数据分析或模型设定上,可以联系学长汇匹配经济与商学方向的导师,先做一次针对性的诊断。


