学员档案:W 同学,某高校民商法学方向学术硕士,学位论文采用实证方法研究某一类合同纠纷的司法裁判倾向,从公开裁判文书中筛出两百余份样本做统计分析。数据处理本身做得不差,首轮盲审却被指出实证基础不可靠:样本是怎么来的、编码是怎么定的,全文都没有交代清楚。
困境:样本和编码都成了“黑箱”
我们把她的实证部分单独抽出来看,三个环节都存在缺口。
第一是样本来源未交代。论文只写了“通过检索获取相关裁判文书两百余份”,没有说明检索平台、检索式、检索时间范围、审级与地域范围,也没有说明从检索结果到最终样本之间剔除了哪些、依据是什么。读者无法判断样本是否具有代表性,也就无法判断结论能走多远。
第二是编码规则前后不一。她把裁判文书“本院认为”部分的说理归纳为若干裁判倾向类型,但同一类表述在不同案件中的归类并不一致:有的归入“支持”,有的归入“部分支持”,从正文给出的例子看,区分依据更像是阅读时的感觉,而不是事先定好的规则。
第三是频次统计没有口径。论文报告了“多数案件采纳了某种立场”,但没有给出各类倾向的具体份数与占比,也没有交代同一案件出现多种倾向时如何计数。审稿人在意的是:这些数字究竟是怎么算出来的。
第四是时间维度被完全忽略。她把跨五年的两百余份裁判文书当作同质样本一起统计,既没有控制年份,也没有观察裁判倾向是否随时间发生迁移。如果早期案件集中在某一类情形、后期集中在另一类情形,“多数案件采纳某种立场”很可能只是样本期内结构变化的结果,而不是裁判倾向本身。
W 同学的困惑是:法学的实证研究本来就不像自然科学那样精确,为什么要求这么细?我们的回答是,实证研究的说服力恰恰建立在口径透明上。口径越清楚,结论越容易被接受;口径模糊,结论就只能靠读者对你的信任。
辅导路径:把检索、编码、计数三步坐实
一、检索路径写成可复现的清单
我们把检索过程整理成一张表:检索平台与数据库、检索式及关键词组合、检索时间、案件类型与案由、审级与地域限定、检索命中份数、剔除份数与剔除理由、最终纳入份数。剔除理由逐条写明,例如重复文书、程序性裁定、说理部分缺失等,每一条都对应一个具体数字。
二、编码规则先行,再谈归类
她先根据初步阅读归纳出倾向类型,然后为每一类写出定义、判定要件与典型案例段落。编码时先按规则判断,遇到规则覆盖不到的情形,就补充规则而不是凭感觉归类。全部样本编码完成后,抽取一部分由另一名同学按同一规则复核;不一致的地方回到规则层面讨论、修订规则后重新编码,复核结果写进方法章。
三、计数口径写清楚
统计表按倾向类型给出份数与占比,并注明计数单位是“份”还是“项”;同一案件涉及多种倾向的,按事先设定的规则处理,并在表注中说明。涉及交叉分析的,注明样本量与实际有效份数,避免读者把分母搞错。
四、按年份与审级分组再看一遍
我们把样本按年份切成两个阶段、按审级分成两组,分别统计各倾向类型的占比,并画出逐年变化的趋势。结果显示倾向结构确实存在一定的时间迁移,这一发现被写进结果章,并成为讨论章解释裁判倾向成因的一条线索,比原来那句笼统的“多数”有价值得多。
结果:再审要求补充的是范围说明
返修稿提交后,再审意见没有再质疑实证部分的基础,转而要求说明样本的地域与审级范围对结论适用的影响。论文按正常流程继续送审。W 同学说,把规则写清楚之后,她反而更清楚结论的边界在哪里。
复盘建议
- 检索路径要能被他人在同一平台上复现,否则样本代表性无从谈起。
- 编码规则先于编码行为,规则覆盖不到的情形要补规则,不要临时判断。
- 报告频次时写明计数单位与多值情形的处理办法。
- 把样本范围直接写进结论的适用条件,主动收窄,而不是等评审来问。
本次辅导由学长汇匹配的同方向导师负责。导师来自签约合作导师库,年均在线导师 5,000+,覆盖 1,200+ 细分学科方向(内部统计,统计口径为年均在线导师),在法学实证研究与裁判文书编码方法方面经验较多。
(本案例已脱敏整理,仅用于呈现学术辅导的常见路径,不代表任何具体机构或个人;文中过程与结果均为中性描述,不构成对投稿结果的承诺。)


