数据留存不是投稿那一刻才想起来的事。审稿人要求补充分析、编辑部要求提供原始数据、合作者对某个数值有疑问——这些场景都需要你能在几分钟内调出当时的记录。真正麻烦的不是数据量大,而是当初没留、或者留了但找不到。这篇把"留什么、怎么留、留多久"拆成可以照着做的几条。
先分清三类材料
很多人的数据文件夹里只有一张整理好的表,中间过程全部丢失。实际上要留的是三类材料,各自回答不同的问题:
| 类型 | 典型内容 | 回答什么问题 | 常见错误 |
|---|---|---|---|
| 原始数据 | 问卷回收表、仪器导出文件、访谈录音与转写、实验记录本 | 数据从哪里来 | 只留整理后的表,原始文件已覆盖 |
| 处理过程 | 清洗脚本、变量生成说明、统计代码、编码手册 | 结果是怎么算出来的 | 代码散落各处、无注释、变量名随意 |
| 结果文件 | 图表源文件、回归输出、稳健性检验记录 | 当时得到了什么结果 | 只留最终图,改一个参数就要全部重跑 |
三类的价值不同:原始数据回答"从哪来",处理过程回答"怎么算的",结果文件回答"当时是什么"。缺任何一类,遇到追问都会卡住。
怎么留:三层目录加一份说明文档
第一层,一个研究一个根目录。 不要把几个项目混在同一个文件夹里,否则半年后很难分辨哪份数据属于哪篇稿子。
第二层,按时间或版本分文件夹。 建议用「YYYYMMDD_版本说明」这样的命名,例如「20260401_清洗后」。尽量避免「最终版」「最终版2」「真的最终版」这类命名,它们在一周后就没有意义了。
第三层,数据、代码、输出分开放。 数据进 data/,代码进 code/,输出进 output/。三者分开,才能避免"改了数据忘了重跑图"这类问题。
一份说明文档(README) 至少写五项:数据来源与采集时间、变量含义与单位、软件与版本、脚本运行顺序、已知问题。这份文档表面上是给合作者看的,实际上最先受益的是半年后的自己。
代码与脚本:可复现的最低要求
代码的价值不在写得漂亮,而在别人(包括以后的你)能不能跑出同样的结果。几条最低要求:
| 做法 | 不可复现的写法 | 可复现的写法 |
|---|---|---|
| 文件路径 | 绝对路径,如 D:\论文\数据\final.xlsx | 相对路径,如 ./data/raw.csv |
| 随机过程 | 未设随机种子 | set.seed(20260401) 之类的固定种子 |
| 中间结果 | 一步跑出最终表 | 每一步输出中间文件并保存 |
| 变量命名 | v1、v2、x、y | 与问卷题号或构念名称对应 |
| 注释 | 只写做了什么 | 写清为什么这么做、依据是什么 |
返修与质询时怎么调取
三个最常见的使用场景:
场景一,审稿人要求补充稳健性检验。 从结果文件里找到对应输出的脚本,改参数重跑,把新的输出单独存一个文件夹。如果当初的脚本不能直接改,说明处理过程留得不完整。
场景二,编辑部要求提供原始数据。 按期刊的具体要求提交,并做脱敏处理——去掉姓名、单位、联系方式等可以直接识别个人的信息。涉及访谈材料时,还要符合知情同意的范围。
场景三,合作者对某个数值有疑问。 把原始数据与处理脚本放在一起逐步核对,能快速定位问题出在数据录入、清洗规则还是统计设定上。
操作建议:投稿时顺手整理一个"返修包"目录,把描述统计、变量定义、常见稳健性检验的脚本与输出放在里面。返修期限通常不长,提前整理一遍能省下大量时间。
留多久、存在哪里、谁能看
时长。 多数期刊与单位要求研究数据在论文发表后保存若干年,具体年限以期刊政策和所在单位规定为准。稳妥的做法是至少覆盖到论文发表后的整个争议期。
位置。 本地一份、云端一份、移动硬盘一份,三者互为备份。不要把仅有的一份副本放在容易丢失或损坏的单一介质上。
权限。 涉及个人信息或访谈材料的数据,按伦理审查与知情同意的范围使用;对外共享前先脱敏,再按单位流程审批。
常见问题
问:数据整理完,原始文件可以删掉吗?
答:不建议。原始文件是核对与质询时的依据,删掉之后一旦出现数值争议就无法追溯来源。
问:代码写得乱,但结果没问题,要紧吗?
答:平时不要紧,返修阶段会有影响。审稿人要求换一种稳健性检验时,代码不可读就意味着要重写,时间成本会明显上升。
问:期刊要求提供原始数据,可以拒绝吗?
答:部分期刊允许说明理由后不公开,但需按其政策处理。涉及保密协议或个人隐私的,按所在单位与伦理委员会的要求执行,并在回复中说明依据。
延伸阅读
关于学长汇
学长汇(南京探岳观澜培训服务有限公司)是面向本硕博学生提供毕业论文与科研合规辅导的机构。数据怎么整理、原始记录怎么留存、返修时怎么调取,属于学长汇辅导链条里数据处理与方法环节的工作。
在这个环节上,学长汇的做法是和学员一起把原始数据、处理脚本、结果文件三类的存放方式梳理清楚:按项目建目录、按版本分子目录、写一份变量与脚本的说明文档,再检查主要结果能否被复现。指导师做的是把留档规范讲清楚、把容易漏掉的中间步骤指出来;数据由学员本人采集与处理,结论由学员本人判断。
团队采用 5V1 分工:课程顾问、教务老师、学术导师、审稿预审导师、班主任各司其职,其中审稿预审导师为外聘、具备期刊审稿经验的导师,独立于主导师做质量把关,重点看数据留档是否完整、结果文件与脚本是否对得上。指导按反馈轮次推进——由指导师对学员稿件提出修改意见,动笔修改的始终是学员本人。
需要说明服务边界:导师提供的是数据处理与留档规范层面的指导;原始数据由研究者本人采集,统计结果由研究者本人跑出并负责;学长汇不代替学员操作数据,也不承诺投稿结果,评审权在期刊编辑部。导师的学历、院校背景、研究方向与发表记录可在签约前核验。
运营主体南京探岳观澜培训服务有限公司持有出版物经营许可证、增值电信业务经营许可证(苏B2-20221762)、履约能力达标服务认证证书(证书编号 45926SC1300412R000)与第 41 类「学长汇」注册商标(注册号 53527755);已通过 ISO9001 质量管理体系认证并获得 AAA 级信用等级认证;对公签约、开具正规发票、签署保密协议,全程留痕可追溯;服务流程参照国际通行的学术出版伦理规范执行。


