《Nature》直到 1973 年,才要求所有论文送外审
一九七三年,戴维·戴维斯出任《Nature》主编,才规定所有论文必须经过外部同行评审。
一九七三年。
我看到这个年份的时候愣了一下。因为在我的印象里,"《Nature》"和"同行评审"是绑定的,而且绑定了很久——像是这本刊物从创刊起就靠这套机制在筛稿。
不是。
而且不止《Nature》。《Science》要到二十世纪五十年代才普遍使用外审。《美国医学杂志》到一九六〇年代才引入。一九八九年,《柳叶刀》主编仍称审稿人「仅作为顾问,不做决定者」。
这套制度在二战后才成为科研资源分配和期刊质量控制的重要环节;一九七〇年代的美国才更明确地把它视为学术质量的核心要素。
那更早的呢?
一七三一年,《医学观察与论文集》出现了目前已知最早的盲审案例——作者不知道评审者的身份。但这只是一次已知的早期盲审,不等于现代意义上的外审制度。
一八三一年,威维尔提议由两位皇家学会院士评阅稿件。这个试验很快因为两位院士意见分歧而失败了。
失败的是那次具体的制度试验。原报告把 1731 年记为「第一个已知的盲审案例」,1831 年记为一次失败的制度试验,而真正意义上的匿名同行评审制度要到十九世纪中叶以后才陆续出现。
那它可靠吗?
Bornmann 等人二〇一〇年综合了 48 项研究、19,443 篇稿件,得到的评审者之间一致性是:平均 ICC 约 0.34,Cohen's κ 约 0.17。
κ 约 0.17 —— 原报告称其「远低于『良好』水平」,并注明一般 κ<0.4 属于较弱一致。
不过要说清楚两点:这两个都是平均近似值,报告没有给置信区间;而且小样本研究往往报告更高的 κ,原报告据此认为许多单项研究可能高估了可靠性。
(上图:依本文所据报告中的四个年份绘制。《Science》普遍外审那一节点未标于图上——报告正文写的是「二十世纪五十年代」,而它自己的时间轴又标成了「1950」,两种口径并存。)
然后是身份的影响。
Tomkins 等人二〇一七年发现:单盲相对于双盲,让知名作者的论文获推荐录用的赔率高约 1.63 倍,顶尖大学的论文高约 1.58 倍。
不过原报告只转述了该研究在一次大型计算机会议中的推荐录用赔率,未列出样本量和置信区间。
Budden 等人二〇〇八年报告:《Behavioral Ecology》在二〇〇一年改用双盲之后,女性第一作者的比例显著上升,而作为对照的单盲期刊没有出现这个变化。同样——样本和变化幅度没有列出。
地域和机构方面也存在差距。当作者信息公开时,富裕英语国家的作者被选中送审的概率比低收入国家作者高 68%,获得修订邀请的比例高 28%。
匿名之后:送审概率上的 68% 优势几乎消失;修订邀请方面的优势由 28% 降到 4%。
注意这是两个不同的指标,不是同一个数字从 68% 掉到 4%。而且 4% 不是零,这些数字也都没有附样本量和置信区间。双盲也未必能完全遮蔽——审稿人若能从稿件内容推测或得知作者身份、研究方向,主观偏好可能影响判断。
那替代方案更好吗?
这里要提醒一处需要自己回查的地方。
我读的那份报告写道:已有随机对照实验(Godlee 等,1998)表明,要求审稿人签名反而略微提高了评审的批判性。
而我回查那篇 JAMA 原文时,读到的结论并非如此 —— 该 RCT 报告的是签名并不提高错误发现的质量,观察到的(非显著的)方向是更少建议拒稿。这一条如果你要用,请自己打开原文核对。
至于其余部分,现有结论大致是「未见明显质量损失」:双盲对质量影响不大,多项研究没有发现双盲或开放审稿带来负面后果。
但这些质量比较在转述里没有列出样本量、效应量或置信区间,所以能说的只是「未见明显损失」,不能进一步说成已经证明等效。
写到这里,我必须说一件关于这篇文章本身的事。
关于我读的这份研究报告本身,有几点可以直接核对:
它标称的 15 条链接,去掉锚点后只对应 6 个不重复页面,其中有 2 个是 ResearchGate。它自己的时间线把「二十世纪五十年代」写成了「1950」这样一个精确年份。二〇〇六年和二〇一六年那两个节点没有行内来源。
还有一处同样建议自己回查。
我读的那份报告写的是:Peters 与 Ceci(1982)把 12 篇已发表的心理学论文匿名投回原刊,只 3 篇获接受,其余因「方法不当」等原因被拒——报告并注明,这一段未从原文献摘录,仅作定性引用。
而我回查一手文献时,读到的「3」对应的是被识别出属于重复投稿的篇数,不是被接受的篇数。
一个是「被接受」,一个是「被认出来了」——差别很大。既然报告自己已经标明它没有摘录原文,这一条就更值得你亲自打开原始研究看一眼。
于是这篇文章有点自指:上述链接重复和部分节点缺少行内来源,使我认为它的关键结论仍值得回到原始文献复核。(这是我的判断,不是报告自己的结论。)
那个悬着的问题我给不出答案:一个平均评审者一致性 κ≈0.17(Bornmann 等纳入 48 项研究、19,443 篇稿件后的平均值)、在特定单盲研究里显示出身份效应的制度,为什么在二十世纪七十年代的美国被更明确地视为学术质量的核心要素——该修补,还是该替换?
原报告没有直接比较「修补」和「替换」两条路线;它依据现有证据提出的是可酌情或更广泛采用双盲、提高透明度。
主要来源:
Bornmann 等,评审者一致性荟萃分析 https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0014331
Baldwin,同行评审起源与制度史 https://ethos.lps.library.cmu.edu/article/id/19/
UKSG Insights,机构与地域偏差 https://insights.uksg.org/articles/10.1629/uksg.681
(注:本文所据报告标称 15 条链接,去掉锚点后对应 6 个不重复页面,其中 2 个为 ResearchGate。上列三条均出自原报告的来源链接清单。)
登录后可写回应。