同行评审到底靠不靠谱?
1973 年,戴维·戴维斯出任《Nature》主编,才规定所有论文必须经过外部同行评审。
我看到这个年份的时候愣了一下。因为在我印象里"《Nature》"和"同行评审"是绑定的,而且绑定了很久,像是这本刊物从创刊起就靠这套机制筛稿。并不是。
而且不止《Nature》。《Science》要到 20 世纪 50 年代才普遍使用外审,《美国医学杂志》到 1960 年代才引入;1989 年,《柳叶刀》主编仍称审稿人"仅作为顾问,不做决定者"。这套制度在二战后才成为科研资源分配和期刊质量控制的重要环节,1970 年代的美国才更明确地把它视为学术质量的核心要素。
更早的痕迹是有的。1731 年,《医学观察与论文集》出现了目前已知最早的盲审案例,作者不知道评审者的身份——但这只是一次已知的早期盲审,不等于现代意义上的外审制度。1831 年,威维尔提议由两位皇家学会院士评阅稿件,这个试验很快因为两位院士意见分歧而失败了。失败的是那次具体的制度试验;原报告把 1731 年记为"第一个已知的盲审案例",1831 年记为一次失败的制度试验,而真正意义上的匿名同行评审制度要到 19 世纪中叶以后才陆续出现。
那它可靠吗。
Bornmann 等人 2010 年综合了 48 项研究、19,443 篇稿件,得到的评审者之间一致性是平均 ICC 约 0.34,Cohen's κ 约 0.17。原报告称 κ 约 0.17"远低于'良好'水平",并注明一般 κ<0.4 属于较弱一致。不过要说清楚两点:这两个都是平均近似值,报告没有给置信区间;而且小样本研究往往报告更高的 κ,原报告据此认为许多单项研究可能高估了可靠性。
然后是身份的影响。Tomkins 等人 2017 年发现,单盲相对于双盲,让知名作者的论文获推荐录用的赔率高约 1.63 倍,顶尖大学的论文高约 1.58 倍;不过原报告只转述了该研究在一次大型计算机会议中的推荐录用赔率,未列出样本量和置信区间。Budden 等人 2008 年报告,《Behavioral Ecology》在 2001 年改用双盲之后女性第一作者的比例显著上升,而作为对照的单盲期刊没有出现这个变化——同样,样本和变化幅度没有列出。
地域和机构方面也存在差距。当作者信息公开时,富裕英语国家的作者被选中送审的概率比低收入国家作者高 68%,获得修订邀请的比例高 28%;匿名之后,送审概率上的 68% 优势几乎消失,修订邀请方面的优势由 28% 降到 4%。注意这是两个不同的指标,不是同一个数字从 68% 掉到 4%;而且 4% 不是零,这些数字也都没有附样本量和置信区间。双盲也未必能完全遮蔽——审稿人若能从稿件内容推测或得知作者身份、研究方向,主观偏好可能影响判断。
那替代方案更好吗。这里要提醒一处需要你自己回查的地方。
我读的那份报告写道:已有随机对照实验(Godlee 等,1998)表明,要求审稿人签名反而略微提高了评审的批判性。而我回查那篇 JAMA 原文时读到的结论并非如此——该 RCT 报告的是签名并不提高错误发现的质量,观察到的(非显著的)方向是更少建议拒稿。这一条如果你要用,请自己打开原文核对。
至于其余部分,现有结论大致是"未见明显质量损失":双盲对质量影响不大,多项研究没有发现双盲或开放审稿带来负面后果。但这些质量比较在转述里没有列出样本量、效应量或置信区间,所以能说的只是"未见明显损失",不能进一步说成已经证明等效。
写到这里,我必须说一件关于这篇文章本身的事。
关于我读的这份研究报告,有几点可以直接核对:它标称的 15 条链接去掉锚点后只对应 6 个不重复页面,其中有 2 个是 ResearchGate;它自己的时间线把"20 世纪 50 年代"写成了"1950"这样一个精确年份;2006 年和 2016 年那两个节点没有行内来源。
还有一处同样建议自己回查。报告写的是:Peters 与 Ceci(1982)把 12 篇已发表的心理学论文匿名投回原刊,只 3 篇获接受,其余因"方法不当"等原因被拒——报告并注明这一段未从原文献摘录,仅作定性引用。而我回查一手文献时,读到的"3"对应的是被识别出属于重复投稿的篇数,不是被接受的篇数。一个是"被接受",一个是"被认出来了",差别很大;既然报告自己已经标明它没有摘录原文,这一条就更值得你亲自打开原始研究看一眼。
于是这篇文章有点自指:上述链接重复和部分节点缺少行内来源,使我认为它的关键结论仍值得回到原始文献复核。(这是我的判断,不是报告自己的结论。)
所以答案是什么
同行评审靠不靠谱?拆成三个可回答的问题:
它是不是一个古老的、经过长期检验的制度?不是。《Nature》1973 年才规定所有论文必须外审,《Science》要到 20 世纪 50 年代才普遍使用,《美国医学杂志》1960 年代才引入,1989 年《柳叶刀》主编还称审稿人"仅作为顾问,不做决定者"。它是二战后才成为质量控制核心环节的,比大多数人以为的年轻得多。
两个审稿人对同一篇稿子的判断一致吗?不太一致。Bornmann 2010 年综合 48 项研究、19,443 篇稿件,平均 ICC 约 0.34,Cohen's κ 约 0.17——原报告称其远低于"良好"水平,一般 κ<0.4 属于较弱一致。而且小样本研究往往报告更高的 κ,所以许多单项研究可能还高估了可靠性。
作者身份影响判断吗?影响。单盲相对双盲,知名作者获推荐录用的赔率高约 1.63 倍,顶尖大学高约 1.58 倍。作者信息公开时,富裕英语国家作者被送审的概率比低收入国家高 68%,修订邀请高 28%;匿名之后,送审那 68% 的优势几乎消失,修订邀请的优势从 28% 降到 4%。(注意这是两个不同指标,不是同一个数字从 68% 掉到 4%;而且 4% 不是零。)
那具体该怎么办
一、如果你能选,选双盲投稿。上面那组数字就是理由,尤其当你不在名校、不是英语母语国家、或者名字不为人知的时候。报告依据现有证据提出的建议就是可酌情或更广泛采用双盲、提高透明度。
二、被拒了不要立刻当成质量判决。κ≈0.17 意味着换一组审稿人,结论很可能不同。这不是自我安慰,是这个制度的实测一致性。合理的反应是看审稿意见里哪几条是具体的、可操作的,其余的当噪声处理。
三、别指望双盲能完全遮蔽。审稿人若能从稿件内容推测或得知作者身份、研究方向,主观偏好仍可能影响判断。所以双盲是降低而不是消除。
四、也别因此就说"同行评审已死"。替代方案的证据大致是"未见明显质量损失"——多项研究没有发现双盲或开放审稿带来负面后果,但这些比较在转述里没列样本量、效应量或置信区间,所以只能说未见明显损失,不能说已经证明等效。
最后,关于我读的这份报告本身,有几点你可以直接核对:它标称的 15 条链接去掉锚点后只对应 6 个不重复页面,其中 2 个是 ResearchGate;它自己的时间线把"20 世纪 50 年代"写成了"1950"这样一个精确年份;2006 年和 2016 年那两个节点没有行内来源。上面那两处需要回查的地方(Godlee 签名实验、Peters-Ceci 的"3"),我已经在正文里标出来了。
写一篇讲同行评审不可靠的文章,材料本身也不可靠——这件事说实话有点讽刺,但也正好说明为什么"自己去开原文"这个动作不能省。
主要来源:
Bornmann 等,评审者一致性荟萃分析 https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0014331
Baldwin,同行评审起源与制度史 https://ethos.lps.library.cmu.edu/article/id/19/
UKSG Insights,机构与地域偏差 https://insights.uksg.org/articles/10.1629/uksg.681
(注:本文所据报告标称 15 条链接,去掉锚点后对应 6 个不重复页面,其中 2 个为 ResearchGate。上列三条均出自原报告的来源链接清单。)