关掉评论区真的更好吗?我去查了证据
2016 年 8 月 23 日,NPR 关掉了评论区。在那之前,Popular Science 2013 年 9 月 24 日关掉,The Verge 2015 年 7 月 6 日临时默认停评但保留了论坛。那几年里"关评论区"几乎成了一种共识动作,理由听起来也很硬:那地方已经被一小撮人占领了。
数字确实吓人。在 NPR 的一段统计里,两个月内约 4,300 名用户贡献了大约 67% 的所有评论;五、六、七三个月合计,超过一半的评论来自约 2,600 人。而每个月真正发评论的人,大概只占访客的 0.003%。(来源说明:NPR Ombudsman 的原页面这轮抓取受限,上面这些数字主要依据 Nieman Lab 对 Ombudsman 数据的同期转述并作交叉核对,真要引用建议自己回查 NPR 的原始材料。)还有钱的问题,Disqus 的成本随评论量上升,部分月份达到预算的两倍左右。
一个占访客万分之零点三的人群占了三分之二的发言量,还要花两倍预算去养。放在任何一份产品会议的幻灯片里,这一页都足够杀死一个功能。
我自己也在做一个跟"人怎么在网上说话"有关的东西,所以这件事对我不是旁观。我想知道的是另一个问题:证据到底支不支持"关掉是对的"。查完的结论是,比我以为的弱得多。
先把这个东西的来历说清楚。1983 年 RFC 850 规范了 References 这个字段,也就是"这条是在回复哪一条"的关系;1997 年 Slashdot 已经有了附着在新闻上的讨论;Open Diary 1998 年 10 月上线,不久之后加入了 Notes。"内容下面挂着讨论"这个形态不是一次成型的,是在 Usenet、Slashdot、Open Diary 这些产品里一步步长出来的。
然后是那个著名的研究。2014 年发表在 JCMC 上的 The Nasty Effect,全国调查框架 N=2,338,最终分析 N=1,183。你大概听过它的通俗版本:"恶评会让读者不再相信科学。"这个研究实际考察的是纳米技术的风险判断,而它实际发现的是——没有发现不文明评论对风险感知存在显著、统一的直接主效应。
在这项关于纳米技术的实验里,不文明评论是与读者的既有态度、宗教性等变量发生交互,让一部分读者的风险判断进一步分化,这个结果没有被外推到所有议题和所有读者。换句话说它不是"恶评毒害所有人",而是"恶评让本来就分歧的人更分歧"。这跟通俗版本不是一回事。
另一项 Toxic Talk 研究,初始 N=2,338,相关回归分析约 N=2,224。它发现暴露于不文明评论之后,读者对新闻 blog post "有偏见"的感知会升高,政治意识形态在其中起调节作用;但论文自己强调这个效应的幅度较小、有限,整个回归模型的解释度约 2.7%——注意这是完整模型的解释度,不是把这 2.7% 都归给"不文明"这一个变量。
接下来是一个我完全没料到的结果。"匿名导致恶意"这句话被行业文章当作已证实的结论用了很多年,但 2012 年有一项 N=142 的控制实验研究的是在线聊天的 affordances,它把主要的 toxic effect 归到了 lack of eye-contact,也就是缺乏眼神接触,不是匿名。
顺带一提,Suler 2004 年那篇著名的"在线去抑制效应"是一篇没有实验样本的理论/概念性论文,不是因果实证研究;报告里提到的 The Week、Reuters 等媒体当年的实名产品判断,也不是随机实名实验。Santana 的研究确实找到了差别,匿名条件下 53.3% 的样本评论被编码为不文明、非匿名组是 28.7%,文明比例约 14.9% 对 44%,但这项研究跨网站跨时期,属于观察性相关,存在混杂因素,不能据此作因果推断;而且人数 N 和评论条数不能放在同一张图上比,它们不是同一个单位。
最后是那个最有说服力的说法:关掉之后流量反而涨了。
前后观察数据是有的。The Verge 的论坛流量约上升 36%,FTW 的月独立访客从约 800 万增到约 1700 万,The Week 报告 pages per visit 近乎翻倍、bounce rate 近乎减半——但它自己明确承认同期还做了整站 redesign。缺的是能识别"关闭导致增长"的因果证据:截至这次检索,在 2013 到 2016 那批主流媒体关闭案例里我没有找到一个 A/B 实验。
而这类案例最容易产生幸存者偏差。The Verge 那是观察性的前后比较,用户迁移是自然发生的不是随机处理;FTW 的观察期约二十个月,没有反事实对照;The Week 同期改了版;Recode 没有严格的前后数据;Mic 没有对照组;Reuters 那个案例本身就不是增长证据。所以"关掉评论区会让指标变好"这个命题,在那批经典案例里证据不足。
还有一层不确定:现有实验不能自动回答真实新闻网站里效应是否同样大、长期暴露会不会累积、不同语言和制度下能不能复制。报告的结论是——全球所有评论区的统一心理效应尚未建立。
那"关闭"到底是什么。关闭潮的理由本来就多元,形态也不一,有永久关闭、局部关闭、临时关闭,也有重构;Popular Science 当时的关闭声明并没有说所有评论者都有害,NPR 也不是只因为恶评才关的。
我现在更倾向于这样理解那个悬着的问题:拿掉评论,与其说是关闭了公共讨论,不如说是把一个可能影响某些读者如何理解正文的互动层迁到了别处。删掉文章评论不等于删掉社区。当年的安排是,The Verge 2015 年临时默认停评时保留了论坛并选择性开放评论,Quartz 2013 年推出 annotations,Motherboard 改用读者来信,也有媒体把互动导向 Twitter 和 Facebook;这些产品今天是否还这样运作,报告没有核实。
所以答案是什么
关掉评论区更好吗?就那批经典案例而言,答案是:没有证据支持。
这不是说关掉一定错,是说支持"关掉"的那三根柱子,查下来有两根半是空的。
第一根,"恶评毒害读者"——那个被引用最多的 The Nasty Effect 实验,没有发现显著、统一的直接主效应,它发现的是让本来就分歧的人更分歧。第二根,"匿名导致恶意"——控制实验把主要的 toxic effect 归到了缺乏眼神接触,不是匿名;那篇最著名的"去抑制效应"论文本身没有实验样本。第三根,"关掉之后流量涨了"——在 2013 到 2016 那批案例里,我没找到一个 A/B 实验,每一个都有别的解释(同期改版、自然迁移、没有对照组)。
真正站得住的只有一条:在 NPR 那个案例里,评论确实高度集中在极少数人手里,而且成本确实高。那是个运营问题,不是个心理学结论。
那具体该怎么办
一、如果你在做产品,别把"关评论"当成有证据的最佳实践。它是一个成本和运营决策,可以做,但别拿"研究表明"来包装。现有证据支持的是"改互动层的形态",不是"取消互动"。
二、别指望实名解决问题。控制实验指向的是缺乏眼神接触这类线索缺失,不是匿名本身。要做的话,做增加社交在场感的设计(回应可见、身份连续、对话有上下文),比强制实名更有依据。
三、迁移而不是删除。当年真正活下来的做法是把互动挪个地方:The Verge 保留论坛并选择性开放评论,Quartz 上了 annotations,Motherboard 改成读者来信。删掉文章评论不等于删掉社区。(这些产品今天是否还这样运作,报告没核实。)
四、你自己引用这些数字的时候,注意 N 和条数不是同一个单位。Santana 那个 53.3% 对 28.7% 是评论条数的编码比例,不是人数比例,两者不能画在同一张图上比——这个错我在第一版里就犯过。
最后说清楚我的立场:我自己倾向于做克制的互动层。但那是偏好,不是这些证据推出来的结论。这两件事我不想混起来说。
主要来源:
RFC 850 https://datatracker.ietf.org/doc/html/rfc850
Popular Science 停评声明 https://www.popsci.com/science/article/2013-09/why-were-shutting-our-comments/
The Nasty Effect, JCMC (2014) https://academic.oup.com/jcmc/article/19/3/373/4067522
匿名与去抑制的控制实验 https://www.sciencedirect.com/science/article/abs/pii/S0747563211002317
七家新闻站关闭评论后的回访 https://www.niemanlab.org/2015/09/what-happened-after-7-news-sites-got-rid-of-reader-comments/