大家都说评论区有毒。我去查了证据,比想象中弱得多
二〇一六年八月二十三日,NPR 关掉了评论区。
在那之前,Popular Science 二〇一三年九月二十四日关掉。The Verge 二〇一五年七月六日临时默认停评,但保留了论坛。
那几年里,"关评论区"几乎成了一种共识动作。理由听起来也很硬:那地方已经被一小撮人占领了。
数字确实吓人。
在 NPR 的一段统计里,两个月内,约 4,300 名用户贡献了大约 67% 的所有评论。五、六、七三个月合计,超过一半的评论来自约 2,600 人。
而每个月真正发评论的人,大概只占访客的 0.003%。
(来源说明:NPR Ombudsman 的原页面这轮抓取受限,上面这些数字主要依据 Nieman Lab 对 Ombudsman 数据的同期转述并作交叉核对。真要引用,建议自己回查 NPR 的原始材料。)
还有钱的问题:Disqus 的成本随评论量上升,部分月份达到预算的两倍左右。
一个占访客万分之零点三的人群,占了三分之二的发言量,还要花两倍预算去养。放在任何一份产品会议的幻灯片里,这一页都足够杀死一个功能。
我自己也做一个跟"人怎么在网上说话"有关的东西,所以这件事对我不是旁观。我想知道的是另一个问题:
证据到底支不支持"关掉是对的"?
我查完的结论是:比我以为的弱得多。
先把这个东西的来历说清楚。
一九八三年,RFC 850 规范了 References 这个字段——也就是"这条是在回复哪一条"的关系。一九九七年,Slashdot 已经有了附着在新闻上的讨论。Open Diary 一九九八年十月上线,不久之后加入了 Notes。
"内容下面挂着讨论"这个形态不是一次成型的。它是在 Usenet、Slashdot、Open Diary 这些产品里一步步长出来的。
然后是那个著名的研究。
二〇一四年发表在 JCMC 上的 The Nasty Effect,全国调查框架 N=2,338,最终分析 N=1,183。你大概听过它的通俗版本:"恶评会让读者不再相信科学。"
这个研究实际考察的是纳米技术的风险判断。
而它实际发现的是——没有发现不文明评论对风险感知存在显著、统一的直接主效应。
在这项关于纳米技术的实验里,不文明评论是与读者的既有态度、宗教性等变量发生交互,让一部分读者的风险判断进一步分化。这个结果没有被外推到所有议题和所有读者。
换句话说,它不是"恶评毒害所有人",而是"恶评让本来就分歧的人更分歧"。
这跟通俗版本不是一回事。
另一项 Toxic Talk 研究,初始 N=2,338,相关回归分析约 N=2,224。它发现暴露于不文明评论之后,读者对新闻 blog post"有偏见"的感知会升高,政治意识形态在其中起调节作用。
但论文自己强调:这个效应的幅度较小、有限。整个回归模型的解释度约 2.7%——注意这是完整模型的解释度,不是把这 2.7% 都归给"不文明"这一个变量。
接下来是一个我完全没料到的结果。
"匿名导致恶意"这句话,被行业文章当作已证实的结论用了很多年。
二〇一二年有一项 N=142 的控制实验,研究的是在线聊天的 affordances。它把主要的 toxic effect 归到了 lack of eye-contact——缺乏眼神接触。
不是匿名。
顺带一提,Suler 二〇〇四年那篇著名的"在线去抑制效应",是一篇没有实验样本的理论/概念性论文,不是因果实证研究。报告里提到的 The Week、Reuters 等媒体当年的实名产品判断,也不是随机实名实验。
Santana 的研究确实找到了差别:匿名条件下 53.3% 的样本评论被编码为不文明,非匿名组是 28.7%;文明比例约 14.9% 对 44%。
但这项研究跨网站、跨时期,属于观察性相关,存在混杂因素,不能据此作因果推断。而且——人数 N 和评论条数不能放在同一张图上比,它们不是同一个单位。
最后是那个最有说服力的说法:关掉之后,流量反而涨了。
前后观察数据是有的。The Verge 的论坛流量约上升 36%。FTW 的月独立访客从约 800 万增到约 1700 万。The Week 报告 pages per visit 近乎翻倍、bounce rate 近乎减半——但它自己明确承认,同期还做了整站 redesign。
缺的是能识别"关闭导致增长"的因果证据。
截至这次检索,在二〇一三到二〇一六那批主流媒体关闭案例里,我没有找到一个 A/B 实验。
而这类案例最容易产生幸存者偏差。The Verge 那是观察性的前后比较,用户迁移是自然发生的,不是随机处理。FTW 的观察期约二十个月,没有反事实对照。The Week 同期改了版。Recode 没有严格的前后数据。Mic 没有对照组。Reuters 那个案例本身就不是增长证据。
也就是说:"关掉评论区会让指标变好"这个命题,在那批经典案例里证据不足。
还有一层不确定:现有实验不能自动回答,真实新闻网站里效应是否同样大、长期暴露会不会累积、不同语言和制度下能不能复制。报告的结论是——全球所有评论区的统一心理效应尚未建立。
那"关闭"到底是什么?
关闭潮的理由本来就多元,形态也不一:有永久关闭、局部关闭、临时关闭,也有重构。Popular Science 当时的关闭声明并没有说所有评论者都有害。NPR 也不是只因为恶评才关的。
我现在更倾向于这样理解那个悬着的问题——
拿掉评论,与其说是关闭了公共讨论,不如说是把一个可能影响某些读者如何理解正文的互动层,迁到了别处。
删掉文章评论,不等于删掉社区。
当年的安排是:The Verge 二〇一五年临时默认停评时保留了论坛并选择性开放评论;Quartz 二〇一三年推出 annotations;Motherboard 改用读者来信;也有媒体把互动导向 Twitter 和 Facebook。这些产品今天是否还这样运作,报告没有核实。
这对我意味着什么,我想说清楚。
把互动层做得克制,是一个产品选择,不是一个已经被证据背书的结论。
我能诚实说出口的只有这几条:在 NPR 那个案例里,评论高度集中在极少数人手里;特定实验表明不文明能改变读者对正文的感知,但结果取决于语气、读者先验和评价对象;核心控制实验不支持把匿名单独视为唯一或最主要的原因;而"关掉会更好",在那批案例里证据不足。
我倾向于克制的那一边。
但倾向不是证明。这两件事我不想混起来说。
主要来源:
RFC 850 https://datatracker.ietf.org/doc/html/rfc850
Popular Science 停评声明 https://www.popsci.com/science/article/2013-09/why-were-shutting-our-comments/
The Nasty Effect, JCMC (2014) https://academic.oup.com/jcmc/article/19/3/373/4067522
匿名与去抑制的控制实验 https://www.sciencedirect.com/science/article/abs/pii/S0747563211002317
七家新闻站关闭评论后的回访 https://www.niemanlab.org/2015/09/what-happened-after-7-news-sites-got-rid-of-reader-comments/
登录后可写回应。