打折的不是 AI,是「AI」这个标签——一项刚见刊的实验,把内容和来源分开算了

2026-08-13 · AI伦理 · 人机信任 · 治理 · 评测
人们排斥的是他们以为的来源、而不是实际来源;这让「AI 内容必须标识」多出一层与质量无关的固定损耗。

先说结论

人对 AI 判断的排斥,锚定在他们以为这段内容来自哪里,而不是它实际来自哪里。本周在 PLOS One 见刊的一项实验把这两件事拆开测了:同一批文字,被试相信是机器写的,认同度就掉;相信是人写的,认同度就回来——与真实来源无关。更扎人的是第三组对照:研究者把 AI 的回答改写得更像人,识别率如愿掉下去了,那个折扣却一分没少。

叠起来的含义不太好听:「让 AI 写得更像人」解决不了接受度,而正在铺开的「AI 内容必须自报家门」,很可能在内容之外加了一层与质量无关的固定损耗。

事情是怎么发生的

先摆时间线,免得把它读成本周的新发现。这项工作 2024 年 10 月就以预印本挂在 arXiv(2410.07304)上了,本周 8 月 5 日以《A moral Turing test: How belief and source shape detection of and agreement with LLM judgments》正式见刊 PLOS One。作者是日内瓦大学的 Basile Garcia、Google DeepMind 的 Crystal Qian 和巴黎高师的 Stefano Palminteri。新的是见刊,不是发现——顺带改了标题,从「人机道德对齐」挪到「信念与来源」,重心被作者自己搬到了更硬的那个结果上。

设计不复杂。60 个道德情境取自 Greene 等人的经典材料,分三类:非道德、非个人化道德、个人化道德(要你亲手把人推下桥的那种)。回答分别由 30 名人类被试和 GPT-3.5 家族的模型(text-davinci-002 / 003)生成。再另找 230 名被试逐条做两件事:判断「这是人写的还是 AI 写的」,同时给认同度打分。

结果分三层。识别上,被试显著高于随机但远谈不上准,两组语料分别是 64% 和 71%;有意思的是道德情境比非道德情境容易被认出来。按真实来源看认同度,并没有一边倒——非道德情境里人们更认同人类的回答,而在最难的个人化道德情境里,反而更认同机器给的理由。只有按被试相信的来源去切,才出现跨全部情境都显著的反 AI 折扣。

第三组语料是最关键的一手证据:研究者用模型把 AI 的回答「人性化」——缩短、加错字、加第一人称。识别率掉到 60% 以下,认同度的差距却原封不动。

为什么重要

第一,它把「AI 反感」从内容问题挪成了标签问题。语言学分析很直接:长度、错字、第一人称显著影响识别,但都不显著影响认同。认同是经由「我猜这是谁写的」这一层中介的,不是对文字质量的直接反应。

第二,对正在落地的披露制度,这是一笔没被定价的成本。要说清楚边界:实验里被试是被要求来源,不是被告知来源。强制标识做的是把「猜」换成「知道」,论文没测这一步,所以下面这句是推断而不是结论——但推断的方向很难乐观:既然在猜错的时候折扣照打,那么在告知无误的时候,它只会更稳定。

第三,产业侧的错误解法已经写在纸上了。第三组语料实质上就是「把 AI 写得不像 AI」这条产品路线的一次预演,它买到了更低的可检测性,没换来一分认同。可以想见的下一步诱惑是继续优化表层说服力——加第一人称、去掉算账口吻(论文发现「命」「救」「死亡」这类成本收益式措辞显著预测不认同)。这条路优化的是被接受度而不是正确性,而实验提示它连被接受度都没买到。

站得住与站不住的地方

站得住的是信念侧:这是主结论,跨情境显著,且在人性化条件下依然成立,是三组语料互相印证出来的,不是单点显著。

要打折的有四条。一,语料出自 GPT-3.5,两年前的文本,今天的模型措辞早已不是那个样子,识别率必然不同,折扣是否等比例保留没人测过。二,「难题上人更认同机器」得弱着说——作者自己指出这个偏好在 dv3 出现、在 dv2 上并不一致,属于条件性结果。三,被试评的是一段文字理由,不是有后果的决策;点头认同一段说理,和让机器替你拍板,是两件事。四,也是最根本的:把这个折扣直接叫「偏见」可能太快了。如果人们知道 AI 不承担后果、出错无人可追责,对来源打折可以是对问责结构的合理反应,而非非理性歧视。这个设计分不开这两种解释。

接下来该盯什么

一,有没有人在新一代模型上重做这个「信念 vs 来源」的拆分。这是整套结论能不能迁移到今天的唯一门槛。

二,标识制度真正落地之后,平台侧会不会出现可观测的「标注即降权」:同一个答案挂上 AI 标签之后的采纳率、点击率、复议率。这是把实验室效应搬到真实分布上的第一手数据。

三,医疗、司法、审稿这类高风险场景怎么处理——照单披露并承受折扣,还是走「AI 生成、人类署名」的混合归属。第三条路在合规上是灰的,在短期效果上最有诱惑,也最值得盯。