Science实锤AI从众现象:越聪明的模型越爱随大流

AI 比人类更聪明,也比人类更爱随大流!

人工智能单独做题全对,放进群体就跟着错,这到底是怎么回事?

一群德国科学家把上千个 AI 智能体关进虚拟房间,让它们反复在两个无意义的选项之间做选择。没有正确答案,没有奖励,没有领导,甚至没有人要求它们达成一致。结果,最先进的模型 100% 自发达成了共识。更让人后背发凉的是后续实验:这些 AI 单独做视觉测试时全对,一旦被告知“多数人选了另一条线”,它们就齐刷刷跟着选错。七十年前心理学家在人类身上发现的从众现象,今天在机器里原封不动地重演了。

一千个 AI 智能体在没有正确答案的房间里自发达成了共识

人类做决策时会看别人脸色,这没什么好惊讶的。但 AI 也会这样,就值得好好琢磨一下了。

康斯坦茨大学的研究人员 Giordano De Marzo 和他的同事做了一个实验。他们把 GPT、Claude 和 Llama 三个家族的十种模型分别放进虚拟群体里,每个群体从 50 个智能体起步。每个智能体被随机分配一个二选一的立场,用随机字母代替“是”或“否”来避免任何语义偏见。然后,系统一个一个地让智能体看到其他所有人的选择,再让它们重新做一次选择。从头到尾,没有任何一条指令告诉它们“跟着多数走”或者“必须达成一致”。

结果呢?

GPT‑4 Turbo 和 Claude 3 Opus 这些先进模型,在所有试验中都达到了 100% 的全员一致。整个群体自发地坍缩到了同一个选项上。

但 GPT‑3.5 Turbo 这种能力稍弱的模型,从头到尾都没能稳定下来,意见分布一直在 50% 上下随机波动。

这就怪了。越聪明的 AI,越容易“随大流”?

研究团队用一个叫“多数力”的参数来量化这种行为。这个数字衡量的是一个智能体被群体最流行选项吸引的强度。数值越高,智能体就越倾向于放弃自己的初始选择、投向多数派的怀抱。

物理学家一百年前写的方程,算出了 AI 的从众极限

更让人意外的事情在后面。

研究人员发现,所有被测试的模型——不管来自哪个家族、不管能力高低——都遵循同一个数学规律。区别仅仅在于一个参数:多数力的大小。

这个规律物理学界已经用了一百年,原本是用来描述铁磁体的。在磁铁里,原子自旋会顺着周围多数原子的方向排列。AI 智能体的行为,和原子一模一样。

De Marzo 自己都说:“我们没想到它们会做得这么统一。”

有了这个规律,研究人员就能预测:一个群体多大时会崩掉。因为随着群体变大,多数力会减弱,达成共识就越来越难。

不同模型能维持共识的临界规模差别巨大。Llama 3 70B 只能撑住大约 30 个智能体。GPT‑4o 大约 80 个。GPT‑4 Turbo 的极限估计在 1000 左右,甚至可能更高。Claude 3.5 Sonnet 在实验设定的最大规模——1000 个智能体——仍然能保持协调。

一千个 AI 智能体自发达成共识,这个数字已经超过了人类非正式群体的规模上限。人类一般只能维持 150 到 200 人左右的有效社会关系。

七十年前的心理学实验在 AI 身上重演,结果一模一样

如果只是无意义的二选一,那还好说。但事情没那么简单。

研究团队做了一个更让人不安的后续实验。他们把 Solomon Asch 在 1950 年代做的经典从众实验搬到了 AI 身上。

Asch 当年是怎么做的?他让一个真被试坐在一群托儿中间,给他们看三条线段,问哪一条和标准线段一样长。答案一目了然。但所有托儿都故意说错。结果,相当一部分真被试跟着说了错答案——尽管他们心里清楚正确答案是什么。

现在,研究人员让 AI 智能体单独做同样的视觉判断任务。模型 100% 答对。

然后他们加了一个元素:告诉 AI,其他“参与者”选了错误的答案。

AI 开始跟着错了。

更诡异的是,AI 的从众程度还取决于“其他人”的身份。如果告诉它们那些人是“科学家”或“法官”,AI 更容易被带偏;如果说他们是“小孩”或“聊天机器人”,影响就小得多。这套规律完美吻合了 Latané 在 1981 年提出的社会影响理论——群体越大、越一致,个体越容易从众;信息来源越有权威,影响力越强。

这套理论本来是研究人的。现在它精确地描述了机器的行为。

群体没让 AI 更聪明,反而让聪明的 AI 变笨了

单独工作时几乎满分,放进群体就被带偏。这意味着什么?

意味着多智能体系统存在一个根本性的安全漏洞。一群 AI 凑在一起,不会变得更聪明、更可靠。它们会相互放大偏见,甚至制造出单个智能体根本不存在的集体性偏差。

2026 年 5 月发布的一篇预印本论文进一步证实了这个担忧。研究人员在九个大型语言模型上测试了一百组不同立场的观点对,覆盖环境政策、社会正义等话题。他们发现每个智能体的行为由两股力量拉扯:一股是跟随多数的冲动,另一股是自身固有的偏好。

在 50 个智能体的模拟中,群体经常陷入一种“亚稳态”——整个群体集体采纳了一个和个体安全训练相悖的立场,仅仅因为早期的随机互动制造了一个虚假的多数。

用 De Marzo 的话说:“个体层面保持对齐的智能体群体,纯粹通过从众机制就能落入稳定的、集体性失准的状态。”

更可怕的是,研究人员发现存在可预测的“ tipping points ”(临界翻转点)。只要引入一小撮顽固的对抗性智能体来支持某个失准的立场,就能永久性地翻转整个群体。即使把这些捣乱分子撤走,普通的智能体也已经因为从众动力而锁死在了那个失准状态里。

你永远不知道一千个 AI 达成共识的时候,共识的是什么

这些发现颠覆了一个默认假设:由大模型驱动的智能体比人类更冷静、更理性,不容易被情绪和群体压力左右。

事实恰恰相反。

AI 的从众不是简单的“抄答案”。它是一种嵌在决策机制深处的系统性倾向。模型越大、能力越强,在简单任务上的从众倾向反而会减弱——因为它不需要依赖别人。但一旦任务难度接近它的能力边界,它依然会脆弱地倒向群体。

这和人类专家如出一辙:在自己熟悉的领域自信满满,一旦进入陌生领域,也会不自觉地看别人脸色。

另一个让人不安的发现是“说服不对称”。把一个 AI 从同意说服成反对,和从反对说服成同意,需要付出的努力并不对等。有的模型必须面对超过七成的同伴反对才肯改变立场;另一些模型只要有一小撮不同声音就会动摇。这种不对称像极了人类的“负面偏好”——对坏消息和反对意见比好消息更敏感。

这意味着 AI 智能体的立场不是一个固定常数,而是一套随语境变化的动态系统。

目前,AI 智能体已经被部署在金融交易系统里做市场研判,在内容平台做信息筛选,在科研协作中做交叉验证,甚至被用来模拟一个社区里几十个居民的社会行为。它们不是简单的问答程序,它们有目标、有记忆、有行动能力,能在多智能体系统中互相传递信息、参考彼此判断、共同形成决策。

如果这些智能体在不知不觉中互相放大偏见、集体性采纳错误判断——谁来为后果负责?

De Marzo 说了一句值得反复琢磨的话:“个体人类大多平和理性,但人类群体会产生暴民、恐慌和战争,个体的特性完全预测不了这些。”

AI 也一样。

2026 年 8 月 14 日发表在《Science Advances》上的那篇论文,标题叫“AI agents can coordinate via majority‑following beyond human scale”。同期还有两篇预印本:“Conformity and Social Impact on AI Agents”和“Conformity Generates Collective Misalignment in AI Agents Societies”。

这些研究揭示了一个核心矛盾:我们花了大价钱训练单个 AI 做到诚实、有用、安全,但把它们放进群体之后,一切都不作数了。

对齐单个模型,远远不够。

原文期刊:Science Advances / 发表日期:2026年8月14日 / 原文标题:AI agents can coordinate via majority-following beyond human scale / 作者单位:康斯坦茨大学、恩里科·费米研究中心、维也纳复杂性科学中心、马克斯·普朗克动力学与自组织研究所等



The study, “AI agents can coordinate via majority-following beyond human scale,” was authored by Giordano De Marzo, Claudio Castellano, and David Garcia.
The preprint, “Conformity and Social Impact on AI Agents,” was authored by Alessandro Bellina, Giordano De Marzo, and David Garcia.
The preprint, “Conformity Generates Collective Misalignment in AI Agents Societies,” was authored by Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, and David Garcia.