数据炼出智能架构:AI先天偏见被源头语料刻进骨髓

随机初始化的人工智能,其实已经认得你了!

还没开始训练,机器就已经在偷偷给你分类了!

想象一下,你从零开始搭建一个神经网络,里面的所有参数都是完全随机生成的,没经过任何训练。然后你把它扔到CIFAR-10这个经典图像数据集面前——猜猜会发生什么?按常理,它应该跟瞎猜差不多,准确率顶多10%对吧?但科学家们发现了一件怪事:当你把几百个这样的“随机网络”凑在一起,它们居然能把飞机、汽车、鸟和猫区分开,准确率飙到了60%以上!

这就怪了。一个从未学过任何东西的机器,凭什么认得猫和狗?

你以为是随机,机器却在偷偷给你分类

2022年2月,Google Research的Ehsan Amid和团队在arXiv上发了一篇论文,标题叫《Learning from Randomly Initialized Neural Network Features》。他们把随机初始化的ResNet-18反复初始化几百次,每次让网络“看一眼”CIFAR-10的图像但不做任何训练,然后把每次产生的中间特征拼在一起——他们管这叫神经随机特征(Neural Random Features,简称NRF)。

结果让人傻眼。一个线性分类器(就是最简单的那种分类器)直接拿原始像素训练,CIFAR-10上只能达到42%的测试准确率。但同样的分类器,拿NRF特征来训练,ResNet-18生成的NRF能达到60%的准确率。一个从没训练过的网络产生的特征,比原始像素本身更好用。

这还没完。他们拿这些随机特征做了个可视化——把高维数据压到二维平面上画出来。结果发现,飞机、汽车、船舶这些人工物体天然聚在一堆,猫、狗、鹿这些动物聚在另一堆,连“鸟”和“飞机”这种语义上有关联的类别都被放在了相邻的位置。仿佛这个随机网络天生就知道什么东西应该在一起。

你可能会说:这不就是随机投影吗?Johnson-Lindenstrauss引理早就说了,随机投影能保留距离信息。但问题是,线性随机投影根本达不到这个效果。只有经过神经网络这种非线性结构的随机投影,才能把数据的底层结构给“挖”出来。这说明什么?说明神经网络的结构本身——那些卷积层、残差连接、激活函数——天然就带有某种“偏见”,让它在看到数据之前就已经知道该怎么看。

随机网络不随机,它带着几十年的进化记忆

那这种“先天知识”是从哪来的?

答案藏在一个你想不到的地方:几十年来的试错和淘汰。想想看,ResNet、CNN、Vision Transformer这些架构,是怎么一步步走到今天的?不是某个人灵光一现拍脑袋想出来的,是无数研究者对着CIFAR-10、ImageNet这些标准数据集反复实验、反复调整,最终筛选出来的。那些在这个数据集上表现不好的架构——比如训练不稳定、调参太麻烦、泛化能力差——慢慢就被淘汰了。活下来的,都是那些能“轻松适应”这些数据分布的架构。

这个过程持续了三四十年。从1980年代的CNN到2020年代的Vision Transformer,每一轮筛选都在做同一件事:让架构更适配自然图像的数据结构。而这个筛选的结果,被“固化”在了架构本身的设计里——残差连接怎么跳、卷积核多大、归一化层放哪——所有这些细节,都是被数据“雕刻”出来的。

所以当你随机初始化一个ResNet时,它里面的权重虽然是随机的,但它的“骨架”已经带着几十年的进化记忆。这个骨架本身就是一张为自然图像量身定做的“地图”。随机权重只是在“地图”上随机撒点,但地图本身已经告诉了你哪里是山哪里是河。

这就好比一个天生色盲的人,你给他一个画好的彩色地图——他虽然看不懂颜色,但地图上的道路和地标还在,他照样能找路。随机初始化的ResNet就是那个拿到地图的人:权重是随机瞎画的,但架构本身已经把数据的结构“画”好了。

数据在悄悄决定你用什么架构,你浑然不觉

这个发现细思极恐的地方在于:我们一直以为架构设计是“技术问题”,但实际上它是个“演化问题”。

Adam优化器里那个0.9的动量超参数,为什么到处都在用?不是因为0.9有什么数学上的神圣性,而是因为那些不适应0.9的架构,在早期就被淘汰了。那些需要花大量精力去调参的架构,没人愿意用,慢慢就消失了。活下来的架构,都是跟0.9“合得来”的。换句话说,不是我们主动选择了0.9,是数据筛选过程替我们选了。

这就引出一个更深的问题:如果当年ImageNet用的不是自然图像,而是医学影像、卫星图或者雷达信号,我们今天用的架构还会是ResNet和Transformer吗?答案大概率是否定的。不同的数据分布会筛选出不同的架构特征。自然图像有平移不变性、局部相关性、多尺度结构——CNN刚好抓住了这些。如果换一套数据,筛选出来的可能是完全不同的东西。

再看看Transformer。它最早是给机器翻译设计的。后来大家发现它在代码生成、数学推理上也好用,就一股脑往上堆。但你有没有想过:Transformer真的是做代码和数学的“最优解”吗?还是说,我们只是拿着一个为翻译设计的锤子,看什么都是钉子?那些针对代码和数学做的架构 tweak——比如更长的上下文、更复杂的注意力机制——本质上都是在“打补丁”,让一个为翻译设计的架构勉强适应新任务。

如果当年我们是从代码生成任务出发、从头开始设计架构,会得到跟Transformer一模一样的东西吗?几乎不可能。

交给AI自己找架构,小心它只认识考试题

现在,事情要加速了。

2026年4月,一家叫Core Automation的AI公司浮出水面。创始人Jerry Tworek是OpenAI前研究副总裁,o1和o3推理模型的主导者。团队里塞满了来自Google DeepMind和Anthropic的顶尖研究员——包括上面那位Ehsan Amid本人。这家公司在X上的第一条推文写的是:“我们在建造世界上自动化程度最高的AI实验室”。他们的目标之一:用智能体(agent)来自动化神经网络架构搜索。公司刚成立几个月就在寻求5亿美元融资。

你品品这意味着什么。

过去三四十年,是人类手工试错,慢慢筛选出了现在的架构。接下来,AI自己要动手了——而且速度会快得吓人。一个智能体一天可以测试几千种架构,人类一辈子都做不到。但问题来了:这些智能体在搜索的时候,拿什么数据做“考题”?

答案不言自明:还是CIFAR-10、ImageNet、标准语言 benchmarks。那些我们手头现成的、标注好的、大家都用的数据集。

于是我们面临一个诡异的局面:自动化架构搜索,可能会把人类花几十年偶然踩出来的“偏见”加速放大。智能体会发现某些架构在标准数据集上得分特别高,然后拼命往那个方向收敛。它不会问“这个架构是真的好,还是只是擅长应付这套考题?”——它只管分数。

这就像你用历年真题训练一个学生,他考试能拿满分,但你把他扔到真实世界里他啥也不会。你甚至不知道他到底是真懂了,还是只是把题目背下来了。

Core Automation的人显然意识到了这个问题。他们提的概念叫“持续学习”(continual learning)——让模型能在新数据上不断学习,而不是死磕一套固定考题。但这里面有个矛盾:你要搜索新架构,总得有个评估标准吧?只要你有标准,搜索就会去钻标准的空子。

这不是技术问题,是演化问题。自动化只是把演化的速度调到了100倍,但演化的方向依然由数据决定。

你以为你在设计AI,其实是数据在设计你

那篇2022年的论文里还有一个细节,细想之下更让人背脊发凉。

作者拿随机初始化的Transformer做了个实验:输入是OpenAI和Anthropic两家公司的推特,然后看随机网络产生的特征。结果发现,这些随机特征对每条推文的“第一个词”极其敏感。同一个账号发的推,如果开头词不同,在特征空间里会被拉到完全不同的位置。

这说明了什么?说明随机初始化网络不仅“认得”图像的语义结构,连“文本的开头词很重要”这种语言学上的规律,它都预先编码好了。一个从没训练过的Transformer,天然就知道应该关注句子的开头。

那这个“先验知识”是哪儿来的?还是那套逻辑:Transformer最初是为翻译设计的,翻译任务里,句子的开头确实承载了大量信息。几十年的机器翻译研究,把“关注开头”这个偏见刻进了Transformer的骨架里。

你看,人类在不知情的情况下,把自己对语言的理解、对图像的理解,通过“选哪个架构能跑通”这个过程,一点一点地灌输给了机器。然后机器带着这些偏见去处理所有任务——不管是翻译推特,还是写代码,还是做数学题。

我们以为是自己在设计AI。实际上是几十年积累的数据和任务,在设计我们手里的工具。然后这个工具,反过来在塑造我们对“智能”的理解。

你手里那个能写诗能编程的ChatGPT,它的“聪明”有多少来自训练数据,有多少来自架构本身携带的、几十年前就被刻进去的偏见?没人说得清。

但有一件事是确定的:接下来,当AI自己开始设计AI的时候,这个循环会转得更快、更隐蔽、更难察觉。而我们手里用来评估“好架构”的那套标准——那些CIFAR-10、ImageNet、GLUE——可能正在悄无声息地决定,下一代的AI会长成什么样子。

这场演化游戏已经开了几十年。真正的加速,才刚刚开始。