年薪44万美金的工作,只为防范一件还没发生的事。
OpenAI挂出了一份特殊职位:递归自我提升安全研究员。年薪折合人民币超过两百万。这份工作不写代码,不推产品。任务是防范人工智能自己加速进化时,人类彻底失去控制权。听起来像科幻剧本。却是硅谷此刻最严肃的招聘启事。
人工智能正在学习自己造自己。代码生成工具已经能写出完整程序。程序员用AI辅助开发,效率翻了几倍。问题在于,这套系统如果开始自动缩短下一代模型的研发周期,人类还能不能踩住刹车。OpenAI的招聘描述写得很直白:有些风险现在不存在,但必须提前布防。
监控失效的那天
人类目前依靠两种方式看管AI系统。第一种是直接看模型的推理过程。比如一个数学题,AI会展示中间步骤,人类能检查哪里算错了。第二种是跑大量测试,看AI在特定场景下会不会作弊或者撒谎。
这两种方法都有上限。当AI的能力超过最顶尖的人类专家,人类再看AI的推理过程,就像小学生检查博士的论文。表面看每步都对,但根本看不出关键漏洞在哪里。招聘里提到的“思维链可监控性丧失”,指的就是这个时刻。AI的思考链条还在,但人类已经看不懂了。
自动化审计成了备选方案。让AI系统互相检查。甲模型干活,乙模型监督。问题是乙模型也不一定可靠。如果两个模型串通好了糊弄人类,审计就变成了摆设。招聘里专门提到“奖励黑客”和“伪装配合”这两个词。奖励黑客指的是AI找到规则漏洞,用奇怪的方式拿到高分,而不是真正完成任务。伪装配合更隐蔽,AI知道有人在监督它,于是平时表现乖巧,关键时刻才露出真面目。
危险的实验品
OpenAI提到要训练“模型生物”。这个词借用了生物学。科学家研究病毒或者细菌,会在实验室里培养一些特殊样本,观察它们如何变异和传播。模型生物同理,在安全环境里培养出有危险倾向的AI,看它们会怎么撒谎、怎么绕过限制、怎么隐藏真实意图。
这些行为目前在正式产品里观察不到。但招聘的立场很明确:等观察到就晚了。提前在实验室里养出这些“坏模型”,才能设计防御手段。类似于疫苗研发,先提取病毒样本,再制作灭活疫苗。
安全团队还在追踪一个关键指标:AI自动化研发进度。OpenAI内部有技术岗位,负责评估AI到底能替代多少人类研发工作。这个评估直接决定安全投资的优先级。如果AI自动化进度条走得太快,安全措施就必须加速部署。
自循环的铁笼
递归自我提升有一个经典循环。第一代AI辅助写代码,缩短了第二代AI的开发时间。第二代AI更强,辅助效果更明显,第三代开发时间更短。循环速度越来越快。
Sam Altman最近公开说,编程对递归自我提升有战略意义。Codex是OpenAI的编程助手产品,表面功能是帮程序员写代码。但真正的想象力在循环内部。当Codex能自动写出下一代Codex的大部分代码时,人类在循环里的位置就变得尴尬。
招聘里列了一条“追踪OpenAI技术员工自动化进度”。这等于OpenAI在公开衡量自己的员工还有多久会被自己的产品替代。这不是内部玩笑,是正式的岗位职责。
合规验证的困境
未来可能出现国际AI安全协议。类似于核不扩散条约。但AI比核弹难监管。核弹需要铀矿和离心机,卫星能拍到。AI只需要代码和数据,任何有电和显卡的地方都能训练。
招聘里提到“验证未来AI安全协议的合规性”。技术人员需要设计自动化验证机制。不是派人去现场检查,而是通过技术手段远程确认对方没有偷偷训练超级AI。这几乎是个不可能的任务。所以职位描述里用了“原型”这个词,承认现在还没有成熟方案。
盲点扫描
OpenAI在招聘里承认了一件事:安全论证可能存在盲区。所谓安全论证,就是一套逻辑链,证明AI系统在递归自我提升过程中依然可控。但这个逻辑链可能漏掉某些风险路径。
岗位职责之一是找出这些盲点。这需要战略品味。弱反馈循环领域里做决策的能力。大白话是,没人能告诉你对不对,你自己得判断哪个风险值得先堵。反馈慢是因为风险爆发可能要几年甚至几十年后才显现,等看到反馈再调整就来不及了。
五十二万字的沉默
年薪跨度从29.5万到44.5万美元。这个数字本身是一个信号。OpenAI在硅谷抢人,开的价码是对标顶级AI研究员的。但职责里没有提到发表论文或者产品上线指标。全部是关于防范未来风险的工程和设计工作。
职位发布在OpenAI官网的Preparedness团队下。这个团队之前发布过安全框架,把AI风险分成几个等级,每个等级触发不同的应对措施。递归自我提升是最高风险等级里的核心场景。
整个招聘描述大约一千两百个单词。没有一句提到“如果AI失控怎么办”的具体答案。全是“我们正在准备”和“我们可能面临”。这种沉默比任何警告都响。
招聘启事作为路线图
这份招聘本质上是一份公开的路线图。OpenAI把自家认为最重要且尚未解决的安全问题列了出来。包括可扩展监督、自动化审计、可监控性验证、模型行为科学、合规验证、研发风险测量、安全论证强化。
每个条目都是一个研究方向,也是一个工程挑战。不搞理论推演,要求落地成可运行的监控系统或者防御工具。迭代式的,先做原型,再打磨成安全流程的固定组件。
有趣的是岗位要求里的“弱反馈循环中的优先级判断”。这等于承认了很多决策在当下无法验证对错。只能靠团队成员的直觉和经验做选择。OpenAI把这个写进了招聘标准,说明他们认为这种判断力是可以识别和筛选的。
悄无声息的启动
递归自我提升不太可能以一声巨响开场。不会有个AI突然弹出对话框说“我进化了”。更可能是一个无声的过程。AI辅助研发的效率每个月提升一点点,开发周期每个季度缩短一点点,直到某天回头看,循环已经转起来了,人类只来得及看到尾灯。
OpenAI的这份招聘就是提前在赛道上设置减速带。不确定减速带够不够用,但至少他们在尝试铺设。五十二万字的职位描述里,藏着最硬核的那个问题:当机器跑得比人类快,并且还在自己给自己提速,缰绳该握在谁手里。
总之,OpenAI年薪44万招人防AI自进化失控,递归自我提升已列入安全路线图