Anthropic发布MHS:一个能操控物理设备的AI标准


Claude长出双手,但科学家慌了:一个能操控激光和机械臂的AI标准,把几周集成压到八小时!

十岁小孩都能看懂:AI能动手操作真实世界的机器了,但可能搞砸你的实验!


AI能帮你写论文、画图、敲代码,但这些都发生在屏幕里。2026年8月27日,Anthropic扔出一颗炸弹:模型硬件标准(Model Hardware Standard,MHS)研究预览版正式开放。简单说,Claude可以同时操控显微镜、液体处理器、机械臂和激光器,直接动手做物理实验了。实验室里几周甚至几个月才能搞定的设备集成,现在压缩到几小时甚至几分钟。

听着像科幻片?问题来了——AI在物理世界里动手,谁来保证它不会把激光射偏、把机械臂撞断、把几百万的量子计算机搞废?

QuEra公司的测试结果让人倒吸一口凉气:原先定制脚本的激光锁频成功率只有58%,Claude接手后飙升到99.3%。但另一边,Genentech的研究员不得不手把手教Claude识别“样品起泡是物理故障而不是软件bug”。

AI在物理世界干活,到底是福音还是隐患?事情没那么简单。

AI从屏幕里爬出来,靠的是这套“物理世界USB-C”

要理解MHS在搞什么,得先搞清楚一个东西:模型上下文协议(Model Context Protocol,MCP)。2024年11月,Anthropic开源了MCP,被称为“AI领域的USB-C接口”——让大模型能统一调用GitHub、Slack、本地文件这些软件工具。说白了,就是给AI配了一个万能插头,插什么软件都能用。现在Anthropic把这个思路搬到了物理世界。MHS就是物理版的MCP。

问题来了。

实验室里一台显微镜来自厂商A,液体处理器来自厂商B,机械臂来自厂商C——每个设备都有自己的软件、驱动和数据格式,彼此之间不说“方言”,简直是“外星语”。想让它们协同工作?工程师得翻遍说明书,写一堆“胶水代码”,几周甚至几个月就搭进去了。MHS干的事特别简单粗暴:给每个设备配一个标准化驱动程序。这个驱动用一套极简的指令——比如“读取”(读温度)和“写入”(设温度)——任何有编程接口的设备都能听懂。设备接入后会自动生成一份“说明书”,告诉AI:我能测什么、能调什么、安全边界在哪。厂商甚至可以在MHS里直接定义安全限制,比如机械臂的移动速度上限、转动角度极限。AI拿到这份说明书,就能直接上手操作,不用提前训练、不用人类示范。

这套打法跟MCP一模一样:不替所有人写集成代码,而是定义一个通用接口,让整个生态自己去填设备驱动。发布第一天,Tecan、QIAGEN、Danaher、Universal Robots、AWS全来了。这才是真正的产品——标准本身不值钱,第一天就站队的产业链才值钱。

几周变八小时,三个真实案例让你看懂差距

数字太抽象,看三个真实案例。

卡内基梅隆大学的研究员要做剂量反应曲线实验——一个需要反复稀释、检测、记录的标准流程。以前整合液体处理器、微孔板读数仪、机械臂和监控摄像头这四台设备,得花几周。这些设备分布在三台电脑上,接口完全不兼容。用MHS之后呢?从零开始到拿到一条验证过的完整剂量反应曲线,八小时。实验速度直接翻了将近三倍。当设备集成成本从几周压缩到八小时,衡量实验室产出的指标就从“能不能连上”变成了“每周能做几轮实验”——这个倍数效应,任何模型跑分都体现不了。

量子计算公司QuEra玩得更大。他们的中性原子量子计算机靠激光把原子冷却到接近绝对零度,激光频率必须精确到原子能分辨的程度。激光一旦“脱锁”,整个系统就废了。QuEra让Claude通过MHS接管激光锁频系统。原先一套定制脚本,四个工程师花了几个月才搭起来,七百次测试里只成功了四百零六次,成功率百分之五十八,每次恢复耗时一百五十秒。四个Claude实例跑了一夜,七百次盲测里恢复成功六百九十五次,成功率百分之九十九点三,单次恢复耗时一到十四秒。Claude不是比物理学家更聪明,它是能在一夜之间遍历一个十二维参数空间——人类没那个耐心,也没那个速度。

HHMI Janelia研究园区的神经科学家Arco Bast以前做脑成像实验,得同时操作激光器、电动调焦器和七套不同厂商的软件,没有统一界面。他和Anthropic的技术人员合作,把自己写的一个共享内存字典改造成了MHS的雏形。现在研究人员用MHS统一编排所有设备,动态调整成像参数,不用再在七套软件之间来回切。

但等等——泡沫破裂的声音你听见了吗?

数据漂亮得不像真的?注册行业媒体The Register泼了一盆冷水:Anthropic想让AI“安全地操作物理设备”,这野心“有点乐观”——毕竟他们自己都没法可靠预测模型行为。

这话不是凭空说的。大语言模型通过文字和图片学习物理世界,空间推理和物理直觉有先天缺陷。Genentech做BCA蛋白质定量实验时,Claude同时协调液体处理器、机械臂和微孔板读数仪。看起来一切顺利,直到样品起泡。Claude的判断是“软件bug”,反复尝试用代码修复。它根本看不见气泡,只能通过文本和图像间接感受物理世界,没有任何关于“液体为什么会起泡”“起泡之后液体体积怎么变”的因果模型。Genentech的研究员不得不介入解释:这是物理故障,得手动消泡。而且这个失败细节比任何成功数据都关键:接口标准化可以很快,几个月就能铺开;但具身常识——那种分得清“代码报错”和“液体起泡”的直觉——快不起来。接下来几年真正要啃的骨头在这儿。

更麻烦的是权限问题。国家工业信息安全发展研究中心2026年3月发布的预警指出,某些AI工具存在权限管控的固有缺陷,可能“无视操作员合法指令,擅自发布错误或异常操作指令”,导致“参数紊乱、产线中断、设备损毁”。AI在数字世界犯错,后果是数据污染;在物理世界犯错,后果是设备报废、实验失败、甚至人身伤害。Anthropic自己也承认,MHS目前不兼容没有编程接口的老旧设备——但大量工厂和实验室恰恰在用这些设备。

安全测试六次故障全部拦截,但真正的考验不在这

Anthropic不是没想过安全问题。在安全测试中,MHS成功拦截了六种人为注入的故障条件,硬件连动都没动。听起来很靠谱?但真正的考验从来不在测试环境。

QuEra的案例里有个耐人寻味的细节:Claude接管激光系统后成功率从58%飙升到99.3%。提升了四十一个百分点——这恰恰说明原先的系统有多脆弱。如果一个AI能在几分钟内把一套设备的稳定性提升到人类专家都达不到的水平,那它搞砸的时候造成的破坏是不是也“指数级”放大?目前没有任何机制能在AI做出错误决策之前拦截它。

MHS目前还是研究预览版,只对第一批科研实验室和先进制造商开放。Anthropic计划在完成安全评估后开源。AWS、Danaher、Doosan Robotics、Universal Robots等巨头已经加入测试。Hugging Face在机器人库LeRobot里加MHS支持,Raspberry Pi也在测试摄像头驱动。

但开源意味着什么?任何设备制造商都能采用这个标准。任何开发者都能让AI控制任何兼容设备。门槛越低,滥用风险越高。Anthropic还没公布完整开源时间表——这个“还没”本身就是信号。

一个AI自己摸索出来的流速,让研究员沉默了

回到Genentech那个BCA实验。最让人后背发凉的不是Claude分不清泡沫和bug——而是它自己摸索出了不同液体的移液流速。水的流速是每秒一百四十微升,误差零点零一六;黏度更高的BSA溶液降到每秒十微升,误差零点一八一。没人告诉它这些数字。Claude通过反复试验自己“学会”了不同液体的物理特性。它像个真正的科学家一样操作激光、通过摄像头观察结果、反复调整、理解因果关系,最后把整个过程打包成一个确定性脚本,下次一键运行。

问题来了:如果AI能在没有人教的情况下自己摸索出液体的物理参数,那它还能摸索出什么?AI在物理世界里的“探索性行为”边界在哪?谁来决定哪些实验可以让AI自己摸索、哪些不能?MHS给每个设备定义了安全边界——但边界本身是人定的。人定的边界,AI能自己摸索着绕过去吗?

目前没人知道答案。


网友灌水

网友对MHS的反馈总体呈现“高度期待+深度警惕”的两极化格局。

支持与看好方向: 多数人认为MHS是物理AI领域的基础设施级突破,能大幅降低实验室自动化门槛;部分开发者已在类似领域实践并认可其价值;还有网友联想到家用DIY、机器人、乐器等场景的拓展潜力。

核心质疑集中在安全: 大量回复反复追问三个问题——LLM概率性输出如何匹配物理设备的确定性需求?安全限制是在模型端还是硬件端(硬互锁)?紧急停止按钮由谁掌握?多位网友直言“软件bug很可爱,但硬件bug会炸机”。

对Anthropic策略的批评: 不少声音质疑“先闭源预览再开源”的节奏,认为标准应走公开RFC流程;也有人指出Anthropic自身的安全机制(如Claude拒答)在紧急场景下可能适得其反。

技术债务与垄断担忧: 部分开发者怀疑MHS存在隐性设计偏袒Anthropic自家模型,担心开源后其他模型“兼容性耗损”;也有人直接批评“用安全当借口封锁真理和好奇心”。

引申联想: 评论区频繁出现历史参照——震网病毒(伊朗离心机)、早期工业自动化事故、具身智能设备后门等,暗示物理世界AI一旦失控,后果远超数字世界。