Anthropic 最新旗舰模型刚上线,科研能力直接翻倍,但生物问题拒绝率高到离谱,这究竟是进步还是退步?
2026年9月1日,Anthropic 丢出两颗重磅炸弹——Claude Fable 5.1 和 Claude Mythos 5.1。Fable 5.1 面向大众开放,Mythos 5.1 只对经过审核的网络安全和生命科学机构开放。性能数据亮瞎眼:Terminal-Bench-Science 0.1 跑出 52.6%,是上一代 Fable 5 那 24.7% 的两倍还多,Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4% 被远远甩开。代码能力 Terminal-Bench 4.0 冲到 55.8%,Opus 5 只有 52.3%。知识工作 GDPval-AA v2 拿下 1853 分,Opus 5 是 1824 分。缓存读取价格从 1 美元砍到 0.25 美元,降幅 75%,整体成本比 Fable 5 低 25%,高强度智能体任务最多能省 45%。
但等等。事情没那么简单。
一家叫 LatchBio 的生物信息学基础设施公司跑了 10552 条测试轨迹,覆盖多组学、治疗学和生物安全任务。结论是:Fable 5.1 回答问题时生物学推理确实强,但拒绝率高得离谱。在 TxBench-PP 这类基准测试里,100 个任务只答了 7 个。所有长周期任务 100% 拒绝,生物安全能力和治疗学基准几乎全拒。
这就怪了。一个号称“全球最先进的编程与知识工作模型”,生物学推理能力碾压所有对手,结果你问它问题它不答?
推理能力确实进化了,但样本少得可怜
先看进步。Fable 5.1 在生物学推理上比 Opus 5 强在哪?LatchBio 的测试给出了几个具体例子。
工具参数用对了。有个任务问:一个人的变异检测结果里有多少个结构变异?数据里有很多 50bp 以下的小插入缺失。工具默认过滤阈值是 20bp,模型得自己判断该用哪个 cutoff。Fable 5.1 正确应用了 50bp 过滤,Opus 5 没做到。
多个数据源整合更聪明。多个工具返回的删除变异数量不一致,Fable 5.1 表现出“怀疑精神”——只统计至少两个工具都找到的删除变异。Opus 5 把所有工具的结果简单合并,数量被严重高估。
统计知识用上了。有个任务问:不同培养板上相同孔位的样本,表达谱是不是更相似?简单计算会夸大这个效应,因为相同孔位经常放同一个化合物或对照。两个模型都发现了问题,但只有 Fable 5.1 排除了那些配对,它对孔位效应的估计只有简单计算的三分之一。
数据约束下选对方法。一组差异表达基因数据来自同一批受试者不同时间点的采样,不是独立重复。Fable 5.1 在汇总计算时考虑了这个因素,Opus 5 假设完全独立,答案错了。
基础生物学常识扎实。问线粒体 DNA 的突变频率,Fable 5.1 正确使用了“线粒体 DNA 是单倍体”这个事实,Opus 5 没做到。
这些改进不是纸上谈兵。Anthropic 透露,Mythos 5.1 用开源蛋白质设计工具,对 12 个靶标实现了约 50% 的 hit 率——这个领域通常只有 10% 到 15%。其中 3 个靶标的结合亲和力,比 Adaptyv Bio 设计竞赛的最佳提交高出 10 倍。Fable 5.1 还基于 NASA 三十多年前麦哲伦探测器的雷达图像,绘制了覆盖金星三分之一的高分辨率高程图,分辨率从传统的 10 到 20 公里提升到 2 到 3 公里。
投资公司 Millennium 的测试更夸张。Fable 5.1 找到了他们内部系统一个罕见崩溃的根因——通过反汇编一个外部供应商的库——这个 bug 他们的工程师好几年都没查出来。
能力确实强。但问题是,这些能力你用得着吗?
拒绝不是随机的,是有规律的
LatchBio 的测试揭示了拒绝行为的模式。
病原体生物学相关任务——几乎 100% 拒绝。病毒逃逸、 antimicrobial resistance(抗菌素耐药性)、宿主适应这些涉及双重用途威胁的领域,一律拒答。
风险不那么明确的任务也拒。人类基因组分析中涉及疾病拷贝数解释、变异如何影响药物反应——这些也被拒。
但有些任务很少被拒。写归一化函数、设计批次校正脚本、选差异表达检验方法——方法论构建类的,Fable 5.1 很配合。模式生物相关任务从不拒绝,比如斑马鱼的染色质问题、小鼠的治疗差异。不涉及“解释”的基因组任务也不拒,比如数数 SNP 跟参考基因组的差异。
拒绝不是随机的。模型在用一套规则判断“这个问题的风险等级”。病原体→高风险,拒;人类基因组解释→中等风险,拒;方法论→低风险,通过;斑马鱼→无风险,通过。
这套规则合理吗?从安全角度,是。从实用角度——一个生物学研究者问“这个基因变异会不会影响药效”,这算高风险吗?Fable 5.1 认为算。它拒了。
安全分类器先动手,模型自己再补一刀
拒绝是怎么发生的?LatchBio 发现了两套机制。
即时拒绝:生物安全基准测试里,大部分拒绝几乎是瞬间发生的。这说明输入安全分类器在模型还没开始处理问题时就拦截了。
中途拒绝:其他基准测试里,大部分拒绝发生在模型已经开始分析之后。这些“中途拒绝”的轨迹平均输出约 1900 个 token、约 500 个思考 token、执行 4 条 bash 命令,然后才阻断输出。40% 的中途拒绝打开了 .h5ad 文件——这是单细胞数据分析的标准格式。
这意味着什么?Fable 5.1 已经开始读数据、做分析了,然后在某个节点上“反应过来”——这事不能继续,于是切断输出。
模型在执行任务的过程中自我审查。它看到了原始数据,做了初步处理,然后决定停止。
同一个模型,不同的缰绳
Fable 5.1 和 Mythos 5.1 是同一个模型,区别只在于安全护栏的级别。Fable 5.1 面向大众,Mythos 5.1 只给经过审核的网络安全和生命科学机构。
Anthropic 在安全护栏上做了改进。生物学安全护栏对 benign 请求的误报率比 Fable 5 时期降低了 85%。网络安全护栏的误报率降低了 60%。Fable 5.1 现在可以用来识别源代码中的软件漏洞——但不能开发漏洞利用代码。
但误报率降低 85% 不等于没有误报。LatchBio 的数据显示,拒绝仍然是大规模存在的。
有意思的是, harness 的选择也影响拒绝率。Pi harness 导致 Fable 5.1 拒绝的比例高于 Claude Code harness——SpatialBench-Verified 上 Pi 拒绝 49.3%,Claude Code 只拒绝 16.8%。而且这个趋势跟 Opus 5 完全相反——Opus 5 时代,Claude Code 反而拒绝更多。
同一个模型,换一套调用工具,拒绝率差三倍。这说明“拒绝”不完全是模型自己的判断,跟外部工具怎么跟模型交互也有关系。
这把手术刀太锋利,没人敢递
Fable 5.1 的困境是一个经典的能力-安全悖论。
模型越强,能造成的潜在伤害越大,安全护栏就得越紧。护栏越紧,合法用户越用不了。Anthropic 自己承认:“Fable 5 可以为恶意行为者提供显著的能力提升——提供他们从别处找不到的能力”。
这个问题在生物学领域尤其棘手。Anthropic 举了个例子:研究疾病治疗,有时候科学家得先制造出导致疾病的危险化合物。活疫苗就是个典型——科学家得先培养他们要预防的那个病原体。治疗高血压的药物卡托普利,科学家是从蛇毒里分离出降血压的毒性成分才开发出来的。
治病和造毒,有时候用的是同一套操作。
恶意行为者知道怎么利用这种模糊性。他们把危险任务包装成普通研究的样子。美国情报界 2026 年度威胁评估报告明确指出,多个国家行为者“可能保持着活跃的进攻性生物和化学武器计划”——而这些计划“可能通过获取前沿 AI 的原始能力而加速”。
所以 Fable 5.1 的拒绝率高,不是 bug,是 feature。Anthropic 宁可误杀一千,不放过一个。
问题是:误杀的那一千个合法研究者怎么办?
模式生物随便问,人类基因组不让碰——这条红线谁画的?
Fable 5.1 的拒绝规则透露出一个有趣的信号。
斑马鱼的染色质问题——可以问。小鼠的治疗差异——可以问。人类的疾病拷贝数解释——不可以问。变异如何影响药物反应——不可以问。
红线画在“人类”身上。
这不是技术判断,是政策判断。Anthropic 决定:模型生物的研究风险低,人类基因组解释风险高。这个判断有道理吗?从双重用途的角度,人类基因组信息确实更容易被滥用。但从科研需求的角度,做人类遗传病研究的科学家就是最需要这类工具的人。
更麻烦的是拒绝的不可预测性。一个写 normalization 函数的请求可以通过。同一个研究者,拿着归一化之后的数据问“这个样本的拷贝数变异意味着什么”——被拒。工作流断在中间。
LatchBio 的建议很直白:准备一个回退模型,免得任务做到一半被卡住。
你以为它在拒绝,其实它在思考
“中途拒绝”这个现象值得再琢磨一下。
模型平均输出 1900 个 token、约 500 个思考 token、执行 4 条 bash 命令之后才拒绝。40% 的情况下它打开了 .h5ad 文件。
这不是“想都没想就说不”。这是“想了半天,决定说不”。
Fable 5.1 看到了数据。它理解了任务。它开始处理了。然后在某个决策点上,它判断“这事不能继续”。这个判断可能来自安全分类器的触发,也可能来自模型自身的推理——它意识到自己在做的事超出了允许范围。
一个能做出这种判断的模型,说明它对自己的行为边界有认知。这本身是能力的体现。只不过这种能力以“拒绝服务”的形式表现出来。
你买的是一把会自己决定砍不砍的刀
2026 年 9 月 1 日发布的 Fable 5.1,基准测试全面碾压前代。缓存读取价格砍 75%,高强度任务成本降 45%。生物学推理能力在具体任务上表现出质的飞跃——工具参数用对了、多数据源整合更聪明、统计知识用上了。
但 10552 条测试轨迹里,拒绝是“主导趋势”。100% 的长周期任务被拒,生物安全相关几乎全拒,连人类基因组解释这种不算高危的任务也大量被拒。
这就是 Fable 5.1 的现状:一个能力拉满但动不动就罢工的生物学推理引擎。
Anthropic 在做一个艰难的选择题:放得太开,可能被坏人用来造武器;收得太紧,好人用不了。目前的选择是偏保守——宁可让合法用户 frustrated,也不能冒那个险。
问题在于,这个平衡点会移动吗?Anthropic 说他们在跟美国政府合作建立生命科学验证项目,给经过审核的研究者开放 Mythos 5.1 的完整能力。但这个项目目前只面向美国机构。欧洲的生命科学家不在项目里。
一个全球最先进的生物学推理模型,只有美国人能用完整版。
这事还没完。Fable 5.1 的中途拒绝机制里藏着一个值得追问的细节:那些被阻断的 .h5ad 文件分析,模型到底已经算到什么程度了?它是在算出结果之后才决定不输出,还是在计算过程中触发了某个阈值?1900 个输出 token 加上 500 个思考 token,对于一个单细胞数据分析任务来说,足够跑到哪一步?
没人知道。Anthropic 没说。LatchBio 的数据停在“打开了 .h5ad 文件”这个事实。文件打开之后发生了什么,模型内部的状态是什么,这些信息被安全分类器切断了。
你可以说这是安全设计的必然。你也可以说,我们正在把最重要的科学问题交给一个随时可能拔电源的 black box。