Anthropic 宣布更新 Claude Fable 5 的生物安全防护机制,通过优化分类器显著降低误报。此次更新使生物相关的无效回退减少约85%,模型能更好地支持医疗、教育等领域的良性生物学查询,同时继续防范生物安全风险。
Anthropic 宣布对 Claude Fable 5 的生物安全防护机制进行更新,大幅减少误报。此次更新后,用户在提出生物学相关查询时,遇到的“回退”(指系统切换到能力较弱的模型)数量显著下降。在测试中,生物学相关的回退在各类产品界面中减少了约 85%。Fable 5 将能处理更广泛的生物学任务。
在实际使用中,用户在日常生活和教育类问题(如解读化验结果、理解症状、学习生物学知识)上遇到的回退明显减少。医疗专业人员也能在临床任务中获得更多来自 Fable 5 的支持。
Anthropic 认为,AI 对世界产生积极影响的最大机会在于生物学和医学领域,并正在大力投资,以负责任的方式为生物学家提供前沿能力。目前,对于被视为“双重用途”的请求(包括病毒学、毒理学和分子设计),Fable 5 仍会回退到 Opus 5,因此它还无法用于专业生物学研究和药物开发。Anthropic 表示,将通过可信访问途径缩小这一差距。
为什么建立强大的生物安全防护
Anthropic 的目标是让尽可能多的用户尽快用上 Fable 5 的前沿能力。但要做到这一点,就需要管理更强大模型带来的风险。在生物学领域,Fable 5 在一些高度复杂的生物学任务上已经能超越专家,并能为其他任务提供操作支持。这意味着它能为研发新疗法的研究者提供真正的帮助(这也是 Anthropic 希望通过改进分类器和可信访问计划扩大模型使用范围的原因)。但若落入不当之手,这些能力可能被恶意行为者利用,例如用于开发生物武器。Anthropic 的能力评估显示,Fable 5 可能为这类行为者提供显著的“助益”,即提供他们在其他地方无法获得的能力。
区分 AI 在生物学中的有益和有害用途往往很困难。例如,研究某种疾病的治疗方法,有时需要科学家首先生产出导致该疾病的危险化合物。这在活疫苗中最为明显——科学家需要培养他们想要预防的病原体。某些药物也是如此。为了开发治疗高血压的卡托普利,科学家分离了毒蛇毒液中会降低人体血压的有毒成分。随着 AI 前沿生物学能力的不断发展,我们需要保持警惕,确保新风险不会先于其潜在科学效益而实现。
老练的恶意行为者知道如何利用这种模糊性来掩盖意图,让危险任务看起来像普通研究。美国情报界2026 年度威胁评估明确指出,此类行为者确实存在,生物技术(包括合成生物学和基因组编辑)的进步“可能导致新的生物威胁”。报告还指出,多个国家行为体可能维持着进攻性生物和化学武器计划——这些计划可能因获得前沿 AI 模型的原始能力而加速。
由于对“双重用途”能力(可用于有益或有害目的,且界限不易划定)的担忧,Anthropic 在发布 Fable 5 时有意屏蔽了几乎所有生物学查询。这让模型能为其他领域的用户所用。Anthropic 知道这会让合法的生物学用户感到沮丧:短期内会出现大量误报,用户提出生物学相关问题时会遭到拦截并被移交到能力较弱的模型。但他们选择了这种权衡,因为 Fable 在双重用途领域(如生物学)被滥用的代价可能是灾难性的。
生物学安全防护如何工作
保护生物安全的核心手段之一是安全分类器:更小型的自动化 AI 系统,用于检测 Fable 5 是否被要求执行受保护生物学任务,或可能产生有害输出。Anthropic 此前曾撰文介绍过其在网络安全领域的类似分类器。
当分类器被触发时,模型会将用户请求重新路由到 Opus 5——一个不具备与 Fable 5 同等生物学能力、也无法为恶意用户提供同等帮助的模型。这正是用户请求被拦截时看到的回退。
开发精准而稳健的分类器并非易事。分类器要快速稳定地运行,必须学会区分我们认为“范围内”和“范围外”的主题和查询(涉及潜在危害的)。调整分类器需要时间和反复迭代,既要避免误报(对无害内容触发),也要避免漏报(错过有害内容)。同时,分类器还必须对绕过行为(即越狱)具有鲁棒性,这需要更多的研究和测试。
从非常宽泛的生物学分类器起步,意味着可以在继续研究完善分类器的同时,让用户使用 Fable 5。另一种选择——在安全防护取得更大进展前暂缓发布模型——会将其通用访问时间及潜在用户价值推迟数周或数月。
过去几周,Anthropic 仔细重写了分类器的“准则”(一系列帮助模型区分受保护和允许内容的规则),并具体列出了良性用途。他们征求了多位专家的反馈(包括内部和外部专家),据此更新训练数据、重新训练分类器,并验证新分类器仍能对有害和双重用途的研究内容触发,同时允许更广泛的良性用途。
如下方示意图所示,与 Fable 5 发布时相比,此次更新后,分类器对良性生物学相关请求的触发次数大幅减少。

(图中说明:左侧为允许内容,右侧为受保护内容(被拦截并移交到能力较弱的模型)。明显有害内容(红色)和双重用途内容(橙色)会触发分类器并被拦截。安全边际中包括极可能良性但仍出于谨慎而被拦截的内容(浅绿色),深绿色为明确良性内容。Fable 5 刚发布时,分类器非常宽泛(A),大量请求被触发,包括几乎肯定良性的请求,边界因此位于最左侧。今天的更新(B)让更多良性请求被允许,分类器区分良性查询与双重用途查询的细微差别能力更强,边界也进一步右移。)
结论
安全防护的完善仍有大量工作要做。不可避免地还会存在误报——即落在分类器安全边际内的低风险请求被触发。如前所述,由于潜在的双重用途风险,Fable 将继续阻止专业生物学和药物开发查询。Anthropic 完全致力于通过可信访问渠道,为研究人员开发一条安全、可扩展的使用最强大模型的路径。
Anthropic 希望用户继续反馈意见,以便进一步改进安全防护。
此外,由于此次更新,预计总回退(无论是否与生物学相关)也将减少:Claude.ai 减少约 67%,Cowork 减少 55%,Claude Code 减少 17%,Claude 平台减少 7%。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断