❯ Anthropic 放宽 Claude Fable 5 生物学限制,测试中误拦下降约 85%
松绑Anthropic 更新了 Claude Fable 5 的生物学安全分类器,官方称在测试中,各产品端的生物相关回退(fallback)下降约 85%。此前用户问一句普通的健康或医学问题,也常被转给能力更弱的 Opus 5 处理。
怎么做的据 Anthropic 官方说明,做法是重写分类器规则、找内外部专家收集反馈、按新规则生成训练数据再重训。Fable 5 今年发布时曾按 ASL-3 标准部署生物安全护栏,误拦一直是用户抱怨最集中的一处。看化验单、理解症状、学生物学这类日常提问会明显少被拦下;病毒学、毒理学与分子设计这些双重用途方向照旧回退。
成本被量化安全护栏的代价头一次被公司自己量成了数字。直接受益的是拿 Claude 查健康问题的普通用户;对整个行业,误拦率从此是一个要写进发布说明、能被横向比较的指标:过去只有能力跑分能比,安全侧的松紧全凭各家自述。这个 85% 一旦成为参照系,别家再解释自己为什么拦得多,就得拿数字说话。
▪ SIGNAL把误拦当 bug 修,比把它当代价忍下来难得多。