北京时间9月2日,Anthropic悄然推出了Claude Fable 5.1和Mythos 5.1。这两款模型的发布无疑是一次重大的技术进步,它在8项公开基准测试中均取得了第一,缓存读取的价格从每百万token由原来的1美元降至0.25美元,降幅达75%。与此同时,典型工作负载的总体成本也降低了约25%,而在高度智能化的任务中,成本下降幅度高达45%。然而,这一切表面上的进展下,还有更深层的变革值得关注。

首先,Anthropic正式亮出了其反蒸馏机制。从今天起,新注册的API账户在多轮对话中无法手动修改Claude的上下文,也不能拥有完整的推理过程。每个思维链块都被赋予了数字签名,任何对话前缀的改动都会导致签名失效。如果发生这种情况,API会返回400错误,或者静默地丢弃被篡改的区块。这一技术措施的实施,反映了Anthropic对信息安全的严格把控。

在一个月前,字节跳动的张一鸣提到字节不进行蒸馏,纵然短期内会落后,引发了不少讨论。而如今,Anthropic则在反蒸馏的具体实施中走出了一步。蒸馏是自2015年Hinton提出以来就被广泛使用的过程,通常是通过一个强大的“教师模型”来指导一个较小的“学生模型”学习。然而,Anthropic的决定则是为了防止这些“学习能力”在没有充分防护的情况下被释放,维护其技术和知识产权。

核心在于,思维链的不可篡改性至关重要,因为它讲述了推理过程的细节,最后的答案依赖这些步骤。通过对思维链区块进行数字签名,Anthropic希望增强模型的安全性,特别是在新的注册账户中,预计这种措施将逐渐扩展到所有未来的新模型。

在功能和性能评测方面,Claude Fable 5.1依然以其卓越的表现而闪耀。在智能体科研基准Terminal-Bench-Science 0.1上,Fable 5.1的得分达到了52.6%,大幅领先于前代的24.7%和Claude Opus 5的29.0%。在智能体编程测试Terminal-Bench 4.0中,Fable 5.1取得55.8%的分数,而Mythos 5.1更是高达60.9%。此数据显著优于上一代和其他竞争者的成绩。

在用户体验方面,尽管输入输出的定价与Fable 5保持不变,但缓存的读取成本大幅降低,这是因为缓存读取在智能体任务中占据了大量成本。通过这一优化,普通工作负载的总成本减少了25%,而重度Agent任务的成本最高省至45%。这对于需要频繁读写上下文的复杂应用无疑是一次重要的经济性提升。