Claude Opus 5 vs Claude Fable 5:8 项同题实测

Opus 5 与 Fable 5 的两张记分卡

Fable 5 是 Anthropic 新的 Mythos 级模型,定位在 Opus 之上,价格也是 Opus 5 的两倍($10/$50 vs $5/$25 每百万 token)。但 7 月的公开榜单上 Opus 5 反而在多数基准反超了它:Frontier-Bench 43.3% vs 33.7%,Artificial Analysis 61 vs 60。Fable 5 的优势区集中在 SWE-bench Pro(80.0 vs 79.2)和长时程自主任务。

榜单归榜单,我自己搭了一套小测试,让两个模型在完全相同的提示词和工作条件下跑一遍,看看日常干活场景里到底差多少。

说明:单次运行(n=1)的个人测试记录,无法度量方差,结论只能作方向性参考,不是严谨评测。

测试方法

  • 执行环境:Claude Code 的 Agent 工具,分别指定 model=opus 和 model=fable,两边提示词逐字相同
  • 8 项测试覆盖:数学推理、逻辑约束、算法实现、代码找 bug、指令遵循、信息提取、决策备忘录、Agentic 文件任务
  • 判分尽量机械化:数学/逻辑答案经暴力枚举验证,算法用 9 个隐藏 pytest 用例,指令遵循和 ETL 用脚本校验
  • 唯一的主观题(决策备忘录)用双评委盲评:sonnet 和 opus 各评一次,A/B 位置互换,评委不知道作者是谁

结果总表

测试项满分Opus 5Fable 5
T1 数学推理(禁工具)333
T2 逻辑约束求解(禁工具)555
T3 算法实现(隐藏测试)999
T4 代码找 bug(6 个埋点)655
T5 指令遵循(7 条硬约束)777
T6 信息提取 + 日期推算888
T7 决策备忘录(盲评)108.639.25
T8 Agentic ETL777
总分5552.6353.25

总耗时:Opus 5 用了 344.1 秒,Fable 5 用了 332.5 秒,基本相当。

几个有意思的观察

客观题完全打平,连漏掉的 bug 都是同一个

45 分的客观题两边都拿了 44。丢的那 1 分在找 bug 环节:6 个埋点里双方都找到了同样的 5 个,都漏掉了同一个——int(latency_s) 把小数延迟记录静默丢弃(应为 float)。两个模型的盲区高度重合,这可能比分数本身更说明问题:它们对「显眼 bug」的敏感度一致,对「类型转换吃掉数据」这类安静的 bug 也一样迟钝。

工作风格有差异:验证方式和工具调用次数

算法题两边都全过隐藏测试,但自测风格完全不同:Fable 5 写了 300 组随机对拍来验证自己的实现,Opus 5 手写了 11 个用例。ETL 任务两边输出完全正确(10 行合并订单、总收入分毫不差),Opus 5 用了 11 次工具调用,Fable 5 用了 9 次。方向性地看,Fable 更倾向「重验证」,动作也稍微省一点。

主观题是唯一拉开差距的地方

决策备忘录题目是个经典架构选型:pgvector p95 180ms 要压到 100ms 以下,2000 万向量一年翻三倍,在「深度优化 pgvector / 自建向量库 / 云托管」三个方案里选一个写给 CTO。

两个模型都选了自建 Qdrant,结构也都齐整。差别在策略:Fable 5 给出的是双轨方案——先用 30 天对 pgvector 做止血优化(halfvec 量化、ef_search 调参)压到 120ms 左右,为迁移争取从容窗口,同时并行建设 Qdrant 终局,结尾一句「用 A 买时间,用 B 建终局」。Opus 5 是纯迁移路径加决策闸门,严谨但没管过渡期。

盲评出了个插曲:opus 评委的评审任务跑了两轮,给出了两份分差不同的记分卡(9.5 vs 8.5 和 8.5 vs 8.25),聚合时取了它的最终轮。但要点是:包括 sonnet 评委在内,三张记分卡在 A/B 位置互换下全部把 Fable 的备忘录排在前面,理由也指向同一点——双轨策略更有工程现实感。排名很稳,分差本身倒是印证了「模型当裁判自己也有方差」。

都不太守「不要输出其他内容」

好几项测试要求「只输出答案」。Opus 5 在 3 项里加了被禁止的前言或推理过程,Fable 5 在 2 项里加了。不过这项有个混杂因素:子代理框架本身要求返回结果摘要,可能诱导附加文本,只能作参考。

怎么看

这套测试里两个模型几乎不可区分:客观能力打平,速度打平,唯一差距是主观题上 Fable 5 的决策质量小胜一筹。

结合价格看结论就比较清晰了:日常的数学、逻辑、代码、提取、ETL 类任务,Opus 5 用一半的价格给出同等的结果,还有 Fast Mode 可用,是性价比选项。Fable 5 的差异化在开放式判断题——它在备忘录里表现出的那种「先止血再建终局」的策略感,恰好和公开基准里它擅长长时程自主任务的画像对得上。另外选型时还要记得它附带 30 天数据留存要求和更高的安全分类器触发率。

单次运行的小样本,以上都是方向性参考。等有空跑 n=5 再看方差。