幸知日报
← 返回 2026-07-18 日报
关注

🆕 Charles Azam 独立基准测试:Fable 5 在 NP-Hard 优化问题上碾压 Sol,「/goal 赢了多数比赛却让均值更差」

> 🔑 补充条目 — 7月17日发布。独立研究者 Charles Azam 用自建 NP-Hard 光纤网络设计基准 KIRO(搜索空间 ~10^1223),对 Fable 5 / Opus 4.8 / Sonnet 5 / GPT-5.6 Sol / Terra / Luna 进行 30 分钟无提示基准测试。核心发现:(1) Fable 5 绝对统治——纯原始智能,plain mean 比 Sol 低 1,875 分(分数=总缆线长度,越低越好),plain 分值跨仅 319 点(Sol 跨 1,958 点);(2) /goal 悖论——赢率 4/6 但两个模型均值均变差(Fable +759 / Sol +868 worse),因为目标模式偶尔放大坏决策;(3) Claude Code 的 /goal 用独立评估模型(Haiku)只读对话记录,Codex 的 /goal 让模型自己声明完成然后后台恢复——两种完全不同实现被称为同一功能。 > > 信号:这是目前最严谨的 Fable 5 vs GPT-5.6 Sol 独立基准测试。Fable 5 的优势不仅在常规编程(SWE-ben