关注
Fable 5 vs GPT-5.6 Sol 基准:Fable「纯粹原始智能」碾压,/goal 模式胜多负少但均值更差
开发者 Charles Azam 用同一未公开 NP 难优化问题(光纤网络设计,搜索空间 ~10^1223)对六款模型做 30 分钟基准测试。结论:(1)Fable 5 是「绝对怪兽」——plain 模式均值 32,386,比 Sol 的 34,261 优 1,875 分,分数范围仅 319(稳定)vs 1,958;(2)/goal 模式在 6 次试验中赢 4 次,但均值反变差(Fable +759/Sol +868),因为偶尔的大退化远大于多数小改进。技术对比:Claude Code 的 /goal 使用独立评估器模型(Haiku)读取对话判断是否完成,Codex 的 /goal 是持久化线程状态让模型自评——两者实现完全不同。HN 205 分。