重大
基准方亲口宣布“饱和”:Epoch AI 称 FrontierMath Tier 4 全部题目被解出,Astra 拿 97.6%——但题目是 OpenAI 出资委托的
深调把这条从“中文传闻”追成了官方结论。基准维护方 Epoch AI 的官方 Bluesky 账号(2026-09-10 17:38 UTC)原文:“每一个 FrontierMath Tier 4 题目现在都已被 AI 解出,GPT-6 Astra 解出了最后一道——它由 Jay Pantone 出题。”同一账号补上了刻度:“我们在 2025 年 7 月 11 日推出 Tier 4 时,最高分是 5%。不到 14 个月后,最高分是 98%,我们认为该基准已经饱和。”注意这条表态只发在社交账号,Epoch 官网的 latest 列表里没有对应博文——这是本轮最重要的通道发现:官方博客列表不等于官方表态的全部。 OpenAI 侧也有一手源:其发布页正文写“Astra 以 98% 的成绩使 FrontierMath Tier 4 饱和”,同页评测表给出的精确值为 97.6%,并列对比 GPT-5.6 Sol 83.0%、Claude Fable 5.1 87.8%、Claude Fable 5 90.2%、Claude Opus 5 73.2%(量子位转述的 97.6% 由此核实通过)。 但