幸知日报 V1 事实底稿——GPT-6 Astra 刷穿 FrontierMath Tier 4 与 OpenAI 企业落地案例
本报告的作用:为 2026-09-13 幸知日报的 V1 条目提供可直接回填的事实底稿。 采集时点:2026-09-13 00:16–01:00(+08:00),即 2026-09-12 16:16–17:00 UTC。全部页面均在此时点实际打开并落盘。 素材位置:tmp/swarm-materials/astra-2
幸知 调研报告 调研
#GPT#Astra#FrontierMath#Tier#OpenAI#UTC
本报告的作用:为 2026-09-13 幸知日报的 V1 条目提供可直接回填的事实底稿。 采集时点:2026-09-13 00:16–01:00(+08:00),即 2026-09-12 16:16–17:00 UTC。全部页面均在此时点实际打开并落盘。 素材位置:
tmp/swarm-materials/astra-2026-09-13/(原始 html + 清洗 txt,文件名一一对应;清洗脚本_extract.py同目录)。 置信度标注:[事实]一手源直接读到;[推断]由多条事实推得、未被直接证实;[推测-待确认]单条线索、低置信。
一、概况
- 本条目成立。两条线索都能追到一手源,且有一条比中文转述更硬的补充事实。
- 「刷穿 FrontierMath Tier 4」不是中文媒体造势,是基准方自己下的结论 —— Epoch AI 官方社交账号 2026-09-10 用原话写明「we consider the benchmark saturated」。
[事实] - 但「饱和」的口径与中文转述不完全一致。Epoch 的说法是「每一道 Tier 4 题都已被 AI 解出;GPT-6 Astra 解掉了最后一道」,同时给出「最高分 98%」。这个「98%」和「每道题都被解出」是否同一次运行的结果,Epoch 未明说。
[事实](表述原文)+[推断](口径解读) - OpenAI 官方确实公布了成绩:发布页正文写「saturates FrontierMath Tier 4 with a 98% score」,同一页的评测表给出精确值 97.6%,并列出 5 个对比模型的同表数字。这一条把量子位「OpenAI 自己公布的成绩也是 97.6%」坐实了。
[事实] - 最重要的风险点:Epoch AI 官方公开披露——FrontierMath 由 OpenAI 出资委托出题,且 OpenAI 对 Tier 4(v1)50 道题中的 30 道拥有访问权。评估独立性存在结构性利益冲突,报告正文必须带这个 caveat。
[事实] - 企业落地两条案例都是「厂商单方口径」:OpenAI 发的客户故事,引用客户高管的话,通篇没有一个量化效果数字。没有找到任何第三方验证。
[事实] - 时间戳异常已核实:Perplexity 案例页的发布日期「2026-09-14」确实晚于当前时点约 32 小时,RSS 的
pubDate也是 9-14 00:00 GMT,但页面此刻已经可以打开读到全文。不是模型未发布,是这一页的时间戳本身异常。[事实]+ 成因[推测-待确认] - 纳维-斯托克斯线:OpenAI 已发布证明文稿 + Lean 形式化,明确声明不申领 Clay 奖;Clay 官方千年问题索引页此刻已不再把 Navier–Stokes 列在「未解决」清单里,但也没列进「已解决」——与《The Verge》报道一致。
[事实]
二、时间线(全部取自一手源)
| 日期 | 事件 | 一手源 |
|---|---|---|
| 2024-10-22 | FrontierMath 最早在 Epoch 版本表中留痕的版本(119 题,即 arXiv 论文分析的那一版) | epoch.ai/frontiermath/tiers-1-4/about |
| 2024-11-26 / 12-04 | 版本 180 题 / 197 题;OpenAI o3 于 2024-12-20 公布 25.2%(针对 11-26 版) | 同上 |
| 2025-02-28 | 300 题核心集完整版;随机扣留 53 道解法不给 OpenAI | 同上 |
| 2025-06-30 | FrontierMath_T4_06-30-25:Tier 4 扩展 50 题;扣留 20 题不给 OpenAI | 同上 |
| 2025-07-11 | Tier 4 上线,当时最高分 5% | Epoch AI 官方 Bluesky,2026-09-10 |
| 2026-06-12 | v2 发布:Tiers 1-3 修正 123 题、Tier 4 修正 12 题;Tiers 1-3 移除 5 题、Tier 4 移除 7 题。全库 338 题 = 295(T1-3)+ 43(T4) | epoch.ai/benchmarks/frontiermath-tier-4-v2 |
| 2026-08 | FrontierMath Erdős 的「开放基线」月份(68 题此时均未被解) | epoch.ai/benchmarks/frontiermath-erdos |
| 2026-09-01 | Epoch 发布 FrontierMath Erdős(68 题,Lean 形式化);同日 OpenAI 听到「两个千年问题被解决」的传言,启动内部攻坚 | epoch.ai/latest/announcing-frontiermath-erdos / openai.com/index/navier-stokes-solution |
| 2026-09-03 11:00 GMT | OpenAI 发布 GPT-6 Astra(发布页正文 + 评测表 97.6%) | openai.com/index/gpt-6-astra / OpenAI 官方 RSS |
| 2026-09-05 | OpenAI 多智能体系统得出 Navier–Stokes 解答(距 9-01 启动约 88 小时) | openai.com/index/navier-stokes-solution |
| 2026-09-06 | Lean 验证完成(额外 17 小时,经 GPT-6 Astra);同日联系 Alpöge / Buckmaster | 同上 |
| 2026-09-08 10:00 GMT | OpenAI 发布《On the Navier–Stokes Millennium Prize Problem》 | 同上 |
| 2026-09-09 11:00 GMT | OpenAI 发布 GPT-6 Astra 商用篇《The next generation in intelligence for work》 | openai.com/index/gpt-6-astra-next-generation-work |
| 2026-09-10 17:38 UTC | Epoch AI 官方宣布 Tier 4 饱和(Bluesky 三连帖) | bsky.app/profile/epochai.bsky.social |
| 2026-09-10 | OpenAI 在 N-S 帖「Concurrent work」节追加 9-10 调查更新 | openai.com/index/navier-stokes-solution |
| 2026-09-11 16:00 GMT | OpenAI 发布 Cognition/Devin 客户故事;同日 Cognition 官方博客发 Fusion 帖 | openai.com/index/cognition-devin-testing-with-astra / cognition.ai/blog |
| 2026-09-12 11:00 UTC | 《The Verge》发《OpenAI just wants to win》(数学署名争议长报道) | theverge.com/…/994255 |
| 2026-09-14 00:00 GMT(页面自称) | Perplexity 客户故事。但页面在 2026-09-12 16:2x UTC 就已可读 | openai.com/index/perplexity-improving-accuracy-with-astra |
三、核心事实
1. FrontierMath 是什么
发布方与结构 [事实]
Epoch AI 官方原文:「FrontierMath is our program for testing AI on advanced mathematics. It has three components: FrontierMath Tiers 1-4, a benchmark of difficult problems authored by mathematicians; Open Problems, a broad collection of significant open research problems; and FrontierMath Erdős, a curated set of Erdős problems formalized in Lean.」 来源:epoch.ai/frontiermath
难度分层 [事实]
- Tiers 1-3:「cover undergraduate problems through exploratory problems suitable for an advanced graduate student」
- Tier 4:「research-level mathematics」(研究级)
- 题量:全库 338 题 = 基础集 295 题(Tiers 1-3)+ 扩展集 43 题(Tier 4)。公开 12 题(T1-3 十题 + Tier 4 两题),其余为私有集,榜单数字默认基于私有集。
- 单题工作量:「Solving a typical problem requires multiple hours of effort from a researcher in the relevant branch of mathematics, and for the upper end questions, multiple days.」
来源:epoch.ai/benchmarks/frontiermath-tier-4-v2
谁在维护榜单 [事实] —— Epoch AI 自行运行评测,用 Inspect 框架,自定义了 FrontierMath 实现,并发布 task 定义与 log viewer;评测由英国 AI Security Institute 资助。
来源:epoch.ai/data/ai-benchmarking-dashboard
评测条件(这是「怎么算分」的关键) [事实]
- 模型必须提交一个 Python 函数
answer(),返回 Python 对象作为答案; - 允许模型写代码并执行(python 工具,30 秒单次运行上限,仅 stdout 返回,无状态);
- token 硬上限 1,000,000;到 660,000 token 时强制进入提交阶段;
- 答案函数最长 30 秒,跑在「当年普通商用硬件」上;
- 评分 0/1,答对 1 分。 来源:epoch.ai/benchmarks/frontiermath-tier-4-v2
Tier 4 此前是否长期未被攻克 [事实]
Epoch AI 官方原话:「When we launched Tier 4 on July 11th, 2025, the top score was 5%. Less than 14 months later, the top score is 98% and we consider the benchmark saturated.」
来源:Epoch AI 官方 Bluesky,2026-09-10 17:38 UTC。
利益冲突披露(必须带上) [事实]
Epoch 官方《Conflict of interest statement》原文:「OpenAI commissioned 300 questions for the core FrontierMath dataset and 50 problems for Tier 4. They have access to all problem statements and solutions up to FrontierMath_12-04-24, except for 53 solutions randomly withheld … Additionally, OpenAI has access to 30 of the 50 Tier 4 problems, with the remaining 20 reserved as a holdout set. Epoch AI retains the right to conduct and publish evaluations using the full FrontierMath dataset.」
来源:epoch.ai/frontiermath/tiers-1-4/about
2. 「刷穿/饱和」的原始证据
证据 A:基准方官方口径 [事实]
Epoch AI 官方 Bluesky(@epochai.bsky.social,经 Bluesky 公共 API getAuthorFeed 直读 record.text 与 record.createdAt),2026-09-10 17:38 UTC 三连帖:
- (17:38:27)「Every FrontierMath Tier 4 problem has now been solved by AI, with GPT-6 Astra solving the last problem standing. Mathematicians often commented that AI found unintended shortcuts when solving their Tier 4 problems. Not so for this last one, which was created by Jay Pantone.」
- (17:38:29)「When we launched Tier 4 on July 11th, 2025, the top score was 5%. Less than 14 months later, the top score is 98% and we consider the benchmark saturated.」
- (17:38:31)引导到
epoch.ai/frontiermath。
证据 B:OpenAI 官方成绩 [事实]
OpenAI 发布页正文:「Astra saturates FrontierMath Tier 4 with a 98% score, having already helped solve long-standing open problems in mathematics.」
同页评测表「Academic」区块,列名依次为 GPT-6 Astra / GPT-5.6 Sol / Claude Fable 5.1 / Claude Fable 5 / Claude Opus 5 / Gemini 3.8 Flash:
| 基准 | Astra | 5.6 Sol | Fable 5.1 | Fable 5 | Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
表下附注:「Evaluation scores are the maximum at any effort. GPT evaluations were run in our research environment or via our API, which may provide slightly different output from production ChatGPT…」 来源:openai.com/index/gpt-6-astra
顺带证实:量子位写的「Claude Fable 5 达到 90.2%」与 OpenAI 官方表一致,说明该文确有对照官方表格;而第三方榜单 BenchLM 的同类榜单里根本没有 Claude Fable 5/5.1 这几行(见下),不能拿 BenchLM 当「谁第二」的依据。
题量与口径的算术校验 [推断]
Tier 4 v2 私有集 43 题。若为单次跑分,可能的整数得分只能是 41/43 = 95.35% 或 42/43 = 97.67%,都不是 97.6%。因此 97.6% 大概率是多次运行的均值,或分母口径与 43 不完全对应。[推断],待核实:本次未找到 OpenAI 或 Epoch 公布 97.6% 的分子分母。
谁跑的这次评测 —— 待核实
OpenAI 页面没有标注 FrontierMath Tier 4 (v2) 这一行的评测方(既没写 Epoch AI,也没写 OpenAI 自测)。Epoch 的 Tier 4 hub 页面确实挂了一个公开 log viewer 链接(logs.epoch.ai/inspect-viewer/...),说明 Epoch 至少公开过某次运行的完整轨迹,但无法据此断定 97.6% 这一行就是 Epoch 跑的。追踪过程:已检查发布页原始 HTML 中 8 处 FrontierMath 上下文与表格 JSON,未发现 Source:/评测方标注。
第三方交叉验证(弱) [事实]
BenchLM.ai 的 FrontierMath v2 (Tier 4) 榜单页(数据刷新 2026-09-10):榜首 GPT-6 Astra 97.600%,第二名 GPT-5.6 Sol 83.000%,题量标注「43 private extreme-difficulty mathematics problems」,评测格式标注「Python-enabled iterative mathematical reasoning」。与 OpenAI 表格的前三名数字吻合。
但其榜单质量存疑:48 个模型中 Anthropic 最好成绩是 Claude Opus 4.8 的 31.250%,完全没有 Claude Fable 5 / 5.1 / Opus 5 这些新一代模型 —— 与 OpenAI 官方表格(Fable 5 = 90.2%)直接冲突。
来源:benchlm.ai/benchmarks/frontiermathv2tier4
中文转述核对结果(量子位原文:qbitai.com/2026/09/487701.html)
| 量子位说法 | 核验结果 |
|---|---|
| OpenAI 自公布 97.6% | ✅ 已核实(OpenAI 官方表) |
| Epoch AI 正式下结论「饱和」 | ✅ 已核实(Epoch 官方 Bluesky) |
| Tier 4 上线时最高约 5% | ✅ 已核实(同上,5%) |
| v2:Tier 4 修正 12 题、移除 7 题、剩 43 题 | ✅ 已核实(Epoch changelog:Tier 4 corrected 12 / removed 7) |
| Tier 4 初版 50 题、2025 年加层 | ✅ 已核实(Epoch 版本表 FrontierMath_T4_06-30-25 50 题) |
| FrontierMath 于 2024-11-07 首发 | ⚠️ 待核实:Epoch 官方版本表最早一版是 FrontierMath_10-22-24(119 题),无 11-07 记录 |
| 最初 300 题分 Tier 1/2/3 | ✅ 部分核实(官方:核心集 300 题由 OpenAI 委托出题;分层表述与 Epoch 一致) |
| 发布之初「历次测试加起来只有 3 道题曾被解出」 | ⚠️ 待核实:本次未找到一手源 |
| 陶哲轩、Gowers、Borcherds 参与出题;陶哲轩称 Tier 3 还能卡几年 | ⚠️ 待核实:本次未找到一手源 |
| Epoch 样题页曾写「有些题可能几十年不会被 AI 解决」 | ⚠️ 待核实:本次未找到该字样 |
| Astra 在 FrontierMath Erdős 68 题中只解决 2 道 | ✅ 已核实(Epoch 官方:Astra 3% = 2/68) |
| 题目作者 Jay Pantone 表态「AI 这次解法和自己相当接近」 | ⚠️ 待核实:Epoch 官方帖只确认「最后一道题由 Jay Pantone 创作」「这次没有出现意外的捷径」;Pantone 本人的原话未找到一手源 |
3. Tier 4 之后还剩什么
方向一:把难题从「求解」推向「验证」 [事实]
- FrontierMath Erdős(2026-09-01 发布):68 道 Paul Erdős 提出/研究过、截至 2026 年 8 月仍未解决的问题(覆盖 erdosproblems.com 上 65 道不同编号题)。全部用 Lean 4 + Mathlib 表述,AI 必须写出完整的 Lean 证明或反证。
- 策展人:Thomas Bloom(erdosproblems.com 维护者),68 题约占其站点当时未解题数(652 题)的 10%。
- 验证:只接受通过 Comparator(Lean FRO 维护、抗作弊设计)的提交;每题在无网络的两个 Docker 容器中分离运行(agent 容器 + 干净的 Lean 工具链容器)。
- 预算:每题一次尝试,花费上限 300 美元、工时上限 72 小时;准确率 = 68 题中解决的比例。
- 离线资料:476,000 篇 2022 年前纯数学 arXiv 论文的 LaTeX 源码树。
- 官方自陈的局限:题选本身高度主观;形式化本身是额外负担(举例:Erdős 单位距离猜想的自然语言证明 18 页,Lean 形式化 120 万行代码);污染问题随时间显现;Erdős 问题不等于全部数学。
- 首轮成绩(5 个模型,均为每题一次尝试):GPT-6 Astra(预发布版)3%(68 题中 2 题);GPT-5.6 Sol / GPT-5.5 / Claude Fable 5.1 / Claude Fable 5 均为 0%。
- 除基准跑之外的非系统性追加尝试:Astra 在更多次数、更大预算下共解出 5/68(题 1 反证、74 反证、126 证明、548 证明、571 证明),总花费 超 22 万美元(基准跑本身约 2 万美元)。
来源:epoch.ai/benchmarks/frontiermath-erdos、epoch.ai/latest/announcing-frontiermath-erdos
- Open Problems:50 道来自真实数学研究的重要未解问题,「Solutions are computationally verifiable, so evaluation can take place without needing to review AI proofs」。Epoch 基准页「最新动态」栏(2026-07-31)写明该集已扩展到 50 题、AI 已解出 3 题。 来源:epoch.ai/frontiermath、epoch.ai/data/ai-benchmarking-dashboard
方向二:饱和之后换指标 [事实]
Epoch 的 ECI(Epoch Capabilities Index)能力总指数,截至 2026-09-12 更新时,榜首 167 分即 GPT-6 Astra。
来源:epoch.ai/data/ai-benchmarking-dashboard
结论 [推断]:Tier 4 之后,这条线同时往两个方向走 —— ①难度上移(Open Problems:真实未解问题);②验证方式革命(Erdős:Lean 形式化 + 机器验证,把「证明对不对」从人工同行评议变成可编程判定)。Tier 4 自身则从「能力标尺」退化为「历史刻度」。
4. GPT-6 Astra 是什么
[事实]
- 官方命名:GPT-6 Astra。API 模型 id 为
gpt-6-astra。 - 发布时间:2026-09-03 11:00 GMT(OpenAI 官方 RSS
pubDate:Thu, 03 Sep 2026 11:00:00 GMT;发布页正文日期「September 3, 2026」)。 - 发布节奏:发布当天仅向有限机构开放,「over the coming days」向 ChatGPT Plus / Pro / Business / Enterprise 及 API、Microsoft Azure、AWS Bedrock 开放;企业侧默认关闭,需管理员开启。
- 能力定位:「our most intelligent and aligned model」(发布页)/「the world’s most intelligent and aligned model」(商用篇);自称在 computer use、browsing、software engineering、cybersecurity、science、professional work 全面 SOTA。
- 定价:每百万输入 token 10 美元、每百万输出 token 50 美元;Fast mode 可 2 倍速、2 倍价。
- 安全定位:第一个达到 OpenAI Preparedness Framework 下「Critical」网络安全能力阈值的模型;内部 computer-use 安全基准上「非预期结果」比 GPT-5.6 Sol 少 89%、比 Claude Fable 5.1 少 74.7%。
- 与内测模型的关系(重要):OpenAI 在 Navier–Stokes 帖中说明,该成果用的是「an internal model that is significantly more capable than GPT-6 Astra」;在《Ten advances in mathematics》里也用「an internal version of Astra, our next major model」。也就是说 Astra 是已发布的前沿,但不是 OpenAI 内部最强。 来源:openai.com/index/navier-stokes-solution、openai.com/index/ten-advances-in-mathematics
- 同页主要数字:Terminal-Bench 4.0 = 57.9%(Sol 37.3%、Fable 5.1 55.8%);ExploitBench = 100%(Sol 78.5%);ARC-AGI-3 = 99.9%。
关于「9-14 时间戳」的核查结论 [事实] + 成因 [推测-待确认]
- 被质疑的页面是 Perplexity 客户故事(不是模型发布页)。它的页面日期显示
September 14, 2026,OpenAI 官方 RSS 的pubDate也是Mon, 14 Sep 2026 00:00:00 GMT;同页「Keep reading」区块里 Cognition 那篇标注Sep 11, 2026。 - 本次实测的当前时点:本机
Get-Date= 2026-09-13 00:16 (+08:00);同时用两个独立外部时钟核对 HTTPDate响应头 —— cloudflare.com 返回Sat, 12 Sep 2026 16:18:08 GMT,epoch.ai 返回Sat, 12 Sep 2026 16:18:09 GMT。本机时钟准确。 - 结论:该页面的标注日期比实际可访问时间早约 32 小时,且页面在「未来日期」下已经全文可读、可抓取。
- 成因判断:最可能是定时发布提前上线 / CMS 日期标为计划日。
[推测-待确认]。不是「GPT-6 Astra 尚未发布」——Astra 已于 9-03 正式发布;异常仅限这一个客户故事页。不影响条目成立,但幸知日报如果引用该页,日期应写「官方标注 9-14(实际 9-12 已可访问)」并标注异常。
5. 企业落地的具体内容
Cognition / Devin(OpenAI 官方客户故事,2026-09-11 16:00 GMT)
[事实]
- 用在哪:「We’ve been using it to make improvements across our product, including the core cloud agent that is Devin, but also our CLI and desktop products」——Cognition 联合创始人 Walden Yan。
- 具体场景 1(自测):Devin 用 Astra 测试 iPhone 游戏 Otter Run,返回模拟器运行录像 + 一份报告,标明哪些检查通过、哪些区域未测。
- 具体场景 2(客服闭环):客户发来一张 bug 截图 → 交给用 Astra 的 Devin → 修复后返回一张结果截图,团队「get back to customers much quicker」。
- 定位表述:「One of the big pieces that Astra improves on is its ability to test and prove that its work actually functions the way you expect.」(Walden Yan)
- 效果数字:没有。 全篇只有定性描述(「much quicker」「less manual code review」),零量化指标。
- 侧证:OpenAI 发布页引 Cognition SVP Research Silas Alberti:「We’re integrating GPT-6 Astra into Devin’s harness on launch day, where it delivers state-of-the-art performance on our internal testing benchmark」——同样是「内部基准 SOTA」这种不可验证表述,无数字。
- 厂商侧补充(Cognition 官方博客,2026-09-11):《Introducing Fusion in Devin Desktop & CLI》——「Fusion is the most efficient frontier harness for Fable and Astra, up to 39% more efficient compared to other model harnesses across major coding benchmarks」。注意:这是 harness(编排层)效率,且同时覆盖 Claude Fable 与 Astra,不是 Astra 单独的模型成绩。
来源:openai.com/index/cognition-devin-testing-with-astra、cognition.ai/blog
Perplexity(OpenAI 官方客户故事,页面标注 2026-09-14)
[事实]
- 用在哪(Johnny Ho,联合创始人兼首席战略官):「We can have the model craft communications, edit real-world systems, and monitor our production software in a way that previous generations were not able to.」——即:撰写对外沟通、改动真实系统、监控生产软件。
- 具体场景(自测):Ho 让 Astra 围绕一个应用构建一个小型测试程序;模型扮演其他服务(例如某个语言模型 API 或连接器)生成逼真响应,从而端到端验证整个工作流。
- 信任表述:「We’re actually able to trust it with full end-to-end systems and check in on it much less frequently than previous generations of models.」
- 效果数字:没有。 「much less frequently」无基线与量值。
- Perplexity 一手源状态:未取到。
perplexity.ai/hub/blog与perplexity.ai/hub直连均返回 HTTP 403(5,588–5,624 字节的拒绝页);r.jina.ai 代理同样 403;archive.org 快照取回的是 JS 空壳(清洗后 4,075 字符全为导航占位)。因此 Perplexity 侧只有 OpenAI 的转述,没有 Perplexity 自己的公开文本。
两条案例的可信度判定
[事实] + [推断]
- 两条都是 OpenAI 官方发布的客户故事,被引用的都是客户方高管(Cognition 联创 Walden Yan、Perplexity 联创 Johnny Ho),属于厂商单方口径。
- 未找到任何第三方独立验证:没有第三方评测机构复现、没有客户侧公开的量化报告、没有可审计的指标定义。
[推断]:这两条案例适合作为「企业正在把 Astra 接到生产工作流里」的定性证据,不适合作为「Astra 带来 X% 提升」的量化依据。幸知日报若要引用效果数字,只能引 OpenAI 9-09 商用篇里其他客户的自报数字(Databricks、Hebbia 17%/19%、Box >10%、Basis 20%、CodeRabbit ~20%、Datacurve DeepSWE 74%),并明确标注为厂商自报。- 补充背景(同页自述):OpenAI 自己在内部提前数周铺开 Astra,用 Astra + Codex 把 3 小时多机位素材剪成开发者首印象视频(4 天 55 万播放),工程团队用其定位内存分配瓶颈,换来 25 倍回合延迟下降、峰值内存上升约 30%。这些也是自报。
6. 纳维-斯托克斯 / 千年问题的官方状态与争议
OpenAI 官方声明状态 [事实]
- 已发布:2026-09-08 10:00 GMT,标题《On the Navier–Stokes Millennium Prize Problem》,同时给出证明文稿与 Lean 形式化。
- 声称的内容:内部系统给出解析证明 + Lean 形式化,证明「初始光滑、静止的流体可以在有限时间内产生奇点」,即证否存在性与光滑性;称这解决了官方表述中的命题 C(以及 D)。
- 算力与方法自述:约 10,000 个并发智能体;9-01 启动、9-05 得出解答(约 88 小时);Lean 形式化与验证额外 17 小时(用 GPT-6 Astra);期间共发 4.9M 条消息、约 3,000 亿输出 token(其中 Navier–Stokes 单项 2.7M 条消息、约 1,300 亿 token)。副产品:还顺带解掉了无外力版 Euler 方程正则性问题(约 100 个智能体、约 50 小时)。
- 是否申领 Clay 奖:明确不申领。 原文:「We do not intend to claim the Millennium Prize for this result.」
- 是否经同行评审:无证据表明有。 公布的是文稿 + Lean 形式化(Lean 是机器核验,不是人审)。《The Verge》援引 Clay 规则:需结果发表满 两年、且期间「received general acceptance in the global mathematics community」。
- Clay 官方页面实测(本次直读 claymath.org):千年问题索引页当前「Unsolved problems」下只列 Birch and Swinnerton-Dyer、Hodge、P vs NP、Riemann Hypothesis、Yang-Mills & the Mass Gap 五个;「Solved problems」下只有 Poincaré 猜想。Navier–Stokes 两个清单里都没有(导航里仍有它的独立页面,页面顶部带一个
Active标签)。[事实](页面实际内容)+[推断](解读为「已从未解决清单撤下、但未宣布解决,与 The Verge 报道一致」) 来源:claymath.org/millennium-problems、claymath.org/millennium/navier-stokes-equation
9-12 数学界争议与官方回应 [事实](《The Verge》转述的具名表态)/ [事实](OpenAI 官网自述部分)
- 争议核心人物:Tristan Buckmaster(纽约大学数学教授)与 Levent Alpöge(Anthropic 员工,自称与 Anthropic 无关的「个人合作」)。二人当时正在推进有外力版 Euler 方程的结果,被 OpenAI 9-01 的传言触发竞速。
- OpenAI 官方回应 1(官网自述,9-10 更新):承认 Alpöge / Buckmaster 在有外力 Euler 问题上的优先权并致贺;称「We (the researchers and the agents) did not see any of their work through any means until they released it publicly — in particular, no specific user data was accessed in order to solve this problem.」;并称经调查确认「Buckmaster 在此前两个月的 Codex 提示不可能以任何方式影响该系统,包括通过训练」。
- OpenAI 官方回应 2(发言人 Laurance Fauconnet 对 The Verge):「We can say categorically that it is impossible for Dr. Buckmaster’s Codex prompts over the last two months to have influenced the system in any way, including training.」同时表示「since the completion of Navier-Stokes we have made substantial progress on another Millennium Prize problem」,正在斟酌如何公布(具体是哪个问题未透露)。
- 争议方立场:Buckmaster 表示「one should take such statements with great skepticism」;他称 OpenAI 研究员 Sébastien Bubeck 曾提出给他近乎无限算力、并让他成为 OpenAI 论文唯一作者,条件是排除 Alpöge,他视之为「bribe」并拒绝。Bubeck 在社交媒体与《纽约时报》否认其定性,但承认确实提出过资源安排,且 Alpöge 的 Anthropic 身份是症结(「how can we have an internal OpenAI project with an Anthropic employee?」)。
- 另一位当事人:Andreas Thom(德累斯顿工业大学教授)称 OpenAI 曾悄悄修改公告以承认他与 Gábor Kun 的贡献,但未公告这一修改;他关心的「ChatGPT 对话数据是否被用于改进模型」这一问题,The Verge 称 OpenAI 未回应。
- 学界动作:
- Leiden 宣言(2026-06-08 发布,Wadham College 通稿):16 位学者起草,获国际数学联盟(IMU)背书,一周内 2,000 个签名;《The Verge》(9-12)称已近 3,900 人联署。 来源:wadham.ox.ac.uk 通稿
- mathandai.org《A Severe Misalignment of AI in Mathematics》宣言:本次直读页面,署名区列出 25 位菲尔兹奖得主(Avila、Bhargava、Birkar、Deligne、Yu Deng、Donaldson、Duminil-Copin、Figalli、Hairer、Huh、Kontsevich、Elon Lindenstrauss、P.-L. Lions、Maynard、McMullen、Mori、Ngô Bảo Châu、Okounkov、Scholze、Smirnov、Terence Tao、Viazovska、Villani、Werner、Zelmanov —— 逐一点数确为 25 人)。 来源:mathandai.org 注意:它与 Leiden 宣言不是同一份文件(发布方、日期、签署机制均不同)。任务简报把两者混为一谈,本报告分列。
- OpenAI 在争议高峰期间撤回了对加州理工本科数学黑客松的赞助(《The Verge》)。
- 石溪/清华的丘成桐(Shing-Tung Yau)对 The Verge 表示担忧对青年研究者的影响,并支持独立调查,指出 AI 公司同时是「研究工具提供方」和「竞争者」,构成严重利益冲突。
四、争议与不确定
- 「饱和」的评测独立性。FrontierMath 由 OpenAI 出资委托出题,且 OpenAI 对 Tier 4(v1)50 题中的 30 题有访问权(20 题扣留)。Epoch 保留了在全量数据集上评测与发布的权力,但「OpenAI 的模型在 OpenAI 出题、OpenAI 有访问权的基准上饱和」这一结构,客观上削弱了「饱和」作为独立第三方结论的强度。
[事实] - 97.6% 的评测执行方不明。OpenAI 页面未标注该行由谁执行;Epoch 的 Tier 4 hub 页面虽然挂有 log viewer 链接,但不能证明这一行来自 Epoch 的运行。待核实。
- 97.6% 的分子分母不明。43 题的整数得分无法得到 97.6%,疑为多次运行均值。待核实。
- 「每道题都被解出」的统计口径不明。Epoch 原话把「所有 Tier 4 题已被 AI 解出」与「最高分 98%」并列,未说明「全部解出」是跨模型、跨多次尝试的累积(量子位的解读),还是 Astra 单次运行即全对(与 97.6% 矛盾)。待核实:本次未找到 Epoch 的明确定义。
- 第三方榜单质量堪忧。BenchLM 的榜单缺失 Claude Fable 5/5.1/Opus 5 等主力模型,其「第二名 83%」与 OpenAI 官方表的 87.8%/90.2% 冲突。用第三方聚合榜单做交叉验证时须打折扣。
- 量子位多处细节未获一手源:首发日期 2024-11-07、「发布之初仅 3 题曾被解出」、陶哲轩等菲尔兹奖得主参与出题、「可能几十年不会被 AI 解决」原句、Jay Pantone 本人的原话。这些不得进入 V1 正文。
- Perplexity 侧无独立信源:
perplexity.ai/hub直连 403,r.jina.ai 403,archive.org 快照为 JS 空壳。条目中所有 Perplexity 内容都只有 OpenAI 的转述。 - Perplexity 客户故事页日期异常(页面标注 9-14,实际 9-12 已可读,相差约 32 小时)。成因未定。
- 未被验证的「另一个千年问题」。OpenAI 称在 Navier–Stokes 之后「在另一个千年问题上取得实质进展」,但未说明是哪个。《The Verge》提到社交媒体上有 Hodge 猜想的未经证实猜测。推测-待确认。
- 本报告未覆盖:OpenAI Astra 系统卡(system card)、安全概览页、Path to Astra 页 —— 三者在本次抓取中均返回 403 空壳(9,969 / 10,035 / 9,972 字节),r.jina.ai 代理亦 403。系统卡可能包含 FrontierMath 评测条件的正式说明,是后续补齐的首选目标。
五、行业影响研判
以下为
[推断],非事实陈述。
- 基准竞赛的「终点线」正被系统性后移。Tier 4 从 5% 到 98% 只用了 14 个月;但同一个 Epoch 在同一个月就推出了 68 题的 Erdős 集,而 Astra 在那里只有 3%。这说明「饱和」不是能力见顶,而是旧标尺失效。任何以「某基准被刷穿」为标题的报道,都必须同时说清「下一根标尺在哪里、成绩如何」,否则只传播了一半信息。
- 评估范式正在从「答案对不对」转向「证明能不能被机器检查」。Erdős 集用 Lean + Comparator 把证明核验变成程序判定,绕开了人工同行评议的成本瓶颈。代价是把形式化负担压给 AI(18 页证明 → 120 万行 Lean)。这条路线如果跑通,会反过来重塑数学论文的生产方式。
- 「厂商单方口径」仍是企业 AI 案例的通病。两条案例通篇零量化,这在幸知日报里应作为元信息呈现:不是「Astra 让 Devin 快了 X%」,而是「OpenAI 用两条客户故事证明 Astra 进了生产工作流,但客户双方都没有给出可核验的数字」。读者需要知道这一层。
- 信任赤字正在成为 AI 数学进展的主要成本项。Leiden 宣言(IMU 背书)、25 位菲尔兹奖得主的另一份宣言、Caltech 赞助撤回、以及 Buckmaster/Thom 的署名与数据来源质疑,共同构成一条「能力越强、合法性越受质疑」的曲线。OpenAI 在 Navier–Stokes 帖里专门加了「Concurrent work」节和 9-10 更新,本身就是对这种压力的让步。
- Astra 不是 OpenAI 的天花板。官方自陈内部有「显著强于 Astra」的模型在训练中。这意味着已公布的 97.6% 与「饱和」叙事,在下一个模型发布时会被整体重刷;同样的评测体系会再次面临标尺失效。对幸知日报的启示:跟踪「基准饱和」类新闻时,应把「基准方是否已备好下一层」作为固定追问项。
- 信息披露的通道差异值得单独记一笔。本次研究中最硬的两条一手证据,一条来自官方发布页(OpenAI 的 97.6% 表格),另一条来自官方社交账号(Epoch 的饱和结论,官网
latest列表里没有对应博文)。做信源核查时,官方博客列表不等于官方表态的全部;机构社交账号是必须扫的通道。
六、断言清单(Assertion Ledger)
| # | 断言 | 有一手信源 | 信源 URL | 置信度 |
|---|---|---|---|---|
| 1 | FrontierMath 由 Epoch AI 发布,含 Tiers 1-4、Open Problems、FrontierMath Erdős 三部分 | ✅ | https://epoch.ai/frontiermath | [事实] |
| 2 | Tiers 1-3 为本科到高年级研究生难度,Tier 4 为研究级数学 | ✅ | https://epoch.ai/frontiermath | [事实] |
| 3 | v2 全库 338 题 = 295(T1-3)+ 43(T4);公开 12 题 | ✅ | https://epoch.ai/benchmarks/frontiermath-tier-4-v2 | [事实] |
| 4 | FrontierMath 由 OpenAI 出资委托出题;OpenAI 对 Tier 4 v1 的 50 题有 30 题访问权,20 题扣留 | ✅ | https://epoch.ai/frontiermath/tiers-1-4/about | [事实] |
| 5 | 评测条件:提交 Python answer() 函数、可用 python 工具、100 万 token 硬上限、660k 强制提交、答案函数 30 秒上限 | ✅ | https://epoch.ai/benchmarks/frontiermath-tier-4-v2 | [事实] |
| 6 | Tier 4 于 2025-07-11 上线,当时最高分 5% | ✅ | Epoch 官方 Bluesky https://bsky.app/profile/epochai.bsky.social | [事实] |
| 7 | Epoch AI 官方认定 FrontierMath Tier 4 已饱和(2026-09-10) | ✅ | 同上 | [事实] |
| 8 | Tier 4 每道题都已被 AI 解出,最后一道由 GPT-6 Astra 解出,该题作者为 Jay Pantone | ✅ | 同上 | [事实] |
| 9 | OpenAI 官方发布页称 Astra「saturates FrontierMath Tier 4 with a 98% score」 | ✅ | https://openai.com/index/gpt-6-astra | [事实] |
| 10 | OpenAI 官方表给出 FrontierMath Tier 4 (v2):Astra 97.6%、Sol 83.0%、Fable 5.1 87.8%、Fable 5 90.2%、Opus 5 73.2% | ✅ | https://openai.com/index/gpt-6-astra | [事实] |
| 11 | 97.6% = 42/43 不成立,疑为多次运行均值或分母不同 | — | 算术推导 | [推断] |
| 12 | 97.6% 一行的评测执行方(Epoch 还是 OpenAI)未在页面标注 | ✅(作为「未标注」的事实) | https://openai.com/index/gpt-6-astra | [事实](缺标注)/结论 [待核实] |
| 13 | 第三方 BenchLM 榜单同样给出 Astra 97.600%,题量 43 | ✅ | https://benchlm.ai/benchmarks/frontiermathv2tier4 | [事实](该榜单自述);其完整性 [推断] 存疑 |
| 14 | v2(2026-06-12):Tier 4 修正 12 题、移除 7 题;Tiers 1-3 修正 123 题、移除 5 题 | ✅ | https://epoch.ai/benchmarks/frontiermath-tier-4-v2 | [事实] |
| 15 | FrontierMath Erdős = 68 题(65 个不同编号),Lean 4 + Mathlib,Comparator 验证,每题 $300 / 72 小时 / 一次尝试 | ✅ | https://epoch.ai/benchmarks/frontiermath-erdos | [事实] |
| 16 | 首轮:GPT-6 Astra(预发布)3%(2/68),其余四个模型 0% | ✅ | https://epoch.ai/latest/announcing-frontiermath-erdos | [事实] |
| 17 | 追加非系统尝试下 Astra 共解出 5/68,总花费 >22 万美元 | ✅ | 同上 | [事实] |
| 18 | FrontierMath Open Problems 已扩至 50 题,AI 已解 3 题 | ✅ | https://epoch.ai/data/ai-benchmarking-dashboard | [事实] |
| 19 | Epoch ECI 榜首(167)为 GPT-6 Astra,更新于 2026-09-12 | ✅ | https://epoch.ai/data/ai-benchmarking-dashboard | [事实] |
| 20 | GPT-6 Astra 于 2026-09-03 发布;API id gpt-6-astra;$10/$50 每百万 token | ✅ | https://openai.com/index/gpt-6-astra + OpenAI RSS https://openai.com/news/rss.xml | [事实] |
| 21 | Astra 是首个达到 OpenAI Preparedness Framework「Critical」网络安全阈值的模型 | ✅ | https://openai.com/index/gpt-6-astra | [事实] |
| 22 | OpenAI 内部有「显著强于 Astra」的模型;Astra 非其最强 | ✅ | https://openai.com/index/navier-stokes-solution | [事实] |
| 23 | Cognition 把 Astra 用于 Devin 云端 agent、CLI、桌面端;示例为测 iPhone 游戏 Otter Run 并回传模拟器录像 + 报告 | ✅ | https://openai.com/index/cognition-devin-testing-with-astra | [事实] |
| 24 | Cognition 案例无任何量化效果数字;仅有定性表述 | ✅ | 同上 | [事实] |
| 25 | Cognition 官方博客称 Fusion harness 对 Fable 与 Astra「up to 39% more efficient」 | ✅ | https://cognition.ai/blog | [事实](厂商自述) |
| 26 | Perplexity 用 Astra 撰写沟通内容、改动真实系统、监控生产软件;用其扮演外部服务做端到端测试 | ✅(OpenAI 转述) | https://openai.com/index/perplexity-improving-accuracy-with-astra | [事实](OpenAI 口径) |
| 27 | Perplexity 案例无任何量化效果数字 | ✅ | 同上 | [事实] |
| 28 | Perplexity 一手信源(自家博客)本次未取到(403 / 快照为 JS 空壳) | ✅(作为过程事实) | https://www.perplexity.ai/hub/blog(403) | [事实](受阻)/内容 [待核实] |
| 29 | 两条企业案例均为厂商单方口径,无第三方验证 | ✅(未找到反证) | — | [事实](本次检索范围内) |
| 30 | Perplexity 案例页标注 2026-09-14,但 2026-09-12 16:2x UTC 已可全文访问,相差约 32 小时 | ✅ | https://openai.com/index/perplexity-improving-accuracy-with-astra + RSS pubDate | [事实] |
| 31 | 该日期异常的成因(定时发布提前上线 / CMS 日期) | — | — | [推测-待确认] |
| 32 | 本机时钟准确(与 cloudflare.com、epoch.ai 的 HTTP Date 一致) | ✅ | HTTP Date 响应头 | [事实] |
| 33 | OpenAI 于 2026-09-08 发布 Navier–Stokes 证明文稿 + Lean 形式化,声称解决命题 C(及 D) | ✅ | https://openai.com/index/navier-stokes-solution | [事实] |
| 34 | 该成果用约 10,000 并发智能体、88 小时;Lean 验证额外 17 小时(用 Astra) | ✅ | 同上 | [事实] |
| 35 | 资源自述:全程 4.9M 消息 / 约 3000 亿输出 token;N-S 单项 2.7M 消息 / 约 1300 亿 token | ✅ | 同上 | [事实] |
| 36 | OpenAI 明确表示不申领千年大奖 | ✅ | 同上 | [事实] |
| 37 | Clay 千年问题索引页当前未把 Navier–Stokes 列入「未解决」清单,也未列入「已解决」 | ✅ | https://www.claymath.org/millennium-problems/ | [事实](页面内容)/解读 [推断] |
| 38 | Clay 规则要求发表满两年且获得数学界普遍接受 | ✅(媒体转述) | https://www.theverge.com/ai-artificial-intelligence/994255/… | [事实](媒体转述) |
| 39 | 无证据表明该结果经过期刊同行评审 | ✅(未找到反证) | — | [事实](本次检索范围内) |
| 40 | OpenAI 发言人否认 Buckmaster 的 Codex 提示影响了系统;OpenAI 官网 9-10 更新同结论 | ✅(官网)/媒体转述(发言人) | https://openai.com/index/navier-stokes-solution + The Verge | [事实] |
| 41 | OpenAI 承认 Alpöge / Buckmaster 在有外力 Euler 问题上的优先权 | ✅ | https://openai.com/index/navier-stokes-solution | [事实] |
| 42 | OpenAI 称已在「另一个千年问题」上取得实质进展,但未说明是哪个 | ✅(媒体转述) | The Verge | [事实](转述)/具体问题 [推测-待确认] |
| 43 | Leiden 宣言 2026-06-08 发布,16 位学者起草,获 IMU 背书,一周 2,000 签名 | ✅ | https://www.wadham.ox.ac.uk/news/the-leiden-declaration-on-artificial-intelligence-and-mathematics-is-published | [事实] |
| 44 | mathandai.org 宣言署名含 25 位菲尔兹奖得主(逐一点数) | ✅ | https://mathandai.org/ | [事实] |
| 45 | mathandai.org 宣言与 Leiden 宣言是两份不同文件 | ✅ | 两份源页面 | [事实] |
| 46 | OpenAI 撤回了加州理工本科数学黑客松赞助 | ✅(媒体转述) | The Verge | [事实](转述) |
| 47 | 量子位称 FrontierMath 首发于 2024-11-07 | ❌ | — | [待核实](Epoch 版本表最早为 2024-10-22) |
| 48 | 量子位称发布之初「累计仅 3 题曾被解出」 | ❌ | — | [待核实] |
| 49 | 量子位称陶哲轩等菲尔兹奖得主参与出题、并称「Tier 3 还能卡几年」 | ❌ | — | [待核实] |
| 50 | 量子位引「有些题可能几十年不会被 AI 解决」 | ❌ | — | [待核实] |
| 51 | 量子位引 Jay Pantone 称「AI 这次解法和自己相当接近」 | ❌(Epoch 官方帖只说「这次没有意外捷径」) | — | [待核实] |
待核实项追踪过程留痕(对应第 47–51 条):已读 Epoch 官方 frontiermath/tiers-1-4/about 版本表(列出 FrontierMath_10-22-24 起的 6 个版本,无 11-07)、frontiermath-tier-4-v2 全文(changelog 与 methodology)、frontiermath 总览页、announcing-frontiermath-erdos 全文、Epoch Bluesky 2026-09 全部帖文(60 条 feed 中筛 9-08 起);未找到上述四项的一手源。
七、信源清单
一手源(本次实际打开并落盘)
| 机构 | 页面 | URL | 抓取状态 |
|---|---|---|---|
| OpenAI | GPT-6 Astra: A new generation of intelligence(发布页,含 97.6% 评测表) | https://openai.com/index/gpt-6-astra | ✅ 2,717,375 字节(首次 403 空壳,加 Accept/Referer/--compressed 后成功) |
| OpenAI | GPT-6 Astra: The next generation in intelligence for work | https://openai.com/index/gpt-6-astra-next-generation-work | ✅ 657,528 字节 |
| OpenAI | Cognition helps Devin test its own work with GPT-6 Astra | https://openai.com/index/cognition-devin-testing-with-astra | ✅ 365,943 字节 |
| OpenAI | Perplexity trusts GPT-6 Astra with end-to-end systems | https://openai.com/index/perplexity-improving-accuracy-with-astra | ✅ 353,710 字节(页面标注 9-14) |
| OpenAI | On the Navier–Stokes Millennium Prize Problem | https://openai.com/index/navier-stokes-solution | ✅ 426,187 字节 |
| OpenAI | Ten advances in mathematics | https://openai.com/index/ten-advances-in-mathematics | ✅ 554,698 字节 |
| OpenAI | 官方新闻 RSS(1,192 条 item,含 pubDate 与链接) | https://openai.com/news/rss.xml | ✅ 724,821 字节 |
| Epoch AI | FrontierMath 总览 | https://epoch.ai/frontiermath | ✅ 70,339 字节 |
| Epoch AI | FrontierMath Tier 4 (v2)(methodology / changelog / 引用) | https://epoch.ai/benchmarks/frontiermath-tier-4-v2 | ✅ 99,615 字节 |
| Epoch AI | FrontierMath Tiers 1-4 冲突声明与版本表 | https://epoch.ai/frontiermath/tiers-1-4/about | ✅ 110,482 字节 |
| Epoch AI | FrontierMath Erdős | https://epoch.ai/benchmarks/frontiermath-erdos | ✅ 99,412 字节 |
| Epoch AI | 公告:Announcing FrontierMath Erdős(含首轮成绩表) | https://epoch.ai/latest/announcing-frontiermath-erdos | ✅ 127,785 字节 |
| Epoch AI | 基准与能力数据中枢(ECI / 最新动态) | https://epoch.ai/data/ai-benchmarking-dashboard | ✅ 129,270 字节 |
| Epoch AI | 官方 Bluesky 账号(饱和结论原始出处) | https://bsky.app/profile/epochai.bsky.social | ✅ 经公共 API getAuthorFeed 直读 |
| Clay 数学研究所 | 千年问题索引 | https://www.claymath.org/millennium-problems/ | ✅ 88,028 字节 |
| Clay 数学研究所 | Navier–Stokes 问题页 | https://www.claymath.org/millennium/navier-stokes-equation/ | ✅ 108,381 字节 |
| Cognition | 官方博客(含 2026-09-11 Fusion 帖) | https://cognition.ai/blog | ✅ 335,903 字节 |
| Math and AI | 《A Severe Misalignment of AI in Mathematics》宣言 | https://mathandai.org/ | ✅ 9,058 字节 |
| Wadham College | Leiden 宣言发布通稿 | https://www.wadham.ox.ac.uk/news/the-leiden-declaration-on-artificial-intelligence-and-mathematics-is-published | ✅ 104,597 字节 |
权威媒体(作交叉与转述)
| 机构 | 页面 | URL |
|---|---|---|
| The Verge | OpenAI just wants to win(Robert Hart,2026-09-12 11:00 UTC,引用 12+ 位数学家) | https://www.theverge.com/ai-artificial-intelligence/994255/openai-millennium-prize-problem-tristan-buckmaster-competition |
第三方聚合(仅作弱交叉,不作依据)
| 机构 | 页面 | URL | 备注 |
|---|---|---|---|
| BenchLM.ai | FrontierMath v2 (Tier 4) Leaderboard | https://benchlm.ai/benchmarks/frontiermathv2tier4 | 缺 Claude Fable 5/5.1/Opus 5,完整性存疑 |
中文转述(仅作线索,不得作为 V1 依据)
| 机构 | 页面 | URL |
|---|---|---|
| 量子位 | AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4(2026-09-12 15:33) | https://www.qbitai.com/2026/09/487701.html |
通道受阻记录(如实登记,未假装读到)
| 页面 | 受阻情况 | 已尝试通道 |
|---|---|---|
| OpenAI 《Safety overview: GPT-6 Astra》 | 403,10,035 字节空壳 | curl 直连 ×2、r.jina.ai(403)、archive.org(429) |
| OpenAI 《Path to Astra》 | 403,9,972 字节空壳 | curl 直连、r.jina.ai(403) |
OpenAI 新闻索引页 openai.com/news/ | 9,908 字节无正文壳 | curl 直连(改从官方 RSS 取列表替代) |
| OpenAI Astra 系统卡(发布页内链) | 未定位到独立 URL;链接为页内锚点,PDF 未取到 | 已检索发布页 HTML 内全部 pdf / system-card 链接 |
| Perplexity 官方博客 | 403(5,588 / 5,624 字节) | curl 直连 ×2、r.jina.ai(403)、archive.org 快照(JS 空壳 4,075 字符) |
| r.jina.ai 代理 | 本次全局 403(疑似需 API key),作为降级通道失效 | — |
archive.org wayback/available API | 429 Too Many Requests(连环限流) | 改用 web.archive.org/web/2026id_/ 直取(成功,2,717,375 字节对照件已落盘) |
素材落盘位置:tmp/swarm-materials/astra-2026-09-13/(60 个文件:.html 原始 + .txt 清洗文本 + _extract.py;另有 jina-*.txt 为代理失败回执、wayback-*.html 为存档对照件)。
八、给幸知日报编辑的直接建议
- 标题不要用「刷穿」,用「基准方宣布饱和」——因为「饱和」是 Epoch AI 的原话与主动判断,而「刷穿」隐含单次全对,与 97.6% 的实际数字有出入。
- 必须同框给出的三个数字:Tier 4(v2)43 题、Astra 97.6%、Erdős 68 题中只解 2 题(3%)。只给前两个会误导读者以为「数学被解决了」。
- 必须带的 caveat:FrontierMath 由 OpenAI 出资委托出题,OpenAI 对 Tier 4 v1 的 30/50 题有访问权。
- 企业案例表述:写「OpenAI 发布两条客户故事,Cognition 与 Perplexity 的高管以定性语言描述 Astra 进入其生产工作流」,不要编造任何百分比。
- Perplexity 案例的日期:官方标 9-14,实际 9-12 已可访问,建议在条目里注明这一点或干脆等 9-14 再引。
- 纳维-斯托克斯:可用「OpenAI 已发布证明 + Lean 形式化,明确不申领 Clay 奖;Clay 官方清单已不再把它列为未解决,但也未宣布解决」——这个「两头不靠」的状态本身就是最好的新闻点。