幸知日报
← 文章

Mostik「模型桥」声明证据档位核查报告

任务定位:对 2026-09-08 幸知日报 V2 条目「Mostik 模型桥」做证据链深调,判定「ARC-AGI 3 达 GPT-6 Astra 量级」在三档(官方榜确认 / 团队自述 / 纯转述)中的真实档位。调研时间 2026-09-08。原始素材存 tmp/swarm-materials/mostik-brid

幸知 调研报告 调研

#AGI#算力#Mostik#ARC#GPT#Astra

任务定位:对 2026-09-08 幸知日报 V2 条目「Mostik 模型桥」做证据链深调,判定「ARC-AGI 3 达 GPT-6 Astra 量级」在三档(官方榜确认 / 团队自述 / 纯转述)中的真实档位。调研时间 2026-09-08。原始素材存

任务定位:对 2026-09-08 幸知日报 V2 条目「Mostik 模型桥」做证据链深调,判定「ARC-AGI 3 达 GPT-6 Astra 量级」在三档(官方榜确认 / 团队自述 / 纯转述)中的真实档位。调研时间 2026-09-08。原始素材存tmp/swarm-materials/mostik-bridge/(34 个文件,含官方榜数据、自述全文、连线正文)。

一、声明还原

先分清「谁在哪一层说了什么」,这是后面判档的基础:

声明内容出处
团队(CEO 长帖,2026-09-02)「first place on the ARC-AGI leaderboard」——未指明 v3 还是综合榜,并明言「比赛还在跑,不能多说」;技术口径:753B 模型读题 + 4B 模型作答,「成绩达前沿模型 80%,快 20 倍」 [事实]X 帖,见信源 1
团队(官网长文)桥关闭大小模型差距的 50%,自身准确率 +25%,难子集提升 2 倍,比部署中等模型省 2.5 倍算力;全文未提 ARC-AGI、未提任何榜单 [事实]mostik.ai/read-more,见信源 2
独立媒体(连线,2026-09-02)「已经冲上 ARC-AGI 3 榜首……(他们不肯多说,因为想赢下比赛)」——记者转述团队自述,另附前 DeepMind 研究员 Karl Tuyls 的正面评价 [事实]连线报道,见信源 3
中文媒体(量子位,2026-09-07)标题「4B 手机 Qwen+云端 GLM 刷爆 ARC-AGI 3」,正文「ARC-AGI 3 达 GPT-6 Astra 量级」「大模型侧推理成本约 1/20」——转述+强化(把团队口径的「80% 达前沿」改写成「GPT-6 Astra 量级」) [事实]见信源 4

数字口径辨析 [事实]:CEO 帖「80% as accurate + 20x faster」与官网长文「关闭 50% 差距 / +25% / 省 2.5 倍」是同一实验的两种表述(关闭 50% 差距 ≈ 达到前沿 80% 的另一种说法);量子位的「1/20」对应帖子的「20x faster」、「五分之二」对应官网的「省 2.5 倍」。三处互洽,但全部出自团队单方口径。

二、官方榜核查(最硬一环)

结论:ARC-AGI-3 官方榜无任何 Mostik 或「Qwen+GLM 组合」条目。 [事实]

核查方法与证据(全部直开抓取,素材已存档):

  1. 榜数据定义文件https://arcprize.org/scripts/leaderboard/data.js):定义三个半私榜版本。其中 v3_Semi_Private(即 ARC-AGI-3 榜)只含 6 个模型标识:openai-gpt-5-6-solopenai-gpt-5-6-terraopenai-gpt-5-6-lunaanthropic-claude-opus-5openai-gpt-6-astraopenai-gpt-6-astra-provider-adapter——无 Mostik、无 Qwen、无 GLM。[事实]
  2. 实际评测数据https://arcprize.org/media/data/leaderboard/v3.json):共 40 条评测记录,全部属于 OpenAI、Anthropic、xAI、Google 四家。最高分 openai-gpt-6-astra-max-provider-adapter 0.9855;无工具适配口径的 openai-gpt-6-astra-max 0.6271;非 OpenAI 最好成绩 anthropic-claude-opus-5-high 0.3016。[事实]
  3. 全量关键词检索:官方全部数据文件(models.json 约 11 万字节、evaluations.json 约 18 万字节、v1/v2/v3 榜单、providers.json)中 mostik/malysheva/smirnov/bridge 命中数均为 0。[事实]
  4. 对照组成立性openai-gpt-6-astra 确在官方榜(v3),量子位「GPT-6 Astra 量级」的对照物真实存在——但 Mostik 组合自身没有任何官方记录可与之对照。[事实]
  5. 补充:官方数据里 qwen/glm 有命中,但均为阿里/智谱单体模型qwen3-235b-a22b-instruct-2507glm-5glm-5.2,来自 Alibaba 与 Z.ai 两家供应商),且评测记录全部在 v1/v2(ARC-AGI-1/2),v3 零条目。这说明单体模型经官方半私评测提交的通路存在且被用过,而 Mostik 组合没有走这条通路。[事实]
  6. ARC-AGI-3 专属榜页(/arc-agi/3/leaderboard)与社区榜页(/leaderboard/community)静态内容同样无 Mostik 字样。[事实]

Kaggle 竞赛榜:待核实 [推测-待确认]。竞赛页 https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-3/leaderboard 存在(标题「ARC Prize 2026 - ARC-AGI-3」),但返回 5550 字节的脚本壳页,榜单数据由前端渲染,无凭据无法拉取竞赛榜 JSON——「第一名」声明无法在 Kaggle 通路上证实或证伪。追踪过程:直开页面→壳页(0 命中);无账号凭据,未用 API。ARC Prize 的惯例是 Kaggle 竞赛榜与官网半私榜分离、赛后才合并收录,因此「在 Kaggle 竞赛榜领先但不出现在官网半私榜」逻辑上自洽。[推断]

三、一手源追踪(全程记录,含失败)

已定位并验证的一手源:

一手源验证方式结果
CEO 帖(Sasha Malysheva,2026-09-02)X 官方嵌入接口 + 第三方镜像接口双通道抓取全文到手;2402 赞、256 转;帖内链接官方账号 @mostik_ai 与连线报道 [事实]
团队官网 mostik.ai(含长文 read-more)直开抓取全文真实站点;自述 15 人(12 博士 + 1 位菲尔兹奖得主)、成立 4 个月;投资方 General Catalyst、Foundation Capital;长文不含 ARC-AGI 与榜单字样(此前检索到的 10 处「ARC」全是 search/research 的字母巧合,已排除)[事实]
Stanislav Smirnov 日内瓦大学个人页直开抓取真实存在(数学系教授、地址邮箱齐全);页面无任何 Mostik/AI 内容(2011 年版式的纯数学主页);其「合适的数学语言还不存在」等表态出自连线对他的直接采访 [事实]
论文引用核验arXiv 官方接口逐条验证自述引用的 5 篇文献全部真实存在(详见第四节)[事实]

未能定位的(如实记录追踪过程):

  • arXiv 论文:官方接口检索 all:"Mostik" 命中 0 篇;"Stanislav Smirnov" AND cat:cs.LG 命中 0 篇——无对应论文发表 [事实]
  • 代码托管组织:github.com/mostik-aigithub.com/mostik 均返回 404——无公开组织 [事实]
  • X 帖直达通道:r.jina.ai 代理对 X 域名返回 403;线程阅读器未收录该帖(空壳);两个尼特镜像(xcancel、nitter.net)均为壳页无帖文——最终改经 X 官方嵌入接口拿到全文 [追踪过程记录]
  • 搜索引擎交叉检索:必应结果页在此环境仅返回重定向样式页,无有机结果,未能用于发现更多第三方报道 [追踪过程记录]

独立第三方信源(连线报道)核验细节: 作者 Maxwell Zeff,发布 2026-09-02 14:20(美东),标题《这些俄罗斯数学家教会 AI 模型不用语言互相交流》。文中 Malysheva 与 Smirnov 均为直接受访者(“told me over coffee”),并引入独立评论人 Karl Tuyls(前 DeepMind)。连线报道的是团队的自述与访谈,未提供榜单独立复核——文中没有任何「ARC Prize 官方证实」的表述 [事实]。

四、技术合理性对照

Mostik 的核心声明拆成两层,与已知研究的距离不同:

第一层:「内部状态里有未说出口的信息」——有坚实研究基础。 自述引用的五篇文献经 arXiv 接口逐一验证真实且引用准确:

  1. Hanna & Ameisen《Latent Planning Emerges with Scale》(ICLR 2026,arXiv:2604.12493):Qwen-3 系列在写出「accountant」前多个 token 已携带其表征,且随规模增强——与官网引用逐字吻合 [事实]
  2. Huh 等《The Platonic Representation Hypothesis》(arXiv:2405.07987):不同模型表征正在趋同,指向共享统计模型 [事实]
  3. Lester 等《The Power of Scale for Parameter-Efficient Prompt Tuning》(arXiv:2104.08691):软提示可注入冻结模型 [事实]
  4. Zou 等《Representation Engineering》(arXiv:2310.01405):单模型内部表征可读出与操控 [事实]
  5. Korbak 等《Chain of Thought Monitorability》(arXiv:2507.11473):思维链监控有漏报 [事实]

第二层:「跨异构模型(GLM-5.2 ↔ Qwen-3.5,双方冻结、互不微调)经一个训练的小桥直接传递内部状态,关闭 50% 差距」——无公开研究支撑,属未验证声明。 [推断]

与已有研究的距离:软提示与激活工程(如上 3、4)都只在单个模型内部注入或读出连续向量;表征趋同研究(上 2)只说结构在靠近、不等于可零训练成本直通——映射本身仍需学习,这正是 Mostik 说「桥是被训练的部分」的立足点。方向上自洽(桥的存在性有理论依托),但「这一步已经做成且数字如此之好」只有团队单方实验,无论文、无代码、无第三方复现。[推断]

合理性小结:声明不是民科式空想(引用文献真实且贴切、机制设计与预填充便宜/解码昂贵的工程事实吻合),而是「有研究基础的未验证工程声明」——可信度高于纯空想,低于已验证成果。

合理性小结:声明不是民科式空想(引用文献真实且贴切、机制设计与预填充便宜/解码昂贵的工程事实吻合),而是「有研究基础的未验证工程声明」——可信度高于纯空想,低于已验证成果。

五、三档判定

判定:档② 团队自述(上限档②,未达档①,已排除档③)。

  • 档①官方榜确认:不成立。 官方半私榜 v3 全量数据(40 条评测、6 个模型标识)无 Mostik 或 Qwen+GLM 组合;mostik 等关键词在官方全量数据命中为 0。[事实]
  • 档③纯转述:排除。 一手自述已定位——CEO 帖全文(官方嵌入接口)、官网长文全文(直开)双源到手,团队与人物身份可验证(Smirnov 日内瓦主页、连线直接采访)。[事实]
  • 档②团队自述:成立。 自述真实存在且被独立媒体(连线)以访谈形式转述。但注意三点张力:其一,「first place on the ARC-AGI leaderboard」与官方榜无条目矛盾,最可能解释是「第一名」指仍进行中的 Kaggle 竞赛榜(无法核验)[推测-待确认];其二,官网长文刻意不提榜单,榜单声明只出现在社媒帖与媒体转述里 [事实];其三,全部成绩数字(80%/25%/50%/2x/2.5x/20x)均为团队单方口径,无论文无复现 [事实]。
  • 对原条目的影响: 量子位「刷爆 ARC-AGI 3」「达 GPT-6 Astra 量级」是媒体对团队自述的强化转述——官方榜上既无该组合条目,也无可对照的分数记录。[事实] 条目本身(公司、团队、机制声明存在)为真;其成绩声明的档位应降格为「团队自述,官方榜未收录,待比赛结束后验证」。

六、建议回填(供主会话执行,本报告不改动卡片)

  1. 卡片末尾「ARC-AGI 3 官方榜单组合未独立核验(深调子代理在途)」→ 改为:「2026-09-08 官方榜核查完毕:arcprize.org 半私榜 v3 全量数据无 Mostik/Qwen+GLM 组合条目(40 条评测均为四家大厂模型);声明档位=团队自述(CEO 帖一手自述 + 连线独立访谈转述),官方榜未收录;『第一名』或指进行中的 Kaggle 竞赛榜,待核实」
  2. 「ARC-AGI 3 达 GPT-6 Astra 量级」处加注:此为量子位对团队「80% as accurate as frontier model」口径的转述强化,非官方榜记录;GPT-6 Astra(max 无适配 0.6271)确在官方榜可作对照。
  3. 「大模型侧推理成本约 1/20」处加注:出自 CEO 帖「20x faster performance」口径;官网另给出「比等效中等模型省 2.5 倍算力」,两者为不同对照基准的团队自述数字。
  4. 卡片可增补正向价值点:官网长文与五篇引用文献(arXiv:2604.12493、2405.07987、2104.08691、2310.01405、2507.11473)全部真实——技术叙事有研究基础,非空想。
  5. 关联卡「17比特通道-模型间信息瓶颈」的待确认项按上述 1-4 回填后可摘除「在途」标记。

七、断言清单(逐条 + 信源 + 链接)

#断言置信度信源链接
1官方半私榜 v3(ARC-AGI-3)无 Mostik/Qwen+GLM 组合条目[事实]榜数据定义文件 + v3.json 全量https://arcprize.org/scripts/leaderboard/data.jshttps://arcprize.org/media/data/leaderboard/v3.json
2GPT-6 Astra 在官方 v3 榜(max 0.6271,适配口径最高 0.9855)[事实]v3.jsonhttps://arcprize.org/media/data/leaderboard/v3.json
3CEO 帖真实存在且声称「first place on the ARC-AGI leaderboard」「80% 准确、快 20 倍」[事实]X 官方嵌入接口全文https://x.com/aimalysheva/status/2095232794792255848
4团队官网长文存在,含全部成绩数字但未提 ARC-AGI/榜单[事实]直开全文https://mostik.ai/read-more
5连线 2026-09-02 报道存在,直接采访 Malysheva 与 Smirnov,转述「冲上 ARC-AGI 3 榜首」为团队自述[事实]直开全文https://www.wired.com/story/russian-startup-mostik-ai-models-communication/
6Smirnov 为日内瓦大学教授(2010 菲尔兹奖得主);其大学主页无 Mostik 相关内容[事实]日内瓦大学个人页 + 连线访谈https://www.unige.ch/~smirnov/
7团队投资方为 General Catalyst、Foundation Capital[事实](自述口径)官网长文 + CEO 帖https://mostik.ai/read-more
8arXiv 无 Mostik 署名或相关论文;GitHub 无 mostik 公开组织[事实]arXiv 官方接口 0 命中;组织页 404http://export.arxiv.org/api/query?search_query=all:%22Mostik%22
9官方数据中 Qwen/GLM 单体模型仅出现在 v1/v2,v3 零条目[事实]models.json + evaluations.jsonhttps://arcprize.org/leaderboard
10「第一名」指 Kaggle 竞赛榜(进行中、未合并官网)[推测-待确认]仅逻辑自洽,Kaggle 榜无法核验https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-3/leaderboard
11自述五篇引用文献全部真实存在[事实]arXiv 接口逐条验证arXiv:2604.12493、2405.07987、2104.08691、2310.01405、2507.11473
12成绩数字(25%/50%/2x/2.5x/20x)无第三方复现[事实](无复现源)全源检索无果
13量子位表述为团队自述的强化转述[事实]量子位原文(主会话已直开)+ 本报告对照https://www.qbitai.com/2026/09/485108.html

八、信源清单

官方一手: ARC Prize 榜单页与数据文件(信源清单第 1、2、9 行链接);X 官方嵌入接口(oembed,帖文全文);arXiv 官方接口(论文验证)。

团队一手: mostik.ai 官网及长文(信源 4);CEO X 帖(信源 3)。

独立第三方: 连线报道(Maxwell Zeff,信源 5);Smirnov 日内瓦大学个人页(信源 6)。

中文转述(基线,非判定依据): 量子位 2026-09-07 文(信源 13,主会话已直开核验)。

追踪未果记录: r.jina.ai 对 X 域 403;线程阅读器未收录;尼特镜像(xcancel、nitter.net)壳页;Kaggle 榜单脚本壳无法无凭据取数;GitHub 组织 404;必应有机结果不可用。素材全部存 tmp/swarm-materials/mostik-bridge/

更多文章 →