Mostik「模型桥」声明证据档位核查报告
任务定位:对 2026-09-08 幸知日报 V2 条目「Mostik 模型桥」做证据链深调,判定「ARC-AGI 3 达 GPT-6 Astra 量级」在三档(官方榜确认 / 团队自述 / 纯转述)中的真实档位。调研时间 2026-09-08。原始素材存 tmp/swarm-materials/mostik-brid
幸知 调研报告 调研
#AGI#算力#Mostik#ARC#GPT#Astra
任务定位:对 2026-09-08 幸知日报 V2 条目「Mostik 模型桥」做证据链深调,判定「ARC-AGI 3 达 GPT-6 Astra 量级」在三档(官方榜确认 / 团队自述 / 纯转述)中的真实档位。调研时间 2026-09-08。原始素材存tmp/swarm-materials/mostik-bridge/(34 个文件,含官方榜数据、自述全文、连线正文)。
一、声明还原
先分清「谁在哪一层说了什么」,这是后面判档的基础:
| 层 | 声明内容 | 出处 |
|---|---|---|
| 团队(CEO 长帖,2026-09-02) | 「first place on the ARC-AGI leaderboard」——未指明 v3 还是综合榜,并明言「比赛还在跑,不能多说」;技术口径:753B 模型读题 + 4B 模型作答,「成绩达前沿模型 80%,快 20 倍」 [事实] | X 帖,见信源 1 |
| 团队(官网长文) | 桥关闭大小模型差距的 50%,自身准确率 +25%,难子集提升 2 倍,比部署中等模型省 2.5 倍算力;全文未提 ARC-AGI、未提任何榜单 [事实] | mostik.ai/read-more,见信源 2 |
| 独立媒体(连线,2026-09-02) | 「已经冲上 ARC-AGI 3 榜首……(他们不肯多说,因为想赢下比赛)」——记者转述团队自述,另附前 DeepMind 研究员 Karl Tuyls 的正面评价 [事实] | 连线报道,见信源 3 |
| 中文媒体(量子位,2026-09-07) | 标题「4B 手机 Qwen+云端 GLM 刷爆 ARC-AGI 3」,正文「ARC-AGI 3 达 GPT-6 Astra 量级」「大模型侧推理成本约 1/20」——转述+强化(把团队口径的「80% 达前沿」改写成「GPT-6 Astra 量级」) [事实] | 见信源 4 |
数字口径辨析 [事实]:CEO 帖「80% as accurate + 20x faster」与官网长文「关闭 50% 差距 / +25% / 省 2.5 倍」是同一实验的两种表述(关闭 50% 差距 ≈ 达到前沿 80% 的另一种说法);量子位的「1/20」对应帖子的「20x faster」、「五分之二」对应官网的「省 2.5 倍」。三处互洽,但全部出自团队单方口径。
二、官方榜核查(最硬一环)
结论:ARC-AGI-3 官方榜无任何 Mostik 或「Qwen+GLM 组合」条目。 [事实]
核查方法与证据(全部直开抓取,素材已存档):
- 榜数据定义文件(
https://arcprize.org/scripts/leaderboard/data.js):定义三个半私榜版本。其中v3_Semi_Private(即 ARC-AGI-3 榜)只含 6 个模型标识:openai-gpt-5-6-sol、openai-gpt-5-6-terra、openai-gpt-5-6-luna、anthropic-claude-opus-5、openai-gpt-6-astra、openai-gpt-6-astra-provider-adapter——无 Mostik、无 Qwen、无 GLM。[事实] - 实际评测数据(
https://arcprize.org/media/data/leaderboard/v3.json):共 40 条评测记录,全部属于 OpenAI、Anthropic、xAI、Google 四家。最高分openai-gpt-6-astra-max-provider-adapter0.9855;无工具适配口径的openai-gpt-6-astra-max0.6271;非 OpenAI 最好成绩anthropic-claude-opus-5-high0.3016。[事实] - 全量关键词检索:官方全部数据文件(models.json 约 11 万字节、evaluations.json 约 18 万字节、v1/v2/v3 榜单、providers.json)中
mostik/malysheva/smirnov/bridge命中数均为 0。[事实] - 对照组成立性:
openai-gpt-6-astra确在官方榜(v3),量子位「GPT-6 Astra 量级」的对照物真实存在——但 Mostik 组合自身没有任何官方记录可与之对照。[事实] - 补充:官方数据里 qwen/glm 有命中,但均为阿里/智谱单体模型(
qwen3-235b-a22b-instruct-2507、glm-5、glm-5.2,来自 Alibaba 与 Z.ai 两家供应商),且评测记录全部在 v1/v2(ARC-AGI-1/2),v3 零条目。这说明单体模型经官方半私评测提交的通路存在且被用过,而 Mostik 组合没有走这条通路。[事实] - ARC-AGI-3 专属榜页(
/arc-agi/3/leaderboard)与社区榜页(/leaderboard/community)静态内容同样无 Mostik 字样。[事实]
Kaggle 竞赛榜:待核实 [推测-待确认]。竞赛页 https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-3/leaderboard 存在(标题「ARC Prize 2026 - ARC-AGI-3」),但返回 5550 字节的脚本壳页,榜单数据由前端渲染,无凭据无法拉取竞赛榜 JSON——「第一名」声明无法在 Kaggle 通路上证实或证伪。追踪过程:直开页面→壳页(0 命中);无账号凭据,未用 API。ARC Prize 的惯例是 Kaggle 竞赛榜与官网半私榜分离、赛后才合并收录,因此「在 Kaggle 竞赛榜领先但不出现在官网半私榜」逻辑上自洽。[推断]
三、一手源追踪(全程记录,含失败)
已定位并验证的一手源:
| 一手源 | 验证方式 | 结果 |
|---|---|---|
| CEO 帖(Sasha Malysheva,2026-09-02) | X 官方嵌入接口 + 第三方镜像接口双通道抓取 | 全文到手;2402 赞、256 转;帖内链接官方账号 @mostik_ai 与连线报道 [事实] |
| 团队官网 mostik.ai(含长文 read-more) | 直开抓取全文 | 真实站点;自述 15 人(12 博士 + 1 位菲尔兹奖得主)、成立 4 个月;投资方 General Catalyst、Foundation Capital;长文不含 ARC-AGI 与榜单字样(此前检索到的 10 处「ARC」全是 search/research 的字母巧合,已排除)[事实] |
| Stanislav Smirnov 日内瓦大学个人页 | 直开抓取 | 真实存在(数学系教授、地址邮箱齐全);页面无任何 Mostik/AI 内容(2011 年版式的纯数学主页);其「合适的数学语言还不存在」等表态出自连线对他的直接采访 [事实] |
| 论文引用核验 | arXiv 官方接口逐条验证 | 自述引用的 5 篇文献全部真实存在(详见第四节)[事实] |
未能定位的(如实记录追踪过程):
- arXiv 论文:官方接口检索
all:"Mostik"命中 0 篇;"Stanislav Smirnov" AND cat:cs.LG命中 0 篇——无对应论文发表 [事实] - 代码托管组织:
github.com/mostik-ai、github.com/mostik均返回 404——无公开组织 [事实] - X 帖直达通道:r.jina.ai 代理对 X 域名返回 403;线程阅读器未收录该帖(空壳);两个尼特镜像(xcancel、nitter.net)均为壳页无帖文——最终改经 X 官方嵌入接口拿到全文 [追踪过程记录]
- 搜索引擎交叉检索:必应结果页在此环境仅返回重定向样式页,无有机结果,未能用于发现更多第三方报道 [追踪过程记录]
独立第三方信源(连线报道)核验细节: 作者 Maxwell Zeff,发布 2026-09-02 14:20(美东),标题《这些俄罗斯数学家教会 AI 模型不用语言互相交流》。文中 Malysheva 与 Smirnov 均为直接受访者(“told me over coffee”),并引入独立评论人 Karl Tuyls(前 DeepMind)。连线报道的是团队的自述与访谈,未提供榜单独立复核——文中没有任何「ARC Prize 官方证实」的表述 [事实]。
四、技术合理性对照
Mostik 的核心声明拆成两层,与已知研究的距离不同:
第一层:「内部状态里有未说出口的信息」——有坚实研究基础。 自述引用的五篇文献经 arXiv 接口逐一验证真实且引用准确:
- Hanna & Ameisen《Latent Planning Emerges with Scale》(ICLR 2026,arXiv:2604.12493):Qwen-3 系列在写出「accountant」前多个 token 已携带其表征,且随规模增强——与官网引用逐字吻合 [事实]
- Huh 等《The Platonic Representation Hypothesis》(arXiv:2405.07987):不同模型表征正在趋同,指向共享统计模型 [事实]
- Lester 等《The Power of Scale for Parameter-Efficient Prompt Tuning》(arXiv:2104.08691):软提示可注入冻结模型 [事实]
- Zou 等《Representation Engineering》(arXiv:2310.01405):单模型内部表征可读出与操控 [事实]
- Korbak 等《Chain of Thought Monitorability》(arXiv:2507.11473):思维链监控有漏报 [事实]
第二层:「跨异构模型(GLM-5.2 ↔ Qwen-3.5,双方冻结、互不微调)经一个训练的小桥直接传递内部状态,关闭 50% 差距」——无公开研究支撑,属未验证声明。 [推断]
与已有研究的距离:软提示与激活工程(如上 3、4)都只在单个模型内部注入或读出连续向量;表征趋同研究(上 2)只说结构在靠近、不等于可零训练成本直通——映射本身仍需学习,这正是 Mostik 说「桥是被训练的部分」的立足点。方向上自洽(桥的存在性有理论依托),但「这一步已经做成且数字如此之好」只有团队单方实验,无论文、无代码、无第三方复现。[推断]
合理性小结:声明不是民科式空想(引用文献真实且贴切、机制设计与预填充便宜/解码昂贵的工程事实吻合),而是「有研究基础的未验证工程声明」——可信度高于纯空想,低于已验证成果。
五、三档判定
判定:档② 团队自述(上限档②,未达档①,已排除档③)。
- 档①官方榜确认:不成立。 官方半私榜 v3 全量数据(40 条评测、6 个模型标识)无 Mostik 或 Qwen+GLM 组合;
mostik等关键词在官方全量数据命中为 0。[事实] - 档③纯转述:排除。 一手自述已定位——CEO 帖全文(官方嵌入接口)、官网长文全文(直开)双源到手,团队与人物身份可验证(Smirnov 日内瓦主页、连线直接采访)。[事实]
- 档②团队自述:成立。 自述真实存在且被独立媒体(连线)以访谈形式转述。但注意三点张力:其一,「first place on the ARC-AGI leaderboard」与官方榜无条目矛盾,最可能解释是「第一名」指仍进行中的 Kaggle 竞赛榜(无法核验)[推测-待确认];其二,官网长文刻意不提榜单,榜单声明只出现在社媒帖与媒体转述里 [事实];其三,全部成绩数字(80%/25%/50%/2x/2.5x/20x)均为团队单方口径,无论文无复现 [事实]。
- 对原条目的影响: 量子位「刷爆 ARC-AGI 3」「达 GPT-6 Astra 量级」是媒体对团队自述的强化转述——官方榜上既无该组合条目,也无可对照的分数记录。[事实] 条目本身(公司、团队、机制声明存在)为真;其成绩声明的档位应降格为「团队自述,官方榜未收录,待比赛结束后验证」。
六、建议回填(供主会话执行,本报告不改动卡片)
- 卡片末尾「ARC-AGI 3 官方榜单组合未独立核验(深调子代理在途)」→ 改为:「2026-09-08 官方榜核查完毕:arcprize.org 半私榜 v3 全量数据无 Mostik/Qwen+GLM 组合条目(40 条评测均为四家大厂模型);声明档位=团队自述(CEO 帖一手自述 + 连线独立访谈转述),官方榜未收录;『第一名』或指进行中的 Kaggle 竞赛榜,待核实」
- 「ARC-AGI 3 达 GPT-6 Astra 量级」处加注:此为量子位对团队「80% as accurate as frontier model」口径的转述强化,非官方榜记录;GPT-6 Astra(max 无适配 0.6271)确在官方榜可作对照。
- 「大模型侧推理成本约 1/20」处加注:出自 CEO 帖「20x faster performance」口径;官网另给出「比等效中等模型省 2.5 倍算力」,两者为不同对照基准的团队自述数字。
- 卡片可增补正向价值点:官网长文与五篇引用文献(arXiv:2604.12493、2405.07987、2104.08691、2310.01405、2507.11473)全部真实——技术叙事有研究基础,非空想。
- 关联卡「17比特通道-模型间信息瓶颈」的待确认项按上述 1-4 回填后可摘除「在途」标记。
七、断言清单(逐条 + 信源 + 链接)
| # | 断言 | 置信度 | 信源 | 链接 |
|---|---|---|---|---|
| 1 | 官方半私榜 v3(ARC-AGI-3)无 Mostik/Qwen+GLM 组合条目 | [事实] | 榜数据定义文件 + v3.json 全量 | https://arcprize.org/scripts/leaderboard/data.js 、https://arcprize.org/media/data/leaderboard/v3.json |
| 2 | GPT-6 Astra 在官方 v3 榜(max 0.6271,适配口径最高 0.9855) | [事实] | v3.json | https://arcprize.org/media/data/leaderboard/v3.json |
| 3 | CEO 帖真实存在且声称「first place on the ARC-AGI leaderboard」「80% 准确、快 20 倍」 | [事实] | X 官方嵌入接口全文 | https://x.com/aimalysheva/status/2095232794792255848 |
| 4 | 团队官网长文存在,含全部成绩数字但未提 ARC-AGI/榜单 | [事实] | 直开全文 | https://mostik.ai/read-more |
| 5 | 连线 2026-09-02 报道存在,直接采访 Malysheva 与 Smirnov,转述「冲上 ARC-AGI 3 榜首」为团队自述 | [事实] | 直开全文 | https://www.wired.com/story/russian-startup-mostik-ai-models-communication/ |
| 6 | Smirnov 为日内瓦大学教授(2010 菲尔兹奖得主);其大学主页无 Mostik 相关内容 | [事实] | 日内瓦大学个人页 + 连线访谈 | https://www.unige.ch/~smirnov/ |
| 7 | 团队投资方为 General Catalyst、Foundation Capital | [事实](自述口径) | 官网长文 + CEO 帖 | https://mostik.ai/read-more |
| 8 | arXiv 无 Mostik 署名或相关论文;GitHub 无 mostik 公开组织 | [事实] | arXiv 官方接口 0 命中;组织页 404 | http://export.arxiv.org/api/query?search_query=all:%22Mostik%22 |
| 9 | 官方数据中 Qwen/GLM 单体模型仅出现在 v1/v2,v3 零条目 | [事实] | models.json + evaluations.json | https://arcprize.org/leaderboard |
| 10 | 「第一名」指 Kaggle 竞赛榜(进行中、未合并官网) | [推测-待确认] | 仅逻辑自洽,Kaggle 榜无法核验 | https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-3/leaderboard |
| 11 | 自述五篇引用文献全部真实存在 | [事实] | arXiv 接口逐条验证 | arXiv:2604.12493、2405.07987、2104.08691、2310.01405、2507.11473 |
| 12 | 成绩数字(25%/50%/2x/2.5x/20x)无第三方复现 | [事实](无复现源) | 全源检索无果 | — |
| 13 | 量子位表述为团队自述的强化转述 | [事实] | 量子位原文(主会话已直开)+ 本报告对照 | https://www.qbitai.com/2026/09/485108.html |
八、信源清单
官方一手: ARC Prize 榜单页与数据文件(信源清单第 1、2、9 行链接);X 官方嵌入接口(oembed,帖文全文);arXiv 官方接口(论文验证)。
团队一手: mostik.ai 官网及长文(信源 4);CEO X 帖(信源 3)。
独立第三方: 连线报道(Maxwell Zeff,信源 5);Smirnov 日内瓦大学个人页(信源 6)。
中文转述(基线,非判定依据): 量子位 2026-09-07 文(信源 13,主会话已直开核验)。
追踪未果记录: r.jina.ai 对 X 域 403;线程阅读器未收录;尼特镜像(xcancel、nitter.net)壳页;Kaggle 榜单脚本壳无法无凭据取数;GitHub 组织 404;必应有机结果不可用。素材全部存 tmp/swarm-materials/mostik-bridge/。