幸知日报
← 返回 2026-06-23 日报
关注

VibeThinker:3B 模型在推理上击败 Opus 4.5

HN 出现一篇 arXiv 论文,主打 SFT+GRPO 训练流程的小模型在多项推理任务上反超大模型 - arXiv 论文