重大
美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
首个真实生活场景下面向长期动态用户建模的智能体评测基准:56 名真实特征用户、819 个复杂任务、2000+ 动态偏好、66 个可执行工具。平均用户交互周期 1580 天。关键发现: 1. 时间越长 AI 忘得越快——所有模型性能随时间衰减,记忆不是解药 2. 思考模式不帮助个性化——开启思考模式在个性化任务上不总是有帮助 3. AI 普遍缺乏主动沟通意愿——Claude 家族主动性任务得分从 46.0 骤降至 27.4 4. 即使把真实偏好告诉模型,多数仍然失败 5. 智能体瓶颈已从"工具失误"转向"情商不足" 信号:Agent 评测范式从单点任务→长期陪伴、从被动执行→主动沟通。对 Agent 开发有直接指导意义。