❯ 字节跳动 Seed 发布 EdgeBench,测 AI 智能体能否在任务中越做越好
换评测范式字节跳动 Seed 团队发布新基准 EdgeBench,专门测 AI 智能体能否在与环境的长时间互动中”边做边学”,共 134 个真实任务、每个至少运行 12 小时(部分长达 72 小时)。据官方介绍,它把 AI 评测的问题从”模型已经知道什么”,换成”模型能不能在反馈中越做越好”。
日级长跑与此前常见的一问一答式跑分不同,EdgeBench 让智能体在本地环境里反复试错、把成果提交给隐藏评委换取更强反馈,覆盖科研、软件工程、优化、专业工作、形式化数学和游戏等多类任务。团队跑了 3.8 万小时智能体运行后发现,随着智能体与环境持续互动,其总体表现能被一条对数-S 型(log-sigmoid)曲线精确拟合,并用一套图探索理论给出解释。首批已开源 134 个任务中的 51 个及完整评测框架。
长程能力标尺对做智能体的研发团队来说,这类基准提供了一把此前缺失的标尺——衡量的不再是模型的静态知识,而是它在数十小时任务里能否靠反馈自我改进。当行业都在讲”智能体”,能不能量化”越做越好”这件事,才是把演示和产品区分开的地方。对做智能体选型的人来说,要重新评估的是一条新指标:模型在数十小时任务里的长程改进斜率,而不再只看它一次问答答得多漂亮。接下来要看的,是各家厂商愿不愿意把自家模型放到这条对数-S 型曲线上跑一遍,公开自己的长程改进能力。
signal: 从”知道多少”到”能进步多少”,EdgeBench 换的是评测的坐标系——真正值钱的,是智能体在长任务里自我改进的斜率。