11 RESEARCH
❯ 开源科研智能体 OpenScience 称科研基准得分超过 Codex,差距来自工作流设计
70 题做对 53 道初创公司 Synthetic Sciences 在 GitHub 项目页公布,其开源科研智能体 OpenScience 在 Terminal-Bench-Science 基准的 70 个任务中完成 53 个,得分 75.7%。按社交媒体转述,在 9 月 23 日的一份榜单镜像中,排名第一的 Codex 搭配 GPT-6 Astra 为 68.1%。成绩为公司自测,完整运行记录已公开,尚未见第三方复现。
从查文献到写报告OpenScience 以 Apache 2.0 许可免费开源,可在桌面、浏览器或命令行中运行,并可接入不同厂商的模型。用户用自然语言描述研究任务,它会检索文献、提出假设、写代码跑实验、分析数据并写成报告,每一步都可以查看。Terminal-Bench-Science 由斯坦福大学和 Laude Institute 主持,题目由生命科学、物理、地球科学等领域的专家编写,考察智能体完成真实科研流程的能力。
同一模型,不同工作流OpenScience 本身跑的也是 GPT-6 Astra 和 Sol 模型,比 Codex 高出的七个多百分点,来自它围绕科研流程设计的工具和步骤。如果第三方复现成立,OpenAI、Anthropic 的通用编程智能体在专业领域就会面临这类垂直工具的直接竞争。
▪ SIGNAL底层模型相同,胜负落在工作流设计上,这对只卖通用助手的公司是个不太舒服的提醒。