斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。最强模型仅解决 30% 的任务,成本与 token 前沿显示不同系统取舍,为选择科学智能体提供了更接近真实研究的依据。
Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体