让 GPT-5 跑一整篇生物信息学研究,要多久?
答案是:24 小时、10.7 亿 token、525 美元。
成绩单呢?0.48 分,满分 1.0。
这不是某次翻车,这是 BixBench3 给 13 个顶级模型出的统一考卷。最强的那个,刚刚及格的一半。最弱的那个,0.00——交了白卷。
背景过去两年,AI 圈讲了一个新故事:AI 智能体(Agent)能当"数字员工",能自己查资料、写代码、做研究。Manus、Devin、AutoGen、Claude Computer Use……一批"会自己干活"的 AI 轮番登场,估值一个比一个高。
但故事讲得再热闹,终究要问一句:它们到底能干什么?干得怎么样?
这正是 BixBench3 想要回答的问题。它不是普通的"代码题"或"选择题",而是把真实发表过的生物学论文拆解成 20 个完整任务,每个任务包含原始数据(有的超过 100 GB)、研究目标、方法指导,让 AI 智能体从零跑到终,再把 AI 输出的结果(峰调用矩阵、差异表达表等 138 个数据产物)程序化比对原论文。
换句话说,这不是"AI 懂不懂生物学"的考试,而是"AI 能不能替一个正经生物学家干完一整天活"的考试。
来自 FutureHouse、Anthropic、康奈尔等机构的 8 位研究者,把这道考卷发到了 arXiv 上。论文链接
为什么这事值得看?因为它直接戳破了当前 AI 智能体最大的泡沫——"端到端科研"。过去我们总以为,只要把任务丢给 AI,它就能跑完全流程。但 BixBench3 的答案很冷酷:跑是能跑,跑完是一回事,跑对是另一回事。
核心发现来看那组刺眼的数字。
任务规模:20 个完整研究任务,138 个独立数据产物,13 个前沿模型同台竞技。BixBench3 摘要
成绩分布:
- 最强选手 GPT-5 拿到 0.48 分——刚过满分的一半。
- 最弱选手 Gemini 3.1 Flash Lite 拿到 0.00——交了白卷。
- 13 个模型平均在 0.20 上下徘徊。
数据规模是分水岭:
- 数据 < 100 GB 的任务,AI 平均能拿 0.36。
- 数据 > 100 GB 的任务,成绩直接腰斩到 0.10。
- 100 GB 这个门槛,成了 AI 智能体"能不能干活"的生死线。
步骤数是另一个分水岭:
- 1-2 步就能完成的任务,平均 0.36。
- 3 步以上的多步骤任务,平均 0.24。
- 步骤越多,AI 越容易"在中间某一步犯迷糊,最后全盘崩溃"。
成本账单:
- 平均每个任务花 6.8 小时、1.02 亿 token、43 美元。
- 最长一次尝试:24 小时、10.7 亿 token、525 美元。
- 反直觉的是:得分高的模型反而更省钱——因为它们不靠"瞎试"凑答案。
这三组数据放在一起,构成了一个清晰的画面:AI 智能体能跑流程,但跑不出科学家。
影响升维BixBench3 的意义,远不止是一份成绩单。
第一,它重新定义了"AI 能不能干活"的标准。过去我们用 SWE-bench、HumanEval、GAIA 这些"单步任务"来测 AI 智能体——AI 当然能拿高分,因为单步任务和"完整研究"根本是两回事。BixBench3 把标准从"单步能力"升到了"研究规模",这是基准测试从"考记忆"到"考工程"的代际跃迁。
第二,它撕开了"AI 数字员工"叙事的口子。现在市面上的 AI 智能体产品,demo 视频里"自己写代码、自己调 API、自己交付结果"——但 demo 是挑过的,真实任务没人测。BixBench3 给出了冷静的答案:把一个 100 GB 的真实数据丢给 AI,让它自己跑到终,一半的任务它会跑崩。这意味着,"AI 数字员工"在 2026 年的真实定位,是科学家的实习生,不是替代者——它能帮你跑 60% 的流程,但最后那 40% 的判断、纠错、领域知识,依然要人接手。
第三,它指向了一个反直觉的结论:更聪明的 AI,更省 token,也更省钱。这跟"AI 越强越烧钱"的直觉相反。原因是笨模型靠"暴力穷举"试错,聪明模型靠"一次做对"省力。这给企业部署 AI 智能体提了个醒:选模型不是选参数最大的,是选 ROI 最高的。
第四,从 AI 文明的角度看,BixBench3 揭示了一个更深层的真相:AI 在"长链路、多模态、大数据、强领域知识"四重叠加下,会出现能力断崖。这四重里任何一重,AI 都能勉强应付;四重叠加,能力直接掉到一半以下。这说明 AGI 不是"模型变大"就能解决的事,它是"认知架构"的事——AI 需要全新的工作流设计,才能跨越"单步聪明"到"端到端可靠"之间的鸿沟。
对国内而言,这既是警钟,也是机会。警钟在于:我们的 AI 智能体产品如果只盯着"代码生成"、"文档总结"这些单步任务,迟早会被国际同行用 BixBench3 这样的硬基准打脸。机会在于:中国在垂直领域(生物医药、材料科学、能源)有海量真实数据,如果能率先在垂直领域建立"研究级"AI 智能体基准,就能在下一波 AI 浪潮中占住"定义标准"的位置。
收尾金句当 AI 跑完一篇研究需要花 525 美元、24 小时,却只能拿 48 分时,我们突然意识到:
这道鸿沟,可能比所有人以为的都要深。
📄 论文原文:arXiv:2608.25286v1
🔍 关键词 Tags#AI智能体 #计算生物学 #基准测试 #生物信息学 #研究自动化 #大语言模型 #科学发现 #代理评估
宏天有鸣是创新的AI数字员工解决方案公司,核心团队来自中国科学技术大学。我们提供从咨询规划、方案落地到协助运营的一站式服务,协助企业把AI变成能干活、不休息的"数字员工",向AI共生组织演进,持续降本、提效、增收:
- 品牌推广数字员工:能自动写文章,做视频,运营自媒体账号矩阵;
- 全网拓客数字员工:24小时在抖音、小红书等平台自动找客户;
- 金牌销售数字员工:复制销冠经验,推动潜在客户签单。

