vep_traitgym:RNA 变异判断缺少最终答案
Kimi-K2.6、DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 生成了数十万字符,但没有给出可解析答案。gpt-5.5 与 gemini-3.1-pro-preview 用较短输出返回了正确的“否”选项。
面向生命科学语言模型的评测框架——
以能力为中心,覆盖通用任务、辅助科研与生物设计。
随着基础模型进入生命科学领域,模型评估正在变得更丰富,也更分散。既有基准提供了有价值的任务结果,但大多聚焦于单一任务或局部能力;科学应用真正关心的推理、设计、自主执行和使用边界,仍然缺少统一的评测与解释框架。
ARCK 的目标是在保留原有评测价值的基础上,将分散的生命科学相关评测组织到统一的评测框架中。它依托通用任务、辅助科研和生物设计三条评测赛道,结合知识(Knowledge,K)、推理(Reasoning,R)、构建(Craft,C)和自主(Autonomy,A)四类能力维度,评估模型在不同科学任务中的能力表现与使用边界。
同一套基准结果提供两个榜单:0–100 的常规 综合得分,以及按 1–5 级 K/R/C/A 能力分级得到的 生命科学智能指数(Life-Science Intelligence,LSI)。
两个榜单使用同一批基准,但回答不同问题。常规榜单遵循标准评分流程:随机基线校正后的子任务得分依次聚合为分类得分、赛道得分和 0–100 的综合得分。它适合直接比较模型在基准上的相对表现。
ARCK LSI 榜单在聚合前引入能力分级,得到 1–5 级 K/R/C/A 轴分数、各赛道 ARCK 分数,并进一步汇总为 LSI。LSI 对三条赛道的权重为通用任务 0.2、辅助科研 0.4、生物设计 0.4。这个榜单突出能力构成和任务覆盖,而不是只给出总分。
ARCK 包含四个能力维度、三条任务赛道和两条评分流程,分别产出常规综合得分和按 ARCK 分级得到的 LSI。
ARCK 用四个维度描述模型能力。知识关注事实掌握和领域背景;推理关注推断、因果分析和假设形成;构建关注受约束的生成和结构化产出;自主关注规划、工具使用、自检和迭代修订。
1–5 级定义用于解释子任务难度。它们描述任务要求的能力层级,而不是给模型分配科学角色。ARCK 分数由当前协议下的结果推导,应被视为本套基准上的结果,而不是对模型能力边界的泛化断言。
依赖规则用于限制等级映射,避免把一个维度的高分误读为另一个维度的能力。例如,生成结果较好并不自动意味着推理能力较强。
三条赛道对应三类任务。通用任务提供基线;辅助科研关注模型对科研工作流的支持;生物设计聚焦生命科学中的生成、判别和优化问题。
作为通用基线,覆盖知识、推理、代码、数学、指令遵循与智能体任务。
覆盖事实知识、科学推理、研究结果解读、实验方案写作和协作式流程。
覆盖生成、约束满足、安全性评估和迭代优化等生物设计任务。
下方表格中的每个数据源名称都链接到其数据集或代码仓库 ↗ — 悬停名称可查看其授权协议。
| 分类 | 子任务 | ARCK 标记 | 数据源 |
|---|---|---|---|
| 知识 | 2 | K1R1C1A1 | MMLU, MMLU-Pro |
| 数学 | 3 | K1-2R1-3C1A1 | AIME 2024, AIME 2025, MATH 500 |
| 逻辑与推理 | 2 | K1-2R2C1A1 | DROP, GPQADiamond |
| 指令遵循 | 1 | K1R1C1A1 | IFEval |
| 代码生成 | 2 | K1-2R2-3C2A1 | LiveCodeBench, HumanEval |
| 工具使用 | 1 | K1R2C1A1 | T-Eval |
| 智能体执行 | — | A2+ | 暂无任务 |
| 分类 | 子任务 | ARCK 标记 | 数据源 |
|---|---|---|---|
| 事实知识 | 3 | K1-2R1C1A1 | MMLU-Pro(生物/化学), lab-bench |
| 科学推理 | 8 | K2R1-3C1-2A1 | GPQA, ATLAS, HLE, DeepPrinciple† |
| 研究结果评析 | 4 | K2R2C1A1 | FrontierScience(生物/化学奥赛), SciPredict |
| 实验方案写作 | 2 | K3R4C3A1 | FrontierScience(生物/化学研究) |
| 智能体协作 | — | A2+ | 暂无任务 |
| 模态 | 子任务 | ARCK 标记 | 数据源 |
|---|---|---|---|
| 基因组 | 69 | K2R1-2C1A1 | OligoGym‡, NT‡, GUE‡, GLRB‡, BEACON‡, mRNABench‡, RNAGym‡ |
| 蛋白 | 59 | K2R1-3C1-2A1-2 | LiveProteinBench, VenusX‡, PRING‡, ProteinGym‡, TAPE‡, PDFBench |
| 小分子 | 54 | K1-2R1-3C1-3A1-2 | ChemBench, MoleculeQA, MolTextQA, MoleculeNet‡, SMolInstruct†, s2bench |
生物设计按模态组织。基因组与 RNA、蛋白、小分子化学对应不同设计对象;每个模态分别报告 K / R / C / A 标注范围。
两条流程使用同一批子任务得分。常规流程按赛道和分类聚合,产出 [0, 100] 区间的综合得分。ARCK 流程先按 K/R/C/A 轴和等级分组,再应用赛道阈值表,最后聚合为 LSI。两条流程都使用随机基线校正。
求平均之前,原始得分先按随机基线校正。这样,不同随机基线下的相同原始准确率不会被视为等价。
ARCK 分级流程使用 [0, 1] 区间的 normalized_score。
常规榜单展示 100 × normalized_score。
| 任务类型 | 随机基线 | 示例(原始 → 展示) |
|---|---|---|
| 四选一 MCQ | 0.25 | MMLU 0.85 → 80.0 |
| 五选一 MCQ | 0.20 | GPQA 0.42 → 27.5 |
| 生成(pass@1) | 0.00 | HumanEval 0.82 → 82.0 |
| Spearman ρ | 0.00 | ProteinGym ρ=0.42 → 42.0 |
| LLM 评分(1-5) | 0.20 | ChemBench 3.8/5 → 70.0 |
对于非 MCQ 任务,随机基线是空模型在该评分指标下的期望得分(随机生成的 pass@1 = 0,随机预测的 Spearman ρ = 0)。逐指标的空分布估计见技术报告。
该流程只做算术聚合,不引入能力分级或等级映射。
归一化之后,子任务按 ARCK 等级标记分组,再逐轴判定通过等级,并按能力维度汇总。两条核心公式如下:
K/R/C/A 轴分数使用 1–5 级定义。各赛道 ARCK 与聚合 LSI 是派生指数,不裁剪到 5。
在 v0.1 中,聚合 LSI 大致落在 1.6–3.3,各赛道 ARCK 约 1.2–4.2 — 名义上限为整数 K=R=C=A=5 时的 11.25。
权重定义的是报告口径的聚合方式,而非每个 LSI 点对应的固定实用价值。
下列步骤说明原始子任务得分如何进入该聚合。逐等级判定公式(τ 阈值和插值)随步骤给出。
τ(·) 由带版本的 TAU_TRACK_V0_1 表定义。示例:通用任务 K/R = 0.70/0.80/0.90/0.95/1.00;辅助科研 C = 0.20/0.30/0.45/0.55/0.65;生物设计 A = 0.30/0.90/0.95/1.00/1.00。
在第一个未通过的已有等级 n 处,取 (s, a, b, ρ)=(sn, τm, τn, 1)。当所有已有等级都通过且 τm<1 时,取 (sm, τm, 1, β)。m 为已通过的最高已有等级。v0.1 取 β=0.25。
两种评分结果回答不同问题:常规综合得分给出直接排名;ARCK LSI 展示同一批模型结果在 K/R/C/A 维度下的分布。
这些区间用于解读派生 LSI 指数。当前 v0.1 模型得分只覆盖理论范围的较低部分;这些区间是报告参考,不是部署角色标签。
文献摘要、基础问答、简单属性查询
基础参考用途跨论文综合、单目标生成、自检
辅助式科学综合机制推理、多目标优化、主动使用工具
方法层面的科研支持跨领域假设、硬约束设计、多轮优化
高级科研规划范式发现、系统级药物设计、自主演化式科研工作流
理论上限区间结合两个榜单,可以比较模型排序、闭源与开源模型差异,以及当前基准对各类科学任务的覆盖范围。
开源模型在两个榜单中均由 Kimi-K2.6 居首;闭源模型在两个榜单中排序不同。
K / R / C / A 分解展示了综合分数中被压缩的差异。下方逐轴视图采用辅助科研赛道,因为该赛道的任务覆盖目前最充分。
每个模型一行,按辅助科研 ARCK 分数排序。K / R / C / A 单元格按数值着色,颜色越亮表示分数越高;逐列比较可看到主要差异。
模态视图按设计对象拆分生物设计:基因组与 RNA、蛋白、小分子。生物设计 ARCK 列给出赛道级分级结果;三个模态列显示各自贡献。
聚合分数反映平均表现,但不能解释单个样本上的失败方式。本节选取少量辅助科研和生物设计案例,回到模型的原始输出记录。
本节关注模型在单个样本上的具体行为,而不是重新给出总体排名。
候选案例先由量化指标筛选,再人工复核输出记录。下列示例归纳为四类模式,用于补充聚合分数未能呈现的细节。
案例筛选覆盖 23 个代表性子任务。每个模型对应 4,306 条样本记录。下表汇总原始平均分、无有效答案比例和推理长度中位数。长度按字符计,不依赖特定分词器。
| 模型 | 类型 | 记录数 | 平均分 | 无有效答案 | 推理字符中位数 |
|---|---|---|---|---|---|
| Kimi-K2.6 核心 | 开源 | 4,306 | 0.57 | 3.4% | 51k |
| DeepSeek-V4-Pro 核心 | 开源 | 4,306 | 0.56 | 7.7% | 84k |
| gpt-5.5 核心 | 闭源 | 4,306 | 0.64 | 0.1% | 6k* |
| gemini-3.1-pro-preview 核心 | 闭源 | 4,306 | 0.66 | 0.1% | 2k* |
| DeepSeek-V4-Flash 补充 | 开源 | 4,306 | 0.54 | 8.8% | 73k |
| Qwen3.5-397B-A17B 补充 | 开源 | 4,306 | 0.51 | 2.3% | 20k |
| Qwen3.5-122B-A10B 补充 | 开源 | 4,306 | 0.38 | 14.6% | 22k |
| gpt-5.4-mini 补充 | 闭源 | 4,306 | 0.56 | 1.4% | 36k* |
| gemini-3-flash-preview 补充 | 闭源 | 4,306 | 0.62 | 0.3% | 8k* |
下方案例卡选自这些输出记录。“无有效答案”一列对应答案完成度问题。字符长度分布有助于区分输出冗长和答案质量。
* 闭源模型通常不暴露完整推理过程,因此其字符中位数只反映部分或经摘要的输出,仅供参考。
每类模式包含代表性案例。选择模式后,点击模型标签可查看任务提示、模型输出和评分信息。
部分模型生成了很长的输出,但没有给出可解析的最终答案。在评分时,缺少最终答案与答错一样会导致任务失败。
Kimi-K2.6、DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 生成了数十万字符,但没有给出可解析答案。gpt-5.5 与 gemini-3.1-pro-preview 用较短输出返回了正确的“否”选项。
该任务要求为 waaA 克隆至 HindII 线性化 pUC19 选择一对引物。DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 生成了很长输出,但没有给出最终预测。gpt-5.5 与 gemini-3.1-pro-preview 选出正确选项,Kimi-K2.6 在较长输出后也给出正确答案。
模型可能提到相关事实,但最终答案取决于线索权重。在这些案例中,部分模型让较弱线索主导了结论。
该任务要求在四个候选中找出唯一不稳定的微型蛋白。gpt-5.5、gemini-3.1-pro-preview、Kimi-K2.6 与 DeepSeek-V4-Flash 关注候选 3 较弱的 β 折叠模式和核心堆积线索,并选出正确候选。DeepSeek-V4-Pro 与 gemini-3-flash-preview 讨论了多种蛋白设计线索,但最终选择了另一个候选。
该任务问:配备跑轮的饲养方式如何改变雌性小鼠的社交探究时间。gpt-5.5、Kimi-K2.6 与两个 DeepSeek 变体都保留了正确方向:配跑轮的雌鼠探究时间更短。Gemini 各变体与 gpt-5.4-mini 则回答"无显著差异"。
开放式答案可能合理,但仍偏离评分目标。此类案例有助于区分模型行为问题和评分规则问题。
四个核心模型都写出了相当完整的合成生物学方案。但评分细则只奖励若干具体要点,例如转座酶辅助整合、CRISPRi 分裂激活子逻辑设计,以及工程化肽信号的稳定性。
Kimi-K2.6 与 DeepSeek-V4-Pro 列举了若干可能相关的危害。gpt-5.5 与 gemini-3.1-pro-preview 则选中了计分所依据的相容性图表目标:有毒物质的增溶。
这些卡片比较同一模型家族的不同规模变体。总体配对结果更常有利于较强变体,但单个样本中,规模变化可能改变线索选择、选项校准和最终答案。
该任务问:在补充 L. plantarum 的条件下,哪种持续性病毒感染表现出生存率下降。gpt-5.5 与 gemini-3.1-pro-preview 选了 DAV,而它们的轻量变体转向 Nora 或 DAV+Nora。DeepSeek 与 Qwen 则呈相反方向,轻量变体选了 DAV。
目标排序是 4,1,2,3。gpt-5.4-mini、gemini-3-flash-preview 与 Qwen3.5-122B-A10B 比它们更强的同族更接近该排序,而 DeepSeek-V4-Pro 完全正确、DeepSeek-V4-Flash 则不然。
计分答案是:WNK 抑制后 RNF43 的表面水平最终高于 FZD5。gpt-5.4-mini、gemini-3.1-pro-preview 与 DeepSeek-V4-Flash 遵循该方向。gpt-5.5、gemini-3-flash-preview 与 DeepSeek-V4-Pro 将其反转。两个 Qwen 变体都回答正确。
该任务要求从一段很长的蛋白序列推断其分子功能。计分答案是磷酸泛酰巯基乙胺(phosphopantetheine)结合。gpt-5.5、两个 Gemini 变体、DeepSeek-V4-Pro 与 Qwen3.5-397B-A17B 选择了磷酸泛酰巯基乙胺结合选项,而 gpt-5.4-mini、DeepSeek-V4-Flash 与 Qwen3.5-122B-A10B 则转向组蛋白结合或木聚糖酶相关线索。
当前基准池覆盖面较广,但并不均衡。本版直接覆盖辅助科研工作流和生物设计模态;对智能体式实验工作和长文档综合的覆盖仍然不足。
ARCK 基于下列公开数据集构建。我们感谢这些数据集的作者与维护者。各数据集版权仍归原作者所有,并按所示授权协议使用;在上方覆盖表格中悬停数据源名称,可查看授权协议。
| 数据集 | 授权协议 | 备注 |
|---|---|---|
| AIME 2024 | Apache-2.0 | Apache-2.0 来自上游 AI-MO 来源;所链接的 HuggingFaceH4 仓库未声明授权。 |
| AIME 2025 | MIT | — |
| DROP | CC-BY-SA-4.0 | 经由 OpenAI simple-evals 镜像链接;规范来源为 AllenAI(ucinlp/drop)。 |
| GPQADiamond | CC-BY-4.0 | 上游为受限访问(Idavidrein/gpqa);经由 OpenAI simple-evals 镜像链接。 |
| HumanEval | MIT | — |
| IFEval | Apache-2.0 | — |
| LiveCodeBench | CC(未指定) | HF 标签只是一个没有具体变体的 "cc";底层题目(LeetCode / AtCoder / Codeforces)的再分发条款不明确。 |
| MATH 500 | MIT | MIT 来自上游 OpenAI PRM800K 来源;所链接的 HuggingFaceH4 仓库未声明授权。 |
| MMLU | MIT | — |
| MMLU-Pro | MIT | — |
| T-Eval | Apache-2.0 | — |
| ATLAS | CC-BY-NC-SA-4.0 | 依据数据集卡片标识为非商用 + 相同方式共享。(HF 机器元数据标为 CC-BY-SA-4.0;此处采用更严格的卡片值。) |
| DeepPrinciple† | MIT | 组织主页;我们使用的 science_chemistry / science_biology 仓库为 MIT。 |
| FrontierScience | Apache-2.0 | — |
| GPQA | CC-BY-4.0 | 受限访问 — 需接受条款并同意不公开示例。 |
| HLE | MIT | 受限访问;尽管授予 MIT,卡片仍要求不要再分发。 |
| lab-bench | CC-BY-SA-4.0 | — |
| SciPredict | MIT | — |
| BEACON‡ | 混合 — Apache-2.0, CC0-1.0, GPL-3.0, MIT, 未声明授权, 公有领域, 仅限研究用途 | 逐任务授权依据 BEACON 论文的表 22。bpRNA-1M 本身是多个子来源授权的混合(CRW / tmRDB / SRPDB / tRNADB / Rnase P / RFam / PDB)。 |
| ChemBench | MIT | — |
| GLRB‡ | CC-BY-NC-SA-4.0 | 非商用 + 相同方式共享。 |
| GUE‡ | 未声明授权 | 未声明数据授权。virus_covid 源自 GISAID,其访问条款较为严格。 |
| LiveProteinBench | 未声明授权 | 仓库中没有 LICENSE 文件或授权声明;论文的 CC BY 4.0 仅覆盖手稿本身。 |
| MoleculeNet‡ | MIT | MIT 覆盖 DeepChem 的整理工作;各子集保留各自的上游条款。经由镜像 tarball 链接。 |
| MoleculeQA | MIT | — |
| MolTextQA | CC-BY-4.0 | — |
| mRNABench‡ | 混合 — CC-BY-4.0, CC-BY-SA-4.0, MIT, 未声明授权 | 伞式基准,没有逐任务授权;下方组件授权为依据上游来源的尽力推断。mRNABench 代码仓库为 AGPL-3.0。 |
| NT‡ | 未声明授权 | 数据集卡片声明无授权。常被引用的 CC-BY-NC-SA-4.0 属于模型/代码仓库,而非本数据 — 不可迁移。 |
| OligoGym‡ | CC-BY-4.0 | — |
| PDFBench | MIT | 数据改用自 Mol-Instructions(HF nwliu/Molinst-SwissProtCLAP,MIT);PDFBench 代码仓库本身没有 LICENSE 文件。 |
| PRING‡ | MIT | — |
| ProteinGym‡ | MIT | 构建于第三方 DMS/临床实验数据之上;请引用原始实验论文。 |
| RNAGym‡ | CC-BY-4.0 | HF 上的数据(Marks-lab/RNAgym)为 CC-BY-4.0;GitHub 代码仓库为 MIT。 |
| s2bench | 未声明授权 | TOMG-Bench;HF 卡片与 GitHub 仓库均无授权。 |
| SMolInstruct† | CC-BY-4.0 | — |
| TAPE‡ | BSD-3-Clause | — |
| VenusX‡ | Apache-2.0 | 数据集为 Apache-2.0;配套代码仓库为 CC-BY-NC-ND-4.0(非商用 + 禁止演绎)。 |
† 提示改编 · ‡ 任务重构 — 底层标签与标准答案保持不变。改编内容详见上方覆盖表格。
BEACON 组件授权协议: bpRNA-1M / CRW — 未声明授权; bpRNA-1M / tmRDB — 仅限研究用途; bpRNA-1M / SRPDB — 仅限研究用途; bpRNA-1M / tRNADB — 公有领域; bpRNA-1M / Rnase P — 公有领域; bpRNA-1M / RFam — CC0-1.0; bpRNA-1M / PDB — CC0-1.0; splice_ai — GPL-3.0; isoform — MIT; modification — MIT; noncoding_rna_family — Apache-2.0; programmable_rna_switches — 未声明授权; crispr_on_target — Apache-2.0; crispr_off_target — Apache-2.0
mRNABench 组件授权协议: rna-loc-fazal — 未声明授权; protein-loc — CC-BY-SA-4.0; rna-lifecycle — 未声明授权; mirna-target — CC-BY-4.0; mrl — 未声明授权; te — 未声明授权; eclip — 未声明授权; GO — CC-BY-4.0; rnahl — CC-BY-4.0; mrl-egfp — 未声明授权; utr-variants — CC-BY-4.0; vep-traitgym — MIT
配套技术材料将包括: