v0.1 · 2026 年 5 月

ARCK:通往科学智能的桥梁

面向生命科学语言模型的评测框架——
以能力为中心,覆盖通用任务、辅助科研与生物设计。


为何需要 ARCK?

随着基础模型进入生命科学领域,模型评估正在变得更丰富,也更分散。既有基准提供了有价值的任务结果,但大多聚焦于单一任务或局部能力;科学应用真正关心的推理、设计、自主执行和使用边界,仍然缺少统一的评测与解释框架。

ARCK 的目标是在保留原有评测价值的基础上,将分散的生命科学相关评测组织到统一的评测框架中。它依托通用任务、辅助科研和生物设计三条评测赛道,结合知识(Knowledge,K)、推理(Reasoning,R)、构建(Craft,C)和自主(Autonomy,A)四类能力维度,评估模型在不同科学任务中的能力表现与使用边界。

榜单 详情 ↓

同一套基准结果提供两个榜单:0–100 的常规 综合得分,以及按 1–5 级 K/R/C/A 能力分级得到的 生命科学智能指数(Life-Science Intelligence,LSI)

常规 综合得分 · 0–100 明细 ↓

ARCK LSI · 派生指数 明细 ↓

常规榜单 0–100 · 随机基线校正 公式 ↓

先对每个子任务进行随机基线校正,再汇总为赛道得分和综合得分。

点击任意模型行可打开其能力详情

ARCK LSI 榜单 LSI · 派生指数 · ARCK 分级 公式 ↓

先按 K/R/C/A 能力等级重组子任务结果,再汇总为 LSI 指数。

点击任意模型行可打开其能力详情

两个榜单有何不同 返回榜单 ↑

两个榜单使用同一批基准,但回答不同问题。常规榜单遵循标准评分流程:随机基线校正后的子任务得分依次聚合为分类得分、赛道得分和 0–100 的综合得分。它适合直接比较模型在基准上的相对表现。

ARCK LSI 榜单在聚合前引入能力分级,得到 1–5 级 K/R/C/A 轴分数、各赛道 ARCK 分数,并进一步汇总为 LSI。LSI 对三条赛道的权重为通用任务 0.2、辅助科研 0.4、生物设计 0.4。这个榜单突出能力构成和任务覆盖,而不是只给出总分。

说明 · Claude 系列缺席 · Claude 系列模型在本套件较多对抗性与生物设计提示上拒答,导致当前协议下大量任务无法评分。因此,本版榜单未纳入 Claude 系列排名。
闭源模型的部分高容量通用任务采用下采样:MMLU(570,分层抽样)、MMLU-Pro(700,分层抽样)、DROP(500)。这些任务已接近饱和,在真实推理成本下全量运行几乎不增加区分度。其余基准保持全量。该处理对通用任务得分的影响小于 0.1 分,且不改变排名。

ARCK 的工作原理

ARCK 包含四个能力维度、三条任务赛道和两条评分流程,分别产出常规综合得分和按 ARCK 分级得到的 LSI。

ARCK 用四个维度描述模型能力。知识关注事实掌握和领域背景;推理关注推断、因果分析和假设形成;构建关注受约束的生成和结构化产出;自主关注规划、工具使用、自检和迭代修订。

K
知识
事实性知识、领域深度、文献背景,以及对已知边界的把握。
基础维度
R
推理
逻辑推断、因果建模、假设生成,以及对研究范式的分析。
基础维度
C
构建
在约束下生成结构化产出,包括代码、分子、蛋白和实验方案。
基础维度
A
自主
在给定环境中规划步骤、使用工具、检查结果,并根据反馈修订。
整合维度
1–5 级能力定义

1–5 级定义用于解释子任务难度。它们描述任务要求的能力层级,而不是给模型分配科学角色。ARCK 分数由当前协议下的结果推导,应被视为本套基准上的结果,而不是对模型能力边界的泛化断言。

K — 知识
1
基础
回忆既有概念、术语与标准事实。
2
专业
将领域专门知识应用于范围清晰的问题。
3
专家
判断领域研究中的方法、假设、数据与局限。
4
综合
连接子领域间的机制,识别可信的跨领域联系。
5
前沿
就未解问题、边界条件与相互竞争的前沿假设进行推理。
R — 推理
1
直接
在前提明确的情况下求解单步推断任务。
2
多步
将若干已陈述的事实或结果组合为有支撑的结论。
3
因果
分析机制、干预、混杂与反事实结果。
4
假设
提出可检验的解释并在多个备选之间加以甄别。
5
概念
重构假设,或基于现有结果提出新的解释框架。
C — 构建
1
判别
在明确标准下对给定对象进行分类、排序或打分。
2
单目标
生成满足某一主要目标或约束的单个产物。
3
多目标
在活性、安全性与可行性等多个目标之间取得平衡。
4
硬约束
满足严格的结构、功能或合成约束。
5
系统级
设计带有反馈与失效模式的、协调一致的多组件干预方案。
A — 自主
1
单步
在不使用外部工具或反馈的情况下完成一条孤立指令。
2
遵循工具
按明确流程使用指定的工具或数据源。
3
自适应
选择合适的工具,检查中间结果,并修订局部步骤。
4
流程控制
协调带有错误处理与可追溯决策的多步工作流。
5
闭环
规划并执行带有不确定性跟踪、结果反馈与候选筛选的迭代式、演化式工作流。

依赖规则

依赖规则用于限制等级映射,避免把一个维度的高分误读为另一个维度的能力。例如,生成结果较好并不自动意味着推理能力较强。

RK + 2推理等级受知识等级约束
CR + 1构建等级受推理等级约束
CK + 2构建等级受知识等级约束
A ≤ min(K, R) + 1自主同时依赖知识与推理

主要结果

结合两个榜单,可以比较模型排序、闭源与开源模型差异,以及当前基准对各类科学任务的覆盖范围。

主要观察

闭源与开源模型

分组
常规第一
ARCK 第一
闭源
gemini-3.1-pro-preview · 66.2
gpt-5.5 · 3.27
开源
Kimi-K2.6 · 62.1
Kimi-K2.6 · 2.69

开源模型在两个榜单中均由 Kimi-K2.6 居首;闭源模型在两个榜单中排序不同。

能力结构

K / R / C / A 分解展示了综合分数中被压缩的差异。下方逐轴视图采用辅助科研赛道,因为该赛道的任务覆盖目前最充分。

推理突出型
gpt-5.5
K 3.0 · R 4.0 · C 3.1 · A 1.1
唯一超过 R = 3.5 的模型。K 与 C 较均衡,A 仍处于低值区间。
闭源 · 构建较强
gemini-3.1-pro-preview, gemini-3-flash-preview
K 2.0 · R 3.0 · C ~2.9 · A 1.1
C 接近闭源高分组。K 约为 2,低于 gpt-5.5。
开源 · 推理较强
Kimi-K2.6, MiMo-V2.5-Pro
K 1.9–2.8 · R 2.6–3.0 · C 1.6–1.8 · A 1.0
K 与 R 接近部分闭源模型。C 与 A 较低,限制了 LSI。
闭源 · 轻量
gpt-5.4-mini
K 1.9 · R 2.1 · C 1.0 · A 1.0
闭源 API 访问并不意味着相同能力结构。该模型的 C 仍约为 1.0。
开源 · 构建较强
DeepSeek-V4-Pro
K 2.0 · R 1.8 · C 2.9 · A 1.0
C 接近闭源高分组;R 较低,限制了辅助科研赛道得分。
长尾
Qwen3.5/3.6, gpt-oss-120b, Intern-S1/S2, gemma-4, GLM-5.1, MiniMax-M2.7, DeepSeek-V4-Flash
K 1.2–1.9 · R 1.3–2.2 · C ~1.0–1.3 · A 0.9–1.0
8 个以上模型集中在 C ≤ 1.3、A ≤ 1.0。这两个轴在当前任务集中的区分度有限。

辅助科研 · 能力结构 ARCK 热力图

每个模型一行,按辅助科研 ARCK 分数排序。K / R / C / A 单元格按数值着色,颜色越亮表示分数越高;逐列比较可看到主要差异。

辅助科研的两个限制因素 · 在全部 17 个模型中,A 从未超过 1.1,因为当前辅助科研任务很少要求自主工具使用或迭代动作。17 个模型中有 8 个的 C 为 1.0,构建能力仍是主要瓶颈之一。

生物设计 · 模态得分 基因组 / 蛋白 / 小分子 · 0–100 分

模态视图按设计对象拆分生物设计:基因组与 RNA、蛋白、小分子。生物设计 ARCK 列给出赛道级分级结果;三个模态列显示各自贡献。

基因组模态整体得分较低:多数模型表现接近,只有闭源高分组明显更高。小分子模态区分度较低:高分开源模型与闭源模型的差异小于基因组模态。

样本级案例研究

聚合分数反映平均表现,但不能解释单个样本上的失败方式。本节选取少量辅助科研和生物设计案例,回到模型的原始输出记录。

案例选择

本节关注模型在单个样本上的具体行为,而不是重新给出总体排名。

候选案例先由量化指标筛选,再人工复核输出记录。下列示例归纳为四类模式,用于补充聚合分数未能呈现的细节。

案例研究范围
23个代表性子任务
4,306个对齐样本
9个模型
38,754条样本 × 模型记录
38个人工复核案例
10张案例卡,覆盖 10 个唯一样本

样本记录概览

案例筛选覆盖 23 个代表性子任务。每个模型对应 4,306 条样本记录。下表汇总原始平均分、无有效答案比例和推理长度中位数。长度按字符计,不依赖特定分词器。

模型 类型 记录数 平均分 无有效答案 推理字符中位数
Kimi-K2.6 核心开源4,3060.573.4%51k
DeepSeek-V4-Pro 核心开源4,3060.567.7%84k
gpt-5.5 核心闭源4,3060.640.1%6k*
gemini-3.1-pro-preview 核心闭源4,3060.660.1%2k*
DeepSeek-V4-Flash 补充开源4,3060.548.8%73k
Qwen3.5-397B-A17B 补充开源4,3060.512.3%20k
Qwen3.5-122B-A10B 补充开源4,3060.3814.6%22k
gpt-5.4-mini 补充闭源4,3060.561.4%36k*
gemini-3-flash-preview 补充闭源4,3060.620.3%8k*

下方案例卡选自这些输出记录。“无有效答案”一列对应答案完成度问题。字符长度分布有助于区分输出冗长和答案质量。

* 闭源模型通常不暴露完整推理过程,因此其字符中位数只反映部分或经摘要的输出,仅供参考。

四类样本模式 — 先选模式,再点模型标签

每类模式包含代表性案例。选择模式后,点击模型标签可查看任务提示、模型输出和评分信息。

部分模型生成了很长的输出,但没有给出可解析的最终答案。在评分时,缺少最终答案与答错一样会导致任务失败。

案例 8生物设计 · 基因组

vep_traitgym:RNA 变异判断缺少最终答案

Kimi-K2.6DeepSeek-V4-ProDeepSeek-V4-Flash 生成了数十万字符,但没有给出可解析答案。gpt-5.5gemini-3.1-pro-preview 用较短输出返回了正确的“否”选项。

关键观察失败发生在答案格式和收尾阶段,而不是任务本身不可解。
这里的失败主要来自最终答案缺失,而不一定来自生物学推断错误。
案例 21辅助科研 · 事实知识

lab_bench:Gibson 引物选择缺少最终选项

该任务要求为 waaA 克隆至 HindII 线性化 pUC19 选择一对引物。DeepSeek-V4-ProDeepSeek-V4-Flash 生成了很长输出,但没有给出最终预测。gpt-5.5gemini-3.1-pro-preview 选出正确选项,Kimi-K2.6 在较长输出后也给出正确答案。

关键观察输出保持任务相关,但仍因缺少可解析选项而无法评分。
答案完成度是实验方案类任务中的独立失败来源。
阅读说明。 每个标签给出该模型在某一样本上的得分。分数沿用原始任务评分器的分值范围,而非胜率。许多任务使用 0–1 分;排序任务可能给出部分分或负相关分。本节 10 张卡片覆盖 10 个唯一样本。案例先由量化指标筛选,再经人工复核,因此仍包含主观判断。请结合聚合表格和配对统计阅读。

局限性

当前基准池覆盖面较广,但并不均衡。本版直接覆盖辅助科研工作流和生物设计模态;对智能体式实验工作和长文档综合的覆盖仍然不足。

路线图 · v0.2 上述缺口将作为后续扩展方向,重点包括智能体任务和长上下文任务。

致谢

ARCK 基于下列公开数据集构建。我们感谢这些数据集的作者与维护者。各数据集版权仍归原作者所有,并按所示授权协议使用;在上方覆盖表格中悬停数据源名称,可查看授权协议。

数据集授权协议备注
AIME 2024Apache-2.0Apache-2.0 来自上游 AI-MO 来源;所链接的 HuggingFaceH4 仓库未声明授权。
AIME 2025MIT
DROPCC-BY-SA-4.0经由 OpenAI simple-evals 镜像链接;规范来源为 AllenAI(ucinlp/drop)。
GPQADiamondCC-BY-4.0上游为受限访问(Idavidrein/gpqa);经由 OpenAI simple-evals 镜像链接。
HumanEvalMIT
IFEvalApache-2.0
LiveCodeBenchCC(未指定)HF 标签只是一个没有具体变体的 "cc";底层题目(LeetCode / AtCoder / Codeforces)的再分发条款不明确。
MATH 500MITMIT 来自上游 OpenAI PRM800K 来源;所链接的 HuggingFaceH4 仓库未声明授权。
MMLUMIT
MMLU-ProMIT
T-EvalApache-2.0
ATLASCC-BY-NC-SA-4.0依据数据集卡片标识为非商用 + 相同方式共享。(HF 机器元数据标为 CC-BY-SA-4.0;此处采用更严格的卡片值。)
DeepPrincipleMIT组织主页;我们使用的 science_chemistry / science_biology 仓库为 MIT。
FrontierScienceApache-2.0
GPQACC-BY-4.0受限访问 — 需接受条款并同意不公开示例。
HLEMIT受限访问;尽管授予 MIT,卡片仍要求不要再分发。
lab-benchCC-BY-SA-4.0
SciPredictMIT
BEACON混合 — Apache-2.0, CC0-1.0, GPL-3.0, MIT, 未声明授权, 公有领域, 仅限研究用途逐任务授权依据 BEACON 论文的表 22。bpRNA-1M 本身是多个子来源授权的混合(CRW / tmRDB / SRPDB / tRNADB / Rnase P / RFam / PDB)。
ChemBenchMIT
GLRBCC-BY-NC-SA-4.0非商用 + 相同方式共享。
GUE未声明授权未声明数据授权。virus_covid 源自 GISAID,其访问条款较为严格。
LiveProteinBench未声明授权仓库中没有 LICENSE 文件或授权声明;论文的 CC BY 4.0 仅覆盖手稿本身。
MoleculeNetMITMIT 覆盖 DeepChem 的整理工作;各子集保留各自的上游条款。经由镜像 tarball 链接。
MoleculeQAMIT
MolTextQACC-BY-4.0
mRNABench混合 — CC-BY-4.0, CC-BY-SA-4.0, MIT, 未声明授权伞式基准,没有逐任务授权;下方组件授权为依据上游来源的尽力推断。mRNABench 代码仓库为 AGPL-3.0。
NT未声明授权数据集卡片声明无授权。常被引用的 CC-BY-NC-SA-4.0 属于模型/代码仓库,而非本数据 — 不可迁移。
OligoGymCC-BY-4.0
PDFBenchMIT数据改用自 Mol-Instructions(HF nwliu/Molinst-SwissProtCLAP,MIT);PDFBench 代码仓库本身没有 LICENSE 文件。
PRINGMIT
ProteinGymMIT构建于第三方 DMS/临床实验数据之上;请引用原始实验论文。
RNAGymCC-BY-4.0HF 上的数据(Marks-lab/RNAgym)为 CC-BY-4.0;GitHub 代码仓库为 MIT。
s2bench未声明授权TOMG-Bench;HF 卡片与 GitHub 仓库均无授权。
SMolInstructCC-BY-4.0
TAPEBSD-3-Clause
VenusXApache-2.0数据集为 Apache-2.0;配套代码仓库为 CC-BY-NC-ND-4.0(非商用 + 禁止演绎)。

† 提示改编 · ‡ 任务重构 — 底层标签与标准答案保持不变。改编内容详见上方覆盖表格。

BEACON 组件授权协议: bpRNA-1M / CRW — 未声明授权; bpRNA-1M / tmRDB — 仅限研究用途; bpRNA-1M / SRPDB — 仅限研究用途; bpRNA-1M / tRNADB — 公有领域; bpRNA-1M / Rnase P — 公有领域; bpRNA-1M / RFam — CC0-1.0; bpRNA-1M / PDB — CC0-1.0; splice_ai — GPL-3.0; isoform — MIT; modification — MIT; noncoding_rna_family — Apache-2.0; programmable_rna_switches — 未声明授权; crispr_on_target — Apache-2.0; crispr_off_target — Apache-2.0

mRNABench 组件授权协议: rna-loc-fazal — 未声明授权; protein-loc — CC-BY-SA-4.0; rna-lifecycle — 未声明授权; mirna-target — CC-BY-4.0; mrl — 未声明授权; te — 未声明授权; eclip — 未声明授权; GO — CC-BY-4.0; rnahl — CC-BY-4.0; mrl-egfp — 未声明授权; utr-variants — CC-BY-4.0; vep-traitgym — MIT


开放合作

ARCK 将现有基准整合进统一的评测框架。我们欢迎社区反馈,以改进基准准入、分数解读和结果报告。

联系团队
技术报告 即将发布

配套技术材料将包括:

方法学 规模检验 逐基准结果 改编来源