LINKX · WORLD MODEL · AUG 2026

从序列到表型:生命科学的世界模型

AI for Science · Sequence-to-Function

序列是生命的第一性原理。碱基扰动后的功能走向取决于细胞与组织语境,至今仍是靶点发现的卡点。LinkX 构建这条从序列到表型的世界模型。

自研 Sequence-to-Function 模型为内核。OmniReg-GPT 已在独立基准上取得全球 SOTA。面向创新药企,交付靶点立项所需的可审计功能证据。

SEQUENCE × CONTEXT → FUNCTION → PHENOTYPE

02 THE BOTTLENECK

靶点发现是
药物研发核心瓶颈

靶点发现是药物研发最上游、价值最高的环节。立项判定所需的功能证据,正是 Sequence-to-Function 模型的直接输出。而这一环节恰恰被三大结构性问题锁死,构成当前研发的效率天花板。

01靶点决策偏差直接推高研发损耗

全球药物研发临床失败超 50% 源于靶点选择偏差。具备遗传学证据支撑的靶点,获批概率约为无遗传证据者的 2.6 倍,且该优势随「变异 - 基因」归因置信度提升持续增强——归因置信度直接决定靶点证据的价值。

02靶点立项受限于自然样本供给

传统靶点发现高度依赖自然样本:需依托人群缺失突变、病人组织功能图谱方可启动立项,行业内成熟靶点长期稀缺,大多依赖偶然发现与验证。

03非编码区长期缺功能证据

大量非编码变异、剪接调控与 lncRNA 因缺少可审计的功能证据,无法进入研发管线,潜在成药价值被锁在立项之外。

数据来源:Minikel EV, Painter JL, Dong CC & Nelson MR. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0。

03 SEQUENCE-TO-FUNCTION

自研 Sequence-to-Function
做到独立基准全球 SOTA

立项判定所需的功能证据,正是这些模型的直接输出。相关成果发表于 Nature Genetics、Nature Communications;OmniReg-GPT 在独立公开基准上三项第一。

01OmniReg-GPT 独立基准三项第一

在上海人工智能实验室发布的 CENO 公开基准中,OmniReg-GPT 于三个疾病分组的 ClinVar F1 均列第一,获国际学界独立验证。

02从单细胞表达到可解释功能词表

Nvwa、Huatuo、HERMES 覆盖跨物种表达、细胞类型特异调控与 40 类序列功能簇,构成世界模型的内核。

OmniReg-GPT · CENO 外部基准 · 疾病分组 ClinVar F1

Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.

核心成果 PUBLISHED TRACK RECORD

覆盖序列到功能的关键能力

团队成员为相关成果的第一作者或通讯作者。

2022 · Nature GeneticsNvwa
Nvwa 论文首页
核心成果
跨物种、单细胞分辨率的序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种验证,测试基因在训练期间完全未见过。
体系定位
跨物种「序列→细胞状态」基座模型,为世界模型提供细胞语境下的功能判断基础。
查看论文
2023 · Nature CommunicationsHuatuo
Huatuo 论文首页
核心成果
在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;覆盖 20 种组织、44 类细胞、13,182 个候选细胞类型特异调控变异。
体系定位
承担「信号作用的细胞 / 组织语境判定」功能,是系统机制归因的核心环节。
查看论文
2025 · Nature CommunicationsOmniReg-GPT
OmniReg-GPT 论文首页
核心成果
外部基准测试中,三项疾病分组 ClinVar F1 均列第一(CENO 报告)。
体系定位
主力前沿 S2F 模型,承担候选压缩环节的功能证据打分,同时作为 Model + Agent 基准的基线模型。
查看论文
2026 · 2026HERMES
HERMES 论文首页
核心成果
迄今规模最大的 sequence-to-function 模型;将海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
体系定位
Scaling 路线关键节点;40 类功能词表是机制假设可解释性的核心来源。
查看论文

04 MODEL FACTORY

核心壁垒是自进化的
模型生产体系

我们自研 AI Infra(DeepGeSeq),把造模过程本身做成可调度的生产线。人工只设证据边界,Infra 持续构建下一代 SOTA 模型——面向疾病、组织与合作语境自动产出。

01用 AI 创造 AI

自研 AI Infra 自动完成模型微调与迭代。人工只设定证据边界与决策门槛,Infra 自己跑完「建模 → 预测 → 外部验证 → 生成训练信号 → 微调下一版」。

02垂类模型误差数量级下降

在人类细胞系 K562、完全独立留出的染色体测试集上,首版自动微调使 ATAC 任务 MAE 下降 91.9%,R² 由负转正。

03自进化的模型生产体系

DeepGeSeq 是已发表的 AI Infra。壁垒不在某一版权重,而在这条生产线能持续产出下一代 SOTA 模型。

AI4AI · DEEPGESEQ · K562 CASE

用 AI 创造 AI:自主构建微调模型使 ATAC 任务误差下降 90% 以上

Agent 自动完成「建模→预测→外部验证→生成训练信号→微调下一版模型」全流程,人工仅设定证据边界与决策门槛。在人类细胞系 K562 上,首版自动微调模型,在完全独立留出的染色体测试集上,表现已显著优于原始基准模型。

  1. Frozen model
  2. Leakage-aware split
  3. Predict
  4. Candidates
  5. External validation
  6. Fine-tune
  7. Frozen benchmark
指标(frozen chr8 · n = 2,520)基准模型Fine-tune V0变化幅度
ATAC · MAE5.9470.482−91.9%
ATAC · R²−182.80.469由负转正
ATAC · Pearson0.6580.690+0.032
H3K27ac · RMSE4.9724.433−10.8%
H3K27ac · R²0.1220.302+0.180

本案例数据与微调基础设施来自已发表的 DeepGeSeq(Bioinformatics, 2026)。发表的是 AI Infra;还在自进化的是生产线。

2026 · BioinformaticsDeepGeSeq
DeepGeSeq 论文首页
核心成果
首个内置智能体技能、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
体系定位
模型工厂执行层,可面向疾病、组织与合作语境快速生成与适配专项模型。
查看论文

05 LINKX WORLD MODEL

LinkX 世界模型

自研模型是内核,全球前沿模型是弹药。S2F Agent 用合同把开放的生物学问题收成可检查、可回归的执行——一次干预,给出机制假设、证据边界和下一步实验。

输入

  • 序列 × 组织 / 细胞语境在特定生物学语境下判断功能。
  • 干预:变异 / 编辑 / 暴露一次干预进入世界。暴露是输入槽位,与变异、编辑并列。

S2F AGENT · CONTRACT-DRIVEN HARNESS

内核 · 自研模型
  1. OmniReg-GPT
  2. Nvwa
  3. Huatuo
  4. HERMES
弹药 · 外部前沿
  1. AlphaGenome
  2. Borzoi
  3. Evo 2
  4. GPN

PLAYBOOKS · 4 WORKFLOWS轨道预测 · 序列嵌入 · 模型微调 · 变异效应

  1. 01 Agent Core使命、路由策略与安全边界。把开放问题收成可执行任务。
  2. 02 Registry输入 schema、任务合同、输出合同与恢复策略。机器可读的控制面。
  3. 03 Skills11 项模型技能:自研内核 + AlphaGenome、Borzoi、Evo 2 等外部前沿。模型语法留在技能层。
  4. 04 Playbooks四类生物学工作流:轨道预测、序列嵌入、微调、变异效应。任务与模型解耦。
  5. 05 EvalsRouting、Groundedness、Task success。幻觉与越权调用被合同拦住。
  6. 06 Runtimeroute → validate → plan → execute → verify → recover。每一步可检查、可回归。
  1. 用户意图
  2. 路由 / 澄清
  3. 校验输入
  4. 生成计划
  5. 执行
  6. 核验产出
  7. 恢复回路

出口

  • 多模态功能判断表达、可及性、进化约束同时给出。
  • 支持 / 反证 / 不确定度主张与反对证据并列,预测不升级成因果。
  • 下一步实验,或明确终止出口是可执行的下一步,或一张停的理由。
2026 · 2026S2F Agent
S2F Agent 论文首页
核心成果
面向 S2F 的 skill-grounded 智能体;统一编排 11 项模型技能(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
体系定位
世界模型编排层的公开学术版本,把模型广度收敛为单一任务判断精度。
查看论文
FROZEN CAD BENCHMARK · AGENT ABLATIONS

同一基准下,组合推演超过最强单模型

在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),达到预设决策门槛;所有对比项均在相同数据划分、相同标签、相同指标下完成评测。

S2F AGENT VS GENERAL AGENT · 54 PAIRED CASES
+77.8pp

54 组配对案例测试中,S2F Agent 通过率 100%,GPT-5.5 通用 Agent 通过率为 22.22%;McNemar 检验 p = 4.55e-13。

测试维度S2F AgentGPT-5.5差值
Routing100.00% (23/23)21.74% (5/23)+0.783
Groundedness100.00% (8/8)0.00% (0/8)+1.000
Task success100.00% (23/23)30.43% (7/23)+0.696
整体表现100.00% (54/54)22.22% (12/54)+0.778

垂直场景成功率显著领先通用型智能体。公开学术版本:S2F Agent(2026)。

06 TYPICAL SCENES

同一套世界模型,
四类典型场景

从模型自进化、靶点发现、功能注释到个体基因组。四个已完成的典型场景,用来检验同一套架构换任务之后是否仍然成立。它们不是能力边界。

01 · K562 · ENCODE自进化模型构建

通用基础模型并不能直接读实验室自己的功能基因组。S2F-Agent 自主完成数据规约、微调与评估,把基因组基础模型适配为该场景的垂类模型。

在 ENCODE K562 的 ATAC 与 H3K27ac 定量谱上,hold-out 预测成立,并能从序列中区分 primed 与 active 两类调控状态。

留下的是可复用的垂类模型资产。
02 · CAD靶点发现

复杂疾病的关联空间远大于可实验空间。真正要做的,是从中找出少数具有机制意义、可能被干预的轴。

系统将功能扰动、进化约束与精细定位置于同一工作流,从 16,607 个冠心病相关变异中优先出 42 个高置信候选。候选带有组织上下文——肝脏、内皮、血管。已知的肝脏 SORT1 轴被独立回收,作为方法学对照。

从关联空间压到少数可能被干预的机制轴。
03 · 多性状 GWAS功能注释

功能是情境化的。注释也应当是。

同一套多模态解释扩展到 25 万以上多性状 GWAS 变异,按组织、模态与性状给出分子后果。绝大多数位点并非全局功能变异;顶层多模态一致约为 0.22%。

新性状进入同一框架,不必重写流程。
04 · N = 1个体解读

临床目录记录的是已知事项。个人基因组的大部分并不在其中。

传统临床注释通常每人仅保留 3–9 个已标注位点。S2F-Agent 在证据门控下将优先功能假说扩展至约 1,700–2,900 条,并约束表述边界。12 个表型组中,9 组保留机制线索;全部停留在研究假说层。

覆盖从临床目录之外展开,表述停在证据允许的边界。

07 PUBLIC PROOF

公开验证

冠心病:
世界模型的公开验证

场景 02 的公开展开。遗传起点是 Aragam 等百万样本 CAD 研究(Nature Genetics, 2022;PMID 36474045)。下面把筛选流程与证据包格式摊开。

方法多模型交叉

多模型交叉,组织特异机制可复核

AlphaGenome、Borzoi、GPN 等互补视角被合同约束到同一条执行链:组织特异调控、转录扰动、进化约束同时给出,再与 GTEx eQTL 对齐。

  1. 多模型交叉评分
  2. 组织特异调控方向
  3. eQTL / 机制对齐
  4. 证据包交付
筛选流程压缩约 400×

16,607 → 42

  1. 16,607CAD 相关显著变异
  2. 42统计—功能双支持的优先候选
优先候选 · 统计与功能双支持42

从 16,607 个 CAD 相关变异收敛到 42 个高优先候选。系统找回肝脏 SORT1 轴:组织、基因与调控方向同时对齐,作为可复核的机制样例。

SORT1

已知肝脏脂质机制被重新定位为组织特异调控事件:组织、基因与方向同时对齐,作为证据包里可复核的机制样例。

变异到实验证据包

每条候选机制以「变异 → 分子事件 → 表型」链条呈现,并同时给出支持证据数、反证数、不确定度与决策结论。第一条为已公开的 PCSK9 机制,其余客户项目按 NDA 脱敏。

LINKX · EVIDENCE PACKAGE样例 · NDA 项下
机制 #1 · 优先级 高 · 已公开

rs11591147肝细胞 PCSK9 功能丧失PCSK9 活性 ↓ → LDL-C ↓ → ASCVD 风险 ↓

支持证据 4反证 1不确定度 推进
机制 #2 · 优先级 中 · 客户项目脱敏

内皮细胞特异性调控失衡血管表型

支持证据 3反证 2不确定度 已设终止标准

08 BUSINESS MODEL

给创新药企的
靶点立项基础设施

卖给药企的,是可审计的功能证据包。合作从客户既有靶点组合的系统重审开始。格式锁定,换名单就能再跑。

商业模式

  • 01
    买方

    创新药企与转型中的传统药企。小分子、抗体、核酸,立项的第一问相同:这个基因值不值得动、往哪边动、什么情况下终止。

  • 02
    交付

    可审计的功能证据包。同一套格式,换一张名单就能再跑。合作从客户既有靶点组合的系统重审开始。

  1. 现在靶点立项的功能证据

    标准化证据包进入药企立项决策。

  2. 随后合作回流,模型随使用变准

    每一次立项合作成为训练信号,世界模型跟着变准。

  3. 再后高确信机制上的共同 IP

    当同一高确信机制被反复给出,再谈联合开发与权益。

DRUG PIPELINE · WHERE WE SIT

新药立项的第一问,与下游模态无关

小分子、抗体、核酸,立项的第一问相同:这个基因值不值得动、往哪边动。LinkX 回答这一问。分子设计、递送与临床在下游。

  1. 疾病锚定
  2. 靶点确证
  3. 方向判定
  4. 分子设计
  5. 开发与递送
  6. 临床验证

09 TEAM

核心团队

01 FOUNDER / CEO
鲍志炜

鲍志炜

浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,从 0 到 1 打造覆盖医疗全流程的百余个 AI 产品,落地百余家三甲医院并推动数亿元有效合同;国内最大生物信息学社区 BioLinkX 创始人。现全面负责公司建设、团队管理、融资、商业策略与客户拓展。

团队管理融资商业策略
02 FOUNDER / CHIEF SCIENTIST · CTO
李佳琦

李佳琦

浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制研究。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表成果发表于 Nature Genetics、Nature Communications、Bioinformatics 等顶级期刊。全面负责模型科学、技术路线、评测体系与研发团队管理。

模型科学S2F Agent评测体系

10 THE RAISE

本轮融资 2,000 万

支持 12 个月运营,团队扩至约 10 人。用于世界模型的产品化与规模化应用;12 个月内,与 1–2 家创新药企达成付费立项合作。

资金用途与对应里程碑 TOTAL RMB 20M · 12 MONTHS

资金主线明细科目金额及占比对应里程碑
模型工厂与算力算力、云服务、数据与生产线运转250 万 · 12.5%自进化 Infra 持续产出下一代模型
证据包产品化与客户项目格式锁定、交付流水线、首批药企项目600 万 · 30.0%同一格式的证据包,可重复交付
商务拓展与团队建设人才招聘、药企对接、客户成功750 万 · 37.5%落地 1–2 家付费药企,实现首笔收入
运营保障与风险准备风险准备金、产品基础设施、办公行政400 万 · 20.0%覆盖交付延期、招聘延迟与融资周期缓冲

11 THIS ROUND

本轮目标

  1. 01把证据包格式锁成可重复交付的产品
  2. 02落地 1–2 家药企付费立项合作,实现首笔收入
  3. 03自进化 Infra 面向合作语境产出下一代模型
  4. 04每一笔立项合作回流进生产线

12 VISION

在 AI 时代下,
无限扩展中心法则的边界

序列是生命的第一性原理,中心法则奠定了生命信息单向编译的底层规则。面对疾病高度异质性、药效个体差异显著的行业痛点,传统「人群平均」研发范式始终无法建立序列锚定功能、机制与治疗的底层体系。我们以序列为核心原点,正向打通碱基到表型的全链路映射,反向从目标表型精准推导干预靶点。当下以靶点立项验证价值,长期迈向个体基因组级精准成药,目标成为生命科学的底层计算基础设施。

BIOLOGY SCALING LAW · TWO CURVES, ONE MODEL

生物学的 Scaling Law:两条曲线实现能力规模化跃迁

这一终局目标能否落地,核心取决于两条可验证、可自进化的技术曲线能否持续推进。二者共同收敛为序列到功能的底层统一语法,构成 LinkX 的技术路径。

CURVE 01 · DNA LM曲线一:DNA 语言模型(DNA LM)

持续扩充生物序列语料,学习序列内在的生成语法。

  • 语料演进路径:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
  • 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
  • 参数规模:117M → 270M → 500M → 2B+,配套 compute-optimal 算力扫描
CURVE 02 · FOUNDATIONAL S2F曲线二:基础 S2F 模型(Foundational S2F)

持续扩充功能观测,沉淀序列到功能的映射。

  • 功能图谱规模:当前 137,127 组(HERMES)→ 统一本体论下全量公共与私有观测数据
  • 功能模态覆盖:表达、剪接、染色质、转录因子结合、甲基化、三维互作、单细胞、扰动实验
  • 输出分辨率:窗口聚合 → 单碱基、增强子-基因关联、变异效应解析
底层三层语法体系 · 平台化能力的技术基石

三层语法构成完整的序列-功能语言体系,是未来成为行业基础设施的核心标准。

底层 Token 词表

采用 BPE / k-mer / 单碱基 Token 体系,承载序列组合语法规则

功能语义词表

覆盖启动子、增强子、转录因子结合、组蛋白状态等功能元件,对应 HERMES 定义的 40 类序列功能簇

关系语法规则

定义增强子-启动子兼容性、基序-转录因子结合、变异效应方向等序列-功能映射逻辑