全球药物研发临床失败超 50% 源于靶点选择偏差。具备遗传学证据支撑的靶点,获批概率约为无遗传证据者的 2.6 倍,且该优势随「变异 - 基因」归因置信度提升持续增强——归因置信度直接决定靶点证据的价值。
02 THE BOTTLENECK
靶点发现是
药物研发核心瓶颈
靶点发现是药物研发最上游、价值最高的环节。立项判定所需的功能证据,正是 Sequence-to-Function 模型的直接输出。而这一环节恰恰被三大结构性问题锁死,构成当前研发的效率天花板。
传统靶点发现高度依赖自然样本:需依托人群缺失突变、病人组织功能图谱方可启动立项,行业内成熟靶点长期稀缺,大多依赖偶然发现与验证。
大量非编码变异、剪接调控与 lncRNA 因缺少可审计的功能证据,无法进入研发管线,潜在成药价值被锁在立项之外。
数据来源:Minikel EV, Painter JL, Dong CC & Nelson MR. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0。
03 SEQUENCE-TO-FUNCTION
自研 Sequence-to-Function
做到独立基准全球 SOTA
立项判定所需的功能证据,正是这些模型的直接输出。相关成果发表于 Nature Genetics、Nature Communications;OmniReg-GPT 在独立公开基准上三项第一。
在上海人工智能实验室发布的 CENO 公开基准中,OmniReg-GPT 于三个疾病分组的 ClinVar F1 均列第一,获国际学界独立验证。
Nvwa、Huatuo、HERMES 覆盖跨物种表达、细胞类型特异调控与 40 类序列功能簇,构成世界模型的内核。
Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.
核心成果 PUBLISHED TRACK RECORD
覆盖序列到功能的关键能力
团队成员为相关成果的第一作者或通讯作者。

- 核心成果
- 跨物种、单细胞分辨率的序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种验证,测试基因在训练期间完全未见过。
- 体系定位
- 跨物种「序列→细胞状态」基座模型,为世界模型提供细胞语境下的功能判断基础。

- 核心成果
- 在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;覆盖 20 种组织、44 类细胞、13,182 个候选细胞类型特异调控变异。
- 体系定位
- 承担「信号作用的细胞 / 组织语境判定」功能,是系统机制归因的核心环节。

- 核心成果
- 外部基准测试中,三项疾病分组 ClinVar F1 均列第一(CENO 报告)。
- 体系定位
- 主力前沿 S2F 模型,承担候选压缩环节的功能证据打分,同时作为 Model + Agent 基准的基线模型。

- 核心成果
- 迄今规模最大的 sequence-to-function 模型;将海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
- 体系定位
- Scaling 路线关键节点;40 类功能词表是机制假设可解释性的核心来源。
04 MODEL FACTORY
核心壁垒是自进化的
模型生产体系
我们自研 AI Infra(DeepGeSeq),把造模过程本身做成可调度的生产线。人工只设证据边界,Infra 持续构建下一代 SOTA 模型——面向疾病、组织与合作语境自动产出。
自研 AI Infra 自动完成模型微调与迭代。人工只设定证据边界与决策门槛,Infra 自己跑完「建模 → 预测 → 外部验证 → 生成训练信号 → 微调下一版」。
在人类细胞系 K562、完全独立留出的染色体测试集上,首版自动微调使 ATAC 任务 MAE 下降 91.9%,R² 由负转正。
DeepGeSeq 是已发表的 AI Infra。壁垒不在某一版权重,而在这条生产线能持续产出下一代 SOTA 模型。
用 AI 创造 AI:自主构建微调模型使 ATAC 任务误差下降 90% 以上
Agent 自动完成「建模→预测→外部验证→生成训练信号→微调下一版模型」全流程,人工仅设定证据边界与决策门槛。在人类细胞系 K562 上,首版自动微调模型,在完全独立留出的染色体测试集上,表现已显著优于原始基准模型。
- Frozen model→
- Leakage-aware split→
- Predict→
- Candidates→
- External validation→
- Fine-tune→
- Frozen benchmark↺
| 指标(frozen chr8 · n = 2,520) | 基准模型 | Fine-tune V0 | 变化幅度 |
|---|---|---|---|
| ATAC · MAE | 5.947 | 0.482 | −91.9% |
| ATAC · R² | −182.8 | 0.469 | 由负转正 |
| ATAC · Pearson | 0.658 | 0.690 | +0.032 |
| H3K27ac · RMSE | 4.972 | 4.433 | −10.8% |
| H3K27ac · R² | 0.122 | 0.302 | +0.180 |
本案例数据与微调基础设施来自已发表的 DeepGeSeq(Bioinformatics, 2026)。发表的是 AI Infra;还在自进化的是生产线。

- 核心成果
- 首个内置智能体技能、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
- 体系定位
- 模型工厂执行层,可面向疾病、组织与合作语境快速生成与适配专项模型。
05 LINKX WORLD MODEL
LinkX 世界模型
自研模型是内核,全球前沿模型是弹药。S2F Agent 用合同把开放的生物学问题收成可检查、可回归的执行——一次干预,给出机制假设、证据边界和下一步实验。
输入
- 序列 × 组织 / 细胞语境在特定生物学语境下判断功能。
- 干预:变异 / 编辑 / 暴露一次干预进入世界。暴露是输入槽位,与变异、编辑并列。
S2F AGENT · CONTRACT-DRIVEN HARNESS
- OmniReg-GPT
- Nvwa
- Huatuo
- HERMES
- AlphaGenome
- Borzoi
- Evo 2
- GPN
PLAYBOOKS · 4 WORKFLOWS轨道预测 · 序列嵌入 · 模型微调 · 变异效应
- 01 Agent Core使命、路由策略与安全边界。把开放问题收成可执行任务。
- 02 Registry输入 schema、任务合同、输出合同与恢复策略。机器可读的控制面。
- 03 Skills11 项模型技能:自研内核 + AlphaGenome、Borzoi、Evo 2 等外部前沿。模型语法留在技能层。
- 04 Playbooks四类生物学工作流:轨道预测、序列嵌入、微调、变异效应。任务与模型解耦。
- 05 EvalsRouting、Groundedness、Task success。幻觉与越权调用被合同拦住。
- 06 Runtimeroute → validate → plan → execute → verify → recover。每一步可检查、可回归。
- 用户意图→
- 路由 / 澄清→
- 校验输入→
- 生成计划→
- 执行→
- 核验产出→
- 恢复回路↺
出口
- 多模态功能判断表达、可及性、进化约束同时给出。
- 支持 / 反证 / 不确定度主张与反对证据并列,预测不升级成因果。
- 下一步实验,或明确终止出口是可执行的下一步,或一张停的理由。

- 核心成果
- 面向 S2F 的 skill-grounded 智能体;统一编排 11 项模型技能(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
- 体系定位
- 世界模型编排层的公开学术版本,把模型广度收敛为单一任务判断精度。
同一基准下,组合推演超过最强单模型
在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),达到预设决策门槛;所有对比项均在相同数据划分、相同标签、相同指标下完成评测。
54 组配对案例测试中,S2F Agent 通过率 100%,GPT-5.5 通用 Agent 通过率为 22.22%;McNemar 检验 p = 4.55e-13。
| 测试维度 | S2F Agent | GPT-5.5 | 差值 |
|---|---|---|---|
| Routing | 100.00% (23/23) | 21.74% (5/23) | +0.783 |
| Groundedness | 100.00% (8/8) | 0.00% (0/8) | +1.000 |
| Task success | 100.00% (23/23) | 30.43% (7/23) | +0.696 |
| 整体表现 | 100.00% (54/54) | 22.22% (12/54) | +0.778 |
垂直场景成功率显著领先通用型智能体。公开学术版本:S2F Agent(2026)。
06 TYPICAL SCENES
同一套世界模型,
四类典型场景
从模型自进化、靶点发现、功能注释到个体基因组。四个已完成的典型场景,用来检验同一套架构换任务之后是否仍然成立。它们不是能力边界。
通用基础模型并不能直接读实验室自己的功能基因组。S2F-Agent 自主完成数据规约、微调与评估,把基因组基础模型适配为该场景的垂类模型。
在 ENCODE K562 的 ATAC 与 H3K27ac 定量谱上,hold-out 预测成立,并能从序列中区分 primed 与 active 两类调控状态。
留下的是可复用的垂类模型资产。复杂疾病的关联空间远大于可实验空间。真正要做的,是从中找出少数具有机制意义、可能被干预的轴。
系统将功能扰动、进化约束与精细定位置于同一工作流,从 16,607 个冠心病相关变异中优先出 42 个高置信候选。候选带有组织上下文——肝脏、内皮、血管。已知的肝脏 SORT1 轴被独立回收,作为方法学对照。
从关联空间压到少数可能被干预的机制轴。功能是情境化的。注释也应当是。
同一套多模态解释扩展到 25 万以上多性状 GWAS 变异,按组织、模态与性状给出分子后果。绝大多数位点并非全局功能变异;顶层多模态一致约为 0.22%。
新性状进入同一框架,不必重写流程。临床目录记录的是已知事项。个人基因组的大部分并不在其中。
传统临床注释通常每人仅保留 3–9 个已标注位点。S2F-Agent 在证据门控下将优先功能假说扩展至约 1,700–2,900 条,并约束表述边界。12 个表型组中,9 组保留机制线索;全部停留在研究假说层。
覆盖从临床目录之外展开,表述停在证据允许的边界。07 PUBLIC PROOF
冠心病:
世界模型的公开验证
场景 02 的公开展开。遗传起点是 Aragam 等百万样本 CAD 研究(Nature Genetics, 2022;PMID 36474045)。下面把筛选流程与证据包格式摊开。
多模型交叉,组织特异机制可复核
AlphaGenome、Borzoi、GPN 等互补视角被合同约束到同一条执行链:组织特异调控、转录扰动、进化约束同时给出,再与 GTEx eQTL 对齐。
- 多模型交叉评分→
- 组织特异调控方向→
- eQTL / 机制对齐→
- 证据包交付
16,607 → 42
- 16,607CAD 相关显著变异
- 42统计—功能双支持的优先候选
从 16,607 个 CAD 相关变异收敛到 42 个高优先候选。系统找回肝脏 SORT1 轴:组织、基因与调控方向同时对齐,作为可复核的机制样例。
已知肝脏脂质机制被重新定位为组织特异调控事件:组织、基因与方向同时对齐,作为证据包里可复核的机制样例。
每条候选机制以「变异 → 分子事件 → 表型」链条呈现,并同时给出支持证据数、反证数、不确定度与决策结论。第一条为已公开的 PCSK9 机制,其余客户项目按 NDA 脱敏。
rs11591147 → 肝细胞 PCSK9 功能丧失 → PCSK9 活性 ↓ → LDL-C ↓ → ASCVD 风险 ↓
→ 内皮细胞特异性调控失衡 → → 血管表型
08 BUSINESS MODEL
给创新药企的
靶点立项基础设施
卖给药企的,是可审计的功能证据包。合作从客户既有靶点组合的系统重审开始。格式锁定,换名单就能再跑。
商业模式
- 01买方
创新药企与转型中的传统药企。小分子、抗体、核酸,立项的第一问相同:这个基因值不值得动、往哪边动、什么情况下终止。
- 02交付
可审计的功能证据包。同一套格式,换一张名单就能再跑。合作从客户既有靶点组合的系统重审开始。
- 现在靶点立项的功能证据
标准化证据包进入药企立项决策。
- 随后合作回流,模型随使用变准
每一次立项合作成为训练信号,世界模型跟着变准。
- 再后高确信机制上的共同 IP
当同一高确信机制被反复给出,再谈联合开发与权益。
新药立项的第一问,与下游模态无关
小分子、抗体、核酸,立项的第一问相同:这个基因值不值得动、往哪边动。LinkX 回答这一问。分子设计、递送与临床在下游。
- 疾病锚定→
- 靶点确证→
- 方向判定→
- 分子设计→
- 开发与递送→
- 临床验证
09 TEAM
核心团队

鲍志炜
浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,从 0 到 1 打造覆盖医疗全流程的百余个 AI 产品,落地百余家三甲医院并推动数亿元有效合同;国内最大生物信息学社区 BioLinkX 创始人。现全面负责公司建设、团队管理、融资、商业策略与客户拓展。

李佳琦
浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制研究。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表成果发表于 Nature Genetics、Nature Communications、Bioinformatics 等顶级期刊。全面负责模型科学、技术路线、评测体系与研发团队管理。
10 THE RAISE
本轮融资 2,000 万
支持 12 个月运营,团队扩至约 10 人。用于世界模型的产品化与规模化应用;12 个月内,与 1–2 家创新药企达成付费立项合作。
资金用途与对应里程碑 TOTAL RMB 20M · 12 MONTHS
| 资金主线 | 明细科目 | 金额及占比 | 对应里程碑 |
|---|---|---|---|
| 模型工厂与算力 | 算力、云服务、数据与生产线运转 | 250 万 · 12.5% | 自进化 Infra 持续产出下一代模型 |
| 证据包产品化与客户项目 | 格式锁定、交付流水线、首批药企项目 | 600 万 · 30.0% | 同一格式的证据包,可重复交付 |
| 商务拓展与团队建设 | 人才招聘、药企对接、客户成功 | 750 万 · 37.5% | 落地 1–2 家付费药企,实现首笔收入 |
| 运营保障与风险准备 | 风险准备金、产品基础设施、办公行政 | 400 万 · 20.0% | 覆盖交付延期、招聘延迟与融资周期缓冲 |
11 THIS ROUND
本轮目标
- 01把证据包格式锁成可重复交付的产品
- 02落地 1–2 家药企付费立项合作,实现首笔收入
- 03自进化 Infra 面向合作语境产出下一代模型
- 04每一笔立项合作回流进生产线
12 VISION
在 AI 时代下,
无限扩展中心法则的边界
序列是生命的第一性原理,中心法则奠定了生命信息单向编译的底层规则。面对疾病高度异质性、药效个体差异显著的行业痛点,传统「人群平均」研发范式始终无法建立序列锚定功能、机制与治疗的底层体系。我们以序列为核心原点,正向打通碱基到表型的全链路映射,反向从目标表型精准推导干预靶点。当下以靶点立项验证价值,长期迈向个体基因组级精准成药,目标成为生命科学的底层计算基础设施。
生物学的 Scaling Law:两条曲线实现能力规模化跃迁
这一终局目标能否落地,核心取决于两条可验证、可自进化的技术曲线能否持续推进。二者共同收敛为序列到功能的底层统一语法,构成 LinkX 的技术路径。
持续扩充生物序列语料,学习序列内在的生成语法。
- 语料演进路径:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
- 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
- 参数规模:117M → 270M → 500M → 2B+,配套 compute-optimal 算力扫描
持续扩充功能观测,沉淀序列到功能的映射。
- 功能图谱规模:当前 137,127 组(HERMES)→ 统一本体论下全量公共与私有观测数据
- 功能模态覆盖:表达、剪接、染色质、转录因子结合、甲基化、三维互作、单细胞、扰动实验
- 输出分辨率:窗口聚合 → 单碱基、增强子-基因关联、变异效应解析
三层语法构成完整的序列-功能语言体系,是未来成为行业基础设施的核心标准。
采用 BPE / k-mer / 单碱基 Token 体系,承载序列组合语法规则
覆盖启动子、增强子、转录因子结合、组蛋白状态等功能元件,对应 HERMES 定义的 40 类序列功能簇
定义增强子-启动子兼容性、基序-转录因子结合、变异效应方向等序列-功能映射逻辑
