全球药物研发临床失败超 50% 源于靶点选择偏差。具备遗传学证据支撑的靶点,成药概率较传统方式提升 2.6 倍——该优势的前提是遗传证据可精准归因至对应基因与作用机制。
02 THE BOTTLENECK
靶点发现是
核酸药研发核心瓶颈
靶点选择偏差是药物临床失败的核心诱因,三大结构性问题共同构成当前赛道的效率天花板。
核酸药赛道增长确定性高,但靶点发现高度依赖自然样本:需依托人群缺失突变、病人组织功能图谱方可启动立项,赛道长期仅有少量经偶然验证的成熟靶点。
基因组 90% 以上为非编码区,私有突变、剪接调控、lncRNA 等领域因缺乏功能证据,无法进入研发管线,大量潜在成药价值尚未释放。
数据来源:Minikel EV, Painter JL, Dong CC & Nelson MR. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0。研究同时指出,该成药概率优势随「变异 - 基因」归因置信度提升而增强。
03 THE PARADIGM SHIFT
序列第一性原理的
范式突破
核心变革:先计算预判,后实验验证。传统核酸靶点立项遵循「先获取功能证据,后启动研发」的跟随逻辑。本技术体系重构底层规则:碱基扰动后的 RNA 调控效应,可先通过计算完成预判,再经实验验证落地。功能可预测性是方法学换代的核心标志。
三大传统前提对应三项技术突破 PARADIGM COMPARISON
| 传统立项前提 | 传统模式边界 | 技术突破 | 商业价值 |
|---|---|---|---|
| 依赖人群自然缺失突变 | 仅覆盖少量肝分泌蛋白靶点 | 支持任意 DNA 序列输入,不依赖人群天然样本 | 无缺失携带者的位点也可完成成药性判断 |
| 依赖病人组织图谱测序 | 跨器官、跨病种研发成本极高 | 序列为第一性输入,换病种仅需切换场景语境 | 图谱构建前即可预判序列价值,降低试错成本 |
| 依赖细胞 / 队列 QTL 证据 | 私有突变、深内含子、编辑序列为盲区 | 可对任意 DNA 序列完成功能预判 | 罕见病、碱基编辑产物可在合成前完成评估 |
技术边界说明:纯序列输入存在语境依赖上限,同一序列在不同细胞中的功能输出存在差异。体系内同步配置细胞与组织语境模型及跨模型交叉验证机制;序列为第一性输入,而非唯一输入。
下游分子设计已是资金密集的成熟赛道,团队聚焦上游核心环节,掌握靶点立项的决策主动权。
04 MODEL PRODUCTION SYSTEM
可迭代的
模型生产体系
核心壁垒并非单点模型,而是可规模化、可持续迭代的模型生产工程体系。
在上海人工智能实验室发布的 CENO 公开基准测试中,OmniReg-GPT 在三个疾病分组的 ClinVar F1 指标上均位列第一,技术能力获国际学界验证。
以自研智能体自动化完成模型微调与迭代,垂类模型 MAE 降幅超 90%,具备持续产出世界级模型的工程化能力。
核心竞争力并非单一模型,而是可规模化复制、可持续迭代的模型生产体系,保障长期技术领先性。
Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.
用 AI 创造 AI:自主构建微调模型使 ATAC 任务误差下降 90% 以上
Agent 自动完成「建模→预测→外部验证→生成训练信号→微调下一版模型」全流程,人工仅设定证据边界与决策门槛。在人类细胞系 K562 上,首版自动微调模型已在完全留出的染色体测试集上显著优于原始基准模型。
- Frozen model→
- Leakage-aware split→
- Predict→
- Candidates→
- External validation→
- Finetune→
- Frozen benchmark↺
| 指标(frozen chr8 · n = 2,520) | 原型模型 | Finetune V0 | 变化幅度 |
|---|---|---|---|
| ATAC · MAE | 5.947 | 0.482 | −91.9% |
| ATAC · R² | −182.8 | 0.469 | 由负转正 |
| ATAC · Pearson | 0.658 | 0.690 | +0.032 |
| H3K27ac · RMSE | 4.972 | 4.433 | −10.8% |
| H3K27ac · R² | 0.122 | 0.302 | +0.180 |
本案例数据与微调基础设施来自已发表的 DeepGeSeq(Bioinformatics, 2026)。
六项自研模型成果 PUBLISHED TRACK RECORD
相关成果已于顶刊发表,
实现序列到功能世界模型全栈布局
团队成员均为相关成果的第一作者与通讯作者。

- 核心成果
- 全球首个单细胞分辨率的序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种验证,测试基因在训练期间完全未见过。
- 体系定位
- 跨物种「序列→细胞状态」基座模型,为 S2F 系统提供细胞语境下的功能读出基础。

- 核心成果
- 首个在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;覆盖 20 种组织、44 类细胞、13,182 个候选细胞类型特异调控变异。
- 体系定位
- 承担「信号作用的细胞 / 组织语境判定」功能,是系统机制归因的核心环节。

- 核心成果
- 外部基准测试中,三项疾病分组 ClinVar F1 均列第一(CENO 报告);跨全部 ClinVar 任务的 family-level 综合分首位为 CENO-1B。
- 体系定位
- 主力前沿 S2F 模型,承担候选压缩环节的功能证据打分,同时作为 Model + Agent 基准的基线模型。

- 核心成果
- 首个内置智能体技能、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
- 体系定位
- 模型工厂执行层,可面向疾病、组织与客户语境快速生成与适配专项模型。

- 核心成果
- 迄今规模最大的 sequence-to-function 模型;将海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
- 体系定位
- Scaling 路线关键节点;40 类功能词表是机制假设可解释性的核心来源。

- 核心成果
- 首个专为 S2F 建模设计的 skill-grounded 智能体;统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
- 体系定位
- 引擎区 S2F Agent 的公开学术版本,实现将模型广度收敛为单一任务判断精度。
05 S2F AGENT
S2F Agent:
多智能体协同的功能预测
实验室 SOTA 与真实研发场景的泛化能力存在落差,多智能体编排把多模型广度收敛为可复现的任务判断。
同一基准下性能超越 AlphaGenome
在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),达到预设决策门槛;所有对比项均在相同数据划分、相同标签、相同指标下完成评测。
54 组配对案例测试中,S2F Agent 通过率 100%,GPT-5.5 通用 Agent 通过率为 22.22%;McNemar 检验 p = 4.55e-13。
| 测试维度 | s2f-agent | GPT-5.5 | 差值 |
|---|---|---|---|
| Routing | 100.00% (23/23) | 21.74% (5/23) | +0.783 |
| Groundedness | 100.00% (8/8) | 0.00% (0/8) | +1.000 |
| Task success | 100.00% (23/23) | 30.43% (7/23) | +0.696 |
| 整体表现 | 100.00% (54/54) | 22.22% (12/54) | +0.778 |
垂直场景成功率显著领先通用型智能体。公开学术版本:S2F Agent 预印本(bioRxiv, 2026)。
06 THE CASE
CAD 靶点回测:
全流程盲测设计与实证结果
以 Aragam 等于 2022 年 12 月 6 日发表于 Nature Genetics 的百万样本 CAD 研究(PMID 36474045,GWAS Catalog 编号 GCST90132314)为时间零点。源研究覆盖 181,522 例病例、1,165,690 名参与者,结果数据冻结于 2026 年 8 月 17 日。
选择冠心病作为验证场景,核心原因是其遗传数据完备、临床证据充分,验证结果具备行业公信力,是最易接受证伪检验的病种。
以 2022 年 12 月为时间节点,完全屏蔽节点后的研究数据;新颖性判定排除源研究自身成果,全流程无信息泄漏,结果为真实后验验证。
从原始序列出发,经多轮层层筛选,从万级遗传变异中锁定 12 个高置信核心靶点。
排序规则前置冻结,全流程无信息泄漏
本回测为严格后验验证,四项规则在结果生成前已全部冻结:所有方法在同一 557 变异 / 154 位点池内排序;复核预算 K = 51 / 37 在结果可见前锁定;新颖性判定排除源研究自身数据;显著性检验采用 5,000 次位点聚类 bootstrap。规则前置的核心意义,在于区分「筛选规则有效」与「测试标签由筛选规则定义」。
- 时间零点 2022-12-06→
- 排除源研究数据→
- 统一 557 / 154 排序池→
- 冻结预算 K = 51 / 37→
- 解封 2023–2026 记录→
- 位点聚类 bootstrap ×5,000↺
16,607 → 12
- 16,607源 GWAS / S2F 变异总量
- 557进入排序环节 · 对应 154 个位点
- 51优先输出变异 · 对应 37 个位点
- 12最终核心靶点
冻结预算 K = 51 条件下,PIP + S2F 组合命中 16 个,纯 PIP 排序命中 12 个;位点层面 17 个对 14 个,提升 21.4%。同等实验预算下命中数更高,直接对应客户的实际采购价值。
优先变异在源研究发表前无严格 CAD 命中记录。其中 31 个(88.6%)至少具备一类额外证据,12 个至少具备两类。四类证据并非全部统计独立,因此为「多证据支持」,而非「多次独立验证」。
实证结果:75% 靶点获成药性验证 DRUGGABILITY AUDIT
12 个核心靶点包含 9 个进入成药性审计靶点 + 3 个 biology-first 靶点,75% 与 50% 占比均以 12 为分母计算。
75% 靶点获独立成药性验证。12 个盲测筛选的核心靶点中,75% 在 2022 年后被独立研究验证具备成药性,50% 已进入临床证据阶段,准确率显著优于传统遗传学筛选方法。
传统方法盲区靶点被率先识别。多个传统方法无证据支撑的靶点,被本体系率先识别并验证。以 SORT1 为例,其在行业标准数据库中成药性标注为零,但审计口径下已有 Phase 3 阶段抗体药物,充分体现「先算后验」范式的突破价值。
全流程可追溯、可复现。部分已验证靶点可披露名称,逐变异状态、全排序指标与输入哈希均保留在可复现证据包中,可在 NDA 协议下开放复核。
核心靶点已验证成药性(9 / 12)
已有临床或批准药物(6 / 12)
可披露的 9 个靶点成药性审计 DRUGGABILITY AUDIT
| 靶点 | 基因映射依据 | 成药验证 | 最高研发阶段 |
|---|---|---|---|
| PCSK9 | rs471705;GTEx 配对 | 抗体、siRNA;ASCVD / 降脂 | 已批准 |
| SORT1 | rs12740374;Open Targets mapper 综合分 0.795(High);GTEx + L2G/coloc 双支持 | 抗 SORT1 单抗 Latozinemab(CHEMBL4650439);另有 affibody-peptide、高质量小分子结合口袋 | Phase 3(额颞叶痴呆 FTD-GRN,非 CAD 适应证;已终止) |
| LIPA | rs1412444;Medium;GTEx + L2G/coloc | 蛋白替代药物 Sebelipase alfa | 已批准(LAL 缺乏症,非 CAD 适应证) |
| FN1 | rs1250247;Medium;源研究精确匹配 | 抗体 / 融合蛋白;ocriplasmin | Phase 3 / 已批准(非 CAD 适应证) |
| GLP1R | rs1155347;心代谢成熟靶点 | 多款 GLP-1 受体激动剂 | 已批准 |
| NOS3 | rs3918226 | Tilarginine acetate,心血管适应证 | Phase 3(已终止) |
| SCARB1 | rs7296737 / rs10846744;Medium;GTEx + L2G/coloc | 高质量配体、小分子结合剂;SR-BI 抑制剂药理机制明确 | 临床前可开发阶段 |
| ANGPTL4 | rs116843064;Medium | 配体结合结构明确、抗体可及、治疗性拮抗机制成立 | 临床前可开发阶段 |
| ABCG8 | rs4245791;Medium;源研究 + 后续研究精确匹配 | 结构明确、抗体可及 | 临床前可开发阶段 |
统计口径:前 6 个计入 50% 临床 / 已批准比例,全部 9 个计入 75% 成药性验证比例。其中 3 个靶点的适应证与 CAD 无关(SORT1 为额颞叶痴呆、LIPA 为 LAL 缺乏症、FN1 为肿瘤与眼科)。成药性验证与疾病验证为两个独立维度,行业标准口径仅审计前者,由此形成资产错定价空间。
07 SCENARIO EXPANSION
场景拓展:
从标杆验证到赛道复制
核心定位:一个技术底座,多个赛道出口。CAD 领域完成方法学验证后,同一技术引擎向商业价值更高的场景横向复制。
四条拓展路径 EXPANSION PATH
| 拓展方向 | 核心内容 |
|---|---|
| CAD 标杆验证 | CAD 领域完成方法学验证与标杆案例落地,验证 Sequence-to-Function 范式的普适性。 |
| 第一增长曲线:核酸药 | 传统方法盲区最大、商业价值最高、技术优势最显著,为当前核心发力方向。 |
| 横向场景复用 | 可拓展至自免、罕见病、IVD 等高价值领域,底层引擎具备多场景复用能力。 |
| 平台型成长逻辑 | 公司本质为「一个技术底座,多个赛道出口」的平台型企业,成长空间高于单一管线公司。 |
第一增长曲线:核酸药
核酸药是继小分子、抗体后的第三代创新药浪潮,为全球医药研发增速最快的核心赛道,产业价值与确定性突出。赛道核心瓶颈在于成熟靶点供给不足,正是本技术体系优势最显著的落地场景。
核酸药的核心药理机制为基因表达下调,因此立项前必须明确作用方向:压低该基因表达是否对患者具有保护作用。该判定可由人类队列证据给出,也可由本体系在无队列覆盖的位点上直接计算得出。决定项目成败的前四个核心环节——疾病锚定、靶点确证、方向判定、序列设计——均发生在序列层面,构成本团队的核心作业边界。
- 疾病锚定(S2F)→
- 靶点确证(S2F)→
- 方向判定(S2F)→
- 序列设计(S2F)→
- 化学修饰与递送→
- 临床验证
PCSK9 → inclisiran 是该路径已验证的成熟先例,也是本次回测的 Tier A 正对照。
08 BUSINESS MODEL
商业模式:
靶点授权与联合开发
核心交付:高置信靶点、完整证据链、可交易 IP。首单合作以客户既有靶点组合为对象,按统一审计标准完成重审,交付可验证的评估结论;合作门槛低、决策链路短。
| 维度 | 核心内容 |
|---|---|
| 客户定位 | 聚焦创新药企、核酸药企业、转型中的传统药企,均为高付费能力、强需求刚性的 B 端客户。 |
| 合作模式 | 里程碑付费 + 联合开发 + IP 授权,兼顾短期现金流与长期权益增值。 |
| 交付标准 | 高置信靶点 + 完整成药性证据链 + 可交易 IP,直接匹配药企管线立项需求。 |
| 商务进展 | 已与多家头部药企启动深度对接。 |
LAND-AND-EXPAND · 四级合作体系
- 01付费验证 / 证据包
针对明确问题、锁定数据集、预设验收标准的单次验证服务。
- 02疾病发现项目
单一疾病领域内滚动复购的周期式发现服务。
- 03年度平台合作
在客户环境内整合私有数据,部署客户专属专家模型与工作流,交付模型产能而非单次报告。
- 04靶点优先权 / 联合开发 / 授权
收取优先权费、里程碑付款并享有共同开发收益分成,包含优先权费、首付款、研发里程碑、销售分成等多层收益。
→ liver chromatin accessibility ↓ → expression ↓ → lipid dysregulation
→ endothelial-specific disruption → → vascular phenotype
09 COMPETITIVE LANDSCAPE
差异化路线,
构建技术代际优势
同类 AI 制药公司多在传统范式内优化效率,本团队从第一性原理出发,形成技术代际差异。
本质是传统研发范式的辅助工具,无法突破原有方法的能力边界。
覆盖传统方法难以触达的非编码区、私有突变等盲区,形成技术代际领先。
专注靶点发现上游环节,差异化卡位高价值稀缺节点。
竞争格局
| 核心能力 | LinkX本轮拟融资 ¥2,000 万 | insitro公开披露资本 ≈ 8 亿美元 | Relation公开披露投资 ≥ 1.01 亿美元 | Deep Genomics公开披露股权融资 ≥ 2.33 亿美元 |
|---|---|---|---|---|
| 以人类遗传学为首要发现入口 | ✓* | ✓ | ◐ | ✓ |
| 跨 DNA、RNA、蛋白、免疫序列专家模型的编排能力 | ✓* | ◐ | ◐ | — |
| 标准化、可审计证据包(支持证据 + 反证 + 不确定性) | ✓* | — | — | — |
| 直接输出实验优先级与决策标准 | ✓* | ◐ | ◐ | ◐ |
| 机制优先、不锁定治疗模态的开发路线 | ✓* | ✓ | ◐ | — |
| 轻资产嵌入客户现有数据与实验体系 | ✓* | — | — | — |
| 不依赖细胞 QTL 数据的功能预测覆盖 | ✓* | — | ◐ | ◐ |
融资额来源于公开信息检索,统计截至 2026 年 8 月 16 日。
10 TEAM
核心团队

鲍志炜
浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,孵化千万级医疗 AI 场景,在百余家国内三甲医院落地;国内最大生物信息学社区 BioLinkX 创始人。全面负责公司建设与团队管理、融资、商业策略与客户拓展。

李佳琦
浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制研究。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表成果发表于 Nature Genetics、Nature Communications、Bioinformatics 等顶级期刊。全面负责模型科学、技术路线、评测体系与研发团队管理。
11 THE RAISE
2,000 万融资,
跑通商业闭环
本轮融资支持 12 个月运营,团队规模扩展至约 10 人。
资金用途与对应里程碑 TOTAL ¥20M · 12 MONTHS
| 资金主线 | 明细科目 | 金额及占比 | 对应里程碑 |
|---|---|---|---|
| 模型迭代与算力投入 | 算力、云服务与数据采购 | 200 万 · 10.0% | 持续巩固 SOTA 技术地位 |
| CRO 湿实验验证与 IIT 推进 | 前瞻实验与 CRO 服务 | 480 万 · 24.0% | 夯实靶点证据链,启动 1–2 项 IIT |
| 全球 IP 布局 | IP 申请、法务与合规 | 80 万 · 4.0% | 锁定核心靶点权益,提交首批专利 |
| 商务拓展与团队建设 | 人才招聘、商务拓展与客户项目 | 830 万 · 41.5% | 落地首批商业化合作,实现首笔收入 |
| 运营保障与风险准备 | 风险准备金、产品基础设施、办公行政 | 410 万 · 20.5% | 覆盖实验延期、招聘延迟与融资周期缓冲 |
12 NEXT 6–12 MONTHS
短期里程碑:
从验证到落地
- 01完成 1–2 个核心疾病领域的靶点库扩增与回测验证
- 02落地 1–2 家头部药企商业化合作,实现首笔收入
- 03启动 1–2 项 IIT 临床验证,强化证据链
- 04持续迭代模型与智能体体系,巩固技术领先性
- 05核酸药方向完成首批靶点交付,验证商业闭环
13 VISION
在 AI 时代下,
无限扩展中心法则的边界
打造从 Sequence 到 Function 的完整生命序列世界模型,探索生物学的 Scaling Law,完成生命科学的真实定律。当下聚焦商业化落地,以实证兑现价值;长期致力于成为全球药物研发的底层基础设施,用计算重构生命科学产业。
生物学的 Scaling Law:两条曲线实现能力规模化跃迁
我们认为,生物学的 Scaling Law 将沿两条可验证、可迭代的技术曲线稳步推进,最终构建序列到功能的底层统一语法,支撑全行业的研发需求。
核心逻辑:持续扩充生物序列语料规模,学习序列内在的生成语法规则。
- 语料演进路径:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
- 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
- 参数规模:117M → 270M → 500M → 2B+,配套 compute-optimal 算力扫描
核心逻辑:持续扩充功能观测数据,沉淀「序列→功能」的精准映射规律。
- 功能图谱规模:当前 137,127 组(HERMES)→ 统一本体论下全量公共与私有观测数据
- 功能模态覆盖:表达、剪接、染色质、转录因子结合、甲基化、三维互作、单细胞、扰动实验
- 输出分辨率:窗口聚合 → 单碱基、增强子-基因关联、变异效应解析
三层语法构成完整的序列-功能语言体系,是未来成为行业基础设施的核心标准。
采用 BPE / k-mer / 单碱基 Token 体系,承载序列组合语法规则
覆盖启动子、增强子、转录因子结合、组蛋白状态等功能元件,对应 HERMES 定义的 40 类序列功能簇
定义增强子-启动子兼容性、基序-转录因子结合、变异效应方向等序列-功能映射逻辑
