它改变的是表达、剪接、染色质可及性,还是蛋白活性?信号本身给不出答案。
02 THE PROBLEM
人类遗传学指出方向,
疾病机制仍是黑箱。
GWAS、WES/WGS 与大规模人群队列持续产出海量遗传信号——但信号本身并不直接回答:它做了什么、在哪个生物学环境里起作用、下一步该验证什么。
同一个变异,在不同细胞、组织和疾病环境中的功能可能完全不同。
实验预算有限,哪个机制假设最值得优先验证?
疾病相关基因组的大部分,
仍处于功能暗区。
03 FIRST PRODUCT
LinkX 将人类遗传信号,
转化为可审计的
实验决策。
把一个明确的人类遗传学问题,转化为可复现、可直接进入实验的决策包。
- 输入
- GWAS、WES/WGS、专有组学数据,以及疾病、组织、细胞类型等生物学语境。
- 智能层
- 前沿 S2F 模型群 + S2F Agent。
- 输出
- 优先级排序的机制假设、支持与反对证据、校准后的不确定性、实验优先级与 Go/No-Go 标准。
- 交付物
- Variant-to-Experiment Evidence Package(变异到实验证据包)。
- 目标客户
- 药企与生物科技公司的人类遗传学、功能基因组学与靶点发现团队。
- 验收
- 可复现的运行记录、预先冻结的评测标准、人工科学复核,以及双方约定的前瞻性验证协议。
→ liver chromatin accessibility ↓ → expression ↓ → lipid dysregulation
→ endothelial-specific disruption → → vascular phenotype
04 WHY GENETICS + HARD EVIDENCE
人类遗传证据正在提升
新药研发胜率。
OmniReg-GPT 持续领先 Benchmark。
有人类遗传证据支持的药物机制,临床成功率估计提升 2.6 倍。
Minikel EV, Painter JL, Dong CC & Nelson MR. Refining the impact of genetic evidence on clinical success. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0在上海人工智能实验室联合多家科研机构发布的 CENO 基因组世界模型技术报告中,OmniReg-GPT 在全部三个疾病分组的 ClinVar F1 基准上排名第一。
| 疾病分组 | F1 | 排名 |
|---|---|---|
| 乳腺(Breast) | 0.70 | #1 |
| 心血管(Cardiovascular) | 0.92 | #1 |
| 肾脏(Renal) | 0.98 | #1 |
| 平均 | ≈0.87 | — |
Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.
OmniReg-GPT + S2F Agent 在同一冻结基准上的表现。Results pending.
05 TECHNOLOGY SYSTEM
两个 AI 引擎,
一套复利系统。
LinkX 的生物学世界模型(World Model for Biology)不是一个单一的万能大模型,而是由 specialist 模型群、自进化模型工厂、S2F Agent 与实验反馈组成的复利系统。
- 按需构建特定 context 的 S2F specialist 模型。
- 随数据与生物学需求持续适配模型。
- 把失败分析转化为下一代模型。
- 为每个任务挑选并编排最合适的模型。
- 跨模型、跨模态交叉质证证据。
- 把广阔的发现空间收敛为可执行的实验决策。
- 01 / INPUT人类遗传学 + 私有项目数据
- 02 / MODEL FACTORYSpecialist 模型
- 03 / ORCHESTRATIONS2F Agent
- 04 / DECISION优先级排序的实验
- 05 / FEEDBACK正负实验结果
- 06 / COMPOUNDING更强的模型 · 更深的证据 · 更低风险的机制假设
06 PUBLISHED TRACK RECORD
已发表成果覆盖 Sequence-to-Function 全栈
团队成员均为第一作者 & 通讯作者

- Task
- 从转录起始位点周围的 DNA 序列预测单细胞表达状态,并提取细胞类型相关的保守调控 motif。
- Headline result
- AUROC 0.78 / AUPR 0.59 · 跨 8 个物种,测试基因均为训练中从未见过的基因
- Role in the system
- 跨物种「序列 → 细胞状态」建模基座,是后续 specialist 模型的能力起点。

- Task
- 将序列模型、单细胞图谱与 eQTL / GWAS 证据联合,在 cell- and tissue-context 中解码调控变异。
- Headline result
- 20 种组织 · 44 类细胞 · 357 个细胞簇模型 · 13,182 个候选细胞类型特异调控变异
- Role in the system
- 回答「信号在哪个细胞 / 组织 context 中起作用」的核心能力。

- Task
- Regulatory-genomics foundation model:20 kb 长序列窗口,覆盖表达、染色质可及性、遗传变异与三维基因组任务。
- Headline result
- CENO 报告三项疾病分组 ClinVar F1 全部第一(见 04 节)
- Role in the system
- 当前主力 frontier S2F 模型,也是 Model + Agent benchmark 的基线。

- Task
- 已发表的模型训练、适配和 fine-tuning 基础设施:配置化驱动完整深度学习工作流,含 agentic skill 接口。
- Headline result
- 覆盖 pipeline 验证、已发表模型复现与用户数据 fine-tuning 的系统案例验证
- Role in the system
- Self-Evolving Model Factory 的执行层:efficient adaptation and specialist-model generation。

- Task
- 以 137,127 个功能基因组 profiles 训练的 foundational S2F 模型,覆盖 DNA 甲基化、TF 结合、聚合酶、组蛋白修饰、染色质可及性与 RNA 表达。
- Headline result
- 迄今规模最大的 sequence-to-function 模型;把海量功能观测总结为 40 个 sequence classes 的可解释功能词表
- Role in the system
- Scaling Law 路线的关键探索:功能观测数据越多,模型越能从「预测单点信号」升级为「理解调控语法」。

- Task
- Skill-grounded 智能体编排系统:以 canonical input keys、任务 playbooks 与标准化 contracts,把开放式基因组学问题转译为可复现、可执行的分析。
- Headline result
- 统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2)的工作流,并通过 routing 与 groundedness 评测验证
- Role in the system
- 第二台引擎 S2F Agent 的公开学术版本(见 08 节)。
07 SELF-EVOLVING MODEL FACTORY
自进化模型工厂:
把前沿模型的构建,
变成可复制的流水线
不仅仅是一个 SOTA 模型,而是持续构建 SOTA 模型的 Loop Engineering。
- 01Scientific Question
- 02Task Specification
- 03Data Curriculum
- 04Architecture & Training Recipe
- 05Training / Adaptation
- 06Frozen Evaluation
- 07Failure Analysis
- 08Next-Generation Model
高效适配与 specialist 模型生成(Efficient adaptation and specialist-model generation)。
疾病、组织、细胞特异的 specialist 模型,以及针对客户数据适配的模型。
从科学问题到通过冻结评测的模型时间
— · —每个新 specialist 模型的边际训练成本
— · —人类细胞系 K562 · Finetune V0:ATAC 误差(MAE)−91.9%,R² 由负转正至 0.469(留出测试集 n = 2,520)
MAE −91.9%全流程所需的人工干预比例
— · —AI4AI 闭环已跑通:Agent 自动完成建模、验证与 Finetune,误差下降 90% 以上
Agent 自动完成「建模 → 预测 → 外部验证 → 形成训练信号 → Finetune 下一版模型」,人类只设定证据边界和 Go/No-Go 门槛。在经典人类细胞系 K562 的功能预测任务上,首版自动微调(Finetune V0)已在完全留出的染色体测试集上显著优于原始模型。
- Frozen model→
- Leakage-aware split→
- Predict→
- Candidates→
- External validation→
- Finetune→
- Frozen benchmark↺
| 指标(frozen chr8 · n = 2,520) | 原型 | Finetune V0 | 变化 |
|---|---|---|---|
| ATAC · MAE | 5.947 | 0.482 | −91.9% |
| ATAC · R² | −182.8 | 0.469 | 由负转正 |
| H3K27ac · RMSE | 4.972 | 4.433 | −10.8% |
| H3K27ac · R² | 0.122 | 0.302 | +0.180 |
诚实边界:当前 Finetune 为 V0(仅训练下游 head、冻结 backbone),仅在单一人类细胞系(K562)与两类功能信号上验证;1,308 / 2,520 个样本误差改善,提升主要由高误差样本修复驱动。下一步:复制到更多任务,并升级为全 backbone 的持续自进化。
08 S2F AGENT
S2F Agent 把模型广度,
收敛为可直接指导实验的决策智能。
S2F Agent 不只是调用模型:它会选择、适配、交叉质证,并把模型组合成任务专属的工作流。
- LinkX frontier models
- External frontier models
- DeepGeSeq-generated specialist models
- Statistical genetics and functional genomics tools
- Literature and biological databases
优先级排序的机制、支持与反对证据、校准的不确定性、实验方案与 Go/No-Go 标准。
S2F-agent: Skill-grounded agent for Sequence-to-Function computational genomics workflows · bioRxiv 2026.05.13.724757 (preprint)- 01Plan
- 02Select
- 03Adapt
- 04Cross-Examine
- 05Synthesize
- 06Prioritize
- 07Design
Model + Agent,
显著优于最强单模型
在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),通过预设 GO 门槛;全部对比项均在同一数据划分、同一标签、同一指标下评测。
S2F Agent(0.2145)超过全部单模型与朴素融合(Naive rank ensemble 0.0782 → Structured Agent +0.1363);单模型甚至可能为负相关。诚实边界:最强两路静态 stacker(AG-RNA + AG-REG,0.2206)当前仍高出 0.006,是下一轮 Harness 必须超越的 baseline。数据来自 frozen CAD test(LinkX internal benchmark, Aug 2026)。
同一套 benchmark 里,Harness Agent 对通用 Agent 的真实差距
54 个 paired cases 上,s2f-agent 通过率 100%,GPT-5.5 通用 Agent 为 22.22%;McNemar p = 4.55e-13。
| Suite | s2f-agent | GPT-5.5 | Δ |
|---|---|---|---|
| Routing | 100.00% (23/23) | 21.74% (5/23) | +0.783 |
| Groundedness | 100.00% (8/8) | 0.00% (0/8) | +1.000 |
| Task success | 100.00% (23/23) | 30.43% (7/23) | +0.696 |
| Overall | 100.00% (54/54) | 22.22% (12/54) | +0.778 |
边界说明:GPT-5.5 结果来自 proxy OpenAI-compatible endpoint,非官方 first-party 评估;gpt-5 / gpt-4 / o3-mini 在 probe 阶段返回 503 未进入分母;Codex 与更多 API 模型将按同一协议补测。
OmniReg-GPT + S2F Agent 在 ClinVar 冻结基准上的表现,以及 GPT / Codex 在 CAD numeric-fusion 上的 zero-shot 对照。Results pending.
09 CORONARY ARTERY DISEASE CASE
CAD:
从 16,607 个遗传信号,
到 42 个候选机制,
再到 3 条专有假设
LinkX 选择冠状动脉疾病,是因为它同时具备大规模统计遗传证据、明确的相关组织和细胞、可用于校准的已知机制,以及可执行的功能验证路径。
16,607 个遗传信号
→ 42 个多层证据候选机制
→ 3 条高优先级专有机制假设
- 16,607冠状动脉疾病显著变异↓ 精细定位 · 聚为 191 个区域
- 3,002可信集合变异
- 605PIP ≥ 0.1 高置信变异
- 42多层证据候选机制
42 个多层证据候选机制中,3 条被列为高优先级专有机制假设。
其中 33 / 42 在至少一个冠状动脉疾病相关组织中具有方向一致的基因表达关联证据(eQTL)。
- 1p13 locus
- reduced liver chromatin accessibility
- reduced expression of a metabolic gene
- lipid dysregulation
- higher CAD risk
- Variant near NOS3
- endothelial-specific transcriptional disruption
- impaired vascular-tone regulation
- hypertension
- higher cardiovascular risk
- LPA promoter variant
- reduced liver ATAC-seq signal
- predicted change in Lp(a) regulation
- higher risk of coronary atherosclerosis
本版本中真正的新 target、variant 与完整证据链已脱敏,可在 NDA 下提供;前瞻验证进行中。
对 42 个候选与匹配对照进行适配的并行功能筛选。
选择 3–5 个位点进行内源等位基因编辑。
验证方向一致的分子变化、元件—基因关系、冠状动脉疾病相关细胞功能和独立重复。
10 BUSINESS MODEL + GTM
以付费发现
打开药企合作入口,
以共同开发
分享管线长期价值。
从 Human Genetics 切入,向药物研发全链条扩张。初始买方:药企与 biotech 的 Human Genetics、Functional Genomics 和 Target Discovery 团队。
VERIFIEDEVIDENCE GRAPHLAND-AND-EXPAND · FOUR TIERS
- 01Paid Validation / Evidence Package
一个明确的问题、一套锁定的数据集、一组预先约定的验收标准。
证据包 · 可复现记录 · 20–50 万元假设 - 02Disease Discovery Program
在一个疾病领域内滚动复购的发现周期。
项目首付款 · 研究经费 · 50–150 万元起 - 03Annual Platform Partnership
整合私有数据,部署客户专属的 specialist 模型与工作流。
年度研究框架 · 200–500 万元 / 年假设 - 04Target Option / Co-Development / Licensing
获取优先权费、里程碑付款与共同开发收益分成。
优先权费 · 首付款 · 研发里程碑 · 销售分成
价格为待设计伙伴与实际项目校准的初始商业假设,不代表已签约价格。
11 COMPETITIVE LANDSCAPE
竞争格局
| 核心能力 | LinkX本轮拟融资 ¥2,000 万 | insitro公开披露资本 ≈ 8 亿美元 | Relation公开披露投资 ≥ 1.01 亿美元 | Deep Genomics公开披露股权融资 ≥ 2.33 亿美元 |
|---|---|---|---|---|
| 以人类遗传学为首要发现入口 | ✓* | ✓ | ◐ | ✓ |
| 跨 DNA、RNA、蛋白、免疫序列 specialist 模型的编排能力 | ✓* | ◐ | ◐ | — |
| 标准化、可审计的 Evidence Package(支持证据 + 反证 + 不确定性) | ✓* | — | — | — |
| 直接输出实验优先级与 Go/No-Go 标准 | ✓* | ◐ | ◐ | ◐ |
| 机制优先、不锁定治疗模态的开发路线 | ✓* | ✓ | ◐ | — |
| 轻资产嵌入客户现有数据与实验体系 | ✓* | — | — | — |
融资额来源于公开互联网检索,统计截至 2026-08-16。
12 TEAM
团队成员
两位创始人的组合覆盖原创建模、Agent 工程、生物学判断与医疗商业化。本轮将围绕 B2B 疾病发现、前瞻验证与企业交付,补齐转化生物学、功能实验、企业产品与药企合作能力。

鲍志炜
浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,主导医学 AI 产品化、组织管理与产业合作,创造千万级 AI 医疗落地场景;全国规模最大的生物信息学组织 BioLinkX 创始人。负责公司建设、融资、商业策略与客户入口。

李佳琦
浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、从序列到功能的模型与可解释调控机制。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 的核心作者,代表工作发表于 Nature Genetics、Nature Communications、Bioinformatics 等期刊。负责模型科学、技术路线、评测体系与研发团队。
持续招募中:
- 转化生物学与疾病项目负责人
- 计算基因组与 Model Factory 工程
- 疾病模型、基因编辑与功能实验
- 企业产品、安全部署与 Scientific Solutions
- 药企合作、知识产权与资产 BD
- 药物开发、监管与 CMC 顾问
融资 2,000 万元,支持 12 个月运营,并将团队扩展至约 10 人。核心目标是把创始团队的技术领先,转化为可核验的商业证据:量化模型工厂的增益,验证“模型 + Agent”的系统级优势,前瞻验证 CAD 机制,并形成可持续的商业合作。
- 01 / MODEL模型(Model)
量化模型工厂在速度、成本、性能增益与自动化程度上的实际表现。
- 02 / AGENT智能体(Agent)
在冻结基准上,验证 OmniReg-GPT + S2F Agent 显著优于最强单模型与简单集成。
- 03 / BIOLOGY生物学(Biology)
对 CAD 机制进行前瞻性验证,跑通正负实验反馈闭环。
- 04 / COMMERCIAL商业化(Commercial)
将付费试点转化为疾病项目、年度合作与共同开发权益。
Operationalize the factory. Demonstrate system-level lift. Validate mechanisms. Convert evidence into partnerships. 以上均为本轮拟验证的前瞻性里程碑(benchmark 完成前统一使用 demonstrate 而非 prove),不代表已完成成果;具体数字、时间、负责人、runway 与下一轮触发条件待补。本轮不覆盖正式临床开发、重资产 CMC 或自建重资产实验室。
14 TWO-YEAR AI ROADMAP
通往生物学的
GPT-2 时刻。
- 2026验证楔子:前沿 S2F 智能
已发表 S2F 模型、外部基准验证、S2F Agent v1,以及付费人类遗传学发现项目。
- 2027规模化专家模型:自进化模型组合
打通“任务—模型”自动化闭环,实现低成本场景适配,构建面向疾病、组织与客户语境的专家模型。
- 2028–2029闭合学习循环:生物学世界模型
建成 DNA、RNA、蛋白与免疫专家模型;由 Agent 统一编排,实验数据持续回流。
- 2030–2031生物学的 GPT-2 时刻
建立数据、算力与实验反馈之间的 scaling law;实现跨任务泛化与可预测的能力增长;从 Sequence 走向 Therapy。
生物学 Scaling Law
不断增加生物序列语料,学习序列本身的生成语法
- 序列语料:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
- 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
- 参数规模:117M → 270M → 500M → 2B+,配 compute-optimal 扫描
不断增加功能观测数据,学习「序列 → 功能」的映射
- 功能 profiles:137,127(HERMES)→ 统一 ontology 下的全量公共与私有观测
- 功能模态:表达、剪接、染色质、TF 结合、甲基化、3D contact、单细胞、扰动实验
- 输出分辨率:窗口聚合 → 单碱基、enhancer–gene、variant-effect
BPE / k-mer / 单碱基 token,承载序列组合语法
promoter、enhancer、TF binding、histone state 等——HERMES 40 sequence classes
enhancer–promoter compatibility、motif–TF、variant-effect 方向
- P0 · Calibration0–3 个月
冻结数据、模型、benchmark 与算力预算;跑小规模 scaling 预实验。
- P1 · Two Curves3–9 个月
分别扫描 DNA LM 与 S2F 两条 scaling 曲线,定位瓶颈。
- P2 · Unified S2F9–18 个月
用统一语法词表合并生成式预训练与多任务功能头,产出 Foundational S2F Model v1。
- P3 · Loop Scaling12–24 个月
把 Harness 与 Finetune 接入训练循环,让验证信号回流,形成自进化 Pro 版模型。
经典中心法则描述遗传信息如何从 DNA 流向 RNA 和蛋白质,奠定了现代分子生物学的基础。LinkX 要创造并工程化 AI 时代的中心法则:让不同生命序列在具体患者和生物学环境中的功能可以被计算,让功能与疾病之间的关系可以被实验验证,并让这条信息流能够被反向运行——从目标表型和治疗目标出发,发现、选择并最终设计相应的干预。
模型、实验和患者反馈持续循环,使生物学从观察和解释走向预测、验证和设计。LinkX 不仅希望提出这一法则,更要把它变成可以持续产生治疗方案和药物资产的真实系统。
- 01Sequence × Patient ContextGenome · Transcriptome · Immune State
- 02Function & MechanismCell · Tissue · Molecular Effect
- 03Phenotype & DiseasePatient-specific Relevance
- 04Therapy Selection / DesignRNA · Editing · Protein · TCR
- 05Experiment & Patient FeedbackCorrection · Response · Learning
