LINKX · GENOME × EXPOSURE WORLD MODEL · AUG 2026

从序列到表型:重构生命功能的计算范式

AI for Science · 生命世界模型 · Genome × Exposure

范式差异虚拟细胞囿于已知细胞状态的拟合,能力边界受限于既有扰动目录;LinkX 以「基因组 × 暴露」为第一性输入,直接计算序列与环境交互后的功能输出与表型走向,在计算维度打通序列到表型的完整闭环。

核心实证盲测回测显示:12 个核心靶点中,75% 获后续独立成药性验证,50% 进入临床证据阶段。靶点发现是该体系首个完成验证、商业价值的落地出口。

GENOME × EXPOSURE → FUNCTION → PHENOTYPE

02 THE BOTTLENECK

靶点发现是
药物研发核心瓶颈

靶点发现是药物研发最上游、价值最高的环节,立项判定所需的功能证据,正是 LinkX 能力链 的直接输出。而这一环节恰恰被三大结构性问题锁死,构成当前研发的效率天花板。

01靶点决策偏差直接推高研发损耗

全球药物研发临床失败超 50% 源于靶点选择偏差。具备遗传学证据支撑的靶点,成药概率较传统方式提升 2.6 倍,且该优势随「变异 - 基因」归因置信度提升持续增强——归因置信度直接决定靶点证据的价值。

02靶点立项受限于自然样本供给

传统靶点发现高度依赖自然样本:需依托人群缺失突变、病人组织功能图谱方可启动立项,行业内成熟靶点长期稀缺,大多依赖偶然发现与验证。

03九成基因组区域尚未进入研发管线

基因组 90% 以上为非编码区,私有突变、剪接调控、lncRNA 等领域因缺乏功能证据,无法进入研发管线,大量潜在成药价值尚未释放。

数据来源:Minikel EV, Painter JL, Dong CC & Nelson MR. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0。

03 THE PARADIGM SHIFT

序列第一性原理的
范式突破

核心变革:先计算预判,后实验验证。传统靶点立项遵循「先获取功能证据,后启动研发」的跟随逻辑,基于观测数据训练的模型也受同样限制:只能判断已经被实验测量过的对象,无法超出已知边界。LinkX 重构底层规则:碱基扰动后的 RNA 调控效应,可先通过计算完成预判,再经实验验证落地。功能可预测性是方法学换代的核心标志。

三大传统前提对应三项技术突破 PARADIGM COMPARISON

传统立项前提传统模式边界技术突破商业价值
依赖人群自然缺失突变仅能针对有天然携带者、表型可测的少数基因立项支持任意 DNA 序列输入,不依赖人群天然样本私有突变、深内含子和编辑产物也能先给出分子功能与实验优先级
依赖病人组织图谱测序跨器官、跨病种研发成本极高序列为第一性输入,换病种仅需切换场景语境图谱构建前即可预判序列价值,降低试错成本
依赖细胞 / 队列 QTL 证据私有突变、深内含子、编辑序列为盲区可对任意 DNA 序列完成功能预判罕见病、碱基编辑产物可在合成前完成评估

技术边界说明:纯序列输入存在语境依赖上限,同一序列在不同细胞中的功能输出存在差异。体系内同步配置细胞与组织语境模型及跨模型交叉验证机制;序列为第一性输入,而非唯一输入。

04 THE CAPABILITY MAP

基因组 × 暴露:
一条完整的功能计算链

疾病风险并非仅由细胞自身状态决定,而是基因组与环境暴露长期相互作用的结果。LinkX 体系分为输入、功能、决策、表型四层架构,形成了从任意序列到表型走向的完整计算链路。

  1. 输入层任意 DNA 序列

    不依赖人群天然样本,无携带者的位点、深内含子区域、人工编辑序列均可作为输入。

  2. 输入层外部暴露与环境扰动

    将暴露与环境作为与序列并列的第一性输入,覆盖细胞外因素导致的疾病风险来源。

  3. 功能层多模态调控功能读出

    可在细胞与组织的特定语境下,输出基因表达、剪接、染色质可及性、转录因子结合、甲基化及三维互作等多维度结果。

  4. 功能层代谢与蛋白互作

    在调控层预测的基础上,进一步延伸至代谢与蛋白互作层面,补全从功能到表型的完整机制链条。

  5. 决策层可审计证据包

    支持证据、反证与不确定性并列输出,附实验优先级与决策标准,可在 NDA 下复核。

  6. 表型层表型走向与干预点

    由功能推及表型,并反向定位可干预节点,是该体系的终局形态。

与既有世界模型路线的差异 WORLD MODEL COMPARISON

对比维度虚拟细胞 / 扰动图谱路线序列语言模型路线LinkX
建模对象细胞状态序列自身的语法序列与环境交互后的功能
输入边界已观测的扰动目录任意序列任意序列 × 暴露与环境
核心输出细胞表型序列似然与生成多模态功能读出,并延伸至表型
天然样本依赖需先有扰动实验
机制可解释性多以嵌入表示多以嵌入表示40 类功能词表与三层语法
可审计交付物未见对外标准化未见对外标准化证据包:支持证据、反证与不确定性

对比口径说明:上表按技术路线分类,不指向具体公司;各路线特征依其公开表述归纳,不含未公开信息。

05 MODEL PRODUCTION SYSTEM

可迭代的
模型生产体系

核心壁垒并非单点模型,而是可规模化、可持续迭代的模型生产工程体系。

01OmniReg-GPT 性能达全球 SOTA

在上海人工智能实验室发布的 CENO 公开基准测试中,OmniReg-GPT 在三个疾病分组的 ClinVar F1 指标上均位列第一,技术能力获国际学界验证。

02用 AI 创造 AI

以自研智能体自动化完成模型微调与迭代,垂类模型 MAE 降幅超 90%,具备持续产出世界级模型的工程化能力。

03体系化产能构建长期壁垒

核心竞争力并非单一模型,而是可规模化复制、可持续迭代的模型生产体系,保障长期技术领先性。

OmniReg-GPT · CENO 外部基准 · 疾病分组 ClinVar F1

Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.

AI4AI · DEEPGESEQ · K562 CASE

用 AI 创造 AI:自主构建微调模型使 ATAC 任务误差下降 90% 以上

Agent 自动完成「建模→预测→外部验证→生成训练信号→微调下一版模型」全流程,人工仅设定证据边界与决策门槛。在人类细胞系 K562 上,首版自动微调模型,在完全独立留出的染色体测试集上,表现已显著优于原始基准模型。

  1. Frozen model
  2. Leakage-aware split
  3. Predict
  4. Candidates
  5. External validation
  6. Fine-tune
  7. Frozen benchmark
指标(frozen chr8 · n = 2,520)基准模型Fine-tune V0变化幅度
ATAC · MAE5.9470.482−91.9%
ATAC · R²−182.80.469由负转正
ATAC · Pearson0.6580.690+0.032
H3K27ac · RMSE4.9724.433−10.8%
H3K27ac · R²0.1220.302+0.180

本案例数据与微调基础设施来自已发表的 DeepGeSeq(Bioinformatics, 2026)。

六项自研模型成果 PUBLISHED TRACK RECORD

相关成果已于顶刊发表,
实现序列到功能世界模型全栈布局

团队成员均为相关成果的第一作者与通讯作者。

2022 · Nature GeneticsNvwa
Nvwa 论文首页
核心成果
全球首个单细胞分辨率的序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种验证,测试基因在训练期间完全未见过。
体系定位
跨物种「序列→细胞状态」基座模型,为 S2F 系统提供细胞语境下的功能读出基础。
查看正式发表页面
2023 · Nature CommunicationsHuatuo
Huatuo 论文首页
核心成果
首个在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;覆盖 20 种组织、44 类细胞、13,182 个候选细胞类型特异调控变异。
体系定位
承担「信号作用的细胞 / 组织语境判定」功能,是系统机制归因的核心环节。
查看正式发表页面
2025 · Nature CommunicationsOmniReg-GPT
OmniReg-GPT 论文首页
核心成果
外部基准测试中,三项疾病分组 ClinVar F1 均列第一(CENO 报告);跨全部 ClinVar 任务的 family-level 综合分首位为 CENO-1B。
体系定位
主力前沿 S2F 模型,承担候选压缩环节的功能证据打分,同时作为 Model + Agent 基准的基线模型。
查看正式发表页面
2026 · BioinformaticsDeepGeSeq
DeepGeSeq 论文首页
核心成果
首个内置智能体技能、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
体系定位
模型工厂执行层,可面向疾病、组织与客户语境快速生成与适配专项模型。
查看正式发表页面
2026 · bioRxiv PreprintHERMES
HERMES 论文首页
核心成果
迄今规模最大的 sequence-to-function 模型;将海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
体系定位
Scaling 路线关键节点;40 类功能词表是机制假设可解释性的核心来源。
查看正式发表页面
2026 · bioRxiv PreprintS2F Agent
S2F Agent 论文首页
核心成果
首个专为 S2F 建模设计的 skill-grounded 智能体;统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
体系定位
引擎区 S2F Agent 的公开学术版本,实现将模型广度收敛为单一任务判断精度。
查看正式发表页面

06 S2F AGENT

S2F Agent:
多智能体协同的功能预测

实验室里的 SOTA 模型,落地到真实研发场景往往会出现效果折损;我们通过多智能体协同编排,将多模型的能力广度收敛为可复现、可落地的精准任务判断。

FROZEN CAD BENCHMARK · AGENT ABLATIONS

同一基准下性能超越 AlphaGenome

在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),达到预设决策门槛;所有对比项均在相同数据划分、相同标签、相同指标下完成评测。

S2F AGENT VS GENERAL AGENT · 54 PAIRED CASES
+77.8pp

54 组配对案例测试中,S2F Agent 通过率 100%,GPT-5.5 通用 Agent 通过率为 22.22%;McNemar 检验 p = 4.55e-13。

测试维度S2F AgentGPT-5.5差值
Routing100.00% (23/23)21.74% (5/23)+0.783
Groundedness100.00% (8/8)0.00% (0/8)+1.000
Task success100.00% (23/23)30.43% (7/23)+0.696
整体表现100.00% (54/54)22.22% (12/54)+0.778

垂直场景成功率显著领先通用型智能体。公开学术版本:S2F Agent 预印本(bioRxiv, 2026)。

07 THE CASE

核心案例

CAD 靶点回测:
全流程盲测设计与实证结果

以 Aragam 等于 2022 年 12 月 6 日发表于 Nature Genetics 的百万样本 CAD 研究(PMID 36474045,GWAS Catalog 编号 GCST90132314)为时间零点。源研究覆盖 181,522 例病例、1,165,690 名参与者,结果数据冻结于 2026 年 8 月 17 日。

01病种选择:高公信力验证场景

选择冠心病作为验证场景,核心原因是其遗传数据完备、临床证据充分,验证结果具备行业公信力,是行业内公认最适合做证伪验证的标杆病种。

02盲测规则:严格隔绝后续信息

以 2022 年 12 月为时间节点,完全屏蔽节点后的研究数据;新颖性判定排除源研究自身成果,全流程无信息泄漏,是真正意义上的事后盲测验证。

03全流程:从原始序列到核心靶点

从原始序列出发,经多轮层层筛选,从万级遗传变异中锁定 12 个高置信核心靶点。

盲测规则规则前置冻结

排序规则前置冻结,全流程无信息泄漏

本回测为严格后验验证,四项规则在结果生成前已全部冻结:所有方法在同一 557 变异 / 154 位点池内排序;复核预算 K = 51 / 37 在结果可见前锁定;新颖性判定排除源研究自身数据;显著性检验采用 5,000 次位点聚类 bootstrap。提前冻结所有规则,核心是为了避免「筛选规则适配已知结果」的过拟合问题,确保验证结果真实可信。

  1. 时间零点 2022-12-06
  2. 排除源研究数据
  3. 统一 557 / 154 排序池
  4. 冻结预算 K = 51 / 37
  5. 解封 2023–2026 记录
  6. 位点聚类 bootstrap ×5,000
筛选流程压缩比 326×

16,607 → 12

  1. 16,607源 GWAS / S2F 变异总量
  2. 557进入排序环节 · 对应 154 个位点
  3. 51优先输出变异 · 对应 37 个位点
  4. 12最终核心靶点
同预算增益 · 相对纯 PIP 排序+33.3%

冻结预算 K = 51 条件下,PIP + S2F 组合命中 16 个,纯 PIP 排序命中 12 个;位点层面 17 个对 14 个,提升 21.4%。同等实验预算下命中数更高,直接对应客户的实际采购价值。

35 / 51

这些优先变异,在源研究发表前均未被明确证实与冠心病相关。其中 31 个(88.6%)至少具备一类额外证据,12 个至少具备两类。四类证据并非全部统计独立,因此为「多证据支持」,而非「多次独立验证」。

实证结果:75% 靶点获成药性验证 DRUGGABILITY AUDIT

12 个核心靶点包含 9 个进入成药性审计靶点 + 3 个 biology-first 靶点,75% 与 50% 占比均以 12 为分母计算。

实证结果TIER A–D

75% 靶点获独立成药性验证12 个盲测筛选的核心靶点中,75% 在 2022 年后被独立研究验证具备成药性,50% 已进入临床证据阶段,准确率显著优于传统遗传学筛选方法。

传统方法盲区靶点被率先识别多个传统方法无证据支撑的靶点,被 LinkX 率先识别并验证。以 SORT1 为例,其在行业标准数据库中成药性标注为零,但审计口径下已有 Phase 3 阶段抗体药物,充分体现「先算后验」范式的突破价值。

全流程可追溯、可复现部分已验证靶点可披露名称,逐变异状态、全排序指标与输入哈希均保留在可复现证据包中,可在 NDA 协议下开放复核。

75%

核心靶点已验证成药性(9 / 12)

50%

已有临床或批准药物(6 / 12)

可披露的 9 个靶点成药性审计 DRUGGABILITY AUDIT

靶点基因映射依据成药验证最高研发阶段
PCSK9rs471705;GTEx 配对抗体、siRNA;ASCVD / 降脂已批准
SORT1rs12740374;Open Targets mapper 综合分 0.795(High);GTEx + L2G/coloc 双支持抗 SORT1 单抗 Latozinemab(CHEMBL4650439);另有 affibody-peptide、高质量小分子结合口袋Phase 3(额颞叶痴呆 FTD-GRN,非 CAD 适应证;已终止)
LIPArs1412444;Medium;GTEx + L2G/coloc蛋白替代药物 Sebelipase alfa已批准(LAL 缺乏症,非 CAD 适应证)
FN1rs1250247;Medium;源研究精确匹配抗体 / 融合蛋白;ocriplasminPhase 3 / 已批准(非 CAD 适应证)
GLP1Rrs1155347;心代谢成熟靶点多款 GLP-1 受体激动剂已批准
NOS3rs3918226Tilarginine acetate,心血管适应证Phase 3(已终止)
SCARB1rs7296737 / rs10846744;Medium;GTEx + L2G/coloc高质量配体、小分子结合剂;SR-BI 抑制剂药理机制明确临床前可开发阶段
ANGPTL4rs116843064;Medium配体结合结构明确、抗体可及、治疗性拮抗机制成立临床前可开发阶段
ABCG8rs4245791;Medium;源研究 + 后续研究精确匹配结构明确、抗体可及临床前可开发阶段

统计口径:前 6 个计入 50% 临床 / 已批准比例,全部 9 个计入 75% 成药性验证比例。其中 3 个靶点的适应证与 CAD 无关(SORT1 为额颞叶痴呆、LIPA 为 LAL 缺乏症、FN1 为肿瘤与眼科)。成药性验证与疾病验证为两个独立维度,行业标准口径仅审计前者,由此形成资产错定价空间。

08 BUSINESS MODEL

商业模式:
靶点授权与联合开发

核心交付:高置信靶点、完整证据链、可交易 IP。首单合作以客户既有靶点组合为对象,按统一审计标准完成重审,交付可验证的评估结论;合作门槛低、决策链路短。

商业模式

  • 01
    客户定位

    聚焦创新药企与转型中的传统药企,覆盖小分子、抗体、核酸等多模态立项需求,均为高付费能力、强需求刚性的 B 端客户。

  • 02
    合作模式

    里程碑付费 + 联合开发 + IP 授权,兼顾短期现金流与长期权益增值。

  • 03
    交付标准

    高置信靶点 + 完整成药性证据链 + 可交易 IP,直接匹配药企管线立项需求。

  • 04
    商务进展

    已与多家头部药企启动深度对接。

变异到实验证据包

每条候选机制以「变异 → 分子事件 → 表型」链条呈现,并同时给出支持证据数、反证数、不确定度与决策结论。第一条为已公开的 PCSK9 机制,其余客户项目按 NDA 脱敏。

LINKX · EVIDENCE PACKAGE样例 · NDA 项下
机制 #1 · 优先级 高 · 已公开

rs11591147肝细胞 PCSK9 功能丧失PCSK9 活性 ↓ → LDL-C ↓ → ASCVD 风险 ↓

支持证据 4反证 1不确定度 推进
机制 #2 · 优先级 中 · 客户项目脱敏

内皮细胞特异性调控失衡血管表型

支持证据 3反证 2不确定度 已设终止标准

09 SCENARIO EXPANSION

场景拓展:
从标杆验证到赛道复制

核心定位:一个技术底座,多个赛道出口。拓展沿两个方向同时进行:横向按疾病领域复制既有能力,纵向随能力层推进解锁新场景。

横向:四条疾病领域路径 EXPANSION PATH

拓展方向核心内容
CAD 标杆验证CAD 领域完成方法学验证与标杆案例落地,验证 Sequence-to-Function 范式的普适性。
模态无关的交付层交付的是靶点功能证据与作用方向判定,可直接进入小分子、抗体、核酸等各模态的立项流程。
横向场景复用可拓展至自免、罕见病、IVD 等高价值领域,底层引擎具备多场景复用能力。
平台型成长逻辑公司本质为「一个技术底座,多个赛道出口」的平台型企业,成长空间高于单一管线公司。

纵向:能力层推进解锁的场景 CAPABILITY EXPANSION

能力层解锁场景
暴露与环境层复杂病与慢病的风险归因、可干预暴露识别,覆盖单靠基因组无法解释的风险份额。
代谢层代谢通路层面的机制补全与作用方向判定,扩展至代谢性疾病与营养干预场景。
蛋白互作层由调控读出延伸至蛋白层作用面,支持蛋白降解、互作阻断等模态的靶点评估。
表型层由目标表型反向求解干预点,构成长期的干预设计与资产创制能力。
DRUG PIPELINE · WHERE LINKX OPERATES

全模态通用卡位:锚定药物研发上游决策核心

靶点供给不足是小分子、抗体、核酸药等所有治疗模态共同的上游核心瓶颈。无论分子形态差异多大,药物立项的首要命题始终一致:目标基因是否值得干预、应当朝哪个方向干预。LinkX 核心交付恰好卡位这一共性决策层,不与任何下游模态绑定 —— 分子设计、化学修饰、递送系统属于模态专属的下游环节,上游靶点的成药性与干预方向证据具备跨模态通用性。

干预方向判定是立项成败的关键前提:降表达类核酸药(RNAi、gapmer ASO)需验证基因下调的保护作用,剪接调节、外显子跳跃等上调类模态(如 SMN 上调药物 nusinersen)则需反向验证,方向误判将直接导致项目失败。该判定传统上依赖人群队列证据,而 LinkX 可在无队列覆盖的全新位点上,直接通过计算完成方向预判。

决定项目生死的三大前置环节 —— 疾病锚定、靶点确证、方向判定 —— 全部落在序列层面,构成 LinkX 的核心作业边界;对于核酸药、碱基编辑等分子设计仍处于序列层的模态,我们的能力可进一步延伸至前端序列设计。

  1. 疾病锚定(S2F)
  2. 靶点确证(S2F)
  3. 方向判定(S2F)
  4. 分子设计
  5. 开发与递送
  6. 临床验证

10 COMPETITIVE LANDSCAPE

差异化路线,
构建技术代际优势

同类 AI 制药公司多在传统范式内优化效率,本团队从第一性原理出发,形成技术代际差异。

01同类 AI 制药公司多基于已有遗传学数据做效率优化

本质是传统研发范式的辅助工具,无法突破原有方法的能力边界。

02本团队基于序列第一性原理

覆盖传统方法难以触达的非编码区、私有突变等盲区,形成技术代际领先。

03靶点基因是行业通用交付接口,机制归因才是核心竞争壁垒

不同技术路线最终都交付靶点基因;我们不参与下游分子设计的同质化竞争,而是专注深耕从变异到基因的机制归因——归因的置信度,直接决定靶点的商业价值。

竞争格局

核心能力LinkX本轮拟融资 ¥2,000 万insitro公开披露资本 ≈ 8 亿美元Relation公开披露投资 ≥ 1.01 亿美元Deep Genomics公开披露股权融资 ≥ 2.33 亿美元
以人类遗传学为首要发现入口✓*
跨 DNA、RNA、蛋白、免疫序列专家模型的编排能力✓*
机制优先、不锁定治疗模态的开发路线✓*
轻资产嵌入客户现有数据与实验体系✓*
不依赖细胞 QTL 数据的功能预测覆盖✓*
以暴露与环境作为与序列并列的建模输入◑*
核心产品或对外交付 在建,尚无对外可核结果 部分覆盖或主要内部使用 未公开定位为标准化核心产品

融资额来源于公开信息检索,统计截至 2026 年 8 月 16 日。同业能力标注依各家公开表述归纳。

11 TEAM

核心团队

01 FOUNDER / CEO
鲍志炜

鲍志炜

浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,从 0 到 1 打造覆盖医疗全流程的百余个 AI 产品,落地百余家三甲医院并推动数亿元有效合同;国内最大生物信息学社区 BioLinkX 创始人。现全面负责公司建设、团队管理、融资、商业策略与客户拓展。

团队管理融资商业策略
02 FOUNDER / CHIEF SCIENTIST · CTO
李佳琦

李佳琦

浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制研究。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表成果发表于 Nature Genetics、Nature Communications、Bioinformatics 等顶级期刊。全面负责模型科学、技术路线、评测体系与研发团队管理。

模型科学S2F Agent评测体系

12 THE RAISE

2,000 万融资,
跑通商业闭环

本轮融资支持 12 个月运营,团队规模扩展至约 10 人。

资金用途与对应里程碑 TOTAL RMB 20M · 12 MONTHS

资金主线明细科目金额及占比对应里程碑
模型迭代与算力投入算力、云服务与数据采购200 万 · 10.0%持续巩固 SOTA 技术地位
CRO 湿实验验证与 IIT 推进前瞻实验与 CRO 服务480 万 · 24.0%夯实靶点证据链,启动 1–2 项 IIT
全球 IP 布局IP 申请、法务与合规80 万 · 4.0%锁定核心靶点权益,提交首批专利
商务拓展与团队建设人才招聘、商务拓展与客户项目830 万 · 41.5%落地首批商业化合作,实现首笔收入
运营保障与风险准备风险准备金、产品基础设施、办公行政410 万 · 20.5%覆盖实验延期、招聘延迟与融资周期缓冲

13 NEXT 6–12 MONTHS

短期里程碑:
从验证到落地

  1. 01完成 1–2 个核心疾病领域的靶点库扩增与回测验证
  2. 02落地 1–2 家头部药企商业化合作,实现首笔收入
  3. 03启动 1–2 项 IIT 临床验证,强化证据链
  4. 04持续迭代模型与智能体体系,巩固技术领先性
  5. 05完成首批靶点交付,跑通商业闭环

14 VISION

在 AI 时代下,
无限扩展中心法则的边界

序列是生命的第一性原理,中心法则奠定了生命信息单向编译的底层规则。面对疾病高度异质性、药效个体差异显著的行业痛点,传统「人群平均」研发范式始终无法建立序列锚定功能、机制与治疗的底层体系。我们以序列为核心原点,正向打通碱基到表型的全链路映射,反向从目标表型精准推导干预靶点,在遵循细胞信息规则的基础上,以计算闭合设计闭环,将中心法则的价值从「解释信息流动」升级为「生命可由序列重建、计算与逆向运行」。当下以靶点发现商业化验证价值,长期迈向个体基因组级精准成药,目标成为全球生命科学的底层计算基础设施。

BIOLOGY SCALING LAW · TWO CURVES, ONE MODEL

生物学的 Scaling Law:两条曲线实现能力规模化跃迁

这一终局目标能否落地,核心取决于两条可验证、可迭代的技术曲线能否持续推进。二者共同收敛为序列到功能的底层统一语法,构成 LinkX 的技术路径。

CURVE 01 · DNA LM曲线一:DNA 语言模型(DNA LM)

核心逻辑:持续扩充生物序列语料规模,学习序列内在的生成语法规则。

  • 语料演进路径:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
  • 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
  • 参数规模:117M → 270M → 500M → 2B+,配套 compute-optimal 算力扫描
CURVE 02 · FOUNDATIONAL S2F曲线二:基础 S2F 模型(Foundational S2F)

核心逻辑:持续扩充功能观测数据,沉淀「序列→功能」的精准映射规律。

  • 功能图谱规模:当前 137,127 组(HERMES)→ 统一本体论下全量公共与私有观测数据
  • 功能模态覆盖:表达、剪接、染色质、转录因子结合、甲基化、三维互作、单细胞、扰动实验
  • 输出分辨率:窗口聚合 → 单碱基、增强子-基因关联、变异效应解析
底层三层语法体系 · 平台化能力的技术基石

三层语法构成完整的序列-功能语言体系,是未来成为行业基础设施的核心标准。

底层 Token 词表

采用 BPE / k-mer / 单碱基 Token 体系,承载序列组合语法规则

功能语义词表

覆盖启动子、增强子、转录因子结合、组蛋白状态等功能元件,对应 HERMES 定义的 40 类序列功能簇

关系语法规则

定义增强子-启动子兼容性、基序-转录因子结合、变异效应方向等序列-功能映射逻辑