LINKX · GENOME × EXPOSURE WORLD MODEL · AUG 2026

从序列到表型:重构生命功能的计算范式

AI for Science · 生命世界模型 · Genome × Exposure

建模对象虚拟细胞类模型以观测过的细胞状态为建模对象,其能力边界受既有扰动目录约束。LinkX 以「基因组 × 暴露」为第一性输入,直接计算序列与环境交互后的功能输出与表型走向。

核心验证数据盲测回测显示:12 个核心靶点中,75% 获后续独立成药性验证,50% 进入临床证据阶段。靶点发现为该体系首个完成端到端验证、且商业价值最高的出口。

GENOME × EXPOSURE → FUNCTION → PHENOTYPE

02 THE CAPABILITY MAP

基因组 × 暴露:
一条完整的功能计算链

疾病风险并非细胞自主产生,而由基因组与暴露长期交互形成。LinkX 沿输入、功能、决策、表型四层构建,实心节点为已具备对外可核结果的环节,描边节点为在建环节。

  1. 输入层任意 DNA 序列

    不依赖人群天然样本,零携带者位点、深内含子与编辑序列均可作为输入。

  2. 输入层外部暴露与环境扰动

    将暴露与环境作为与序列并列的第一性输入,覆盖非细胞自主的疾病风险来源。

  3. 功能层多模态调控功能读出

    表达、剪接、染色质可及性、TF 结合、甲基化与三维互作,均在细胞与组织语境下给出。

  4. 功能层代谢与蛋白互作

    在调控层读出之上延伸至代谢与蛋白互作,补全从功能到表型之间的机制环节。

  5. 决策层可审计证据包

    支持证据、反证与不确定性并列输出,附实验优先级与决策标准,可在 NDA 下复核。

  6. 表型层表型走向与干预点

    由功能推及表型,并反向定位可干预节点,是该体系的终局形态。

与既有世界模型路线的差异 WORLD MODEL COMPARISON

对比维度虚拟细胞 / 扰动图谱路线序列语言模型路线LinkX
建模对象细胞状态序列自身的语法序列与环境交互后的功能
输入边界已观测的扰动目录任意序列任意序列 × 暴露与环境
核心输出细胞表型序列似然与生成多模态功能读出,并延伸至表型
天然样本依赖需先有扰动实验
机制可解释性多以嵌入表示多以嵌入表示40 类功能词表与三层语法
可审计交付物未见对外标准化未见对外标准化证据包:支持证据、反证与不确定性

对比口径说明:上表按技术路线分类,不指向具体公司;各路线特征依其公开表述归纳,不含未公开信息。LinkX 的「表型」与「暴露」两层处于在建阶段,已在上方全景图中单独标注。

03 THE BOTTLENECK

靶点发现是
核酸药研发核心瓶颈

LinkX 能力链 的首个商业出口,落在与其天然同构的赛道:核酸药的干预本身就是序列层面的操作,立项判定所需的功能证据,正是本体系的直接输出。而该赛道最上游、价值最高的环节——靶点发现,恰恰被三大结构性问题锁死,构成当前研发的效率天花板。

01靶点决策偏差直接推高研发损耗

全球药物研发临床失败超 50% 源于靶点选择偏差。具备遗传学证据支撑的靶点,成药概率较传统方式提升 2.6 倍——该优势的前提是遗传证据可精准归因至对应基因与作用机制。

02核酸药立项受限于自然样本供给

核酸药赛道增长确定性高,但靶点发现高度依赖自然样本:需依托人群缺失突变、病人组织功能图谱方可启动立项,赛道长期仅有少量经偶然验证的成熟靶点。

03九成基因组区域尚未进入研发管线

基因组 90% 以上为非编码区,私有突变、剪接调控、lncRNA 等领域因缺乏功能证据,无法进入研发管线,大量潜在成药价值尚未释放。

数据来源:Minikel EV, Painter JL, Dong CC & Nelson MR. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0。研究同时指出,该成药概率优势随「变异 - 基因」归因置信度提升而增强。

04 THE PARADIGM SHIFT

序列第一性原理的
范式突破

核心变革:先计算预判,后实验验证。传统核酸靶点立项遵循「先获取功能证据,后启动研发」的跟随逻辑,观测驱动的模型亦受同一约束:其可判定范围止于已被测量过的对象。LinkX 重构底层规则:碱基扰动后的 RNA 调控效应,可先通过计算完成预判,再经实验验证落地。功能可预测性是方法学换代的核心标志。

三大传统前提对应三项技术突破 PARADIGM COMPARISON

传统立项前提传统模式边界技术突破商业价值
依赖人群自然缺失突变仅覆盖少量肝分泌蛋白靶点支持任意 DNA 序列输入,不依赖人群天然样本无缺失携带者的位点也可完成成药性判断
依赖病人组织图谱测序跨器官、跨病种研发成本极高序列为第一性输入,换病种仅需切换场景语境图谱构建前即可预判序列价值,降低试错成本
依赖细胞 / 队列 QTL 证据私有突变、深内含子、编辑序列为盲区可对任意 DNA 序列完成功能预判罕见病、碱基编辑产物可在合成前完成评估

技术边界说明:纯序列输入存在语境依赖上限,同一序列在不同细胞中的功能输出存在差异。体系内同步配置细胞与组织语境模型及跨模型交叉验证机制;序列为第一性输入,而非唯一输入。

下游分子设计已是资金密集的成熟赛道,团队聚焦上游核心环节,掌握靶点立项的决策主动权。

05 MODEL PRODUCTION SYSTEM

可迭代的
模型生产体系

核心壁垒并非单点模型,而是可规模化、可持续迭代的模型生产工程体系。

01OmniReg-GPT 性能达全球 SOTA

在上海人工智能实验室发布的 CENO 公开基准测试中,OmniReg-GPT 在三个疾病分组的 ClinVar F1 指标上均位列第一,技术能力获国际学界验证。

02用 AI 创造 AI

以自研智能体自动化完成模型微调与迭代,垂类模型 MAE 降幅超 90%,具备持续产出世界级模型的工程化能力。

03体系化产能构建长期壁垒

核心竞争力并非单一模型,而是可规模化复制、可持续迭代的模型生产体系,保障长期技术领先性。

OmniReg-GPT · CENO 外部基准 · 疾病分组 ClinVar F1

Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.

AI4AI · DEEPGESEQ · K562 CASE

用 AI 创造 AI:自主构建微调模型使 ATAC 任务误差下降 90% 以上

Agent 自动完成「建模→预测→外部验证→生成训练信号→微调下一版模型」全流程,人工仅设定证据边界与决策门槛。在人类细胞系 K562 上,首版自动微调模型已在完全留出的染色体测试集上显著优于原始基准模型。

  1. Frozen model
  2. Leakage-aware split
  3. Predict
  4. Candidates
  5. External validation
  6. Finetune
  7. Frozen benchmark
指标(frozen chr8 · n = 2,520)原型模型Finetune V0变化幅度
ATAC · MAE5.9470.482−91.9%
ATAC · R²−182.80.469由负转正
ATAC · Pearson0.6580.690+0.032
H3K27ac · RMSE4.9724.433−10.8%
H3K27ac · R²0.1220.302+0.180

本案例数据与微调基础设施来自已发表的 DeepGeSeq(Bioinformatics, 2026)。

六项自研模型成果 PUBLISHED TRACK RECORD

相关成果已于顶刊发表,
实现序列到功能世界模型全栈布局

团队成员均为相关成果的第一作者与通讯作者。

2022 · Nature GeneticsNvwa
Nvwa 论文首页
核心成果
全球首个单细胞分辨率的序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种验证,测试基因在训练期间完全未见过。
体系定位
跨物种「序列→细胞状态」基座模型,为 S2F 系统提供细胞语境下的功能读出基础。
查看正式发表页面
2023 · Nature CommunicationsHuatuo
Huatuo 论文首页
核心成果
首个在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;覆盖 20 种组织、44 类细胞、13,182 个候选细胞类型特异调控变异。
体系定位
承担「信号作用的细胞 / 组织语境判定」功能,是系统机制归因的核心环节。
查看正式发表页面
2025 · Nature CommunicationsOmniReg-GPT
OmniReg-GPT 论文首页
核心成果
外部基准测试中,三项疾病分组 ClinVar F1 均列第一(CENO 报告);跨全部 ClinVar 任务的 family-level 综合分首位为 CENO-1B。
体系定位
主力前沿 S2F 模型,承担候选压缩环节的功能证据打分,同时作为 Model + Agent 基准的基线模型。
查看正式发表页面
2026 · BioinformaticsDeepGeSeq
DeepGeSeq 论文首页
核心成果
首个内置智能体技能、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
体系定位
模型工厂执行层,可面向疾病、组织与客户语境快速生成与适配专项模型。
查看正式发表页面
2026 · bioRxiv PreprintHERMES
HERMES 论文首页
核心成果
迄今规模最大的 sequence-to-function 模型;将海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
体系定位
Scaling 路线关键节点;40 类功能词表是机制假设可解释性的核心来源。
查看正式发表页面
2026 · bioRxiv PreprintS2F Agent
S2F Agent 论文首页
核心成果
首个专为 S2F 建模设计的 skill-grounded 智能体;统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
体系定位
引擎区 S2F Agent 的公开学术版本,实现将模型广度收敛为单一任务判断精度。
查看正式发表页面

06 S2F AGENT

S2F Agent:
多智能体协同的功能预测

实验室 SOTA 与真实研发场景的泛化能力存在落差,多智能体编排把多模型广度收敛为可复现的任务判断。

FROZEN CAD BENCHMARK · AGENT ABLATIONS

同一基准下性能超越 AlphaGenome

在冻结的 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),达到预设决策门槛;所有对比项均在相同数据划分、相同标签、相同指标下完成评测。

S2F AGENT VS GENERAL AGENT · 54 PAIRED CASES
+77.8pp

54 组配对案例测试中,S2F Agent 通过率 100%,GPT-5.5 通用 Agent 通过率为 22.22%;McNemar 检验 p = 4.55e-13。

测试维度s2f-agentGPT-5.5差值
Routing100.00% (23/23)21.74% (5/23)+0.783
Groundedness100.00% (8/8)0.00% (0/8)+1.000
Task success100.00% (23/23)30.43% (7/23)+0.696
整体表现100.00% (54/54)22.22% (12/54)+0.778

垂直场景成功率显著领先通用型智能体。公开学术版本:S2F Agent 预印本(bioRxiv, 2026)。

07 THE CASE

核心案例

CAD 靶点回测:
全流程盲测设计与实证结果

以 Aragam 等于 2022 年 12 月 6 日发表于 Nature Genetics 的百万样本 CAD 研究(PMID 36474045,GWAS Catalog 编号 GCST90132314)为时间零点。源研究覆盖 181,522 例病例、1,165,690 名参与者,结果数据冻结于 2026 年 8 月 17 日。

01病种选择:高公信力验证场景

选择冠心病作为验证场景,核心原因是其遗传数据完备、临床证据充分,验证结果具备行业公信力,是最易接受证伪检验的病种。

02盲测规则:严格隔绝后续信息

以 2022 年 12 月为时间节点,完全屏蔽节点后的研究数据;新颖性判定排除源研究自身成果,全流程无信息泄漏,结果为真实后验验证。

03全流程:从原始序列到核心靶点

从原始序列出发,经多轮层层筛选,从万级遗传变异中锁定 12 个高置信核心靶点。

盲测规则规则前置冻结

排序规则前置冻结,全流程无信息泄漏

本回测为严格后验验证,四项规则在结果生成前已全部冻结:所有方法在同一 557 变异 / 154 位点池内排序;复核预算 K = 51 / 37 在结果可见前锁定;新颖性判定排除源研究自身数据;显著性检验采用 5,000 次位点聚类 bootstrap。规则前置的核心意义,在于区分「筛选规则有效」与「测试标签由筛选规则定义」。

  1. 时间零点 2022-12-06
  2. 排除源研究数据
  3. 统一 557 / 154 排序池
  4. 冻结预算 K = 51 / 37
  5. 解封 2023–2026 记录
  6. 位点聚类 bootstrap ×5,000
筛选流程压缩比 326×

16,607 → 12

  1. 16,607源 GWAS / S2F 变异总量
  2. 557进入排序环节 · 对应 154 个位点
  3. 51优先输出变异 · 对应 37 个位点
  4. 12最终核心靶点
同预算增益 · 相对纯 PIP 排序+33.3%

冻结预算 K = 51 条件下,PIP + S2F 组合命中 16 个,纯 PIP 排序命中 12 个;位点层面 17 个对 14 个,提升 21.4%。同等实验预算下命中数更高,直接对应客户的实际采购价值。

35 / 51

优先变异在源研究发表前无严格 CAD 命中记录。其中 31 个(88.6%)至少具备一类额外证据,12 个至少具备两类。四类证据并非全部统计独立,因此为「多证据支持」,而非「多次独立验证」。

实证结果:75% 靶点获成药性验证 DRUGGABILITY AUDIT

12 个核心靶点包含 9 个进入成药性审计靶点 + 3 个 biology-first 靶点,75% 与 50% 占比均以 12 为分母计算。

实证结果TIER A–D

75% 靶点获独立成药性验证12 个盲测筛选的核心靶点中,75% 在 2022 年后被独立研究验证具备成药性,50% 已进入临床证据阶段,准确率显著优于传统遗传学筛选方法。

传统方法盲区靶点被率先识别多个传统方法无证据支撑的靶点,被 LinkX 率先识别并验证。以 SORT1 为例,其在行业标准数据库中成药性标注为零,但审计口径下已有 Phase 3 阶段抗体药物,充分体现「先算后验」范式的突破价值。

全流程可追溯、可复现部分已验证靶点可披露名称,逐变异状态、全排序指标与输入哈希均保留在可复现证据包中,可在 NDA 协议下开放复核。

75%

核心靶点已验证成药性(9 / 12)

50%

已有临床或批准药物(6 / 12)

可披露的 9 个靶点成药性审计 DRUGGABILITY AUDIT

靶点基因映射依据成药验证最高研发阶段
PCSK9rs471705;GTEx 配对抗体、siRNA;ASCVD / 降脂已批准
SORT1rs12740374;Open Targets mapper 综合分 0.795(High);GTEx + L2G/coloc 双支持抗 SORT1 单抗 Latozinemab(CHEMBL4650439);另有 affibody-peptide、高质量小分子结合口袋Phase 3(额颞叶痴呆 FTD-GRN,非 CAD 适应证;已终止)
LIPArs1412444;Medium;GTEx + L2G/coloc蛋白替代药物 Sebelipase alfa已批准(LAL 缺乏症,非 CAD 适应证)
FN1rs1250247;Medium;源研究精确匹配抗体 / 融合蛋白;ocriplasminPhase 3 / 已批准(非 CAD 适应证)
GLP1Rrs1155347;心代谢成熟靶点多款 GLP-1 受体激动剂已批准
NOS3rs3918226Tilarginine acetate,心血管适应证Phase 3(已终止)
SCARB1rs7296737 / rs10846744;Medium;GTEx + L2G/coloc高质量配体、小分子结合剂;SR-BI 抑制剂药理机制明确临床前可开发阶段
ANGPTL4rs116843064;Medium配体结合结构明确、抗体可及、治疗性拮抗机制成立临床前可开发阶段
ABCG8rs4245791;Medium;源研究 + 后续研究精确匹配结构明确、抗体可及临床前可开发阶段

统计口径:前 6 个计入 50% 临床 / 已批准比例,全部 9 个计入 75% 成药性验证比例。其中 3 个靶点的适应证与 CAD 无关(SORT1 为额颞叶痴呆、LIPA 为 LAL 缺乏症、FN1 为肿瘤与眼科)。成药性验证与疾病验证为两个独立维度,行业标准口径仅审计前者,由此形成资产错定价空间。

08 SCENARIO EXPANSION

场景拓展:
从标杆验证到赛道复制

核心定位:一个技术底座,多个赛道出口。拓展沿两个方向同时进行:横向按疾病领域复制既有能力,纵向随能力层推进解锁新场景。

横向:四条疾病领域路径 EXPANSION PATH

拓展方向核心内容
CAD 标杆验证CAD 领域完成方法学验证与标杆案例落地,验证 Sequence-to-Function 范式的普适性。
第一增长曲线:核酸药传统方法盲区最大、商业价值最高、技术优势最显著,为当前核心发力方向。
横向场景复用可拓展至自免、罕见病、IVD 等高价值领域,底层引擎具备多场景复用能力。
平台型成长逻辑公司本质为「一个技术底座,多个赛道出口」的平台型企业,成长空间高于单一管线公司。

纵向:能力层推进解锁的场景 CAPABILITY EXPANSION

能力层解锁场景
暴露与环境层 在建复杂病与慢病的风险归因、可干预暴露识别,覆盖单靠基因组无法解释的风险份额。
代谢层 在建代谢通路层面的机制补全与作用方向判定,扩展至代谢性疾病与营养干预场景。
蛋白互作层 在建由调控读出延伸至蛋白层作用面,支持蛋白降解、互作阻断等模态的靶点评估。
表型层 在建由目标表型反向求解干预点,构成长期的干预设计与资产创制能力。

上述四层均处于在建阶段,尚无对外可核结果,故与已验证场景分表呈现。

NUCLEIC-ACID PIPELINE · WHERE LINKX OPERATES

第一增长曲线:核酸药

核酸药是继小分子、抗体后的第三代创新药浪潮,为全球医药研发增速最快的核心赛道,产业价值与确定性突出。赛道核心瓶颈在于成熟靶点供给不足,正是LinkX 优势最显著的落地场景。

核酸药的核心药理机制为基因表达下调,因此立项前必须明确作用方向:压低该基因表达是否对患者具有保护作用。该判定可由人类队列证据给出,也可由 LinkX 在无队列覆盖的位点上直接计算得出。决定项目成败的前四个核心环节——疾病锚定、靶点确证、方向判定、序列设计——均发生在序列层面,构成本团队的核心作业边界。

  1. 疾病锚定(S2F)
  2. 靶点确证(S2F)
  3. 方向判定(S2F)
  4. 序列设计(S2F)
  5. 化学修饰与递送
  6. 临床验证

PCSK9 → inclisiran 是该路径已验证的成熟先例,也是本次回测的 Tier A 正对照。

09 BUSINESS MODEL

商业模式:
靶点授权与联合开发

核心交付:高置信靶点、完整证据链、可交易 IP。首单合作以客户既有靶点组合为对象,按统一审计标准完成重审,交付可验证的评估结论;合作门槛低、决策链路短。

维度核心内容
客户定位聚焦创新药企、核酸药企业、转型中的传统药企,均为高付费能力、强需求刚性的 B 端客户。
合作模式里程碑付费 + 联合开发 + IP 授权,兼顾短期现金流与长期权益增值。
交付标准高置信靶点 + 完整成药性证据链 + 可交易 IP,直接匹配药企管线立项需求。
商务进展已与多家头部药企启动深度对接。

LAND-AND-EXPAND · 四级合作体系

  1. 01
    付费验证 / 证据包

    针对明确问题、锁定数据集、预设验收标准的单次验证服务。

  2. 02
    疾病发现项目

    单一疾病领域内滚动复购的周期式发现服务。

  3. 03
    年度平台合作

    在客户环境内整合私有数据,部署客户专属专家模型与工作流,交付模型产能而非单次报告。

  4. 04
    靶点优先权 / 联合开发 / 授权

    收取优先权费、里程碑付款并享有共同开发收益分成,包含优先权费、首付款、研发里程碑、销售分成等多层收益。

交付物样例 · 部分脱敏变异到实验证据包

每条候选机制以「变异 → 分子事件 → 表型」链条呈现,并同时给出支持证据数、反证数、不确定度与决策结论。第一条为已公开的 PCSK9 机制,其余客户项目按 NDA 脱敏。

LINKX · EVIDENCE PACKAGE样例 · NDA 项下
机制 #1 · 优先级 高 · 已公开

rs11591147肝细胞 PCSK9 功能丧失PCSK9 活性 ↓ → LDL-C ↓ → ASCVD 风险 ↓

支持证据 4反证 1不确定度 推进
机制 #2 · 优先级 中 · 客户项目脱敏

内皮细胞特异性调控失衡血管表型

支持证据 3反证 2不确定度 已设终止标准

10 COMPETITIVE LANDSCAPE

差异化路线,
构建技术代际优势

同类 AI 制药公司多在传统范式内优化效率,本团队从第一性原理出发,形成技术代际差异。

01同类 AI 制药公司多基于已有遗传学数据做效率优化

本质是传统研发范式的辅助工具,无法突破原有方法的能力边界。

02本团队基于序列第一性原理

覆盖传统方法难以触达的非编码区、私有突变等盲区,形成技术代际领先。

03不切入下游分子设计的成熟赛道

专注靶点发现上游环节,差异化卡位高价值稀缺节点。

竞争格局

核心能力LinkX本轮拟融资 ¥2,000 万insitro公开披露资本 ≈ 8 亿美元Relation公开披露投资 ≥ 1.01 亿美元Deep Genomics公开披露股权融资 ≥ 2.33 亿美元
以人类遗传学为首要发现入口✓*
跨 DNA、RNA、蛋白、免疫序列专家模型的编排能力✓*
标准化、可审计证据包(支持证据 + 反证 + 不确定性)✓*
直接输出实验优先级与决策标准✓*
机制优先、不锁定治疗模态的开发路线✓*
轻资产嵌入客户现有数据与实验体系✓*
不依赖细胞 QTL 数据的功能预测覆盖✓*
以暴露与环境作为与序列并列的建模输入◑*
核心产品或对外交付 在建,尚无对外可核结果 部分覆盖或主要内部使用 未公开定位为标准化核心产品

融资额来源于公开信息检索,统计截至 2026 年 8 月 16 日。同业能力标注依各家公开表述归纳。

11 TEAM

核心团队

01 FOUNDER / CEO
鲍志炜

鲍志炜

浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,孵化千万级医疗 AI 场景,在百余家国内三甲医院落地;国内最大生物信息学社区 BioLinkX 创始人。全面负责公司建设与团队管理、融资、商业策略与客户拓展。

团队管理融资商业策略
02 FOUNDER / CHIEF SCIENTIST · CTO
李佳琦

李佳琦

浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制研究。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表成果发表于 Nature Genetics、Nature Communications、Bioinformatics 等顶级期刊。全面负责模型科学、技术路线、评测体系与研发团队管理。

模型科学S2F Agent评测体系

12 THE RAISE

2,000 万融资,
跑通商业闭环

本轮融资支持 12 个月运营,团队规模扩展至约 10 人。

资金用途与对应里程碑 TOTAL ¥20M · 12 MONTHS

资金主线明细科目金额及占比对应里程碑
模型迭代与算力投入算力、云服务与数据采购200 万 · 10.0%持续巩固 SOTA 技术地位
CRO 湿实验验证与 IIT 推进前瞻实验与 CRO 服务480 万 · 24.0%夯实靶点证据链,启动 1–2 项 IIT
全球 IP 布局IP 申请、法务与合规80 万 · 4.0%锁定核心靶点权益,提交首批专利
商务拓展与团队建设人才招聘、商务拓展与客户项目830 万 · 41.5%落地首批商业化合作,实现首笔收入
运营保障与风险准备风险准备金、产品基础设施、办公行政410 万 · 20.5%覆盖实验延期、招聘延迟与融资周期缓冲

13 NEXT 6–12 MONTHS

短期里程碑:
从验证到落地

  1. 01完成 1–2 个核心疾病领域的靶点库扩增与回测验证
  2. 02落地 1–2 家头部药企商业化合作,实现首笔收入
  3. 03启动 1–2 项 IIT 临床验证,强化证据链
  4. 04持续迭代模型与智能体体系,巩固技术领先性
  5. 05核酸药方向完成首批靶点交付,验证商业闭环

14 VISION

在 AI 时代下,
无限扩展中心法则的边界

能力链走到最后一层,是由功能推及表型,并反向定位可干预节点:给定目标表型,逆向求解应当改动的序列与应当阻断的暴露。中心法则的边界由此从「信息如何流动」扩展为「信息流可否被计算与反向运行」。当下聚焦商业化落地,以实证兑现价值;长期致力于成为全球药物研发的底层基础设施。

BIOLOGY SCALING LAW · TWO CURVES, ONE MODEL

生物学的 Scaling Law:两条曲线实现能力规模化跃迁

该终局的可达性取决于两条可验证、可迭代的技术曲线能否持续推进。二者共同收敛为序列到功能的底层统一语法,构成 LinkX 的技术路径。

CURVE 01 · DNA LM曲线一:DNA 语言模型(DNA LM)

核心逻辑:持续扩充生物序列语料规模,学习序列内在的生成语法规则。

  • 语料演进路径:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
  • 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
  • 参数规模:117M → 270M → 500M → 2B+,配套 compute-optimal 算力扫描
CURVE 02 · FOUNDATIONAL S2F曲线二:基础 S2F 模型(Foundational S2F)

核心逻辑:持续扩充功能观测数据,沉淀「序列→功能」的精准映射规律。

  • 功能图谱规模:当前 137,127 组(HERMES)→ 统一本体论下全量公共与私有观测数据
  • 功能模态覆盖:表达、剪接、染色质、转录因子结合、甲基化、三维互作、单细胞、扰动实验
  • 输出分辨率:窗口聚合 → 单碱基、增强子-基因关联、变异效应解析
底层三层语法体系 · 平台化能力的技术基石

三层语法构成完整的序列-功能语言体系,是未来成为行业基础设施的核心标准。

底层 Token 词表

采用 BPE / k-mer / 单碱基 Token 体系,承载序列组合语法规则

功能语义词表

覆盖启动子、增强子、转录因子结合、组蛋白状态等功能元件,对应 HERMES 定义的 40 类序列功能簇

关系语法规则

定义增强子-启动子兼容性、基序-转录因子结合、变异效应方向等序列-功能映射逻辑