统计定位完成后,单一病种仍剩数百个可信变异。实验预算无法覆盖,排序仍依赖少数专家经验。
LINKX · PUBLIC INVESTOR OVERVIEW · AUG 2026
从序列出发,构建可进化的
虚拟细胞世界模型
Frontier S2F Models × Self-Evolving Model Factory × S2F Agent
LinkX 以序列为第一性输入。基于 6 项发表于 Nature Genetics、Nature Communications 等期刊的全栈自研模型,由 Self-Evolving Model Factory 与 S2F Agent 协同,把序列信息逐级转化为功能证据、机制假设,以及可立项、可交易的药物资产。
SEQUENCE-TO-THERAPY
01 THE PROBLEM
统计定位之后,
候选靶点排不出
优先级。
百万级样本队列已把候选靶点推到决策台前;序列模型已能读懂调控语法;核酸药物把「作用方向」前置为立项门槛。真正缺的不是更多信号,而是把已有信号变成可决策的资产。三个结构性缺口长期存在:
从变异到基因、从基因到药理方向,证据链没有系统构建。靶点立项建立在不完整归因之上。
行业数据库按「本疾病管线是否已有药物」判定成药性。一个已有 Phase 3 抗体的靶点,在标准页面上可能显示成药性为零。(→ 见 SORT1 案例)
把候选信号转化为可决策药物资产——这就是 S2F 要补上的一层。
02 THE PREMISE + HARD EVIDENCE
人类遗传证据是行业前提,
解释信号的能力才是边界。
九成信号位于非编码区且难以解释,这一前提并不自动成立。解释能力决定遗传证据能否转化为研发胜率,这正是 LinkX 的能力所在。
有人类遗传证据支持的药物机制,临床成功率估计提升 2.6 倍。这一结论已是行业共识,也是数据库型平台的能力上限——前提是信号能够被解释。
Minikel EV, Painter JL, Dong CC & Nelson MR. Refining the impact of genetic evidence on clinical success. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0上海人工智能实验室联合多家科研机构发布的 CENO 基因组世界模型技术报告显示,OmniReg-GPT 在全部三个疾病分组的 ClinVar F1 基准上排名第一。
| 疾病分组 | F1 | 排名 |
|---|---|---|
| 乳腺(Breast) | 0.70 | #1 |
| 心血管(Cardiovascular) | 0.92 | #1 |
| 肾脏(Renal) | 0.98 | #1 |
| 平均 | ≈0.87 | — |
Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.
03 PRODUCT
S2F 把统计定位结果,
转化为可审计的
实验决策。
S2F 以群体统计证据为疾病锚点。统计定位之后、实验预算拍板之前,候选压缩、机制归因、成药性分层、实验优先级,过去靠人工完成,现在由系统承接。
- 输入
- GWAS、WES/WGS 与已有精细定位结果、专有组学数据,以及疾病、组织、细胞类型等生物学语境。
- 智能层
- 前沿 S2F 模型群 + S2F Agent。
- 输出
- 优先级排序的机制假设、支持与反对证据、校准后的不确定性、候选基因与模态成药性分层、实验优先级与 Go/No-Go 标准。
- 交付物
- Variant-to-Experiment Evidence Package(变异到实验证据包)。
- 目标客户
- 药企与生物科技公司的人类遗传学、功能基因组学与靶点发现团队。
- 验收
- 可复现运行记录、预先冻结的评测标准、人工科学复核、双方约定的前瞻性验证协议。
→ liver chromatin accessibility ↓ → expression ↓ → lipid dysregulation
→ endothelial-specific disruption → → vascular phenotype
边界:S2F 承接统计定位之后的功能重排序与资产分层;功能先验越强,系统可承接的判断环节越多。
04 TECHNOLOGY STACK
从序列到功能的完整技术栈,
全部自研,顶刊发表。
六项成果覆盖序列语法、单细胞表达、调控组学、智能体编排,构成 S2F 模型基座。这不是单点模型,而是一条从序列到决策的完整链路——回答「改变一个碱基,细胞会怎样」,不只描述细胞状态。
查询工具交付答案,能力底座交付产能。
固定数据库与固定统计方法
按语境现造专家模型
受限于相应组织/细胞的 QTL 数据是否存在
具备序列即可计算
查询结果与分析报告
可审计的实验决策与可部署的模型产能
- 按需构建特定场景的 S2F 专家模型。
- 随数据与生物学需求持续迭代模型。
- 把失败分析转化为下一代模型。
- 为每个任务挑选并编排最合适的模型。
- 跨模型、跨模态交叉验证证据。
- 把广阔发现空间收敛为可执行实验决策。
05 PUBLISHED TRACK RECORD
已发表成果覆盖虚拟细胞世界模型的
Sequence-to-Function 全栈
团队成员均为第一作者 & 通讯作者;模型工作均面向调控与非编码基因组

- Task
- 从转录起始位点周围的 DNA 序列预测单细胞表达状态,并提取细胞类型相关保守调控 motif。
- Headline result
- 全球首个单细胞分辨率序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种,测试基因训练期间从未见过。
- Role in the system
- 跨物种「序列→细胞状态」基座,为 S2F 系统提供细胞语境下的功能读出起点。

- Task
- 联合序列模型、单细胞图谱与 eQTL / GWAS 证据,在细胞与组织语境中解码调控变异。
- Headline result
- 首个在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;20 种组织 · 44 类细胞 · 13,182 个候选细胞类型特异调控变异。
- Role in the system
- 回答「信号在哪个细胞 / 组织语境中起作用」,承担系统机制归因环节。

- Task
- 调控基因组学基础模型:20 kb 长序列窗口,覆盖表达、染色质可及性、遗传变异与三维基因组任务。
- Headline result
- 外部基准:三项疾病分组 ClinVar F1 全部 SOTA(CENO 报告,见 02 节)。
- Role in the system
- 主力前沿 S2F 模型,承担候选压缩中的功能证据打分,也是 Model + Agent 基准的基线。

- Task
- 已发表的模型训练、适配与微调基础设施:配置化驱动完整深度学习工作流,含 agentic skill 接口。
- Headline result
- 首个内置 agentic skill、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
- Role in the system
- 模型工厂执行层,面向疾病、组织与客户语境快速生成与适配专项模型。

- Task
- 以 137,127 个功能基因组 profiles 训练的基础 S2F 模型,覆盖 DNA 甲基化、TF 结合、聚合酶、组蛋白修饰、染色质可及性与 RNA 表达。
- Headline result
- 迄今规模最大的 sequence-to-function 模型;把海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
- Role in the system
- Scaling 路线关键一步;40 类功能词表是机制假设可解释性的来源。

- Task
- Skill-grounded 智能体编排系统:以规范化输入键、任务 playbooks 与标准化 contracts,把开放式基因组学问题转译为可复现、可执行分析。
- Headline result
- 首个专为 S2F 建模设计的 skill-grounded 智能体;统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
- Role in the system
- 引擎区 S2F Agent 的公开学术版本,把模型广度收敛为单一任务上的判断精度。
06 ENGINE 01 · SELF-EVOLVING MODEL FACTORY
自进化模型工厂:
把前沿模型构建,
变成可复制流水线。
不是只造一个 SOTA 模型,而是持续构建 SOTA 模型的 Loop Engineering。
Agent 自动完成建模、验证与 Finetune,误差下降 90% 以上
以已发表 DeepGeSeq 框架为执行层,Agent 自动完成「建模 → 预测 → 外部验证 → 形成训练信号 → Finetune 下一版模型」,持续产出疾病、组织、细胞特异垂类模型;人只设定证据边界和 Go/No-Go 门槛。在经典人类细胞系 K562 功能预测任务上,首版自动微调 Finetune V0 已在完全留出染色体测试集上显著优于原始模型。
- Frozen model→
- Leakage-aware split→
- Predict→
- Candidates→
- External validation→
- Finetune→
- Frozen benchmark↺
| 指标(frozen chr8 · n = 2,520) | 原型 | Finetune V0 | 变化 |
|---|---|---|---|
| ATAC · MAE | 5.947 | 0.482 | −91.9% |
| ATAC · R² | −182.8 | 0.469 | 由负转正 |
| H3K27ac · RMSE | 4.972 | 4.433 | −10.8% |
| H3K27ac · R² | 0.122 | 0.302 | +0.180 |
当前为 Finetune V0(仅训练下游 head、冻结 backbone),已在单一人类细胞系与两类功能信号上完成验证;下一步将复制到更多任务,并升级为全 backbone 的持续自进化。
07 ENGINE 02 · S2F AGENT
S2F Agent 把模型广度,
收敛为可直接指导实验的决策智能。
S2F Agent 不只是调用模型:它会选择、适配、交叉验证,并把模型组合成任务专属工作流。
- DNA 序列与基因组区间(assembly 与坐标系归一化)
- 变异:REF / ALT 等位基因与基因组坐标
- 生物学语境:组织、细胞类型与 assay
- 分析意图:变异打分、序列嵌入、轨迹预测或元件设计
一份可审计的实验决策:机制排序、证据与反证、校准的不确定性。
编排的 skills 涵盖 11 个模型家族:AlphaGenome · Borzoi · DNABERT-2 · Evo 2 · GPN · Nucleotide Transformer v3 · SegmentNT,以及 LinkX 自研与 DeepGeSeq 生成的专家模型。- 01Plan
- 02Select
- 03Adapt
- 04Cross-Examine
- 05Synthesize
- 06Prioritize
- 07Design
Model + Agent,
显著优于最强单模型
冻结 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),通过预设 GO 门槛;所有对比项均在相同数据划分、相同标签、相同指标下评测。
非编码功能预测并非无人可做,真正约束在于可靠性:单模型性能随组织、assay 与变异类型显著波动,图中最弱配置甚至与真实效应负相关。Harness 的作用,是让系统性能不被任一模型局部失效所决定。
数据来自 locked-test frozen CAD benchmark(LinkX internal, Aug 2026)。
同一套 benchmark 下,S2F Agent 通过率 100%,通用 Agent 22.22%
54 个 paired cases 上,s2f-agent 通过率 100%,GPT-5.5 通用 Agent 为 22.22%;McNemar p = 4.55e-13。
| Suite | s2f-agent | GPT-5.5 | Δ |
|---|---|---|---|
| Routing | 100.00% (23/23) | 21.74% (5/23) | +0.783 |
| Groundedness | 100.00% (8/8) | 0.00% (0/8) | +1.000 |
| Task success | 100.00% (23/23) | 30.43% (7/23) | +0.696 |
| Overall | 100.00% (54/54) | 22.22% (12/54) | +0.778 |
GPT-5.5 经 proxy OpenAI-compatible endpoint 评测;Codex 及更多 API 模型将按同一协议纳入。
OmniReg-GPT + S2F Agent 在 ClinVar 冻结基准上的表现,以及 GPT / Codex 在 CAD numeric-fusion 上的 zero-shot 对照。Results pending.
08 PROOF I · CAD FROZEN RETROSPECTIVE
从 16,607 个信号,
到 51 个可审计候选,
再到 12 个核心靶点。
以 2022 年 12 月发表的百万样本 CAD 研究(Aragam et al., 2022)为时间零点,所有证据按「源研究前 / 同期 / 之后」严格切分,避免用后续关联回填;本次结果冻结于 2026-08-17。漏斗:16,607 个源 GWAS / S2F 变异 → 557 个进入排序的变异(154 个位点)→ 51 个优先变异 / 37 个位点 → 12 个核心靶点。
| 输入:遗传变异 | 16,607 |
|---|---|
| 输出:优先变异 / 位点 | 51 / 37 |
| 输出:核心靶点 | 12 |
| 已验证成药性 | 9(75%) |
| 已有临床或批准药物 | 6(50%) |
35 个优先变异在源研究发表前没有严格 CAD 精确命中记录;其中 31 个(88.6%)至少还有一类独立证据,12 个至少有两类。相同复核预算下,相比仅按后验包含概率排序,变异层命中提升 33.3%,位点层提升 21.4%。
核心靶点已验证成药性(9 / 12)
已有临床或批准药物(6 / 12)
16,607 条遗传证据 → 12 个核心靶点:75% 已验证可成药,50% 已有临床或批准药物。
把有限的实验预算,花在更经得起审计的候选上。
脚注:位点层最强基线仍是 GWAS P 值;上述提升为固定预算下的点估计,bootstrap 区间跨零,属探索性增益。完整证据包(逐变异状态、全排序指标、5,000 次 bootstrap、输入哈希)随报告开放复核。数据时点 2026-08-17。
09 PROOF II · SORT1 & TARGET ASSETS
SORT1:被标准管线口径
漏判的 Phase 3 靶点
SORT1 在 Open Targets 靶点页 drugAndClinicalCandidates.count = 0,按本疾病管线计,被记为「无临床候选」。审计口径下不是这样:位点到基因,rs12740374,L2G 0.795(高置信),GTEx 与共定位双重支持;成药性,抗 SORT1 单抗 Latozinemab 曾至 Phase 3(额颞叶痴呆 / FTD-GRN;INFRONT-3 未达终点,开发已终止),另有 affibody 与高质量小分子口袋。成药性已由外部在其他适应证完成投入,不构成疗效背书,也不构成 CAD 验证。
疾病验证与成药性验证是两个独立维度。行业标准数据库只审计前者,系统性遗漏后者——这正是靶点资产被低估的来源,也是 S2F 审计口径的价值所在。
已验证成药性的 9 个靶点 DRUGGABILITY AUDIT
| 靶点 | 基因映射 | 成药验证 | 最高观察阶段 |
|---|---|---|---|
| PCSK9 | rs471705;GTEx pair | 抗体、siRNA;ASCVD / 降脂 | 已批准 |
| SORT1 | rs12740374;L2G 0.795(High);GTEx + coloc | 抗 SORT1 单抗 Latozinemab;另有 affibody、小分子 pocket | Phase 3(额颞叶痴呆,非 CAD;已终止) |
| LIPA | rs1412444;Medium;GTEx + L2G/coloc | 蛋白替代 Sebelipase alfa | 已批准(LAL 缺乏症,非 CAD) |
| FN1 | rs1250247;Medium;源 accession exact | 抗体 / 融合蛋白;ocriplasmin | Phase 3 / 已批准(非 CAD) |
| GLP1R | rs1155347;心代谢靶点成熟 | 多款 GLP-1 受体激动剂 | 已批准 |
| NOS3 | rs3918226 | Tilarginine acetate,心血管适应证 | Phase 3(已终止) |
| SCARB1 | rs7296737 / rs10846744;Medium;GTEx + L2G/coloc | 高质量配体、小分子 binder;SR-BI 抑制剂药理 | 临床前可开发 |
| ANGPTL4 | rs116843064;Medium | 配体结合结构、抗体可及、治疗性拮抗 | 临床前可开发 |
| ABCG8 | rs4245791;Medium;源研究 + 后续 exact | 结构、抗体可及 | 临床前可开发 |
前 6 个计入 50%(已有临床或批准药物);全部 9 个计入 75%(已验证可工程化干预)。资产分层:Tier A 疾病与成药性双验证(PCSK9)· Tier B 成药性已验证,适应证待转化(SORT1 / LIPA / FN1)· Tier C 化学可开发,方向待验证(SCARB1 / ANGPTL4 / ABCG8)· Tier D 生物学先行(CELSR2 等)。
边界:非 CAD 适应证的临床证据,不等于 CAD 验证。作用方向、组织选择与安全窗,是下一阶段需要验证的内容。成药性定义:已具备抗体、小分子、蛋白替代、核酸,或已进入临床 / 获批的可干预路径;药物阶段均为数据库中观察到的最高阶段。
10 STRATEGIC EXTENSION · SEQUENCE MEDICINES
LinkX,
打开核酸药的
全基因组时代。
核酸药物是可编程药物形态:按碱基配对规则设计,原则上可靶向任何转录本;ASO 与 siRNA 已从脊髓性肌萎缩等罕见病走向心血管等常见病,被公认为个性化医疗关键路径之一。其药理是降低表达,因此立项前必须先判断:压低该基因对患者是否有保护性——这一判断可由人类队列证据事先给出。功能缺失呈保护方向的基因,构成天然核酸药物靶点池。
核酸药物研发流程,与 S2F 介入环节
决定核酸药物项目成败的前四个环节——疾病锚定、靶点确证、方向判定、序列设计——全部发生在序列层,正是 S2F 的作业面:疾病锚点来自人类队列证据,靶点与方向由证据链与成药性审计给出,序列层表征直接衔接药物设计。后两个环节(化学修饰与递送、临床验证)由行业成熟平台技术承接。序列定义的药物形态与序列出发的发现引擎共用同一层表征,从靶点确证到药物设计的迭代路径最短。
- 疾病锚定 · S2F→
- 靶点确证 · S2F→
- 方向判定 · S2F→
- 序列设计 · S2F→
- 化学修饰与递送→
- 临床验证
行业综述:Tang Q & Khvorova A. RNAi-based drug design: considerations and future directions. Nat Rev Drug Discov 23, 341–364 (2024);Sun X, et al. Nucleic acid drugs: recent progress and future perspectives. Signal Transduct Target Ther 9 (2024). 边界:递送(尤其肝外组织)仍是全行业瓶颈,属化学修饰与递送环节,不在 S2F 作业面内。
PCSK9 → inclisiran,是这条路径已经走通的先例,也是本次回测的 Tier A 正对照。
药理方向与队列效应方向的系统对齐,已纳入 154 个位点对称审计——S2F 将为每个候选靶点给出方向性判定,直接输出可进入核酸药物靶点清单。
队列证据覆盖不到的四类盲区 BEYOND COHORT COVERAGE
| 现实盲区 | 核酸药的实际需求 |
|---|---|
| 稀有 / 私有突变 | n-of-1 ASO、超罕见剪接病的唯一靶点 |
| 深内含子、调控 RNA | splice-switch、毒 RNA、eRNA / lncRNA 靶点 |
| 编辑后产生的新序列 | 碱基编辑、外显子跳读的产物本身不存在于人群 |
| 反事实扰动 | 药物引入的是「人为修改」,不是「人群中自然存在」的变异 |
LinkX 的核心主张——输入任意 DNA,输出 RNA 与调控效应,不要求该位点进过队列——正好覆盖这四个盲区。
11 BUSINESS MODEL + GTM
先用付费验证切入,
用证据包沉淀下来,
用里程碑锁定价值。
可立即成交的第一种合作:按同一套审计标准,重审客户已有靶点组合,找出被行业标准低估的资产。初始买方:药企与 biotech 的 Human Genetics、Functional Genomics 和 Target Discovery 团队。验证单不是业务终点,作用是把客户决策口径锁定到 S2F,再升级到发现项目与后端分成。
VERIFIEDEVIDENCE GRAPHLAND-AND-EXPAND · FOUR TIERS
- 01Paid Validation / Evidence Package
一个明确的问题、一套锁定的数据集、一组预先约定的验收标准。
证据包 · 可复现记录 · 20–50 万元假设 - 02Disease Discovery Program
在一个疾病领域内滚动复购的发现周期。
项目首付款 · 研究经费 · 50–150 万元起 - 03Annual Platform Partnership
在客户环境内整合私有数据,部署客户专属专家模型与工作流——交付模型产能,而非单次报告。
年度研究框架 · 200–500 万元 / 年假设 - 04Target Option / Co-Development / Licensing
获取优先权费、里程碑付款与共同开发收益分成。
优先权费 · 首付款 · 研发里程碑 · 销售分成
以上价格为与设计伙伴校准中的初始商业假设。
12 COMPETITIVE LANDSCAPE
竞争格局
序列模型公司有功能评分,缺疾病锚点;证据聚合平台有数据广度,但会漏判,且不提供反对证据;传统 CRO 有实验能力,但缺压缩层。把支持证据、反对证据和校准后的不确定性整合成可审计证据包——这一层,目前只有我们做成了产品。
| 核心能力 | LinkX本轮拟融资 ¥2,000 万 | insitro公开披露资本 ≈ 8 亿美元 | Relation公开披露投资 ≥ 1.01 亿美元 | Deep Genomics公开披露股权融资 ≥ 2.33 亿美元 |
|---|---|---|---|---|
| 以人类遗传学为首要发现入口 | ✓* | ✓ | ◐ | ✓ |
| 跨 DNA、RNA、蛋白、免疫序列专家模型的编排能力 | ✓* | ◐ | ◐ | — |
| 标准化、可审计 Evidence Package(支持证据 + 反证 + 不确定性) | ✓* | — | — | — |
| 直接输出实验优先级与 Go/No-Go 标准 | ✓* | ◐ | ◐ | ◐ |
| 机制优先、不锁定治疗模态的开发路线 | ✓* | ✓ | ◐ | — |
| 轻资产嵌入客户现有数据与实验体系 | ✓* | — | — | — |
| 不依赖相应细胞 QTL 数据的功能预测覆盖 | ✓* | — | ◐ | ◐ |
融资额来源于公开互联网检索,统计截至 2026-08-16。
13 TEAM
团队成员
两位创始人组合覆盖原创建模、Agent 工程、生物学判断与医疗商业化。本轮将围绕 B2B 疾病发现、前瞻验证与企业交付,补齐转化生物学、功能实验、企业产品与药企合作能力。

鲍志炜
浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,主导医学 AI 产品化、组织管理与产业合作,创造千万级 AI 医疗落地场景;全国规模最大的生物信息学组织 BioLinkX 创始人。负责公司建设与团队管理、融资、商业策略与客户入口。

李佳琦
浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表工作发表于 Nature Genetics、Nature Communications、Bioinformatics 等期刊。负责模型科学、技术路线、评测体系与研发团队。
持续招募中:
- 转化生物学与疾病项目负责人
- 计算基因组与 Model Factory 工程
- 疾病模型、基因编辑与功能实验
- 企业产品、安全部署与 Scientific Solutions
- 药企合作、知识产权与资产 BD
- 药物开发、监管与 CMC 顾问
融资 2,000 万元,支持 12 个月运营,团队扩展至约 10 人。本轮不列愿景清单,只列「资金—证据」对应:每一分钱,对准 2026–2027 三项可核验产出——154 个位点对称审计、前瞻性实验验证、首批付费客户交付。
- 01 / AUDIT154 个位点对称审计
公开可复核的方向对齐与分层结果。
- 02 / VALIDATION前瞻性实验验证
优先机制的湿实验读出。
- 03 / COMMERCIAL首批付费客户交付
签约、验收标准、回款与可复用证据包。
以上为本轮前瞻性里程碑;详细口径、时间表与负责人见尽调材料。本轮聚焦发现与验证,不覆盖临床开发与自建重资产实验室。
14 ROADMAP
通往生物学的
GPT-2 时刻。
- 2026–2027验证靶点,交付首批付费项目
完成 154 个位点对称审计与药理方向对齐,对优先机制完成前瞻性实验验证;S2F Agent v1 上线,交付首批付费发现项目。
- 2028–2029垂类 SOTA 模型批量拓展
以模型工厂微调管线,把验证过的发现流程复制到新疾病领域;按疾病、组织与客户语境持续扩充垂类模型。
- 2030–2031生物学的 GPT-2 时刻
建立数据、算力与实验反馈之间的 scaling law,构建 one-for-all 统一生物学模型,实现跨任务泛化与可预测能力增长——从 Sequence 走向 Therapy。
生物学 Scaling Law
不断增加生物序列语料,学习序列本身的生成语法
- 序列语料:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
- 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
- 参数规模:117M → 270M → 500M → 2B+,配 compute-optimal 扫描
不断增加功能观测数据,学习「序列 → 功能」映射
- 功能 profiles:137,127(HERMES)→ 统一 ontology 下全量公共与私有观测
- 功能模态:表达、剪接、染色质、TF 结合、甲基化、3D contact、单细胞、扰动实验
- 输出分辨率:窗口聚合 → 单碱基、enhancer–gene、variant-effect
BPE / k-mer / 单碱基 token,承载序列组合语法
promoter、enhancer、TF binding、histone state 等——HERMES 40 sequence classes
enhancer–promoter compatibility、motif–TF、variant-effect 方向
经典中心法则描述遗传信息如何从 DNA 流向 RNA 和蛋白质。LinkX 要创造并工程化 AI 时代的中心法则:让生命序列在具体患者和生物学环境中的功能可以被计算,让功能与疾病之间的关系可以被实验验证,并让这条信息流能够被反向运行——从目标表型出发,发现、选择并设计相应干预。
我们不仅要提出这一法则,更要把它变成可以持续产生治疗方案和药物资产的真实系统。
- 01Sequence × Patient ContextGenome · Transcriptome · Immune State
- 02Function & MechanismCell · Tissue · Molecular Effect
- 03Phenotype & DiseasePatient-specific Relevance
- 04Therapy Selection / DesignRNA · Editing · Protein · TCR
- 05Experiment & Patient FeedbackCorrection · Response · Learning
