LINKX · PUBLIC INVESTOR OVERVIEW · AUG 2026

从序列出发,构建可进化的
虚拟细胞世界模型

Frontier S2F Models × Self-Evolving Model Factory × S2F Agent

LinkX 以序列为第一性输入。基于 6 项发表于 Nature Genetics、Nature Communications 等期刊的全栈自研模型,由 Self-Evolving Model Factory 与 S2F Agent 协同,把序列信息逐级转化为功能证据、机制假设,以及可立项、可交易的药物资产。

SEQUENCE-TO-THERAPY

01 THE PROBLEM

统计定位之后,
候选靶点排不出
优先级。

百万级样本队列已把候选靶点推到决策台前;序列模型已能读懂调控语法;核酸药物把「作用方向」前置为立项门槛。真正缺的不是更多信号,而是把已有信号变成可决策的资产。三个结构性缺口长期存在:

01 / GAP候选过载

统计定位完成后,单一病种仍剩数百个可信变异。实验预算无法覆盖,排序仍依赖少数专家经验。

02 / GAP证据链断裂

从变异到基因、从基因到药理方向,证据链没有系统构建。靶点立项建立在不完整归因之上。

03 / GAP标准漏判

行业数据库按「本疾病管线是否已有药物」判定成药性。一个已有 Phase 3 抗体的靶点,在标准页面上可能显示成药性为零。(→ 见 SORT1 案例)

把候选信号转化为可决策药物资产——这就是 S2F 要补上的一层。

02 THE PREMISE + HARD EVIDENCE

人类遗传证据是行业前提,
解释信号的能力才是边界。

九成信号位于非编码区且难以解释,这一前提并不自动成立。解释能力决定遗传证据能否转化为研发胜率,这正是 LinkX 的能力所在。

HUMAN GENETIC EVIDENCE · 行业前提2.6×

有人类遗传证据支持的药物机制,临床成功率估计提升 2.6 倍。这一结论已是行业共识,也是数据库型平台的能力上限——前提是信号能够被解释。

Minikel EV, Painter JL, Dong CC & Nelson MR. Refining the impact of genetic evidence on clinical success. Nature 629, 624–629 (2024). doi:10.1038/s41586-024-07316-0
解释能力 · 外部基准验证

上海人工智能实验室联合多家科研机构发布的 CENO 基因组世界模型技术报告显示,OmniReg-GPT 在全部三个疾病分组的 ClinVar F1 基准上排名第一

疾病分组F1排名
乳腺(Breast)0.70#1
心血管(Cardiovascular)0.92#1
肾脏(Renal)0.98#1
平均≈0.87
疾病分组 ClinVar F1 · Top 10 模型

Source: CENO: A Genome-Scale World Model for Evolutionary Sequence Interpretation and Programmable Regulatory Design — Technical Report, Shanghai Artificial Intelligence Laboratory (2026), Supplementary Fig. S5b. Zero-shot ClinVar F1 grouped by clinical category; comparison scope limited to the models displayed in that figure.

03 PRODUCT

S2F 把统计定位结果,
转化为可审计的
实验决策。

HUMAN GENETICS DISCOVERY PARTNERSHIP

S2F 以群体统计证据为疾病锚点。统计定位之后、实验预算拍板之前,候选压缩、机制归因、成药性分层、实验优先级,过去靠人工完成,现在由系统承接。

输入
GWAS、WES/WGS 与已有精细定位结果、专有组学数据,以及疾病、组织、细胞类型等生物学语境。
智能层
前沿 S2F 模型群 + S2F Agent。
输出
优先级排序的机制假设、支持与反对证据、校准后的不确定性、候选基因与模态成药性分层、实验优先级与 Go/No-Go 标准。
交付物
Variant-to-Experiment Evidence Package(变异到实验证据包)。
目标客户
药企与生物科技公司的人类遗传学、功能基因组学与靶点发现团队。
验收
可复现运行记录、预先冻结的评测标准、人工科学复核、双方约定的前瞻性验证协议。
DELIVERABLE PREVIEW · REDACTEDVariant-to-Experiment Evidence Package
LINKX · EVIDENCE PACKAGESAMPLE · UNDER NDA
MECHANISM #1 · PRIORITY HIGH

→ liver chromatin accessibility ↓ → expression ↓ → lipid dysregulation

Supporting 4Contradictory 1Uncertainty Go
MECHANISM #2 · PRIORITY MEDIUM

→ endothelial-specific disruption → → vascular phenotype

Supporting 3Contradictory 2Uncertainty No-Go criteria set

边界:S2F 承接统计定位之后的功能重排序与资产分层;功能先验越强,系统可承接的判断环节越多。

04 TECHNOLOGY STACK

从序列到功能的完整技术栈,
全部自研,顶刊发表。

六项成果覆盖序列语法、单细胞表达、调控组学、智能体编排,构成 S2F 模型基座。这不是单点模型,而是一条从序列到决策的完整链路——回答「改变一个碱基,细胞会怎样」,不只描述细胞状态。

定位 · 能力底座,而非查询工具

查询工具交付答案,能力底座交付产能。

底层

固定数据库与固定统计方法

按语境现造专家模型

覆盖边界

受限于相应组织/细胞的 QTL 数据是否存在

具备序列即可计算

交付形态

查询结果与分析报告

可审计的实验决策与可部署的模型产能

ENGINE 01Self-Evolving Model Factory
  • 按需构建特定场景的 S2F 专家模型。
  • 随数据与生物学需求持续迭代模型。
  • 把失败分析转化为下一代模型。
查看 Model Factory 细节
ENGINE 02S2F Agent
  • 为每个任务挑选并编排最合适的模型。
  • 跨模型、跨模态交叉验证证据。
  • 把广阔发现空间收敛为可执行实验决策。
查看 S2F Agent 细节

05 PUBLISHED TRACK RECORD

已发表成果覆盖虚拟细胞世界模型的
Sequence-to-Function 全栈

团队成员均为第一作者 & 通讯作者;模型工作均面向调控与非编码基因组

2022 · Nature GeneticsNvwa
Nvwa 论文首页
Task
从转录起始位点周围的 DNA 序列预测单细胞表达状态,并提取细胞类型相关保守调控 motif。
Headline result
全球首个单细胞分辨率序列到表达深度学习模型;AUROC 0.78 / AUPR 0.59,跨 8 个物种,测试基因训练期间从未见过。
Role in the system
跨物种「序列→细胞状态」基座,为 S2F 系统提供细胞语境下的功能读出起点。
查看正式发表页面
2023 · Nature CommunicationsHuatuo
Huatuo 论文首页
Task
联合序列模型、单细胞图谱与 eQTL / GWAS 证据,在细胞与组织语境中解码调控变异。
Headline result
首个在细胞类型 × 单核苷酸双分辨率下解码调控遗传变异的统一框架;20 种组织 · 44 类细胞 · 13,182 个候选细胞类型特异调控变异。
Role in the system
回答「信号在哪个细胞 / 组织语境中起作用」,承担系统机制归因环节。
查看正式发表页面
2025 · Nature CommunicationsOmniReg-GPT
OmniReg-GPT 论文首页
Task
调控基因组学基础模型:20 kb 长序列窗口,覆盖表达、染色质可及性、遗传变异与三维基因组任务。
Headline result
外部基准:三项疾病分组 ClinVar F1 全部 SOTA(CENO 报告,见 02 节)。
Role in the system
主力前沿 S2F 模型,承担候选压缩中的功能证据打分,也是 Model + Agent 基准的基线。
查看正式发表页面
2026 · BioinformaticsDeepGeSeq
DeepGeSeq 论文首页
Task
已发表的模型训练、适配与微调基础设施:配置化驱动完整深度学习工作流,含 agentic skill 接口。
Headline result
首个内置 agentic skill、支持全自然语言交互的基因组深度学习库;经 pipeline 验证、已发表模型复现与用户数据微调系统验证。
Role in the system
模型工厂执行层,面向疾病、组织与客户语境快速生成与适配专项模型。
查看正式发表页面
2026 · bioRxiv PreprintHERMES
HERMES 论文首页
Task
以 137,127 个功能基因组 profiles 训练的基础 S2F 模型,覆盖 DNA 甲基化、TF 结合、聚合酶、组蛋白修饰、染色质可及性与 RNA 表达。
Headline result
迄今规模最大的 sequence-to-function 模型;把海量功能观测总结为 40 个 sequence classes 的可解释功能词表。
Role in the system
Scaling 路线关键一步;40 类功能词表是机制假设可解释性的来源。
查看正式发表页面
2026 · bioRxiv PreprintS2F Agent
S2F Agent 论文首页
Task
Skill-grounded 智能体编排系统:以规范化输入键、任务 playbooks 与标准化 contracts,把开放式基因组学问题转译为可复现、可执行分析。
Headline result
首个专为 S2F 建模设计的 skill-grounded 智能体;统一编排 11 个 SOTA 模型(含 AlphaGenome、Borzoi、Evo 2),并通过 routing 与 groundedness 评测验证。
Role in the system
引擎区 S2F Agent 的公开学术版本,把模型广度收敛为单一任务上的判断精度。
查看正式发表页面

06 ENGINE 01 · SELF-EVOLVING MODEL FACTORY

自进化模型工厂:
把前沿模型构建,
变成可复制流水线。

不是只造一个 SOTA 模型,而是持续构建 SOTA 模型的 Loop Engineering。

AI4AI · AGENTIC FINETUNE V0 · K562 CASE

Agent 自动完成建模、验证与 Finetune,误差下降 90% 以上

以已发表 DeepGeSeq 框架为执行层,Agent 自动完成「建模 → 预测 → 外部验证 → 形成训练信号 → Finetune 下一版模型」,持续产出疾病、组织、细胞特异垂类模型;人只设定证据边界和 Go/No-Go 门槛。在经典人类细胞系 K562 功能预测任务上,首版自动微调 Finetune V0 已在完全留出染色体测试集上显著优于原始模型。

  1. Frozen model
  2. Leakage-aware split
  3. Predict
  4. Candidates
  5. External validation
  6. Finetune
  7. Frozen benchmark
指标(frozen chr8 · n = 2,520)原型Finetune V0变化
ATAC · MAE5.9470.482−91.9%
ATAC · R²−182.80.469由负转正
H3K27ac · RMSE4.9724.433−10.8%
H3K27ac · R²0.1220.302+0.180

当前为 Finetune V0(仅训练下游 head、冻结 backbone),已在单一人类细胞系与两类功能信号上完成验证;下一步将复制到更多任务,并升级为全 backbone 的持续自进化。

07 ENGINE 02 · S2F AGENT

S2F Agent 把模型广度,
收敛为可直接指导实验的决策智能。

S2F Agent 不只是调用模型:它会选择、适配、交叉验证,并把模型组合成任务专属工作流。

INPUTS · 规范化输入键
  • DNA 序列与基因组区间(assembly 与坐标系归一化)
  • 变异:REF / ALT 等位基因与基因组坐标
  • 生物学语境:组织、细胞类型与 assay
  • 分析意图:变异打分、序列嵌入、轨迹预测或元件设计
OUTPUTS

一份可审计的实验决策:机制排序、证据与反证、校准的不确定性。

编排的 skills 涵盖 11 个模型家族:AlphaGenome · Borzoi · DNABERT-2 · Evo 2 · GPN · Nucleotide Transformer v3 · SegmentNT,以及 LinkX 自研与 DeepGeSeq 生成的专家模型。
  1. 01Plan
  2. 02Select
  3. 03Adapt
  4. 04Cross-Examine
  5. 05Synthesize
  6. 06Prioritize
  7. 07Design
FROZEN CAD BENCHMARK · AGENT ABLATIONS

Model + Agent,
显著优于最强单模型

冻结 CAD 基准上,结构化 Agent 相对验证集锁定的最优单模型,Δ macro Spearman 达 +0.3282(95% CI 0.0861–0.4639),通过预设 GO 门槛;所有对比项均在相同数据划分、相同标签、相同指标下评测。

非编码功能预测并非无人可做,真正约束在于可靠性:单模型性能随组织、assay 与变异类型显著波动,图中最弱配置甚至与真实效应负相关。Harness 的作用,是让系统性能不被任一模型局部失效所决定。

数据来自 locked-test frozen CAD benchmark(LinkX internal, Aug 2026)。

S2F AGENT VS GENERAL AGENT · 54 PAIRED CASES

同一套 benchmark 下,S2F Agent 通过率 100%,通用 Agent 22.22%

+77.8pp

54 个 paired cases 上,s2f-agent 通过率 100%,GPT-5.5 通用 Agent 为 22.22%;McNemar p = 4.55e-13。

Suites2f-agentGPT-5.5Δ
Routing100.00% (23/23)21.74% (5/23)+0.783
Groundedness100.00% (8/8)0.00% (0/8)+1.000
Task success100.00% (23/23)30.43% (7/23)+0.696
Overall100.00% (54/54)22.22% (12/54)+0.778

GPT-5.5 经 proxy OpenAI-compatible endpoint 评测;Codex 及更多 API 模型将按同一协议纳入。

NEXT PROOF POINT

OmniReg-GPT + S2F Agent 在 ClinVar 冻结基准上的表现,以及 GPT / Codex 在 CAD numeric-fusion 上的 zero-shot 对照。Results pending.

08 PROOF I · CAD FROZEN RETROSPECTIVE

证明 I · 时间冻结回测

从 16,607 个信号,
到 51 个可审计候选,
再到 12 个核心靶点。

以 2022 年 12 月发表的百万样本 CAD 研究(Aragam et al., 2022)为时间零点,所有证据按「源研究前 / 同期 / 之后」严格切分,避免用后续关联回填;本次结果冻结于 2026-08-17。漏斗:16,607 个源 GWAS / S2F 变异 → 557 个进入排序的变异(154 个位点)→ 51 个优先变异 / 37 个位点 → 12 个核心靶点。

S2F 补充的结果(CAD)压缩比 326×
输入:遗传变异16,607
输出:优先变异 / 位点51 / 37
输出:核心靶点12
已验证成药性9(75%)
已有临床或批准药物6(50%)

35 个优先变异在源研究发表前没有严格 CAD 精确命中记录;其中 31 个(88.6%)至少还有一类独立证据,12 个至少有两类。相同复核预算下,相比仅按后验包含概率排序,变异层命中提升 33.3%,位点层提升 21.4%。

75%

核心靶点已验证成药性(9 / 12)

50%

已有临床或批准药物(6 / 12)

16,607 条遗传证据 → 12 个核心靶点:75% 已验证可成药,50% 已有临床或批准药物。

把有限的实验预算,花在更经得起审计的候选上。

脚注:位点层最强基线仍是 GWAS P 值;上述提升为固定预算下的点估计,bootstrap 区间跨零,属探索性增益。完整证据包(逐变异状态、全排序指标、5,000 次 bootstrap、输入哈希)随报告开放复核。数据时点 2026-08-17。

09 PROOF II · SORT1 & TARGET ASSETS

证明 II · SORT1 案例

SORT1:被标准管线口径
漏判的 Phase 3 靶点

SORT1 在 Open Targets 靶点页 drugAndClinicalCandidates.count = 0,按本疾病管线计,被记为「无临床候选」。审计口径下不是这样:位点到基因,rs12740374,L2G 0.795(高置信),GTEx 与共定位双重支持;成药性,抗 SORT1 单抗 Latozinemab 曾至 Phase 3(额颞叶痴呆 / FTD-GRN;INFRONT-3 未达终点,开发已终止),另有 affibody 与高质量小分子口袋。成药性已由外部在其他适应证完成投入,不构成疗效背书,也不构成 CAD 验证。

疾病验证与成药性验证是两个独立维度。行业标准数据库只审计前者,系统性遗漏后者——这正是靶点资产被低估的来源,也是 S2F 审计口径的价值所在。

已验证成药性的 9 个靶点 DRUGGABILITY AUDIT

靶点基因映射成药验证最高观察阶段
PCSK9rs471705;GTEx pair抗体、siRNA;ASCVD / 降脂已批准
SORT1rs12740374;L2G 0.795(High);GTEx + coloc抗 SORT1 单抗 Latozinemab;另有 affibody、小分子 pocketPhase 3(额颞叶痴呆,非 CAD;已终止)
LIPArs1412444;Medium;GTEx + L2G/coloc蛋白替代 Sebelipase alfa已批准(LAL 缺乏症,非 CAD)
FN1rs1250247;Medium;源 accession exact抗体 / 融合蛋白;ocriplasminPhase 3 / 已批准(非 CAD)
GLP1Rrs1155347;心代谢靶点成熟多款 GLP-1 受体激动剂已批准
NOS3rs3918226Tilarginine acetate,心血管适应证Phase 3(已终止)
SCARB1rs7296737 / rs10846744;Medium;GTEx + L2G/coloc高质量配体、小分子 binder;SR-BI 抑制剂药理临床前可开发
ANGPTL4rs116843064;Medium配体结合结构、抗体可及、治疗性拮抗临床前可开发
ABCG8rs4245791;Medium;源研究 + 后续 exact结构、抗体可及临床前可开发

前 6 个计入 50%(已有临床或批准药物);全部 9 个计入 75%(已验证可工程化干预)。资产分层:Tier A 疾病与成药性双验证(PCSK9)· Tier B 成药性已验证,适应证待转化(SORT1 / LIPA / FN1)· Tier C 化学可开发,方向待验证(SCARB1 / ANGPTL4 / ABCG8)· Tier D 生物学先行(CELSR2 等)。

边界:非 CAD 适应证的临床证据,不等于 CAD 验证。作用方向、组织选择与安全窗,是下一阶段需要验证的内容。成药性定义:已具备抗体、小分子、蛋白替代、核酸,或已进入临床 / 获批的可干预路径;药物阶段均为数据库中观察到的最高阶段。

10 STRATEGIC EXTENSION · SEQUENCE MEDICINES

LinkX,
打开核酸药的
全基因组时代。

核酸药物是可编程药物形态:按碱基配对规则设计,原则上可靶向任何转录本;ASO 与 siRNA 已从脊髓性肌萎缩等罕见病走向心血管等常见病,被公认为个性化医疗关键路径之一。其药理是降低表达,因此立项前必须先判断:压低该基因对患者是否有保护性——这一判断可由人类队列证据事先给出。功能缺失呈保护方向的基因,构成天然核酸药物靶点池。

NUCLEIC-ACID PIPELINE · WHERE S2F OPERATES

核酸药物研发流程,与 S2F 介入环节

决定核酸药物项目成败的前四个环节——疾病锚定、靶点确证、方向判定、序列设计——全部发生在序列层,正是 S2F 的作业面:疾病锚点来自人类队列证据,靶点与方向由证据链与成药性审计给出,序列层表征直接衔接药物设计。后两个环节(化学修饰与递送、临床验证)由行业成熟平台技术承接。序列定义的药物形态与序列出发的发现引擎共用同一层表征,从靶点确证到药物设计的迭代路径最短。

  1. 疾病锚定 · S2F
  2. 靶点确证 · S2F
  3. 方向判定 · S2F
  4. 序列设计 · S2F
  5. 化学修饰与递送
  6. 临床验证

行业综述:Tang Q & Khvorova A. RNAi-based drug design: considerations and future directions. Nat Rev Drug Discov 23, 341–364 (2024);Sun X, et al. Nucleic acid drugs: recent progress and future perspectives. Signal Transduct Target Ther 9 (2024). 边界:递送(尤其肝外组织)仍是全行业瓶颈,属化学修饰与递送环节,不在 S2F 作业面内。

PCSK9 → inclisiran,是这条路径已经走通的先例,也是本次回测的 Tier A 正对照。

药理方向与队列效应方向的系统对齐,已纳入 154 个位点对称审计——S2F 将为每个候选靶点给出方向性判定,直接输出可进入核酸药物靶点清单。

队列证据覆盖不到的四类盲区 BEYOND COHORT COVERAGE

现实盲区核酸药的实际需求
稀有 / 私有突变n-of-1 ASO、超罕见剪接病的唯一靶点
深内含子、调控 RNAsplice-switch、毒 RNA、eRNA / lncRNA 靶点
编辑后产生的新序列碱基编辑、外显子跳读的产物本身不存在于人群
反事实扰动药物引入的是「人为修改」,不是「人群中自然存在」的变异

LinkX 的核心主张——输入任意 DNA,输出 RNA 与调控效应,不要求该位点进过队列——正好覆盖这四个盲区。

11 BUSINESS MODEL + GTM

先用付费验证切入,
用证据包沉淀下来,
用里程碑锁定价值。

可立即成交的第一种合作:按同一套审计标准,重审客户已有靶点组合,找出被行业标准低估的资产。初始买方:药企与 biotech 的 Human Genetics、Functional Genomics 和 Target Discovery 团队。验证单不是业务终点,作用是把客户决策口径锁定到 S2F,再升级到发现项目与后端分成。

Program dataSpecialist modelsS2F AgentPrioritized experimentsPositive + negative outcomesProprietary mechanisms
VERIFIEDEVIDENCE GRAPH
POSITIVENEGATIVECONTEXT-DEPENDENT

LAND-AND-EXPAND · FOUR TIERS

  1. 01
    Paid Validation / Evidence Package

    一个明确的问题、一套锁定的数据集、一组预先约定的验收标准。

    证据包 · 可复现记录 · 20–50 万元假设
  2. 02
    Disease Discovery Program

    在一个疾病领域内滚动复购的发现周期。

    项目首付款 · 研究经费 · 50–150 万元起
  3. 03
    Annual Platform Partnership

    在客户环境内整合私有数据,部署客户专属专家模型与工作流——交付模型产能,而非单次报告。

    年度研究框架 · 200–500 万元 / 年假设
  4. 04
    Target Option / Co-Development / Licensing

    获取优先权费、里程碑付款与共同开发收益分成。

    优先权费 · 首付款 · 研发里程碑 · 销售分成

以上价格为与设计伙伴校准中的初始商业假设。

12 COMPETITIVE LANDSCAPE

竞争格局

序列模型公司有功能评分,缺疾病锚点;证据聚合平台有数据广度,但会漏判,且不提供反对证据;传统 CRO 有实验能力,但缺压缩层。把支持证据、反对证据和校准后的不确定性整合成可审计证据包——这一层,目前只有我们做成了产品。

核心能力LinkX本轮拟融资 ¥2,000 万insitro公开披露资本 ≈ 8 亿美元Relation公开披露投资 ≥ 1.01 亿美元Deep Genomics公开披露股权融资 ≥ 2.33 亿美元
以人类遗传学为首要发现入口✓*
跨 DNA、RNA、蛋白、免疫序列专家模型的编排能力✓*
标准化、可审计 Evidence Package(支持证据 + 反证 + 不确定性)✓*
直接输出实验优先级与 Go/No-Go 标准✓*
机制优先、不锁定治疗模态的开发路线✓*
轻资产嵌入客户现有数据与实验体系✓*
不依赖相应细胞 QTL 数据的功能预测覆盖✓*
核心产品或对外交付 部分覆盖或主要内部使用 未公开定位为标准化核心产品✓* LinkX:Published / Productized / Internal development 分级

融资额来源于公开互联网检索,统计截至 2026-08-16。

13 TEAM

团队成员

两位创始人组合覆盖原创建模、Agent 工程、生物学判断与医疗商业化。本轮将围绕 B2B 疾病发现、前瞻验证与企业交付,补齐转化生物学、功能实验、企业产品与药企合作能力。

01 FOUNDER / CEO
鲍志炜

鲍志炜

浙江大学医学院生物信息学博士、医学信息学博士后,辅修浙江大学管理学院 BEST-MBA。曾任医疗上市公司人工智能事业部负责人,主导医学 AI 产品化、组织管理与产业合作,创造千万级 AI 医疗落地场景;全国规模最大的生物信息学组织 BioLinkX 创始人。负责公司建设与团队管理、融资、商业策略与客户入口。

团队管理融资商业策略
02 FOUNDER / CHIEF SCIENTIST · CTO
李佳琦

李佳琦

浙江大学本科,浙江大学医学院 AI for Science 博士、博士后,长期聚焦单细胞基因组学、序列到功能模型与可解释调控机制。Nvwa、Huatuo、OmniReg-GPT、DeepGeSeq 与 S2F Agent 核心作者,代表工作发表于 Nature Genetics、Nature Communications、Bioinformatics 等期刊。负责模型科学、技术路线、评测体系与研发团队。

模型科学S2F Agent评测体系

持续招募中:

BIOTECH CAPABILITIES TO BUILD
  • 转化生物学与疾病项目负责人
  • 计算基因组与 Model Factory 工程
  • 疾病模型、基因编辑与功能实验
  • 企业产品、安全部署与 Scientific Solutions
  • 药企合作、知识产权与资产 BD
  • 药物开发、监管与 CMC 顾问
融资用途 · 12 个月2,000 万元:把技术领先,转化为商业证明2,000 万元

融资 2,000 万元,支持 12 个月运营,团队扩展至约 10 人。本轮不列愿景清单,只列「资金—证据」对应:每一分钱,对准 2026–2027 三项可核验产出——154 个位点对称审计、前瞻性实验验证、首批付费客户交付。

最低有效首关 1,500 万元可超额认购至 2,500 万元
  1. 01 / AUDIT154 个位点对称审计

    公开可复核的方向对齐与分层结果。

  2. 02 / VALIDATION前瞻性实验验证

    优先机制的湿实验读出。

  3. 03 / COMMERCIAL首批付费客户交付

    签约、验收标准、回款与可复用证据包。

以上为本轮前瞻性里程碑;详细口径、时间表与负责人见尽调材料。本轮聚焦发现与验证,不覆盖临床开发与自建重资产实验室。

14 ROADMAP

通往生物学的
GPT-2 时刻。

  1. 2026–2027验证靶点,交付首批付费项目

    完成 154 个位点对称审计与药理方向对齐,对优先机制完成前瞻性实验验证;S2F Agent v1 上线,交付首批付费发现项目。

  2. 2028–2029垂类 SOTA 模型批量拓展

    以模型工厂微调管线,把验证过的发现流程复制到新疾病领域;按疾病、组织与客户语境持续扩充垂类模型。

  3. 2030–2031生物学的 GPT-2 时刻

    建立数据、算力与实验反馈之间的 scaling law,构建 one-for-all 统一生物学模型,实现跨任务泛化与可预测能力增长——从 Sequence 走向 Therapy。

BIOLOGY SCALING LAW · TWO CURVES, ONE MODEL

生物学 Scaling Law

CURVE 01 · DNA LM曲线一 · DNA 语言模型

不断增加生物序列语料,学习序列本身的生成语法

  • 序列语料:参考基因组 → 人群基因组 → 多物种基因组 → 宏基因组
  • 上下文长度:4 kb → 20 kb → 200 kb → 1 Mb
  • 参数规模:117M → 270M → 500M → 2B+,配 compute-optimal 扫描
CURVE 02 · FOUNDATIONAL S2F曲线二 · Foundational S2F 模型

不断增加功能观测数据,学习「序列 → 功能」映射

  • 功能 profiles:137,127(HERMES)→ 统一 ontology 下全量公共与私有观测
  • 功能模态:表达、剪接、染色质、TF 结合、甲基化、3D contact、单细胞、扰动实验
  • 输出分辨率:窗口聚合 → 单碱基、enhancer–gene、variant-effect
合并方式 · 三层统一语法词表
底层 token 词表

BPE / k-mer / 单碱基 token,承载序列组合语法

功能词表

promoter、enhancer、TF binding、histone state 等——HERMES 40 sequence classes

关系语法

enhancer–promoter compatibility、motif–TF、variant-effect 方向

经典中心法则描述遗传信息如何从 DNA 流向 RNA 和蛋白质。LinkX 要创造并工程化 AI 时代的中心法则:让生命序列在具体患者和生物学环境中的功能可以被计算,让功能与疾病之间的关系可以被实验验证,并让这条信息流能够被反向运行——从目标表型出发,发现、选择并设计相应干预。

我们不仅要提出这一法则,更要把它变成可以持续产生治疗方案和药物资产的真实系统

  1. 01Sequence × Patient ContextGenome · Transcriptome · Immune State
  2. 02Function & MechanismCell · Tissue · Molecular Effect
  3. 03Phenotype & DiseasePatient-specific Relevance
  4. 04Therapy Selection / DesignRNA · Editing · Protein · TCR
  5. 05Experiment & Patient FeedbackCorrection · Response · Learning
MODEL LEARNING LOOP · EXPERIMENTAL + PATIENT FEEDBACK

Toward a New Central Dogma
for the AI Era.