[email protected] 加利福尼亚州,TX 70240 +86 +86 151 1137 2457

2026年被业界视为AI虚拟细胞商业化的起始年份。技术取得突破、政策给予支持、资本大量涌入以及市场需求释放,这些因素在同一时期汇聚,推动该行业正式迈入产业化落地的阶段。然而,在热度之下,产业各方对于AI虚拟细胞的概念界定、技术路径、竞争态势以及真实挑战,仍欠缺统一的认知。

这份白皮书旨在解答三个核心问题:全球参与者形成了怎样的竞争格局,哪些路径更具长期发展潜力?从数据到模型再到应用落地,真正的障碍在哪里?产业界已经出现了哪些值得关注的创新解决方案?

为此,动脉智库梳理了全球AI虚拟细胞的技术演进和产业脉络,访谈了多家企业,盘点了数据供应、模型开发、商业落地等各个环节的参与者布局。我们发现,尽管行业热度高涨,但数据层面高价值数据的缺乏、模型层面预测能力未达产业预期、应用层面验证标准与闭环机制的缺失,构成了关键制约。与此同时,一批企业正在数据生产、跨模态对齐、干湿闭环和真实场景交付方面展开探索,为行业走向规模化落地提供了现实可行的突破口。

核心内容与观点:

以下为白皮书内容节选:

爆发增长,AI虚拟细胞开启生命科学新范式

1、定义与三层技术架构

虚拟细胞(Virtual Cell)是指利用数学方程、物理模拟和AI技术,在计算空间中构建细胞行为的数字化模型,使研究者能够在不依赖实体湿实验的条件下,预测细胞对外部扰动(如药物、基因编辑、环境变化等)的响应。

需要指出的是,虚拟细胞并非单一产品,而是一类技术体系的总称。根据建模方法的不同,目前主要存在两条技术路线。

数据驱动的AI建模路线,使用大规模神经网络从数据中学习细胞行为的映射关系。该路线规模化能力强、迭代速度快,但黑箱特性明显,缺乏因果性解释能力。2024年12月,斯坦福大学、基因泰克与陈-扎克伯格基金会联合在《Cell》上提出的AI虚拟细胞概念,是这一路线的代表性框架。

经典计算细胞生物学路线,基于数学物理方程,从已知的生化反应动力学出发构建模型。该路线机制透明、可解释性强,但扩展性差,难以适配真实生物系统的高复杂度、动态化特征。

当前行业的前沿探索方向,是在数据驱动框架中融入生物机理约束,试图兼顾规模化能力与可解释性。

虚拟细胞技术路线

在讨论AI虚拟细胞时,有几个相近的概念有必要厘清边界。

AI虚拟细胞与相近概念内涵及关系

动脉智库从技术构建到产业落地的实际流程,将AI虚拟细胞技术划分为数据层、模型层、应用层三层架构,同时由闭环主动学习驱动持续进化。

AI虚拟细胞三层技术架构

(1)数据层:由先验知识、静态架构、动态状态组成

先验知识整合已发表的生物医学文献、已知的分子表达规律和多尺度成像数据,明确细胞生命活动的基础规则。静态架构收录细胞形态结构、分子空间分布等固定信息,还原细胞固有物理特征。动态状态是构建具备真实推演能力模型的关键,聚焦细胞自然发育、衰老、药物干预、基因编辑等外部扰动下的状态变化,是支撑AI虚拟细胞实现动态仿真的核心数据底座。

(2)模型层:多类模型构成的能力矩阵

模型层基于数据层提供的信息,构建能够表征和预测细胞行为的数字化模型,产品形态大致分为以下几类。

细胞表征模型是当前数量最多的类型。扰动预测模型是目前核心竞争方向,在单细胞基础模型底座之上,针对性优化外部扰动响应建模能力,预判药物、基因编辑等干预行为对细胞状态的影响。多模态整合、跨尺度建模模型是长期演进方向,是贴合真实细胞生命活动规律、突破现有仿真精度瓶颈的必然发展趋势。

(3)应用层:面向生命科学全链条的价值落地

应用层将模型能力转化为实际应用场景中的解决方案,包括药物研发领域,可覆盖靶点发现与验证、候选药物虚拟筛选、药效评估、毒性预测、适应症拓展等,以及再生医学、合成生物学等领域。

(4)闭环主动学习:AI虚拟细胞的进化引擎

在数据层、模型层和应用层之间,存在一个关键的动态机制——闭环主动学习。

AI虚拟细胞在应用过程中自主识别模型认知缺口与预测不确定性区域,针对性设计基因编辑、小分子药物处理等新型湿实验方案,产出新数据,再将新增数据回流至数据层,驱动模型迭代优化。这使得AI虚拟细胞从静态的预测工具,变为一个能够持续逼近真实细胞行为的学习系统。

2、行业爆发窗口:技术、政策、资本、市场四维共振

技术拐点:AI建模与数据获取技术的双重突破。 AI建模层面,AI大模型技术向生命科学领域渗透,行业摆脱人工预设生物规则的传统模式,形成数据驱动、自主学习、动态推演的全新建模逻辑。数据获取层面,单细胞测序、蛋白质组学、器官芯片等技术的逐步成熟,提供了不可或缺的燃料基础。

政策拐点:主要经济体同步加码AI for Science。 2025年以来,美国、英国、欧盟、日本、中国等主要经济体密集出台AI for Science政策,普遍将其上升为国家级战略工程。

主要经济体AI for Science重点政策(2025—2026年)

资本拐点:全球资本加速入局,产业资金条件逐步成熟。 截至2026年8月底,全球AI虚拟细胞领域融资总规模突破30亿美元,成为生命科学智能方向的重点投资赛道。国内市场后发加速,融资热潮集中于2026年,呈现出早期化特征。

全球AI虚拟细胞投融资事件盘点

需求拐点:传统研发体系承压,行业迎来刚性需求。 AI虚拟细胞的爆发,离不开传统新药研发体系长期积累的弊端。下游需求已经从前沿技术探索转向实质性采购,这一变化由多重行业压力驱动。

四重压力驱动下的药企需求拐点

数据、模型、验证矛盾待解,规模化落地面临瓶颈

在产业热度之下,从数据生产、模型构建到场景验证的全链条中,仍存在多项深层次矛盾。动脉智库沿着数据、模型、应用三层产业链路,逐层拆解制约行业扩张的核心痛点,梳理现存约束。

1、数据层约束:高价值数据生产与标准化推高产业落地门槛

数据获取与加工痛点

(1)生产端:扰动、蛋白与阴性数据供给不足

扰动数据成本高,实验周期长,供给存在明显缺口。 扰动数据需要通过定向干预实验产出,获取成本高、实验周期长,整体积累速度远慢于静态观测数据,难以支撑模型持续迭代。

蛋白质数据获取面临成本与技术瓶颈,供给严重不足。 在细胞信息构成中,DNA仅承载约10%的静态信息,RNA反映约20%-30%的预备状态,蛋白质的功能修饰承载超过60%的信息权重。但质谱检测成本尚未出现指数级下降趋势,且蛋白覆盖率有限,使得蛋白组学数据获取的难度和成本都相对较高。

药物研发与阴性数据的缺乏,对AI虚拟细胞模型性能也有重要影响。 药企内部的研发数据是模型学习真实药物作用机制的核心素材。特别是阴性数据,覆盖无效分子、毒性反应、失败扰动等边界场景,能够提升真实研发场景中的预测稳定性与可靠性。但药企内部研发数据通常不会对外共享,且行业惯例只留存阳性结果,大量失败实验数据被丢弃,公开数据清洗时也仅保留阳性结果,导致模型无法学习失败边界。

(2)加工端:标注与对齐两大梗阻制约数据可用性

即便数据被生产出来,进入模型前的加工环节仍面临双重梗阻。生物数据标注远比文本复杂,单个细胞状态需同时标注基因表达谱、蛋白丰度、表观遗传状态等多个维度,几乎缺乏自动化标注手段,高度依赖专家。

跨模态、跨尺度数据对齐同样困难。 单细胞测序具有破坏性,测完一个组学后其他组学无法再测,天然难以实现模态对齐。跨数据源对齐整合需要大量批次效应校正和归一化处理,目前缺乏行业公认的统一流程。

数据层面的缺陷,会沿着模型能力、商业落地、规模效应形成负向传导。首先,模型能力固化,难以建立可靠的预测能力,其次,模型输出与商业需求错位,药企对描述性模型付费意愿有限,再次,Scaling Law局部失灵,单纯扩大模型参数量难以提升性能。

2、模型层瓶颈:通用架构与生物系统运行规律的结构性错配

模型层核心痛点

■ 困境一:先验缺失,通用架构缺乏生物拓扑的内建理解

结构性先验错配诱发通用AI架构核心功能失效。Transformer的自注意力机制假设序列中任意位置均可直接交互,但生物系统的相互作用具有严格的拓扑约束。通用架构未内建这些生物先验,只能依靠数据从零拟合。在样本有限的高维生物场景中,参数效率极低。

■ 困境二:表征割裂,组学模态与跨尺度动态难以统一

多组学数据格式不统一,跨模态整合停留在特征拼接层面。 这引发了三重问题:其一,不同模态的噪声相互干扰,高噪声模态会稀释低噪声模态的有效信号;其二,模型对模态完整性要求过高,缺失任一模态就会导致整条样本不可用,数据利用率明显下降;其三,不同模态的量纲与分布差异干扰梯度优化,导致训练不稳定。

时空尺度跨越多个数量级,现有模型难以同时实现分子到组织过程动态建模。

■ 困境三:解释性缺位,黑盒预测与高风险决策需求的错配

深度学习模型的黑盒特性在消费互联网场景中通常不构成主要问题,但在药物研发等高风险决策场景中会直接影响其可信度和实际采纳。当前模型仅能输出相关性层面的预测结果,无法提供因果层面的机制解释,导致预测结果无法转化为可执行的实验设计。

模型层架构与生物规律的错配,导致模型从核心决策依据退为辅助参考工具,商业化落地进度显著滞后于早期市场预期,尚未跨过大规模商业化应用的门槛。

3、应用层挑战:从技术验证到产业落地之间的断层

虚拟细胞应用层核心矛盾与结论

标准缺位,模型价值难以被客观量化。 AI虚拟细胞领域至今缺乏类似CASP的行业级统一评估框架。现有评测任务多为预定义、有限范围的学术场景,无法覆盖药企实际面对的复杂决策情境。评估标准碎片化,导致不同模型之间难以横向比较,药企在技术选型时缺乏可靠参照。

接口错位,模型输出与药企研发流程难以嵌入对接。 系统层面,多数药企数字化实验流程尚不完善。认知层面,模型输出多为计算原生格式,而研发团队习惯消费决策友好格式,跨界人才稀缺导致对接高度定制化。决策层面,大型药企技术引进决策权高度集中,早期合作往往依赖既有关系网络。三重错位叠加,使商业化落地难以脱离项目制模式。

闭环断裂,干湿循环未打通,制约模型进化。 AI虚拟细胞的核心价值是以计算预测替代湿实验试错,但当前模型预测结果的可靠性本身仍需湿实验验证。类器官、器官芯片或动物实验等验证路径成本高、周期长,许多企业只能做到算完即弃,无法将验证结果结构化回流至模型进行迭代优化。干湿闭环的断裂,使模型丧失了通过预测、验证、反馈循环持续提升能力的关键机制。

竞争路径分化,数据与闭环能力决定长期竞争力

过去两年间,一批企业和机构在数据基建、模型搭建和商业应用上展开了探索,针对行业痛点形成了多元化的技术突破路径与落地解决方案。

本章基于行业发展现状,系统盘点市场参与主体类型、产品形态与整体发展进度,构建企业能力全景图谱,从数据、模型、应用三个层面梳理行业参与者的综合实力与发展差异。

1、参与类型多元,形成七大差异化发展路径

AI虚拟细胞行业格局全景图谱

目前行业参与者类型多元、覆盖维度广泛,不同背景的企业与科研机构依据自身资源禀赋,分别在产业数据层、模型层、应用层形成差异化布局,呈现出多点开花、协同发展的繁荣格局,尚未形成高度集中的竞争态势,各类主体仍处于能力搭建与赛道卡位阶段。

可以发现,业内企业虽处同一个赛道,选择的发展路径却差异显著,从上游数据供给到下游临床应用,从技术驱动到需求拉动,从商业公司到非营利机构,不同参与者基于初始资源禀赋、数据获取方式、技术切入逻辑与壁垒建设思路,形成了七条发展路径,不少企业随业务推进,会叠加多条发展路径。

■ 路径一、全栈平台型:资本驱动的全链条布局

该路径先投入重金建设数据基础设施和计算模型平台,形成从数据生成、模型训练到管线推进的全链条能力,再通过自研管线或对外合作实现长期价值回报,入场门槛极高,需要大规模的前期资本投入,且回报周期较长。

■ 路径二、服务验证型:以药企合作锚定技术价值

该路径用跨国药企的合作合同为自身技术定价,是当前行业认可度最高的技术验证路径之一。

■ 路径三、数据供给型:将数据资产作为核心产品

该路径打破数据作为实验副产品的传统定位,将生物数据打造为独立商业化产品,通过自主搭建实验体系规模化生产AI适配数据,供给模型研发企业。

■ 路径四、场景飞轮型:用临床场景驱动数据积累

该路径将真实临床场景作为数据入口,通过业务持续落地沉淀结构化数据,以数据迭代优化模型能力,再依托升级后的模型深化场景渗透,形成自我强化的正向循环,具备场景真实性强、数据维度贴合临床需求的特点。

■ 路径五、干湿闭环型:物理实验与计算模型互补

该路径通过器官芯片湿实验体系弥补纯算法建模的短板,构建AI预测、实验验证、数据回流、模型优化的闭环迭代体系,依托干湿结合的差异化路径形成独特竞争优势。

■ 路径六、公共基础设施型:搭建公共科研生态

该路径以非营利科研机构为主,通过搭建公共数据平台、建立行业评测标准、组织产业学术赛事等方式构建行业基础设施。

■ 路径七、临床牵引型:从临床痛点反向定义能力

该路径以临床痛点为导向,先明确临床诊疗、药物研发中的实际问题,再针对性定义AI虚拟细胞模型的能力需求,通过适配的数据采集、算法优化补齐技术短板,实现技术与场景的精准匹配。

七种发展路径对比

2、数据层:从公开数据集到私有资产壁垒的构建

仅依靠公开数据集,不足以支撑具备产业实用价值的模型,必须依托定向产出的私有实验数据完成训练与校准,这推动一批专业化数据生产商快速切入AI虚拟细胞赛道。

发展现状:专业化数据生产商快速崛起

AI虚拟细胞数据生产商布局

目前,数据供给端已经形成多元参与者矩阵。 单细胞测序企业是重要数据来源,包括10x Genomics、寻因生物、墨卓生物、新格元等。类器官与器官芯片企业可产出贴近生理环境的细胞实验数据,代表有耀速科技、淇嘉科技等;蛋白质组学企业依托自研质谱平台,产出转录组难以覆盖的功能蛋白、翻译后修饰数据,包括嘉华药锐、西湖欧米等;部分生物医药企业也开始对外输出数据资产,例如神拓生物这类体内治疗技术企业,沉淀大量真实研发过程数据与失败边界信息。

数据层的核心竞争要点集中在数据集积累速度与客户迁移成本。一旦主体完成规模化、体系化的数据资产沉淀,后来参与者很难在短周期复刻同等体量与质量的数据资源。

单一模态数据很难完整还原细胞复杂运行逻辑,多组学融合的数据集合可以有效降低模型的认知偏差。业内数据生产商正积极通过跨主体合作补齐自身数据维度短板,淇嘉科技与赛陆医疗共建AI虚拟细胞数据训练平台,耀速科技联合珞米科技探索器官芯片叠加蛋白组学的数据体系,都是这一趋势下的实践案例。

与此同时,模型开发企业也意识到了数据底座的价值,数据生产商已经成为模型开发与迭代不可或缺的外部合作伙伴。2026年赛道诞生多起产业合作,例如衍因科技与神拓生物,百图生科与耀速科技,无界进化与墨卓生物,百曜科技与新格元,无尽方舟与寻因生物,英矽智能与墨卓生物,百图生科与华大智造,数据层与模型层的绑定日益紧密。

数据生产企业与模型开发企业合作案例

数据供给主体数量持续增长的背景之下,不可忽视的是,行业尚未建立统一的数据质量评判标尺,不同机构产出数据集的一致性、可复用性参差不齐。想要成为合格的AI虚拟细胞数据供给方,需要打造标准化的AI Ready数据体系,围绕模型训练诉求重构数据生产、整理与输出逻辑。

首先,企业需要优化数据整体分布结构。 常规药物设计实验聚焦优质有效靶点与阳性化合物,数据样本高度集中于有效区间,会导致模型学习维度片面,难以掌握完整的细胞作用规律。合格的数据生产需要主动拓宽样本覆盖范围,均衡布局全维度实验空间,补齐无效、临界状态等薄弱数据区间,让模型实现对细胞调控与药物作用空间的全面认知。

其次,需要重构样本构建规则,重视全量实验数据与配套信息的留存。 传统研发场景仅关注阳性有效样本,大量具备研究价值的阴性样本被舍弃,数据生产商需要合理优化正负样本比例与分布结构,留存实验批次、环境参数、操作条件等元数据,完善数据溯源体系,这是传统实验场景无需关注、却是AI模型训练不可或缺的内容。

同时,数据生产商需要建立数据与模型的协同思维,摆脱被动生产实验数据的模式。 企业需要精准匹配模型迭代需求,了解模型训练的数据短板与优化方向,以低成本、高质量的定制化实验方案,补齐模型所需的关键数据,实现数据生产与模型开发的联动。

最后,需要具备多组学多模态数据的对齐与整合能力。 AI虚拟细胞模型的高精度训练,依托于多维度生物数据的关联匹配。数据生产商需要针对性设计多类型扰动实验,统一多组学数据观测标准,梳理不同维度数据的内在关联,完成多模态数据的标准化对齐与结构化整理。

从传统实验数据生产到AI Ready数据体系的模式转变

但AI Ready数据体系的落地将显著推高实验与人力成本,对企业资源能力要求较高,多数中小企业难以承担,未来数据供给端大概率迎来一轮淘汰整合。

数据层创新方案:面向模型训练需求,补齐关键数据短板

面对AI虚拟细胞对特殊类型数据的迫切需求,产业端已经涌现多项创新解决方案,针对性缓解跨模态跨尺度数据难以对齐、扰动数据稀缺、大规模功能蛋白组获取困难、药物研发阴性数据不足等行业痛点。

(1)跨模态跨尺度数据对齐

多组学、多尺度数据的对齐融合是一大现实难题。百图生科是行业内少数已经落地跨尺度、跨模态

3条评论

  • 如何系统化理解NBA比赛数据? - NBA下注专题

    张伟

    2026年9月20日 上午11:25

    2026年9月28日,湖人主场对阵勇士的比赛中,湖人末节失误多达7次,勇士利用转换进攻得到18分,最终逆转取胜。复盘显示,湖人替补控卫的缺阵是失误集中的直接原因。

    回复
    • 张明 2026年9月28日 14:38 这篇文章对湖人失误的分析很到位,确实替补控卫缺阵影响很大。希望能看到更多关于轮换阵容效率的复盘。 回复
  • 李伟 2026年9月25日 09:15 凯尔特人限制字母哥接球的策略很经典,数据复盘把防守执行讲清楚了。建议后续增加对裁判吹罚尺度的分析。 回复

在此留下你的评论