

2026年8月13日,Ali Ghodsi带领Databricks完成50亿美元战略融资,投后估值达到1900亿美元。公司同期披露,收入运行率超过70亿美元,同比增长超过80%,客户超过2万家,覆盖超过70%的《财富》500强。对一家不卖药、不直接诊断、也没有消费硬件的公司来说,这组数字很容易让人产生一个疑问:资本究竟在为哪一种医疗AI能力付钱?
Databricks卖给企业的是数据与AI平台。药企、医院、保险机构和研究团队在上面处理数据、管理权限、运行模型和部署AI Agent。Novo Nordisk用它整合临床试验数据,Regeneron用它分析电子病历与基因测序数据。两个案例指向同一个瓶颈:医疗AI真正难的,常常不是模型能否生成答案,而是数据能否被找到、授权、复用、追溯,并安全地送进研发和临床工作流。
Ghodsi过去十多年解决的正是数据问题。如今,他把这条技术路径推向医疗行业,却没有把公司主要商业叙事押在最热闹的通用模型竞速上。为什么一条藏在医院和药企后台的路线,获得了1900亿美元估值?

2009—2026,从Apache Spark到医疗AI,Ali Ghodsi始终在解同一道数据题
Ali Ghodsi的职业起点不是医院,也不是药企,而是分布式计算。
2009年,Apache Spark诞生于加州大学伯克利分校AMPLab,试图改善传统大数据任务速度慢、不同计算过程难协同的问题。Spark在2010年开源,2013年进入Apache软件基金会。Ghodsi是早期创建者之一,他的学术研究涉及资源调度、数据缓存和分布式系统,相关思想也被用于Apache Mesos和Hadoop。
这段经历塑造了Databricks后来选择的位置。Spark让大规模数据计算变快,却不能单独解决企业里的全部难题:数据仍散落在不同系统,权限规则彼此割裂,分析结果难以追踪,开源软件也需要有人把部署、运维和安全变成可购买的服务。
2013年,Ghodsi与另外6位联合创始人创建Databricks,围绕Spark提供商业化平台。他先负责工程和产品,2016年出任CEO。公司随后从计算工具扩展到覆盖数据存储、分析、机器学习、模型调用和AI Agent的统一平台。公开经历显示,他的路径没有突然转向医疗,而是把长期处理的“复杂数据如何被更多人安全使用”推到监管更严、价值更高的行业。
Databricks的商业模式可以用30秒解释清楚。企业把分散的数据接入Lakehouse,用Unity Catalog设置谁能看、谁能改,并记录数据从哪里来、经过哪些处理;业务人员可以通过Genie用自然语言查询,开发团队通过Agent Bricks构建执行具体任务的Agent,Lakebase保存这些应用所需的实时业务状态,Unity AI Gateway再管理模型选择、调用权限、预算和审计记录。
客户主要按平台使用量和相关云资源付费。数据处理越多,模型和Agent调用越频繁,平台消费也可能越高。Databricks没有单独披露医疗与生命科学业务收入,因此,Novo Nordisk或Regeneron的项目不能被换算成“医疗业务占比”,更不能把1900亿美元全部归因于医疗AI。

医疗行业之所以成为检验这套模式的场景,是因为它把数据基础设施的难题集中到了一起。临床试验记录、电子病历、真实世界数据、医学影像和基因组数据格式不同,存放位置不同,允许使用的目的也不同。研究人员不仅要找到数据,还要证明数据取得了授权、加工过程可以复核、模型输出没有越过权限边界。
Spark当年回答的是“数据怎样跑得更快”,Databricks今天回答的是“数据怎样在企业里安全地流动”。直到大模型降低自然语言交互门槛、Agent开始执行多步骤任务、药企愿意为持续的数据调用付费,这个后台问题才从工程成本变成直接影响研发效率的商业产品。

2024—2026,1600项临床试验开始复用,医疗AI才走出模型演示
过去的医疗AI常从一个模型开始:识别影像、预测风险或整理病历。模型一旦进入药企或医院,困难就会沿着数据链条出现:资料在哪里、谁有权查看、患者授权覆盖什么用途、错误答案由谁复核,每一步都可能阻止产品进入日常工作。
Databricks表面上卖数据与AI平台,真实需求是让敏感临床数据在授权范围内反复利用,核心资源则是权限体系、数据血缘和研发工作流。数据血缘相当于给结论附上“来路地图”:数据源是什么,经过哪些处理,被哪个模型调用,最后流向哪里。
Novo Nordisk的FounData提供了一个具体样本。Novo Nordisk在2024年资本市场日材料中披露,公司正对约1600项临床试验的数据进行统一处理,涉及数十亿个临床数据点。FounData主要服务已经完成的试验,让研发人员进行二次分析;DataCore则管理试验进行过程中的数据,并运行在符合药物临床试验质量管理规范要求的环境中。
Databricks客户案例披露,FounData从概念走到最小可用产品用了9个月,目前约有1000名用户和80多个活跃协作项目,研发组织中使用临床数据的比例从此前“类似1%的很小比例”提高到20%以上。Novo Nordisk还在2025年6月中旬上线了首个Co-Scientist Agent,用于搜索临床数据和外部医学文献,并保留人员监督。

同一案例预计,未来5年,优化临床试验可产生超过1.57亿美元净新增价值和1400万美元运营效率收益。这些金额是Databricks客户案例中的预测和归因值,不是Novo Nordisk已经确认的收入,也不是独立审计后的财务结果。它们能证明客户正在为平台计算经济回报,却不能证明患者已经更早用上新药。
临床数据由少数熟悉旧系统的人才能使用,转向更多研发人员在权限控制下查询。统一平台把找数据、申请权限、整合和核对放进可管理的流程,AI才有机会持续参与工作。
Regeneron展示了另一种价值。Databricks客户材料称,该公司把约10TB电子病历和DNA测序数据放进同一分析环境,一项针对完整数据集的查询从30分钟降到3秒,约提升600倍;ETL数据准备时间由3周缩短到2天。这里的600倍只对应特定查询工作负载,不是药物研发周期、临床疗效或审批速度提升600倍。
但3秒与30分钟会改变提问频率。几秒返回的分析允许研究团队连续验证假设、筛选患者亚群、比较遗传变异与疾病记录。平台没有替代科学判断,只是降低了反复试错的时间成本。
Unity Catalog把权限和血缘放在同一层,AI Gateway管理模型调用、成本和审计,Genie让不熟悉代码的人查询经过治理的数据。HIPAA、HITRUST等合规配置不等于客户自动合规;数据分类、患者授权和最终责任仍由医疗机构与药企承担。

2024—2026,Databricks没有把最强模型当主业,却把平台消费做成高估值生意
Databricks并非完全不做模型:公司2023年收购MosaicML,2024年发布DBRX,也提供模型训练和托管。它没有把“训练最强通用模型”作为主要收入逻辑,而是让客户选择不同模型,再用统一的数据、权限和成本控制把模型放进业务。
这条路线不如模型排行榜直观,却更接近企业采购。通用模型可以被多家供应商提供,药企多年积累的临床数据、访问规则和研发流程却不能轻易搬走。一旦数据治理平台成为研发人员每天使用的基础设施,更换供应商就意味着重做接口、权限、历史数据和内部流程。Databricks争夺的不是患者数据所有权,而是企业决定谁能使用数据、如何使用以及如何留下记录的治理位置。

资本给出了高昂定价。2024年12月,Databricks宣布以620亿美元估值推进100亿美元J轮融资,公告时已有86亿美元完成交割;2025年9月,10亿美元K轮把估值推到1000亿美元以上;2026年2月,公司以1340亿美元估值完成约50亿美元股权融资,并取得约20亿美元债务额度;半年后,最新50亿美元战略融资把估值提高到1900亿美元。
最新公告显示,公司整体收入运行率超过70亿美元,同比增长超过80%;超过1000家客户的年化消费运行率超过100万美元,超过100家超过1000万美元。Lakehouse收入运行率超过15亿美元,Lakebase超过1亿美元。这是私营公司公告口径,并非上市公司经审计年报,但已能说明企业AI使用量正在转化为大规模平台消费。
数据底座也意味着更长的销售周期、更复杂的部署和更重的责任。Databricks需要接入旧系统,理解权限架构,并在监管要求不同的市场区分功能。平台越深入研发流程,客户效率越高,对单一供应商的依赖也越深。
传统云数据仓库和ETL工具擅长存储、计算与搬运,客户还要拼接模型治理和Agent环境;单点医疗AI工具能解决病历整理或患者筛选,却未必能管理整家机构的数据关系。Databricks想占据两者之间的平台层,以持续使用量而非一次交付扩大收入。
星环科技更偏数据基础软件和AI基础设施,依靠软件许可、项目交付及服务进入本地环境。其2024年营业收入约3.71亿元、归母净亏损约3.43亿元、研发费用约2.27亿元。本地部署是优势,规模和全球开源影响力则不能与Databricks等同。
滴普科技更接近企业AI应用与经营决策。港交所招股书显示,FastAGI在2024年收入约9040万元,占公司收入37.2%;截至年底累计客户245家。三家公司不构成一一替代,却对应三种付费位置:底层数据软件、企业AI应用,以及覆盖数据、模型与Agent的综合平台。

未来12个月到1—3年,医疗AI将从购买模型转向购买可追责的工作流
50亿美元融资对医疗AI最直接的信号,是企业采购正在把注意力从“模型能不能回答医学问题”移向“模型能不能在真实数据环境中被控制”。未来12个月,药企和医疗机构更可能把预算投向临床文档处理、患者筛选、真实世界证据分析、药物安全监测,以及支撑这些任务的数据治理、接口和审计能力。
模型准确率仍然重要,但采购表格会出现更多后台问题:谁批准Agent读取敏感字段,调用一次花多少钱,错误结果怎样撤回,供应商退出后数据能否迁移。能回答这些问题的平台,更有机会从试点预算进入持续费用。
单点工具可以更快部署,用一个任务证明价值;平台公司承担更高的集成和合规成本,换取更深的工作流位置。成败还取决于医院和药企是否愿意统一数据标准、重新分配权限并承担组织变革成本。
普通人短期内不会看到一款标有Databricks名称的家用产品,却可能间接感受到它的影响。临床试验数据更容易复用,可能帮助研究团队更快筛选合适患者;电子病历与基因数据分析提速,可能让药物安全信号更早被发现;医院和保险机构如果能在授权范围内持续分析数据,慢病随访与用药提醒也可能更及时。

这些变化不保证药价下降,也不能把AI输出直接当成医生结论。数据调用增加后,隐私泄露、权限滥用和错误自动化也会放大。平台必须允许机构追溯来源、限制访问,并在必要时停止Agent。
中国市场不会照搬海外路径。微软官方区域清单显示,Azure Databricks已经在中国东部2/3和中国北部2/3提供服务,因此“Databricks完全无法进入中国”并不准确;但官方功能清单也显示,部分基础模型、外部模型、模型服务及AI Gateway能力尚未在中国区域提供。
监管边界比产品是否可访问更重要。医疗健康信息属于敏感个人信息,数据跨境需要依据主体、数量和数据类型,分别采用安全评估、标准合同或认证等机制;涉及人类遗传资源的国际合作、材料出境或信息对外提供,还要遵守专门规则。国内机会因此不是简单复制一个海外平台,而是建设可以本地部署、连接国产模型、适配医院和药企流程,并把权限、血缘与审计做进产品的数据底座。
星环科技、滴普科技、云服务商、医疗信息化企业和专业合规服务商都可能获得新增需求,割裂的数据仓库、依赖人工搬运的数据服务,以及缺乏私有数据治理能力的轻量AI应用则会承受压力。未来1—3年,竞争重点可能由“谁接入了更强模型”转向“谁能长期管理数据与责任关系”。
如果Databricks的客户案例能够从少数头部药企扩展到更多机构,医疗AI的价值链会继续向数据治理和工作流靠近;如果项目停留在试点,失败点更可能是集成成本、数据授权和责任划分,而不是模型参数。
Ali Ghodsi从Apache Spark走到1900亿美元估值,始终围绕一个问题工作:怎样让复杂数据被更多人安全使用。医疗AI把这道问题推到风险更高、回报也更高的位置。当AI开始长期读取临床和个人健康数据,企业争夺的将不只是一次软件销售,而是谁能获得授权、记录过程,并连接医生、药企、医院、保险与患者之间持续发生的服务关系。
编辑 |胡乔皓
出品 |AI医疗观察














