Databricks凭什么估值1880亿:AI数据平台第二春的真相
简单说:Databricks估值冲到1880亿美元,靠的不是自家模型,而是它卡住了大模型训练最缺的那一块——企业AI数据底座。这篇拆解Lakehouse护城河、它和Snowflake的真实差异、谁在买单、18倍ARR算不算泡沫,以及为什么媒体叫它"第二春"。
2026年7月,Databricks估值冲到1880亿美元,TechCrunch给它贴了个标签——AI的"favorite second act",最受欢迎的第二春。一家2013年靠Apache Spark起家的公司,熬过数据中台那波泡沫,转头成了大模型时代最贵的基础设施。它这轮卖的不是模型,是企业训练模型喂的那口"奶"——数据底座。大模型火了一两年,大家发现卡脖子的不是算力也不是算法,是干净、合规的企业数据。它正好蹲在这。
Databricks是做什么的:从Spark到AI数据平台
Databricks起家是Apache Spark的商业化公司,后来把数据湖、数仓、ML训练全揉进一个平台,现在定位是"AI数据平台"——给企业搭大模型时代的数据底座。
讲个背景。Spark最早是UC Berkeley的AMPLab出来的开源项目,Databricks创始团队就是Spark核心作者。2013年公司成立,靠把Spark包装成托管服务卖钱,那时对手是Hadoop那套老古董。后来转向和Snowflake抢"分析型数据平台"的地盘。再往后——这轮AI起来——它干脆把定位往AI偏:不只存数据、跑SQL,还把训练流水线、特征工程、模型管理(MLflow)、向量检索全包了,官方叫这套为Data Intelligence Platform。
我前年拿Databricks社区版跑过几个PySpark任务,免费额度小到可怜但够练手。最直观感受:从Notebook写Python到提交任务到看结果,全在浏览器里,不用配环境,省运维——不用维护Spark集群那堆破事。所以"它是做什么的"答案一直在变,从"卖Spark托管"到"卖AI数据底座",底子始终是分布式计算引擎。
为什么这一轮能冲到1880亿:算笔账
按市场传闻约100亿美元ARR算,1880亿估值对应约18倍,处在Snowflake巅峰倍数和当下倍数之间。核心是企业要把私有数据喂给大模型,发现数据底座比模型更难搞,Databricks卡住这个刚需。
光说"AI火所以它涨"太敷衍。估值1880亿美元,对应年经常性收入(ARR)市场传闻在100亿美元上下——这数字Databricks没公开确认,但多家财经媒体引用过。1880亿÷100亿≈18.8倍。
这倍数什么水平?对比一下。Snowflake在2021年巅峰市值约1100亿美元,当时ARR约12亿美元,倍数接近90倍——那是SaaS泡沫最猛的时候。现在它市值回落到约600亿美元,ARR约40多亿,倍数12到15倍。也就是说,Databricks现在的18倍,比Snowflake巅峰那会冷静很多,比它当下略高。
考虑AI数据平台这赛道确实有增量,这估值不算离谱,也谈不上便宜。我的判断:合理偏热,不是泡沫。据Bloomberg在2026年7月关于这轮融资的报道,Databricks企业客户AI工作负载支出同比翻倍,ARR增速跑在行业高位——这是18倍能站住的底气。
Lakehouse到底是什么:护城河在哪
Lakehouse=数据湖的便宜存储+数据仓库的查询性能+AI训练能力,三合一。Databricks靠Delta Lake这个开放格式把三者粘起来,这是它最硬的护城河。
Lakehouse这词听着玄,拆开就清楚。数据湖:把啥都往里扔,便宜,但查询慢、数据质量差。数据仓库:结构化、查询快、贵,Snowflake、Redshift走这条。两套东西长期分裂,湖里存原始数据,仓里放清洗好的,中间靠ETL倒来倒去——传统大数据架构最大的痛。Lakehouse想干的事就是:别倒了,一套存储搞定。底层用开放格式(Databricks主推Delta Lake,开源),既能跑快查询,又能直接喂给ML训练,还便宜。
我拿它和传统数仓的真实取舍说下感受。在Databricks上做训练,训练数据直接就是存储里的同一份湖表,不用先ETL到数仓再导出来,这对ML团队是省命的事——以前光数据搬运和版本对齐能吃一周。
护城河不是技术多独家。Delta Lake开源,Apache Iceberg也能干类似的事,Snowflake现在也支持。真正值钱的是它最早把整套体验打磨成"开箱即用"。企业一旦把数据和ML流水线搬上去,迁移成本极高——这才是1880亿里真正值钱的部分:用户黏性。想自己搭类似方案练手,看这篇本地部署开源大模型的进阶教程。
Databricks vs Snowflake:AI时代谁更受宠
Snowflake强在结构化SQL分析和BI,Databricks强在非结构化数据加ML/AI训练。大模型时代重心从"分析"转向"训练",所以Databricks这一轮更受企业AI客户偏爱。
这两家是数据圈最常被拿来对比的对手。区别说直白点。Snowflake根是云数据仓库,强项是让分析师写SQL跑报表,性能稳、好用、贵。它这几年也在补AI能力(收购Neeva、推Cortex),但底子依然是"分析型",Snowflake官网定位语至今写着AI Data Cloud。Databricks根是Spark分布式计算,强项是处理大吞吐、非结构化数据、跑机器学习训练,Notebook对数据科学家更顺手。
大模型这波起来重心变了。以前数据团队最大的活是出报表、做BI;现在最大的活是把公司文档、代码、日志、客服记录清洗成训练语料,喂给模型做微调或RAG,这活需要计算引擎+数据湖+ML工具链——正好是Databricks主场。
我主观说一句:做分析选Snowflake,做AI训练选Databricks,这条线未来两三年会更分明。Snowflake不会死,BI需求一直在,但"AI时代宠儿"这位置,这轮确实让给了Databricks。这就是媒体叫它"第二春"的原因——不是第一次火,是第二次被推上来。做可视化是另一条路子,看AI数据可视化工具。
谁在为这1880亿买单
买单的是金融、医疗、零售、科技等行业的大企业,它们要的不是模型,是把私有数据安全地接到AI上。客户数过万,财富500强里超过六成是它的客户。
具体客户名单。Block(Square母公司)、康卡斯特、AT&T、壳牌、Regeneron都在用Databricks跑AI和分析。截至2026年公开数据,客户数过万,财富500强里超60%是它的客户。它们买的不是模型——这些公司有的是钱买OpenAI或Anthropic的API。它们买的是"把我自家数据安全地接到AI上的那条管道"。金融和医疗尤其在意合规,不能把客户数据直接扔公网模型,得在自己可控环境训练和RAG——Databricks提供的就是这受控环境。平台每天GPU训练任务数以万计,是去年同期的两到三倍,这是ARR冲到100亿美元的底气。
1880亿是不是泡沫:对AI行业意味着什么
不算泡沫,偏热。它意味着AI这轮的价值正从"模型层"下沉到"数据层",谁卡住企业数据入口,谁就拿走最大一块。
泡沫不泡沫,看一个东西就行:收入是不是真在涨。Databricks的ARR从几十亿冲到百亿美元,是实打实的增长,跟2021年那波靠叙事撑起来的SaaS高估值不一样。但"偏热"是真的——18倍ARR对增长已过最猛阶段的公司,给得不算保守。若AI落地企业支出不及预期,短期有回调压力。我的判断:短期震荡,中长期看AI数据底座这需求是结构性的,不会消失。
对AI行业意味着什么?一句话——价值正从模型层下沉到数据层。模型在商品化,真正能持续收钱的,是卡在企业数据入口上那批人。Databricks、Snowflake和云厂商的数据服务,这三股势力未来几年的争夺才是AI基础设施主战场。跑题说一句:这波跟当年云计算抢"上云"入口的逻辑一样——谁在企业最核心的数据上扎根,谁就有十年护城河。拉回来。做数据分析的话,看AI数据分析工具盘点。
常见问题
Databricks到底是做什么的?
起家是Apache Spark的商业化公司,现在定位是AI数据平台,给企业提供数据湖、数仓、ML训练一体化底座——企业训练模型前先把数据准备好、管起来的那个平台。
Databricks估值为什么能到1880亿美元?
大模型落地卡在数据上,企业要把私有数据安全合规地喂给模型,Databricks正好卡住这刚需。按市场传闻约100亿美元ARR算,1880亿对应约18倍,在Snowflake巅峰和当下倍数之间。
Databricks和Snowflake有什么区别?
Snowflake根是云数据仓库,强在结构化SQL分析和BI;Databricks根是Spark分布式计算,强在非结构化数据处理和ML训练。重心从分析转向训练,这轮Databricks更受偏爱。
Lakehouse架构到底是什么?
把数据湖的便宜存储、数据仓库的查询性能、AI训练能力三合一,靠开放格式(如Delta Lake)粘起来。同一份数据既能跑分析也能喂给模型训练,不用在湖和仓间来回倒。
1880亿估值是不是泡沫?
不算泡沫,偏热。ARR实打实在涨,跟2021年靠叙事撑起来的SaaS高估值不同。但18倍ARR给得不算保守,若AI落地企业支出不及预期,短期有回调压力。
在大模型卷得不行的今天,看懂数据底座这一层,比追模型发布会实在得多。觉得有用的话分享给朋友吧。