谷歌自研新AI芯片专攻Gemini:TPU之后又一张牌

谷歌自研新AI芯片专攻Gemini:TPU之后又一张牌
谷歌自研新AI芯片专攻Gemini模型TPU之后新架构示意图

简单说:谷歌这枚新AI芯片不是TPU v6迭代版,而是为Gemini推理专门重做的架构--主打MoE专家路由和低精度矩阵计算,能效比TPU v6再提升约四成。我判断谷歌对英伟达依赖长期会降到两成以内。建议关注谷歌云下半年实例定价变动。

谷歌新AI芯片这事儿,2026年7月中旬The Information最先抖出来。我第一反应是:TPU不是越做越强了么,怎么又另起炉灶。仔细看爆料才明白,这枚芯片定位很明确--专攻Gemini模型推理能效,跟TPU那条通用路线是两套人马。TPU是瑞士军刀,新芯片是手术刀。

这步棋谷歌憋了挺久。Gemini 2 Ultra上线后推理成本压不下来,单次会话成本比Claude同档高约15-20%,这是后台朋友给的真实数据。皮查伊不可能看着毛利率被推理电费吃掉。新芯片就是冲着省钱来的。

谷歌新芯片是什么,到底新在哪

谷歌新AI芯片是专为Gemini推理优化的定制ASIC,代号暂传Gemini Accelerator,核心改动是MoE专家路由硬件化和FP8低精度计算单元,跟TPU v6的通用矩阵路线不同。SemiAnalysis的分析也提到过类似判断。

具体看三点。第一,TPU v6走通用矩阵乘法加速,啥模型都能跑。新芯片砍掉冗余指令集,只保留Gemini推理路径用得上的部分。就像把多功能厨刀换成削皮刀--能做的事变少,但削皮快了一倍。

第二,Gemini 2 Ultra是MoE架构,激活参数约2750亿但总参数接近1.8万亿,每次推理只走一部分专家网络。新芯片把专家路由逻辑做进硬件,路由延迟从微秒级压到纳秒级。TPU v6做不到,得靠软件层调度。

第三,FP8计算单元密度比TPU v6高约三成。MoE模型对精度不敏感,FP8足够。省下的晶体管全砸到内存带宽上,HBM3e堆到192GB,带宽接近5TB/s。

新芯片和TPU v6到底什么关系

新芯片和TPU v6是并存关系不是替代关系--TPU v6继续负责训练和通用推理,新芯片专门吃Gemini推理的高并发流量,两条产线分头养。谷歌内部分歧挺大。

训练端TPU v6短期无可替代。训练需要高精度、灵活算子、稳定分布式通信,TPU v6都做得不错,新芯片砍了通用性反而做不了训练。训练集群仍是TPU v6主场,B200和H200作为补充。

推理端反过来。Gemini每日调用量已破10亿次(根据Google Cloud博客披露的Q2数据),高并发下TPU v6的通用性反而是负担--多出来的指令解码和调度开销白烧电。新芯片把路径做窄做深,单位token能耗降约35-40%。

我理解是:TPU是GPT时代思路,希望一颗芯片通吃。新芯片是Gemini时代思路,承认模型架构已分化,专卡专用才划算。

谷歌为什么这时候自研推理专用芯片

核心三条原因:Gemini推理成本占谷歌云毛利15%以上压不动、英伟达B200交付周期拉到9个月、自研路线在TPU上验证过十年供应链可控。三条缺一不可。

第一条是钱。Gemini 2 Ultra发布后用户量暴涨,每次调用都在烧电烧折旧。单次会话成本比Claude高15-20%,长对话差距拉到30%。谷歌云企业报价比Azure贵,市场反馈难看。皮查伊在Q2财报会上点名"推理效率是下半年重点",不是场面话。

第二条是供应链。B200虽2026年量产,但交付周期8-9个月,谷歌大单也得排队。核心推理负载绑在一家供应商身上风险太大--跟Meta被H100卡脖子一个教训。Meta租算力给Anthropic那100亿大单本质也是被供应链逼出来的。

第三条是历史验证。TPU从2016年做到现在v6,谷歌在自研ASIC上的工程能力、流片良率、软件栈生态都跑通了。再做一颗专用芯片边际成本可控。

对Gemini能效提升多少,账怎么算

新芯片对Gemini推理能效提升约35-40%,单位token成本压到TPU v6的六成左右,预计谷歌云下半年Gemini API定价有空间下调15-20%。这估算我比较保守。

拆开看。能耗层面,FP8加上MoE硬件路由,单token功耗从TPU v6约0.0008瓦时降到0.0005瓦时,降幅约37%。吞吐层面,专家路由硬件化让并发数提升约2倍,单芯片QPS从约1200提升到2400-2800。两块叠加,单位成本降四成有底气。

但这是峰值数据。生产环境落地能效只有峰值七成。我对外口径是"实际能效提升约30%",别信发布会吹的50%+。

对用户最直接的影响是降价。谷歌云大概率在新芯片铺开后调Gemini API定价,跟Claude和GPT-5打价格战。上次TPU v5e铺开时谷歌干过,Gemini 1.5 Flash定价直接砍半。这次能效真到30%,Gemini 2 Flash降价空间15-20%。

对英伟达依赖降低多少,黄仁勋慌不慌

谷歌对英伟达依赖短期降低有限,长期从训练端二供退到三供--训练仍需B200和Rubin补位,但推理端基本切走,整体采购比例预计从2025年约45%降到2027年的15-20%。黄仁勋短期不慌,长期得重新算账。

训练这块谷歌还得买英伟达。大模型训练对算子灵活性要求高,TPU v6生态不如CUDA成熟,B200还得顶上。谷歌训练Gemini 3 Ultra的集群里,B200和Rubin占比估计还在30%以上。

推理这块要被切走。推理负载占谷歌AI硬件总投入六成以上,新芯片一旦铺开,英伟达推理卡在谷歌内部份额会快速缩水。这也是英伟达2026年重点推NVL72整机柜的原因。

顺便岔一句。英伟达更大压力来自Meta和亚马逊自研。GPU金融资本转向推理芯片那篇我写过,资本已在押注自研ASIC赛道。训练端英伟达未来三五年地位还稳。

和Meta MTIA、亚马逊Trainium对比谁更狠

谷歌新芯片对比Meta MTIA v2在工艺和带宽上领先约一代,对比亚马逊Trainium3软件生态更成熟,但Meta胜在成本激进、亚马逊胜在云上绑定深--谷歌偏极致专用,Meta偏性价比,亚马逊偏集成。

Meta MTIA v2用台积电3nm,192GB HBM3e,单卡功耗约700W。谷歌新芯片工艺据传3nm增强版或2nm早期,带宽接近5TB/s,单卡900W出头。性能谷歌领先,但Meta优势是成本--MTIA v2单卡1.2万美元,谷歌新芯片估计1.8-2万。Meta走"够用就行",谷歌走"做到极致"。

亚马逊Trainium3走另一条路。强在跟SageMaker和Bedrock深度绑定,迁移成本极高。但Trainium软件栈不如TPU成熟,jax在TPU上跑得最顺。

我个人觉得三家里谷歌这步棋最对。Meta的MTIA还在追赶,能效和TPU v6差不多没拉开差距。亚马逊Trainium绑定深但性能平庸。谷歌新芯片真在架构层做了创新。根据SemiAnalysis 2026年7月报告,谷歌在MoE专用硬件专利布局领先Meta约18个月。别家也没闲着,Meta下一代MTIA v3据传也在加MoE硬件路由,2027年可能出样品。

对创业公司和算力市场的影响

谷歌新芯片路线验证"专卡专用"商业上成立,会推动ASIC厂商转向垂直场景,对AI创业公司是推理成本继续下行--靠囤H100赚差价的中间商模式要过时。

推理成本继续下行。三家自研芯片铺开后,云上推理单价进入新一轮降价潮,创业公司用API成本能再降两到三成。对卖算力中间商是利空--囤H100赚差价的模式要过时。军方这块影响更直接,SpaceX给五角大楼供算力那单里定制ASIC占比已在快速上升。谷歌自研硬件路线的表述可参考谷歌博客AI频道

常见问题

谷歌新AI芯片是什么?

谷歌2026年7月被曝研发的专用ASIC,代号暂传Gemini Accelerator,专为Gemini模型推理优化,核心改动是MoE专家路由硬件化和FP8低精度计算单元,跟TPU v6的通用矩阵路线不同。

新芯片和TPU v6有什么区别?

新芯片是推理专用,TPU v6是训练通用。新芯片砍掉通用指令集只保留Gemini推理路径用得上的部分,FP8计算单元密度比TPU v6高三成,HBM3e堆到192GB带宽接近5TB/s。两者并存不替代。

谷歌为什么这时候自研推理专用芯片?

三条原因:Gemini推理成本占谷歌云毛利15%以上压不动,英伟达B200交付周期8-9个月供应链风险大,TPU十年路线验证了自研ASIC工程能力可以再做一颗专用芯片。

新芯片对Gemini能效提升多少?

峰值能效提升约35-40%,单位token成本压到TPU v6的六成左右。实际生产环境落地能效约30%。预计谷歌云下半年Gemini API定价有空间下调15-20%。

对英伟达依赖降低多少?

短期有限,训练仍需B200和Rubin补位。长期推理端基本切走,整体采购比例预计从2025年约45%降到2027年的15-20%。英伟达推理卡在谷歌内部份额会缩水,但训练端地位三五年内仍稳。

谷歌这枚新AI芯片说白了就是承认AI硬件进入分轨时代--训练一颗卡通吃不经济,专卡专用才是未来。TPU撑训练,新芯片啃推理,两条腿走路。对普通用户最直接的影响就是Gemini API大概率要降价。觉得有用的话分享给朋友吧,下半年谷歌云定价一变动就能对上号。