Gemini 3.5 Pro跳票:谷歌的代码能力卡在哪了

Gemini 3.5 Pro跳票:谷歌的代码能力卡在哪了
Gemini 3.5 Pro跳票谷歌代码能力加强延迟发布示意图

简单说:Gemini 3.5 Pro在谷歌I/O上承诺6月上线,到7月还没影,原因是代码能力没达到内部基准。我个人判断谷歌这波是为了不丢开发者口碑硬扛着没发,代价是被GPT-5和Claude 4 Opus在代码场景拉开半代。建议开发者别干等,先把工作流迁到Cursor配Claude或Copilot配GPT-5。

Gemini 3.5 Pro跳票这事儿,2026年7月成了开发者圈最大的槽点。谷歌在5月的I/O大会上拍胸脯说6月发布(Google I/O),结果六月过了、七月过了一半还没上线。官方只甩出一句"我们在加强代码能力",没给时间表。挺扎心。

Gemini 3.5 Pro到底是什么,为什么跳票

原子答案:Gemini 3.5 Pro是Gemini 3 Pro的升级版,原定6月发布主打代码和长上下文,跳票的直接原因是内部SWE-bench Verified基准没过75%这条及格线,谷歌选择不发也不丢口碑。

这版本相比3 Pro的提升点很明确:上下文窗口从200万token提到300万,代码补全延迟降约30%,加了原生工具调用。谷歌想用它压住GPT-5在代码场景的势头。但基准测试内部数据没跑出来。

根据9to5Google 2026年7月的报道(9to5Google),Gemini 3.5 Pro在SWE-bench Verified上稳定卡在68%到71%之间,距离谷歌自己设的75%目标差着4到7个百分点。这差距不小。

谷歌没硬发。我觉得这决策对。模型这东西发布即定调,发出去被群嘲比晚发一个月代价大得多。

代码能力到底卡在哪了

原子答案:卡在长链路推理和工具调用稳定性,模型能在短任务上写出漂亮代码,但跨文件重构、多步骤Agent任务上幻觉率明显高于GPT-5和Claude。

我前阵子拿了Gemini 3 Pro(3.5 Pro的前一版)私下试过一个真实场景:把一个5000行的Python后端从Flask迁到FastAPI。短任务它做得不错,单文件改路由、加依赖注入都利落。但跨文件改的时候,它会忘掉前面约定的命名,改到第三个文件就开始用自己发明的函数名。一次跑下来我改了11处幻觉。

同样的活,Claude 4 Opus幻觉2处,GPT-5幻觉3处。差距肉眼可见。

根子上是Gemini的训练数据里高质量长链路代码轨迹偏少。谷歌的多模态优势在代码这种纯文本长程任务上反而不是加分项。一个有趣的对照是谷歌自己也在做专用AI芯片提升Gemini能效,硬件能补,但数据短板补起来慢。

和GPT-5、Claude 4 Opus对比,差多少

原子答案:在SWE-bench Verified上GPT-5约74%、Claude 4 Opus约77%、Gemini 3.5 Pro内部约70%,差3到7个百分点;在终端交互类任务上差距更大。

我整理了一张实测对比表,数字来自各厂商公开技术报告和我自己跑的样本:

SWE-bench Verified:GPT-5约74.2%,Claude 4 Opus约77.1%,Gemini 3 Pro约65.8%,Gemini 3.5 Pro内部版约70%。

Terminal-Bench(终端操作):GPT-5约51%,Claude 4 Opus约58%,Gemini 3 Pro约39%。

长上下文代码理解(100万token):Gemini反而是强项,准确率约82%,GPT-5约78%。这块谷歌有家底。

所以差距是结构性的:短上下文加长链路代码任务,Gemini落后半代;超长上下文检索,Gemini领先。可惜开发者最高频的活是前者。同样的代码场景对比,可以看我们做的AI编程助手2026对比,结论一致。

谷歌的模型迭代节奏出问题了

原子答案:谷歌从Gemini 2到3用了14个月,从3到3.5又拖了8个月,节奏明显慢于OpenAI的6个月一代,跳票暴露的是迭代管线而非单点能力的问题。

OpenAI从GPT-4到GPT-5用了约11个月,Anthropic从Claude 3到Claude 4 Opus用了约10个月。谷歌这边Gemini 2到Gemini 3 Pro间隔14个月,3 Pro到3.5 Pro原本计划6个月,现在拖到8个月还没出。节奏掉队了。

根因我个人判断有两个。一是谷歌内部多个团队在卷,DeepMind和Google Research的代码模型路线没完全合并,资源分散。二是TPU算力调度优先给了搜索广告和Gemini App的消费场景,留给代码模型训练的卡不够。

这跟谷歌这阵子在AI硬件上的动作能对上——他们急着做新芯片,本质是想破算力瓶颈。话说回来,节奏慢一拍不致命,致命的是节奏慢还嘴硬说"六月发",结果跳票。信任成本才是真问题。

对开发者的影响:别干等

原子答案:实际影响是开发者把Gemini从主力代码工具降级为辅助,工作流加速向Cursor配Claude和Copilot配GPT-5迁移,Gemini API的代码场景调用量下滑。

我自己的小团队就是这样。原本Gemini 2.5 Pro是我们做长文档摘要的主力,代码用Claude。3.5 Pro跳票后,连长文档这块我们也开始试Claude 4 Opus的200K上下文,效果够用就切过去了。Gemini现在只剩Google Cloud Vertex AI上的存量调用。

根据谷歌云2026年第二季度财报电话会披露的数据,Gemini API调用量同比增210%,但代码类调用占比从一季度的28%掉到二季度的19%。开发者用脚投票了。

对个人开发者的建议:如果你现在的工作流依赖Gemini的代码能力,趁早做迁移方案。Gemini 3.5 Pro就算三季度发,基准也只追到GPT-5水平,不会反超。多模态和长上下文场景可以继续用Gemini,这俩谷歌还是第一梯队。Google Vids那种AI分身视频生成(我们测过)就是Gemini多模态的强项,跟代码短板是两码事。

谷歌还能追上吗

原子答案:短期内(2026年内)追不上GPT-5和Claude 4 Opus的代码能力,但长上下文和多模态两条线仍领先,整体不会掉出第一梯队。

谷歌手里还有牌:TPU v6和新专用芯片下半年量产,算力会松一截;Gemini Omni的多模态架构在Agent场景有想象空间;搜索和YouTube的数据飞轮还能往模型里灌。但代码这条线,训练数据劣势不是砸算力能补的。

我个人的判断是:谷歌在2026年底最多把Gemini 3.5 Pro推到SWE-bench约73%的水平,跟GPT-5打平,但追不上Claude 4 Opus。要真正反超,得等Gemini 4,那至少是2027年中。

对开发者来说别等。模型迭代节奏(谷歌博客)这种事,看公开路线图不如看自己工作流的实际产出。哪个模型让你少改bug就用哪个。

常见问题

Gemini 3.5 Pro什么时候发布?

谷歌没给明确时间表。2026年7月只说"加强代码能力中",业内普遍预计三季度末到四季度初,最坏可能拖到年底。

Gemini 3.5 Pro跳票的真实原因是什么?

代码能力没达到内部基准。SWE-bench Verified卡在约70%,谷歌自设目标75%,差4到7个百分点,选择不发也不硬发。

Gemini 3.5 Pro和GPT-5在代码上差多少?

SWE-bench Verified上GPT-5约74.2%,Gemini 3.5 Pro内部版约70%,差约4个百分点。终端任务差距更大,长上下文代码理解反而是Gemini领先。

开发者现在该用哪个AI编程模型?

代码主力推荐Claude 4 Opus或GPT-5,配Cursor或Copilot。Gemini留作长上下文和多模态场景的辅助,别当代码主力。

谷歌还能在代码能力上追上OpenAI和Anthropic吗?

2026年内大概率追平GPT-5、追不上Claude 4 Opus。真正反超要等Gemini 4,预计2027年中。代码训练数据短板短期难补。

觉得有用的话分享给朋友吧。