Gemini 4 Pro疑似泄露:多项跑分曝光,谷歌这次要放大招?
一张疑似Gemini 4 Pro的测试成绩表正在流传。从DeepSWE、Terminal-bench到OSWorld-2.0,多项数据都表现亮眼,部分项目超过GPT-6 Astra和Claude Fable 5.1。与此同时,Gemini 4 Pro据称拥有2M上下文窗口,输入、输出价格也被一并曝光。不过目前这些信息尚未得到Google官方确认,测试环境和参数也不完整,最终表现仍要等正式发布和第三方复测。
Gemini 4 Pro疑似泄露:基准和实测同时曝光,真的要挑战Astra和Fable了?
一张最近疯传的基准测试图,把AI圈的注意力再次拉到了谷歌身上。

图中疑似还未正式发布的 **Gemini 4 Pro**,在编码、Agent、电脑操作等测试中拿到了非常亮眼的成绩,甚至超过了GPT-6 Astra和Claude Fable 5.1。
不过先别急着宣布“谷歌王者归来”。
目前这份成绩单没有Google官方背书,测试环境、Harness版本、Prompt以及采样参数也没有完整公开。因此,这些数字更准确的说法应该是**“网传成绩”**,而不是已经确认的官方跑分.
Gemini 4 Pro到底有多强?
目前流传最广的一版基准表显示,Gemini 4 Pro在多个Agent和编码相关项目中都拿到了非常靠前的成绩。

需要特别强调,这些数字目前都属于泄露表中的数据,并未经过Google官方确认,也缺少完整的可复现测试条件。
如果最终能够复现,那么最值得关注的并不是某一项多了几个百分点,而是Gemini 4 Pro似乎把重点放在了长链路Agent任务上。
编码Agent成了重点
DeepSWE主要考察模型解决真实软件工程任务的能力,需要模型持续阅读代码、修改代码、运行测试,再根据结果继续调整。
网传成绩中,Gemini 4 Pro达到88.7%,GPT-6 Astra为86.9%。
两者差距只有1.8个百分点,因此单看这个数字,并不能简单理解成“全面碾压”。
但如果Gemini 4 Pro最终能够在不同测试环境下稳定达到这一水平,意义还是比较大的——因为这类任务考验的已经不是单纯写几段代码,而是模型能不能长时间维持任务状态并不断纠错。
OSWorld:真正考验电脑操作能力
另一个值得关注的是OSWorld-2.0。
这类测试不是让模型回答一道题,而是把AI放进真实电脑环境,让它自己操作软件、点击界面并完成连续任务。
网传数据中,Gemini 4 Pro为86.8%,Astra为84.5%,Fable 5.1为77.9%。
如果这个成绩最终得到验证,那么它说明Gemini 4 Pro的提升可能并不只是传统Benchmark上的“刷分”,而是开始向真正的Computer Use和Agent工作流延伸。
更有意思的是:开发者已经开始实测
除了跑分之外,近期社区还出现了疑似Gemini 4 Pro的匿名模型测试。
有开发者发现Arena中出现了一个名为 **gemini-3.8-flash** 的模型,而这个名字与此前公开版本存在异常,引发了“谷歌正在用Flash马甲测试下一代模型”的猜测。
但目前官方并没有确认这个匿名模型就是Gemini 4 Pro,因此这部分仍然属于社区推测。
与此同时,开发者还展示了一批3D网页、SVG以及交互式应用生成案例。
其中比较有意思的是3D产品展示:模型不仅能够生成基本的3D物体,还可以进一步加入旋转展示、组件拆解、参数信息以及交互动画。
这类Demo真正值得看的地方,不是“画面有多漂亮”,而是模型能不能把**代码、3D结构、交互逻辑和页面UI**一次性串起来。
现在还不能直接宣布“Gemini 4 Pro碾压一切”
这也是这波消息最需要冷静看待的地方。
目前关于Gemini 4 Pro的很多关键信息——包括模型身份、完整Benchmark配置、价格以及部分技术规格——都还没有得到Google正式确认。
尤其是Benchmark,缺少Harness版本、Prompt模板、采样参数和测试环境时,不同结果之间并不能简单横向比较。
所以现在更准确的结论应该是:
如果这张泄露成绩单最终被验证,Gemini 4 Pro确实可能成为谷歌今年最值得关注的一张牌;但在官方发布和第三方复现之前,“全面碾压Astra和Fable”仍然只能算是对泄露数据的推演,而不是已经坐实的结论。
目前最值得盯的,反而是Google什么时候正式亮出Gemini 4 Pro,以及这些网传成绩最终能不能被独立复现。
讨论与补充
0还没有讨论
分享一条可复现的补充、问题或使用经验。