新闻资讯

Gemini 4 Pro疑遭提前曝光,"AI要减速了"的承诺再度落空

作者: admin | 发布于: 2026-09-19 19:41 | 分类: 科技资讯
Gemini 4 Pro疑遭提前曝光,"AI要减速了"的承诺再度落空

过去数月间,OpenAI与Anthropic接连将各自的顶级模型推向更高台阶,而谷歌这边却罕见地保持了沉默。

Flash系列保持着近乎三周一迭代的节奏,3.6、3.7、3.8依次登场,然而象征能力天花板的Pro型号却始终杳无音讯。

就在近日,大模型匿名对战平台Arena中,赫然出现了一个标注为gemini-3.8-flash的参赛模型。

开发者们一接触便觉蹊跷——正式的Gemini 3.8 Flash早已面世,其性能水准业内心知肚明。但这个顶着"3.8 Flash"之名的选手,无论是编程能力、SVG渲染还是Agent执行,都呈现出明显的跃升。

经过多轮交叉验证后,一种推测在圈内快速发酵:

这个模型极有可能是谷歌隐藏在新标签之下的新一代旗舰——Gemini 4 Pro。

紧随其后,一份更为惊人的benchmark横向对比图开始在社交平台上广泛传播。在编码、Agent、推理等多个维度上,各项分数均将GPT-6 Astra与Claude Fable甩在了身后。

就在数日前,几家头部AI企业还在公开场合探讨是否应当放缓脚步。如今,"降速"的呼声尚未尘埃落定,新一轮军备竞赛已然全面提速。

而在这个疑似Gemini 4 Pro的"怪兽级模型"背后,还藏着一个更具冲击力的核心词:

Gemini 4 Pro疑似外泄

9月2日,谷歌刚刚官宣了Gemini 3.8 Flash。官方介绍称,这是Gemini 3家族最新的Flash迭代版本,在软件工程、Agent任务以及复杂多步骤推理方面均有显著进步;从3.7 Flash到3.8 Flash,间隔仅三周。

因此,当Arena中再次浮现一个同样冠以gemini-3.8-flash名号的模型时,开发者们很快便嗅出了异样。

真正的3.8 Flash已经摆在台面上,所有人都拥有直接的对比基准。而眼前这个模型的性能表现明显高出一档,完全是Pro级别才具备的水准。

最早引爆讨论的一组实测,聚焦于SVG绘制、网页构建和3D场景生成。

开发者Harshith让该模型用SVG绘制一只侧面站立的猫,并将产出与GPT-6 Astra Max及正式发布的Gemini 3.8 Flash并列比较。Arena中的这一版本,在轮廓准确度、比例协调性和细节完备度上,都与正式3.8 Flash拉开了清晰可见的差距。

图中从左至右分别为"4 Pro"、Astra、3.8 Flash

X用户@thtbee_则从多个维度对这个疑似Gemini 4 Pro的模型进行了密集测试。

一座体素风格的宝塔,模型耗时约8分钟,一次性产出了完整的可交互3D场景。

一架空中客车H145直升机,它仅用不到10分钟便搭建出细节极为丰富的3D展示页面。不过该用户也指出,页面底端的UI组件"观感欠佳"。

网页设计方面,模型大约14分钟即完成了一套单色系主题站点,整体风格简洁且结构完整。以往Gemini常被诟病的审美短板,这一次似乎得到了有效修补。

另一位用户@Mr_Salio则直接将这个疑似Gemini 4 Pro的模型投入游戏开发。最终成品的帧率表现相当顺滑,世界观构建与玩法设计的完成度也相当可观。

更具分量的一条线索出自开发者Qwinah之手。

他宣称自己成功"幽灵路由"进入了Gemini 4 Pro的后端系统,并附上了一张疑似内部终端界面的截图。

据他所言,该模型的内部代号中直接出现了G4P-ARGON和VIA_3.8_FLASH字样,最大输出长度达256K,上下文窗口突破千万token量级,同时还集成了跨会话持久记忆、免API直连互联网、后端自动编译执行脚本乃至物理机器人操控等功能。

若上述信息为真,那这绝非一次常规的Flash迭代所能解释。

与此同时,一张Gemini 4 Pro的benchmark对照表也在社区中急速扩散。

依据表中数据,Gemini 4 Pro在软件工程基准DeepSWE v1.1上取得88.7%,终端Agent基准Terminal-Bench 2.1上录得95.3%,专家级知识推理基准HLE-Verified上攀升至72.1%,计算机操作Agent基准OSWorld 2.0上达到86.8%。

最为瞩目的是,在衡量真实知识劳动能力的GDPval-AA v2指标上,其Elo分被标注为2064,一举跨越2000门槛。

倘若这些数字经得起检验,Gemini 4 Pro足以"碾压Fable、压制Astra",一步登顶前沿模型排行榜。

然而,数字越是惊人,审视便需越审慎。

需要留意的是,这张benchmark表格与Qwinah所"挖掘"出的那张疑似后端截图之间存在不完全吻合之处;表格中用作参照的Astra得分也与官方公布的数据存在出入;两份材料均未获得谷歌、Arena或任何相关benchmark机构的官方认证,现阶段仍属社区自发传播的信息。

目前唯一可以坐实的,仅仅是Arena中存在一个名为gemini-3.8-flash的模型,以及它的表现与Gemini 3.8 Flash应有的水平严重不符。

但人们之所以如此迅速地将军旗指向Gemini 4 Pro,还有一个不可忽视的背景因素:谷歌的Pro产品线,已经断档过长了。

Gemini 3.5 Pro迟迟未能正式交付,Gemini 4此前已被确认进入训练阶段,而过去数月间,Flash系列不断向前推进,真正承载能力上限的Pro线却始终没有新品亮相。

眼下,一个能力明显异于常理的"3.8 Flash"突然从Arena中现身。

由此,种种猜想愈发合情合理——谷歌或许压根不打算将真正意义上的重大升级分配给3.5 Pro,而是将所有筹码压向了Gemini 4 Pro。

Gemini 4 Pro背后,更深层的核心议题是RSI

即便Gemini 4 Pro目前仍停留在社区传闻层面,更值得关注的是,谷歌正在显著提速AI介入模型自身研发的进程。

在这一轮Gemini 4 Pro的风波中,RSI这一概念被频繁引用。

RSI即Recursive Self-Improvement(递归自我改进),通俗来讲,便是AI开始参与到更强AI的打造过程中,而更强的AI反过来又进一步压缩下一代模型的研发周期。

一旦这条正反馈回路真正运转起来,被加速的便不再局限于模型能力本身。

模型自身的进化速率,也将被模型亲手推快。

路透社今年8月报道指出,谷歌联合创始人Sergey Brin在近几个月中持续推动Gemini系列的迭代提速,并将递归自我改进列为重点攻关方向之一。

尽管谷歌迄今未公开宣称已实现这一完整闭环,但其确实在将越来越多原本由研究员承担的任务移交给人工智能代理,涵盖模型评测、改进路径探索、实验执行,再将结论反哺至模型研发管线之中。

9月2日Gemini 3.8 Flash发布之际,谷歌在官方文档中也提及,一套长期运转的Agent循环正在"递归地对底层模型进行评估与优化"。

Google DeepMind研究员姚顺宇(非腾讯的姚顺雨)在3.8 Flash发布后,借用了阿姆斯特朗登月的经典语句来描述此次更新:

"这是模型迈出的小小一步,却是RSI的巨大大步。"

近期,谷歌还将"RSI"直接嵌入了一篇新论文的标题之中。

9月14日,谷歌与GDM等联合团队发表了Dream-RSI,专门探索如何驱动Agent通过持续优化探索策略来实现递归自我改进。在算法工程、数学优化及GPU内核调度等任务上,该方法均展现出更高的探索效率与更低的搜索开销。

正因如此,本轮关于Gemini 4 Pro的传闻才会如此紧密地与RSI捆绑在一起。

社区中的讨论并未止步于"Gemini 4 Pro确实强悍"这一层面,更多声音在追问:谷歌内部究竟已将RSI推进到了何种深度?