大模型竞技场Arena惊现性能异常跃升的神秘模型,疑为Google跳过3.5直接憋出的下一代旗舰Gemini 4 Pro。在递归自我改进(RSI)飞轮的驱动下,前沿实验室台前呼吁安全减速,台下竞备却再度狂飙。
前几个月,OpenAI和Anthropic轮番迭代旗舰模型,Google却显得有些低调。虽然小模型Flash几乎三周一更,但代表能力上限的Pro系列迟迟没有动静。
直到近日,大模型盲测竞技场LMSYS Arena中突然冒出一个挂着“gemini-3.8-flash”标签的神秘模型。

开发者一上手就发现了蹊跷。官方版Gemini 3.8 Flash的实际水平大家心知肚明,而这个“同名”模型在写代码、SVG生成和运行AI智能体(Agent)等维度的表现,明显跨上了一个台阶。


几轮测试后,社区推测迅速扩散:这极有可能是Google披着马甲偷跑的下一代旗舰——Gemini 4 Pro。

紧接着,一张更惊人的基准测试对比图开始流传,在编程、Agent和推理等多项测试中,其成绩均压制了竞品。前沿实验室台前还在讨论是否需要踩刹车,暗地里新一轮角逐已再度提速。
Google此前正式推出Gemini 3.8 Flash,主打软件工程与复杂多步推理。当Arena竞技场出现同名模型时,更强的逻辑推理与生成能力让它分明透出了顶级Pro模型的底色。

在SVG、前端设计和3D建模实测中,该模型表现亮眼。让其绘制猫咪的SVG矢量图,轮廓和细节完整度远超正式版3.8 Flash;生成体素风格宝塔或直升机交互页面,它在数分钟内便能输出完整的3D交互场景。


![]()

![]()
在网页排版上,过去常被吐槽设计审美的Gemini,这次耗时约14分钟便完成了一套视觉精致的单色极简站点。甚至有开发者利用它直接编写可运行的游戏DEMO,其流畅度与场景完成度极高。




关键线索接连浮出。有开发者贴出了疑似渗透至后端的配置截图:内部包含“G4P-ARGON”代号,最大输出达256K,上下文窗口标称突破千万Token,并具备跨会话持久记忆和后端脚本自编译执行等底层特征。


网传基准测试显示,该模型在软件工程测试DeepSWE达88.7%,终端Agent评估Terminal-Bench达95.3%,通用知识工作基准甚至宣称突破2000 Elo大关。不过目前这些材料仍缺乏官方背书,唯一确定的是,Arena中这个“3.8 Flash”表现异常激进。由于Gemini 3.5 Pro迟迟未至,Google直接跳级亮出Gemini 4 Pro的可能性大幅增加。
与新模型流言紧密绑定的,还有一个核心概念:递归自我改进(RSI,Recursive Self-Improvement)。

免费获取企业 AI 成熟度诊断报告,发现转型机会

简而言之,就是利用AI来自动化研发下一代更强的AI。一旦闭环打通,模型本身及其进化周期的加速都将脱离纯人力节奏。
据悉,Google联合创始人Sergey Brin近来持续要求Gemini加快研发,并将递归自我改进列为攻坚方向。Google当前正把越来越多评测、实验与优化工作下放给Agent系统,让智能体在长期运行中循环评估并改进底层算法架构。

Google DeepMind研究员姚顺宇在早先模型发布时曾评价:“这是模型的一小步,RSI的一大步。”随后Google团队发布的Dream-RSI论文,更是专门探索如何通过Agent策略自我改进,提升算法工程与底层算力优化的搜索效率。

不仅是Google,Anthropic披露的自动化数据显示,Claude目前已能独立主导其内部26%的研发任务,并参与了超90%的研发协同。

智谱AI首席科学家唐杰也表示“最小的循环已经出现”,其自研Agent成功参与了底层芯片基础设施的设计与推理调优,大幅缩减系统迭代周期。

此前,Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)曾呼吁前沿机构协同建立“减速机制”,警惕RSI失控风险——当技术进化由机器驱动,人类评估与安全约束的步调可能难以追赶。
这一理念在舆论层面得到了Sam Altman、Elon Musk与Demis Hassabis的口头附和。但在激烈的产业竞争现实面前,没有哪家厂商敢率先放慢脚步。


如今,Google的Gemini 4 Pro疑云未散,Anthropic的下一代Opus已露灰度踪迹,OpenAI的下一代模型测试传闻亦接踵而至。口头倡导的刹车机制,终究难敌前沿大模型全速狂飙的惯性。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断