OpenAI Labs展示GPT-6 Astra连续通关48道复杂人机验证小游戏。当视觉模型掌握GUI闭环控制,传统图形验证码失效,现代网络安全防线正从阻挡机器转向密码学身份认证与权限委托。
一个 AI 在网页上成功证明了自己“不是机器人”。
OpenAI Labs 成员 Sharif Shameem 近日展示了 GPT-6 Astra 连续完成网页小游戏《I’m Not a Robot》全部 48 关的记录。挑战前期是常见的图像识别和字符判断,随后迅速进阶为拖拽、模拟停车、视觉搜索、节奏控制及动态逻辑游戏。Astra 依靠连续捕捉屏幕、控制键鼠输入,并根据界面即时反馈不断调整操作,最终拿到了系统颁发的“人类认证”。

这不仅是攻克验证码的技术秀,更标志着人机交互与 Web 防御体系的分水岭:CAPTCHA 长期依赖的人类认知优势正在被 AI 智能体瓦解。
早期验证码本质上是单次静态推理:模型输入单张图像,解析字符或标记目标,输出答案后流程即刻终止。但 Computer Use 的机制完全不同,模型的动作会动态改写后续输入。
在控制系统视角下,页面包含隐藏状态 $state_t$,屏幕截图只是暴露给模型的观测值 $obs_t$。当 Astra 执行点击或拖拽等动作 $action_t$ 后,网页推进至 $$。模型无法直接读取浏览器底层状态,必须结合最新画面与操作历史,持续推断当前的执行节点。

以停车与节奏关卡为例,环境每时每刻都在演变,AI 智能体不仅要看懂画面,还必须维持对系统内部状态的连续估计。这就对“GUI Grounding”(界面语义接地)提出了严苛要求——模型需要将“确认按钮”这一语义对象精准映射为操作系统的像素坐标。在 ScreenSpot-Pro 基准中,Astra 在无额外工具辅助下达到了 92.7% 的定位准确率。
但长任务链路对容错率的要求更高。一旦误点,后续操作都会建立在错误前提之上。因此长程 Computer Use 引入了关键的动作状态校验机制:模型执行操作后,会自动比对界面预期与实际反馈,一旦出现偏差立刻重试或切换策略。

此外,延迟优化直接决定了控制稳定性。在动态界面中存在“状态过期(state staleness)”问题:模型推理若耗时过长,真实环境已发生位移,动作将作用于失效场景。Astra 在 OSWorld 2.0 任务中将模拟耗时从 75 分钟压减至 40 分钟,执行成功率达 72.6%,更高的“感知-动作”刷新率大幅降低了长程操作的漂移。
当视觉 AI 智能体可以熟练操作动态图形界面,依赖认知题目的验证方案正在全面失去防御能力。Google 与 Cloudflare 等厂商早已将风控重心下沉至浏览器底层与服务端。

以 Google reCAPTCHA v3 为例,它不再依赖二元对错,而是结合交互上下文由后端计算综合风险评分。Cloudflare Turnstile 更是将验证分为客户端静默挑战与服务端校验:浏览器在后台执行轻量 JavaScript 探测,采集空间证明、Web API 状态与运行差异,生成单次有效的短期 Token,再经由服务器接口二次核验。
与此同时,TLS 指纹(如 JA3/JA4)、网络协议栈和环境特征构成了多层防线。Astra 攻克的是像素与动作层,而防御端往往在审视它未曾注意的底层特征:TLS 握手是否异常、JavaScript 环境是否纯净、请求时序是否呈现机器特征。
不过,随着未来 AI 智能体越来越深入地嵌入到完整真实的浏览器运行栈中,纯粹基于环境指纹的拦截也将逐渐失效,风控正逼近更棘手的对抗周期。
更本质的矛盾在于:Agent 时代的大量自动化请求本身就是合法的用户行为。用户委托 AI 智能体查询订单、填报审批或调度系统,盲目拦截机器反而会切断业务通道,将访问者划分为“人”或“机器人”的二元模型正在失效。

Cloudflare 推出的 Web Bot Auth 展示了安全体系的转型方向:基于 HTTP 消息签名技术,Agent 生成非对称密钥对(如 Ed25519)为 HTTP 请求签名,公开目录验证其合法身份。此时,Web 安全体系不再试图去“证明屏幕前没有人”,而是构建起一条可验证的身份与授权委托链:
Astra 跑通 48 关验证码,意味着图形界面已不再是机器的物理禁区。二十年前,CAPTCHA 的命题是“确认屏幕对面是个人”;如今在 Agent 时代,Web 的新安全边界已经演化为:这台机器是谁,代表了谁,以及当下被赋予了多大的权限。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断