前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.10 · 00:00/5 MIN/编译自 雷锋网/0 阅读

Astra通关48关非机器人验证,reCAPTCHA防线转向身份校验

OpenAI Labs展示GPT-6 Astra连续通关48道复杂人机验证小游戏。当视觉模型掌握GUI闭环控制,传统图形验证码失效,现代网络安全防线正从阻挡机器转向密码学身份认证与权限委托。

一个 AI 在网页上成功证明了自己“不是机器人”。

OpenAI Labs 成员 Sharif Shameem 近日展示了 GPT-6 Astra 连续完成网页小游戏《I’m Not a Robot》全部 48 关的记录。挑战前期是常见的图像识别和字符判断,随后迅速进阶为拖拽、模拟停车、视觉搜索、节奏控制及动态逻辑游戏。Astra 依靠连续捕捉屏幕、控制键鼠输入,并根据界面即时反馈不断调整操作,最终拿到了系统颁发的“人类认证”。

Astra 通关演示

这不仅是攻克验证码的技术秀,更标志着人机交互与 Web 防御体系的分水岭:CAPTCHA 长期依赖的人类认知优势正在被 AI 智能体瓦解。

从静态感知到闭环控制

早期验证码本质上是单次静态推理:模型输入单张图像,解析字符或标记目标,输出答案后流程即刻终止。但 Computer Use 的机制完全不同,模型的动作会动态改写后续输入。

在控制系统视角下,页面包含隐藏状态 $state_t$,屏幕截图只是暴露给模型的观测值 $obs_t$。当 Astra 执行点击或拖拽等动作 $action_t$ 后,网页推进至 $$。模型无法直接读取浏览器底层状态,必须结合最新画面与操作历史,持续推断当前的执行节点。

闭环控制机制

以停车与节奏关卡为例,环境每时每刻都在演变,AI 智能体不仅要看懂画面,还必须维持对系统内部状态的连续估计。这就对“GUI Grounding”(界面语义接地)提出了严苛要求——模型需要将“确认按钮”这一语义对象精准映射为操作系统的像素坐标。在 ScreenSpot-Pro 基准中,Astra 在无额外工具辅助下达到了 92.7% 的定位准确率。

但长任务链路对容错率的要求更高。一旦误点,后续操作都会建立在错误前提之上。因此长程 Computer Use 引入了关键的动作状态校验机制:模型执行操作后,会自动比对界面预期与实际反馈,一旦出现偏差立刻重试或切换策略。

操作校验机制

此外,延迟优化直接决定了控制稳定性。在动态界面中存在“状态过期(state staleness)”问题:模型推理若耗时过长,真实环境已发生位移,动作将作用于失效场景。Astra 在 OSWorld 2.0 任务中将模拟耗时从 75 分钟压减至 40 分钟,执行成功率达 72.6%,更高的“感知-动作”刷新率大幅降低了长程操作的漂移。

现代 CAPTCHA 的阵地迁移

当视觉 AI 智能体可以熟练操作动态图形界面,依赖认知题目的验证方案正在全面失去防御能力。Google 与 Cloudflare 等厂商早已将风控重心下沉至浏览器底层与服务端。

验证码安全机制变迁

以 Google reCAPTCHA v3 为例,它不再依赖二元对错,而是结合交互上下文由后端计算综合风险评分。Cloudflare Turnstile 更是将验证分为客户端静默挑战与服务端校验:浏览器在后台执行轻量 JavaScript 探测,采集空间证明、Web API 状态与运行差异,生成单次有效的短期 Token,再经由服务器接口二次核验。

与此同时,TLS 指纹(如 JA3/JA4)、网络协议栈和环境特征构成了多层防线。Astra 攻克的是像素与动作层,而防御端往往在审视它未曾注意的底层特征:TLS 握手是否异常、JavaScript 环境是否纯净、请求时序是否呈现机器特征。

不过,随着未来 AI 智能体越来越深入地嵌入到完整真实的浏览器运行栈中,纯粹基于环境指纹的拦截也将逐渐失效,风控正逼近更棘手的对抗周期。

从拦截机器到身份授权

更本质的矛盾在于:Agent 时代的大量自动化请求本身就是合法的用户行为。用户委托 AI 智能体查询订单、填报审批或调度系统,盲目拦截机器反而会切断业务通道,将访问者划分为“人”或“机器人”的二元模型正在失效。

Web Bot Auth 机制

Cloudflare 推出的 Web Bot Auth 展示了安全体系的转型方向:基于 HTTP 消息签名技术,Agent 生成非对称密钥对(如 Ed25519)为 HTTP 请求签名,公开目录验证其合法身份。此时,Web 安全体系不再试图去“证明屏幕前没有人”,而是构建起一条可验证的身份与授权委托链:

  1. 确认请求发起者的 Agent 机器身份合法;
  2. 确认其持有真实用户的明确委托;
  3. 严格限定细粒度权限范围(例如仅允许修改收货地址,禁止取消订单)。

Astra 跑通 48 关验证码,意味着图形界面已不再是机器的物理禁区。二十年前,CAPTCHA 的命题是“确认屏幕对面是个人”;如今在 Agent 时代,Web 的新安全边界已经演化为:这台机器是谁,代表了谁,以及当下被赋予了多大的权限。

标签:OpenAIAstraAgent网络安全

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
置顶

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

//

24小时热榜

RLHF先驱Paul Christiano加入OpenAI基金会董事会
TOP1

RLHF先驱Paul Christiano加入OpenAI基金会董事会

小米破局:短期看汽车,中期看手机,长期看AI
TOP2

小米破局:短期看汽车,中期看手机,长期看AI

3

超越序列预测:AI何时能复原现实世界的隐藏规律?

10小时前
超越序列预测:AI何时能复原现实世界的隐藏规律?
4

OpenAI 发布 GPT-6 Astra:主打电脑操作与办公自动化

11小时前
OpenAI 发布 GPT-6 Astra:主打电脑操作与办公自动化
5

蓝色光标合作AhaCreator,用AI重构全球达人营销

18小时前
蓝色光标合作AhaCreator,用AI重构全球达人营销
6

理想小米转向自研与二供,宁德时代面临多供博弈

18小时前
理想小米转向自研与二供,宁德时代面临多供博弈
7

Momenta逼近盈利,L3新规重塑智驾分工边界

18小时前
Momenta逼近盈利,L3新规重塑智驾分工边界
8

京东发布物理AI战略:建十万卡算力集群与世界模型

18小时前
京东发布物理AI战略:建十万卡算力集群与世界模型
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断