AutoBot 是一个开源的自我改进智能体外壳,依托 macOS 上的 ChatGPT 桌面版运行,通过分层记忆和持久任务图让长任务在执行者被替换后仍可接续完成。据 GitHub 项目页披露的基准数据,其在 OSWorld 2.0 上以 32.41% 的二元准确率超过 Claude Opus 5 Max,并在 AssistantBench 官方隐藏测试排行榜上以 50.70% 的准确率排名第一。
AutoBot 是一个开源的"自我改进智能体外壳"(agentic harness),目标是让前沿 AI 模型更好完成复杂知识工作。它不是独立模型或聊天机器人,而是依托 macOS 上的 ChatGPT 桌面版运行,官方称其为"Native ChatGPT on your Mac"的配套项目,由 Autonomous Production 构建,此前名为 AutoAssist。
AutoBot 由两层组成:一层是 Native ChatGPT 桌面 App,包括 Projects、Voice、Goals 和 Computer Use;另一层是 AutoBot 工作区,包含操作契约、隐私分区和本地目标状态机。文档中,语音(Voice)只是 ChatGPT 桌面版自带能力之一,AutoBot 依赖并复用这层能力,GitHub 页面没有进一步说明语音交互的实现细节。
针对"知识超出上下文窗口"的问题,AutoBot 把分层记忆存在本地磁盘,按任务检索构建工作上下文,并每晚做一次知识整合。持久任务图和原子检查点则让任务在执行它的 agent 被替换后仍能被接续完成,完成状态需绑定已验证的目标端证据;外部写入操作要求经 Computer Use 执行并检查渲染结果,避免重复提交。遇到困难工作流时,AutoBot 会修复自身外壳、独立验证改动并保留下来,后续任务直接继承这次改进,无需重新训练模型。

图:OSWorld 2.0 长任务、多应用工作流基准对比表,AutoBot 以 32.41% 的二元准确率、64.28% 的部分准确率排在首位,来源:github.com
在 OSWorld 2.0 基准的 108 个任务中,AutoBot 取得 32.41% 的二元准确率和 64.28% 的部分准确率,比 OpenAI 公开的 "Sol Max" 基线高 18.5% 的任务完成率,也超过 Anthropic 的 "Claude Opus 5 Max"。在 AssistantBench 官方隐藏测试排行榜上,AutoBot 在 181 个任务中排名第一,准确率 50.70%。
隐私上,AutoBot 按关系和用途把上下文分区:个人、家庭朋友、工作及用户主动共享的内容各自独立存放,不会自动进入共享区;本地运行时拒绝在"生产者"标签下完成验证,要求由独立验证者检查任务真实目标端。
安装门槛不高:基础文件夹安装不需要 Node 或登录,进阶运行时需要 Node 22 或更新版本。项目已在 GitHub 开源,仓库为 demeyer1/Autobot,官方文档尚未公开说明语音交互的实现方式及后续版本计划。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断