吴恩达与 Rohit Prasad 发布的开源桌面 Agent OpenWorker 上线一周,社区反馈指向多模型兼容、权限控制等共性问题;同期亚马逊 Kiro Crew 开源,两款产品共同标志着 AI Agent 工具链正从单次代码生成走向长期任务承包。
美国时间 7 月 23 日,人工智能领域学者吴恩达与 Rohit Prasad 在 X 上正式发布了开源桌面 Agent:OpenWorker。顶流学者背书、开箱即用的桌面形态、多模型自由切换……OpenWorker 集齐了爆款产品的多个要素。然而上线一周,来自社区的真实反馈指向了一个普遍性问题:从极客工具到普通人可用的数字员工,桌面 Agent 这个品类还有明显的产品化距离。
从产品结构上看,OpenWorker 是一套运行在桌面端的 Agent 工作台,大致分为三层。
最上层是桌面界面。用户可以在这里创建晨间简报、周报、频道监控等自动化任务,也可以自行填写任务名称和指令。任务运行过程中,模型的思考步骤、工具调用记录和最终结果会完整显示在应用界面内。
中间层是运行在本地的 Agent 服务,负责接收用户目标、调用模型、管理任务循环,并根据模型的判断读取文件、执行命令或调用外部工具。会话记录、记忆、任务状态和权限审批等逻辑主要在这一层实现。
最外层是模型和连接器。OpenWorker 支持接入 OpenAI、Gemini、Ollama 等不同模型,也能对接 Slack、GitHub、Jira、Notion、Outlook 等办公工具。当模型判断任务需要查询消息、读取项目状态或处理文件时,本地 Agent 服务调用对应工具,把返回结果再交给模型继续处理,直到任务完成或被权限机制拦下。
模型层基于吴恩达团队此前开源的 aisuite 构建。aisuite 统一了不同模型厂商在接口格式、参数和调用方式上的差异,让上层应用无需分别适配每家厂商的 SDK。
上线一周后,社区反馈集中指向三个方向:多模型兼容性、数据流向透明度以及权限控制的细粒度。
这些并不是 OpenWorker 独有的问题。让一个 Agent 在无人值守时安全地访问本地文件、发送消息、提交代码,涉及的权限边界远比演示场景复杂得多。"从极客的玩具到普通人的数字员工,中间还隔着一条巨大的产品化鸿沟",这是雷锋网报道中援引的社区反馈原话。
8 月 4 日,亚马逊云科技将 Kiro Crew 正式开源。Kiro Crew 的定位与 OpenWorker 有部分交叠,同样强调多 Agent 协作,但切入方向偏向开发者工具链:持久记忆、任务调度、失败重试,以及对代码仓库、构建流水线和部署状态的持续监测。
亚马逊云科技杰出开发者布道师 Darko Mesaroš 将 Kiro 的核心思路概括为"规范驱动开发":先把需求文档、技术设计和任务清单做好,再写代码——这与单凭一句提示词快速搭建原型的"氛围编程"形成对比。
两款产品的相继开源表明,AI 编程工具正在从"单次代码生成助手"向"长期任务承包者"转型,但这一转型对工程控制层的要求远高于演示层。
桌面 Agent 品类的基础形态已经进入可用阶段。接下来值得关注的,是哪款产品能率先把权限控制、多模型稳定性和数据流向透明度打磨到普通用户可接受的水准——这三件事是当前同类产品的共同瓶颈,也是这个品类能否从开发者工具扩散到更广泛用户群的关键门槛。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断