斯坦福与Google团队打造的25人虚拟小镇引爆学术圈。论文一作Joon Park详解了结合记忆流、反思与规划的生成式Agent架构,利用大语言模型攻克长达40年的可信行为模拟难题。
25 个 AI 智能体在一个类似早期宝可梦像素风格的虚拟小镇中,自主制定日程、漫步社交、组织聚会、甚至产生情绪涟漪。斯坦福大学与 Google Research 联合发表的论文《生成式代理:人类行为的交互模拟体》(arXiv 论文链接与项目演示地址)让整个 AI 领域和游戏行业为之震动。

游戏开发者看到了真正具备开放世界交互深度的智能 NPC,AI 研究人员则见证了大语言模型(LLM)对悬置数十年难题的破解。该论文第一作者、斯坦福大学计算机科学博士 Joon Sung Park 近日接受清华大学姚班学子 Sophia 与斯坦福在读博士曹瀚成的专访,深度解析了生成式 Agent 的系统架构、上下文记忆突破以及多智能体的群体智能涌现。

Joon Park 指出,生成式 Agent 本质上是展现出可信人类行为的计算实体。与常规单轮交互式聊天机器人不同,该智能体具备跨时间的长期一致性,能够充当人类在虚拟环境中的数字孪生。
其技术底座虽然依托于 ChatGPT 等大语言模型,但核心创新在于整体架构设计。研究团队搭建了一套协同运行的闭环系统,明确划分出感知、行动、记忆、反思与规划五大模块。这使得 Agent 不仅能对眼前的事件产生即时反应,更能在漫长的时间轴上维持社交关系和记忆上下文。
创造具备综合人类行为的「可信代理」(Believable Agents)并非新概念。早在 1994 年,计算机科学家 Joseph Bates 就将其定义为人机交互领域的北极星目标,更早还能追溯到 1980 年代认知架构理论的兴起。

然而在过去十几年中,这一方向几乎陷入停滞。究其原因,过往技术路线存在难以跨越的瓶颈:
大语言模型的突破改变了游戏规则。LLM 在涵盖全人类知识库、社交网络与文学作品的海量语料上完成预训练,天然内化了复杂的人类行为模式。这正是过往认知框架中最稀缺的拼图。
针对受限的 Context window(上下文窗口),系统如何在累积成千上万条记录后维持逻辑严谨?
Joon Park 表示,团队遵循「美在简单」的设计理念,构建了轻量但高表达力的**记忆流(Memory Stream)**数据结构。整个记忆系统仅由纯自然语言字符串列表构成,主要包含三类信息:
整个工作流由 70 至 80 个精心编排的 Prompt 像时钟齿轮般咬合运转。当智能体需要决策时,检索模块会从上万条记忆记录中,按照相关性、时间衰减与重要性加权检索出约 30 条关键记录,直接注入模型生成当下动作,无需强行灌入全量历史。
小镇 Smallville 的地图与物理空间由 Joon 手绘规划,设定了房屋、桌椅等离散环境元素。

在开放世界模拟中,模型难免生成当前环境无法执行的意图。例如某位商店店员规划「开车上班」,但地图里并未配置车辆概念。系统展现出了极强的自愈与降级能力:当无法索引到车辆交互对象时,语言模型自动退化为「步行上班」,既达成了目标,又维护了世界运行规则的自洽。
同样,想画画的 Agent 如果找不到画架,会退而求其次选择书桌。语言模型的常识推理能力赋予了 Agent 在既定限制内自由即兴发挥的弹性。
许多人担忧,所有 Agent 依托底层相同的语言模型驱动,长期运行后是否会陷入同质化?
Joon Park 明确表示,单一智能体的行为或许高度符合大模型先验,但多智能体交互引发的复杂性会导致群体智能涌现。每个 Agent 拥有独特的初始记忆与身份背景,平均每天会与 5 位不同的邻居深度交谈。25 个个体之间排列组合的社交传播链,极易引发蝴蝶效应,从而使整个虚拟社会的演进轨迹充满了不可预知的生动细节。
谈及未来发展,Joon Park 认为生成式 Agent 的认知框架不仅能赋能游戏 NPC,更将成为具身智能(Embodied AI)与实体机器人基础模型的大脑中枢。在探索 Agent 自主性的同时,如何在系统安全与模拟可信度之间取得权衡,将是学术界与产业界接下来共同面对的核心课题。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断