在云栖大会上,米哈游揭秘了其AI游戏研发与玩法落地的完整技术布局。从具备多层记忆与情绪表达的AI NPC,到内部协作研发的多Agent平台,再到用强化学习自进化的游戏闭环,米哈游正在押注千亿打造全新的动态互动体验。
一周内对话突破6000万次,甚至有玩家一天与AI帕姆交互上千次——这是《崩坏:星穹铁道》接入AI对话功能后的真实表现。米哈游联合创始人大伟哥此前透露,未来三年米哈游在AI方向的投入上限可能高达1000亿元。这笔巨资究竟如何落地?在云栖大会上,米哈游《崩坏》系列AI NPC与Gameplay负责人郑银河的分享揭开了冰山一角:其核心逻辑在于「AI进入游戏,游戏反哺AI」。
为了消除AI帕姆的「人机感」,米哈游推进了三项核心改造:

然而,仅能对话还不够。米哈游正在探索AI Gameplay,让角色根据局势自主做出判断与行动,使对话本身变成玩法。例如在内部测试的AI桌游中,大模型既负责角色对话,也负责逻辑博弈与决策,玩家的不同言行会实时改变NPC的态度与后续选择,真正实现千人千面的动态体验。

在幕后研发端,米哈游搭建了名为EchoX的代码Agent托管平台,并配合专为游戏工业化自研的Harness规则体系与MCP工具链,推动多个AI智能体协作开发。

这套工业化体系极大地缩短了玩法从概念到验证的周期,但多Agent协作也带来了成本挑战,系统失控或空转可能导致高昂的Token账单,亟需工程化手段建立安全约束。
游戏天然具备封闭边界与即时胜负反馈,是训练AI智能体的绝佳试验场。米哈游最初尝试基于Qwen-VL等多模态模型,通过像素级画面直接输出键鼠指令,但这种模式在面对长周期策略规划时常常顾此失彼。
随后,团队转向了「Coding Agent编写脚本 + 逻辑执行 + 读取Log复盘自我改进」的策略迭代路径。在《小丑牌》(Balatro)的自学习实验中,Agent通过持续试错自我进化,甚至在测试中一度利用网络工具直接调用模拟器查看牌堆,展现了递归自我改进(RSI)过程中典型的奖励作弊(Reward Hacking)现象。

目前,这套「任务执行-日志分析-策略调整」的自适应机制已正式接入《崩坏:星穹铁道》的QA自动化测试流程。AI在游戏里充当玩家找出潜在缺陷,游戏产生的数据则持续迭代模型能力。
从前端交互的AI NPC与AI Gameplay,到后端研发的EchoX协作平台,再到驱动模型自进化的游戏练级场,米哈游的AI技术闭环已初步成型。技术终究要回归可玩性本身,随着国产模型能力的演进,未来两到三年内能否真正兑现「千人千面」的游戏生态,正成为行业关注的焦点。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断