9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能,负责机器人强化学习方向。他将推进机器人强化学习后训练闭环,让机器人从“学会任务”走向“越做越好”。
9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能,负责机器人强化学习方向的技术研发与应用探索。
过去两年,机器人基础模型主要解决“会不会”的问题;随着机器人从演示走向真实部署,问题正变成“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,让强化学习重新回到中心位置。
孙鹏长期专注强化学习(RL)、智能体(Agent)与多智能体强化学习(MARL),既有机器人强化学习经验,也做过大规模分布式RL系统和大模型强化学习。他的加入将加强星尘智能在机器人强化学习方向的布局,并与AI模型、具身OS和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化。

孙鹏博士毕业于清华大学,随后在康奈尔大学和罗格斯大学从事博士后研究。过去十余年,他的研究和产业实践始终围绕强化学习与智能体展开,并从机器人强化学习逐步延伸至大规模RL系统与大模型后训练。
在腾讯AI Lab和Robotics X期间,他曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。他用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;还开发了《星际争霸》AI智能体TStarBots、TStarBotX,在多智能体强化学习的复杂博弈中取得重要成果。
加入字节跳动后,孙鹏把技术实践由算法扩展到大规模RL系统工程。他主导开发了核心强化学习基础设施ByteRL,支撑多款自研游戏AI的高效训练。团队曾获IEEE CoG 2023策略卡牌AI竞赛冠军,其《炉石传说》AI展现出击败行业顶尖选手的竞技水平。
大语言模型兴起后,孙鹏又把强化学习积累拓展到LLM后训练。在字节AI Lab/ByteResearch,他作为项目负责人参与并发布了强化微调方法ReFT与数学推理智能体DeltaProver;在Seed团队,他深度参与模型RLHF和预训练,沉淀了模型对齐、推理增强及Agent方向的前沿经验。
从机器人强化学习,到大规模RL系统,再到大模型后训练,孙鹏的技术路径始终围绕“如何让智能体在交互与反馈中持续改进策略”展开。如今,随着AI进入物理世界,这套能力正在具身智能领域找到新落点。
对星尘智能来说,建设“AI模型+具身OS+绳驱本体”全栈技术体系时,孙鹏的加入补上了模型“训练之后”的关键环节。
这家公司从成立起就坚持Design for AI,主张机器人本体、数据与AI模型不应割裂设计。现在,这套思路已形成基座模型、前端共生Agent与强化学习后训练组成的完整闭环:基座模型Lumo系列持续推进机器人对环境与动作的理解、预测和生成,其中Lumo-1让机器人理解动作背后的“为什么”,Lumo-2作为首个家庭隐式世界动作模型,率先引入Latent World Dynamics,在隐空间预测未来世界再生成动作;前端Agent Philia负责长期记忆、任务管理、多机器人协同与自然交互;而强化学习承担着让机器人从真实环境和任务反馈中持续优化行为策略的重任。
孙鹏在机器人强化学习、大规模RL系统以及大模型RLHF、强化微调与Agent方向上的长期积累,将直接强化星尘智能的这个环节。接下来,他会参与星尘具身模型、机器人强化学习及后训练体系建设,探索把大模型时代验证过的强化学习后训练方法,与真实机器人执行、数据闭环和长期部署结合起来。
据了解,孙鹏加入后也将扩充机器人强化学习团队,推动相关技术能力提升与落地。
对于加入星尘智能,孙鹏表示:“过去十多年,我一直在做强化学习和智能体,亲历了强化学习从机器人控制、复杂博弈走向大模型后训练。现在,我很希望把这些积累真正带回物理世界。星尘智能已经具备从机器人本体、具身OS到AI模型的完整技术基础,接下来最让我期待的,是和大家一起把强化学习融入真实机器人的训练与部署,让机器人不只是‘学会一个任务’,而是能在一次次真实执行和反馈中把任务越做越好。”
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断