从Prof G的讲故事方法出发,拆解AI规划算法的本质,分析强化学习在真实世界应用的关键挑战,以及技术叙事如何决定AI产品的成败。
人们总是忽略别人看到的东西,而讲故事是捕捉注意力的利器。Prof G(Scott Galloway)的这句核心观点,在AI领域同样适用。当我们在讨论规划算法时,背后不只是数学问题,更是一套关于“如何让技术走进现实”的故事。
规划算法是智能体在复杂环境中制定行动序列的核心。从经典的A*路径搜索,到机器人领域的Task Planning,都离不开“规划”二字。大语言模型(LLM)的兴起让很多人开始问:AI是否真的学会了规划?还是说,它只是用统计学方法“蒙”对了结果?
最新研究给出了一个微妙的答案:大模型在很多任务上表现出“类规划”能力,但一旦离开训练数据的分布区间,就会失效。它们模仿了训练文本中隐含的因果逻辑,而非真正理解因果结构。这就像一个人背下了棋谱,但从未学会下棋。
强化学习(RL)通过奖励信号驱动智能体不断试错,最终学习到最优策略。在围棋、电子游戏、机器人控制等明确规则的环境里,RL已经取得了惊人成就。DeepMind的AlphaGo、OpenAI的Dota 5v5 bot,都是教科书级的例子。
但现实世界是另一回事。环境非稳态、奖励函数难以设计、安全约束层层叠加,这些困难让RL在真实业务中的落地远比论文困难得多。
中国互联网公司其实早已在现实中折腾RL了。滴滴的派单系统,需要实时匹配乘客和司机,动态定价、空驶率、高峰期运力调度,都涉及RL的思路。美团外卖的骑手路径规划,要在几十个订单里选最优路线,还要考虑天气、商家出餐时间、甚至骑手熟悉度。
这些场景的核心问题不是“如何做出完美决策”,而是“如何在不确定和约束下做出足够好的决策”。这恰恰是RL与规划算法在现实世界融合的关键点。
Prof G说,好的故事能让你“看到别人看不到的东西”。AI从业者如果只会写代码,不会讲故事,再强的技术也很难获得资源。OpenAI发布Sora时,用一段高质量视频让公众瞬间理解“世界模拟器”的想象力,这就是叙事的力量。
反过来,很多技术败在了“叙事错位”上。比如某些自动驾驶公司,过度强调“全无人”,结果出了事故,舆论崩塌。这不是技术不行,而是没有讲好“AI有边界”的故事。
AI的规划能力会持续进化,但真正的突破可能来自另一种“算法”——如何让技术被理解、被信任、被采用。强化学习教AI在试错中找到策略,而好的叙事,则是让人类在复杂现实中愿意给AI一次机会。这两者,缺一不可。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断