研究者用强化学习微调 4B 参数开源模型作数据库查询优化器,在标准 Join Order Benchmark 上生成的查询计划比 PostgreSQL 原生优化器快 81%,验证了 LLM 在可验证推理任务上的优势。
Rohan Bansal 近日发表研究,通过强化学习将一个 4B 参数开源模型微调为数据库查询优化器,在标准 Join Order Benchmark 上,该模型生成的查询计划比 PostgreSQL 原生优化器快 81%。
数据库查询优化器的核心任务之一是确定多表连接的顺序(Join Ordering),这是已知的 NP 难问题。Leis 等人 2015 年的调查在十年后重做时仍发现:优化器表现远不尽如人意,留下大量性能空间未利用。
验证一个查询计划的好坏只有一个维度:执行时间。这类"输出易于核查"的任务正是 LLM 通过强化学习优化的适用场景——模型根据执行时间信号持续调整,不需要人类逐步标注推理过程。
研究者使用公开可用的 4B 参数模型,在 PostgreSQL 提供的 Join Order Benchmark 上通过强化学习微调。最终模型生成的查询计划执行时间平均比 PostgreSQL 原生优化器快 81%。
这说明:在可验证的推理任务上,相对小型的 LLM 经过目标导向的训练后,可以超越经过数十年工程打磨的传统启发式算法。
该实验在受控基准环境下完成,实际生产数据库的场景更复杂(数据分布持续变化、不同硬件环境等)。研究者的完整实验细节已在个人博客发布:rohanbansal.com/qorl。
"AI 替代 / 增强数据库优化器"是近年来多个开源项目和学术团队探索的方向。这篇博客提供了一个可复现的小规模实验路径,接下来值得关注的是:能否在生产级别的多租户数据库上复现类似的性能增益。
同时,该方向也面临一个结构性挑战:生产数据库的查询模式持续变化,强化学习在特定基准上训练出的策略,能否泛化到未见查询模式,仍需更多真实场景验证。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断