# 训练一个 4B 模型，让它生成的查询计划比 Postgres 默认的快 81%

> 原标题：Training a 4B model to produce 81% faster query plans than Postgres

- 来源：Hacker News 首页
- 发布时间：2026-09-16T18:50:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56937
- 原文：https://rohanbansal.com/qorl

## 摘要

Rohan Bansal 拿 Qwen 4B 模型做实验，先让 GPT-6 Astra 当老师，用 500 条示范轨迹做监督微调，再设计了一套强化学习变体，让模型自己生成查询计划、扔到 Postgres 里实测耗时，根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上，最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%，...

## 推荐理由

一个 4B 小模型，靠强化学习训出来的查询计划比 Postgres 默认计划快 81%，方法本身有实用价值。但测试只跑了 113 条多表联查 SQL，能不能泛化到其他场景还没验证，所以分数卡在 78。

## 锐评

Rohan Bansal 拿 Qwen 4B 做了一次挺有意思的尝试：先让 GPT-6 Astra 当老师，用 500 条示范轨迹做监督微调，再设计了一套强化学习变体，让模型自己生成查询计划、扔到 Postgres 里实测耗时，根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上，最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%，几何平均加速 81%。训练用了一台租来的双 H100 节点，测量靠他桌上四台跑 Postgres 的容器。

这个结果看着漂亮，但得打几个折。首先测试集只有 113 条查询，全是多表联查，覆盖面窄，不知道在更杂乱的业务 SQL 上表现如何。其次正文没披露模型生成一次计划要花多长时间——如果推理延迟比执行节省的时间还长，那实际收益就大打折扣。另外也没说总训练时长和稳定性，强化学习在这种噪声环境里容易跑偏。

还缺什么：跟其他学习型优化器的对比、更大规模查询的验证、以及推理成本与延迟的完整数据。如果这些能补上，小模型替代传统优化器这条路才真的值得跟。
