Shoehorn:按你机器的实际内存来压缩模型,不浪费一兆显存
Shoehorn 是一个开源的模型量化工具,它不按固定的精度档位来压缩,而是先测你机器上到底有多少可用内存,扣掉运行推理本身要占的部分,剩下的空间再按张量逐层分配混合精度。官方给的例子是 519.2 MiB 的预算用了 519.2 MiB,只留了 13 KB 的余量,利用率超过 99.99%。它自带一个本地网页界面,能直接检测你的硬件、列出 Huggi...
推荐理由:开源工具,把量化问题倒过来解——先量内存再分配精度,思路实用。99.99% 的利用率数字很具体,但这是个人开发者的 Show HN 项目,没有论文或大规模验证,所以我会先打个折,给到 featured 门槛的 78 分。