Reddit 网友在 6GB 显存的笔记本 4050 上跑了 20 个小模型的速度对比
Benchmarks of 20 small LLMs on a 6GB RTX 4050
这篇帖子本身被 Reddit 的安全策略拦住了,正文内容没抓到,只留下一个“被网络安全屏蔽”的提示。从标题和已有的英文摘要看,作者用 LM Studio 的接口测了 20 个小模型,统一在 6GB 显存的 RTX 4050 上跑,每个模型在 1k、8k、32k 三种上下文长度下各测了 5 次速度。目前能看到的唯一具体数据是 unsloth/lfm2.5...
推荐理由:我会先打个折,来源是 Reddit 帖子,权威性一般,但内容本身很实在。作者没搞虚的,就是拿 20 个模型在 LM Studio 里用 6GB 4050 实测,把速度、显存占用都列出来。对想本地跑小模型的人来说,这比看论文里的 A100 数据有用得多。正文没披露测试用的量化精度和具体 prompt,这点信息缺口让结论不能直接照搬,但作为一张低显存显卡的参考表,已经够用了。