论文称用低成本 FPGA 跑 Qwen3-30B-A3B Q4 推理,生成速度 18 t/s,量产成本预计 150 美元
[Paper on Hummingbird+: low-cost FPGAs for LLM inference] Qwen3-30B-A3B Q4 at 18 t/s token-gen, 24GB, expected $150 mass production cost
这篇论文讲的是 Hummingbird+,用低成本 FPGA 跑大模型推理。他们拿 Qwen3-30B-A3B 的 Q4 量化版测试,生成速度能到每秒 18 个 token,板子带 24GB 显存,作者说量产的话成本能压到 150 美元左右。不过帖子正文没披露具体是哪款 FPGA、功耗多少、测试条件是什么,Reddit 原帖还被网络屏蔽了,看不到讨论细...
推荐理由:这篇论文的钩子很直接:一块预计量产成本 150 美元的 FPGA,能把 Qwen3-30B-A3B 的 Q4 量化版跑到每秒 18 个 token,配 24GB 内存。对想本地跑大模型又嫌显卡贵的人来说,这个数字挺诱人。但我会先打个折——正文没披露用的是哪款 FPGA,也没给功耗数据,评测条件同样空白。没有这些,18 t/s 是在什么负载、什么精度损失下跑出来的就说不清。所以这条值得关注,但别急着下结论,等他们把板卡型号和功耗补上再说。