骁龙 8 Elite 跑混合专家模型实测:CPU 推理反而比 NPU 快
LLM's on Android (Snapdragon 8 Elite) MOE Experience
一位 Reddit 用户用 24GB 内存的荣耀 Magic 7 Pro(骁龙 8 Elite)跑了几个混合专家(MoE)模型。在 Q4 量化下,LFM2-24b-a2b 跑到约 24 token/秒,Gemma 约 11 token/秒。比较意外的是,他这套配置里 CPU 推理速度比 NPU 和 GPU 都快,正文没披露具体用的什么推理框架和功耗数据...
推荐理由:这条来自 Reddit 个人测试,不是官方数据,权威性弱,但信息量够:24GB 手机、Q4 量化、LFM2-24b-a2b 跑 24 token/s、Gemma 跑 11 token/s,CPU 比 NPU/GPU 快。对想在手机上本地部署的人有参考价值,不过只有一台设备的数据,别当普遍结论。给 featured 低分段,因为话题热、数据具体,但来源单一。