# 骁龙 8 Elite 跑混合专家模型实测：CPU 推理反而比 NPU 快

> 原标题：LLM's on Android (Snapdragon 8 Elite) MOE Experience

- 来源：r/LocalLLaMA
- 发布时间：2026-05-17T22:22:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21957
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tg3ssd/llms_on_android_snapdragon_8_elite_moe_experience/

## 摘要

一位 Reddit 用户用 24GB 内存的荣耀 Magic 7 Pro（骁龙 8 Elite）跑了几个混合专家（MoE）模型。在 Q4 量化下，LFM2-24b-a2b 跑到约 24 token/秒，Gemma 约 11 token/秒。比较意外的是，他这套配置里 CPU 推理速度比 NPU 和 GPU 都快，正文没披露具体用的什么推理框架和功耗数据...

## 推荐理由

这条来自 Reddit 个人测试，不是官方数据，权威性弱，但信息量够：24GB 手机、Q4 量化、LFM2-24b-a2b 跑 24 token/s、Gemma 跑 11 token/s，CPU 比 NPU/GPU 快。对想在手机上本地部署的人有参考价值，不过只有一台设备的数据，别当普遍结论。给 featured 低分段，因为话题热、数据具体，但来源单一。

## 锐评

这条帖子最值得看的是实测速度：24GB 内存的荣耀 Magic 7 Pro 上，LFM2-24b-a2b 这个混合专家模型（MoE，把任务分给不同小专家处理，省算力）在 Q4 量化后跑到约 24 token/秒，Gemma 约 11 token/秒。对手机端来说，24 token/秒已经能用了，不是那种等半天才蹦一个字的体验。

但有个反直觉的结果：这套配置里 CPU 推理比 NPU 和 GPU 都快。这不太正常，通常 NPU 应该更擅长跑模型。问题在于发帖人没交代用了什么推理框架、有没有针对骁龙的 NPU 做适配，也没测功耗和发热。如果只是拿通用框架跑了一下，那 NPU 跑不过 CPU 只能说明软件没跟上硬件，不代表芯片本身不行。

还缺几个关键信息：模型加载占了多少内存、持续跑几分钟后会不会降频、不同量化精度的速度差异。这些没测，就没法判断这配置到底能不能当日常助手用。
