有人把折叠屏手机改成了跑本地模型的节点,用 Vulkan 加速
I turned an Android phone into a Vulkan-accelerated local LLM node (GGUF + LiteLLM + Tailscale)
Reddit 用户 GsxrGuy80s 拿一台 Z Fold 6 当 GGUF 推理节点,走 Vulkan 加速,搭配 LiteLLM 和 Tailscale 组网。帖子公开了 gpu_layers=89 这个关键参数,说明把 89 层模型计算都扔给了手机 GPU。节点对外暴露 OpenAI 兼容接口,还设了 fallback 路由,请求搞不定就自动...
推荐理由:一个 Reddit 用户把折叠屏手机改成了本地大模型推理节点,用 Vulkan 驱动 GPU 加速,跑 GGUF 格式的模型,再通过 LiteLLM 统一接口、Tailscale 组网,让其他设备也能调用。帖子给了 gpu_layers=89 这个关键参数,还说明了模型崩了怎么自动切到备用路由。我会先打个折:这只是个人分享,没做压力测试,也没披露实际推理速度和功耗,稳定性存疑。但如果是真的,这种把闲置手机当推理节点的玩法挺省钱,也避开了云服务的隐私顾虑。对想自己折腾本地推理的从业者来说,这套组合拳(Vulkan+GGUF+LiteLLM+Tails...