# 有人把折叠屏手机改成了跑本地模型的节点，用 Vulkan 加速

> 原标题：I turned an Android phone into a Vulkan-accelerated local LLM node (GGUF + LiteLLM + Tailscale)

- 来源：r/LocalLLaMA
- 发布时间：2026-06-03T23:15:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33696
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tw63jz/i_turned_an_android_phone_into_a/

## 摘要

Reddit 用户 GsxrGuy80s 拿一台 Z Fold 6 当 GGUF 推理节点，走 Vulkan 加速，搭配 LiteLLM 和 Tailscale 组网。帖子公开了 gpu_layers=89 这个关键参数，说明把 89 层模型计算都扔给了手机 GPU。节点对外暴露 OpenAI 兼容接口，还设了 fallback 路由，请求搞不定就自动...

## 推荐理由

一个 Reddit 用户把折叠屏手机改成了本地大模型推理节点，用 Vulkan 驱动 GPU 加速，跑 GGUF 格式的模型，再通过 LiteLLM 统一接口、Tailscale 组网，让其他设备也能调用。帖子给了 gpu_layers=89 这个关键参数，还说明了模型崩了怎么自动切到备用路由。我会先打个折：这只是个人分享，没做压力测试，也没披露实际推理速度和功耗，稳定性存疑。但如果是真的，这种把闲置手机当推理节点的玩法挺省钱，也避开了云服务的隐私顾虑。对想自己折腾本地推理的从业者来说，这套组合拳（Vulkan+GGUF+LiteLLM+Tails...

## 锐评

这条帖子展示了一个把安卓手机变成本地大模型推理节点的方案，核心是用 Vulkan 加速跑 GGUF 格式模型，再通过 LiteLLM 暴露接口、Tailscale 组网。作者公开了 gpu_layers=89 这个参数，意思是把模型全部 89 层计算都交给手机 GPU 处理，没有让 CPU 分担。节点对外提供 OpenAI 兼容接口，还设置了 fallback 路由，请求搞不定就自动转到更大的本地机器上。

但问题在于，Reddit 原文被网络屏蔽，我们拿到的只是摘要，看不到实际运行数据。手机跑全层 GPU 推理，内存带宽和散热会是硬瓶颈，Z Fold 6 虽然芯片不差，但持续负载下能撑多久、每秒能出多少 token，这些关键指标都没披露。另外，LiteLLM 和 Tailscale 的组网延迟在移动网络环境下表现如何，也没有实测。

这个方案的价值在于把闲置手机变成算力节点，适合轻量任务或做实验。但别指望它能替代正经推理服务器，功耗和稳定性都是未知数。如果作者后续能补上 token 生成速度、手机温度和续航数据，判断才有依据。
