# 用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

> 原标题：Building a fully local PDF-to-audiobook workflow with Kokoro 82M, Qwen and llama.cpp

- 来源：r/LocalLLaMA
- 发布时间：2026-04-29T19:04:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11765
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sz8auq/building_a_fully_local_pdftoaudiobook_workflow/

## 摘要

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程，用 Kokoro 82M 做语音合成，Qwen 3.5 0.8B 或 2B 处理文本，llama.cpp 做推理，整个应用用 Tauri 2.0 打包，在 M1 Mac 上运行。工作方式是先读前 15 句，边读边准备下 15 句，减少等待。作者说真正的难点不在...

## 推荐理由

HKR 三项都踩中了，但本质是 Reddit 上的个人工作流展示，不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折：正文没披露代码和表格朗读的具体处理逻辑，这点先别太激动。

## 锐评

这条分享的价值在于把 PDF 转有声书的整个链路都压到了本地，不用联网，数据不外传。作者用 Kokoro 82M 做语音合成，Qwen 3.5 0.8B 或 2B 处理文本，llama.cpp 跑推理，Tauri 2.0 打包成桌面应用，在 M1 Mac 上就能跑。技术上比较实在的一点是用了流水线策略：先读前 15 句，边播放边准备下 15 句，这样能压住首句延迟。

作者自己说真正的难点不在模型，而在 PDF 文本对齐、代码块和表格的处理，这些脏活才是工程大头。不过正文被 Reddit 的网络安全拦截了，我们看不到完整的技术细节和实际效果演示。82M 参数的语音模型能做到什么水平的自然度和停顿，Qwen 0.8B 处理复杂排版会不会丢段落，这些关键信息都缺失。另外整个流程的内存占用、耗电和生成速度也没给数字，想在自己机器上复现的人没法评估成本。
