# 6GB 显卡跑本地会议纪要的下限测试：Qwen3.5 0.8B 用 57 秒出结果，Granite 4 350M 快但会瞎编

> 原标题：Floor for local meeting summarization on a 6GB GPU: qwen3.5:0.8b works at 57s, Granite 4 350M hallucinates

- 来源：r/LocalLLaMA
- 发布时间：2026-05-19T16:50:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23721
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1thsset/floor_for_local_meeting_summarization_on_a_6gb/

## 摘要

一位用户在 RTX 3060 笔记本（6GB 显存）上拿 VoiceFlow 1.6.0 测了两款小模型，看谁能在本地把一段 4 分钟的会议转成纪要。Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结，结果可用。Granite 4 350M 速度很快，0.6 到 2.8 秒就出稿，但会凭空捏造内容，比如编出币安和《星际迷航》的情节...

## 推荐理由

一个 Reddit 用户拿笔记本 3060 6GB 跑 VoiceFlow 1.6.0 做会议总结，Qwen3.5 0.8B 用 57 秒处理 4 分钟录音，Granite 4 350M 虽然快到 0.6-2.8 秒但会凭空编造内容。我会先打个折，这是单人单卡的一次性测试，不是系统评测，但 6GB 这个门槛和幻觉案例对想本地跑会议总结的人有直接参考价值，所以给 73 分 featured。

## 锐评

这条测试很实在，直接给出了本地跑会议纪要的底线配置。一台 RTX 3060 笔记本，6GB 显存，用 VoiceFlow 1.6.0 处理 4 分钟会议音频，Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结，结果可用。这个速度意味着你开完会去接杯水，回来纪要已经好了，对个人用户来说完全能接受。

Granite 4 350M 的表现就有点黑色幽默了。速度快得惊人，0.6 到 2.8 秒就出稿，但会凭空捏造内容，比如编出币安和《星际迷航》的情节。这提醒我们，小模型在极端压缩后，幻觉问题可能比大模型更隐蔽也更危险——它说得太快太流畅，你反而容易信。

正文没披露测试用的具体 prompt、温度参数，也没说 Qwen 的总结质量到底怎么评判的，只说“可用”。另外，VoiceFlow 本身的转写准确率也没提，如果语音识别那步就错了，后面总结再快也没意义。这点先别太激动，等有人复现了再看。
