# 一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

> 原标题：Local LLM autocomplete + agentic coding on a single 16GB GPU + 64GB RAM

- 来源：r/LocalLLaMA
- 发布时间：2026-05-12T14:53:30.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19006
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tb3zxp/local_llm_autocomplete_agentic_coding_on_a_single/

## 摘要

Reddit 用户 grumd 在一张 RTX 5080（16GB 显存）和 64GB 内存的单机上同时跑了两套模型：Qwen2.5-Coder-7B Q6 做代码补全，Qwen3.6-35B-A3B Q8 做智能体编程（让模型自己规划步骤、调用工具写代码）。35B 那个模型用了内存卸载，上下文能撑到约 145k，速度是每秒 35.29 个 token...

## 推荐理由

这是一篇 Reddit 个人实验帖，不是系统评测，没有对比其他方案或验证稳定性，所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了，对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率，这点先别太激动。

## 锐评

这条帖子展示了一个挺实用的本地开发方案：用一张RTX 5080（16GB显存）加64GB内存，同时跑两套模型。小模型Qwen2.5-Coder-7B负责代码补全，大模型Qwen3.6-35B-A3B通过内存卸载跑智能体编程，让模型自己规划步骤、调用工具写代码。大模型上下文能撑到约145k，速度每秒35个token，内存占用56GB左右。这个速度对于智能体任务来说能用，但不算快，复杂任务可能会让人等。

不过这条信息有个硬伤：Reddit原文返回了403错误，我们拿到的只是摘要，看不到原帖的详细配置、实际体验和稳定性反馈。35B模型用内存卸载跑智能体，内存带宽会成为瓶颈，长时间任务会不会降速、会不会出错，这些关键信息都缺失。另外，两套模型同时跑，显存和内存的分配策略也没披露。

如果你手头正好有类似配置，这个方案值得试试，但别对稳定性抱太高期待。最好等原帖恢复后看看评论区，那里通常会有真实的踩坑记录。
