# 本地模型后端生成基准测试：GLM、Qwen、DeepSeek 函数调用能力对比

> 原标题：Local LLM Benchmark about Backend Generation by Function Calling (GLM vs Qwen vs DeepSeek)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-03T13:59:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13139
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t2m7wi/local_llm_benchmark_about_backend_generation_by/

## 摘要

AutoBe 发了一个后端代码生成基准，用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平，但样本量只有 4 个项目，而且评分工具是自己写的，可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token，按 GPT 5.5 的定价算，单模型成本在 1000 到 1500 美元。正文没披露...

## 推荐理由

我会先打个折：数据来自 Reddit 帖子，只测了 n=4 个项目，评测 harness 还是自己写的，偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球，加上单任务 1000 多美元的成本和笔记本可跑的硬限制，对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节，这点先别太激动。

## 锐评

这个测试让模型通过函数调用来设计数据库和 API，相当于考模型能不能把需求直接变成可运行的后端代码。qwen3.5-35b-a3b 的表现跟 gpt-5.4 持平，听起来挺强，但得先打个折：总共只测了 4 个项目，样本量太小，换个项目可能结果就变了。而且评分工具是作者自己写的，没有第三方验证，可能存在偏向。

成本方面，一个商场项目跑下来要消耗 2 到 3 亿 token，按 GPT 5.5 的定价算，单模型成本在 1000 到 1500 美元。这个数字说明两件事：一是这种全自动后端生成目前还很烧钱，二是如果开源模型真能追上闭源，省下的费用会很可观。

正文没披露测试的具体项目类型、评分标准细节，也没说 qwen 在哪些子任务上强、哪些上弱。光看一个总分很难判断它是不是真的能替代 gpt-5.4 干活。
