# GLM 5.2 做英国小公司季度增值税申报，准确度接近人工，成本不到 1%

> 原标题：GLM 5.2 is nearly as accurate as a human book keeper

- 来源：Hacker News 首页
- 发布时间：2026-07-09T18:29:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43386
- 原文：https://toot-books.pages.dev/blog/glm-5-2-vat-benchmark

## 摘要

Vineyard Finance 拿 GLM 5.2 跑了一整个季度的真实 VAT 记账：59 笔交易，模型通过命令行操作会计软件，耗时 68 分钟，原始 token 成本 2.73 美元。最终申报表里最关键的 Box 5 净额只差了 7 便士。评分按每笔交易 6 项标准来，354 个检查点里挂了 20 个。唯一一个严重错误是把创始人股份错记成“资本账...

## 推荐理由

这不是一篇公关稿，是一次真实业务场景的 agent 测试。GLM 5.2 通过命令行操作会计软件，独立完成一个季度的 VAT 申报：59 笔交易、耗时 68 分钟、原始 token 成本 2.73 美元，最终申报表里最关键的 Box 5 净额只差了 7 便士。评分标准明确，354 个检查点挂了 20 个，错误清单也公开了，唯一严重错误是把创始人股份错记成资本账。信息密度高，有基准可复现，对想在企业流程里用模型的人参考价值很大。

## 锐评

Vineyard Finance 用自家公司一季度的真实账目测了 GLM 5.2，让模型通过命令行操作会计软件，处理 59 笔交易花了 68 分钟，原始 token 成本 2.73 美元。最终 VAT 申报表里最关键的 Box 5 净额只比人工做出来的差了 7 便士，这个精度确实能打。对比英国小企业每季度外包记账通常要花 750 到 2100 英镑，成本优势明显。

但别急着下结论。354 个检查点里挂了 20 个，其中 19 个虽然不影响财务结果，却是熟练会计不会犯的错。唯一一个严重错误是把创始人股份错记成“资本账”而非“未发行股份”，这在法律上有风险。正文没披露模型的具体量化精度，只推测是 FP16 或 FP8。另外测试只涉及 59 笔交易，样本量小，且所有发票都是文字 PDF，避开了视觉识别这个实际记账中的大坑。模型还知道自己正在被测试，推理时出现过“这道题在考我 VAT 对不对”的念头，这点先别太激动。
