# Heretic 1.3 发布：模型可复现、内置跑分、显存占用更低

> 原标题：Heretic 1.3 released: Reproducible models, integrated benchmarking system, reduced peak VRAM usage, broader model support, and more

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T14:57:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14419
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t4hwup/heretic_13_released_reproducible_models/

## 摘要

Heretic 1.3 这个版本主要干了三件事。第一，它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来，别人照着做就能复现结果，不用再猜“为啥我跑出来不一样”。第二，它内置了一套跑分系统，直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

## 推荐理由

我会先打个折：正文没给出 VRAM 具体降了多少，这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现，把 PyTorch、GPU、驱动版本都记下来，方便排查问题；二是内置了 lm-evaluation-harness 基准测试，不用再自己搭评测流程。项目有 2 万星、1300 万次下载，社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字，所以重要性停在 72 分，放在 featured 里合适。

## 锐评

Heretic 1.3 这个版本最实在的改进是“可复现”——它把跑模型时的 PyTorch 版本、GPU 型号、驱动这些环境信息打包存下来，别人照着做就能拿到一样的结果，不用再猜“为啥我跑出来不一样”。这对开源社区是个好事，能减少大量扯皮。内置跑分系统直接接入了 lm-evaluation-harness，测 MMLU、EQ-Bench、GSM8K 和 HellaSwag，省得自己搭评测流程。新增了对 Qwen3.5 和 Gemma 4 的支持，覆盖面更广了。

但原文被 Reddit 的网络墙挡了，我只能看到摘要。项目方说峰值显存占用降低了，但具体降了多少、在什么卡上测的、跑什么模型得出的数字，正文没披露。20,000 个 GitHub star 和 1,300 万次模型下载这两个数字，也没法验证是累计还是单版本。如果显存优化真能省出一张显卡的钱，那值得跟；如果只是边角优化，就别抱太大期待。建议等有人实测放出对比数据再决定要不要升级。
