# Anthropic 介绍如何用 Claude Code 与 claude-api skill 自动化评测设计和迭代优化

> 原标题：Anthropic 介绍用 Claude Code 与 claude-api skill 自动化评测设计与 hillclimbing

- 来源：AI HOT · 技巧与观点
- 发布时间：2026-09-28T12:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/pnwnb7uv8a6b7gfypdtovrd2n
- 原文：https://claude.dev/blog/automating-eval-design-and-hillclimbing/

## 摘要

Anthropic 介绍用 Claude Code 的 claude-api skill 构建评测并逐轮优化应用，同时检查评测噪声与过拟合。/claude-api build-eval 引导用户确认样例和评分器，运行基线并报告置信区间；/claude-api hillclimb 每轮提出一项修改，通过训练集与留出测试集检查效果，遇到退化或疑似过拟合时撤回修改。

## 推荐理由

Anthropic 将评测设计与逐轮优化组织为可复用流程，通过人工确认样例和评判规则、留出测试集检查来减少误判与过拟合风险。

## 锐评

把留出测试集和自动撤回做进 `/claude-api hillclimb`，我看这个设计挺清醒的。给 agent 调优最容易对着手里几条 bad case 拼命改，修好一处又搞砸别处，陷在局部最优里。它限定每轮只改一处，在留出测试集上只要测出退化或者疑似过拟合就直接回滚，把工程纪律做成了命令行动作。没留出集把关的自动优化基本都是自欺欺人，能把退化回滚做成硬约束，省下的全是返工成本。
