跳到正文
Hacker News 首页

Agent Skills 用错的人很多:别让模型自己写说明书,去补它看不见的知识缺口

You're probably using Agent Skills wrong

Anson Biggs 结合 SkillsBench 论文吐槽了 Agent Skills 的常见误用。这个基准测试覆盖了 11 个领域、86 项任务,用 7 种模型配置跑了 7308 条轨迹。结果显示,人工整理好的 Skills 平均能把通过率拉高 16.2 个百分点,但领域差异极大:软件工程只涨了 4.5 个百分点,医疗健康则暴涨 51.9 个百分...

推荐理由:一篇用基准测试数据做支撑的实操吐槽,不是空对空的观点。H、K、R 三个维度都踩中了,但本质是个人博客的总结分析,不是原创研究或产品发布,所以定在 featured 门槛的 72 分。目前只有摘要,完整论证力度待看全文。

读原文 ↗导出 Markdown