# 我测了 36 个热门 MCP 服务器，三分之一在拖累你的 AI 智能体

> 原标题：I graded 36 popular MCP servers on agent usability. A third got a D or F

- 来源：Hacker News 首页
- 发布时间：2026-07-22T05:51:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45886
- 原文：https://tengli.dev/posts/mcp-servers-failing-agents.html

## 摘要

作者用自己写的 mcpgrade 工具给 36 个流行 MCP 服务器打分，11 个拿了 D 或 F。主要问题是参数没写说明——firecrawl 的 134 个错误里有 132 个是参数没描述，MongoDB 和 Notion 的官方服务器也一样。在真实模型测试里，文档差的服务器让工具选择准确率从 100% 掉到 84%，更危险的是，面对不该处理的任...

## 推荐理由

这是一篇第一人称的工程实测，作者自己造轮子给 MCP 服务器打分，有量化数据（准确率从 100% 跌到 84%）、有具体服务器点名（firecrawl、MongoDB、Notion），还点出了“模型硬接不该接的任务”这种安全隐患。不是产品发布或模型突破，但把 MCP 落地最扎心的文档问题讲透了，放在 featured 里当工程实践参考很合适。

## 锐评

作者用自己写的mcpgrade工具扫了36个MCP服务器，三分之一拿了D或F，包括MongoDB、Notion这些官方出品。核心问题不是协议不合规，而是参数描述大面积缺失——firecrawl的134个错误里132个是参数没说明，模型只能看到参数名和类型，不知道这个url该填哪个地址、什么格式。这直接导致真实模型测试中工具选择准确率从100%掉到84%，更危险的是，面对不该处理的任务，拒绝率从100%跌到50%，模型开始瞎猜。

好消息是修起来不费劲，就是给每个参数补.describe()。context7已经这么干了，评分直接从C跳到满分。作者把锅甩给了zod和OpenAPI自动生成schema的流程——类型系统知道是string，但模型需要的那句人话被悄悄丢掉了。

这篇的价值在于把“能用”和“合规”拆开了。正文没披露测试用的具体模型和任务样本量，eval校准细节在单独的文档里，这点先别太激动。另外Stripe和Supabase因为需要真实凭证没扫成，实际表现未知。
