# Pulpie：用编码器做网页清洗，效果追平SOTA但成本只要二十分之一

> 原标题：Pulpie：用于清理网络的Pareto最优模型

- 来源：AI HOT 精选
- 发布时间：2026-07-08T01:33:24.910Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43004
- 原文：https://usefeyn.com/blog/pulpie-pareto-optimal-models-for-cleaning-the-web

## 摘要

Feyn Labs 开源了一个叫 Pulpie 的网页正文提取模型家族。最小的 pulpie-orange-small 只有 2.1 亿参数，在 WebMainBench 上的 ROUGE-5 F1 得分是 0.862，跟目前最强的 Dripper（6 亿参数，0.864 分）几乎打平。快是它最大的卖点：在 L4 GPU 上每秒能处理 13.7 个页面...

## 推荐理由

Feyn Labs开源了一个叫Pulpie的网页正文提取模型家族。最小的版本只有2.1亿参数，在WebMainBench上得分0.862，跟目前最强的Dripper（6亿参数，0.864分）几乎打平。快是它最大的卖点：在L4 GPU上每秒能处理13.7个页面，推理成本只要Dripper的二十分之一。对做网页抓取、给RAG系统喂数据的团队来说，这些数字能直接换算成成本节省。不过正文提取本身是基础设施，不是大多数AI从业者每天头疼的问题，所以我会先打个折。

## 锐评

这条新闻最值得看的是成本数字：用 Pulpie 清洗 10 亿个网页只要 7900 美元，而之前最强的 Dripper 要 15.9 万。差距来自架构选择——Pulpie 是个编码器，一次前向传播就给页面所有块打好标签；Dripper 是解码器，一个 token 一个 token 往外吐，被显存带宽卡住了脖子。效果上，Pulpie 在 WebMainBench 上拿了 0.862 分，Dripper 是 0.864，基本打平。

训练标签来自 DeepSeek V3.2 和 Dripper 0.6B 交叉标注的 15880 个 Common Crawl 页面，块级别一致率 93.3%。文章还引用了 AICC 实验：用模型提取的语料训练，13 个基准平均准确率提升 1.08 个百分点，超过了 FineWeb 和 RefinedWeb。这个提升幅度不算夸张，但考虑到只换了提取器、其他管线没动，说明干净数据确实值钱。

不过要打折的地方也有。正文明确说只测了英文页面，多语言表现没披露。15880 页的训练集不算大，泛化到各种奇葩 HTML 结构能有多稳还不好说。另外成本对比基于 L4 GPU 的 0.39 美元/小时定价，实际大规模部署时实例类型和批处理策略会影响最终账单。
