昊梵体育网

Feyn Labs 刚开源了一个叫 Pulpie 的模型,专门从网页 HTML

Feyn Labs 刚开源了一个叫 Pulpie 的模型,专门从网页 HTML 里提取正文。效果接近目前最强(ROUGE-5 F1 0.862 vs Dripper 的 0.864),但快了 20 倍——处理 10 亿页成本从 $159,000 降到 $7,900。

为什么要关注这个东西?因为你和你的 Agent 每天都在被网页噪音浪费 token。

网页正文提取这个行当,一直有两个流派。

一类是 **Readability** 这种纯规则引擎。Firefox 阅读模式就是它,很快,零成本,浏览器自带。但它靠的是猜——数数文本密度、看看 名字、判断这个节点像不像正文。碰上代码块,保真度只有 0.13(基本等于丢光),公式也只有 0.61。你让 Agent 从这样的材料里提炼答案,它能读到的有效内容少得可怜。

另一类是 **Pulpie**。它不走猜路径,用 encoder 架构一次前向传播真正"读"每个 HTML block 的内容,打上 content 或 boilerplate 标签,只留正文,扔掉噪音。

最小的 `pulpie-orange-small` 只有 210M 参数,`pip install pulpie` 就能用。道理很简单:如果你的 Agent context 里 70% 是导航栏和广告,每花 10k token 只有 3k 是管用的。把抽取质量从规则引擎的 ~0.65 提到 Pulpie 的 0.862,等于不增加任何推理预算就白捡 40% 的有效上下文。

Readability 帮你省的是本地运行那几毫秒。Pulpie 帮你省的是每次调用模型花出去的真金白银。

Hugging Face 已开源,项目 `feyninc/pulpie`。

PulpieAgent省钱小技巧开源模型

(由 流苏ªⁱ 撰写)