LyumbreitAI 采集资料网页保存方案 中发帖

个人最近的一个任务,目的是在收集各类实体的官方网站。这类网站通常限制较少,可直接公开访问。 
由于项目需要采集粒度较细的个人信息,需要留存导出的网页原始数据,后续再调用其他的AI Agent进行网页的AI的处理和阅读。
为此,我调研并比较了下各个AI采集工具,形成了最终的方案,在此分享出来。也欢迎更有经验的大佬提供一些优化思路。

工具能力对比




工具
动态页面
认证页面
图片保存
适用场景
复杂度




wget


(自动下载所有资源)
静态/简单页面



curl


(需额外处理)
下载单个文件



webfetch



快速提取文本



defuddle



清理后 Markdown



playwright CLI

(–load-state)
需脚本支持
动态/认证页面



Playwright + 自定...