article-extractor

从 URL 提取干净的网页文章内容,移除广告、导航和干扰元素,保存为格式良好的纯文本。支持博客、新闻、教程等多种文章类型。

智能内容清洗,自动移除以下干扰元素: 导航菜单和页头页脚 广告和推广内容 新闻通讯注册表单 相关文章侧边栏 社交媒体按钮 Cookie 通知 评论区域(可选)

输出规范

提取后的文件包含: 文章标题(如可用) 作者信息(如工具提供) 主要文章内容 章节标题层级 无广告、无导航的纯净文本

展示内容: 提取成功确认:✓ Extracted: [Article Title] 保存位置:✓ Saved to: [filename] 预览内容(前 10-15 行) 文件大小和路径

使用场景: 用户分享文章链接并要求保存内容 需要离线阅读网页文章 从博客或新闻网站提取研究资料 将在线教程转为本地文档

最佳实践: 优先使用 reader:适合大多数新闻网站和博客,基于成熟的 Readability 算法 trafilatura 适用于:学术文章、复杂布局、非英语内容 提取后务必展示预览,让用户确认质量 保存前验证提取结果,失败时自动尝试降级方案 文件名保持简洁(< 100 字符),移除特殊字符

v1.0.0 2026-07-14
下载
技能信息
下载量 1
作者 michalparkola
最新版本 v1.0.0
下载zip包