概览
Web2MD 可以处理任何网页,但有些站点用专门的提取逻辑效果更好。Web2MD 内置了 16 个平台专用提取器,利用各平台的 API 或 DOM 结构,产出比通用提取更优质的 Markdown。
支持的站点
基于 API(无需打开标签页)
这类提取器直接通过平台 API 获取数据,即使没有活动的浏览器标签页也能工作。- 帖子标题、作者、subreddit 和得分
- 自发帖正文或链接内容
- 最多 200 条评论,支持 4 层嵌套,含作者和得分
- 图片和媒体链接
/.json)进行可靠提取。
Hacker News
通过 Algolia API 提取完整讨论串:- 帖子标题、URL、分数和评论数
- 所有评论,含作者和嵌套结构
arXiv
提取研究论文:- 论文标题、作者和摘要
- 论文的完整 HTML 内容
YouTube
提取视频元数据:- 视频标题和频道名
- 时长和播放量
- 英文字幕(如可用)
Twitter / X
提取推文内容:- 推文文本和媒体
- 作者信息和互动数据
基于 DOM(需要浏览器标签页)
这类提取器在活动标签页内解析页面 DOM,提取结构化内容。OpenAI Docs
提取 OpenAI 文档站的页面:- 代码块和 API 参考
- 结构化的导航和内容层级
Claude Chat
提取 Claude.ai 聊天界面中的对话内容。Notion
提取公开及已登录的 Notion 页面内容(notion.so、notion.site):- 双重提取:块级 DOM 解析(
data-block-id),失败时回退到容器解析 - 标题、正文、代码块、列表、折叠块、标注块、引用
- 图片、表格、书签和嵌入内容
飞书 / Lark
提取飞书 Docx 和 Wiki 页面内容(feishu.cn、larksuite.com):- 双重提取:PageMain 块模型,失败时回退到 DOM 解析
- 标题、正文、代码块、列表、表格、图片
- 高亮块和复选框
Medium
从 Medium 的 DOM 提取文章内容:- 作者、发布日期和阅读时长
- 完整文章内容
Substack
提取 newsletter 文章:- 作者、日期和完整文章内容
Wikipedia
提取词条内容:- 章节、表格和参考文献
- 去除导航栏和侧边栏干扰
DEV.to
提取开发者博客文章:- 标签、reactions 和评论
Product Hunt
提取产品页面:- 产品描述和 maker 信息
- 讨论串
Stack Overflow
提取问答内容:- 问题标题、正文、标签和票数
- 已采纳答案(高亮标注)
- 高票答案及其票数
GitHub
提取 Issue 和 Pull Request,包括:- 标题、状态(open/closed/merged)和标签
- 原始描述/正文
- 最多 30 条评论,含作者信息
适配器的工作方式
转换页面时,Web2MD 会自动:- 根据 URL 识别站点
- 如果有对应适配器,选用最合适的那个
- 用站点专用方法提取内容
- 如果适配器失败,回退到通用提取
站点适配器对所有用户(Free 和 Pro)开放。它们在主转换管线之前运行,不受套餐限制。