跳转到主要内容

概览

Web2MD 可以处理任何网页,但有些站点用专门的提取逻辑效果更好。Web2MD 内置了 16 个平台专用提取器,利用各平台的 API 或 DOM 结构,产出比通用提取更优质的 Markdown。
Site-specific adapters

支持的站点

基于 API(无需打开标签页)

这类提取器直接通过平台 API 获取数据,即使没有活动的浏览器标签页也能工作。

Reddit

提取完整的帖子内容,包括:
  • 帖子标题、作者、subreddit 和得分
  • 自发帖正文或链接内容
  • 最多 200 条评论,支持 4 层嵌套,含作者和得分
  • 图片和媒体链接
使用 Reddit 的 JSON API(/.json)进行可靠提取。

Hacker News

通过 Algolia API 提取完整讨论串:
  • 帖子标题、URL、分数和评论数
  • 所有评论,含作者和嵌套结构

arXiv

提取研究论文:
  • 论文标题、作者和摘要
  • 论文的完整 HTML 内容

YouTube

提取视频元数据:
  • 视频标题和频道名
  • 时长和播放量
  • 英文字幕(如可用)

Twitter / X

提取推文内容:
  • 推文文本和媒体
  • 作者信息和互动数据

基于 DOM(需要浏览器标签页)

这类提取器在活动标签页内解析页面 DOM,提取结构化内容。

OpenAI Docs

提取 OpenAI 文档站的页面:
  • 代码块和 API 参考
  • 结构化的导航和内容层级

Claude Chat

提取 Claude.ai 聊天界面中的对话内容。

Notion

提取公开及已登录的 Notion 页面内容(notion.so、notion.site):
  • 双重提取:块级 DOM 解析(data-block-id),失败时回退到容器解析
  • 标题、正文、代码块、列表、折叠块、标注块、引用
  • 图片、表格、书签和嵌入内容

飞书 / Lark

提取飞书 Docx 和 Wiki 页面内容(feishu.cn、larksuite.com):
  • 双重提取:PageMain 块模型,失败时回退到 DOM 解析
  • 标题、正文、代码块、列表、表格、图片
  • 高亮块和复选框

Medium

从 Medium 的 DOM 提取文章内容:
  • 作者、发布日期和阅读时长
  • 完整文章内容

Substack

提取 newsletter 文章:
  • 作者、日期和完整文章内容

Wikipedia

提取词条内容:
  • 章节、表格和参考文献
  • 去除导航栏和侧边栏干扰

DEV.to

提取开发者博客文章:
  • 标签、reactions 和评论

Product Hunt

提取产品页面:
  • 产品描述和 maker 信息
  • 讨论串

Stack Overflow

提取问答内容:
  • 问题标题、正文、标签和票数
  • 已采纳答案(高亮标注)
  • 高票答案及其票数

GitHub

提取 Issue 和 Pull Request,包括:
  • 标题、状态(open/closed/merged)和标签
  • 原始描述/正文
  • 最多 30 条评论,含作者信息
使用 GitHub REST API 获取结构化数据。

适配器的工作方式

转换页面时,Web2MD 会自动:
  1. 根据 URL 识别站点
  2. 如果有对应适配器,选用最合适的那个
  3. 用站点专用方法提取内容
  4. 如果适配器失败,回退到通用提取
你不需要做任何配置——适配器会自动生效。
站点适配器对所有用户(Free 和 Pro)开放。它们在主转换管线之前运行,不受套餐限制。

对比