> ## Documentation Index
> Fetch the complete documentation index at: https://web2md.org/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 站点适配器

> 针对 Reddit、GitHub、YouTube、Hacker News、arXiv、Medium 等 16 个热门平台优化的内容提取。

## 概览

Web2MD 可以处理任何网页，但有些站点用专门的提取逻辑效果更好。Web2MD 内置了 **16 个平台专用提取器**，利用各平台的 API 或 DOM 结构，产出比通用提取更优质的 Markdown。

<Frame>
  <img src="https://mintcdn.com/web2md/qOtwQjeH2QQiHWtp/images/site-adapters.png?fit=max&auto=format&n=qOtwQjeH2QQiHWtp&q=85&s=129e33379869863c7e80ea6db4c585d4" alt="Site-specific adapters" width="1280" height="800" data-path="images/site-adapters.png" />
</Frame>

## 支持的站点

### 基于 API（无需打开标签页）

这类提取器直接通过平台 API 获取数据，即使没有活动的浏览器标签页也能工作。

#### Reddit

提取完整的帖子内容，包括：

* 帖子标题、作者、subreddit 和得分
* 自发帖正文或链接内容
* 最多 **200 条评论**，支持 4 层嵌套，含作者和得分
* 图片和媒体链接

使用 Reddit 的 JSON API（`/.json`）进行可靠提取。

#### Hacker News

通过 Algolia API 提取完整讨论串：

* 帖子标题、URL、分数和评论数
* 所有评论，含作者和嵌套结构

#### arXiv

提取研究论文：

* 论文标题、作者和摘要
* 论文的完整 HTML 内容

#### YouTube

提取视频元数据：

* 视频标题和频道名
* 时长和播放量
* 英文字幕（如可用）

#### Twitter / X

提取推文内容：

* 推文文本和媒体
* 作者信息和互动数据

### 基于 DOM（需要浏览器标签页）

这类提取器在活动标签页内解析页面 DOM，提取结构化内容。

#### OpenAI Docs

提取 OpenAI 文档站的页面：

* 代码块和 API 参考
* 结构化的导航和内容层级

#### Claude Chat

提取 Claude.ai 聊天界面中的对话内容。

#### Notion

提取公开及已登录的 Notion 页面内容（notion.so、notion.site）：

* 双重提取：块级 DOM 解析（`data-block-id`），失败时回退到容器解析
* 标题、正文、代码块、列表、折叠块、标注块、引用
* 图片、表格、书签和嵌入内容

#### 飞书 / Lark

提取飞书 Docx 和 Wiki 页面内容（feishu.cn、larksuite.com）：

* 双重提取：PageMain 块模型，失败时回退到 DOM 解析
* 标题、正文、代码块、列表、表格、图片
* 高亮块和复选框

#### Medium

从 Medium 的 DOM 提取文章内容：

* 作者、发布日期和阅读时长
* 完整文章内容

#### Substack

提取 newsletter 文章：

* 作者、日期和完整文章内容

#### Wikipedia

提取词条内容：

* 章节、表格和参考文献
* 去除导航栏和侧边栏干扰

#### DEV.to

提取开发者博客文章：

* 标签、reactions 和评论

#### Product Hunt

提取产品页面：

* 产品描述和 maker 信息
* 讨论串

#### Stack Overflow

提取问答内容：

* 问题标题、正文、标签和票数
* 已采纳答案（高亮标注）
* 高票答案及其票数

#### GitHub

提取 Issue 和 Pull Request，包括：

* 标题、状态（open/closed/merged）和标签
* 原始描述/正文
* 最多 **30 条评论**，含作者信息

使用 GitHub REST API 获取结构化数据。

## 适配器的工作方式

转换页面时，Web2MD 会自动：

1. 根据 URL **识别站点**
2. 如果有对应适配器，**选用最合适的那个**
3. 用站点专用方法**提取内容**
4. 如果适配器失败，**回退**到通用提取

你不需要做任何配置——适配器会自动生效。

<Info>
  站点适配器对所有用户（Free 和 Pro）开放。它们在主转换管线之前运行，不受套餐限制。
</Info>

## 对比

| 特性    | 通用提取       | 站点适配器                |
| ----- | ---------- | -------------------- |
| 内容准确度 | 对文章类页面效果不错 | 针对站点结构优化             |
| 评论/回复 | 不提取        | 包含（Reddit、GitHub、SO） |
| 元数据   | 基础（标题、URL） | 丰富（作者、得分、状态）         |
| 媒体    | 仅图片        | 视频、字幕、嵌入内容           |
| 可靠性   | 依赖页面结构     | 使用稳定的 API            |
