> ## Documentation Index
> Fetch the complete documentation index at: https://web2md.org/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Адаптеры сайтов

> Оптимизированное извлечение контента для 16 популярных платформ, включая Reddit, GitHub, YouTube, Hacker News, arXiv, Medium и другие.

## Обзор

Хотя Web2MD работает с любой веб-страницей, некоторые сайты выигрывают от специализированной логики извлечения. Web2MD включает **16 адаптеров под конкретные платформы**, которые используют API или структуру DOM каждой платформы, чтобы получить более качественный Markdown, чем при обычном извлечении.

<Frame>
  <img src="https://mintcdn.com/web2md/qOtwQjeH2QQiHWtp/images/site-adapters.png?fit=max&auto=format&n=qOtwQjeH2QQiHWtp&q=85&s=129e33379869863c7e80ea6db4c585d4" alt="Адаптеры под конкретные сайты" width="1280" height="800" data-path="images/site-adapters.png" />
</Frame>

## Поддерживаемые сайты

### На основе API (вкладка не требуется)

Эти экстракторы получают данные напрямую через API платформы, поэтому работают даже без активной вкладки браузера.

#### Reddit

Извлекает полное содержимое поста, включая:

* Заголовок поста, автора, сабреддит и рейтинг
* Текст поста или содержимое по ссылке
* До **200 комментариев** с 4 уровнями вложенности, включая автора и рейтинг
* Ссылки на изображения и медиа

Использует JSON API Reddit (`/.json`) для надёжного извлечения.

#### Hacker News

Извлекает полные ветки обсуждений через Algolia API:

* Заголовок поста, URL, баллы и количество комментариев
* Все комментарии с автором и вложенностью

#### arXiv

Извлекает научные статьи:

* Заголовок статьи, авторов и аннотацию
* Полное HTML-содержимое научных статей

#### YouTube

Извлекает метаданные видео:

* Название видео и название канала
* Длительность и количество просмотров
* Английские субтитры (если доступны)

#### Twitter / X

Извлекает содержимое твита:

* Текст твита и медиа
* Информацию об авторе и метрики вовлечённости

### На основе DOM (требуется вкладка браузера)

Эти экстракторы разбирают DOM страницы внутри активной вкладки для получения структурированного контента.

#### OpenAI Docs

Извлекает страницы документации с сайта документации OpenAI:

* Блоки кода и справочники по API
* Структурированную навигацию и иерархию контента

#### Claude Chat

Извлекает содержимое разговора из интерфейса чата Claude.ai.

#### Notion

Извлекает контент с публичных и авторизованных страниц Notion (notion.so, notion.site):

* Двойное извлечение: разбор DOM на уровне блоков (`data-block-id`) с резервным вариантом по контейнеру
* Заголовки, текст, блоки кода, списки, toggle-блоки, callout-блоки, цитаты
* Изображения, таблицы, закладки и встраивания

#### Feishu / Lark

Извлекает контент со страниц Feishu Docx и Wiki (feishu.cn, larksuite.com):

* Двойное извлечение: модель блоков PageMain с резервным вариантом по DOM
* Заголовки, текст, блоки кода, списки, таблицы, изображения
* Callout-блоки и чекбоксы

#### Medium

Извлекает содержимое статьи из DOM Medium:

* Автора, дату публикации и время чтения
* Полное содержимое статьи

#### Substack

Извлекает записи рассылок:

* Автора, дату и полное содержимое статьи

#### Wikipedia

Извлекает содержимое статьи:

* Разделы, таблицы и источники
* Убирает навигацию и лишние элементы боковой панели

#### DEV.to

Извлекает записи блогов разработчиков:

* Теги, реакции и комментарии

#### Product Hunt

Извлекает страницы продуктов:

* Описания продуктов и информацию о создателях
* Ветки обсуждений

#### Stack Overflow

Извлекает контент вопросов и ответов:

* Заголовок вопроса, текст, теги и количество голосов
* Принятый ответ (выделен)
* Топовые ответы с количеством голосов

#### GitHub

Извлекает Issues и Pull Requests, включая:

* Заголовок, статус (open/closed/merged) и метки
* Исходное описание/текст
* До **30 комментариев** с информацией об авторе

Использует REST API GitHub для структурированных данных.

## Как работают адаптеры

При конвертации страницы Web2MD автоматически:

1. **Определяет сайт** по URL
2. **Выбирает наилучший адаптер**, если он существует
3. **Извлекает контент**, используя метод, специфичный для сайта
4. **Переключается на обычное извлечение**, если адаптер не сработал

Настраивать ничего не нужно — адаптеры применяются автоматически.

<Info>
  Адаптеры сайтов доступны всем пользователям (Free и Pro). Они запускаются до основного конвейера конвертации, поэтому работают независимо от вашего тарифа.
</Info>

## Сравнение

| Характеристика     | Обычное извлечение            | Адаптер сайта                        |
| ------------------ | ----------------------------- | ------------------------------------ |
| Точность контента  | Хорошо подходит для статей    | Оптимизировано под структуру сайта   |
| Комментарии/ответы | Не извлекаются                | Включены (Reddit, GitHub, SO)        |
| Метаданные         | Базовые (заголовок, URL)      | Расширенные (автор, рейтинг, статус) |
| Медиа              | Только изображения            | Видео, субтитры, встраивания         |
| Надёжность         | Зависит от структуры страницы | Использует стабильные API            |
