Обзор
Хотя Web2MD работает с любой веб-страницей, некоторые сайты выигрывают от специализированной логики извлечения. Web2MD включает 16 адаптеров под конкретные платформы, которые используют API или структуру DOM каждой платформы, чтобы получить более качественный Markdown, чем при обычном извлечении.
Поддерживаемые сайты
На основе API (вкладка не требуется)
Эти экстракторы получают данные напрямую через API платформы, поэтому работают даже без активной вкладки браузера.- Заголовок поста, автора, сабреддит и рейтинг
- Текст поста или содержимое по ссылке
- До 200 комментариев с 4 уровнями вложенности, включая автора и рейтинг
- Ссылки на изображения и медиа
/.json) для надёжного извлечения.
Hacker News
Извлекает полные ветки обсуждений через Algolia API:- Заголовок поста, URL, баллы и количество комментариев
- Все комментарии с автором и вложенностью
arXiv
Извлекает научные статьи:- Заголовок статьи, авторов и аннотацию
- Полное HTML-содержимое научных статей
YouTube
Извлекает метаданные видео:- Название видео и название канала
- Длительность и количество просмотров
- Английские субтитры (если доступны)
Twitter / X
Извлекает содержимое твита:- Текст твита и медиа
- Информацию об авторе и метрики вовлечённости
На основе DOM (требуется вкладка браузера)
Эти экстракторы разбирают DOM страницы внутри активной вкладки для получения структурированного контента.OpenAI Docs
Извлекает страницы документации с сайта документации OpenAI:- Блоки кода и справочники по API
- Структурированную навигацию и иерархию контента
Claude Chat
Извлекает содержимое разговора из интерфейса чата Claude.ai.Notion
Извлекает контент с публичных и авторизованных страниц Notion (notion.so, notion.site):- Двойное извлечение: разбор DOM на уровне блоков (
data-block-id) с резервным вариантом по контейнеру - Заголовки, текст, блоки кода, списки, toggle-блоки, callout-блоки, цитаты
- Изображения, таблицы, закладки и встраивания
Feishu / Lark
Извлекает контент со страниц Feishu Docx и Wiki (feishu.cn, larksuite.com):- Двойное извлечение: модель блоков PageMain с резервным вариантом по DOM
- Заголовки, текст, блоки кода, списки, таблицы, изображения
- Callout-блоки и чекбоксы
Medium
Извлекает содержимое статьи из DOM Medium:- Автора, дату публикации и время чтения
- Полное содержимое статьи
Substack
Извлекает записи рассылок:- Автора, дату и полное содержимое статьи
Wikipedia
Извлекает содержимое статьи:- Разделы, таблицы и источники
- Убирает навигацию и лишние элементы боковой панели
DEV.to
Извлекает записи блогов разработчиков:- Теги, реакции и комментарии
Product Hunt
Извлекает страницы продуктов:- Описания продуктов и информацию о создателях
- Ветки обсуждений
Stack Overflow
Извлекает контент вопросов и ответов:- Заголовок вопроса, текст, теги и количество голосов
- Принятый ответ (выделен)
- Топовые ответы с количеством голосов
GitHub
Извлекает Issues и Pull Requests, включая:- Заголовок, статус (open/closed/merged) и метки
- Исходное описание/текст
- До 30 комментариев с информацией об авторе
Как работают адаптеры
При конвертации страницы Web2MD автоматически:- Определяет сайт по URL
- Выбирает наилучший адаптер, если он существует
- Извлекает контент, используя метод, специфичный для сайта
- Переключается на обычное извлечение, если адаптер не сработал
Адаптеры сайтов доступны всем пользователям (Free и Pro). Они запускаются до основного конвейера конвертации, поэтому работают независимо от вашего тарифа.