Перейти к основному содержанию

Обзор

Хотя Web2MD работает с любой веб-страницей, некоторые сайты выигрывают от специализированной логики извлечения. Web2MD включает 16 адаптеров под конкретные платформы, которые используют API или структуру DOM каждой платформы, чтобы получить более качественный Markdown, чем при обычном извлечении.
Адаптеры под конкретные сайты

Поддерживаемые сайты

На основе API (вкладка не требуется)

Эти экстракторы получают данные напрямую через API платформы, поэтому работают даже без активной вкладки браузера.

Reddit

Извлекает полное содержимое поста, включая:
  • Заголовок поста, автора, сабреддит и рейтинг
  • Текст поста или содержимое по ссылке
  • До 200 комментариев с 4 уровнями вложенности, включая автора и рейтинг
  • Ссылки на изображения и медиа
Использует JSON API Reddit (/.json) для надёжного извлечения.

Hacker News

Извлекает полные ветки обсуждений через Algolia API:
  • Заголовок поста, URL, баллы и количество комментариев
  • Все комментарии с автором и вложенностью

arXiv

Извлекает научные статьи:
  • Заголовок статьи, авторов и аннотацию
  • Полное HTML-содержимое научных статей

YouTube

Извлекает метаданные видео:
  • Название видео и название канала
  • Длительность и количество просмотров
  • Английские субтитры (если доступны)

Twitter / X

Извлекает содержимое твита:
  • Текст твита и медиа
  • Информацию об авторе и метрики вовлечённости

На основе DOM (требуется вкладка браузера)

Эти экстракторы разбирают DOM страницы внутри активной вкладки для получения структурированного контента.

OpenAI Docs

Извлекает страницы документации с сайта документации OpenAI:
  • Блоки кода и справочники по API
  • Структурированную навигацию и иерархию контента

Claude Chat

Извлекает содержимое разговора из интерфейса чата Claude.ai.

Notion

Извлекает контент с публичных и авторизованных страниц Notion (notion.so, notion.site):
  • Двойное извлечение: разбор DOM на уровне блоков (data-block-id) с резервным вариантом по контейнеру
  • Заголовки, текст, блоки кода, списки, toggle-блоки, callout-блоки, цитаты
  • Изображения, таблицы, закладки и встраивания

Feishu / Lark

Извлекает контент со страниц Feishu Docx и Wiki (feishu.cn, larksuite.com):
  • Двойное извлечение: модель блоков PageMain с резервным вариантом по DOM
  • Заголовки, текст, блоки кода, списки, таблицы, изображения
  • Callout-блоки и чекбоксы

Medium

Извлекает содержимое статьи из DOM Medium:
  • Автора, дату публикации и время чтения
  • Полное содержимое статьи

Substack

Извлекает записи рассылок:
  • Автора, дату и полное содержимое статьи

Wikipedia

Извлекает содержимое статьи:
  • Разделы, таблицы и источники
  • Убирает навигацию и лишние элементы боковой панели

DEV.to

Извлекает записи блогов разработчиков:
  • Теги, реакции и комментарии

Product Hunt

Извлекает страницы продуктов:
  • Описания продуктов и информацию о создателях
  • Ветки обсуждений

Stack Overflow

Извлекает контент вопросов и ответов:
  • Заголовок вопроса, текст, теги и количество голосов
  • Принятый ответ (выделен)
  • Топовые ответы с количеством голосов

GitHub

Извлекает Issues и Pull Requests, включая:
  • Заголовок, статус (open/closed/merged) и метки
  • Исходное описание/текст
  • До 30 комментариев с информацией об авторе
Использует REST API GitHub для структурированных данных.

Как работают адаптеры

При конвертации страницы Web2MD автоматически:
  1. Определяет сайт по URL
  2. Выбирает наилучший адаптер, если он существует
  3. Извлекает контент, используя метод, специфичный для сайта
  4. Переключается на обычное извлечение, если адаптер не сработал
Настраивать ничего не нужно — адаптеры применяются автоматически.
Адаптеры сайтов доступны всем пользователям (Free и Pro). Они запускаются до основного конвейера конвертации, поэтому работают независимо от вашего тарифа.

Сравнение