Visão geral
Embora o Web2MD funcione em qualquer página web, certos sites se beneficiam de uma lógica de extração especializada. O Web2MD inclui 16 extratores específicos por plataforma que usam a API ou a estrutura DOM de cada plataforma para produzir uma saída em Markdown melhor do que a extração genérica.
Sites suportados
Baseados em API (sem necessidade de aba)
Esses extratores buscam dados diretamente pela API da plataforma, então funcionam mesmo sem uma aba de navegador ativa.- Título do post, autor, subreddit e pontuação
- Texto próprio ou conteúdo de link
- Até 200 comentários com 4 níveis de aninhamento, incluindo autor e pontuação
- Links de imagens e mídia
/.json) para uma extração confiável.
Hacker News
Extrai threads de discussão completas via API do Algolia:- Título do post, URL, pontos e contagem de comentários
- Todos os comentários com autor e aninhamento
arXiv
Extrai papers de pesquisa:- Título, autores e resumo do paper
- Conteúdo HTML completo dos papers de pesquisa
YouTube
Extrai metadados do vídeo:- Título do vídeo e nome do canal
- Duração e número de visualizações
- Legendas em inglês (quando disponíveis)
Twitter / X
Extrai conteúdo de tweets:- Texto e mídia do tweet
- Informações do autor e métricas de engajamento
Baseados em DOM (requer aba do navegador)
Esses extratores analisam o DOM da página dentro da aba ativa para obter conteúdo estruturado.OpenAI Docs
Extrai páginas de documentação do site de documentação da OpenAI:- Blocos de código e referências de API
- Navegação estruturada e hierarquia de conteúdo
Claude Chat
Extrai o conteúdo da conversa da interface de chat do Claude.ai.Notion
Extrai conteúdo de páginas públicas e autenticadas do Notion (notion.so, notion.site):- Extração dupla: parsing de DOM em nível de bloco (
data-block-id) com fallback de container - Títulos, texto, blocos de código, listas, toggles, callouts, citações
- Imagens, tabelas, bookmarks e embeds
Feishu / Lark
Extrai conteúdo de páginas Feishu Docx e Wiki (feishu.cn, larksuite.com):- Extração dupla: modelo de bloco PageMain com fallback de DOM
- Títulos, texto, blocos de código, listas, tabelas, imagens
- Callouts e checkboxes
Medium
Extrai conteúdo de artigos do DOM do Medium:- Autor, data de publicação e tempo de leitura
- Conteúdo completo do artigo
Substack
Extrai posts de newsletter:- Autor, data e conteúdo completo do artigo
Wikipedia
Extrai conteúdo de artigos:- Seções, tabelas e referências
- Remove navegação e ruído de barra lateral
DEV.to
Extrai posts de blog para desenvolvedores:- Tags, reações e comentários
Product Hunt
Extrai páginas de produtos:- Descrições de produtos e informações do criador
- Threads de discussão
Stack Overflow
Extrai conteúdo de perguntas e respostas:- Título da pergunta, corpo, tags e contagem de votos
- Resposta aceita (destacada)
- Melhores respostas com contagem de votos
GitHub
Extrai Issues e Pull Requests, incluindo:- Título, status (aberto/fechado/mesclado) e labels
- Descrição/corpo original
- Até 30 comentários com informações do autor
Como os adaptadores funcionam
Quando você converte uma página, o Web2MD automaticamente:- Detecta o site a partir da URL
- Seleciona o melhor adaptador, se existir
- Extrai o conteúdo usando o método específico do site
- Recorre à extração genérica se o adaptador falhar
Os adaptadores de site estão disponíveis para todos os usuários (Free e Pro). Eles rodam antes do pipeline principal de conversão, então funcionam independentemente do seu plano.