Zum Hauptinhalt springen

Überblick

Web2MD funktioniert zwar auf jeder Webseite, doch bei bestimmten Websites profitiert die Extraktion von spezialisierter Logik. Web2MD enthält 16 plattformspezifische Extraktoren, die die API oder DOM-Struktur der jeweiligen Plattform nutzen, um ein besseres Markdown-Ergebnis zu liefern als die generische Extraktion.
Site-specific adapters

Unterstützte Websites

API-basiert (kein Tab nötig)

Diese Extraktoren rufen Daten direkt über die API der Plattform ab und funktionieren daher auch ohne aktiven Browser-Tab.

Reddit

Extrahiert den vollständigen Beitragsinhalt, einschließlich:
  • Titel, Autor, Subreddit und Score des Beitrags
  • Selbsttext- oder Link-Inhalt
  • Bis zu 200 Kommentare mit 4 Verschachtelungsebenen, inklusive Autor und Score
  • Bild- und Medienlinks
Nutzt die JSON-API von Reddit (/.json) für zuverlässige Extraktion.

Hacker News

Extrahiert vollständige Diskussions-Threads über die Algolia-API:
  • Titel, URL, Punkte und Kommentaranzahl des Beitrags
  • Alle Kommentare mit Autor und Verschachtelung

arXiv

Extrahiert wissenschaftliche Paper:
  • Titel, Autoren und Abstract des Papers
  • Vollständiger HTML-Inhalt wissenschaftlicher Paper

YouTube

Extrahiert Video-Metadaten:
  • Videotitel und Kanalname
  • Dauer und Aufrufzahl
  • Englische Untertitel/Captions (sofern verfügbar)

Twitter / X

Extrahiert Tweet-Inhalte:
  • Tweet-Text und Medien
  • Autoreninformationen und Engagement-Kennzahlen

DOM-basiert (erfordert Browser-Tab)

Diese Extraktoren analysieren das DOM der Seite im aktiven Tab, um strukturierte Inhalte zu erhalten.

OpenAI Docs

Extrahiert Dokumentationsseiten von der Dokumentations-Website von OpenAI:
  • Code-Blöcke und API-Referenzen
  • Strukturierte Navigation und Inhaltshierarchie

Claude Chat

Extrahiert Gesprächsinhalte aus der Chat-Oberfläche von Claude.ai.

Notion

Extrahiert Inhalte von öffentlichen und angemeldeten Notion-Seiten (notion.so, notion.site):
  • Duale Extraktion: block-basiertes DOM-Parsing (data-block-id) mit Container-Fallback
  • Überschriften, Text, Code-Blöcke, Listen, Toggles, Callouts, Zitate
  • Bilder, Tabellen, Lesezeichen und Einbettungen

Feishu / Lark

Extrahiert Inhalte von Feishu-Docx- und Wiki-Seiten (feishu.cn, larksuite.com):
  • Duale Extraktion: PageMain-Blockmodell mit DOM-Fallback
  • Überschriften, Text, Code-Blöcke, Listen, Tabellen, Bilder
  • Callouts und Checkboxen

Medium

Extrahiert Artikelinhalte aus dem DOM von Medium:
  • Autor, Veröffentlichungsdatum und Lesezeit
  • Vollständiger Artikelinhalt

Substack

Extrahiert Newsletter-Beiträge:
  • Autor, Datum und vollständiger Artikelinhalt

Wikipedia

Extrahiert Artikelinhalte:
  • Abschnitte, Tabellen und Quellenangaben
  • Entfernt Navigation und Sidebar-Ballast

DEV.to

Extrahiert Entwickler-Blogbeiträge:
  • Tags, Reaktionen und Kommentare

Product Hunt

Extrahiert Produktseiten:
  • Produktbeschreibungen und Informationen zum Ersteller
  • Diskussions-Threads

Stack Overflow

Extrahiert Q&A-Inhalte:
  • Titel, Text, Tags und Stimmenanzahl der Frage
  • Akzeptierte Antwort (hervorgehoben)
  • Top-Antworten mit Stimmenanzahl

GitHub

Extrahiert Issues und Pull Requests, einschließlich:
  • Titel, Status (offen/geschlossen/gemerged) und Labels
  • Ursprüngliche Beschreibung/Text
  • Bis zu 30 Kommentare mit Autoreninformationen
Nutzt die REST-API von GitHub für strukturierte Daten.

Wie Adapter funktionieren

Beim Konvertieren einer Seite geht Web2MD automatisch wie folgt vor:
  1. Erkennt die Website anhand der URL
  2. Wählt den passenden Adapter aus, sofern vorhanden
  3. Extrahiert den Inhalt mit der site-spezifischen Methode
  4. Greift auf die generische Extraktion zurück, falls der Adapter fehlschlägt
Sie müssen nichts konfigurieren — Adapter werden automatisch angewendet.
Site-Adapter stehen allen Nutzern zur Verfügung (Free und Pro). Sie laufen vor der eigentlichen Konvertierungs-Pipeline und funktionieren daher unabhängig von Ihrem Plan.

Vergleich