نظرة عامة
رغم أن Web2MD يعمل على أي صفحة ويب، تستفيد بعض المواقع من منطق استخراج متخصص. يتضمن Web2MD 16 مستخرجًا مخصصًا لمنصات محددة تستخدم واجهة برمجة التطبيقات (API) أو بنية DOM الخاصة بكل منصة لإنتاج مخرجات Markdown أفضل من الاستخراج العام.
المواقع المدعومة
قائمة على API (لا تحتاج تبويبًا مفتوحًا)
تجلب هذه المستخرِجات البيانات مباشرة عبر واجهة برمجة تطبيقات المنصة، لذا تعمل حتى دون وجود تبويب متصفح نشط.- عنوان المنشور، الكاتب، الـ subreddit، والنقاط
- نص المنشور أو محتوى الرابط
- حتى 200 تعليق بأربعة مستويات من التداخل، مع الكاتب والنقاط
- روابط الصور والوسائط
/.json) لاستخراج موثوق.
Hacker News
يستخرج مواضيع النقاش الكاملة عبر واجهة Algolia:- عنوان المنشور، الرابط، النقاط، وعدد التعليقات
- جميع التعليقات مع الكاتب والتداخل
arXiv
يستخرج الأوراق البحثية:- عنوان الورقة، المؤلفون، والملخص
- محتوى HTML الكامل للأوراق البحثية
YouTube
يستخرج البيانات الوصفية للفيديو:- عنوان الفيديو واسم القناة
- المدة وعدد المشاهدات
- الترجمات/التعليقات النصية الإنجليزية (عند توفرها)
Twitter / X
يستخرج محتوى التغريدة:- نص التغريدة والوسائط
- معلومات الكاتب ومقاييس التفاعل
قائمة على DOM (تتطلب تبويب متصفح)
تحلّل هذه المستخرِجات بنية DOM للصفحة داخل التبويب النشط لاستخراج محتوى منظَّم.OpenAI Docs
يستخرج صفحات التوثيق من موقع توثيق OpenAI:- كتل الكود ومراجع API
- التنقل المنظَّم وتسلسل المحتوى الهرمي
Claude Chat
يستخرج محتوى المحادثة من واجهة الدردشة في Claude.ai.Notion
يستخرج المحتوى من صفحات Notion العامة والمسجَّل دخولها (notion.so، notion.site):- استخراج مزدوج: تحليل DOM على مستوى الكتلة (
data-block-id) مع احتياطي (fallback) على مستوى الحاوية - العناوين، النصوص، كتل الكود، القوائم، القوائم القابلة للطي (toggles)، الملاحظات المنبثقة (callouts)، الاقتباسات
- الصور، الجداول، الإشارات المرجعية، والتضمينات (embeds)
Feishu / Lark
يستخرج المحتوى من صفحات Feishu Docx وWiki (feishu.cn، larksuite.com):- استخراج مزدوج: نموذج كتلة PageMain مع احتياطي على DOM
- العناوين، النصوص، كتل الكود، القوائم، الجداول، الصور
- الملاحظات المنبثقة وصناديق الاختيار
Medium
يستخرج محتوى المقال من بنية DOM في Medium:- الكاتب، تاريخ النشر، ووقت القراءة
- محتوى المقال الكامل
Substack
يستخرج منشورات النشرة البريدية:- الكاتب، التاريخ، ومحتوى المقال الكامل
Wikipedia
يستخرج محتوى المقال:- الأقسام، الجداول، والمراجع
- يزيل عناصر التنقل والشريط الجانبي غير الضرورية
DEV.to
يستخرج تدوينات المطورين:- الوسوم، ردود الفعل، والتعليقات
Product Hunt
يستخرج صفحات المنتجات:- أوصاف المنتج ومعلومات الصانع
- مواضيع النقاش
Stack Overflow
يستخرج محتوى الأسئلة والأجوبة:- عنوان السؤال، النص، الوسوم، وعدد الأصوات
- الإجابة المقبولة (مميَّزة)
- أفضل الإجابات مع عدد الأصوات
GitHub
يستخرج الـ Issues والـ Pull Requests بما في ذلك:- العنوان، الحالة (مفتوح/مغلق/مدموج)، والتصنيفات
- الوصف/النص الأصلي
- حتى 30 تعليقًا مع معلومات الكاتب
كيف تعمل المحوّلات
عند تحويل صفحة، يقوم Web2MD تلقائيًا بما يلي:- اكتشاف الموقع من الرابط
- اختيار أفضل محوّل إن وُجد
- استخراج المحتوى باستخدام الطريقة الخاصة بالموقع
- الرجوع الاحتياطي إلى الاستخراج العام إذا فشل المحوّل
محوّلات المواقع متاحة لجميع المستخدمين (Free وPro). تعمل قبل خط أنابيب التحويل الرئيسي، لذا تعمل بغض النظر عن خطتك.