الانتقال إلى المحتوى الرئيسي

نظرة عامة

رغم أن Web2MD يعمل على أي صفحة ويب، تستفيد بعض المواقع من منطق استخراج متخصص. يتضمن Web2MD 16 مستخرجًا مخصصًا لمنصات محددة تستخدم واجهة برمجة التطبيقات (API) أو بنية DOM الخاصة بكل منصة لإنتاج مخرجات Markdown أفضل من الاستخراج العام.
Site-specific adapters

المواقع المدعومة

قائمة على API (لا تحتاج تبويبًا مفتوحًا)

تجلب هذه المستخرِجات البيانات مباشرة عبر واجهة برمجة تطبيقات المنصة، لذا تعمل حتى دون وجود تبويب متصفح نشط.

Reddit

يستخرج محتوى المنشور الكامل بما في ذلك:
  • عنوان المنشور، الكاتب، الـ subreddit، والنقاط
  • نص المنشور أو محتوى الرابط
  • حتى 200 تعليق بأربعة مستويات من التداخل، مع الكاتب والنقاط
  • روابط الصور والوسائط
يستخدم واجهة Reddit لبيانات JSON (/.json) لاستخراج موثوق.

Hacker News

يستخرج مواضيع النقاش الكاملة عبر واجهة Algolia:
  • عنوان المنشور، الرابط، النقاط، وعدد التعليقات
  • جميع التعليقات مع الكاتب والتداخل

arXiv

يستخرج الأوراق البحثية:
  • عنوان الورقة، المؤلفون، والملخص
  • محتوى HTML الكامل للأوراق البحثية

YouTube

يستخرج البيانات الوصفية للفيديو:
  • عنوان الفيديو واسم القناة
  • المدة وعدد المشاهدات
  • الترجمات/التعليقات النصية الإنجليزية (عند توفرها)

Twitter / X

يستخرج محتوى التغريدة:
  • نص التغريدة والوسائط
  • معلومات الكاتب ومقاييس التفاعل

قائمة على DOM (تتطلب تبويب متصفح)

تحلّل هذه المستخرِجات بنية DOM للصفحة داخل التبويب النشط لاستخراج محتوى منظَّم.

OpenAI Docs

يستخرج صفحات التوثيق من موقع توثيق OpenAI:
  • كتل الكود ومراجع API
  • التنقل المنظَّم وتسلسل المحتوى الهرمي

Claude Chat

يستخرج محتوى المحادثة من واجهة الدردشة في Claude.ai.

Notion

يستخرج المحتوى من صفحات Notion العامة والمسجَّل دخولها (notion.so، notion.site):
  • استخراج مزدوج: تحليل DOM على مستوى الكتلة (data-block-id) مع احتياطي (fallback) على مستوى الحاوية
  • العناوين، النصوص، كتل الكود، القوائم، القوائم القابلة للطي (toggles)، الملاحظات المنبثقة (callouts)، الاقتباسات
  • الصور، الجداول، الإشارات المرجعية، والتضمينات (embeds)

Feishu / Lark

يستخرج المحتوى من صفحات Feishu Docx وWiki (feishu.cn، larksuite.com):
  • استخراج مزدوج: نموذج كتلة PageMain مع احتياطي على DOM
  • العناوين، النصوص، كتل الكود، القوائم، الجداول، الصور
  • الملاحظات المنبثقة وصناديق الاختيار

Medium

يستخرج محتوى المقال من بنية DOM في Medium:
  • الكاتب، تاريخ النشر، ووقت القراءة
  • محتوى المقال الكامل

Substack

يستخرج منشورات النشرة البريدية:
  • الكاتب، التاريخ، ومحتوى المقال الكامل

Wikipedia

يستخرج محتوى المقال:
  • الأقسام، الجداول، والمراجع
  • يزيل عناصر التنقل والشريط الجانبي غير الضرورية

DEV.to

يستخرج تدوينات المطورين:
  • الوسوم، ردود الفعل، والتعليقات

Product Hunt

يستخرج صفحات المنتجات:
  • أوصاف المنتج ومعلومات الصانع
  • مواضيع النقاش

Stack Overflow

يستخرج محتوى الأسئلة والأجوبة:
  • عنوان السؤال، النص، الوسوم، وعدد الأصوات
  • الإجابة المقبولة (مميَّزة)
  • أفضل الإجابات مع عدد الأصوات

GitHub

يستخرج الـ Issues والـ Pull Requests بما في ذلك:
  • العنوان، الحالة (مفتوح/مغلق/مدموج)، والتصنيفات
  • الوصف/النص الأصلي
  • حتى 30 تعليقًا مع معلومات الكاتب
يستخدم واجهة REST API الخاصة بـ GitHub للبيانات المنظَّمة.

كيف تعمل المحوّلات

عند تحويل صفحة، يقوم Web2MD تلقائيًا بما يلي:
  1. اكتشاف الموقع من الرابط
  2. اختيار أفضل محوّل إن وُجد
  3. استخراج المحتوى باستخدام الطريقة الخاصة بالموقع
  4. الرجوع الاحتياطي إلى الاستخراج العام إذا فشل المحوّل
لست بحاجة لتهيئة أي شيء — تُطبَّق المحوّلات تلقائيًا.
محوّلات المواقع متاحة لجميع المستخدمين (Free وPro). تعمل قبل خط أنابيب التحويل الرئيسي، لذا تعمل بغض النظر عن خطتك.

المقارنة