> ## Documentation Index
> Fetch the complete documentation index at: https://web2md.org/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# サイトアダプター

> Reddit、GitHub、YouTube、Hacker News、arXiv、Medium など、16 の人気プラットフォームに最適化されたコンテンツ抽出。

## 概要

Web2MD はあらゆる Web ページで動作しますが、一部のサイトでは専用の抽出ロジックを使うとより良い結果が得られます。Web2MD には **16 のプラットフォーム専用エクストラクター**が組み込まれており、各プラットフォームの API や DOM 構造を利用して、汎用抽出よりも高品質な Markdown を生成します。

<Frame>
  <img src="https://mintcdn.com/web2md/qOtwQjeH2QQiHWtp/images/site-adapters.png?fit=max&auto=format&n=qOtwQjeH2QQiHWtp&q=85&s=129e33379869863c7e80ea6db4c585d4" alt="Site-specific adapters" width="1280" height="800" data-path="images/site-adapters.png" />
</Frame>

## 対応サイト

### API ベース(タブ不要)

これらのエクストラクターはプラットフォームの API から直接データを取得するため、アクティブなブラウザタブがなくても動作します。

#### Reddit

投稿の全内容を抽出します:

* 投稿タイトル、投稿者、サブレディット、スコア
* セルフテキストまたはリンクの内容
* 最大 **200 件のコメント**(4 階層のネスト、投稿者とスコア付き)
* 画像とメディアのリンク

Reddit の JSON API(`/.json`)を利用して確実に抽出します。

#### Hacker News

Algolia API 経由でディスカッションスレッド全体を抽出します:

* 投稿タイトル、URL、ポイント、コメント数
* 投稿者とネスト構造付きの全コメント

#### arXiv

研究論文を抽出します:

* 論文タイトル、著者、アブストラクト
* 研究論文の HTML 全文

#### YouTube

動画のメタデータを抽出します:

* 動画タイトルとチャンネル名
* 再生時間と視聴回数
* 英語字幕・キャプション(利用可能な場合)

#### Twitter / X

ツイート内容を抽出します:

* ツイートのテキストとメディア
* 投稿者情報とエンゲージメント指標

### DOM ベース(ブラウザタブが必要)

これらのエクストラクターは、アクティブなタブ内でページの DOM を解析して構造化コンテンツを取得します。

#### OpenAI Docs

OpenAI のドキュメントサイトからドキュメントページを抽出します:

* コードブロックと API リファレンス
* 構造化されたナビゲーションとコンテンツ階層

#### Claude Chat

Claude.ai のチャットインターフェースから会話内容を抽出します。

#### Notion

公開ページおよびログイン済みの Notion ページ(notion.so、notion.site)からコンテンツを抽出します:

* 二段構えの抽出:ブロック単位の DOM 解析(`data-block-id`)とコンテナへのフォールバック
* 見出し、テキスト、コードブロック、リスト、トグル、コールアウト、引用
* 画像、テーブル、ブックマーク、埋め込み

#### Feishu / Lark

Feishu Docx および Wiki ページ(feishu.cn、larksuite.com)からコンテンツを抽出します:

* 二段構えの抽出:PageMain ブロックモデルと DOM へのフォールバック
* 見出し、テキスト、コードブロック、リスト、テーブル、画像
* コールアウトとチェックボックス

#### Medium

Medium の DOM から記事コンテンツを抽出します:

* 著者、公開日、読了時間
* 記事の全文

#### Substack

ニュースレター記事を抽出します:

* 著者、日付、記事の全文

#### Wikipedia

記事コンテンツを抽出します:

* セクション、テーブル、参考文献
* ナビゲーションやサイドバーのノイズを除去

#### DEV.to

開発者向けブログ記事を抽出します:

* タグ、リアクション、コメント

#### Product Hunt

プロダクトページを抽出します:

* プロダクトの説明とメーカー情報
* ディスカッションスレッド

#### Stack Overflow

Q\&A コンテンツを抽出します:

* 質問のタイトル、本文、タグ、投票数
* 採用された回答(ハイライト表示)
* 投票数付きの上位回答

#### GitHub

Issue と Pull Request を抽出します:

* タイトル、ステータス(open/closed/merged)、ラベル
* 元の説明・本文
* 最大 **30 件のコメント**(投稿者情報付き)

GitHub の REST API を利用して構造化データを取得します。

## アダプターの仕組み

ページを変換すると、Web2MD は自動的に次の処理を行います。

1. URL から**サイトを検出**する
2. 対応するアダプターがあれば**最適なアダプターを選択**する
3. サイト固有の方法で**コンテンツを抽出**する
4. アダプターが失敗した場合は汎用抽出に**フォールバック**する

設定は一切不要です。アダプターは自動的に適用されます。

<Info>
  サイトアダプターはすべてのユーザー(Free / Pro)が利用できます。メインの変換パイプラインより前に実行されるため、プランに関係なく動作します。
</Info>

## 比較

| 項目       | 汎用抽出           | サイトアダプター               |
| -------- | -------------- | ---------------------- |
| コンテンツの精度 | 記事には良好         | サイト構造に最適化              |
| コメント・返信  | 抽出されない         | 含まれる(Reddit、GitHub、SO) |
| メタデータ    | 基本のみ(タイトル、URL) | 豊富(著者、スコア、ステータス)       |
| メディア     | 画像のみ           | 動画、字幕、埋め込み             |
| 信頼性      | ページ構造に依存       | 安定した API を利用           |
