doc-scraper: LLMのためのローカルドキュメントコンテキストを構築するGoクローラー
doc-scraperは、Sriram PRによって開発され、技術的なウェブサイトのドキュメントを収集し、AI支援ワークフローのために準備します。このアプリはドキュメントサイトをクロールし、モデルコンテキストとして使用するために最適化された読みやすいコンテンツを抽出します。開発者やAI研究者を対象としています。クリーンで検索可能な出力とローカル知識ストアを重視しており、エディタベースのアシスタントがプロンプト構築中にノイズの多いウェブページを引き出すことなく、関連する参考資料にアクセスできるようにしています。
サイトのHTMLをモデルコンテキストに適した構造化されたMarkdownに変換します
このツールは、ナビゲーションバー、フッター、その他の非コンテンツの装飾を削除し、ドキュメントHTMLを構造化されたMarkdownに変換するGoベースのクローラーです。変換は見出しとインラインコードを保持し、テキストのノイズを減らし、クリーンな見出しとリンクを通じてナビゲーションコンテキストを保持するコンパクトなコーパスファイルを生成し、下流のモデルワークフローによる容易な取得と参照を可能にします。
検索可能性と変更検出により、コーパスはエージェントにとって信頼性があります
アプリは、オフラインのBM25検索をSQLite FTS5を介して実装し、インターネットアクセスなしでクロールされたコーパスに対してローカルクエリを可能にします。BadgerDBとSQLiteによる状態の永続性は、再開可能な操作と履歴インデックスをサポートします。コンテンツを意識したdiffメカニズムは、タイムスタンプのみに依存せずに実際のページの変更を特定し、冗長なダウンロードを減らし、ローカルコーパスを実質的な編集に集中させます。
入力パターンとクロール制限が成功を定義します
doc-scraperは、Docusaurus、MkDocs、Sphinx、GitBook、ReadTheDocsなどのドキュメントフレームワークを自動的に検出し、未知のサイトでは可読性に基づく抽出器を使用します。クロールは共有リソース管理と組み込みのレート制限で並行して実行され、クローラーはrobots.txtを尊重して礼儀正しさを保ちます。これらの境界は、過剰なネットワーク負荷を避けながら、開発者に関連するコンテンツの抽出を優先します。
ローカルMCPホスティングはエディター中心のAIワークフローとプライバシーのニーズに適合します
サーバーモードで実行されると、アプリはモデルコンテキストプロトコルサーバーとして機能し、ローカルAIエージェントがエディター内でドキュメントを読み取り、検索できるようにします。ローカルでオフラインの知識ベース設計は、Claude Desktop、Claude Code、Cursorなどのエージェントに検索可能なドキュメントを提供し、リモート取得への依存を減らします。このツールは、他のスクレイパーが苦労するサイトでクリーンな出力を生成することで、GoおよびAI開発者コミュニティで注目されています。
ローカルコンテキストを構築およびホストできる技術的に熟練した開発者に最適
doc-scraperは、検証可能でローカルにホストされたドキュメントをモデルコンテキストとして必要とする開発者や研究者にとって実用的な選択肢です。このツールはGo(バージョン1.25以上)からソースをビルドする必要があるため、技術的に能力のあるユーザーを好みます。Goプロジェクトをコンパイルできないチームは、セットアップのオーバーヘッドを期待すべきです。ユーザーは、権威あるモデル入力として使用する前に、スクレイピングされたパッセージを検査する必要があります。





