Olostep Crawl-Endpoint

Viele Seiten crawlen. Inhalte auf Abruf erhalten.

Der Crawl-Endpoint entdeckt und verarbeitet Unterseiten nach deinen Regeln — anschließend rufst du HTML oder Markdown pro Seite über retrieve ab.

So funktioniert's

Einen Crawl per POST mit start_url und Limits senden.

Status bis completed verfolgen.

Seiten auflisten und /v1/retrieve pro Seite aufrufen.

Das Vertrauen von Teams weltweit

Merchkit
Podqi
Khoj
Finny AI
Contents
Athena HQ
CivilGrid
GumLoop
Plots
Uman
Verisave
Relay
OpenMart
Profound
Centralize
Use Bear
Merchkit
Podqi
Khoj
Finny AI
Contents
Athena HQ
CivilGrid
GumLoop
Plots
Uman
Verisave
Relay
OpenMart
Profound
Centralize
Use Bear
Merchkit
Podqi
Khoj
Finny AI
Contents
Athena HQ
CivilGrid
GumLoop
Plots
Uman
Verisave
Relay
OpenMart
Profound
Centralize
Use Bear
Merchkit
Podqi
Khoj
Finny AI
Contents
Athena HQ
CivilGrid
GumLoop
Plots
Uman
Verisave
Relay
OpenMart
Profound
Centralize
Use Bear

Von der Start-URL zu vielen Seiten

Orchestriere mehrseitige Extraktion, ohne einen eigenen Crawler zu bauen.

  • Step 1

    Einen Crawl starten

    Sende start_url per POST mit include_urls, exclude_urls, max_pages und optionalem max_depth.

  • Step 2

    Abfragen oder Webhook

    Frage GET /v1/crawls/{id} ab, bis der Status completed ist, oder übergib webhook_url für eine Push-Benachrichtigung.

  • Step 3

    Seiten auflisten & abrufen

    Paginiere GET /v1/crawls/{id}/pages, hole dann jede retrieve_id über /v1/retrieve für Markdown oder HTML.

POST /v1/crawls

{
  "start_url": "https://example.com",
  "max_pages": 100,
  "include_urls": ["/**"],
  "exclude_urls": ["/admin/**"]
}

Für mehrseitige Jobs gebaut

Die /v1/crawls-API liegt zwischen einzelnen Scrapes und großen Batch-URL-Listen.

  • Begrenzte Erkundung

    Steuere depth und max_pages, damit Crawls vorhersehbar bleiben.

  • Webhooks

    Optionale webhook_url bei Abschluss des Crawls.

  • Cursor-Paginierung

    Streame Seiten, während der Crawl läuft oder nach Abschluss.

  • Retrieve-Pipeline

    Kombiniere Crawls mit /v1/retrieve für die Formate Markdown, HTML oder JSON.

Was du bauen kannst

Website-Spiegel erstellen, Datensätze aufbauen und Recherche-Agenten antreiben.

  • Dokumentations-Spiegel

    Rufe jede Doku-Seite für Offline-Suche oder RAG ab.

  • E-Commerce-Kataloge

    Crawle Produktbereiche mit Include-Mustern.

  • Compliance-Archive

    Erstelle Snapshots vieler Seiten einer Domain mit Audit-Metadaten.

Mehrseitige Extraktion

Crawl starten. Abfragen. Seiten auflisten.

Nutze Webhooks für Abschlusssignale; paginiere Seiten mit cursor und limit.

AnfragePOST /v1/crawls
{
  "start_url": "https://sugarbooandco.com",
  "max_pages": 100,
  "include_urls": ["/**"],
  "exclude_urls": ["/collections/**"],
  "include_external": false
}
Antwort200 OK
{
  "id": "crawl_…",
  "object": "crawl",
  "status": "in_progress",
  "start_url": "https://sugarbooandco.com",
  "pages_count": 0
}

Häufig gestellte Fragen

Produkt & Funktionen

  • Er durchläuft eine Website (innerhalb deiner Limits) und liefert Seiteneinträge zurück, die du später mit /v1/retrieve abrufen kannst — ideal für mehrseitige Extraktion, ohne jede URL selbst zu orchestrieren.

  • Liste Seiten über /v1/crawls/{id}/pages auf und rufe dann /v1/retrieve mit der retrieve_id jeder Seite auf. Bevorzuge retrieve gegenüber den veralteten Inline-Content-Feldern auf Seiten.

Nutzung & Automatisierung

  • Ja. Nutze die Glob-Muster include_urls und exclude_urls, search_query, top_n und verwandte Parameter wie dokumentiert.

Preise & Tarife

  • Crawl wird pro gecrawlter Seite abgerechnet (aktuelle Preise siehe Dokumentation).

Starte das Crawling mit Olostep

500 kostenlose Credits zum Ausprobieren
Keine Kreditkarte erforderlich.

Crawl Endpoint | Mehrseitiges Web-Crawling | Olostep