Rekursives Crawling, strukturiert

Web Crawling API zur Umwandlung von Websites in Datensätze

Verwandeln Sie eine einzelne URL in einen Datensatz sauberer Seiten. Unser rekursiver Crawler berücksichtigt robots.txt, JavaScript-Rendering und Seitenlimits — ideal für RAG, KI-Training und Website-Migration.

Keine Kreditkarte500 kostenlose AnfragenNo-Code-freundlich

Web Crawling API Playground

Crawlen Sie eine Website. Prüfen Sie strukturiertes JSON.

Live-Crawl

https://docs.olostep.com

Senden Sie eine URL, um einen Live-Crawl zu starten. Ein Crawl-Job läuft asynchron — dieses Playground fragt Status und Seiten ab, sobald sie verarbeitet werden.

Strukturierte JSON-Daten
{
  "start_url": "https://docs.olostep.com",
  "crawl_id": null,
  "status": null,
  "pages_count": 0,
  "pages": []
}

Entwicklererfahrung

Erstellen Sie einen Job. Fragen Sie den Status ab, bis er fertig ist.

Crawls laufen asynchron — starten Sie einen mit einer URL und einem Seitenlimit, fragen Sie dann den Status ab, bis er abgeschlossen ist, und listen Sie die gefundenen Seiten auf.

REST APIAPI-Schlüssel-AuthentifizierungAsynchroner Job + Statusabfragerobots.txt wird berücksichtigtJavaScript-RenderingWebhook-Benachrichtigungen
Dokumentation lesen
# 1. Start the crawl
curl --request POST \
  --url https://api.olostep.com/v1/crawls \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "start_url": "https://docs.olostep.com",
    "max_pages": 5,
    "include_urls": ["/**"]
  }'

# 2. Poll for status (repeat until status is "completed")
curl --url https://api.olostep.com/v1/crawls/CRAWL_ID \
  --header 'Authorization: Bearer YOUR_API_KEY'

# 3. List crawled pages
curl --url 'https://api.olostep.com/v1/crawls/CRAWL_ID/pages?cursor=0&limit=25' \
  --header 'Authorization: Bearer YOUR_API_KEY'

Vertraut von den besten Startups der Welt

Das Problem

Eine Website in nutzbare Daten umzuwandeln ist schwieriger, als es aussieht

Sie kennen nicht jede URL

Websites liefern keine vollständige Seitenliste — sie zu finden bedeutet, Links selbst zu verfolgen.

Moderne Websites brauchen einen Browser

Single-Page-Apps rendern Inhalte mit JavaScript, sodass ein einfacher HTTP-Abruf den Großteil der Seite verpasst.

Skalierung erfordert Warteschlangenverwaltung

Hunderte Seiten zu crawlen bedeutet Nebenläufigkeit, Wiederholungsversuche und Ratenbegrenzungen — leicht falsch zu machen.

Asynchroner Job, strukturierte Seiten

Crawl starten, Ergebnisse abfragen

Senden Sie eine Start-URL und ein Seitenlimit, fragen Sie den Job bis zum Abschluss ab und erhalten Sie eine saubere Liste jeder gefundenen Seite.

Rekursive ErkennungSeiten- und TiefenlimitsURL-Include-/Exclude-Glob-MusterWebhook bei Abschlussrobots.txt wird respektiertVollständiger Seiteninhalt auf Anfrage
{
  "id": "crawl_20tyuvpx78",
  "status": "completed",
  "pages_count": 3,
  "pages": [
    { "url": "https://example.com/", "retrieve_id": "ftfky1o5lo" },
    { "url": "https://example.com/docs", "retrieve_id": "gr427f2yny" }
  ]
}

Funktionen

Gebaut, um ganze Websites zu erfassen — nicht nur einzelne Seiten

Rekursives Crawling

Starten Sie bei einer URL und folgen Sie Links über die gesamte Domain, bis zu einem von Ihnen festgelegten Seiten- oder Tiefenlimit.

JS-Rendering

Seiten werden mit einem echten Browser gerendert, sodass Single-Page-Apps und JavaScript-lastige Websites vollständig erfasst werden.

robots.txt wird respektiert

Crawls folgen standardmäßig robots.txt, sodass Sie sich an die angegebenen Crawling-Regeln einer Website halten.

Strukturierte Seitendaten

Jede gecrawlte Seite wird mit ihrer URL und einer retrieve_id für den Abruf des vollständigen Inhalts zurückgegeben.

Asynchrones Job-Modell

Starten Sie einen Crawl und fragen Sie den Status ab — keine lange gehaltene Verbindung, kein Timeout auf Ihrer Seite.

Batch-taugliche Workflows

Crawlen Sie viele Domains nach Zeitplan, um Datensätze und Wissensdatenbanken aktuell zu halten.

Anwendungsfälle

Verwandeln Sie jede Website in einen sauberen, nutzbaren Datensatz

RAG-Wissensdatenbanken

Erfassen Sie Dokumentation und Hilfecenter-Websites, um KI-Modelle mit echtem Inhalt zu fundieren.

SEO-Audits

Crawlen Sie eine Domain, um Struktur, Inhalt und Seitenabdeckung zu prüfen.

Content-Migration

Extrahieren Sie den gesamten Inhalt einer Website als saubere Seiten vor einer CMS- oder Plattformmigration.

Marktbeobachtung

Verfolgen Sie Websites von Wettbewerbern auf neue Seiten, Preis- oder Produktänderungen.

Site-Mapping

Verstehen Sie die Struktur und interne Verlinkung einer Domain vor einer tiefergehenden Analyse.

Offline-Datensätze

Erstellen Sie einen Snapshot des Inhalts einer Website für Training oder Analyse.

So funktioniert's

Von einer URL zu einem vollständigen Datensatz

01

Crawl starten

Senden Sie eine Start-URL, ein Seitenlimit und optionale Include-/Exclude-Muster. Erhalten Sie sofort eine Job-ID zurück.

02

Rekursives Durchsuchen

Olostep besucht Seiten, folgt Links und verarbeitet die Domain innerhalb Ihrer Limits.

03

Seiten abrufen

Fragen Sie den Status ab und listen Sie dann die gefundenen Seiten auf — jede mit einer retrieve_id für den vollständigen Inhalt.

Vergleich

Crawler intern bauen oder eine API nutzen?

Anforderung
Intern bauen
API nutzen
Link-Erkennung
Einen Spider schreiben
Eine Start-URL festlegen
JS-Rendering
Headless-Browser selbst betreiben
Automatisch gehandhabt
Ratenbegrenzung & Wiederholungen
Warteschlangen-Infrastruktur bauen
Für Sie verwaltet
robots.txt-Handling
Implementieren und pflegen
Standardmäßig respektiert
Seitenlimits & Filter
Eigene Logik
max_pages, include/exclude
Entwicklungszeit
Hohe laufende Kosten
Eine Anfrage plus Statusabfragen

Fundieren Sie Ihre KI auf einer ganzen Website, nicht nur einer Seite

Erfassen Sie Dokumentation, Hilfecenter und Wissensdatenbanken in einem Crawl — saubere Seiten, bereit für RAG-Pipelines, Trainingsdatensätze oder Migration.

Preise

Preise für die Web Crawling API

Starten Sie mit 500 kostenlosen Anfragen und skalieren Sie Crawls mit wachsendem Volumen.

Starter

$9/ Monat

Für Tests, Prototypen und kleine Crawls.

  • Alles aus Free
  • 5.000 erfolgreiche Anfragen
  • 150 gleichzeitige Anfragen

Standard

$99/ Monat

Für wiederkehrende Crawls und Wissensdatenbanken.

  • Alles aus Starter
  • 200.000 erfolgreiche Anfragen
  • 500 gleichzeitige Anfragen

Scale

$399/ Monat

Für Plattformen mit hohem Volumen und Enterprise-Workflows.

  • Alles aus Standard
  • 1 Million erfolgreiche Anfragen
  • KI-gestützte Browser-Automatisierungen

Bestätigen Sie aktuelle Preise und Planlimits im Dashboard vor dem Kauf.

Häufig gestellte Fragen

Produkt & Funktionen

Eine Web Crawling API startet bei einer URL und folgt rekursiv Links über eine Website hinweg, wobei der Inhalt jeder besuchten Seite zurückgegeben wird — bis zu einem von Ihnen festgelegten Seiten- oder Tiefenlimit.

Scraping extrahiert Daten von einer einzelnen, bekannten URL. Crawling startet bei einer URL und entdeckt automatisch weitere Seiten der Website, sodass Sie nicht im Voraus die vollständige URL-Liste benötigen.

Ja. Seiten werden mit einem echten Browser gerendert, bevor der Inhalt erfasst wird, sodass Single-Page-Apps mit React, Next.js und ähnlichen Frameworks korrekt verarbeitet werden.

Nutzung & Automatisierung

Ja, standardmäßig. Dies kann außer Kraft gesetzt werden, wenn Sie die Berechtigung haben, eine Website umfassender zu crawlen.

Fragen Sie den Status-Endpoint des Crawls ab, bis status auf completed steht, oder geben Sie eine webhook_url an, um automatisch benachrichtigt zu werden.

Ja. Legen Sie max_pages und max_depth fest, um den Crawl zu begrenzen, und nutzen Sie include_urls- / exclude_urls-Glob-Muster, um gezielt bestimmte Bereiche einer Website anzusteuern.

Jede Seite in den Crawl-Ergebnissen enthält eine retrieve_id — verwenden Sie diese mit dem retrieve-Endpoint, um den vollständigen HTML- oder Markdown-Inhalt dieser Seite abzurufen.

Preise & Tarife

Die Abrechnung basiert auf erfolgreich verarbeiteten Seiten — ein Crawl mit 50 Seiten zählt als 50 Anfragen gegenüber Ihrem Plan.

Nein, nur erfolgreich verarbeitete Seiten werden abgerechnet.

Ja, 500 kostenlose Anfragen bei der Anmeldung — genug, um mehrere kleine Websites zu crawlen oder die API zu testen.

Erfassen Sie den Inhalt einer Website, ohne Crawling-Infrastruktur zu betreiben

Starten Sie mit einer URL und verbinden Sie saubere, strukturierte Seiten mit Ihren RAG-, Trainings-, Migrations- oder Recherche-Workflows.

Crawl Website Content | Turn Websites into Datasets | Olostep