Web Crawling API zur Umwandlung von Websites in Datensätze
Verwandeln Sie eine einzelne URL in einen Datensatz sauberer Seiten. Unser rekursiver Crawler berücksichtigt robots.txt, JavaScript-Rendering und Seitenlimits — ideal für RAG, KI-Training und Website-Migration.
Web Crawling API Playground
Crawlen Sie eine Website. Prüfen Sie strukturiertes JSON.
https://docs.olostep.com
Senden Sie eine URL, um einen Live-Crawl zu starten. Ein Crawl-Job läuft asynchron — dieses Playground fragt Status und Seiten ab, sobald sie verarbeitet werden.
{
"start_url": "https://docs.olostep.com",
"crawl_id": null,
"status": null,
"pages_count": 0,
"pages": []
}Entwicklererfahrung
Erstellen Sie einen Job. Fragen Sie den Status ab, bis er fertig ist.
Crawls laufen asynchron — starten Sie einen mit einer URL und einem Seitenlimit, fragen Sie dann den Status ab, bis er abgeschlossen ist, und listen Sie die gefundenen Seiten auf.
Vertraut von den besten Startups der Welt















Das Problem
Eine Website in nutzbare Daten umzuwandeln ist schwieriger, als es aussieht
Sie kennen nicht jede URL
Websites liefern keine vollständige Seitenliste — sie zu finden bedeutet, Links selbst zu verfolgen.
Moderne Websites brauchen einen Browser
Single-Page-Apps rendern Inhalte mit JavaScript, sodass ein einfacher HTTP-Abruf den Großteil der Seite verpasst.
Skalierung erfordert Warteschlangenverwaltung
Hunderte Seiten zu crawlen bedeutet Nebenläufigkeit, Wiederholungsversuche und Ratenbegrenzungen — leicht falsch zu machen.
Asynchroner Job, strukturierte Seiten
Crawl starten, Ergebnisse abfragen
Senden Sie eine Start-URL und ein Seitenlimit, fragen Sie den Job bis zum Abschluss ab und erhalten Sie eine saubere Liste jeder gefundenen Seite.
Funktionen
Gebaut, um ganze Websites zu erfassen — nicht nur einzelne Seiten
Rekursives Crawling
Starten Sie bei einer URL und folgen Sie Links über die gesamte Domain, bis zu einem von Ihnen festgelegten Seiten- oder Tiefenlimit.
JS-Rendering
Seiten werden mit einem echten Browser gerendert, sodass Single-Page-Apps und JavaScript-lastige Websites vollständig erfasst werden.
robots.txt wird respektiert
Crawls folgen standardmäßig robots.txt, sodass Sie sich an die angegebenen Crawling-Regeln einer Website halten.
Strukturierte Seitendaten
Jede gecrawlte Seite wird mit ihrer URL und einer retrieve_id für den Abruf des vollständigen Inhalts zurückgegeben.
Asynchrones Job-Modell
Starten Sie einen Crawl und fragen Sie den Status ab — keine lange gehaltene Verbindung, kein Timeout auf Ihrer Seite.
Batch-taugliche Workflows
Crawlen Sie viele Domains nach Zeitplan, um Datensätze und Wissensdatenbanken aktuell zu halten.
Anwendungsfälle
Verwandeln Sie jede Website in einen sauberen, nutzbaren Datensatz
RAG-Wissensdatenbanken
Erfassen Sie Dokumentation und Hilfecenter-Websites, um KI-Modelle mit echtem Inhalt zu fundieren.
SEO-Audits
Crawlen Sie eine Domain, um Struktur, Inhalt und Seitenabdeckung zu prüfen.
Content-Migration
Extrahieren Sie den gesamten Inhalt einer Website als saubere Seiten vor einer CMS- oder Plattformmigration.
Marktbeobachtung
Verfolgen Sie Websites von Wettbewerbern auf neue Seiten, Preis- oder Produktänderungen.
Site-Mapping
Verstehen Sie die Struktur und interne Verlinkung einer Domain vor einer tiefergehenden Analyse.
Offline-Datensätze
Erstellen Sie einen Snapshot des Inhalts einer Website für Training oder Analyse.
So funktioniert's
Von einer URL zu einem vollständigen Datensatz
Crawl starten
Senden Sie eine Start-URL, ein Seitenlimit und optionale Include-/Exclude-Muster. Erhalten Sie sofort eine Job-ID zurück.
Rekursives Durchsuchen
Olostep besucht Seiten, folgt Links und verarbeitet die Domain innerhalb Ihrer Limits.
Seiten abrufen
Fragen Sie den Status ab und listen Sie dann die gefundenen Seiten auf — jede mit einer retrieve_id für den vollständigen Inhalt.
Vergleich
Crawler intern bauen oder eine API nutzen?
Fundieren Sie Ihre KI auf einer ganzen Website, nicht nur einer Seite
Erfassen Sie Dokumentation, Hilfecenter und Wissensdatenbanken in einem Crawl — saubere Seiten, bereit für RAG-Pipelines, Trainingsdatensätze oder Migration.
Preise
Preise für die Web Crawling API
Starten Sie mit 500 kostenlosen Anfragen und skalieren Sie Crawls mit wachsendem Volumen.
Bestätigen Sie aktuelle Preise und Planlimits im Dashboard vor dem Kauf.
Häufig gestellte Fragen
Produkt & Funktionen
Nutzung & Automatisierung
Preise & Tarife