Scelto dalle migliori startup startup al mondo
Da un URL di partenza a molte pagine
Orchestri l'estrazione multipagina senza creare un crawler proprio.
-
Avviare un crawling
Invii in POST start_url con include_urls, exclude_urls, max_pages e, facoltativamente, max_depth.
-
Polling o webhook
Interroghi GET /v1/crawls/{id} finché lo stato non è completed, oppure passi webhook_url per ricevere una notifica push.
-
Elencare e recuperare le pagine
Scorra i risultati paginati di GET /v1/crawls/{id}/pages, poi recuperi ogni retrieve_id tramite /v1/retrieve in markdown o HTML.
Pensato per job multipagina
L'API /v1/crawls si colloca tra gli scrape singoli e gli enormi elenchi di URL in batch.
-
Esplorazione delimitata
Controlli profondità e max_pages perché i crawl restino prevedibili.
-
Webhook
webhook_url facoltativo al completamento del crawl.
-
Paginazione a cursore
Riceva le pagine in streaming mentre il crawl è in corso o dopo il completamento.
-
Pipeline di retrieve
Abbini i crawl a /v1/retrieve per i formati markdown, html o json.
Avvii un crawl. Interroghi lo stato. Elenchi le pagine.
Utilizzi i webhook per i segnali di completamento; scorra le pagine con cursor e limit.
Esegua il crawling di tutte le sottopagine
1# pip install olostep
2from olostep import Olostep
3
4client = Olostep(api_key="YOUR_REAL_KEY")
5
6crawl = client.crawls.create(
7 start_url="https://olostep.com",
8 max_pages=100,
9 include_urls=["/**"],
10 exclude_urls=["/collections/**"],
11 include_external=False,
12)
13
14print(crawl.id, crawl.status)
15
16# Wait for completion and iterate pages
17for page in crawl.pages():
18 print(page.url)
19 content = page.retrieve(["markdown"])
20 print(content.markdown_content[:200])
1// npm i olostep
2import Olostep from 'olostep'
3
4const client = new Olostep({ apiKey: 'YOUR_REAL_KEY' })
5
6const crawl = await client.crawls.create({
7 url: 'https://olostep.com',
8 maxPages: 100,
9 includeUrls: ['/**'],
10 excludeUrls: ['/collections/**'],
11 includeExternal: false,
12})
13
14console.log(crawl.id, crawl.status)
15
16// Wait for completion and iterate pages
17for await (const page of crawl.pages()) {
18 console.log(page.url)
19 const content = await client.retrieve({ retrieveId: page.retrieve_id, formats: ['markdown'] })
20 console.log(content.markdown_content.slice(0, 200))
21}
1# Start crawl
2curl -s -X POST "https://api.olostep.com/v1/crawls" \
3 -H "Authorization: Bearer <YOUR_API_KEY>" \
4 -H "Content-Type: application/json" \
5 -d '{
6 "start_url": "https://olostep.com",
7 "max_pages": 100,
8 "include_urls": ["/**"],
9 "exclude_urls": ["/collections/**"],
10 "include_external": false
11 }'
12
13# Check status (replace <CRAWL_ID>)
14curl -s "https://api.olostep.com/v1/crawls/<CRAWL_ID>" \
15 -H "Authorization: Bearer <YOUR_API_KEY>"
16
17# Get pages (replace <CRAWL_ID>)
18curl -s "https://api.olostep.com/v1/crawls/<CRAWL_ID>/pages" \
19 -H "Authorization: Bearer <YOUR_API_KEY>"
20
21# Retrieve content (replace <RETRIEVE_ID>)
22curl -s -G "https://api.olostep.com/v1/retrieve" \
23 -H "Authorization: Bearer <YOUR_API_KEY>" \
24 --data-urlencode "retrieve_id=<RETRIEVE_ID>" \
25 --data-urlencode "formats=markdown"
Cosa può realizzare
Alimenti arricchimento dei dati, monitoraggio e workflow di IA con pagine web in tempo reale.
-
Copie della documentazione
Recuperi ogni pagina della documentazione per la ricerca offline o la RAG.
-
Cataloghi e-commerce
Esegua il crawling delle sezioni prodotto con pattern di inclusione.
-
Archivi di conformità
Acquisisca snapshot di molte pagine di un dominio con metadati di audit.
Scelto da team straordinari che stanno creando il futuro dell'IA
-
Michelle JuliaCo-founder & CEO AuriumOlostep è il migliore!!! Abbiamo automatizzato intere pipeline di dati con un semplice prompt
-
Richard HeCo-founder & CEO OpenmartOlostep è diventato l'infrastruttura di riferimento per il livello web della nostra azienda
-
Max Brodeur-UrbasCo-founder & CEO GumloopOlostep funziona alla perfezione! E il vostro servizio clienti è eccezionale
-
Rob HayesCo-founder MerchkitOlostep ci permette di trasformare qualsiasi sito web in un'API. Ottimo prodotto, persone fantastiche
-
Brandon CohenCo-founder & CTO CivilGridConsiglio vivamente Olostep, ottimo prodotto!
-
Co-founder & CEO Gedd.itVerifichiamo codici coupon su larga scala. Adoriamo Olostep. Funziona su qualsiasi e-commerce
-
Trevor WestCo-founder & CEO PodqiOlostep è la migliore API per cercare, estrarre e strutturare dati dal web. Siamo felici di essere clienti
-
Rida NaveedCo-founder ZecentoUsiamo /batches insieme ai parser ed è magico come riusciamo a ottenere dati strutturati su larga scala
-
Kieran V.Growth PlotsEventsOlostep ci ha permesso di cercare e strutturare dati sugli eventi in tutto il web
-
Paul MitFounder FoundbaseAPI affidabile e conveniente per lavorare con i dati. Complimenti per l'ottimo prodotto
Iniziare il crawling con Olostep
Ottenga dati puliti per la sua IA da qualsiasi sito web con Olostep
L'API più conveniente. Progettata per scalare