Fare clic per provare
Attendere...

Crawling di molte pagine.
Contenuti su richiesta.

L'endpoint Crawl individua ed elabora le sottopagine secondo le regole impostate da lei; poi può recuperare l'HTML o il markdown di ogni pagina tramite retrieve.

Grazie! Abbiamo ricevuto la sua richiesta.
Ops! Si è verificato un errore durante l'invio del modulo.

Scelto dalle migliori startup startup al mondo

Pensato per job multipagina

L'API /v1/crawls si colloca tra gli scrape singoli e gli enormi elenchi di URL in batch.

  • Esplorazione delimitata

    Controlli profondità e max_pages perché i crawl restino prevedibili.

  • Webhook

    webhook_url facoltativo al completamento del crawl.

  • Paginazione a cursore

    Riceva le pagine in streaming mentre il crawl è in corso o dopo il completamento.

  • Pipeline di retrieve

    Abbini i crawl a /v1/retrieve per i formati markdown, html o json.

Avvii un crawl. Interroghi lo stato. Elenchi le pagine.

Utilizzi i webhook per i segnali di completamento; scorra le pagine con cursor e limit.

Esegua il crawling di tutte le sottopagine

1# pip install olostep
2from olostep import Olostep
3
4client = Olostep(api_key="YOUR_REAL_KEY")
5
6crawl = client.crawls.create(
7    start_url="https://olostep.com",
8    max_pages=100,
9    include_urls=["/**"],
10    exclude_urls=["/collections/**"],
11    include_external=False,
12)
13
14print(crawl.id, crawl.status)
15
16# Wait for completion and iterate pages
17for page in crawl.pages():
18    print(page.url)
19    content = page.retrieve(["markdown"])
20    print(content.markdown_content[:200])
1// npm i olostep
2import Olostep from 'olostep'
3
4const client = new Olostep({ apiKey: 'YOUR_REAL_KEY' })
5
6const crawl = await client.crawls.create({
7  url: 'https://olostep.com',
8  maxPages: 100,
9  includeUrls: ['/**'],
10  excludeUrls: ['/collections/**'],
11  includeExternal: false,
12})
13
14console.log(crawl.id, crawl.status)
15
16// Wait for completion and iterate pages
17for await (const page of crawl.pages()) {
18  console.log(page.url)
19  const content = await client.retrieve({ retrieveId: page.retrieve_id, formats: ['markdown'] })
20  console.log(content.markdown_content.slice(0, 200))
21}
1# Start crawl
2curl -s -X POST "https://api.olostep.com/v1/crawls" \
3  -H "Authorization: Bearer <YOUR_API_KEY>" \
4  -H "Content-Type: application/json" \
5  -d '{
6    "start_url": "https://olostep.com",
7    "max_pages": 100,
8    "include_urls": ["/**"],
9    "exclude_urls": ["/collections/**"],
10    "include_external": false
11  }'
12
13# Check status (replace <CRAWL_ID>)
14curl -s "https://api.olostep.com/v1/crawls/<CRAWL_ID>" \
15  -H "Authorization: Bearer <YOUR_API_KEY>"
16
17# Get pages (replace <CRAWL_ID>)
18curl -s "https://api.olostep.com/v1/crawls/<CRAWL_ID>/pages" \
19  -H "Authorization: Bearer <YOUR_API_KEY>"
20
21# Retrieve content (replace <RETRIEVE_ID>)
22curl -s -G "https://api.olostep.com/v1/retrieve" \
23  -H "Authorization: Bearer <YOUR_API_KEY>" \
24  --data-urlencode "retrieve_id=<RETRIEVE_ID>" \
25  --data-urlencode "formats=markdown"

Cosa può realizzare

Alimenti arricchimento dei dati, monitoraggio e workflow di IA con pagine web in tempo reale.

  • Copie della documentazione

    Recuperi ogni pagina della documentazione per la ricerca offline o la RAG.

  • Cataloghi e-commerce

    Esegua il crawling delle sezioni prodotto con pattern di inclusione.

  • Archivi di conformità

    Acquisisca snapshot di molte pagine di un dominio con metadati di audit.

Esplorare altri casi d'uso

Scelto da team straordinari che stanno creando il futuro dell'IA

  • Michelle Julia
    Co-founder & CEO Aurium

    Olostep è il migliore!!! Abbiamo automatizzato intere pipeline di dati con un semplice prompt

  • Richard He
    Co-founder & CEO Openmart

    Olostep è diventato l'infrastruttura di riferimento per il livello web della nostra azienda

  • Max Brodeur-Urbas
    Co-founder & CEO Gumloop

    Olostep funziona alla perfezione! E il vostro servizio clienti è eccezionale

  • Rob Hayes
    Co-founder Merchkit

    Olostep ci permette di trasformare qualsiasi sito web in un'API. Ottimo prodotto, persone fantastiche

  • Brandon Cohen
    Co-founder & CTO CivilGrid

    Consiglio vivamente Olostep, ottimo prodotto!

  • Co-founder & CEO Gedd.it

    Verifichiamo codici coupon su larga scala. Adoriamo Olostep. Funziona su qualsiasi e-commerce

  • Trevor West
    Co-founder & CEO Podqi

    Olostep è la migliore API per cercare, estrarre e strutturare dati dal web. Siamo felici di essere clienti

  • Rida Naveed
    Co-founder Zecento

    Usiamo /batches insieme ai parser ed è magico come riusciamo a ottenere dati strutturati su larga scala

  • Kieran V.
    Growth PlotsEvents

    Olostep ci ha permesso di cercare e strutturare dati sugli eventi in tutto il web

  • Paul Mit
    Founder Foundbase

    API affidabile e conveniente per lavorare con i dati. Complimenti per l'ottimo prodotto

Iniziare il crawling con Olostep

Ottenga dati puliti per la sua IA da qualsiasi sito web con Olostep
L'API più conveniente. Progettata per scalare

È un agente IA? Ecco da dove iniziare

Domande frequenti

Prodotto e funzionalità
  • A cosa serve l'endpoint Crawl?

    Percorre un sito (entro i limiti da lei impostati) e restituisce record di pagina che potrà recuperare in seguito con /v1/retrieve: ideale per l'estrazione multipagina senza dover orchestrare ogni singolo URL.

  • Come ottengo il contenuto delle pagine?

    Elenchi le pagine da /v1/crawls/{id}/pages, poi chiami /v1/retrieve con il retrieve_id di ciascuna pagina. Preferisca retrieve ai campi di contenuto inline delle pagine, ormai deprecati.

Utilizzo e automazione
  • Posso filtrare gli URL sottoposti a crawling?

    Sì. Utilizzi i glob include_urls ed exclude_urls, search_query, top_n e i parametri correlati indicati nella documentazione.

Prezzi e piani
  • Quanto costa il crawling?

    Il crawling viene fatturato per pagina elaborata (consulti i prezzi aggiornati nella documentazione).