Changelog

In evidenza

Estrarre ora, analizzare dopo

La maggior parte delle API di dati web considera i risultati come effimeri. Si invia una richiesta, si riceve la risposta e i dati scompaiono nel giro di poche ore. Funziona per le ricerche in tempo reale, ma non regge più nel momento in cui quei dati le servono di nuovo.

Dai team ci arrivava sempre la stessa richiesta: "Vogliamo analizzare i cambiamenti del web nel lungo periodo senza dover pensare allo storage come a un'infrastruttura separata"

Oggi presentiamo il parametro storage: un modo semplice per conservare i risultati delle sue estrazioni per tutto il tempo necessario e mantenere il pieno controllo sul ciclo di vita dei suoi dati.

Infrastruttura per il secondo utente del web

Come funziona

Passi un oggetto storage nella richiesta per controllare la conservazione:

{
  "url": "https://example.com/product/reviews",
  "formats": ["markdown"],
  "storage": {
    "expires_in": "90d"
  }
}

Valori supportati: 10d, 30d, 60d, 90d, 180d, 365d oppure never per una conservazione illimitata. Senza il parametro si applica la conservazione predefinita di circa 7 giorni.

Nessuna configurazione aggiuntiva. Nessun servizio di storage separato. I suoi dati restano accessibili tramite la stessa API che già utilizza.

I suoi dati come risorsa

Il vero valore dei dati web raramente deriva da una singola estrazione. Deriva dall'accumulo: disporre di settimane, mesi o trimestri di dati strutturati da interrogare, confrontare e analizzare.

Analisi dei dati nel tempo. Quando conserva i suoi risultati, non sta solo archiviando pagine: sta creando un dataset. Può monitorare come cambiano le recensioni di un prodotto dopo un lancio, come evolvono i prezzi in un mercato, come gli annunci di lavoro rivelano la strategia di un concorrente. Lo storage persistente trasforma estrazioni isolate in serie temporali il cui valore cresce nel tempo.

Pieno controllo sul ciclo di vita dei dati. È lei a decidere cosa resta, per quanto tempo e quando viene eliminato. Nessuna preoccupazione che i dati scompaiano prima che il suo team li abbia elaborati. Che le servano finestre di 30 giorni per i flussi operativi o una conservazione illimitata per analisi di lungo periodo, le regole le stabilisce lei. I suoi dati, i suoi tempi.

Conformità e verificabilità. Alcuni settori (fintech, sanità, assicurazioni) richiedono di conservare le prove di quali dati sono stati raccolti e quando. Che si tratti di richieste di accesso ai sensi del GDPR, di audit finanziari o di acquisizione di prove in ambito legale, "expires_in": "never" le fornisce una registrazione con marca temporale di ciò che era presente sulla pagina al momento dell'estrazione.

Dataset riproducibili per IA/ML. Se sviluppa modelli di IA (classificatori, sistemi di sintesi, pipeline di estrazione), ha bisogno di dati di addestramento riproducibili. Perdere i dati grezzi dopo una settimana significa non poter rieseguire la pipeline, analizzare le regressioni o confrontare gli output tra un'iterazione e l'altra. Lo storage persistente trasforma le sue estrazioni in un corpus riutilizzabile e versionato.

Debugging e affidabilità delle pipeline. Quando una pipeline a valle si interrompe, la prima domanda è sempre: "Com'erano i dati di origine?" Se i risultati sono già scomparsi, si procede per tentativi. Lo storage persistente offre al suo team un riferimento concreto per il debugging: esattamente il contenuto elaborato dalla pipeline.

I prossimi sviluppi

Livelli di cold storage. Stiamo lavorando a un'opzione per spostare i dati meno recenti su AWS Glacier (o sistemi di cold storage analoghi). In questo modo potrà conservare i dati per periodi molto più lunghi, anni anziché mesi, a una frazione del costo. Ideale per archivi di conformità, dataset storici e analisi delle tendenze di lungo periodo.

Un linguaggio di query per i suoi dati. Stiamo sviluppando un'interfaccia di query simile a SQL che le permetterà di eseguire query analitiche direttamente sulle estrazioni archiviate, o su specifici sottoinsiemi. Filtrare, aggregare e analizzare senza esportare nulla. I dati archiviati diventano un database interrogabile.

Disponibilità

Il parametro storage è disponibile da oggi sull'endpoint /scrapes in tutti i piani. Stiamo lavorando per estenderlo a /answers, /maps, /crawls e /batches, così presto avrà gli stessi controlli di conservazione per ogni modalità di estrazione dei dati con Olostep.

Consulti il riferimento API per tutti i dettagli, oppure aggiunga semplicemente "storage": { "expires_in": "30d" } alla sua prossima richiesta e lo provi.

  • Nuovo parametro storage con valori expires_in: 10d, 30d, 60d, 90d, 180d, 365d oppure never per una conservazione illimitata
  • Disponibile da oggi sull'endpoint /scrapes in tutti i piani; conservazione predefinita di circa 7 giorni se omesso
  • Presto disponibile anche per /answers, /maps, /crawls e /batches
  • Livelli di cold storage per l'archiviazione a lungo termine e a basso costo (in sviluppo)
  • Interfaccia di query simile a SQL per eseguire analisi direttamente sulle estrazioni archiviate (in sviluppo)
Maggio 2026

API di ricerca web in tempo reale

L'API di ricerca web è ora disponibile per tutti. Si invia una query e si ricevono in un'unica chiamata risultati di ricerca puliti e strutturati, con citazioni delle fonti: pensata per fornire ad agenti e pipeline RAG un contesto web aggiornato in tempo reale.

Lasci che i suoi agenti cerchino, rispondano ed esplorino

I risultati vengono restituiti come JSON normalizzato con titoli, URL, snippet e posizioni in classifica, così può passarli direttamente a un modello o a un parser a valle, senza alcun codice di raccordo per lo scraping.

  • Nuovo endpoint /v1/searches che restituisce risultati normalizzati e ordinati con snippet e URL delle fonti
  • Modalità facoltativa per recuperare i contenuti dai risultati
  • Targeting per area geografica e lingua per query localizzate
Changelog: novità e correzioni | Olostep