Estrarre ora, analizzare dopo
La maggior parte delle API di dati web considera i risultati come effimeri. Si invia una richiesta, si riceve la risposta e i dati scompaiono nel giro di poche ore. Funziona per le ricerche in tempo reale, ma non regge più nel momento in cui quei dati le servono di nuovo.
Dai team ci arrivava sempre la stessa richiesta: "Vogliamo analizzare i cambiamenti del web nel lungo periodo senza dover pensare allo storage come a un'infrastruttura separata"
Oggi presentiamo il parametro storage: un modo semplice per conservare i risultati delle sue estrazioni per tutto il tempo necessario e mantenere il pieno controllo sul ciclo di vita dei suoi dati.

Come funziona
Passi un oggetto storage nella richiesta per controllare la conservazione:
{
"url": "https://example.com/product/reviews",
"formats": ["markdown"],
"storage": {
"expires_in": "90d"
}
}
Valori supportati: 10d, 30d, 60d, 90d, 180d, 365d oppure never per una conservazione illimitata. Senza il parametro si applica la conservazione predefinita di circa 7 giorni.
Nessuna configurazione aggiuntiva. Nessun servizio di storage separato. I suoi dati restano accessibili tramite la stessa API che già utilizza.
I suoi dati come risorsa
Il vero valore dei dati web raramente deriva da una singola estrazione. Deriva dall'accumulo: disporre di settimane, mesi o trimestri di dati strutturati da interrogare, confrontare e analizzare.
Analisi dei dati nel tempo. Quando conserva i suoi risultati, non sta solo archiviando pagine: sta creando un dataset. Può monitorare come cambiano le recensioni di un prodotto dopo un lancio, come evolvono i prezzi in un mercato, come gli annunci di lavoro rivelano la strategia di un concorrente. Lo storage persistente trasforma estrazioni isolate in serie temporali il cui valore cresce nel tempo.
Pieno controllo sul ciclo di vita dei dati. È lei a decidere cosa resta, per quanto tempo e quando viene eliminato. Nessuna preoccupazione che i dati scompaiano prima che il suo team li abbia elaborati. Che le servano finestre di 30 giorni per i flussi operativi o una conservazione illimitata per analisi di lungo periodo, le regole le stabilisce lei. I suoi dati, i suoi tempi.
Conformità e verificabilità. Alcuni settori (fintech, sanità, assicurazioni) richiedono di conservare le prove di quali dati sono stati raccolti e quando. Che si tratti di richieste di accesso ai sensi del GDPR, di audit finanziari o di acquisizione di prove in ambito legale, "expires_in": "never" le fornisce una registrazione con marca temporale di ciò che era presente sulla pagina al momento dell'estrazione.
Dataset riproducibili per IA/ML. Se sviluppa modelli di IA (classificatori, sistemi di sintesi, pipeline di estrazione), ha bisogno di dati di addestramento riproducibili. Perdere i dati grezzi dopo una settimana significa non poter rieseguire la pipeline, analizzare le regressioni o confrontare gli output tra un'iterazione e l'altra. Lo storage persistente trasforma le sue estrazioni in un corpus riutilizzabile e versionato.
Debugging e affidabilità delle pipeline. Quando una pipeline a valle si interrompe, la prima domanda è sempre: "Com'erano i dati di origine?" Se i risultati sono già scomparsi, si procede per tentativi. Lo storage persistente offre al suo team un riferimento concreto per il debugging: esattamente il contenuto elaborato dalla pipeline.
I prossimi sviluppi
Livelli di cold storage. Stiamo lavorando a un'opzione per spostare i dati meno recenti su AWS Glacier (o sistemi di cold storage analoghi). In questo modo potrà conservare i dati per periodi molto più lunghi, anni anziché mesi, a una frazione del costo. Ideale per archivi di conformità, dataset storici e analisi delle tendenze di lungo periodo.
Un linguaggio di query per i suoi dati. Stiamo sviluppando un'interfaccia di query simile a SQL che le permetterà di eseguire query analitiche direttamente sulle estrazioni archiviate, o su specifici sottoinsiemi. Filtrare, aggregare e analizzare senza esportare nulla. I dati archiviati diventano un database interrogabile.
Disponibilità
Il parametro storage è disponibile da oggi sull'endpoint /scrapes in tutti i piani. Stiamo lavorando per estenderlo a /answers, /maps, /crawls e /batches, così presto avrà gli stessi controlli di conservazione per ogni modalità di estrazione dei dati con Olostep.
Consulti il riferimento API per tutti i dettagli, oppure aggiunga semplicemente "storage": { "expires_in": "30d" } alla sua prossima richiesta e lo provi.
- Nuovo parametro
storagecon valoriexpires_in:10d,30d,60d,90d,180d,365doppureneverper una conservazione illimitata - Disponibile da oggi sull'endpoint
/scrapesin tutti i piani; conservazione predefinita di circa 7 giorni se omesso - Presto disponibile anche per
/answers,/maps,/crawlse/batches - Livelli di cold storage per l'archiviazione a lungo termine e a basso costo (in sviluppo)
- Interfaccia di query simile a SQL per eseguire analisi direttamente sulle estrazioni archiviate (in sviluppo)
