Vai al contenuto

CityVibeBot — chi è il nostro crawler

Sei arrivato dai tuoi log e vuoi risposte concrete. Eccole, senza marketing.

Ultima revisione: 26 settembre 2026 · Versione 1.1

Ci hai visti nei tuoi log

Questo è il nostro identificativo, per intero:

CityVibeBot/1.0 (+https://cityvibe.guide/bot-info)

Se compare sul tuo server, siamo noi. Non usiamo nessun altro agente, non ci travestiamo da browser e non ruotiamo indirizzi IP per aggirare alcunché.

Cos'è CityVibe

Un catalogo di eventi in Spagna. Raccogliamo calendari culturali pubblicati come dati aperti, li traduciamo in sette lingue e li mostriamo insieme, citando sempre la fonte e collegando all'originale. L'elenco completo delle fonti è in Fonti dei dati.

Cosa scarichiamo

Feed di dati: JSON, XML, CSV. Indirizzi precisi di cataloghi di dati aperti, non un percorso attraverso il tuo sito.

Non scarichiamo:

  • Pagine HTML di navigazione, motori di ricerca né versioni per la stampa.
  • Immagini: nessuna, mai. Né foto, né locandine, né miniature. Non le conserviamo e non le colleghiamo a caldo.
  • Indirizzi e-mail né numeri di telefono, anche se arrivano nel feed. Quando un campo contiene i recapiti di una persona, il nostro adattatore semplicemente non lo legge.
  • Nulla che stia dietro un accesso o un modulo.

Con che frequenza

Controlliamo tutte le fonti ogni tre ore. Tra una richiesta e l'altra allo stesso server aspettiamo, come minimo:

esmadrid.com
10 secondi — esattamente il «Crawl-delay» che chiede il suo robots.txt
do.diba.cat
10 secondi — esattamente il «Crawl-delay» che chiede il suo robots.txt
datos.madrid.es
2 secondi
datosabiertos.jcyl.es
2 secondi

Un'esecuzione tipica contro una fonte sono da una a cinque richieste. Se rispondi «429» o «503» ci facciamo da parte con attesa esponenziale, e se mandi un'intestazione «Retry-After» la rispettiamo alla lettera. Usiamo «ETag» e «Last-Modified» quando li offri, così un feed che non è cambiato costa quasi nulla a entrambi.

robots.txt

Lo leggiamo e lo rispettiamo, e conviene sapere come: lo esamina una persona quando scriviamo l'adattatore della tua fonte, non un analizzatore automatico a ogni esecuzione. In pratica questo ci rende più severi, non meno — i percorsi che vieti non arrivano nemmeno a essere scritti nel codice, e il «Crawl-delay» che chiedi resta fissato lì dentro. Un esempio reale: abbiamo scartato un insieme di dati che ci interessava perché reindirizzava a un host il cui robots.txt vieta «/api/», e siamo rimasti con l'originale, servito da un percorso consentito.

Nemmeno i reindirizzamenti li seguiamo alla cieca: ogni salto viene verificato e contato.

Come bloccarci

Se preferisci che non passiamo, aggiungi questo al tuo robots.txt:

User-agent: CityVibeBot
Disallow: /

Lo vedremo alla prossima revisione dell'adattatore. Se vuoi che smettiamo di passare oggi, scrivici e lo disattiviamo in pochi minuti: nel nostro sistema una fonte è una riga che si spegne con un interruttore.

E se quello che vuoi è che andiamo più piano, o solo a certe ore, dillo e lo regoliamo. È un numero in un file di configurazione.

Come parlare con noi

Domande sul nostro crawler? Scrivici a alexandr.shurigin@gmail.com (si apre in una nuova scheda).

Scrivici se:

  • Vuoi che smettiamo di scansionarti, del tutto o in parte.
  • Vuoi che cambiamo l'attribuzione o la licenza con cui ti citiamo.
  • C'è un errore nei tuoi eventi così come li mostriamo.
  • Hai un feed migliore di quello che stiamo usando (capita spesso e la segnalazione è sempre gradita).
  • Vuoi semplicemente sapere cosa abbiamo di tuo.

Rispondiamo. E se ci chiedi di fermarci, ci fermiamo: non serve un reclamo formale.

Le nostre regole, in quattro righe

  1. Ci identifichiamo con il nostro nome vero e un link a questa pagina.
  2. Chiediamo meno di quanto ci lasceresti chiedere.
  3. Non tocchiamo dati personali, nemmeno quando il feed ce li offre.
  4. Citiamo chi ci dà i dati, con la sua licenza e il suo link.