Zum Inhalt springen

CityVibeBot — wer unser Crawler ist

Sie kommen aus Ihren eigenen Logs hierher und wollen konkrete Antworten. Hier sind sie, ohne Marketing.

Letzte Überarbeitung: 26. September 2026 · Version 1.1

Sie haben uns in Ihren Logs gesehen

Das ist unsere Kennung, vollständig:

CityVibeBot/1.0 (+https://cityvibe.guide/bot-info)

Wenn sie auf Ihrem Server auftaucht, sind wir es. Wir verwenden keinen anderen Agenten, verkleiden uns nicht als Browser und wechseln keine IP-Adressen, um irgendetwas zu umgehen.

Was CityVibe ist

Ein Veranstaltungskatalog für Spanien. Wir sammeln Kulturkalender, die als offene Daten veröffentlicht werden, übersetzen sie in sieben Sprachen und zeigen sie gemeinsam, nennen dabei immer die Quelle und verlinken auf das Original. Die vollständige Liste der Quellen steht unter Datenquellen.

Was wir laden

Datenfeeds: JSON, XML, CSV. Konkrete Adressen aus Open-Data-Katalogen, kein Durchlauf durch Ihre Website.

Wir laden nicht:

  • HTML-Seiten zur Navigation, Suchseiten oder Druckansichten.
  • Bilder: keine, nie. Weder Fotos noch Plakate noch Vorschaubilder. Wir speichern sie nicht und verlinken sie nicht direkt.
  • E-Mail-Adressen oder Telefonnummern, auch wenn sie im Feed stehen. Enthält ein Feld die Kontaktdaten einer Person, liest unser Adapter es schlicht nicht.
  • Nichts, was hinter einer Anmeldung oder einem Formular liegt.

Wie oft

Wir prüfen alle Quellen alle drei Stunden. Zwischen zwei Anfragen an denselben Server warten wir mindestens:

esmadrid.com
10 Sekunden — genau das „Crawl-delay“, das seine robots.txt verlangt
do.diba.cat
10 Sekunden — genau das „Crawl-delay“, das seine robots.txt verlangt
datos.madrid.es
2 Sekunden
datosabiertos.jcyl.es
2 Sekunden

Ein typischer Durchlauf gegen eine Quelle sind eine bis fünf Anfragen. Antworten Sie mit „429“ oder „503“, ziehen wir uns mit exponentieller Wartezeit zurück, und senden Sie einen „Retry-After“-Header, halten wir ihn buchstabengetreu ein. Wir nutzen „ETag“ und „Last-Modified“, wenn Sie sie anbieten, sodass ein unveränderter Feed uns beiden fast nichts kostet.

robots.txt

Wir lesen sie und halten uns daran, und es lohnt zu wissen wie: Ein Mensch sieht sie sich an, wenn wir den Adapter für Ihre Quelle schreiben, kein automatischer Parser bei jedem Durchlauf. In der Praxis macht uns das strenger, nicht lockerer — die Pfade, die Sie verbieten, kommen gar nicht erst in den Code, und das „Crawl-delay“, das Sie verlangen, ist dort festgeschrieben. Ein echtes Beispiel: Wir haben einen Datensatz verworfen, der uns interessierte, weil er auf einen Host umleitete, dessen robots.txt „/api/“ verbietet, und sind beim Original geblieben, das über einen erlaubten Pfad ausgeliefert wird.

Auch Weiterleitungen folgen wir nicht blind: Jeder Sprung wird geprüft und gezählt.

Wie Sie uns blockieren

Wenn Sie lieber nicht möchten, dass wir vorbeikommen, fügen Sie dies Ihrer robots.txt hinzu:

User-agent: CityVibeBot
Disallow: /

Wir sehen es bei der nächsten Überarbeitung des Adapters. Wenn wir heute aufhören sollen, schreiben Sie uns, und wir schalten es in Minuten ab: In unserem System ist eine Quelle eine Zeile mit einem Schalter.

Und wenn Sie wollen, dass wir langsamer oder nur zu bestimmten Stunden kommen, sagen Sie es, und wir stellen es ein. Es ist eine Zahl in einer Konfigurationsdatei.

Wie Sie mit uns sprechen

Fragen zu unserem Crawler? Schreiben Sie uns an alexandr.shurigin@gmail.com (öffnet in neuem Tab).

Schreiben Sie uns, wenn:

  • Sie möchten, dass wir Sie nicht mehr crawlen, ganz oder teilweise.
  • Sie möchten, dass wir die Namensnennung oder die Lizenz ändern, mit der wir Sie zitieren.
  • In Ihren Veranstaltungen, so wie wir sie zeigen, ein Fehler steckt.
  • Sie einen besseren Feed haben als den, den wir nutzen (das kommt oft vor, und wir sind für den Hinweis immer dankbar).
  • Sie einfach wissen wollen, was wir von Ihnen haben.

Wir antworten. Und wenn Sie uns bitten aufzuhören, hören wir auf: Es braucht keine förmliche Beschwerde.

Unsere Regeln in vier Zeilen

  1. Wir nennen uns mit unserem echten Namen und einem Link auf diese Seite.
  2. Wir fragen weniger ab, als Sie uns erlauben würden.
  3. Wir rühren keine personenbezogenen Daten an, auch nicht, wenn der Feed sie uns anbietet.
  4. Wir nennen den, der uns die Daten gibt, mit seiner Lizenz und seinem Link.