Webcrawler · Identifikation

ContentAuditBot

Dieser Crawler besucht öffentlich zugängliche Webseiten für die Analyse und Optimierung von Website-Inhalten. Diese Seite erklärt, wie er sich verhält und wie Sie ihn steuern.

User-Agent

Jede Anfrage trägt diese Kennung, unverändert und vollständig:

Mozilla/5.0 (compatible; ContentAuditBot/1.0; +https://bot.lauda.hn/)

Der Crawler gibt sich nicht als Browser oder als fremder Bot aus und verschleiert seine Herkunft nicht.

Wie sich der Crawler verhält

robots.txt
Wird vor jedem Abruf gelesen und befolgt, inklusive Crawl-delay. Ist die robots.txt nicht erreichbar oder antwortet sie mit einem Serverfehler, gilt das als Verbot und der Crawler holt nichts.
Anfragerate
Höchstens eine Anfrage pro Sekunde und Host.
Gleichzeitigkeit
Eine Anfrage pro Host zur selben Zeit, also keine parallelen Zugriffe auf denselben Server. Über alle Hosts zusammen höchstens zehn.
Eine Seite je Anfrage
Jede Anfrage holt genau eine URL. Es werden keine Sammelabrufe gestellt.
Rücksicht bei Last
Auf 429 und auf Serverfehler wartet der Crawler und versucht es seltener erneut. Ein gesendetes Retry-After wird eingehalten. Antwortet ein Server langsam, verlangsamt sich der Crawler von selbst zusätzlich.
Umfang
Nur öffentlich zugängliche Inhalte. Keine Anmeldung, keine Formulare, keine Umgehung von Sperren, keine Bezahlschranken. Sehr grosse Antworten werden abgebrochen.

Crawling steuern oder unterbinden

Der Crawler hört auf das Token ContentAuditBot in Ihrer robots.txt. Die Regeln greifen ab dem nächsten Abruf.

Alles ausschliessen

User-agent: ContentAuditBot
Disallow: /

Einzelne Bereiche ausschliessen

User-agent: ContentAuditBot
Disallow: /intern/
Disallow: /suche

Langsamer abfragen

User-agent: ContentAuditBot
Crawl-delay: 10

Möchten Sie den Crawler dauerhaft ausschliessen, ohne Ihre robots.txt zu ändern, schreiben Sie uns. Wir tragen Ihre Domain in eine Sperrliste ein.

Verifikation

Ein User-Agent lässt sich fälschen, deshalb ist er allein kein Nachweis. Es gibt keine feste IP-Adresse und keinen festen IP-Bereich für diesen Crawler: der Dienst läuft in einer Cloud-Umgebung mit wechselnden Ausgangsadressen. Eine Freigabe oder Sperre über IP-Listen führt daher nicht zum Ziel, arbeiten Sie stattdessen mit dem Token in der robots.txt.

Wenn Sie prüfen möchten, ob ein Zugriff in Ihren Logs tatsächlich von uns stammt, senden Sie uns den Zeitstempel, die angefragte URL und die IP-Adresse aus Ihrem Log. Wir gleichen das ab und antworten Ihnen.

Kontakt

crawler@lauda.hn
Fragen, Beschwerden und Ausschlusswünsche beantworten wir. Ein Ausschluss auf Wunsch wird umgesetzt, eine Begründung brauchen Sie dafür nicht.