Webcrawler · Identifikation
ContentAuditBot
Dieser Crawler besucht öffentlich zugängliche Webseiten für die Analyse und Optimierung von Website-Inhalten. Diese Seite erklärt, wie er sich verhält und wie Sie ihn steuern.
User-Agent
Jede Anfrage trägt diese Kennung, unverändert und vollständig:
Mozilla/5.0 (compatible; ContentAuditBot/1.0; +https://bot.lauda.hn/)
Der Crawler gibt sich nicht als Browser oder als fremder Bot aus und verschleiert seine Herkunft nicht.
Wie sich der Crawler verhält
- robots.txt
-
Wird vor jedem Abruf gelesen und befolgt, inklusive
Crawl-delay. Ist die robots.txt nicht erreichbar oder antwortet sie mit einem Serverfehler, gilt das als Verbot und der Crawler holt nichts. - Anfragerate
- Höchstens eine Anfrage pro Sekunde und Host.
- Gleichzeitigkeit
- Eine Anfrage pro Host zur selben Zeit, also keine parallelen Zugriffe auf denselben Server. Über alle Hosts zusammen höchstens zehn.
- Eine Seite je Anfrage
- Jede Anfrage holt genau eine URL. Es werden keine Sammelabrufe gestellt.
- Rücksicht bei Last
-
Auf 429 und auf Serverfehler wartet der Crawler und versucht es seltener erneut. Ein
gesendetes
Retry-Afterwird eingehalten. Antwortet ein Server langsam, verlangsamt sich der Crawler von selbst zusätzlich. - Umfang
- Nur öffentlich zugängliche Inhalte. Keine Anmeldung, keine Formulare, keine Umgehung von Sperren, keine Bezahlschranken. Sehr grosse Antworten werden abgebrochen.
Crawling steuern oder unterbinden
Der Crawler hört auf das Token ContentAuditBot in Ihrer robots.txt. Die
Regeln greifen ab dem nächsten Abruf.
Alles ausschliessen
User-agent: ContentAuditBot
Disallow: /
Einzelne Bereiche ausschliessen
User-agent: ContentAuditBot
Disallow: /intern/
Disallow: /suche
Langsamer abfragen
User-agent: ContentAuditBot
Crawl-delay: 10
Möchten Sie den Crawler dauerhaft ausschliessen, ohne Ihre robots.txt zu ändern, schreiben Sie uns. Wir tragen Ihre Domain in eine Sperrliste ein.
Verifikation
Ein User-Agent lässt sich fälschen, deshalb ist er allein kein Nachweis. Es gibt keine feste IP-Adresse und keinen festen IP-Bereich für diesen Crawler: der Dienst läuft in einer Cloud-Umgebung mit wechselnden Ausgangsadressen. Eine Freigabe oder Sperre über IP-Listen führt daher nicht zum Ziel, arbeiten Sie stattdessen mit dem Token in der robots.txt.
Wenn Sie prüfen möchten, ob ein Zugriff in Ihren Logs tatsächlich von uns stammt, senden Sie uns den Zeitstempel, die angefragte URL und die IP-Adresse aus Ihrem Log. Wir gleichen das ab und antworten Ihnen.
Kontakt
crawler@lauda.hn
Fragen, Beschwerden und Ausschlusswünsche beantworten wir. Ein Ausschluss auf Wunsch wird
umgesetzt, eine Begründung brauchen Sie dafür nicht.