Zum Inhalt springen

Diese Seite ist maschinell übersetzt und wurde nicht unabhängig geprüft. Rechtsbegriffe, Richtlinien-Nummern und zitierter Gesetzestext bleiben in der Originalform. Im Zweifel gilt die englische Fassung. English

Crawler

Über CosmeticlaimBot

Wenn Sie diese Adresse in Ihren Serverprotokollen gefunden haben, erklärt diese Seite, worum es bei der Anfrage ging.

CosmeticlaimBot ruft öffentliche Seiten ab, wenn jemand unseren Scanner bittet, eine Website zu prüfen. Ausgelöst wird er dadurch, dass eine Person eine URL einfügt — er crawlt nicht nach Zeitplan und findet Websites nicht von selbst.

Er identifiziert sich als:

CosmeticlaimBot/1.0 (+https://cosmeticlaim.eu/bot)

Was er tut

  • Ruft zuerst Ihre robots.txt ab — vor jeder Seite, auch vor der, die Sie uns genannt haben — und beachtet Disallow-Regeln für * und für CosmeticlaimBot. Ist die Startseite gesperrt, halten wir an und geben einen Fehler statt eines Berichts zurück. Wir lesen die ersten 1000 Regeln einer robots.txt; ist Ihre länger, gelten die Regeln nach 1000 nicht, und Sie sollten es uns sagen.
  • Liest höchstens 10 Seiten pro Prüfung, je höchstens 2 MB, innerhalb von 45 Sekunden.
  • Folgt höchstens 3 Weiterleitungen, und nur zu öffentlichen http- oder https-Adressen.
  • Ruft Seiten nacheinander ab. Das ähnelt eher einer Person beim Surfen als einem Crawler.

Was er nicht tut

  • Er führt kein JavaScript aus, sendet keine Formulare und folgt keinen Links hinter einem Login.
  • Er speichert Ihre Seiten nicht. Text wird im Arbeitsspeicher analysiert und mit dem Senden der Antwort verworfen.
  • Er indexiert Ihre Website nicht und veröffentlicht nichts daraus.

Eine Einschränkung, weil der Satz, der hier stand, zu stark war: Sätze Ihrer Seiten, die auf einen eingeschränkten Begriff passen, werden an ein Sprachmodell gesendet — ein privates Gateway unter ai-gw.nurme.eu —, das entscheidet, ob der Treffer eine Werbeaussage oder gewöhnlicher Kommentar ist. Das ist höchstens der getroffene Satz und der Seitenpfad, nie die ganze Seite, und nichts davon wird gespeichert. Die Datenschutzseite legt genau dar, was übertragen wird.

Blockieren

Fügen Sie dies in Ihre robots.txt ein, und er hört auf:

User-agent: CosmeticlaimBot
Disallow: /

Blockieren per User-Agent am Edge funktioniert ebenfalls. Wenn Sie lieber möchten, dass er Ihren Origin gar nicht erst erreicht, ist das völlig in Ordnung — der Scanner meldet dann, dass die Seiten übersprungen wurden, statt so zu tun, als wären sie sauber. Unser Crawler kommt von 157.180.65.81, Sie können ihn also auch per Adresse und nicht nur per Name sperren; wenn Sie dazu einen Menschen brauchen, schreiben Sie an tere@cosmeticlaim.eu.