Kurz-Fakten
- Weist sich über eine Kennung im User-Agent aus
- Ansprechbar in der robots.txt je Kennung getrennt
- Beachtung ist freiwillig – es gibt keine technische Durchsetzung
- Crawler von Sprachmodellanbietern wie GPTBot lassen sich getrennt behandeln
Einordnung für die Praxis
Die Frage, welche Crawler zugelassen werden, ist in den letzten Jahren komplizierter geworden. Neben Suchmaschinen rufen inzwischen Anbieter von Sprachmodellen ab – teils für das Training, teils für Antworten mit Quellenangabe. Beides lässt sich in der robots.txt getrennt regeln, weil die Kennungen unterschiedlich sind.
Wer alles sperrt, verliert auch die Nennung als Quelle in generierten Antworten. Wer alles zulässt, gibt Inhalte für das Training frei. Eine richtige Antwort gibt es nicht – aber es ist eine Entscheidung, die man bewusst treffen sollte, statt sie der Vorgabe zu überlassen.