MOBA Module – mobamodulebot

MobaModuleBot ist der Webcrawler der MOBA-Module-Suche. Er dient dazu, öffentlich zugängliche deutschsprachige Inhalte zum Thema Modelleisenbahn für eine spezialisierte Websuche zu erfassen.

Kennung des Crawlers

Der Crawler verwendet folgenden User-Agent:

MobaModuleBot/0.1 (+https://moba-module.de/mobamodulebot/)

Zweck des Crawlers

MobaModuleBot erfasst öffentlich zugängliche HTML-Seiten, die einen fachlichen Bezug zur Modelleisenbahn haben. Dazu können beispielsweise Inhalte über Modellbahnanlagen, Module, Spurweiten, Digitalsteuerungen, Decoder, Elektronik, Fahrzeuge, Landschaftsbau, 3D-Druck, Lasercut oder andere modellbahnspezifische Themen gehören.

Die erfassten Informationen werden für die MOBA-Module-Suche verwendet. In den Suchergebnissen können unter anderem Seitentitel, Domain, Zieladresse und ein zum Suchbegriff passender Textausschnitt angezeigt werden.

Der Crawler ist nicht dafür vorgesehen, vollständige fremde Artikel oder Websites zu spiegeln oder erneut zu veröffentlichen.

Öffentlich zugängliche Inhalte

MobaModuleBot greift ausschließlich auf öffentlich erreichbare Inhalte zu.

Der Crawler versucht nicht, Anmeldungen, Paywalls, CAPTCHAs, Zugriffsbeschränkungen oder andere technische Schutzmaßnahmen zu umgehen. In der derzeitigen Ausbaustufe werden ausschließlich HTML-Seiten verarbeitet. Bilder, PDF-Dateien und JavaScript-gerenderte Inhalte werden nicht gecrawlt.

robots.txt

MobaModuleBot prüft die robots.txt einer Website, bevor Inhalte dieser Domain abgerufen werden.

Soll der Crawler vollständig ausgeschlossen werden, kann beispielsweise folgende Regel verwendet werden:

User-agent: MobaModuleBot
Disallow: /

Auch pfadspezifische Disallow-Regeln werden berücksichtigt.

Ist eine URL für MobaModuleBot durch robots.txt gesperrt, wird sie nicht gecrawlt und nicht als Suchergebnis in den MOBA-Module-Suchindex aufgenommen.

Weitere Indexierungsregeln

Zusätzlich zu robots.txt berücksichtigt MobaModuleBot auch noindex-Anweisungen in Meta-Robots-Angaben sowie im HTTP-Header X-Robots-Tag.

Canonical-Angaben einer Seite werden ebenfalls ausgewertet.

Wird eine bereits erfasste Seite später gesperrt, mit noindex versehen, dauerhaft entfernt oder ausdrücklich blockiert, kann sie aus dem Suchindex entfernt werden.

Schonendes Crawling

MobaModuleBot ist bewusst konservativ konfiguriert. Pro Domain wird jeweils nur eine Anfrage gleichzeitig durchgeführt. Zwischen Anfragen gilt standardmäßig eine Verzögerung von mindestens zwei Sekunden.

Ist in robots.txt ein Crawl-delay für den Bot oder für alle Crawler angegeben, wird dieser berücksichtigt, sofern er eine größere Verzögerung verlangt.

Jeder Crawl ist zusätzlich mengenmäßig begrenzt. Eine Website wird nicht allein deshalb automatisch gecrawlt, weil ein Link auf sie gefunden wurde. Neue Domains müssen vor einem Crawl ausdrücklich für die MOBA-Module-Suche freigegeben werden.

Verwendung im Suchindex

Für die Bereitstellung der Suche werden nur Informationen gespeichert, die für Suche, Einordnung und technische Indexverwaltung erforderlich sind. Dazu können beispielsweise URL, Seitentitel, Überschriften, relevante Textauszüge, Sprache, technische Indexierungsinformationen und Verknüpfungen zwischen Seiten gehören.

Die MOBA-Module-Suche soll Besucher zum ursprünglichen Angebot weiterleiten und kein Ersatz für die jeweilige Website sein.

Sperrung und Entfernung

Websitebetreiber können den technischen Zugriff von MobaModuleBot jederzeit über robots.txt steuern. Für einzelne Seiten kann außerdem eine noindex-Anweisung verwendet werden.

Soll eine Domain oder eine bestimmte URL unabhängig davon aus dem MOBA-Module-Suchindex entfernt oder dauerhaft gesperrt werden, kann eine entsprechende Anfrage an die Redaktion gesendet werden.

E-Mail: info@moba-module.de

Bitte bei einer Anfrage die betroffene Domain beziehungsweise die konkrete URL angeben.