Betreiber des LMS imc Learning Suite möchten meist ganz gezielt steuern, welche Inhalte von Suchmaschinen gefunden werden - und welche nicht. Häufig verwenden Kunden mehrere Umgebungen gleichzeitig für ihr LMS, wie z. B. Produktivsysteme, Testsysteme und Entwicklungsumgebungen. Ohne klare Regeln können Suchmaschinen versehentlich Inhalte indexieren, die eigentlich nie öffentlich sichtbar sein sollten. Genau dafür gibt es die sogenannte robots.txt-Datei. Sie ist ein einfaches, aber wirkungsvolles Werkzeug im technischen SEO.
Was ist die robots.txt?
Die robots.txt ist eine kleine Textdatei im Hauptverzeichnis einer Website, z. B.:
https://imc-learning.com/robots.txt
Sie gibt Suchmaschinen-Bots wie Googlebot oder Bingbot Hinweise darauf:
-
welche Bereiche durchsucht werden dürfen
-
welche Bereiche ausgeschlossen werden sollen
-
welche Inhalte nicht in Suchergebnissen erscheinen sollen
Die Datei richtet sich primär an Suchmaschinen-Crawler und dient der Steuerung des sogenannten „Crawlings“.
Warum ist die robots.txt wichtig?
Die imc Learning Suite verfügt über viele unterschiedliche Inhaltsbereiche:
-
öffentliche Kursseiten
-
Login-Bereiche
-
Benutzerprofile
-
Prüfungen und Zertifikate
-
Testkurse
-
Entwicklungsumgebungen
-
temporäre Schulungsplattformen
Nicht alle diese Inhalte sind für Suchmaschinen geeignet.
Ohne saubere SEO-Steuerung können beispielsweise:
-
interne Testsysteme von Suchmaschinen gefunden werden
-
Duplicate Content entstehen
-
sensible Daten sichtbar werden
-
falsche Umgebungen indexiert werden
-
Crawling-Budget verschwendet werden
Die robots.txt hilft dabei, genau das zu vermeiden.
Wie sieht eine Standard-robots.txt aus?
Die Standard-Version der robots.txt-Datei sieht wie folgt aus:
User-agent: *
Disallow: /
Sitemap: https://imc-learning.com/sitemap.xml
Standardmäßig ist die Datei so konfiguriert, dass keine Umgebung der imc Learning Suite von Suchmaschinen gefunden werden kann.
|
Direktive |
Bedeutung |
|---|---|
|
|
Ziel-Crawler: definiert den Bot (z. B. |
|
|
Pfade, die nicht gecrawlt werden dürfen |
|
|
Pfade, die gecrawlt werden dürfen bzw. Ausnahmen innerhalb gesperrter Pfade |
|
|
Verweist auf die Sitemap. Eine Sitemap ist eine strukturierte Datei (meist XML), die alle wichtigen Seiten einer Website auflistet und zusätzliche Informationen wie Aktualisierungsdatum enthält. Sie hilft Suchmaschinen wie Google, Inhalte effizient zu finden und zu verstehen. Ob ein Sitemap-Eintrag vorhanden ist, hängt davon ab, ob der Kunde eine Sitemap betreibt. |
Typische Umgebungen der imc Learning Suite
Produktive Umgebung (soll in der Regel gefunden werden)
Die Live-Plattform ist normalerweise öffentlich sichtbar und darf indexiert werden.
Beispiel:
User-agent: *
Allow: /
Sitemap: https://imc-learning.com/sitemap.xml
Typische indexierbare Inhalte:
-
Kursübersichten
-
Landingpages
-
Schulungsangebote
Nicht-produktive Umgebungen (sollen in der Regel nicht gefunden werden)
Viele Kunden nutzen zusätzliche zur produktiven Umgebung weitere nicht-produktive Umgebungen wie z. B.:
In der Regel ist es von Kunden nicht gewünscht, dass diese Systeme von Google oder anderen Suchmaschinen gefunden werden.
Beispiel:
User-agent: *
Disallow: /
Sitemap: https://imc-learning.com/sitemap.xml
Dadurch wird Suchmaschinen signalisiert, dass sie nichts auf der entsprechenden Umgebung crawlen sollen.
Die robots.txt allein ist kein Sicherheitsmechanismus.
Sensible Testumgebungen sollten zusätzlich geschützt werden durch:
-
Passwortschutz
-
VPN
-
IP-Restriktionen
-
„noindex“-Metatags
Häufige SEO-Use Cases in der imc Learning Suite
Use Case 1: Login-Bereiche ausschließen
Login-Seiten bieten keinen SEO-Mehrwert und müssen nicht indexiert werden. Dies wird durch folgende Konfiguration der robots.txt-Datei gewährleistet:
User-agent: *
Disallow: /ilp/pages/login.jsf
Use Case 2: Öffentliche Kurse sichtbar machen
Öffentliche Kursseiten dürfen indexiert werden.
Die öffentlichen Kataloge werden über die Sitemap bereitgestellt.
Use Case 3: Zugriff auf Backend-Funktionalität ausschließen
Der Zugriff auf die Backend-Funktionen (ils) der imc Learning Suite sollte nicht öffentlich möglich sein. Dies wird durch folgende Konfiguration der robots.txt-Datei gewährleistet:
User-agent: *
Disallow: /ils
Was Sie als Kunde tun müssen
Zur Initiierung dieses Prozesses legen Sie bitte ein entsprechendes DESK-Ticket im Scheer IMC Service Desk an. Die von der jeweiligen Systemumgebung und den jeweiligen Anforderungen abhängige Anpassung der robots.txt-Datei liegt in der Verantwortung des Kunden. Ist diese abgeschlossen, muss die angepasste Datei bzw. die angepassten Dateien Scheer IMC über das Ticket zur Verfügung gestellt werden. Das Scheer IMC Hosting-Team übernimmt anschließend das Deployment.
Empfehlung: robots.txt regelmäßig prüfen
Besonders wichtig:
-
vor Go-live
-
nach Relaunches
-
bei Domainwechseln
-
nach LMS-Updates