Anpassung der SEO mittels robots.txt

Betreiber des LMS imc Learning Suite möchten meist ganz gezielt steuern, welche Inhalte von Suchmaschinen gefunden werden - und welche nicht. Häufig verwenden Kunden mehrere Umgebungen gleichzeitig für ihr LMS, wie z. B. Produktivsysteme, Testsysteme und Entwicklungsumgebungen. Ohne klare Regeln können Suchmaschinen versehentlich Inhalte indexieren, die eigentlich nie öffentlich sichtbar sein sollten. Genau dafür gibt es die sogenannte robots.txt-Datei. Sie ist ein einfaches, aber wirkungsvolles Werkzeug im technischen SEO.

Was ist die robots.txt?

Die robots.txt ist eine kleine Textdatei im Hauptverzeichnis einer Website, z. B.:

https://imc-learning.com/robots.txt

Sie gibt Suchmaschinen-Bots wie Googlebot oder Bingbot Hinweise darauf:

  • welche Bereiche durchsucht werden dürfen

  • welche Bereiche ausgeschlossen werden sollen

  • welche Inhalte nicht in Suchergebnissen erscheinen sollen

Die Datei richtet sich primär an Suchmaschinen-Crawler und dient der Steuerung des sogenannten „Crawlings“.

Warum ist die robots.txt wichtig?

Die imc Learning Suite verfügt über viele unterschiedliche Inhaltsbereiche:

  • öffentliche Kursseiten

  • Login-Bereiche

  • Benutzerprofile

  • Prüfungen und Zertifikate

  • Testkurse

  • Entwicklungsumgebungen

  • temporäre Schulungsplattformen

Nicht alle diese Inhalte sind für Suchmaschinen geeignet.

Ohne saubere SEO-Steuerung können beispielsweise:

  • interne Testsysteme von Suchmaschinen gefunden werden

  • Duplicate Content entstehen

  • sensible Daten sichtbar werden

  • falsche Umgebungen indexiert werden

  • Crawling-Budget verschwendet werden

Die robots.txt hilft dabei, genau das zu vermeiden.

Wie sieht eine Standard-robots.txt aus?

Die Standard-Version der robots.txt-Datei sieht wie folgt aus:

User-agent: *
Disallow: /
Sitemap: https://imc-learning.com/sitemap.xml

Standardmäßig ist die Datei so konfiguriert, dass keine Umgebung der imc Learning Suite von Suchmaschinen gefunden werden kann.

Direktive

Bedeutung

User-agent

Ziel-Crawler: definiert den Bot (z. B. *, Googlebot, Bingbot, GPTBot, etc.)

Disallow

Pfade, die nicht gecrawlt werden dürfen

Allow

Pfade, die gecrawlt werden dürfen bzw. Ausnahmen innerhalb gesperrter Pfade

Sitemap

Verweist auf die Sitemap.

Eine Sitemap ist eine strukturierte Datei (meist XML), die alle wichtigen Seiten einer Website auflistet und zusätzliche Informationen wie Aktualisierungsdatum enthält. Sie hilft Suchmaschinen wie Google, Inhalte effizient zu finden und zu verstehen.

Ob ein Sitemap-Eintrag vorhanden ist, hängt davon ab, ob der Kunde eine Sitemap betreibt.

Typische Umgebungen der imc Learning Suite

Produktive Umgebung (soll in der Regel gefunden werden)

Die Live-Plattform ist normalerweise öffentlich sichtbar und darf indexiert werden.

Beispiel:

User-agent: *
Allow: /
Sitemap: https://imc-learning.com/sitemap.xml

Typische indexierbare Inhalte:

  • Kursübersichten

  • Landingpages

  • Schulungsangebote

Nicht-produktive Umgebungen (sollen in der Regel nicht gefunden werden)

Viele Kunden nutzen zusätzliche zur produktiven Umgebung weitere nicht-produktive Umgebungen wie z. B.:

In der Regel ist es von Kunden nicht gewünscht, dass diese Systeme von Google oder anderen Suchmaschinen gefunden werden.

Beispiel:

User-agent: *
Disallow: /
Sitemap: https://imc-learning.com/sitemap.xml

Dadurch wird Suchmaschinen signalisiert, dass sie nichts auf der entsprechenden Umgebung crawlen sollen.

Die robots.txt allein ist kein Sicherheitsmechanismus.

Sensible Testumgebungen sollten zusätzlich geschützt werden durch:

  • Passwortschutz

  • VPN

  • IP-Restriktionen

  • „noindex“-Metatags

Häufige SEO-Use Cases in der imc Learning Suite

Use Case 1: Login-Bereiche ausschließen

Login-Seiten bieten keinen SEO-Mehrwert und müssen nicht indexiert werden. Dies wird durch folgende Konfiguration der robots.txt-Datei gewährleistet:

User-agent: *
Disallow: /ilp/pages/login.jsf

Use Case 2: Öffentliche Kurse sichtbar machen

Öffentliche Kursseiten dürfen indexiert werden.

Die öffentlichen Kataloge werden über die Sitemap bereitgestellt.

Use Case 3: Zugriff auf Backend-Funktionalität ausschließen

Der Zugriff auf die Backend-Funktionen (ils) der imc Learning Suite sollte nicht öffentlich möglich sein. Dies wird durch folgende Konfiguration der robots.txt-Datei gewährleistet:

User-agent: *
Disallow: /ils

Was Sie als Kunde tun müssen

Zur Initiierung dieses Prozesses legen Sie bitte ein entsprechendes DESK-Ticket im Scheer IMC Service Desk an. Die von der jeweiligen Systemumgebung und den jeweiligen Anforderungen abhängige Anpassung der robots.txt-Datei liegt in der Verantwortung des Kunden. Ist diese abgeschlossen, muss die angepasste Datei bzw. die angepassten Dateien Scheer IMC über das Ticket zur Verfügung gestellt werden. Das Scheer IMC Hosting-Team übernimmt anschließend das Deployment.

Empfehlung: robots.txt regelmäßig prüfen

Besonders wichtig:

  • vor Go-live

  • nach Relaunches

  • bei Domainwechseln

  • nach LMS-Updates