#---------------------------------------------------------------- # # robots.txt von ChatGPT erstellt! # #---------------------------------------------------------------- # Zulassen ALLER Crawler (beste Strategie, da ich NIEMALS alle Crawler kennen kann – alleine Google betreibt über # 200 verschiedene. Die grössere Gefahr besteht darin, versehentlich einen eigentlich erlaubten Crawler auszuschliessen). User-agent: * Disallow: # Blockierung spezifischer bekannter schädlicher Crawler User-agent: AhrefsBot Disallow: / User-agent: SemrushBot Disallow: / User-agent: MJ12bot Disallow: / User-agent: DotBot Disallow: / User-agent: Yandex Disallow: / User-agent: Sogou Disallow: / User-agent: Baiduspider Disallow: / User-agent: PetalBot Disallow: / User-agent: ZoominfoBot Disallow: / User-agent: SEOkicks-Robot Disallow: / User-agent: BLEXBot Disallow: / User-agent: Exabot Disallow: / User-agent: MegaIndex.ru Disallow: / User-agent: CCBot Disallow: / User-agent: UptimeRobot Disallow: / User-agent: DataForSeoBot Disallow: / User-agent: Mail.RU_Bot Disallow: / User-agent: MauiBot Disallow: / User-agent: trendictionbot Disallow: / User-agent: linkdexbot Disallow: / User-agent: proximic Disallow: / User-agent: SiteAuditBot Disallow: / User-agent: Veoozbot Disallow: / User-agent: serpstatbot Disallow: / User-agent: Wotbox Disallow: / User-agent: SeznamBot Disallow: / User-agent: OpenLinkProfiler Disallow: / #--------------------------------------------------------------------------------------- #--------------------------------------------------------------------------------------- # In der «robots.txt» dürfen keine ASPX-Seiten gesperrt werden – deshalb habe ich sie hier ALLE auskommentiert # ------------------------------------------------------------------------------------------------------------ # Warum: Damit Google und andere Suchmaschinen erkennen, dass eine Seite nicht indexiert werden soll, muss der Crawler die Seite zuerst aufrufen können, # sonst kann das NOINDEX-Meta-Tag auf der ASPX-Seite nicht erkannt werden, nur so liest er das NOINDEX-Meta-Tag auf der Seite selbst. # Wenn das Crawlen blockiert wird, sieht Google dieses NOINDEX-Meta-Tag nicht und kann die Seite, wenn's dumm kommt, trotzdem in den Index aufnehmen # (ich wundere mich dann, dass die Seite indexiert wurde, obwohl ich das Crawlen hier verboten habe. Das eine hat halt nichts mit dem anderen zu tun!). # Wichtig: Ein Verbot in der «robots.txt» verhindert nur das Crawlen, nicht das Indexieren. # Wichtig # ------- # • Will ich verhindern, dass Google oder Bing bestimmte Seiten indexieren, muss ich das # Crawlen zulassen (!) und auf den betreffenden aspx-Seiten ein NOINDEX-Meta-Tag setzen. # • Darf der Crawler die aspx-Seite nicht lesen (Crawlen), kann Google das NOINDEX-Meta-Tag nicht erkennen! # • "robots.txt" kann nur das Crawlen verhindern, nicht das Indexieren. # • Damit das Indexieren verhindert wird, muss das Crawlen erlaubt sein und ein NOINDEX-Meta-Tag auf der jeweiligen aspx-Seite gesetzt werden. # # Siehe Erklärung: "I:\1_KB\4_Google Search Console (ehemals Webmaster-Tool)\2_robots.txt") # Alle URLs werden konsequent in Kleinbuchstaben geschrieben # ---------------------------------------------------------- # Warum: Google behandelt URLs mit unterschiedlicher Gross- und Kleinschreibung als komplett VERSCHIEDENE Seiten. Dadurch kann es passieren, dass Google # im Webmaster-Tool «DUPLICATE CONTENT» reklamiert, obwohl es sich in Wirklichkeit um dieselbe Seite handelt. # Um solche Probleme beim Indexieren zu vermeiden, werden alle Links auf der «Sozialkontakt»-Webseite ausschliesslich in Kleinbuchstaben geschrieben. # Blockierung spezifischer Seiten für alle Crawler (verhindert das Crawlen, aber nicht das Indexieren! # Siehe Erklärung: "I:\1_KB\4_Google Search Console (ehemals Webmaster-Tool)\2_robots.txt") # Mobirise-Seiten: die Definition: habe ich im Tool Mobirise in den Seiteneinstellungen bei den betreffenden Seiten gemacht. # Disallow: /allgemeinegeschaeftsbedingungen.htm # Disallow: /datenschutzerklaerung.htm # Disallow: /impressum.htm # Disallow: /sicherheitshinweise.htm # Disallow: /premium-mitglied.htm # Alle URL's in Kleinbuchstaben (siehe Erklärung oben)! # Wenn ich verhindern will, dass Google oder Bing untenstehende Seiten indexiert, muss ich das Crawlen zulassen (!) und auf untenstehenden aspx-Seiten # ein NOINDEX-Meta-Tag setzen. Wenn der Crawler nicht die aspx-Seite lesen (crawlen) darf, kann Google auch nicht das NOINDEX-Meta-Tag auf dieser aspx-Seite # erkennen! Wichtig: robots.txt kann nur das Crawlen verhindern, nicht aber das Indexieren! Damit das Indexieren verhindert wird, # muss das Crawlen erlaubt sein und ein NOINDEX-Meta-Tag auf der jeweiligen aspx-Seite gesetzt werden. # Siehe Erklärung: "I:\1_KB\4_Google Search Console (ehemals Webmaster-Tool)\2_robots.txt") # Disallow: /activationprocess.aspx # Disallow: /angebote.aspx # Disallow: /chat.aspx # Disallow: /confirmation.aspx # Disallow: /confirmation_register.aspx # Disallow: /css_check_fuer_indirekte_seiten.aspx # Disallow: /filedownloader.aspx # Disallow: /kontakt.aspx # Disallow: /maintenance.aspx # Disallow: /messageimage.aspx # Disallow: /passwort.aspx # Disallow: /profilnotexists.aspx # Disallow: /profilsuspended.aspx # Disallow: /register.aspx # Disallow: /suchen.aspx # Disallow: /suchergebnisse.aspx # Untenstehende PDF's werden durch Web.config blockiert (geht nicht anders): Siehe meine Erklärungen in: "I:\1_KB\4_Google Search Console (ehemals Webmaster-Tool)\2_robots.txt" # Disallow: /referenzierte_dokumente_aus_aspx_links/ # Disallow: /referenzierte_dokumente_aus_aspx_links/anleitung%20zum%20nachrichtenaustausch%20auf%20sozialkontakt.pdf # Disallow: /referenzierte_dokumente_aus_aspx_links/blanko_einzahlungsschein_mit_qr_code.pdf # Disallow: /referenzierte_dokumente_aus_aspx_links/kurzanleitung_zum_nachrichtenaustausch.pdf #--------------------------------------------------------------------------------------- # Alle URL's in Kleinbuchstaben (siehe Erklärung oben)! # Alte URL's die nicht mehr existieren (alle in Kleinbuchstaben schreiben!!) # Disallow: /sozialkontakt-trotz-corona-krise.html # Disallow: /angebote_braintree.aspx # Disallow: /blogdisplay.aspx # Disallow: /institutionen.htm # Disallow: /presse.aspx # Disallow: /registerimage.aspx # Disallow: /videocall.aspx # Disallow: /links.htm #--------------------------------------------------------------------------------------- # Alle URL's in Kleinbuchstaben (siehe Erklärung oben)! # Sitemap-Einträge Sitemap: https://sozialkontakt.at/sitemap/0_sitemap_index_at.xml Sitemap: https://sozialkontakt.ch/sitemap/0_sitemap_index_ch.xml Sitemap: https://sozialkontakt.de/sitemap/0_sitemap_index_de.xml Sitemap: https://sozialkontakt.li/sitemap/0_sitemap_index_li.xml #---------------------------------------------------------------------------------------