robots.txt on sivuston juuresta löytyvä julkinen tiedosto, jolla voidaan ohjata hakukoneiden ja muiden ohjetta noudattavien crawlerien eli verkkorobottien pääsyä sivuston URL-osoitteisiin. URL (Uniform Resource Locator) tarkoittaa yksittäisen verkkosivun osoitetta. Se hallitsee ennen kaikkea crawlausta. Se ei ole salasanasuoja eikä luotettava tapa poistaa sivua Googlen hakutuloksista.
Tiedosto löytyy tavallisesti osoitteesta:
https://yritys.fi/robots.txt
Miltä robots.txt näyttää?
Avoimella pienellä yrityssivustolla tiedosto voi olla hyvin yksinkertainen:
User-agent: *
Allow: /
Sitemap: https://yritys.fi/sitemap.xml
Tässä:
User-agent: *tarkoittaa kaikkia sääntöä noudattavia crawlereitaAllow: /sallii koko sivuston crawlaamisenSitemap:kertoo XML-sitemapin (XML = Extensible Markup Language) eli koneellisesti luettavan sivustokartan osoitteen
Monimutkaisempia sääntöjä tarvitaan vain, jos sivustolla on oikea syy rajata crawlausta.
Estääkö Disallow sivun näkymisen Googlessa?
Ei välttämättä.
Tämä on yksi yleisimmistä väärinkäsityksistä.
Google sanoo, että robots.txt ei ole oikea työkalu sivun pitämiseen pois hakemistosta. Jos URL tunnetaan muista linkeistä, se voi joissain tilanteissa näkyä hakutuloksissa, vaikka Google ei pääse lukemaan sivun sisältöä.
Jos haluat julkisen sivun pois Google-hausta, käytä tarkoitukseen sopivaa noindex-ohjetta ja anna Googlebotin crawlata sivu niin, että se pystyy lukemaan ohjeen.
Jos sisältö on oikeasti yksityistä, suojaa se kirjautumisella tai muulla käyttöoikeudella.
Voiko robots.txt:llä suojata salaisia osoitteita?
Ei.
Robots.txt on julkinen tiedosto. Kuka tahansa voi avata sen selaimella.
Älä siis kirjoita sinne esimerkiksi:
- salaisen hallintapaneelin osoitetta
- yksityisten tiedostojen polkuja ajatuksella, että ne piilotettaisiin
- muuta tietoa, jonka olemassaoloa ei haluta paljastaa
Crawler-sääntö ei ole tietoturvaratkaisu.
Miksi robots.txt voi vahingossa rikkoa SEO:n?
SEO (Search Engine Optimization) eli hakukoneoptimointi voi kärsiä, jos tärkeän sisällön crawlaus estetään vahingossa.
Yksi väärä sääntö voi estää hakukoneen pääsyn tärkeään sisältöön.
Esimerkiksi:
User-agent: *
Disallow: /
kertoo sääntöä noudattaville crawlereille, etteivät ne saa crawlata mitään sivustolta.
Tämä voi jäädä vahingossa tuotantoon, jos kehitysympäristön estot kopioidaan julkaisun mukana.
Siksi robots.txt kannattaa tarkistaa aina uuden sivuston julkaisussa.
Entä ChatGPT ja Claude?
Tekoälypalveluilla voi olla omia user-agenttejaan eri tarkoituksiin.
OpenAI käyttää esimerkiksi OAI-SearchBotia ChatGPT:n hakua varten. Anthropic käyttää Claude-SearchBotia haun tueksi ja ClaudeBotia eri tarkoitukseen mallien kehittämisessä.
Jos robots.txt sallii yleisesti kaikki crawlerit eikä erillistä tarkempaa estoa ole, nämä voivat lähtökohtaisesti käyttää yleistä ryhmää. Sivuston CDN (Content Delivery Network) eli sisällönjakeluverkko tai palomuuri voi silti estää liikenteen erikseen.
Jos haluat hallita tekoälyhakua ja mallien kehittämiseen liittyvää crawlausta eri tavalla, user-agentit kannattaa erotella niiden dokumentaation mukaan.
Miten robots.txt ja sitemap liittyvät yhteen?
Robots.txt-tiedostossa voidaan ilmoittaa sitemapin osoite:
Sitemap: https://yritys.fi/sitemap.xml
Näillä on kuitenkin eri tehtävät:
- robots.txt kertoo, mitä crawler saa pyytää
- sitemap kertoo, mitä URL-osoitteita haluat hakukoneen löytävän
Lue tarkemmin mikä sitemap on.
Mikä on hyvä robots.txt pienelle yrityssivustolle?
Usein paras ratkaisu on yksinkertainen tiedosto, joka sallii julkisen sivuston crawlaamisen ja kertoo sitemapin sijainnin.
Älä lisää estoja varmuuden vuoksi. Lisää sääntö vain, kun tiedät mitä ongelmaa ratkaiset.
Miten GC hoitaa robots.txt:n?
GC:n nettisivupalveluun kuuluvat indeksoinnin tekniset asetukset ja sitemap. Julkaisussa tärkeä tarkistus on, ettei tuotantosivustolle jää crawl-estettä, joka olisi ollut tarkoitettu vain kehitysvaiheeseen.
Katso myös miten nettisivut saa Googleen ja miten yritys voi löytyä ChatGPT:stä.
Lähteet: Google Search Central, Introduction to robots.txt. OpenAI Help Center, Julkaisijat ja kehittäjät – UKK. Anthropic Help Center, crawler-ohjeistus.
