Mikä on robots.txt?
Robots.txt on sivuston juureen tallennettu tekstitiedosto, joka kertoo hakukoneiden ja muiden robottien rastaajille, mitä osoitteita ne saavat käydä läpi. Se löytyy aina samasta paikasta, esimerkiksi osoitteesta https://esimerkki.fi/robots.txt, ja asiallinen robotti lukee sen ennen kuin alkaa käydä sivustoa läpi.
Googlen mukaan tiedostoa käytetään ensisijaisesti siihen, ettei sivustoa kuormiteta liikaa. Sillä voi rajata pois esimerkiksi hallintasivut, sisäisen haun tulossivut tai tuotelistan, joka tuottaa loputtomasti suodatinyhdistelmiä. Se ei ole tapa poistaa sivuja hakutuloksista, vaikka sitä käytetään siihen jatkuvasti.
Tiedosto koskee vain sitä verkkotunnusta, protokollaa ja porttia, jossa se sijaitsee. Jokaisella aliverkkotunnuksella, kuten verkkokaupan tai ajanvarauksen omalla osoitteella, on oma robots.txt, eikä pääsivuston tiedosto vaikuta siihen.
Miltä robots.txt näyttää sisältä
Tiedosto koostuu ryhmistä. Jokainen ryhmä alkaa rivillä, joka kertoo, mitä robottia se koskee, ja sen alla ovat säännöt. Tähti tarkoittaa kaikkia robotteja. Tyypillinen pienen sivuston tiedosto näyttää tältä:
User-agent: *
Disallow: /hallinta/
Disallow: /haku/
Sitemap: https://esimerkki.fi/sitemap.xml
Disallow kieltää polun ja kaiken sen alla olevan. Allow sallii polun, vaikka laajempi kielto koskisi sitä. Sitemap kertoo XML-sivukartan osoitteen, eikä sitä ole sidottu mihinkään ryhmään. Google tukee vain näitä neljää kenttää, ja esimerkiksi crawl-delay-rivin se jättää huomiotta.
Kaksi yksityiskohtaa aiheuttaa eniten yllätyksiä. Polut ovat kirjainkoon suhteen tarkkoja, joten /Hallinta/ ja /hallinta/ ovat eri polkuja. Ja sääntöä verrataan osoitteen alkuun: Disallow: /blogi kieltää myös osoitteet, jotka alkavat esimerkiksi sanalla blogikirjoitukset. Kun säännöt ovat ristiriidassa, Google noudattaa tarkinta eli pisintä sääntöä ja tasatilanteessa sallivampaa.
Robots.txt on pyyntö, ei lukko
Robots.txt ei estä ketään teknisesti. Googlen mukaan tiedoston ohjeet eivät voi pakottaa robottia mihinkään, vaan noudattaminen on robotin varassa. Googlebot ja muut asialliset rastaajat noudattavat tiedostoa, mutta kaikki robotit eivät.
Tästä seuraa tärkeä sääntö: älä koskaan kirjoita robots.txt-tiedostoon polkua, jota haluat pitää salassa. Tiedosto on julkinen, ja kuka tahansa voi avata sen selaimessa. Rivi Disallow: /tarjouspohjat/ kertoo jokaiselle uteliaalle, mistä sisäiset tarjouspohjat löytyvät.
Oikea suojaus on salasana tai kirjautuminen. Kaikki, minkä ei kuulu näkyä ulkopuolisille, suojataan palvelimella eikä pyytämällä kohteliaasti.
Estääkö robots.txt sivun näkymisen Googlessa?
Ei. Robots.txt estää Googlea lukemasta sivua, mutta se ei estä sivua näkymästä hakutuloksissa. Jos kielletylle sivulle linkitetään muilta sivustoilta, Google voi silti indeksoida sen osoitteen. Hakutuloksessa näkyy silloin osoite ja mahdollisesti linkkiteksti, mutta ei kuvausta, koska Google ei ole lukenut sivua.
Google sanoo tämän robots.txt-ohjeessaan suoraan: tiedosto ei ole keino pitää sivua poissa Googlesta. Sivu pidetään poissa hakutuloksista noindex-merkinnällä tai suojaamalla se salasanalla.
Käytännössä tämä näkyy hakutuloksena, jonka kuvauksen paikalla kerrotaan, ettei sivusta ole tietoja saatavilla. Se näyttää huolimattomalta, ja melkein aina se on merkki siitä, että joku on yrittänyt poistaa sivun hausta väärällä työkalulla.
Mitä eroa on robots.txt:llä ja noindexillä?
Robots.txt päättää, saako robotti lukea sivun, ja noindex päättää, saako sivu näkyä hakutuloksissa. Ensimmäinen on koko sivuston yhteinen tiedosto, jälkimmäinen on merkintä sivun omassa koodissa tai palvelimen vastauksessa.
| Ominaisuus | robots.txt | noindex |
|---|---|---|
| Mitä se ohjaa | Sivujen läpikäyntiä | Näkymistä hakutuloksissa |
| Missä se on | Yksi tiedosto sivuston juuressa | Jokaisella sivulla erikseen |
| Lukeeko Google sivun | Ei | Kyllä, ja siksi merkintä toimii |
| Mihin se sopii | Kuormituksen ja turhien osoitteiden rajaamiseen | Sivun pitämiseen poissa hausta |
Tärkein ero on tämä: noindex toimii vain, jos Google pääsee lukemaan sivun. Jos sama sivu on kielletty robots.txt-tiedostossa, Google ei koskaan näe noindex-merkintää, ja sivu voi jäädä hakutuloksiin juuri siinä vajaassa muodossa, jota yritit välttää.
Samaan sivuun yhtä aikaa käytettyinä nämä kaksi siis kumoavat toisensa. Valitse tehtävän mukaan toinen.
Näin sivu poistetaan hausta oikeassa järjestyksessä
- Lisää sivulle noindex-merkintä.
- Varmista, ettei robots.txt kiellä sivua.
- Odota, että Google käy sivulla ja pudottaa sen hakutuloksista. Käyntiä voi nopeuttaa pyytämällä indeksointia Search Consolessa.
- Poista sivu kokonaan tai suojaa se salasanalla, jos sitä ei enää tarvita.
Jos sivu pitää saada näkymättömiin heti, esimerkiksi kun hakutuloksiin on päätynyt asiakastietoja sisältävä sivu, Search Consolessa on työkalu, jolla osoitteen voi piilottaa hakutuloksista tilapäisesti. Se ei poista sivua pysyvästi, joten varsinainen korjaus tehdään silti noindex-merkinnällä, salasanalla tai poistamalla sivu.
Robots.txt-kiellon voi lisätä vasta, kun sivu on pudonnut hausta, ja silloinkin vain, jos kiellolle on muu syy, kuten turhan kuormituksen välttäminen.
Miten robots.txt voi piilottaa koko sivuston Googlelta
Yksi rivi riittää: Disallow: / kaikkia robotteja koskevassa ryhmässä kieltää koko sivuston. Rivi on tavallinen kehitysvaiheessa, jolloin keskeneräistä sivustoa ei haluta hakuun, ja se unohtuu julkaisussa useammin kuin uskoisi.
Vaikutus ei näy heti. Olemassa olevat sivut eivät katoa hakutuloksista yhdessä yössä, mutta Google lakkaa lukemasta niitä. Kuvaukset voivat vaihtua ilmoitukseen puuttuvista tiedoista, uudet sivut eivät löydy, ja muutokset hinnoissa ja aukioloajoissa jäävät päivittymättä. Näkyvyys valuu pois viikkojen aikana, ja syytä etsitään kaikkialta muualta.
Siksi robots.txt kuuluu jokaisen julkaisun ja sivustouudistuksen tarkistuslistaan. Muut syyt siihen, ettei sivusto löydy hausta, on käyty läpi artikkelissa Miksi yritykseni ei näy Googlessa.
Kun robots.txt vastaa virheellä
Tiedoston puuttuminen ei ole ongelma. Jos robots.txt-osoite palauttaa virheen 404, Google toimii kuin rajoituksia ei olisi ja käy läpi koko sivuston.
Palvelinvirhe on eri asia. Googlen tarkan tulkintaohjeen mukaan 500-sarjan virhe saa Googlen keskeyttämään sivuston läpikäynnin ja yrittämään tiedoston hakua uudelleen. Jos virhe jatkuu viikkoja ja sivusto on muutenkin tavoittamattomissa, Google lopettaa läpikäynnin kokonaan. Näin voi käydä esimerkiksi silloin, kun palomuuri tai huoltotila estää juuri robots.txt-tiedoston, vaikka sivut itse toimivat.
Muutokset näkyvät viiveellä. Google pitää tiedoston sisällön yleensä muistissa enintään vuorokauden, ja OpenAI kertoo hakunsa mukautuvan robots.txt-muutokseen noin vuorokaudessa. Jos korjasit virheen tänään, älä odota vaikutusta ennen huomista.
Miten tekoälybotit estetään tai sallitaan?
Tekoälybotit estetään tai sallitaan robots.txt-tiedostossa samalla tavalla kuin hakukoneet: botille tehdään oma ryhmä sen nimellä, ja sen alle kirjoitetaan kielto tai lupa. Esimerkiksi OpenAIn koulutusdataa keräävä botti estetään koko sivustolta näin:
User-agent: GPTBot
Disallow: /
Saman yhtiön boteilla on eri tehtävät, ja nimi kertoo, mitä olet estämässä. Yhtiöiden omat ohjeet kertovat syyskuussa 2026 esimerkiksi seuraavaa:
- GPTBot kerää OpenAIn mukaan sisältöä tekoälymallien koulutukseen. Sen estäminen kertoo, ettei sivuston sisältöä saa käyttää koulutukseen.
- OAI-SearchBot on OpenAIn botti, jonka avulla sivustoja nostetaan ChatGPT:n hakutuloksiin.
- ChatGPT-User hakee sivun, kun käyttäjä pyytää sitä keskustelussa. OpenAIn mukaan robots.txt-säännöt eivät välttämättä koske sitä, koska käynti on käyttäjän käynnistämä.
- ClaudeBot kerää Anthropicin mukaan koulutusdataa ja noudattaa robots.txt-tiedostoa. Anthropicilla on lisäksi erilliset botit hakuun ja käyttäjän pyytämiin sivuhakuihin.
- Google-Extended ei ole erillinen robotti vaan tunniste, jolla ohjataan, saako Google käyttää sivuston sisältöä Gemini-mallien koulutukseen ja vastausten pohjana. Googlen mukaan se ei vaikuta sivuston näkymiseen Googlen haussa eikä sijoituksiin.
Koulutus, haku ja käyttäjän pyyntö ovat eri päätöksiä
Moni estää kaikki tekoälybotit kerralla ja huomaa myöhemmin, ettei yritys näy tekoälyhauissa. Botit tekevät eri asioita, ja jokaisesta kannattaa päättää erikseen.
Koulutusbotin estäminen ei estä saman yhtiön hakubottia, koska ne ovat eri botteja ja niillä on omat rivinsä. Hakubotin estäminen taas heikentää mahdollisuutta, että sivustosi mainitaan ja linkitetään, kun joku kysyy tekoälyltä alasi palveluista. Pienelle palveluyritykselle se on yleensä huono kauppa.
Käyttäjän pyynnöstä sivuja hakevia botteja tuskin kannattaa estää, koska niiden takana on ihminen, joka kysyi juuri sinun sivustostasi tai alastasi.
Päätös on liiketoiminnallinen eikä tekninen. Siitä, miten yritys ylipäätään päätyy tekoälyn vastauksiin, kerrotaan artikkelissa Näin yritys näkyy tekoälyn vastauksissa. Robots.txt ei myöskään ole sama asia kuin llms.txt: ensimmäinen kertoo, kuka pääsee sisään, ja jälkimmäinen tarjoaa sisällysluettelon niille, jotka pääsevät.
Kun botille tehdään oma ryhmä
Robots.txt-standardissa robotti noudattaa ryhmää, joka on kirjoitettu sen omalla nimellä, ja jättää silloin yleisen tähtiryhmän huomiotta. Tämä yllättää usein. Jos tähtiryhmässä on kielletty hallintasivut ja teet GPTBotille oman ryhmän, joka kieltää vain yhden kansion, GPTBot saa lukea hallintasivut.
Siksi jokaiseen nimettyyn ryhmään pitää toistaa ne yleiset kiellot, joiden halutaan koskevan myös sitä. Pienellä sivustolla helpointa on pitää nimettyjä ryhmiä mahdollisimman vähän.
Bottien nimet myös muuttuvat ja niitä tulee lisää. Tarkista ajantasaiset nimet yhtiöiden omista ohjeista ennen kuin muutat tiedostoa, äläkä kopioi pitkiä valmiita estolistoja, joiden alkuperää et tunne. Palvelimen lokeista näet, mitkä botit sivustollasi oikeasti käyvät.
IP-osoitteiden estäminen palomuurissa ei ole hyvä korvike. Anthropic huomauttaa, että se voi estää bottia lukemasta robots.txt-tiedostoa, jolloin kielto ei välttämättä toimi niin kuin tarkoitit.
Mitkä virheet robots.txt:ssä ovat yleisimpiä?
Yleisimmät virheet ovat kehitysvaiheesta unohtunut koko sivuston kielto, sivun poistaminen hausta robots.txt-tiedostolla ja liian laajat kiellot, jotka osuvat myös sivuihin, joita ei ollut tarkoitus estää.
- Unohtunut kokonaiskielto. Koko sivusto on kielletty, koska testivaiheen asetus siirtyi julkaisuun.
- Hausta poistaminen kiellolla. Sivu kielletään robots.txt-tiedostossa, jolloin Google ei näe sen noindex-merkintää.
- Tyylitiedostojen ja skriptien estäminen. Google ei näe sivua sellaisena kuin kävijä, ja se voi arvioida esimerkiksi mobiilinäkymän väärin.
- Liian lyhyt polku. Kielto ilman loppukauttaviivaa osuu kaikkiin osoitteisiin, jotka alkavat samoilla kirjaimilla.
- Väärä kirjainkoko. Kielto on kirjoitettu isolla alkukirjaimella, mutta osoitteet ovat pienellä.
- Salaiset polut listattuna. Tiedosto kertoo kaikille, mistä keskeneräiset tai sisäiset sivut löytyvät.
- Tukemattomat rivit. Noindex- tai crawl-delay-rivit, joita Google ei noudata, antavat väärän turvallisuuden tunteen.
- Väärä sijainti. Tiedosto on alikansiossa tai vain toisessa aliverkkotunnuksessa, joten sitä ei lueta siellä, missä sen pitäisi vaikuttaa.
Näin tarkistat oman robots.txt-tiedostosi
Avaa selaimessa sivustosi osoite, jonka perään on lisätty /robots.txt. Jos tiedostoa ei ole, se on pienelle sivustolle täysin hyväksyttävä tilanne. Jos tiedosto on, lue jokainen Disallow-rivi ja kysy itseltäsi, tiedätkö, miksi se on siellä.
Search Consolessa on raportti, joka näyttää, minkä robots.txt-tiedoston Google on viimeksi hakenut, milloin se tapahtui ja löytyikö tiedostosta virheitä. Yksittäisen sivun tarkistustyökalu kertoo lisäksi suoraan, estääkö robots.txt kyseisen osoitteen.
Tarkista tiedosto aina sivustouudistuksen jälkeen, julkaisujärjestelmän vaihdon jälkeen ja silloin, kun sivustolle asennetaan uusi lisäosa, joka lupaa parantaa hakukonenäkyvyyttä. Osa sellaisista muokkaa robots.txt-tiedostoa kysymättä.
Mitä pienen yrityksen robots.txt-tiedostoon kannattaa kirjoittaa
Useimmille yrityssivustoille riittää lyhyt tiedosto: muu sallittu, hallinta- ja hakutulossivut kielletty ja sivukartan osoite. Pidempi tiedosto on harvoin tarpeen, ja jokainen lisärivi on uusi mahdollisuus virheeseen.
Verkkokaupassa rajattavaa on enemmän, koska suodattimet ja lajittelut tuottavat loputtomasti osoitteita samoista tuotteista. Siellä robots.txt on oikea työkalu, koska tarkoitus on säästää hakukoneen työtä eikä piilottaa mitään.
Tiedostoon ei tarvita rivejä, jotka erikseen sallivat sen, mikä on jo sallittu. Jos tiedostossa ei kielletä mitään, se ei estä mitään, ja se on täysin kelvollinen robots.txt.
Yhteenveto
Robots.txt kertoo roboteille, mitä sivustolla saa käydä läpi. Se on pyyntö eikä lukko, eikä se poista sivuja Googlen hakutuloksista. Hakutuloksista sivu pidetään poissa noindex-merkinnällä, joka toimii vain, jos Google pääsee lukemaan sivun.
Tekoälybotteja hallitaan samassa tiedostossa niiden omilla nimillä. Koulutusdataa keräävät botit, hakubotit ja käyttäjän pyynnöstä sivuja hakevat botit tekevät eri asioita, joten niistä kannattaa päättää erikseen ja tarkistaa nimet yhtiöiden omista ohjeista.
Tarkista tiedosto jokaisen julkaisun ja uudistuksen jälkeen. Yksi unohtunut rivi voi pudottaa koko sivuston hausta, ja se huomataan yleensä vasta, kun puhelin on ollut hiljaa viikkoja.
