Straipsnio turinys
Du visiškai skirtingi robotų tipai
Svarbiausias dalykas, kurį reikia suprasti prieš liečiant robots.txt: „AI robotas“ nėra viena kategorija. 2026 metais didieji tiekėjai naudoja atskirus user-agent’us skirtingoms funkcijoms, ir jų blokavimo pasekmės yra priešingos.
Kas ką daro
| Robotas | Paskirtis ir blokavimo pasekmė |
|---|---|
| GPTBot | OpenAI mokymo robotas. Blokavus — jūsų turinys nenaudojamas modelių treniravimui. Matomumo AI atsakymuose neprarandate. |
| OAI-SearchBot | OpenAI paieškos robotas. Blokavus — dingstate iš ChatGPT paieškos rezultatų ir citatų. |
| ChatGPT-User | Lankosi tada, kai vartotojas paprašo atidaryti konkrečią nuorodą. Blokavus — vartotojas negaus jūsų puslapio turinio. |
| Google-Extended | Ne robotas, o robots.txt valdymo žyma dėl Gemini ir Vertex AI mokymo bei grindimo. AI Overviews neveikia. |
| Googlebot | Įprastas Google robotas. Nuo jo priklauso ir įprasta paieška, ir AI Overviews. Blokuoti neverta beveik niekada. |
| PerplexityBot | Perplexity paieškos robotas. Blokavus — dingstate iš Perplexity atsakymų. |
| ClaudeBot | Anthropic mokymo robotas. |
| CCBot | Common Crawl. Duomenys naudojami daugelio modelių mokymui. |
Ši atskirtis yra praktiškai svarbiausia visoje temoje. Dauguma „užblokuok visus AI robotus“ patarimų internete yra parašyti dar tada, kai atskirų paieškinių robotų nebuvo, ir šiandien jie nurauna svetainę nuo AI atsakymų be jokios naudos.
Realus robots.txt pavyzdys
Toliau — konfigūracija, kurią naudoju dažniausiai: mokymui neleidžiu, paieškai ir citavimui leidžiu.
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://jusu-svetaine.lt/sitemap.xml
robots.txt taisyklės nėra paveldimos: robotas vykdo tik tą bloką, kuris tiksliai atitinka jo vardą. Todėl bendras `User-agent: *` blokas GPTBot’ui negalioja, jei GPTBot turi savo bloką. Ir atvirkščiai — jei norite ką nors uždrausti visiems, tai turi būti pakartota kiekviename bloke atskirai.
Peržiūriu, kurie robotai blokuojami, kurie leidžiami, ir ar dėl seno nustatymo neprarandate matomumo AI atsakymuose.
Kodėl „blokuok viską“ dažniausiai yra klaida
Sprendimas blokuoti visus AI robotus dažniausiai priimamas emocingai: turinys mano, aš už jį mokėjau, tegul nenaudoja. Logika suprantama, bet ji sumaišo du visai skirtingus dalykus. Modelio mokymas iš tiesų yra jūsų turinio panaudojimas be atlygio. O citavimas AI atsakyme yra priešingas dalykas — tai nemokamas jūsų svetainės parodymas žmogui, kuris kaip tik ieško to, ką jūs parduodate.
Praktiškai tai atrodo taip: kai kas nors ChatGPT paklausia „kas Klaipėdoje kuria WordPress svetaines“, atsakymas formuojamas iš puslapių, kuriuos paieškinis robotas gali pasiekti. Jei tas robotas užblokuotas, jūsų tiesiog nėra tame sąraše — bet jūsų konkurentas ten yra. Blokavimas nesustabdo AI atsakymo, jis tik pašalina iš jo jus.
Todėl prieš rašant `Disallow` verta atsakyti į vieną klausimą: ar jūsų turinys yra produktas, ar rinkodaros priemonė? Nuo šio atsakymo priklauso viskas.
Kaip pasirinkti savo poziciją
Trys strategijos
| Kam tinka | Kaina | |
|---|---|---|
| Leisti viską | Turinys — rinkodaros priemonė, srautas ir matomumas svarbiau už turinio nuosavybę | Turinys naudojamas modelių mokymui be atlygio |
| Vidurio kelias | Daugumai verslo svetainių ir paslaugų teikėjų | Reikia prižiūrėti sąrašą, atsiranda naujų robotų |
| Blokuoti viską | Mokamas turinys, unikalūs duomenys, leidyba, kur turinys ir yra produktas | Dingstate iš AI atsakymų, o srauto iš jų nebus visai |
Daugumai Lietuvos verslų — paslaugų įmonėms, e. parduotuvėms, specialistams — tinka vidurio kelias. Turinys jums yra būdas būti randamam, o ne pardavimo objektas. Tokiu atveju nėra prasmės uždaryti duris tiems robotams, kurie atveda žmones.
Ko robots.txt nepadaro
Ribos, kurias verta žinoti
- – robots.txt nėra apsauga — nesąžiningi robotai jį ignoruoja
- – Uždraudimas neišima jau surinkto turinio iš modelių, kurie jau apmokyti
- – Google-Extended blokavimas neišima jūsų iš AI Overviews
- – Robotai gali pasiimti turinį per trečiąsias šalis, kurios jūsų svetainę cituoja
- robots.txt yra teisingas ir standartinis būdas pareikšti savo valią tvarkingiems robotams
- Serverio logai parodys, kurie robotai realiai lankosi jūsų svetainėje
Jei norite išeiti būtent iš Google generatyvinių funkcijų, nuo 2026 m. birželio Search Console atsirado atskiras jungiklis. Google teigia, kad jis nenaudojamas kaip reitingavimo signalas įprastuose paieškos rezultatuose, tačiau parodymų ir srauto iš AI funkcijų tuomet negausite. Alternatyva — `nosnippet` arba `max-snippet:0`, bet jie kartu panaikina ir įprastą aprašymą organiniuose rezultatuose.
Dažni klausimai
Ar užblokavus GPTBot prarasiu srautą iš ChatGPT?
Ne. Už ChatGPT paiešką ir citatas atsakingi OAI-SearchBot bei ChatGPT-User, ne GPTBot.
Ar Google-Extended blokavimas pablogins mano pozicijas?
Google teigia, kad ne. Tai atskiras mokymo ir grindimo valdiklis, nesusijęs su reitingavimu.
Kaip patikrinti, kurie robotai mane lanko?
Serverio prieigos logai. Ieškokite user-agent eilučių: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot ir panašių.
Ar reikia atskirai leisti robotus, ar pakanka nieko neblokuoti?
Pakanka neblokuoti — pagal standartą leidimas yra numatytoji būsena. `Allow` eilutės čia pridėtos aiškumui.
Ar AI robotai apkrauna serverį?
Kai kuriose svetainėse jų srautas pastebimas. Jei tai problema, sprendimas yra crawl greičio ribojimas serverio lygiu, ne visiškas blokavimas.
Ar galiu blokuoti tik dalį svetainės?
Taip, `Disallow` gali nurodyti konkretų katalogą. Pavyzdžiui, uždaryti mokamą turinį, palikti tinklaraštį.
Ar naudinga blokuoti Common Crawl?
Priklauso. CCBot duomenys naudojami daugelio modelių mokymui, bet ir kai kurių tyrimų bei archyvų.
Kaip dažnai peržiūrėti robots.txt?
Bent kartą per pusmetį — nauji robotų vardai atsiranda reguliariai.