Tinklaraštis
SEO ◷ 5 min. skaitymo

AI robotai: blokuoti ar leisti?

Mokymo ir paieškos robotai skiriasi. Realus robots.txt pavyzdys, saugus vidurio kelias ir kodėl „blokuok viską" dažniausiai kenkia.

Du visiškai skirtingi robotų tipai

Norite aukštesnių pozicijų Google?Gaukite nemokamą pasiūlymą per 24 val. — be įsipareigojimų.
SEO optimizavimas

Svarbiausias dalykas, kurį reikia suprasti prieš liečiant robots.txt: „AI robotas“ nėra viena kategorija. 2026 metais didieji tiekėjai naudoja atskirus user-agent’us skirtingoms funkcijoms, ir jų blokavimo pasekmės yra priešingos.

Kas ką daro

RobotasPaskirtis ir blokavimo pasekmė
GPTBotOpenAI mokymo robotas. Blokavus — jūsų turinys nenaudojamas modelių treniravimui. Matomumo AI atsakymuose neprarandate.
OAI-SearchBotOpenAI paieškos robotas. Blokavus — dingstate iš ChatGPT paieškos rezultatų ir citatų.
ChatGPT-UserLankosi tada, kai vartotojas paprašo atidaryti konkrečią nuorodą. Blokavus — vartotojas negaus jūsų puslapio turinio.
Google-ExtendedNe robotas, o robots.txt valdymo žyma dėl Gemini ir Vertex AI mokymo bei grindimo. AI Overviews neveikia.
GooglebotĮprastas Google robotas. Nuo jo priklauso ir įprasta paieška, ir AI Overviews. Blokuoti neverta beveik niekada.
PerplexityBotPerplexity paieškos robotas. Blokavus — dingstate iš Perplexity atsakymų.
ClaudeBotAnthropic mokymo robotas.
CCBotCommon Crawl. Duomenys naudojami daugelio modelių mokymui.

Ši atskirtis yra praktiškai svarbiausia visoje temoje. Dauguma „užblokuok visus AI robotus“ patarimų internete yra parašyti dar tada, kai atskirų paieškinių robotų nebuvo, ir šiandien jie nurauna svetainę nuo AI atsakymų be jokios naudos.

Realus robots.txt pavyzdys

Toliau — konfigūracija, kurią naudoju dažniausiai: mokymui neleidžiu, paieškai ir citavimui leidžiu.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://jusu-svetaine.lt/sitemap.xml

Svarbi techninė detalė

robots.txt taisyklės nėra paveldimos: robotas vykdo tik tą bloką, kuris tiksliai atitinka jo vardą. Todėl bendras `User-agent: *` blokas GPTBot’ui negalioja, jei GPTBot turi savo bloką. Ir atvirkščiai — jei norite ką nors uždrausti visiems, tai turi būti pakartota kiekviename bloke atskirai.

Nesate tikri, ką jūsų svetainės robots.txt daro šiandien?

Peržiūriu, kurie robotai blokuojami, kurie leidžiami, ir ar dėl seno nustatymo neprarandate matomumo AI atsakymuose.

Kreiptis dėl audito

Kodėl „blokuok viską“ dažniausiai yra klaida

Sprendimas blokuoti visus AI robotus dažniausiai priimamas emocingai: turinys mano, aš už jį mokėjau, tegul nenaudoja. Logika suprantama, bet ji sumaišo du visai skirtingus dalykus. Modelio mokymas iš tiesų yra jūsų turinio panaudojimas be atlygio. O citavimas AI atsakyme yra priešingas dalykas — tai nemokamas jūsų svetainės parodymas žmogui, kuris kaip tik ieško to, ką jūs parduodate.

Praktiškai tai atrodo taip: kai kas nors ChatGPT paklausia „kas Klaipėdoje kuria WordPress svetaines“, atsakymas formuojamas iš puslapių, kuriuos paieškinis robotas gali pasiekti. Jei tas robotas užblokuotas, jūsų tiesiog nėra tame sąraše — bet jūsų konkurentas ten yra. Blokavimas nesustabdo AI atsakymo, jis tik pašalina iš jo jus.

Todėl prieš rašant `Disallow` verta atsakyti į vieną klausimą: ar jūsų turinys yra produktas, ar rinkodaros priemonė? Nuo šio atsakymo priklauso viskas.

Kaip pasirinkti savo poziciją

Trys strategijos

Kam tinkaKaina
Leisti viskąTurinys — rinkodaros priemonė, srautas ir matomumas svarbiau už turinio nuosavybęTurinys naudojamas modelių mokymui be atlygio
Vidurio keliasDaugumai verslo svetainių ir paslaugų teikėjųReikia prižiūrėti sąrašą, atsiranda naujų robotų
Blokuoti viskąMokamas turinys, unikalūs duomenys, leidyba, kur turinys ir yra produktasDingstate iš AI atsakymų, o srauto iš jų nebus visai

Daugumai Lietuvos verslų — paslaugų įmonėms, e. parduotuvėms, specialistams — tinka vidurio kelias. Turinys jums yra būdas būti randamam, o ne pardavimo objektas. Tokiu atveju nėra prasmės uždaryti duris tiems robotams, kurie atveda žmones.

Ko robots.txt nepadaro

Ribos, kurias verta žinoti

  • – robots.txt nėra apsauga — nesąžiningi robotai jį ignoruoja
  • – Uždraudimas neišima jau surinkto turinio iš modelių, kurie jau apmokyti
  • – Google-Extended blokavimas neišima jūsų iš AI Overviews
  • – Robotai gali pasiimti turinį per trečiąsias šalis, kurios jūsų svetainę cituoja
  • robots.txt yra teisingas ir standartinis būdas pareikšti savo valią tvarkingiems robotams
  • Serverio logai parodys, kurie robotai realiai lankosi jūsų svetainėje

Jei norite išeiti būtent iš Google generatyvinių funkcijų, nuo 2026 m. birželio Search Console atsirado atskiras jungiklis. Google teigia, kad jis nenaudojamas kaip reitingavimo signalas įprastuose paieškos rezultatuose, tačiau parodymų ir srauto iš AI funkcijų tuomet negausite. Alternatyva — `nosnippet` arba `max-snippet:0`, bet jie kartu panaikina ir įprastą aprašymą organiniuose rezultatuose.

Dažni klausimai

Ar užblokavus GPTBot prarasiu srautą iš ChatGPT?

Ne. Už ChatGPT paiešką ir citatas atsakingi OAI-SearchBot bei ChatGPT-User, ne GPTBot.

Ar Google-Extended blokavimas pablogins mano pozicijas?

Google teigia, kad ne. Tai atskiras mokymo ir grindimo valdiklis, nesusijęs su reitingavimu.

Kaip patikrinti, kurie robotai mane lanko?

Serverio prieigos logai. Ieškokite user-agent eilučių: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot ir panašių.

Ar reikia atskirai leisti robotus, ar pakanka nieko neblokuoti?

Pakanka neblokuoti — pagal standartą leidimas yra numatytoji būsena. `Allow` eilutės čia pridėtos aiškumui.

Ar AI robotai apkrauna serverį?

Kai kuriose svetainėse jų srautas pastebimas. Jei tai problema, sprendimas yra crawl greičio ribojimas serverio lygiu, ne visiškas blokavimas.

Ar galiu blokuoti tik dalį svetainės?

Taip, `Disallow` gali nurodyti konkretų katalogą. Pavyzdžiui, uždaryti mokamą turinį, palikti tinklaraštį.

Ar naudinga blokuoti Common Crawl?

Priklauso. CCBot duomenys naudojami daugelio modelių mokymui, bet ir kai kurių tyrimų bei archyvų.

Kaip dažnai peržiūrėti robots.txt?

Bent kartą per pusmetį — nauji robotų vardai atsiranda reguliariai.

Portfolio

SEO projektai

Realūs projektai — žiūrėkite ką kuriame.

// Svetainė · El. parduotuvė · Sistemos · Marketingas

Pasiekite klientus internetu ir auginkite verslą

Skambinti